亚洲欧美日韩一区-色婷婷综合网-日本特黄视频-亚洲一区二区免费视频-国产午夜精品一区二区三区四区-国产精品视频99-四虎永久网站-男人天堂新地址-国产视频色-啪啪一区-久久综合色网-亚洲精品视频播放-美女人人操-亚洲激情免费-免费日本在线

星空人工智能技術網

昇騰支持Qwen3.8-2.4T-A95B,釋放超大規模MoE模型推理潛能

 2026年8月12日,Qwen正式開放Qwen3.8-2.4T-A95B模型權重。作為Qwen新一代旗艦模型,Qwen3.8-2.4T-A95B擁有2.4T總參數量、95B激活參數,并采用超大規模MoE與混合線性注意力架構,對專家并行、跨卡通信、線性注意力計算及顯存效率提出了更高要求。

Qwen3.8-2.4T-A95B開源后,昇騰Atlas 800 A3超節點通過vLLM-Ascend/SGLang開源推理引擎快速實現了推理支持。圍繞該模型的結構特點,昇騰采用大規模專家并行、MoE通算融合、GDN線性注意力、量化及Decode加速等關鍵路徑進行針對性優化,充分釋放Qwen3.8-2.4T-A95B在昇騰上的推理性能。

Qwen3.8-2.4T-A95B——新一代超大規模MoE旗艦模型

Qwen3.8-2.4T-A95B采用稀疏MoE架構,每個Token僅激活部分專家,在擴展模型容量的同時控制單Token計算開銷。

在Attention層,Qwen3.8采用Gated DeltaNet(GDN)與標準Attention相結合的混合線性注意力架構,兼顧長序列處理效率與上下文建模能力。

MoE與混合線性注意力的結合,也對推理系統提出新的挑戰:大規模Expert的跨NPU部署帶來更高的通信開銷,GDN則引入區別于傳統Attention的計算與狀態管理模式,需要針對模型架構進行專項優化。

基于昇騰實現Qwen3.8-2.4T-A95B的推理部署

昇騰持續深耕大模型推理關鍵技術,從EP64大規模專家并行、Fused MC2通算融合,到GDN線性注意力與Hybrid Cache優化,再到W8A8量化、MTP與ACL Graph Decoe加速,昇騰不斷完善面向前沿模型架構的高性能推理能力,通過vLLM-Ascend/SGLang開源推理引擎實現Qwen3.8-2.4T-A95B在昇騰AI基礎軟硬件上的高效部署。

大規模專家并行:EP64支撐MoE高效部署

針對Qwen3.8 2.4T參數規模的MoE架構,vLLM-Ascend/SGLang支持EP64大規模專家并行,將不同Expert分布至多NPU協同執行,降低單卡模型權重與計算壓力,充分發揮MoE稀疏計算優勢。

MoE通算融合:Fused MC2提升大規模EP效率

隨著Expert Parallel規模擴大,Token在不同NPU之間的Dispatch與Combine通信成為影響MoE推理效率的關鍵因素。

vLLM-Ascend使能Fused MC2通算融合能力,圍繞Token Dispatch、Expert Compute與Combine等關鍵階段進行通信與計算協同,減少通信等待和Host側調度開銷,提升大規模專家并行場景下的執行效率。

混合線性注意力優化:GDN融合算子與Hybrid Cache管理

Qwen3.8-2.4T-A95B采用Gated DeltaNet(GDN)與標準Attention相結合的混合線性注意力架構,GDN通過固定規模狀態承載歷史信息,有效降低長序列場景下的計算與存儲開銷,同時也引入新的線性注意力計算路徑。

針對GDN的計算特點,vLLM-Ascend/SGLang在Prefill階段采用GDN融合算子,以Chunk方式高效處理長序列,并融合關鍵計算過程,減少中間數據搬運和算子調度開銷。

同時,針對GDN與標準Attention混合存在的模型結構,vLLM-Ascend/SGLang采用Hybrid KV Cache / Mamba State管理機制,統一管理Attention層KV Cache與GDN層狀態緩存,提升顯存利用效率。

W8A8量化:降低超大參數模型部署的資源開銷

面對2.4T參數規模帶來的顯存壓力,vLLM-Ascend/SGLang支持Qwen3.8的W8A8量化部署,適配模型及MoE Expert等關鍵模塊的量化權重加載與執行,在兼顧模型精度的同時,降低顯存占用和部署資源需求。

Decode加速:MTP與ACL Graph協同優化

Qwen3.8-2.4T-A95B具備Multi-Token Prediction(MTP)能力。vLLM-Ascend/SGLang支持MTP投機推理,通過預測后續Token并由主模型進行校驗,提升單次模型執行產生的有效Token數量,加速Decode過程。

同時,Decode階段支持ACL Graph,通過將高頻執行的計算路徑捕獲為設備側執行圖,降低Host調度與Kernel下發開銷,并與MTP協同優化,進一步提升Token生成效率。

星空人工智能技術網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯系方式等發郵件至1851688011@qq.com我們將及時溝通與處理。!:首頁 > 星空人工智能產業 > AI大模型 » 昇騰支持Qwen3.8-2.4T-A95B,釋放超大規模MoE模型推理潛能

感覺不錯,很贊哦! ()
分享到:

相關推薦

留言與評論(共有 0 條評論)
   
驗證碼: