作者 takeshi911 (L.Lawlite)
標題 [新聞] Snapdragon 8 Elite Gen 6的Hexagon NPU
時間 Fri Sep 11 17:53:54 2026


1.原文連結:https://reurl.cc/vGK9V1


2.原文標題: Snapdragon 8 Elite Gen 6的Hexagon NPU為代理AI與專家混合

模型而生,新增Element加速器與更大共享快取


3.原文來源(媒體/作者):Cool3c/Chevelle.fu



4.原文內容:

高通繼為即將在9月下旬於Snapdragon高峰會公布的Snapdragon 8 Elite Gen 6搶先預覽

CPU、GPU的特色後,再針對新一代Hexagon NPU進行預覽解密;Snapdragon 8 Elite Gen

6的Hexagon NPU將是為代理式AI與專家混合模型而生,加入Element加速器、進一步增加

共享快取與支援廣泛的精度,提供自預填充、推論到輸出更迅捷、低延遲的代理AI體驗。

AI運算需求從單一推論轉化為持續、多模、低延遲


高通提到,隨著代理式AI成為繼生成式AI後的新趨勢,AI的運算需求也從原本聚焦在執行

單一模型、追求推論速度轉化為需要具備持續、多模態及低延遲,也成為高通在規劃新一

代Hexagon NPU的重點;具體而言,高通全新Hexagon NPU聚焦在兩個重點:Element加速

器與增加50%容量的共享快取。


為代理式AI執行設計的Element加速器

Element是因應新一代生成式與代理式AI所設計的加速器,結合純量、向量與矩陣擴展,

可加速大型模型最重要的運算,使代理式AI可更快的反應、更有效率的推論,進而在不影

響續航力的前提提供豐富的代理體驗。


更大的共享快取減少頻繁的資料傳輸

新一代Hexagon NPU也將共享快取容量提升50%,藉由更大的記憶體系統容納更多模型狀態

、啟動質與中間張量,減少資料需要頻繁傳輸到外部的DDR記憶體的情況,可以減少記憶

體瓶頸,加速AI執行速度與響應,也能降低資料頻繁傳輸的能耗。


因應代理式AI負載需求的設計

代理式AI的效能關鍵在於維持代理式AI執行多個任務時仍可維持響應迅速、上下文相關與

高效率運作,新一代Hexagon NPU借助添加上述兩項特色,使得在進行AI、長上下文推論

、多模態模型具有更出色的持續性能,並帶來低延遲。


更大的快取能使NPU把資料盡可能保持在近端,可協助代理式AI更快完成響應、修正、規

劃與行動,帶來更豐富的上下文視窗、更快的Token輸出與多工具、多任務的代理式AI轉

換。Element加速器則提升生成式與代理式AI最關鍵的轉換器操作效能,透過項量擴展加

速高吞吐量AI數學運算與純量擴展,支援代理最關鍵的決策邏輯、路由與編排。


藉更低記憶體頻寬執行更大的模型

新一代Hexagon NPU也放眼下一代模型架構,高通攜手領先的記憶體與模型供應商合作,

將基於MoE專家混合模型的新一代裝置端AI架構整合至Hexagon NPU,載入一個30B參數的

MoE模型時,在NPU輸出Token階段僅需動用3B的參數。


MoE模型與密集模型不同,MoE會透過動態方式從混合模型中選擇任務對應的專家模型,進

而使運算資源與記憶體頻寬需求降低;在整合智慧的快閃記憶體及記憶體專家管理與快取

技術,專家混合模型能夠以低功耗、低記憶體需求時現更廣泛全面的AI體驗,並提供手機

快速回應、安全的產生高品質的AI代理。


支援廣泛精度及提升預填充

為了應對專家混合模型需求及降低對記憶體頻寬需求,新一代Hexagon NPU具體的作法是

支援更廣泛的精度,提供自INT2、INT4、INT8、FP8至FP16的支援,開發者可靈活的在效

能、記憶體、模型品質與功耗之間選擇合宜的格式與模型規模。


此外對於影響響應最關鍵的預填充,新一代Hexagon NPU在INT4模型提高50%的預填充性能

,並具備更快的解碼吞吐、更強的預測性解碼能力及更高的每秒Token,最終提供即時、

流暢的裝置端AI體驗。


與CPU及GPU異構運算同樣重要

雖然Hexagon NPU的目的是高效率的盡可能執行所有階段的AI任務,不過現行的AI負載仍

須仰賴異構運算,其中任務於核心之間移動的智慧路由、編排與資料可用性需要透過CPU

,而GPU也同樣在現代圖形運算納入特定的AI運算需求。


Snapdragon 8 Elite Gen 6引入超越5GHz時脈的下一代Oryon CPU及Oryon Flex Cache快

取架構,協助在AI任務編排的CPU負載更高效的完成;而全新Adreno GPU亦納入神經網路

加速架構,於圖像處理階段自管線進行AI增強處理,帶來更出色的視覺體驗。



5.心得/評論:

新一代Hexagon NPU憑藉快取與加速器升級,完美解答代理式AI的低延遲與高算力需求。

--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 123.194.188.44 (臺灣)
※ 作者: takeshi911 2026-09-11 17:53:54
※ 文章代碼(AID): #1gey-rn7 (MobileComm)
※ 文章網址: https://www.ptt.cc/bbs/MobileComm/M.1789120437.A.C47.html
NoneWolf: 能跑30B MoE 但機器只配16G記憶體 何意味?1F 09/11 18:13
BadGame:  蘋果殺出跑分後 高通急 頻率還在定 這版不穩發熱高2F 09/11 18:50
sxing6326: 之前才知道高通的Hexagon只能定址4GB記憶體,不知道這代改進了沒3F 09/11 19:54
Hohenzollern: 高通S8 Elite Gen6晶片多核CPU應該贏過蘋果A20 Pro晶片
三大晶片廠牌 高通最後發表產品壓力最大
蘋果CPU單核和聯發科GPU比不上 高通只能極限壓榨多核CPU跑分5F 09/11 22:05
aegis43210: 高通的NPU和google一樣專注在AI推論,ARM則是用在遊戲補幀上
並不是高通GPU弱,而是ARM在繪圖上偷吃步10F 09/11 22:16
KudanAkito: 很好 8E5該降價了吧13F 09/11 23:42

--
作者 takeshi911 的最新發文:
點此顯示更多發文記錄