作者takeshi911 (L.Lawlite)
看板MobileComm
标题[新闻] Snapdragon 8 Elite Gen 6的Hexagon NPU
时间Fri Sep 11 17:53:54 2026
1.原文连结:
https://reurl.cc/vGK9V1
2.原文标题:
Snapdragon 8 Elite Gen 6的Hexagon NPU为代理AI与专家混合
模型而生,新增Element加速器与更大共享快取
3.原文来源(媒体/作者):Cool3c/Chevelle.fu
4.原文内容:
高通继为即将在9月下旬於Snapdragon高峰会公布的Snapdragon 8 Elite Gen 6抢先预览
CPU、GPU的特色後,再针对新一代Hexagon NPU进行预览解密;Snapdragon 8 Elite Gen
6的Hexagon NPU将是为代理式AI与专家混合模型而生,加入Element加速器、进一步增加
共享快取与支援广泛的精度,提供自预填充、推论到输出更迅捷、低延迟的代理AI体验。
AI运算需求从单一推论转化为持续、多模、低延迟
高通提到,随着代理式AI成为继生成式AI後的新趋势,AI的运算需求也从原本聚焦在执行
单一模型、追求推论速度转化为需要具备持续、多模态及低延迟,也成为高通在规划新一
代Hexagon NPU的重点;具体而言,高通全新Hexagon NPU聚焦在两个重点:Element加速
器与增加50%容量的共享快取。
为代理式AI执行设计的Element加速器
Element是因应新一代生成式与代理式AI所设计的加速器,结合纯量、向量与矩阵扩展,
可加速大型模型最重要的运算,使代理式AI可更快的反应、更有效率的推论,进而在不影
响续航力的前提提供丰富的代理体验。
更大的共享快取减少频繁的资料传输
新一代Hexagon NPU也将共享快取容量提升50%,藉由更大的记忆体系统容纳更多模型状态
、启动质与中间张量,减少资料需要频繁传输到外部的DDR记忆体的情况,可以减少记忆
体瓶颈,加速AI执行速度与响应,也能降低资料频繁传输的能耗。
因应代理式AI负载需求的设计
代理式AI的效能关键在於维持代理式AI执行多个任务时仍可维持响应迅速、上下文相关与
高效率运作,新一代Hexagon NPU借助添加上述两项特色,使得在进行AI、长上下文推论
、多模态模型具有更出色的持续性能,并带来低延迟。
更大的快取能使NPU把资料尽可能保持在近端,可协助代理式AI更快完成响应、修正、规
划与行动,带来更丰富的上下文视窗、更快的Token输出与多工具、多任务的代理式AI转
换。Element加速器则提升生成式与代理式AI最关键的转换器操作效能,透过项量扩展加
速高吞吐量AI数学运算与纯量扩展,支援代理最关键的决策逻辑、路由与编排。
藉更低记忆体频宽执行更大的模型
新一代Hexagon NPU也放眼下一代模型架构,高通携手领先的记忆体与模型供应商合作,
将基於MoE专家混合模型的新一代装置端AI架构整合至Hexagon NPU,载入一个30B参数的
MoE模型时,在NPU输出Token阶段仅需动用3B的参数。
MoE模型与密集模型不同,MoE会透过动态方式从混合模型中选择任务对应的专家模型,进
而使运算资源与记忆体频宽需求降低;在整合智慧的快闪记忆体及记忆体专家管理与快取
技术,专家混合模型能够以低功耗、低记忆体需求时现更广泛全面的AI体验,并提供手机
快速回应、安全的产生高品质的AI代理。
支援广泛精度及提升预填充
为了应对专家混合模型需求及降低对记忆体频宽需求,新一代Hexagon NPU具体的作法是
支援更广泛的精度,提供自INT2、INT4、INT8、FP8至FP16的支援,开发者可灵活的在效
能、记忆体、模型品质与功耗之间选择合宜的格式与模型规模。
此外对於影响响应最关键的预填充,新一代Hexagon NPU在INT4模型提高50%的预填充性能
,并具备更快的解码吞吐、更强的预测性解码能力及更高的每秒Token,最终提供即时、
流畅的装置端AI体验。
与CPU及GPU异构运算同样重要
虽然Hexagon NPU的目的是高效率的尽可能执行所有阶段的AI任务,不过现行的AI负载仍
须仰赖异构运算,其中任务於核心之间移动的智慧路由、编排与资料可用性需要透过CPU
,而GPU也同样在现代图形运算纳入特定的AI运算需求。
Snapdragon 8 Elite Gen 6引入超越5GHz时脉的下一代Oryon CPU及Oryon Flex Cache快
取架构,协助在AI任务编排的CPU负载更高效的完成;而全新Adreno GPU亦纳入神经网路
加速架构,於图像处理阶段自管线进行AI增强处理,带来更出色的视觉体验。
5.心得/评论:
新一代Hexagon NPU凭藉快取与加速器升级,完美解答代理式AI的低延迟与高算力需求。
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 123.194.188.44 (台湾)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/MobileComm/M.1789120437.A.C47.html
1F:→ NoneWolf : 能跑30B MoE 但机器只配16G记忆体 何意味? 09/11 18:13
2F:→ BadGame : 苹果杀出跑分後 高通急 频率还在定 这版不稳发热高 09/11 18:50
3F:推 sxing6326 : 之前才知道高通的Hexagon只能定址4GB记忆体,不知 09/11 19:54
4F:→ sxing6326 : 道这代改进了没 09/11 19:54
5F:→ Hohenzollern: 高通S8 Elite Gen6晶片多核CPU应该赢过苹果A20 Pro 09/11 22:05
6F:→ Hohenzollern: 晶片 09/11 22:05
7F:→ Hohenzollern: 三大晶片厂牌 高通最後发表产品压力最大 09/11 22:10
8F:→ Hohenzollern: 苹果CPU单核和联发科GPU比不上 高通只能极限压榨多 09/11 22:11
9F:→ Hohenzollern: 核CPU跑分 09/11 22:11
10F:推 aegis43210 : 高通的NPU和google一样专注在AI推论,ARM则是用在游 09/11 22:16
11F:→ aegis43210 : 戏补帧上 09/11 22:16
12F:→ aegis43210 : 并不是高通GPU弱,而是ARM在绘图上偷吃步 09/11 22:17
13F:→ KudanAkito : 很好 8E5该降价了吧 09/11 23:42
14F:→ WOGEchidna : 放冰箱还能跑出45度的骚操作你就学吧 09/12 02:06
15F:推 banbanzon : 狗通GPU弱?那一堆安卓高端掌机怎麽都用狗通SOC? 09/12 03:04
16F:→ shengshampoo: 不懂就问,板上乡民版友怎麽用AI?聊天机器问问? 09/12 11:29
17F:→ shengshampoo: 会应用到AI agent 融入整合工作流? 09/12 11:30
18F:→ shengshampoo: 边缘运算场景,乡民版友的等级会怎麽做? 09/12 11:31
19F:→ setsuha : 机器就算配到32G 1楼也买不起阿 09/12 16:40
20F:推 pipi5867 : 这代看目前流出的消息 感觉满烂的 09/12 17:07
22F:→ empingao : 8ee6 明显没跑满. 09/12 17:43