高通提出的高带宽计算技术(HBC)针对AI推理中的“内存墙”问题,将计算单元移至内存附近,减少数据搬运带来的延迟与功耗。文章以米其林餐厅“潮1/2”就餐模式作比,形象说明这一近内存计算架构的思路:与其让数据长途跋涉到处理器,不如把“餐桌”搬到“厨房”旁边。当前AI推理分为Prefill和Decode两个阶段,后者每生成一个token都需反复读取模型参数和上下文,计算量有限却受制于内存带宽,成为效率瓶颈。HBC并非取代CPU、GPU、NPU,而是形成异构分工,让不同任务各归其位。这一思路对AI智能体手机尤为重要,因为此类设备需同时处理语音识别、意图理解、应用调用、多模型协作等复杂任务,芯片架构必须围绕Agent重新组织,而非单纯追求算力峰值。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅