内页banner>

联系方式

当前位置: 首页 > 资讯动态

资讯动态Projects

联系我们Contact Us

球友会官网 - 足球篮球赛事资讯平台

电话:13594780383

联系人:周经理

邮箱:laborious@icloud.com

网址:qyh-sitecn.com

地址:铜仁市旁踏港33号

我和我的 AI 手机吃了 3 顿饭

2026-09-16
2741次

米其林三星餐厅潮上潮有一个特别的就餐模式「潮 1/2」:在餐厅后厨旁边放一张小餐桌,供少数人就餐,饭菜在主厨做好的瞬间即可上桌,最大程度地减少传菜过程中的风味和热量损耗,呈现出最好的味道。 对于讲究「一热顶三鲜」的中国人来说,这个就餐模式自有亲切感。 理解了这个,就可以理解高通推出的高带宽计算技术(High bandwidth compute,HBC)了。 把计算放到内存旁边,就像把饭桌放到厨房旁边去 当 ChatGPT 在屏幕上一个字一个字往外吐提问的答案时,我们会很自然地把速度归因于「计算」:CPU 更快一点、GPU 更强一点、NPU 多几十 TOPS,AI 应该就能回答得更快。 但实际情况不是这个样子的。 在 PC 时代,我们习惯看 CPU 的主频;智能手机刚兴起的时候,每个厂商都参与了「核战争」,比拼谁选的处理器核心数更多;后来游戏成为旗舰手机的重要战场,以及整个链条的重要收入来源,于是 GPU 性能和移动光追等指标开始备受关注。 计算性能就像汽车发动机的马力,数字越大,似乎总不会错。但是,AI 运行的时候,芯片里的 CPU、GPU 和 NPU 往往没有在全速工作。 它在等。等数据从内存里送过来。 过去十年里,AI 计算能力和模型规模快速膨胀,但内存容量、带宽和数据搬运效率并没有以相同速度增长。最终,越来越多的时间和能耗花在数据移动上,而非真正的计算。 这就是「内存墙」,大语言模型因为这个「大」字,开始撞墙了。 一次生成式 AI 推理,大致可以分成两个阶段。第一阶段叫是Prefill,可以理解为「读题」。 用户给 AI 一份几十页的 PDF,或者告诉它「帮我总结过去一年和你的聊天记录」,模型首先需要把大量输入内容读进去。这部分工作会进行大量矩阵运算,所以计算能力依然非常重要。 到了第二阶段 Decode 的「答题」阶段,工作性质发生了变化。模型每生成一个 token,都需要不断读取模型参数以及之前累积下来的上下文,但实际进行的计算相对有限。 这就跟去餐厅吃饭一样,后厨的厨师已经炒好了 10 个菜,但是传菜员只有 1 个,那么从厨房(内存)到餐桌(计算)一次也就上一两个菜,根本不够吃。 问题的关键就是找到关键的问题:不是厨师不够,而是传菜员太少。 既然找到了关键的问题,那么产业就可以着手解决问题了,也诞生了不少方法。 有一种技术路线是 SRAM(Static Random-Access Memory,静态随机存取存储器)就像是板前料理,把厨房搬到餐桌前,饭菜做好了就能端到食客面前。但是吃过板前料理的人也清楚,这种就餐模式菜单固定,并且价格一般还很贵。刚好,SRAM 的单位面积成本很高,很难用有限芯片面积装下越来越大的 AI 模型。 HBM(High Bandwidth Memory,高带宽内存)就像是寿司郎,后厨很大,就餐区也很大,后厨和就餐区之间有类似于「高速列车」一样的传送带,嗖嗖嗖地上菜。寿司郎的情况大家也看到了,排队极其夸张,想吃好也不算便宜,同理,先进 HBM 依赖复杂的堆叠和封装技术,成本高,供不应求。 高通推出的高带宽计算技术(High bandwidth compute,HBC)是一种近内存计算架构思路,也就是前面说的「潮 1/2」,把餐桌(计算)搬到厨房(内存)那里去,减少数据和计算之间的搬运,从而加速 AI,减少功耗。 这其实和这么多年计算机产业的思考方向相悖的,过去是处理器越来越强,数据不断向处理器集中,但 AI 的发展迫使大家重新思考。当然,HBC 并不意味着以后所有计算都会跑进内存,Prefill (预填充)这样的高计算强度任务,依然需要强大的计算单元;游戏、视频编辑、影像处理同样不会消失。 大模型里的矩阵乘、向量运算、Embedding 查询、部分 Attention / KV Cache 相关操作,往往要读取大量数据,这些计算适合应用在 HBC 这里,也就是「数据搬运成本很高的计算」;CPU / GPU / NPU 依然负责「计算本身更复杂的任务」。 这本身也是一种异构分工。 HBC 技术虽然发布了,但商用还得一点时间,但针对 AI 对计算的新要求,以及旧需求旧模式依然很重要的情况,「异构分工」成为了一种核心的解题思路。 尤其是 AI 智能体手机这种新物种。 把 AI 计算放在最适合计算 AI 的地方去 如果手机只负责运行一个聊天机器人,事情其实会简单很多,做一颗巨大的 NPU,把模型塞进去,让它尽可能快地生成 token。 但要消费者接受的 AI 智能体手机显然复杂得多,它需要理解用户的个人情境,在多个应用之间运行,持续推理,并根据用户意图采取行动。未来更可能出现的,也不是一个庞大的模型包办所有事情,而是多个专用模型根据任务、情境和用户需求动态协作。 用户对手机说: 我晚上 7 点和朋友吃

about image

球友会官网 - 足球篮球赛事资讯平台

电话:13594780383

联系人:周经理

邮箱:laborious@icloud.com

网址:qyh-sitecn.com

地址:铜仁市旁踏港33号

在线留言

  • 体验移动端

    体验移动端

  • 联系客服

    联系客服