端侧 AI 元年:Agent 搬进手机和汽车,瓶颈是内存带宽不是算力
原创 · 约 11 分钟阅读 · 阅读 --

端侧 AI 元年:Agent 搬进手机和汽车,瓶颈是内存带宽不是算力

作者: Alex Xiang

人工智能行业观察

古董级程序员,大厂出来后一直在创业公司,现在仍在一线做 AI 相关开发。写过本地模型部署,也写过 WSL 里跑 GPU,这篇聊端侧 AI 这一整年从“能跑”到“商用”的变化,以及真正卡住它的那个工程变量。

2026 年被反复称为“端侧 AI 元年”,理由不是某一家发了某个模型,而是一整组数字同时落地:IDC 预测 2026 年中国 AI 手机出货 1.47 亿台、同比增长 31.6%、占比突破 53%,全球生成式 AI 手机出货约 4.32 亿台;端侧 AI 市场规模预计突破 8000 亿元;业内测算 AI 推理计算需求将达到训练需求的 4 到 5 倍。7 月的 WAIC 上,努比亚发布全球首款 AI 智能体手机,荣耀发布 Agentic OS,阶跃星辰端侧模型 Step Edge 宣布累计装机 4200 万台,面壁智能的座舱智能体 SuperMate 宣布完成 30 万台量产车交付。

这篇不追发布会,讲三件事:为什么是今年、端侧到底在跑什么、以及真正卡住端侧 Agent 的工程瓶颈是什么。

为什么是今年:三个条件同时成熟

端侧跑大模型不是新事,2024 年就有手机厂商演示 70 亿参数模型离线聊天。但“演示”到“商用”之间隔了三道坎,2026 年三道坎同时松了:

模型变小还能干活。 端侧能用的模型从“强行塞进 70 亿”变成“专门为端侧设计”:阶跃星辰 Step Edge 是基础模型 + Audio + GUI + Gen 四件套,本地工具调用延迟低至 0.1 秒;面壁智能的 GELab-Zero 是 4B 参数的端侧 GUI Agent 模型且已开源;Liquid AI 的 LFM2.5-230M 把数据抽取模型压到 2 亿参数级别,宣称可跑在手机、笔记本和机器人上。小模型不是“阉割版”,是换了架构和训练目标的新物种。

芯片算力到位,但只到位了一半。 高通的第五代骁龙 8 至尊版 NPU 性能提升 37%、能效提升 16%,端侧推理速度约 220 token/秒,可离线跑 70 亿参数模型;面向 PC 的骁龙 X2 Elite 有 80 TOPS,本地跑 130 亿参数;Acrab 的 GΞLIX 1 芯片主打 650 TOPS、号称支持 100B 参数模型本地运行。算力数字很热闹,但下面会看到,真正卡住吞吐的不是 TOPS。

场景和生态长出来了。 端侧 Agent 要落地,得有标准化的“操作手机”的方式:Step-GUI 可以跨 200+ 个 App 自动操作,配套的 GUI-MCP 开放协议让开发者“10 分钟部署一个手机 Agent”;面壁的 MiniCPM 成为三星 Galaxy AI 的端侧模型能力提供方;苹果新一代端侧模型与 Gemini 联合搭建,复杂任务走云端,同时开放接入 Claude、Gemini 等第三方模型。手机不再是“聊天窗口”,而是 Agent 的宿主。

端侧到底在跑什么:三类任务,一个共同点

端侧不是要把 GPT-5.6 Sol 塞进手机,而是承接三类云端做不好的任务:

任务类型典型场景为什么必须端侧
高频简单任务本地 tool call、快捷指令、消息摘要0.1 秒本地响应,回传云端延迟不可接受
隐私敏感任务聊天记录、照片、文档理解数据不出端,杜绝泄露风险
实时交互任务语音助手、座舱感知、可穿戴提醒低延迟 + 低功耗,断网也能用

Step Edge 的定位就是这三类的交集:文本、视觉、语音全模态本地处理,敏感数据不出端;面壁 SuperMate 在量产车座舱里做“被动响应到主动感知”,已构建 68 个量产亮点场景。共同点是:这些任务要求的是“快”和“不出端”,而不是“世界上最聪明的模型”

真正的瓶颈:内存带宽,不是 TOPS

这是这篇最值得记住的结论。端侧推理的性能模型是 roofline:LLM 的 decode 阶段(逐 token 生成)是典型的内存带宽受限,不是算力受限——每生成一个 token,都要把整个模型的权重从内存搬一遍。量化研究给出的数字很说明问题:decode 速度的方差约 93% 由有效内存带宽解释,而标称算力(TOPS)只解释约 45%。Meta 在 2026 嵌入式视觉峰会上的判断也一致:端侧多模态感知和智能体最大的技术瓶颈是内存带宽。

算一笔账就清楚了。一个 70 亿参数模型,INT4 量化后约 3.5GB 权重;每秒生成 20 个 token,就需要每秒把 3.5GB 权重搬 20 次,即约 70GB/s 的有效带宽。旗舰手机的内存带宽正好在这个量级——这意味着你看到的各种“端侧 100B 模型”宣传,要么靠极强的内存带宽(桌面级 LPDDR5X 大位宽),要么靠稀疏激活只搬部分权重,要么只是“能加载”而不是“能流畅跑”。

当前工程上成熟的解法是“量化三件套”:

  1. INT4 权重量化:把权重从 FP16 压到 4bit,内存占用和带宽需求直接砍到四分之一;
  2. KV Cache 量化:长上下文时 KV cache 会吃掉大量内存,量化后显著降低占用;
  3. NPU delegate:把算子委托给 NPU,而不是在 CPU 上逐个跑。

一个公开的实践案例:Gemini 3.5 Nano 用 INT4 量化 + KV cache 量化 + NPU delegate,在骁龙 8 Gen 3 上做到 280ms 首 token、32 token/s,内存占用 1.8GB。谷歌还在 Pixel 上用“冻结多 token 预测”(MTP)技术给 Nano v3 提速,通过共享主模型 KV cache 的零拷贝结构,单是内存就省了 130MB。这些数字说明:端侧优化是系统工程,模型、量化、运行时、硬件四层都要动,缺一层都跑不出商用体验。

端云协同:哪些留端侧,哪些上云

端侧元年不代表云端被替代,而是分工变清楚。苹果的做法是典型样板:简单任务端侧模型处理,复杂任务扩展到谷歌云、跑在英伟达 GPU 上,同时允许开发者接入 Claude、Gemini 等第三方模型。判断一个任务该放哪,用三个问题:

  1. 延迟敏感吗? 交互式、毫秒级响应的,必须端侧;
  2. 隐私敏感吗? 数据不出端能换来合规和信任的,端侧;
  3. 需要世界知识或强推理吗? 复杂规划、长文档、跨领域推理,留给云端。

一句话:端侧管“本能”,云端管“思考”。手机管家、座舱助手、穿戴提醒是本能;深度的代码生成、复杂的多步规划是思考。两者之间是路由层——也就是端云协同的调度器,这块正在成为新的工程主战场。

给程序员的观察点

  • 别被 TOPS 带偏。 判断一台设备能不能跑端侧模型,先看内存带宽和可用内存,再看 NPU 算力;跑分表里 decode 速度比峰值算力更可信。
  • 量化是你的第一优化手段,不是最后一招。 INT4 + KV cache 量化 + NPU delegate 是 2026 年的及格线;模型架构(稀疏激活、MTP)才是下一个数量级的来源。
  • Agent 协议决定生态速度。 Step Edge 的 GUI-MCP 能 10 分钟部署手机 Agent,说明端侧 Agent 的竞争已经从“模型跑得动”转向“模型能不能操作 App、接多少生态”。
  • 端侧元年是端云协同元年。 真正值钱的是“哪个任务放端侧、哪个放云端、切换阈值是多少”这层路由能力,而不是某一端的大模型。

接下来值得盯的:内存带宽还能不能继续涨(这决定 70B 级模型什么时候能真正在手机上流畅跑)、端侧 GUI 操作的安全边界(200 个 App 的自动化权限怎么管)、以及 8000 亿市场里,模型方、芯片方和终端厂谁拿到最大份额。

打开原图 ↗