当模型在手机上直接推理,地铁隧道里的语音整理、相册里的语义搜索、输入法里的改写,都不必先把原始数据送到远端。端侧 AI 的价值首先不是“更小的聊天机器人”,而是更靠近传感器、上下文与用户意图。
但口袋是一间苛刻的机房:可用内存要和操作系统、相机、游戏共享,电池容量固定,散热面积只有掌心大小。服务器可以增加 GPU 和批量处理请求,手机面对的却常是 batch size 为 1 的实时交互。一个模型能启动,不代表它能成为好产品。
端侧模型的核心指标不是参数量,而是每焦耳、每兆字节内存所换来的有效体验。
01 / FIT先让模型装得下,再谈跑得快
以十亿参数模型为例,若权重采用 16 位表示,仅权重就接近 2GB;推理还需要 KV Cache、临时张量和运行时空间。量化把权重从 FP16 压到 INT8、INT4,甚至更低位宽,是端侧部署的第一把钥匙。4 位权重理论上可把存储压到原来的四分之一,但实际收益还取决于分组元数据、算子支持与内存对齐。
量化并非免费压缩。少数异常通道会显著影响精度,长文本与推理任务比简单分类更敏感。工程团队需要用真实业务样本校准,而不是只看通用榜单。常见路线包括训练后量化、量化感知训练,以及对注意力与前馈层采用不同精度的混合量化。目标不是追求最低位宽,而是在任务质量跌落前找到设备可承受的甜点位。
KV Cache 是会增长的第二个模型
生成时,模型为已读 token 保存 Key 和 Value;上下文越长,占用越大。产品若把“支持 32K 上下文”直接等同于“手机上随便用 32K”,很快会遭遇内存压力。滑动窗口、KV Cache 量化、提示词摘要和限制并发会话,往往比继续压缩权重更有效。
02 / LATENCY用户感知的是首字与节奏,不是平均吞吐
移动交互至少有两个延迟:prefill 读取全部提示词,决定首字等待;decode 逐 token 生成,决定后续文本是否流畅。长文档会拖慢 prefill,而 decode 常受内存带宽限制——每生成一个 token,都需要搬运大量权重。峰值 TOPS 很漂亮,却未必能代表真实速度。
| 体验指标 | 主要瓶颈 | 常见优化 |
|---|---|---|
| 模型启动 | 权重加载、内存映射 | 懒加载、缓存、分片 |
| 首字延迟 | Prompt prefill | 缩短上下文、Prompt Cache |
| 生成速度 | 内存带宽、算子效率 | 量化、融合算子、投机解码 |
| 持续可用 | 温升与降频 | 功耗预算、短任务、暂停策略 |
一次 15 秒的测试很难暴露热降频。可靠的基准应覆盖冷启动、连续多轮、低电量模式和后台应用竞争,并分别记录端到端延迟、峰值内存、能耗与机身温度。硬件加速也不是自动发生的:计算图中一个不支持的算子可能回退 CPU,数据在 CPU、GPU、NPU 之间复制又会吞掉收益。
03 / PRIVACY“数据不离机”是起点,不是完整承诺
端侧推理减少了原始照片、语音和消息上传,离线也能工作,天然适合医疗记录整理、私人知识库检索和屏幕内容理解。但隐私声明仍需回答:模型输入是否写入日志?向量索引是否加密?系统备份会不会同步缓存?第三方键盘能否读取输出?诊断数据中是否包含提示词?
模型文件本身也构成攻击面。应用应验证下载包签名,隔离模型运行时,对工具调用设置显式权限;涉及转账、发信或删除数据时,端侧模型只能提出计划,不能绕过用户确认。端侧降低了传输风险,却没有消除提示注入、越权调用和敏感信息回显。
04 / PRODUCT真正的机会来自“感知—理解—行动”的短回路
端侧最有优势的场景通常高频、短小、上下文敏感:相机取景时即时识别菜单并叠加翻译;在相册本地建立语义索引;把会议片段实时变成待办;根据当前 App 与选中文本提供一句改写;为无障碍用户描述屏幕元素。这些任务不要求模型背下整个互联网,却要求它随时可用、低延迟并尊重隐私。
混合架构会长期存在。端侧小模型负责意图识别、隐私过滤、简单生成与离线兜底;复杂推理在用户同意后交给云端大模型。路由器依据网络、温度、电量、任务敏感度和质量需求做决策。好的产品不会让用户研究模型在哪里运行,而会清楚说明何时需要联网、哪些数据会离开设备。
先定义一个两秒内能完成、离线时仍有价值的核心任务,再选择模型和量化方案。不要先把模型塞进手机,再寻找一个足以解释它存在的入口。
05 / DELIVERY端侧模型也需要持续交付与质量分层
设备碎片化意味着同一模型无法覆盖所有用户。应用可以根据内存、芯片能力与系统版本选择 1B、3B 或云端路径;模型包独立于 App 更新,支持校验、断点下载和快速回滚。评测则要分成语言质量、任务成功率、拒答安全性与设备性能四条线,任何一项退化都可能破坏体验。
把 AI 装进口袋,不是把数据中心缩小,而是重新定义智能的边界:更少的世界知识,换来更近的个人上下文;更有限的算力,换来更快的反馈和更明确的数据控制。胜出的端侧产品未必拥有最大的模型,但一定最懂得如何在有限资源中保留用户真正需要的能力。