囍博士的实验室
← 返回全部文章
On-device Intelligence

端侧大模型:把 AI 装进口袋的挑战与机会

离线、私密、随身可用的智能并非云模型的缩小版。它是一场围绕内存、能耗和交互延迟的系统工程。

虾虾皮
· 阅读约 8 分钟 · 端侧 AI / 大模型 / 移动开发

当模型在手机上直接推理,地铁隧道里的语音整理、相册里的语义搜索、输入法里的改写,都不必先把原始数据送到远端。端侧 AI 的价值首先不是“更小的聊天机器人”,而是更靠近传感器、上下文与用户意图。

但口袋是一间苛刻的机房:可用内存要和操作系统、相机、游戏共享,电池容量固定,散热面积只有掌心大小。服务器可以增加 GPU 和批量处理请求,手机面对的却常是 batch size 为 1 的实时交互。一个模型能启动,不代表它能成为好产品。

端侧模型的核心指标不是参数量,而是每焦耳、每兆字节内存所换来的有效体验。

01 / FIT先让模型装得下,再谈跑得快

以十亿参数模型为例,若权重采用 16 位表示,仅权重就接近 2GB;推理还需要 KV Cache、临时张量和运行时空间。量化把权重从 FP16 压到 INT8、INT4,甚至更低位宽,是端侧部署的第一把钥匙。4 位权重理论上可把存储压到原来的四分之一,但实际收益还取决于分组元数据、算子支持与内存对齐。

量化并非免费压缩。少数异常通道会显著影响精度,长文本与推理任务比简单分类更敏感。工程团队需要用真实业务样本校准,而不是只看通用榜单。常见路线包括训练后量化、量化感知训练,以及对注意力与前馈层采用不同精度的混合量化。目标不是追求最低位宽,而是在任务质量跌落前找到设备可承受的甜点位。

KV Cache 是会增长的第二个模型

生成时,模型为已读 token 保存 Key 和 Value;上下文越长,占用越大。产品若把“支持 32K 上下文”直接等同于“手机上随便用 32K”,很快会遭遇内存压力。滑动窗口、KV Cache 量化、提示词摘要和限制并发会话,往往比继续压缩权重更有效。

02 / LATENCY用户感知的是首字与节奏,不是平均吞吐

移动交互至少有两个延迟:prefill 读取全部提示词,决定首字等待;decode 逐 token 生成,决定后续文本是否流畅。长文档会拖慢 prefill,而 decode 常受内存带宽限制——每生成一个 token,都需要搬运大量权重。峰值 TOPS 很漂亮,却未必能代表真实速度。

体验指标主要瓶颈常见优化
模型启动权重加载、内存映射懒加载、缓存、分片
首字延迟Prompt prefill缩短上下文、Prompt Cache
生成速度内存带宽、算子效率量化、融合算子、投机解码
持续可用温升与降频功耗预算、短任务、暂停策略

一次 15 秒的测试很难暴露热降频。可靠的基准应覆盖冷启动、连续多轮、低电量模式和后台应用竞争,并分别记录端到端延迟、峰值内存、能耗与机身温度。硬件加速也不是自动发生的:计算图中一个不支持的算子可能回退 CPU,数据在 CPU、GPU、NPU 之间复制又会吞掉收益。

03 / PRIVACY“数据不离机”是起点,不是完整承诺

端侧推理减少了原始照片、语音和消息上传,离线也能工作,天然适合医疗记录整理、私人知识库检索和屏幕内容理解。但隐私声明仍需回答:模型输入是否写入日志?向量索引是否加密?系统备份会不会同步缓存?第三方键盘能否读取输出?诊断数据中是否包含提示词?

模型文件本身也构成攻击面。应用应验证下载包签名,隔离模型运行时,对工具调用设置显式权限;涉及转账、发信或删除数据时,端侧模型只能提出计划,不能绕过用户确认。端侧降低了传输风险,却没有消除提示注入、越权调用和敏感信息回显。

04 / PRODUCT真正的机会来自“感知—理解—行动”的短回路

端侧最有优势的场景通常高频、短小、上下文敏感:相机取景时即时识别菜单并叠加翻译;在相册本地建立语义索引;把会议片段实时变成待办;根据当前 App 与选中文本提供一句改写;为无障碍用户描述屏幕元素。这些任务不要求模型背下整个互联网,却要求它随时可用、低延迟并尊重隐私。

混合架构会长期存在。端侧小模型负责意图识别、隐私过滤、简单生成与离线兜底;复杂推理在用户同意后交给云端大模型。路由器依据网络、温度、电量、任务敏感度和质量需求做决策。好的产品不会让用户研究模型在哪里运行,而会清楚说明何时需要联网、哪些数据会离开设备。

Design principle

先定义一个两秒内能完成、离线时仍有价值的核心任务,再选择模型和量化方案。不要先把模型塞进手机,再寻找一个足以解释它存在的入口。

05 / DELIVERY端侧模型也需要持续交付与质量分层

设备碎片化意味着同一模型无法覆盖所有用户。应用可以根据内存、芯片能力与系统版本选择 1B、3B 或云端路径;模型包独立于 App 更新,支持校验、断点下载和快速回滚。评测则要分成语言质量、任务成功率、拒答安全性与设备性能四条线,任何一项退化都可能破坏体验。

把 AI 装进口袋,不是把数据中心缩小,而是重新定义智能的边界:更少的世界知识,换来更近的个人上下文;更有限的算力,换来更快的反馈和更明确的数据控制。胜出的端侧产品未必拥有最大的模型,但一定最懂得如何在有限资源中保留用户真正需要的能力。