AI正从云端走向终端,端侧AI正掀起新一轮人机交互革命。东吴证券研报显示,端侧AI市场规模将从2023年的不到2000亿元增长至2028年的超1.9万亿元,年复合增长率高达58%。苹果通过"本地30亿参数模型+私有云+第三方大模型"三层架构实现系统级AI,谷歌Gemini Nano持续迭代小模型性能。从模型压缩技术创新到硬件内存升级,从多模态UI交互到Agent自主决策,端侧AI的底层逻辑正在发生深刻变革。
AI自主化能力跃升——从指令驱动到意图驱动
AI自主化能力正沿着"以指令为中心"到"以意图为中心"持续提升。根据智能化分级标准,L1-L3级智能体在用户指令被动驱动下工作,而L4级以上智能体能够理解用户历史数据、感知当前状况并在适当时主动提供个性化服务。大模型和智能体正驱动下一代终端操作系统,从单点AI增强→OS智能化改造→以AI为中心的全新OS逐步演进。
当前端侧模型性能和云端大模型仍有较大差距,基于用户场景的端云协同AI将构筑全局化智能。端侧适合无网、隐私要求高、响应要求高的场景,云端适合需要大模型复杂推理的场景。苹果通过小型本地模型+私有云模型+第三方大模型三层架构实现系统级AI,编排层(Orchestration)协调多个模型,根据用户请求调用对应能力的模型,实现用户体验的一致性。
当前端侧模型性能和云端大模型仍有较大差距,基于用户场景的端云协同AI将构筑全局化智能。端侧适合无网、隐私要求高、响应要求高的场景,云端适合需要大模型复杂推理的场景。苹果通过小型本地模型+私有云模型+第三方大模型三层架构实现系统级AI,编排层(Orchestration)协调多个模型,根据用户请求调用对应能力的模型,实现用户体验的一致性。
端侧模型快速迭代——技术创新大于参数量提升
端侧小模型性能持续提升。Gemma2较Gemma1在MMLU测试提升约10个百分点,GSM8K数学推理提升9个百分点。模型性能与参数规模呈明显正向关系:Gemma-2 2B到9B的表现提升远高于9B到27B的提升,说明小模型的优化空间更大。但数据集的差异、蒸馏技术的使用会带来相同模型规模的巨大性能差异——苹果3B的AFM-on-device性能远高于开源的OpenELM-3B。
参数量对模型表现影响巨大。Gemini Nano 1(1.8B)全面弱于Nano 2(3.25B),Nano 2的MMLU准确率55.8%仅为Gemini Pro的78%,MBPP编程测试27.2%仅为Pro的45%。端侧模型需进一步提升参数量以提高各类任务能力,但受限于硬件,小模型的技术创新更加积极,以提升有限参数量下的性能表现。
参数量对模型表现影响巨大。Gemini Nano 1(1.8B)全面弱于Nano 2(3.25B),Nano 2的MMLU准确率55.8%仅为Gemini Pro的78%,MBPP编程测试27.2%仅为Pro的45%。端侧模型需进一步提升参数量以提高各类任务能力,但受限于硬件,小模型的技术创新更加积极,以提升有限参数量下的性能表现。
模型压缩三大技术——量化、剪枝、蒸馏
量化/剪枝/蒸馏是主要的模型压缩方式。量化用低精度数值表示参数,从32bits转化为8bits后内存开销为原来的1/4,计算成本仅为原来的1/16。剪枝删除不必要的神经元/权重参数,修剪后计算复杂性和内存均可降低25%。蒸馏将大模型作为教师模型,用其输出训练一个性能接近但更轻量化的学生模型——Gemma的2B和9B模型由27B模型蒸馏而来。
苹果使用混合精度量化实现3.7bits的量化水平后,加入准确率恢复适配器实现近乎无损的量化压缩:IFEval指令遵循从量化后的97.9%恢复至100.6%,GSM8K数学推理从91.3%恢复至96.0%。参数量-性能的取舍带来更多样化的创新方向,高质量数据集、高效训练方式、先进压缩方法等方向百花齐放。
苹果使用混合精度量化实现3.7bits的量化水平后,加入准确率恢复适配器实现近乎无损的量化压缩:IFEval指令遵循从量化后的97.9%恢复至100.6%,GSM8K数学推理从91.3%恢复至96.0%。参数量-性能的取舍带来更多样化的创新方向,高质量数据集、高效训练方式、先进压缩方法等方向百花齐放。
Agent架构——从LLM到VLA再到个性化内存操作
Agent模型的演进从基础LLM到VLA模型再到个性化Agent。基础模型需引入新的输入类型成为VLA模型(Vision-Language-Action Model),融合视觉、语言和动作的多模态范式。Transformer架构带来状态-动作交互策略学习机遇,通过模糊匹配而非精准映射学习策略,大幅提升泛化能力。消费电子GUI是最先落地的场景。
个人LLM大模型需具备三大能力:任务执行(将用户指令转化为操作行动)、情境感知(感知用户及环境当前状态)、记忆(记录用户数据实现自我进化)。任务执行过程中需要任务分解/规划(推理能力)、切换任务(个性化调整权重)、检索历史数据(内存操作能力)。Agent架构的复杂度提升对硬件提出了更高要求,尤其是内存和算力的协同升级。
个人LLM大模型需具备三大能力:任务执行(将用户指令转化为操作行动)、情境感知(感知用户及环境当前状态)、记忆(记录用户数据实现自我进化)。任务执行过程中需要任务分解/规划(推理能力)、切换任务(个性化调整权重)、检索历史数据(内存操作能力)。Agent架构的复杂度提升对硬件提出了更高要求,尤其是内存和算力的协同升级。
| 模型 | 参数量 | MMLU得分 | 训练数据量 | 备注 |
|---|---|---|---|---|
| Gemma-1 2B | 2B | 42.3 | 2T tokens | 谷歌2024年2月发布 |
| Gemma-2 2B | 2B | 52.2 | 2T tokens | 谷歌2024年6月发布 |
| Mistral 7B | 7B | 62.5 | - | - |
| LLaMA-3 8B | 8B | 66.4 | - | Meta开源模型 |
| Gemma-2 9B | 9B | 71.3 | - | 谷歌小模型标杆 |
| AFM-on-device | 3B | - | - | 苹果端侧模型 |
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共50套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
21页
34张图表
0731-84720580
商务合作:really158d
友链申请 (QQ):1737380874
微信扫码登录
手机快捷登录
账号登录