AI Agent正通过多模态UI交互实现与手机、电脑等终端设备的深度协同。东吴证券研报显示,苹果Ferret-UI在UI元素定位(Grounding)和识别(Referring)任务中准确率超82%,大幅领先GPT-4V的约37%。谷歌ScreenAI模型同样验证了参数提升对UI理解的显著效果——5B模型在复杂任务中的性能提升尚未饱和。Transformer架构正在克服任务和UI元素之间的隐含关系,大幅提升GUI Agent的可行性,为端侧AI的深度应用铺平了道路。
Transformer架构开启UI交互革命,GUI Agent可行性大幅提升
AI智能助理的任务执行过程包括规划和定位两个关键环节。规划是决定“做什么、用什么工具、按什么步骤执行”,定位则是执行过程中精准找到UI界面中的具体元素并操作。
根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两大类。API交互方式依赖公开可用的API,存在应用支持不全(无法覆盖所有App)、人类能轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。
GUI交互可进一步分为基于文本和多模态两种方式。当前多模态GUI交互中,视觉定位(Grounding)难度甚至比规划决策(Planning)更大。UI界面复杂、元素众多且尺寸不一,元素识别错误是当前LMMs GUI模型的主要错误来源。多模态GUI交互面临数据不足、屏幕录制要求高以及当前LMMs模型推理能力有限的困扰。
注:Referring-Android中GPT-4V的114.3%为异常值,源于其过度生成导致的评价失真
根据交互模式,任务执行方法可分为基于API和基于用户界面(UI)两大类。API交互方式依赖公开可用的API,存在应用支持不全(无法覆盖所有App)、人类能轻松执行但API难以实现的任务、拓展性和自动化能力较弱等不足。UI界面方式在Transformer架构下较好克服了任务和UI元素之间的隐含关系,大幅提升了GUI Agent的可行性。
GUI交互可进一步分为基于文本和多模态两种方式。当前多模态GUI交互中,视觉定位(Grounding)难度甚至比规划决策(Planning)更大。UI界面复杂、元素众多且尺寸不一,元素识别错误是当前LMMs GUI模型的主要错误来源。多模态GUI交互面临数据不足、屏幕录制要求高以及当前LMMs模型推理能力有限的困扰。
| 模型 | Grounding-iPhone | Grounding-Android | Referring-iPhone | Referring-Android |
|---|---|---|---|---|
| GPT-4V | 37.7% | 70.3% | 4.7% | 114.3% |
| Ferret-UI-anyres | 82.4% | 81.4% | 83.8% | 93.9% |
注:Referring-Android中GPT-4V的114.3%为异常值,源于其过度生成导致的评价失真
苹果Ferret-UI:专用视觉模型精准定位UI元素
苹果在2024年4月推出Ferret-UI模型,专为移动UI理解设计。Ferret-UI通过视觉编码器对图像进行编码,加入任意分辨率(Anyres)技术切割放大子图像来解决UI交互中的小型对象识别问题(如小图标、小按钮),同时采用混合区域表示方法提高图像特征提取能力,将图像特征和文本指令联合编码后进行推理。
在基准测试中,Ferret-UI-anyres在Grounding(定位)任务中iPhone和Android准确率分别为82.4%和81.4%,在Referring(识别)任务中分别为83.8%和93.9%,而GPT-4V的Grounding准确率仅为37.7%(iPhone)和70.3%(Android),Referring-iPhone仅4.7%。Ferret-UI在定位任务中准确率是GPT-4V的两倍以上,证明专用UI视觉语言模型在精确识别和定位UI元素方面的巨大优势。
在基准测试中,Ferret-UI-anyres在Grounding(定位)任务中iPhone和Android准确率分别为82.4%和81.4%,在Referring(识别)任务中分别为83.8%和93.9%,而GPT-4V的Grounding准确率仅为37.7%(iPhone)和70.3%(Android),Referring-iPhone仅4.7%。Ferret-UI在定位任务中准确率是GPT-4V的两倍以上,证明专用UI视觉语言模型在精确识别和定位UI元素方面的巨大优势。
谷歌ScreenAI:模型参数提升对UI理解性能影响显著
谷歌2024年2月推出ScreenAI可读屏AI视觉语言模型,专门设计用于理解和处理用户界面和信息图标。ScreenAI使用Vision Transformer视觉编码器和T5语言编码器,采用更灵活的屏幕分割策略以适用于不同手机和电脑屏幕。
谷歌发布了670M、2B和5B三个参数版本。参数差异主要在图像和文本编解码器的大小,5B版本支持812×812最大输入分辨率。从模型表现看,增加模型规模能持续提升所有任务的性能,最大5B模型性能提升尚未饱和。在复杂任务中,2B到5B的性能提升(约8-12个百分点)远大于670M到2B(约3-5个百分点),说明在UI理解这种复杂多模态任务中,更大的模型参数仍能带来显著的性能收益。
苹果Ferret-UI和谷歌ScreenAI的进展表明,UI多模态交互正成为AI Agent落地终端设备的关键技术路径。随着模型持续迭代和硬件能力提升,端侧AI有望通过GUI界面实现真正的“人机协同”,开启Agent规模化应用的历史机遇。
谷歌发布了670M、2B和5B三个参数版本。参数差异主要在图像和文本编解码器的大小,5B版本支持812×812最大输入分辨率。从模型表现看,增加模型规模能持续提升所有任务的性能,最大5B模型性能提升尚未饱和。在复杂任务中,2B到5B的性能提升(约8-12个百分点)远大于670M到2B(约3-5个百分点),说明在UI理解这种复杂多模态任务中,更大的模型参数仍能带来显著的性能收益。
苹果Ferret-UI和谷歌ScreenAI的进展表明,UI多模态交互正成为AI Agent落地终端设备的关键技术路径。随着模型持续迭代和硬件能力提升,端侧AI有望通过GUI界面实现真正的“人机协同”,开启Agent规模化应用的历史机遇。
点击阅读报告原文:
最新报告
中英对照
全文搜索
报告精选
PDF上传翻译
多格式文档互转
入驻&报告售卖
会员权益
机构报告
券商研报
财报库
专题合集
英文报告
数据图表
会议报告
其他资源
新质生产力
DeepSeek
低空经济
大模型
AI Agent
AI Infra
具身智能
自动驾驶
宠物
银发经济
人形机器人
企业出海
算力
微短剧
薪酬
白皮书
创新药
行业分析
个股研究
年报财报
IPO招股书
会议纪要
宏观策略
政策法规
其他
人工智能
信息科技
互联网
消费经济
汽车交通
电商零售
传媒娱乐
医疗健康
投资金融
能源环境
地产建筑
传统产业
英文报告
其它
行业聚焦
芯片产业
热点概念
全球咨询智库
人工智能
500强
新质生产力
会议峰会
新能源汽车
企业年报
互联网
公司研究
行业综观
消费教育
科技通信
医药健康
人力资源
投资金融
汽车产业
物流地产
电子商务
传统产业
传媒营销
其它
十五五规划系列报告合集(共54套打包)
2026年宠物经济/它经济报告合集(共46套打包)
AI、科技与通信
广告、传媒与营销
消费、零售与支付
HR、文化与旅游
金融、保险与投资
能源、环境与工业
医疗制药与大健康
物流、地产与建筑
其他行业
AI ▪ 科技 ▪ 通信
数字化
金融财经
智能制造
电商传媒
地产建筑
医疗医学
能源化工
其他行业

收藏
下载
2026-07-20

AI查数
行业数据
政策法规
商业模式
产业链
竞争格局
市场规模
产业概述
自研数据
其它
2026年
AI读财报
年报
一季报
半年报
三季报
IPO招股书
社会责任报告
A股
IPO申报
港股
美股&全球
新三板
2026-07-30
电子行业
21页
1张图表
0731-84720580
商务合作:really158d
微信扫码登录
手机快捷登录
账号登录