您的当前位置:首页 > 标签 > 理想VLA量产
上海财经大学:2026自动驾驶生态报告(68页).pdf
理想VLA量产2026:视觉-语言-动作模型上车,泊车可执行文字指令|技术突破
理想VLA量产深度解读:国内首个视觉-语言-动作模型上车、可读懂交警手势和文字指令、泊车语义理解、VLA vs 端到端。
 2026-08-02
 无人驾驶
 68页
5张图表
数据来源:
上海财经大学:2026自动驾驶生态报告(68页) 查看报告
理想i6在报告实测中跻身第一梯队——它能在复杂路口根据“右转寻找白色车并停在其后方”的文字指令执行操作,能在地库通过读取文字标识自己寻找出口。这不是端到端模型的“反射式”响应,而是VLA(视觉-语言-动作模型)的“思考式”决策。上海财经大学报告指出,理想是国内首个将VLA模型量产上车的车企,让车辆不仅能“看见”,还能“读懂”。VLA的文字理解能力、交警手势识别和临时交通指示解析,正在将城区NOA从“基本好用”推向“真正可靠”。

VLA的技术突破

从“看见”到“读懂”

VLA(Vision-Language-Action,视觉-语言-动作模型)将大语言模型的逻辑推理能力注入智驾系统。纯端到端模型能够识别前方有一块牌子,但无法理解牌子上写的文字意味着什么。VLA则能读取文字内容、理解时间条件、并据此调整行驶策略——例如“前方修路,7:00-09:00变道限速30”这类包含时间条件和速度要求的文字指令。

在实测中,理想i6能根据“右转寻找白色车并停在其后方”的文字指令执行操作,能在地库通过读取文字标识自己寻找出口。这些都是纯端到端模型无法完成的。VLA让汽车不仅能“看见”,还能“读懂”路面上的文字指令和交警手势。

VLA vs 端到端的技术哲学差异

测评专家用类比概括了技术哲学差异:华为是“复读三年死记硬背考700分的学生”——依靠海量数据库和规则打磨,体验稳定但扩展依赖数据积累。理想是“跳级三年靠智商考700分的学生”——依靠VLA的语义理解能力,当前在窄路调整方向时略显迟缓,但底层逻辑是在“思考”而非执行指令,迭代潜力巨大。

VLA面临的工程挑战同样巨大——推理延迟。大语言模型的推理速度远慢于纯端到端模型,而智驾场景对决策延迟容忍度极低。当前工程妥协是将VLA用于“慢思考”层处理需要推理的复杂场景,同时保留纯端到端模型作为“快反射”层处理常规驾驶。

VLA的实测表现与泊车突破

第一梯队的行车体验

报告实测中,理想i6凭借VLA带来的体验飞跃跻身行车第一梯队。VLA的实测表现印证了技术分析:它具备了超越端到端模型的场景理解能力。在复杂施工区、临时交通指示等场景中,VLA的表现显著优于纯端到端方案。

泊车领域的语义理解领先

在泊车场景中,理想的VLA展现出业界领先的语义理解能力。系统不依赖预建的场景数据库,而是实时“读懂”环境——在陌生停车场通过读取文字标识和箭头自主导航,在复杂路口根据文字指令执行操作。虽然当前在窄路口调整方向时略显迟缓,但底层逻辑是在真正“思考”而非执行预设指令。

VLA的产业意义与未来

城区NOA从“基本好用”到“真正可靠”

VLA的语义理解能力与传统智能限速提示(ISLI)有本质区别。过去的ISLI仅能识别标准化的圆形限速牌,遇到非标准化的文字指令即失效。VLA则具备通用的文字理解能力,理论上可以“读懂”任何语言的交通指示——同一套模型出海时的本地化适配成本也将显著降低。

VLA代表了让智驾系统像人类一样“读懂”道路环境中语义信息的关键技术路径,是城区NOA从“基本好用”进化到“真正可靠”的核心突破。

理想的独特优势

理想的结构性优势在于数据标准化——旗下车型均为中大型SUV,传感器配置高度一致,为端到端和VLA模型的统一训练提供天然优势。但理想也面临挑战:人员变动大、长尾场景解决不够好、系统整体稳定性尚需提升。VLA推理延迟的优化、窄路调整的进一步平滑化,将是理想下一阶段的技术攻坚重点。
客服
商务合作
小程序
服务号
折叠