当前位置:首页 > 报告详情

【东吴证券】汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?-260728(11页).pdf

上传人: 向** 编号:1283161 2026-07-28 11页 661.07KB

核心结论速览: 物理AI与数字AI并非对称二分概念:物理AI承接具身智能学术传统,2024—2025年由英伟达等产业主体推向主流,核心支柱包括自动驾驶和具身/人形机器人;数字AI则是在物理AI概念流行后形成的追溯性对照词。 两类AI最根本差异在部署形态和安全约束:数字AI主要面向文本、代码、知识和软件状态,高度依赖云端联网和重运营;物理AI面向车辆、机器人和真实空间,不能假设随时联网,必须在端侧自主、安全攸关和实时反馈条件下运行。 技术史主线:数字AI扩参数、物理AI补闭环:数字AI当前重点从训练期扩参数转向推理期扩算力;物理AI先在自动驾驶、后在机器人中完成产业迭代,从高精地图、激光雷达和模块化系统,逐步走向端到端、VLA和世界模型。 世界模型是两类路线共同关切,但分歧在于潜在空间是否需承载像素重建:生成式路径以Sora、Genie 3、Cosmos为代表,训练目标要求将潜在表示解码还原为可观测画面;表征预测路径以杨立昆JEPA为代表,主张在抽象表征空间预测且不重建像素。 商业化节奏:数字AI率先落地,物理AI仍在验证:数字AI在AICoding、企业级Agent、对话搜索和内容生成等场景已有清晰收费闭环;物理AI中Robotaxi区域化运营和收费逐步推进,人形/具身机器人仍处于出货、成本、可靠性和单位经济验证期。 中美格局:各擅其长:美国在前沿模型、资本和无人里程方面领先;中国在规模化运营、供应链、硬件成本和部分应用落地上具备优势。 机器人正成为数字AI与物理AI的交汇点:越来越多机构认为纯数字模型难以单独形成稳健智能,需借助物理接地、世界模型和真实交互数据提升泛化能力。H2:研究背景与概念界定。数字AI与物理AI是一组并不完全对称的术语。物理AI承接具身智能学术传统,图灵在1948年《Intelligent Machinery》中已区分具身与非具身智能;Rodney Brooks于1986年提出Nouvelle AI,并在1991年《Intelligence without representation》中主张智能可由智能体与物理环境的直接交互产生。作为与数字AI相对的术语,物理AI的明确学术分类可追溯至Miriyev与Kovač在2021年的研究,其将AI区分为处理信号的数字AI与包含机器人等物理实体的物理AI。英伟达及黄仁勋将物理AI从学术概念推向产业主流话语。2024年,黄仁勋提出“感知AI—生成式AI—代理AI—物理AI”的阶段框架;2025年1月CES上,他以物理AI为主题作系统阐述,提出AI的下一个前沿是理解物理定律、拥有身体的AI。物理AI经历了2021年前后的学术分类和2024—2025年的产业定型两个阶段。产业语境下,物理AI主要由两条落地主线构成:1)自动驾驶,包括端到端智驾与Robotaxi;2)具身/人形机器人。二者共享端侧实时推理与云端训练的架构约束。“数字AI”并非主流机构主动提出的自我标签,而是在物理AI概念流行后,为形成对照而被迫溯使用的概念,通常指运行于纯数字或虚拟环境、处理文本与图像等数据的AI。OpenAI、Anthropic、Google DeepMind等机构更常以AGI、通用智能或基础模型自我界定,而较少使用数字AI标签。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:技术驱动力全景。H3:数字AI——通用方法、数据与算力构成主线。数字AI技术史的主线,是用更通用、更可扩展的方法持续替代人工设计。1989年至1998年间,Yann LeCun以LeNet系列将卷积神经网络用于手写数字识别;2009年李飞飞主导构建ImageNet大规模标注数据集;2012年Geoffrey Hinton团队的AlexNet在ImageNet竞赛上显著降低Top-5错误率,引爆深度学习。序列建模上,RNN和LSTM赋予网络记忆能力,但并行扩展受限;2017年的Transformer以注意力机制取代循环与卷积,可并行扩展至大规模模型,成为GPT系列大语言模型的统一底座。数字AI迭代的底层逻辑,可由Richard Sutton在2019年提出的“The Bitter Lesson”概括:长期看,依赖算力增长的通用搜索与学习方法,往往胜过依赖人工注入领域知识的方法。当前重点之一,是从训练期扩参数转向推理期扩算力:OpenAI o系列显示,让模型在可验证任务上投入更多推理计算可提升数学、科学和编程能力;DeepSeek则通过强化学习后训练路线提升推理模型表现。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H3:物理AI——自动驾驶先行,机器人接续验证。与数字AI更多由学术和基础模型机构推动不同,物理AI更依赖产业场景中的持续试错和工程闭环。自动驾驶:从模块化系统走向端到端。 自动驾驶形成两条标志性路线。Waymo路线脱胎于2009年谷歌自动驾驶项目,强调安全冗余:多传感器融合、高精地图、限定区域运营和模块化堆栈是其早期核心,近年逐步用机器学习替换各模块,并在2024年提出构建于Gemini多模态大模型之上的EMMA端到端研究模型。特斯拉路线强调纯视觉与可扩展:2019年HydraNet、2021年纯视觉转向与BEV、2022年占用网络,再到2023—2024年FSD v12以单一端到端神经网络从摄像头像素直接输出控制。两条路线共同趋势是从人工规则模块化走向数据驱动端到端,分歧主要在传感器配置、高精地图依赖和成本可扩展性。机器人:VLA模型与数据飞轮成为主线。 机器人侧主线是视觉-语言-动作模型和数据飞轮。谷歌DeepMind在2023年发布的RT-2被视为早期代表性VLA模型;Physical Intelligence在2024年发布并开源π0,以VLM主干叠加独立扩散动作专家。机器人约束在于高质量交互数据稀缺,交互数据相较多模态互联网数据少1—2个数量级,因此产业路径更多依赖“遥操作—训练VLA—部署—真实反馈”的数据飞轮。产业格局上,特斯拉以Optimus推进制造场景自用和量产降本,Figure以Helix主打人形通用操作,英伟达以Cosmos世界基础模型、GR00T人形VLA和Isaac仿真构建平台。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:世界模型——两类路线的共同关切与根本分歧。两类AI都关心机器能否形成可预测世界或环境状态变化的内部模型,即世界模型。但数字AI中的世界模型更多指向生成、推理与交互环境中的内部表征;物理AI中的世界模型更强调状态与动作后果预测。两类路线都强调世界模型,但技术口径存在差异:生成式路径以Sora、Genie 3、Cosmos、GAIA等为代表,其预测通常在压缩后的潜在空间中进行,训练目标要求将潜在表示解码还原为可观测画面,可服务合成数据和仿真。表征预测路径以杨立昆JEPA为代表,主张在抽象表征空间预测且不重建像素,认为生成式视频会消耗过多容量于不可预测的像素细节。I-JEPA、V-JEPA、V-JEPA 2是该路径的代表。两条路径的分野不在于是否使用潜在空间,而在于潜在空间是否需要承载像素重建:生成式的潜在是须还原画面的编解码压缩,JEPA的潜在则主动丢弃不可预测的细节。分歧实质在于:世界模型应重在生成,还是重在理解与规划。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:商业闭环分化。商业化差异首先来自部署形态。多数通用数字AI服务主要在云端推理,依赖联网、低延迟和持续运营;物理AI则相反,自动驾驶避障决策和机器人抓取控制均属于安全要求高、反应时间短的实时任务,关键推理必须在端侧本地完成,云端主要承担训练、地图和车队学习等非实时职能。由此派生两类差异:1)物理AI对实时低延迟和可靠性的要求更高,单次失误可能造成物理伤害;2)物理AI端侧需处理大量传感器数据,隐私和带宽约束更强。H3:数字AI场景落地。编程AI Coding是落地最扎实、闭环最清晰的场景,原因在于代码可通过编译和测试即时验证,反馈信号明确,生产力提升可量化。头部产品年化运行收入合计已达数十亿至百亿美元量级,Cursor、Claude Code、GitHub Copilot等是代表,收费以按席位订阅为主。对话与搜索用户规模最大,落地逻辑是高频通用、低门槛使用。收费以消费订阅和免费引流为主,如ChatGPT约20美元/月,并辅以API按token计费。头部机构持续提升企业客户收入占比。企业级与Agent是商业变现主战场,场景包括办公协同、客服、知识管理和智能体。Anthropic收入结构中企业客户占比较高,收费以按席位、按用量或企业合同为主。营销与内容生成的最大变现并非来自模型公司本身,而是来自大厂将生成式AI嵌入既有广告和内容产品。Meta财报显示,截至2025年第四季度,其AI广告工具年化收入已超600亿美元,用约3.5年达成该规模。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H3:物理AI场景落地。自动驾驶/Robotaxi是物理AI中商业闭环最靠前的落地场景。Robotaxi已进入区域内真实收费运营阶段:Waymo、百度萝卜快跑、小马智行等均披露了车队规模、订单量或收费收入增长数据。收费模式基本明确,主要按里程和时长计价,类似网约车;但行业整体仍处投入期,盈利能力取决于单车成本、利用率、运营区域密度和安全监管等变量。人形/具身机器人的商业闭环按细分场景成熟度递减:工业/制造环境结构化、任务明确,最先落地;物流/仓储次之;导览、巡检等商用服务已有零散落地;家庭场景仍不成熟。收费模式尚在分化,除整机买断外,RaaS按月或按小时租赁开始出现,但多数厂商尚未跑通可持续单位经济。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:技术演进方向——两种情景推演。情景一:生成式世界模型主导(Sora式路线) 。关键假设:视频生成模型在像素级预测上持续突破,统计意义上符合真实世界物理规律。技术特征:以大规模视频数据预训练为基座,通过潜在扩散生成可交互的物理仿真环境。适用企业:需要大量合成数据训练具身模型的企业、内容生成与仿真平台。代表机构:OpenAI、DeepMind、英伟达、Wayve。情景二:表征式世界模型主导(JEPA式路线) 。关键假设:抽象表征空间预测在样本效率和因果理解上优于像素级生成。技术特征:在表征空间进行预测,主动丢弃不可预测的细节,专注规划与控制。适用企业:对实时决策、安全性和样本效率要求高的自动驾驶和机器人企业。代表机构:Meta、LeCun新公司AMI。两种情景的核心分歧在于:世界模型是服务“生成与仿真”还是服务“理解与规划”。当前两种路线并行发展,尚未收敛。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:中美格局与AGI展望。H3:中美格局:各擅其长。数字AI方面,美国在前沿模型能力与商业变现上领先,闭源前沿模型仍定义能力上限;中国以工程效率、开源生态、成本与用户规模追赶,DeepSeek以MoE、MLA、FP8、GRPO等创新代表效率范式。差距主要体现在最前沿能力、可靠性以及单体商业变现强度。自动驾驶方面,美国Waymo在纯技术成熟度与无人驾驶里程上领先;中国在规模化运营、成本和政策开放上具备优势。继L4技术中国约落后1—2年,但商业化落地与降本推进更快。人形/具身机器人方面,美国在具身基础模型和资本投入上领先;中国在出货量、供应链配套和硬件成本上领先。差距主要集中在具身基础模型、VLA/世界模型,以及六维力矩传感器、高端芯片等高端核心零部件的自主能力。H3:通往AGI——机器人成为两类路线汇合点。数字AI与物理AI机构正在同时涌入机器人领域。数字AI阵营中,OpenAI在2025年重建机器人部门,谷歌DeepMind推出Gemini Robotics,英伟达以GEAR实验室和GR00T押注具身智能;物理AI阵营则包括Physical Intelligence、特斯拉Optimus、Figure、波士顿动力。这一汇合具备三重逻辑:1)物理接地假设——越来越多机构认为纯数字模型不足以达到稳健AGI,智能需要在与物理世界的交互中被检验和塑造;2)世界模型是共同关切,机器人是验证环境预测、动作规划和任务泛化的直接场景;3)物理世界数据稀缺,模型需要通过真实机器人和数据飞轮采集交互数据。但汇合并不意味着路线一致:一类路线把机器人视为大模型的新增模态,以VLM/大模型扩展为主轴;另一类路线强调真实数据、控制优先和世界模型。未来可能形成“多模态大模型负责语义与规划、世界模型负责物理预测、控制系统负责真实执行”的联合架构,但大模型先行还是世界模型/控制优先仍未收敛。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。H2:未来3—5年机会洞察。机会赛道矩阵: 自动驾驶/Robotaxi(高成熟度×高市场空间) :渗透率持续提升,Robotaxi区域化运营已进入收费阶段。爆发窗口已至,推荐优先级最高。 具身/人形机器人工业场景(中成熟度×高市场空间) :工业制造环境结构化、任务明确,最先落地。特斯拉Optimus已于2026年第二季度启动量产。 世界模型(低成熟度×高市场空间) :生成式与表征式两条路线并行发展,技术路线尚未收敛,但将是物理AI的核心基础设施。 VLA模型与数据飞轮(中成熟度×中高市场空间) :机器人侧主线,高质量交互数据稀缺,数据采集和模型训练服务存在机会。多角色行动建议: 车企:加速端到端智驾和Robotaxi布局,关注成本可控的纯视觉路线与安全冗余的混合架构平衡。 机器人厂商:聚焦工业场景率先落地,建立“遥操作—训练VLA—部署—真实反馈”的数据飞轮。 投资者:短期关注自动驾驶/Robotaxi商业化落地,中期关注人形机器人量产和世界模型技术路线收敛。 政策制定者:推动物理AI测试标准和数据合规体系建设,支持规模化运营。(数据来源:东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》)。延伸阅读。以上为报告核心趋势分析,如需获取完整报告详细数据及全部案例,请访问下载页下载完整PDF报告。FAQ。Q1:数字AI与物理AI的核心区别是什么?两类AI最根本差异体现在部署形态和安全约束。数字AI主要面向文本、代码、知识和软件状态,高度依赖云端联网和重运营;物理AI面向车辆、机器人和真实空间,必须在端侧自主、安全攸关和实时反馈条件下运行。Q2:物理AI的两大支柱是什么?物理AI主要由两条落地主线构成:1)自动驾驶,包括端到端智驾与Robotaxi;2)具身/人形机器人。二者共享端侧实时推理与云端训练的架构约束。Q3:世界模型的生成式路径和表征式路径有何不同?生成式路径以Sora、Cosmos为代表,训练目标要求将潜在表示解码还原为可观测画面,可服务合成数据和仿真;表征式路径以杨立昆JEPA为代表,主张在抽象表征空间预测且不重建像素,专注规划与控制。Q4:数字AI哪些场景已实现商业化闭环?编程AI Coding落地最扎实,头部产品年化收入达数十亿至百亿美元量级;企业级与Agent是商业变现主战场;营销与内容生成借道大厂既有产品变现,Meta AI广告工具年化收入已超600亿美元。Q5:物理AI商业化进展如何?自动驾驶/Robotaxi已进入区域收费运营阶段,Waymo、百度萝卜快跑等已披露订单和收入数据;人形/具身机器人仍处于发展初期,工业场景最先落地,家庭场景尚不成熟。Q6:中美在物理AI领域各自优势在哪里?美国在Waymo无人驾驶里程、具身基础模型和资本投入上领先;中国在规模化运营、供应链、硬件成本和部分应用落地上具备优势。数据来源说明。本报告内容基于东吴证券《汽车行业深度报告:AI系列深度03期:数字AI与物理AI的边界在哪里?》(2026年7月28日发布,证券分析师黄细里,执业证书S0600520010001)整理。报告基于分析师认为可靠且已公开的信息,但不保证信息的准确性和完整性。
word格式文档无特别注明外均可编辑修改,预览文件经过压缩,下载原文更清晰!
三个皮匠报告文库所有资源均是客户上传分享,仅供网友学习交流,未经上传用户书面授权,请勿作商用。
客服
商务合作
小程序
服务号
折叠