━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Physical AI
今日要点
· 波士顿动力在现代佐治亚工厂开出 Atlas 训练中心,人形机器人开始在真实汽车产线上练零件排序
· Cognex 以 5 亿美元现金收购 RealSense,计入留任激励后总对价约 6 亿美元
· 特斯拉 Austin 近 7 天实际载客的 Robotaxi 回落到 8 辆,州注册的 Cybercab 却增至 67 辆
· Google 旗下 Intrinsic 以 Apache 2.0 许可开源 Intrinsic Core 的控制、运动规划与仿真模块
· GPT-6 Astra 直接当机器人策略,在 RoboDojo 42 项任务上平均成功率 22.48%,排在 40 个公开策略之上
▎ 论文进展
RoboDawn:不用机器人数据训练,让 VLM 直接闭环控制机械臂 · vla
今天社区热度最高的一篇论文来自这项研究(HF 96↑)。作者将机器人控制拆解为一组离散的平移、旋转和夹爪指令,让 agentic VLM 看图、推理、执行,并根据反馈结果不断调整,整个过程不需要针对特定任务训练机器人。在 RoboTwin 2.0 C2R 上,该方法零样本成功率达到 53.2%;如果加入一条上下文示范,成功率会升到 73.6%,超过 π0.5 的 46.0%。研究团队还在 Franka 真机上验证了放方块进篮子和叠方块两项任务,均已跑通。[1]
GPT-6 Astra 在 RoboDojo 上的首份系统评测 · vla
上周刚有 RoboHarm 与 YAM 双臂测试问世,这篇论文接着把"直接用 LLM 当策略"这一思路放到完整榜单上做检验。研究者让 GPT-6 Astra 在 RoboDojo 全部 42 项任务上跑了 2100 次试验,得到平均成功率 22.48%,排名超过全部 40 个公开策略。相比之下,用同样的后处理方式,GPT-5.5 的成功率只有 0.88%。GPT-6 Astra 的能力表现出明显的两极分化:在语义理解类任务上泛化能力较强,但遇到需要高精度、动态控制或复杂双臂协调的任务时表现较差,即便给出一次示范,整体能力也没有提升。[2]
Grounded Action Model:以 3D grounding 为底座的机器人基础模型 · vla
现有 VLA 和世界动作模型所用的预训练骨干网络,通常不会强制模型学习"目标物体在哪里、有多大",这篇论文则把度量几何放在了模型的最前端(HF 18↑)。具体做法是,先把语言、点或框提示转换成以物体为中心的表示,再结合状态历史一起预测动作块。测试结果显示,在 LIBERO-PRO 的 16 种扰动条件下,该方法平均成功率达到 61%,而 π0.5 只有 53%。在双臂 YAM 真机实验中,当遇到视觉偏移时,该方法成功了 17/20 次,π0.5 仅成功 4/20 次。[3]
CARE:从真实失败里学纠错的 VLA 执行框架 · manipulation
以往纠错数据大多依靠人为设计扰动来生成,CARE 则改为直接收集策略在真实运行中失败的轨迹,按任务所处阶段统计失败后的偏移分布,再据此合成失败状态和相应的纠正示范(HF 10↑)。实验表明,这种方法在多个 VLA 骨干网络上都能起作用:仿真环境下平均成功率提升了 14.5 个百分点,双臂真机上的提升幅度更是达到 15.9 个百分点。研究团队已经公开了代码、模型和数据,同时还附带发布了一个专门评测失败恢复能力的数据集 FSR-Bench。[4]
EgoWild2Dex:用家庭、工厂、药房里的第一视角视频教灵巧手 · manipulation
以往采集人类视频数据大多要在特意搭建的场景中进行,这项研究反其道而行之,让人佩戴头戴相机记录日常工作过程,由此积累出时长达 538.9 小时的 EgoWild 数据集,共计 179,049 段视频,覆盖 1,282 类物体。为配合这批数据,作者提出了一套方法,用来对齐晃动的人眼视角和机器人观测视角。在三项长程双臂灵巧任务的真机测试中,平均成功率达到 96.7%,物体级零样本成功率为 33.3%。作者表示,数据、模型和代码后续都会公开。[5]
RAPolicy:1-2 小时真机在线后训练 VLA · vla
该方法让采样和学习两个过程异步并行进行,同时把 critic 和 actor 的更新都锚定在回放数据上,从而降低对覆盖范围以外动作价值的依赖。训练时,每个任务只需 10 条示范作为起步,在线训练时间为 1-2 小时。结果显示,四个单任务的平均成功率达到 86.3%,而在五任务联合设置下,成功率从 52% 提升到 88%,同时所需的人工干预也相应减少。[6]
动作写成绝对值还是增量,世界模型就会给出两种答案 · world-model
研究发现,同一条指令轨迹,如果分别写成绝对关节目标或相对增量两种形式,那么只在其中一种写法上训练出来的 latent 动力学模型,在另一种写法上就会失效:三个机器人数据集上的检索性能因此下降 2.6 到 13.4 倍,目标条件动作选择的准确率也从 53% 跌至 15%。值得注意的是,这两种编码方式其实可以互相重建(R² 达到 0.996),说明信息本身并没有丢失,问题出在动作通道从来没有被仔细审查过。针对这一问题,作者提出的修复方案是,在两种编码上平均训练目标,再加入一项分歧惩罚项来兼顾最坏情况。[7]
Uranus:用自回归扩散模型替代手工搭建的机器人仿真器 · world-model
只需输入未来的关节位置轨迹,该模型就能逐步生成多视角画面,且不设固定时长上限;经过推理优化后,生成速度达到 24 FPS,并且支持多种机器人本体和相机配置。目前代码和权重均已公开,论文中也专门列出了当前方法存在的局限性。[8]
其他今日论文:CHOREO(把人形机器人的各类技能统一成可执行轨迹,免训练拼接,130 个多动作任务序列成功率 95.4%,[9]);GLIDE(让模型自己写防护规则,辅助采集人类难以示范的任务数据,采集成功率从 0-10% 提到 70-90%,[10]);What Matters in Designing World Action Models(系统对比 6 种因果结构、8 种隐空间、4 种训练目标,[11]);SmoLSTM(用循环状态给小型 VLA 加持久记忆,[12]);VT-Bridge(轻量残差适配,把现成 VLA 扩展成视触觉 VTLA,[13]);LIBERO-VPro(机器人基础模型闭环视觉鲁棒性评测,[14]);FoldQuantVLA(VLA 原生低比特量化,[15]);Think Like a World Model, Act Like a VLA(把世界模型表示蒸馏进小策略,HF 3↑,[16])
开源·工具·评测
· Intrinsic Core:Google 旗下 Intrinsic 宣布以 Apache 2.0 许可开源其工业机器人平台的底层 Intrinsic Core,其中包含控制、运动规划和仿真软件,并且兼容 ROS,目前已经在真实部署中投入使用。Intrinsic 当初从 Alphabet 的登月工厂项目独立出来,五年后又并入 Google,如今正与 Google DeepMind、Google Cloud 展开合作,该平台还接入了 Gemini 模型。Forbes 将此举形容为 Google 正在免费送出一套"机器人领域的 Android"。 [17]
· NVIDIA Isaac ROS 5.0:这一版本把机器人专用知识打包成 skills,人类工程师和 AI 编程代理都可以直接调用,同时新增了 FoundationStereo 微调、速度更快的 FoundationPose 物体跟踪以及独立抓放功能;系统支持 ROS Lyrical 与 Ubuntu 24.04,算力覆盖范围从 Jetson Orin Nano 到 Jetson Thor,且完全免费开源。 [18]
· Light-O1-Preview:亮源新创(Light Origins)以 Apache 2.0 许可发布了一款参数规模约 60 亿的全身动作模型。用户输入文本指令后,模型会输出每秒 20 帧的全身动作序列,每帧包含 138 维数据,涉及 22 个关节。该模型先用从互联网视频中恢复出来的人类动作做预训练,目前已经在自家的 LightBot 和宇树 G1 上进行了演示。 [19]
▎ 融资与交易
Cognex × RealSense | 收购 | 5 亿美元现金 | 总对价约 6 亿美元 · hardware
机器视觉厂商 Cognex 将用自有现金收购深度相机公司 RealSense,基础价格为 5 亿美元,交割预计在第四季度完成。以色列 Globes 报道中提到的"超 6 亿美元"这一说法,其实包含了两部分额外支出:一项为期三年的现金留任计划涉及 5650 万美元,另外还有约 5000 万美元的限制性股份。RealSense 两年前才从 Intel 拆分出来,当时季度营收仅有 700 万至 800 万美元;而 Cognex 预计,到 2026 年该公司营收会达到 8000 万至 9000 万美元,同比增幅超过 50%。Intel 目前仍持有 20% 的股份,这部分股份将随本次交易一并退出。[20]
陈龙新公司(前小米 XLA 负责人)| 已获融资 | 金额未披露 · world-model ⚠️ 单方口径
陈龙此前在小米负责汽车智驾基座模型和 XLA 大模型的相关工作,如今他前往硅谷创业,担任联合创始人,搭档是一位前 Google DeepMind 科学家,两人共同开发具身大模型。据 21财经报道,该项目已经获得融资,并已经有商业化合作在推进。一位投资人透露,陈龙想做的是一个能够"自进化"的具身大脑,而不是单纯依靠堆积数据或者改变训练方式去追求规模法则的效果。雷军也对他的创业表示了支持。目前,小米智驾团队已经引入了多位来自地平线的高管,接替陈龙以及前 L3 负责人王乃岩留下的工作。[21]
先途起源 | 种子轮 | 数千万元 · embodied
本轮融资由啟赋资本领投。这家公司今年 6 月才注册成立,核心团队来自国防科技大学机器人实验室——中国第一台仿人机器人"先行者"正是出自该实验室,公司定位是在工业现场承担精细操作类的具身任务执行工作。[22]
欢创科技(Camsense)| 港交所 IPO 招股 | 约 7800 万美元 · hardware ⚠️ 单方口径
这家扫地机器人传感器零部件商在 9 月 13 日通过聆讯之后,随即启动了招股。[23]
▎ 商业化落地与部署
Atlas 进驻现代佐治亚工厂,开始在真实产线上练零件排序 · humanoid
波士顿动力已在现代汽车集团位于美国的 HMGMA 工厂内开设 Robotics Metaplant Application Center(RMAC)。这座工厂坐落在萨凡纳附近,主要生产 Ioniq 5、Ioniq 9 等电动和混动车型。Atlas 在这里承担的是总装前的零件物流和排序任务,也就是按照装配顺序把各类零件摆放整齐。明年,训练中心将搬进新建的大楼,面积会扩大约 10 倍,同时也会开始探索汽车行业以外的应用场景。现代的目标是在未来几年内,向现代和起亚在全球的工厂投放共计 2.5 万台 Atlas。不过就目前而言,这仍处在训练和测试阶段,距离节拍稳定的量产作业还有不小的距离。[24]
特斯拉 Austin 实际载客车队回落到 8 辆 · autonomy ⚠️ 汇编口径
据 Electrek 援引社区追踪站 Robotaxi Tracker 的数据,过去 7 天里,在 Austin 被观察到实际载客的特斯拉 Robotaxi 只有 8 辆,这一数字已经接近 2025 年 6 月刚开服时的水平。此前在 9 月 3 日 Cybercab 发布活动前后,该数字曾一度冲高至超过 100 辆,而今年大部分时间里都维持在 20 到 40 辆之间。与此同时,特斯拉又向得州车管部门新登记了 28 辆自动驾驶车辆,使该州注册总数达到 476 辆,其中包括 67 辆 Cybercab 和 409 辆 Model Y。需要指出的是,注册数量并不等同于实际载客数量,而这两组数据之间的差距正在持续拉大。[25]
LS Electric 两台 Spot 转为常规巡检 · industrial
这两台 Boston Dynamics 出品的 Spot 部署在 LS Electric 的釜山工厂——也就是该公司特高压变压器的主要生产基地。今年 7 月起,Spot 先与现代 AutoEver 进行了约两个月的试运行,之后才正式投入使用。它的工作是利用热成像技术,以非接触方式检查气相干燥室门封是否存在漏热问题,同时还会采集泵、电机和控制柜的热、噪声与振动数据,用来提前预警设备故障。LS Electric 计划以这些数据为基础训练 AI 分析模型,之后再将其推广到国内外的其他工厂。[26]
广东已有超 2000 台人形机器人进厂 · humanoid
在广东第二届人工智能应用大会的"AI+制造"专场上,共签下了 8 个具身机器人规模化应用项目,总投资达 7500 万元,应用场景涵盖产线、图书馆、地铁、社区和体育场馆等多个领域。会上还披露,广东制造企业目前部署的人形机器人数量已经超过 2000 台,预计全年将突破 3000 台。[27]
Aurora 定下 2028 年自由现金流转正目标 · autonomy ⚠️ 计划口径
Aurora 目前已有 20 辆无人驾驶重卡在公共道路上运营,行驶路线覆盖休斯敦至达拉斯、沃斯堡至埃尔帕索两条线路,公司目标是到年底把车队规模扩大到 200 辆。该公司创始人兼 CEO 在接受 CNBC 采访时表示,依靠车队规模的扩张,公司预计能在 2028 年实现自由现金流转正。作为对照,Aurora 在 2025 年的亏损已超过 8 亿美元。[28]
小鹏第二代 VLA 新版本开始推送 · autonomy ⚠️ 厂商口径
XOS 6.3.0 已于 9 月 22 日启动推送,蒸馏版 VLA Lite 率先在 G9L Max 上搭载,同时也覆盖了 MONA L03、GX、G7、P7 以及 2026 款 M03、G6、G9、P7+、X9 等多款车型。[29]
▎ 产业动态
小鹏机器人完成审厂和核心零部件定点,供应商与特斯拉高度重合 · humanoid
9 月 22 日,小鹏集团举办了首届机器人供应链合作伙伴大会,来自执行器、灵巧手、传感器、AI 晶片等领域的供应商悉数到场。据澎湃报道,小鹏机器人目前已经完成了供应链审厂和核心零部件定点工作,技术路线、产品形态和量产节奏也都已经明确下来。值得一提的是,就在上周,特斯拉工程师刚刚来中国审计过 Optimus 的供应商;据消息人士透露,两家公司在核心供应商层面"存在较高的重合度"。[30]
奔驰签约 Wayve,约两年内把 AI Driver 装进量产车 · autonomy
梅赛德斯-奔驰已与英国公司 Wayve 签署了一份多年期协议,双方将基于奔驰的 MB.OS 架构,力争在约两年内把 Wayve 的端到端自动驾驶系统集成进奔驰未来的车型当中。此前,奔驰已经参与过 Wayve 的 D 轮融资。[31]
Figure Helix 2.5:30 户陌生家庭零样本做家务,成功率 56% · embodied ⚠️ 厂商口径
Figure 03 被派往湾区 30 户此前从未去过的家庭中完成三项家务任务,其中包括把散落的玩具收进篮子,整个过程没有进行任何现场微调,最终成功率达到 56%。在任务数据、架构和评测方式都保持不变的情况下,仅仅是在人类行为数据 Index 上做了预训练,零样本成功率就从 9% 提升到了 56%。Figure 方面宣称,每当预训练数据翻倍,损失下降的曲线就变得足够平滑,可以据此提前预测,公司也因此认为自己找到了机器人领域的 scaling law。不过换个角度看,近一半的尝试其实仍然是失败的。[32]
2025 年全球人形机器人销量:IDC 称 1.8 万台,IFR 称约 7000 台 · adjacent
据 TechJuice 援引 IDC 的数据,2025 年全球人形机器人出货量达到 1.8 万台,同比增长 508%,其中中国厂商占据九成份额。而昨天 IFR 给出的数字则约为 7000 台,其统计范围仅限于工业和专业服务用途。两家机构在计数口径上存在差异,导致两个数字之间相差超过一倍。[33]
爱普生三年投 2800 亿日元押注机器人和精密业务 · industrial ⚠️ 计划口径
精工爱普生社长吉田潤吉在首尔宣布,公司未来三年将投资 2800 亿日元(约合 2.4 万亿韩元),这一数字相当于去年 1.4 万亿日元营收的 20%,投资重点将放在工业机器人和精密元件领域。公司希望到 2035 年,把新业务营收在总营收中的占比从去年的 33% 提升到 50%。同一天,爱普生也推出了自己首款协作机器人。[34]
具身数据集质量行标 11 月 1 日施行 · adjacent
这项名为 YD/T 6771-2026 的行业标准由中国信通院牵头、联合 40 多家单位共同起草,从完整性、一致性、多样性、真实性和安全性等几个维度对具身数据集的质量进行评估。截至 6 月底,全国已经投入使用的具身智能训练场超过 70 个,另外还有 40 多个正在建设或处于规划阶段。[35]
长三角前 8 个月出口四类重点机器人 160 亿元 · industrial
手术机器人等四类重点机器人的出口额同比增长达到 3 倍。[36]
硬件·供应链
· 宇树 Dex5-S 灵巧手:这款灵巧手拥有 22 个自由度,相比上一代在小指部位多加了一个侧摆自由度;尺寸与真人手基本一致,比例为 1:1(102×187×26 毫米),重量约为 620 克;单手最大负载可达 2 千克,持续负载为 1 千克;售价 3.99 万元起,其中 Pro 版本还增加了触觉感知功能。 [37]
· Maxon EC i 70:这是一款 800W 无刷电机,面向对成本较为敏感的大功率应用场景。 [38]
· Aeonsemi Praxium:一款面向 physical AI 领域的多千兆以太网 PHY 晶片。 [39]
· 芯驰科技 × APAQI Robotics:双方将合作开发面向具身机器人的计算与控制平台。 [40]
文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻