━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Physical AI

今日要点

· 工信部等九部门印发智能网联新能源汽车"十五五"规划,2030 年具备自动驾驶功能的汽车实现规模应用

· Skild AI 首次商用部署 10 个月,年化收入跑到 1 亿美元

· 发那科与谷歌的 AI 焊接智能体用平板扫图纸就能焊,12 月开始出货

· 优必选拿下 超 5000 万元海外订单,买家在欧洲、🇯🇵和韩国

· 埃斯顿 4.87 亿元收购埃斯顿酷卓完成并表,原股东承诺四年营收累计不低于 6.2 亿元

· HuRo 用"机器人化"的人类视频做预训练,真机任务完成率从 51.5% 抬到 80.3%

▎ 论文进展

HuRo:把人类视频改造成机器人数据,给 VLA 做预训练 · vla

作者把五个人类视频源转换加工,做成了约 63 万条与机器人对齐的 episode,总共 1.42 亿帧,这个数据集就叫 HuRo。他们想验证的问题是,这种"机器人化"处理过的人类视频,到底能不能撑起 VLA 的预训练,而且规模越大效果是不是越好。结果在四项真机任务上,随着预训练规模的扩大,整体完成率从 51.5% 一路提升到了 80.3%;即便是空间和视觉条件发生变化、属于分布外的场景,完成率也从 34.9% 升到了 72.2%。目前代码和数据都已经公开。[1]

IMLE-VLA:单步生成动作,π0.5 推理频率提到 55 Hz · vla

π0.5 原本用的是 flow matching 动作头,每走一步都要经过 10 次 Euler 采样,所以机器人动起来总是一顿一顿的。IMLE-VLA 的做法是换掉这个模块,改用条件隐式最大似然(cIMLE)训练出来的单步生成器,这样一来推理频率就从原来的 15 Hz 一下子提升到了 55 Hz。在 LIBERO 的 40 项任务测试中,平均成功率达到了 98.0%,而在 Franka 真机的四项任务上,也全面超过了 π0.5。[2]

MaP-WAM:把记忆放到规划端,执行器上下文长度固定 · world-model

HF↑7。做长程操作离不开记忆能力,常见的解决办法是把整段历史统统喂给执行器。而 MaP-WAM 换了个思路,它把已经完成的片段压缩成"下一步该做什么"的语言计划和视觉提示,让执行器只需要关注当前这一步的计划就够了。这套方法在 RMBench 上跑出了 83.3% 的成功率,真机测试也有 78.0%,而且即便历史变得更长,推理延迟也基本没有变化。[3]

2AM:记忆交给 Agent,动作模型只管执行 · vla

在 LIBERO-Mem 这个测试集上,此前表现最好的基线模型平均完成率也只有 14.8%,而 2AM 却做到了 76.3%,而且完全不依赖深度信息、在线几何或者规划器。它的思路是让一个多模态 Agent 单独负责任务记忆,由它把交互历史编译成子任务语言以及 2D 抓放提示,然后交给一个只看 RGB、不带状态的动作模型去执行。不过严格意义上的成功率依然只有 11.8%。[4]

ReactHuman:多模态大模型当人形大脑,突发险情约三次错一次 · benchmark

盘子突然滑落、刀具意外掉地这类突发险情,考验的是机器人能不能当场做出反应。为此,ReactHuman 用 240 Hz 的刚体仿真搭建了一个测试环境,涵盖 17 类事件、1000 多个可以逐位复现的场景,其中还特意放进了一些外观和实际物理属性相反的物体,比如看着像铁砧其实是泡沫做的、看着像苹果其实是钢做的。结果七个受测的 MLLM 大模型,大约每处理三次险情就会出错一次,而且这个错误率并不会随着模型规模变大而降低。目前数据集已经上传到 Hugging Face。[5]

笔记本 CPU 上 18 秒起步,仿人灵巧手握笔写字 · manipulation

只需要大约 18 秒的初始化时间,一只仿人灵巧手就能单靠手内的细微动作握笔写字,平面精度平均能控制在 0.6 mm。实现方式是在真机运行的过程中实时估计手和笔这个组合系统的任务雅可比矩阵,并在线做出修正,整个过程不需要接触模型,也不用仿真训练或者示范数据打底。作者表示,这是仿人手第一次仅凭手内动作就写出了任意的单笔轨迹。[6]

FARM:从冻结的世界模型状态里读出失败信号 · world-model

这套方法其实只训练了一个小小的读出头,参数量仅有 33,985 个,挂载在冻结的 VLA-JEPA 预测状态上,逐步输出失败分数。在七个源任务上,池化后的 AUROC 达到了 85.68,而且这套方法还成功迁移到了 PIPER X、SO-101、Franka 这三种不同的真机平台上。一旦拿到了冻结状态,额外增加的延迟只有大约 0.23 毫秒而已。[7]

ActSafeGuard:把硬约束写进 flow matching 策略的训练 · vla

VLA 生成出来的动作有时会突破物理层面的硬约束,而现有的解决办法大多是在推理阶段外挂一层修正机制。ActSafeGuard 则不同,它在训练阶段就把可行性约束做成了一个可微分的层,让训练和执行共用同一套约束标准。结果在 π0.5 与 Fast-WAM 这两种不同的骨干网络上,逐步安全率都达到了 100%,同时任务成功率也没有因此下降。[8]

其他今日论文:SEED-UMI(让人和机器人穿上同一套外骨骼来采集灵巧操作示范,采集效率是外骨骼遥操作方式的 3 倍,[9]);CAP(一种即便深度感知时好时坏也能保持稳定行走的人形运动策略,已在宇树 G1 上得到验证,[10]);GRADE(在烟雾环境中结合毫米波雷达和生成先验来估计稠密深度,烟雾条件下 MAE 为 0.313 m,[11]);UniMPA(把记忆、未来预测和动作统一放进一个 VLA 框架里,[12]);EgoGenEval(用来评测视觉生成模型在相机自身运动情况下的物理一致性,测试了 16 个模型,结果没有一个能同时在两个维度上达标,[13]);ORCH(借用组织理论来编排最多 50 个异构智能体,让野火救援任务的得分平均提升了 63.97%,[14]);有研究用形式化验证的方法检验端到端转向网络在从未见过的天气条件下会表现如何([15]);SwarmNxt(一套开源的高速无人机集群软硬件平台,[16]);还有 Galaxea R1 Pro 轮式人形机器人的人体动作重定向流水线([17]

开源·工具·评测

· Puffin-World:大晓机器人和南洋理工大学 S-Lab 联手开源了一个统一的多模态世界模型,把物理、几何、外观这三种三维世界状态统统纳入同一个框架当中。这次代码、模型连同 Puffin-16M 数据集一并放出,数据集里包含了 1500 万组视觉-语言-相机三元组。团队方面表示,在 Stanford2D3D 等四项公开基准测试中取得了 SOTA 的成绩 [18]

· π0 微调教程:AWS 发布了一份教程,教大家在 SageMaker HyperPod EKS 上微调 π0 来完成机械臂操作 [19]

▎ 融资与交易

Motive(美国)| 增长融资 | 超 13 亿美元 | 估值未披露 · adjacent

General Catalyst 旗下的 Customer Value Fund 这次出资超过了 13 亿美元。拿到这笔钱之后,Motive 撤回了 S-1 文件,原本打算以代码"MTVE"登陆纽交所的计划也就此搁置。这家公司做的是车队远程信息系统、AI 行车记录仪以及维保管理,此前一次公开估值是在 2022 年,当时是 28.5 亿美元。创始人 Shoaib Makani 表示:"我们在为实体经济搭建智能层。"值得一提的是,它的直接对手 Samsara 已经上市,估值大约在 200 亿美元,ARR 超过了 10 亿美元。[20]

超维动力(Kinetix AI)| 天使+轮系列 | 超 5 亿元 · humanoid

这轮融资由淡马锡旗下的祥峰资本加注领投,方广资本、万石资本等机构也跟进参与。公司成立于 2025 年 9 月,创始团队来自HW自动驾驶和香港大学。旗下产品包括全尺寸人形本体 KAI Bot,全身有 117 个自由度,接近八成的体表都覆盖了触觉皮肤,触点数量大约有 1.8 万个;此外还有一款 37 自由度的灵巧手,以及第一视角数采头环。公司方面称,目前已经积累了超过 10 万小时的第一视角视频,而且乒乓系统的同一套算法已经成功迁移到了宇树 G1 和智元远征 A3 上。[21]

Aidin Robotics(韩国)| 战略投资 | HD 现代机器人 130 亿韩元 · hardware

Aidin 主要做六维力/力矩传感器,产品出口到德国、法国、中国、🇯🇵等 10 个国家。这次双方将联手开发一款专用于造船与重工领域的五指灵巧手,并将其装在 HD 现代的人形机器人上;另外,双方还打算从船厂业务起步,合作开展打磨、抛光等表面处理自动化,之后再瞄准美国船厂市场。同一天,三星创投也另外投了 30 亿韩元,但按被投方的要求,具体持股比例未予披露。[22]

Swarmer(NASDAQ: SWMR)收购 Ratel Robotics | 现金+股份 | 至多 2.24 亿美元 · adjacent

Swarmer 的主业本来是无人机集群协同软件,这次它买下了🇺🇦无人地面车(UGV)制造商 Ratel,业务也因此从空中延伸到了地面。Ratel 今年已经签下了 8600 万美元的合同,这些车辆被用于战场物流、伤员后送、侦察、无人机发射和排雷等场景。2.24 亿美元是所有对赌里程碑都达成时的上限金额,这笔交易预计将在 2026 年四季度完成交割。[23]

魔芯科技 | 新一轮(即将完成)| 或达 10 亿元 | 估值近 100 亿元 · world-model ⚠️ 传闻口径

这已经是魔芯今年的第五轮融资了,距离上一轮 5 亿元级别的融资披露大概只过了 20 天,而上一轮融资之后的估值就已经接近 40 亿元。这家公司最早是靠消费级 3D 打印起家的,2024 年底才转型做世界模型,今年 7 月发布了参数量 28B 的 MoE 模型 MoWorld,宣称能以 50 帧/秒的速度实时生成 3D 场景,而且全程都跑在昇腾 NPU 上。[24]

西湖机器人 | A1 轮 | 数亿元 · embodied

这家公司是由西湖大学孵化出来的,此前的 Pre-A++ 轮融资是由河南国资资本独家投资完成的。[25]

▎ 商业化落地与部署

Skild AI 首次商用 10 个月,年化收入达 1 亿美元 · world-model

这个 1 亿美元其实是 run rate,也就是按近期收入折算出来的年化数字,是公司自己向彭博披露的。Skild 的机器人基础模型目前已经被超过 60 家公司使用,跑在数百台机器人上——要知道今年早些时候,这个数字还只有 8 台。客户当中既有🇯🇵的咖啡店,也有美国的仓库。联合创始人兼 CEO Deepak Pathak 说,这意味着机器人"从 demo 时代走进了部署时代"。上个月发布的 S1 模型靠的是 in-context learning,也就是不改权重、只看一段示范就能照做,只要看一段人类视频,它就能学会长达 10 分钟以上的多步流程。不过公司并没有公布客户名单,所以这个年化数字暂时还没办法和部署台数对上账。[26]

优必选拿下超 5000 万元海外订单 · humanoid

这批订单涉及商用服务人形 Walker C1 以及超仿真人形 UWorld U1,买家分布在欧洲、🇯🇵和韩国。今年上半年,公司已经卖出了 921 台全尺寸人形机器人(此前已报道)。在韩国方面,合作方 Deoksan JMR 与汽车零部件商 AJIN Industrial 签下了合约,原计划从 8 月起在 AJIN 的工厂里验证 Cruzr Y1 和 Walker S2。[27]

新石器 L4 无人配送车在东京开测 · autonomy

这次测试是在平和岛的东京流通中心(TRC)进行的,属于封闭场地的实证测试。首批车辆是 8 月 31 日运抵的,之后会分批增加到 10 台,车型包括载重 520 公斤的 Xolra3,以及载重 1000 至 1130 公斤的 Xolra6。TRC 是全天运营的,每天进出的卡车数量超过 1 万辆。公司方面称,目前已经在全球部署了大约 2.7 万台配送车。[28]

Comau 在迪卡侬电商仓测试协作机器人拣选码垛 · industrial

这套方案由 MyCo 协作机器人、ROS2 软件和模块化夹爪三部分组成,能够自主完成拣选、搬运和码垛的整个流程。这是欧盟 MASTERLY 项目的一部分,目前还处在测试验证阶段,公司方面没有公布具体的部署规模。[29]

▎ 产业动态

九部门印发智能网联新能源汽车"十五五"规划,2030 年自动驾驶规模应用 · autonomy

工信部联合发改委、公安部、交通运输部等九个部门,一起印发了《智能网联新能源汽车产业发展"十五五"规划》。规划里面对 2030 年提出的总体目标明确写道,具备自动驾驶功能的汽车要实现规模化应用;而在高速公路、城市快速路以及部分城市道路等场景中,要实现高度自动驾驶——汽车之家把这一级别标注为 L4。规划还要求,搭载自动驾驶系统的车辆在安全性能上要大幅超过人类驾驶员。在同一组目标里,新能源乘用车和商用车的新车销量占比分别要达到 70% 和 40%。配套的落地措施包括 5 方面 17 项重点任务、4 个重大工程和 3 个重点行动,其中就有"人工智能+汽车"发展行动,以及一个高价值自动驾驶通用场景库。就在一周前,道交法修订草案才刚刚为自动驾驶单独列出一章(此前已报道),可以说产业目标和法律责任在同一个月里各自向前迈出了一步。[30]

发那科与谷歌推出读图纸的 AI 焊接智能体,12 月出货 · industrial

只要用平板扫描一下纸质图纸,系统就能自动读出焊接位置,以及电压、电流、速度这些具体要求,然后交给发那科的协作机械臂自主完成电弧焊作业,就连图纸上手写的批注它也能识别出来。这套系统底层用的是谷歌的 Gemini Enterprise,工人不需要编程,有需要的时候也可以随时介入进行调整。产品预计 12 月出货,采用订阅收费模式,具体价格还没有公布,主要面向电气元件、家具等行业的中小企业。开发方表示,这是全球首个同类系统。[31]

埃斯顿 4.87 亿元把埃斯顿酷卓收进报表 · industrial

9 月 7 日晚间的公告显示,埃斯顿通过两家全资子公司完成了对埃斯顿酷卓 100% 股权的收购,交易总额是 4.87 亿元。这个标的原本是由埃斯顿的控股股东派雷斯特持有的,主营业务涵盖协作机器人、具身智能机器人以及相关核心部件。酷卓 2025 年的营收是 5016.79 万元,净亏损达到了 5299.85 万元。原股东方面承诺,从 2026 年 5 月到 2029 年 12 月这段时间,累计营收不低于 6.2 亿元,其中 2027 年这一年不低于 1.2 亿元,相当于 2025 年的 2.4 倍。至于人形业务的收入,公告并没有单独列出,埃斯顿证劵部的工作人员表示这部分占比较小。[32]

外滩大会具身论坛:卡点是算力还是数据,嘉宾看法不一 · embodied

至简动力联合创始人兼 CEO 贾鹏认为,如果只看模型本身,具身智能其实已经展现出了一部分上下文学习能力;但如果要真正转化为生产力,他觉得"可能还需要三四年甚至四五年"的时间。在他看来,眼下最大的瓶颈是 GPU 算力,原因在于很多工厂根本无法联网,端侧算力一旦不足,就会直接限制模型的发挥。而大晓机器人创始人兼董事长王晓刚则把最大的卡点归结为数据问题,他说:"如果始终需要针对新的任务重新训练,就没有办法实现规模化推广。"至于业内的泡沫论争议,贾鹏的解释是阶段和估值出现了错配,王晓刚的说法则是"我们处在黎明的前期"。[33]

Teradyne 在欧洲统一专利法院起诉节卡,涉及 3 项 UR 专利 · industrial

Universal Robots 的母公司 Teradyne Robotics 在 8 月 24 日向统一专利法院(UPC)哥本哈根地方分庭提起了针对节卡德国子公司的诉讼。涉案的三项专利分别涉及机器人接口、安全制动器和关节,优先权日都追溯到了 2006 年 3 月。这一判决可以在 UPC 的 17 个成员国生效,同时英国和西班牙也被纳入了诉讼范围之内。节卡方面已经向法院申请了禁令,并表示 Teradyne 对这起案件的公开表述"虚假、误导、有损害",同时援引此前两份自由实施(FTO)分析报告,称这两份分析都没有发现任何侵权行为。[34]

京东启动"物理 AI 加速计划" · adjacent

京东集团技术委员会主席、京东云总裁曹鹏在 9 月 9 日举行的 JDD 大会上表示,大量相关技术的落地"仍停留在演示级阶段"。按照这项计划,京东打算在两年内采集超过 1000 万小时的真实场景人类视频;而京东物流则计划在五年内采购 300 万台机器人、100 万台无人车以及 10 万架无人机。⚠️ 计划口径[35]

百度设立韩国法人,萝卜快跑跟进 Waymo · autonomy

百度早在 4 月 30 日就已经在首尔江南区注册了"Baidu Apollo Korea",由负责萝卜快跑海外业务的副总裁 Yang Nan 担任董事,经营范围涵盖自动驾驶研发、网约车服务以及高精地图数据。而 Waymo 也在 7 月刚刚在韩国设立了法人。截至二季度,萝卜快跑在中国以外的运营城市已经达到了 28 座[36]

特斯拉在🇯🇵展出 Cybercab · autonomy

特斯拉🇯🇵负责人表示,"如果时机合适",公司希望能在🇯🇵推出自动驾驶出租车业务,不过第一步会先在现有车型上推出高阶辅助驾驶功能。本周,Cybercab 已经在🇯🇵亮相。[37]

银河通用回应邵天兰:不参与口水战 · embodied

在梅卡曼德 CEO 邵天兰点名之后(此前已报道),银河通用于 9 月 10 日晚间发表声明称:"我们不参与无谓的口水战,不被短期噪音干扰。"不过这份声明并没有正面回应外界关于数采中心和关联交易收入的具体指控。[38]

硬件·供应链

· 丰立智能:公司在业绩说明会上表示,谐波、行星以及灵巧手关节小微减速器这三类产品都能适配人形机器人,目前已经具备批量交付的能力,同时还在用定增募投项目扩大产能 [39] ⚠️ 厂商口径

· 骏鼎达:今年上半年,腱绳及腱绳护套的销售收入还不到 100 万元;灵巧手手套防护材料这块目前仍处于研发阶段,尚未实现量产,也还没有签下正式合同 [40]

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻