━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Physical AI
今日要点
· 波士顿动力给 Atlas 换上 13 自由度四指手,舍掉小指,能用钻、电动扳手和焊枪
· 加州签署 SB 1246:Robotaxi 阻挡警察或消防超过 30 分钟,运营方要被罚款
· 启元 Q1、T1 10 月 1 日在上海、深圳、杭州交付首批
· RPG 框架不改模型权重,靠仿真练习把 22 项操作任务的成功率从 28.6% 提到 95.0%
· 彭博行业研究测算,小马智行、文远知行的车队利用率不及 Waymo,到 2028 年仍将亏损
▎ 论文进展
RPG:机器人在重建的仿真中自行练习,不更新权重 · manipulation
过去,编写技能、设计奖励和调整感知都得由人动手。RPG 把这几件事交给多模态 LLM 来做。它先从离线数据集中找出需要练习的操作能力,再在仿真里搭建对应的练习任务,随后根据失败诊断的结果新增或修改符号技能,同时改写 system prompt。研究者更换初始状态,对 22 项操作任务做了测试:成功率在第一轮练习后为 28.6%,练满 15 轮后升至 95.0%,超过 ASPIRE 的 75.5%,也超过由 GPT-6 Astra Pro 驱动的 CaP-Agent0 的 60.0%。系统冻结之后,在 30 次真机试验中全部成功。[1]
PyRUA-Lean:以 GPT-6 Astra 充当机器人 agent,token 用量减少 65% · vla
HF 13↑。这个 agent 把经典机器人原语和 VLA 策略写进 Python cell 里运行,cell 自带条件判断和局部重试,只有需要时才把图像传回。研究者在 LIBERO-PRO、RoboTwin 2.0、RoboCasa365 的 700 个仿真任务实例上做了测试。LLM 调用预算相同的情况下,成功率由 63.1% 提高到 71.7%。在两种 agent 都完成的实例中,LLM 调用次数少了 49%,输入 token 少了 65%。[2]
InterEvolve:在测试阶段进化奖励程序,使人形机器人完成未训练过的任务 · locomotion
HF 11↑。LLM agent 依据执行反馈改写分阶段的奖励程序,数值优化器负责调整其中的常数,之后交给一个带物体残差的 forward-backward 行为基础模型去执行,整个过程不需要重新训练。进化得到的技能已在 Unitree G1 真机上运行,靠机载的第一视角感知自主完成。[3]
Recova:把操作中的失败转化为可复用的恢复技能 · manipulation
研究者先在重建的数字孪生里同时训练任务执行和失败恢复。部署时,agent 会监控任务进度并调用恢复策略;遇到没有合适恢复手段的情况,就由人示范一次,这次示范随后也进入学习循环。他们用四个真机工位并行采集数据,经 DAgger 微调后,平均成功率从 23.8% 升到 77.5%,再加上恢复技能则达到 87.5%。其中一项任务经过四轮采集,人工干预的比例从 87.5% 降为 0。[4]
λ0:以 500 小时人类全身数据预训练人形 loco-manipulation · vla
团队借助轻量穿戴设备采集了 HumanVerse-500 数据集,时长 500 小时,其中第一视角视频与身体、手部动作是同步记录的。训练分为三个阶段:先用第一视角数据学习交互,再用 HumanVerse-500 学习身体与手的协调,最后适配到具体的机器人。λ0 在 SIMPLE 和 4 项真机任务上自称达到 SOTA,并承诺开放代码、模型和数据。[5]
ECoMEM:以显式的"概念记忆"弥补 VLA 的遗忘 · vla
物体一旦离开视野,VLA 往往就把它忘了。ECoMEM 先由 Writer 依据证据维护一张"概念"记录表,再由 Reader 把这些记录转换成 token,输入 VLA。在 RoboMME 的 16 项任务中,它有 15 项领先。在两项新增的真机任务上,它的成功率为 86.1%,而不带记忆的 VLA 只有 8.6%。论文作者中有 Stanford 的 Mac Schwager 和 Jiajun Wu。[6]
UniWAM:把推理器、世界生成器和动作预测器合并为一个模型 · world-model
UniWAM 将底层动作改写成自然语言,并用 VQA 数据、人类第一视角数据和机器人示范分别监督不同的组件。作者自称在多项评测中达到 SOTA,还报告说人类数据与机器人数据混合训练时存在 log-linear scaling law。[7]
MIKASA-Robo-VLA:以 90 项任务专门测试 VLA 的记忆 · benchmark
这 90 项任务中,有 80 项会把动作所依赖的线索藏起来,其余 10 项作为对照。有 28 项任务的信息空窗期,比受调查的固定上下文 VLA 里最宽的 16 帧窗口还要长。数据集包含 22,500 条轨迹,提供 RLDS 和 LeRobotDataset v3 两种格式。不使用历史帧的 π0.5 基线,平均成功率仅为 0.211。[8]
VLA 的思维链被纠正后,动作不一定随之变对 · autonomy
TRUST 是一个离线训练的价值模型,它根据思维链的前缀预测推理最终是否正确,并以此进行纠偏。在英伟达的驾驶 VLA Alpamayo 1.5 上,推理正确率从 75.9% 提高到 90.0%,困难子集上的碰撞率下降了 30.4%。换到操作类 VLA DeepThinkVLA 上,推理正确率同样提高了,但 LIBERO-Plus 的闭环成绩基本没有变化。[9]
Kinematic MeanFlow:让机器人基础模型一步生成动作 · vla
如果直接套用 MeanFlow,性能会明显崩溃。K-MF 的做法是把时间导数拆分到两个子区间,在多数设置下表现超过多步 flow matching。因此,GR00T-N1.6 动作头的延迟降低了 67.5%~74.4%,端到端延迟降低了 30.3%~54.9%。代码将公开在 IntelChina-AI 仓库。[10]
今日还有这些论文:World Motion Models,由 Berkeley 的 Trevor Darrell 和 Angjoo Kanazawa 署名,用稀疏 SE(3) 轨迹统一描述物体、人体和机器人的动作,[11];Real-to-Sim 重建精度实测,精细重建后仿真与真机得分的相关系数为 0.90,默认开源流程则为 0.51,[12];DeepJEPA,只在决策关键的状态转移处增加计算深度,[13];Embodied Agent Arena,用 1000 个案例评测 7 个前沿 VLM 能否胜任机器人通才,[14];Is Success All You Need,指出成功率相同的 VLA,轨迹行为可能相差很大,[15];Criterion-Aligned 辅助损失,4 个潜空间世界模型对末端位置的编码误差,都超出了成功判据所允许的容差,[16];Screw Attention,把刚体变换代数引入 transformer 层,[17];DexPolicy,一种按阶段调度探索噪声的灵巧手 RL 方法,[18]。
开源·工具·评测
· Runway Praxis-1:以视频生成见长的 Runway 发布了首个开放权重的"世界动作模型",模型基于视频的大规模预训练,目前正与 Noble Machines、Standard Bots、Ultra Robotics 一起测试,并表示数月内会公开。公司自己的实验显示,用网络视频预训练的策略,最终放置误差为 16.1 cm;用遥操作视频预训练的为 16.0 cm,两者差异不显著。⚠️ 厂商口径 [19]
▎ 融资与交易
寅家科技 | 港交所 IPO | 递交上市申请 | 估值约 27.8 亿元 · autonomy
上海寅家电子科技已向港交所主板递交上市申请,股东有正海资本、深创投和东方富海。公司 2025 年收入为 4.81 亿元,而 2023 年仅 1.11 亿元;智驾客户由 16 家增加到 45 家,销量由 13 万台上升到 41.6 万台。按沙利文 2025 年的收入口径,寅家在中国智驾及视觉安全方案供应商中位列第九。至于通用机器人感知定位方案,目前仍处在定点之前的客户验证阶段。[20]
Extend Robotics(英国)| 早期轮 | 260 万英镑 · embodied
这一轮由 Skyworks Venture Capital Fund 领投,Neo Venture (Europe) 和 Zip Capital 跟投。公司开发遥操作平台 AMAS,自己并不出售机器人,而是按客户完成的产出收费。目前订阅客户有 35 家,收入连续三年同比翻番,公司还在苹果的包装线上,用人形机器人做质检。[21]
FORT Robotics | SPAC 合并 | 秘密提交 S-4 · adjacent
FORT 在 10 月 1 日公布了通过 SPAC 合并上市的方案,之后又秘密提交了 S-4 注册文件。[22]
▎ 商业化落地与部署
启元 Q1、T1 的首批产品已交付到用户手中 · humanoid
启元的两款个人机器人在 9 月已报道过,起售价 19999 元。10 月 1 日,上海淮海中路的授权店交付了首批产品,深圳和杭州也同步交付,其他门店将陆续跟进。授权体验店现已覆盖 7 城。基础版 Q1 不开放 SDK,用户要购买 26999 元的探索版,才能获得二次开发接口。[23]
珠海长隆机器人乐园开园,300 多台人形机器人上岗 · humanoid
智元的第 2 万台机器人 9 月下旬在横琴长隆下线并交付,这批机器人现在已进入乐园工作:300 多台人形机器人承担值机、引导、表演,还陪游客打乒乓球。据 CGTN 报道,目前每 3 台机器人配备 1 名操作员,智元的目标则是 1 人照看 10 台。也就是说,1:3 的人机比是当前运营的真实成本,1:10 只是目标。⚠️ 厂商口径[24]
猎户星空在韩国累计供货 4000 台 · adjacent
猎户星空 2022 年经由"外卖的民族"运营商优雅的兄弟们进入韩国市场,约 4 年间累计供货 4000 台。早期以送餐机器人为主,现在已扩展到导览、清洁和物流机器人,用户包括科学馆、学校和医院。釜山一家披萨店在两层楼里各部署了 5 台送餐机器人。[25]
特斯拉在得州的 Cybercab 登记数增至 158 辆 · autonomy
9 月 26 日的报道是 126 辆,最新一批又增加了 32 辆,而 9 月 23 日时只有 69 辆。这些数字出自博主整理的得州 DMV 记录。登记只说明车辆办完了上牌手续,并不等于已经在路上载客。⚠️ 汇编口径[26]
Barrett 计划自 2027 年起跨仓库部署 UNIT AI 平台 · industrial
美国第三方物流商 Barrett 扩大了与 UNIT AI 的合作。从 2027 年起,Barrett 将用 UNIT AI 的平台,在多座仓库之间统一调度库存、履约和退货,并按"仓储即服务"的模式付费。⚠️ 计划口径[27]
▎ 产业动态
Atlas 改用四指手:13 自由度,去掉小指 · humanoid
波士顿动力为 Atlas 推出了新一代的手:三根手指各有 3 个自由度,对生拇指有 4 个,合计 13 自由度。拇指可以沿其他手指的长度和宽度两个方向滑动,指尖和手掌上布满了压力触觉传感器。上一代的手只有 7 个自由度,主要用来抓取;新手则能在手内翻转物体、接住打滑的物件,还能操作电钻、电动扭矩扳手、角磨机、射钉枪和焊枪。少一根手指,就能省下 3 个执行器,成本、体积和故障点也随之减少。CTO Zack Jackowski 曾让团队成员把小指和无名指绑在一起过一天,记录哪些事情做不了,最后得出的结论是四根手指够用。所有执行器都做了封装,且只用一种型号,也没有线缆穿过关节,公司称这样有利于量产和维修。[28]
加州 SB 1246 生效:Robotaxi 阻挡急救超过 30 分钟即被处罚 · autonomy
州长纽森已签署 SB 1246。按照这项法案,Robotaxi 发生故障时,运营方必须为急救人员提供本地的现场支持;如果阻挡警察或消防超过 30 分钟,就会受到处罚。远程驾驶员必须人在美国,并持有美国驾照。法案提案人、州参议员 Dave Cortese 表示:"自动驾驶车辆撞车、抛锚、在紧急情况下堵路或妨碍执法和急救时,必须有明确的责任归属。"TechCrunch 的数据显示,Waymo 在全美的商业车队约 4000 辆,其中约 1200 辆位于旧金山湾区,此前的事故也大多涉及 Waymo。[29]
彭博行业研究:中国 Robotaxi 的车队利用率低于 Waymo · autonomy
据彭博行业研究测算,小马智行和文远知行的车队利用率都低于 Waymo。该机构预计两家公司到 2028 年仍然亏损,车队规模要到 2020 年代后期才可能达到盈利所需的水平。报告还指出,Waymo 的利用率并没有随车队扩张而提高,而是在单次行程距离变长之后才明显上升。车队密度不足,乘客使用起来就不方便;运营成本较高,也会继续压低利润率。⚠️ 测算口径[30]
Skild AI 推出 S1:看一段视频就能学会新任务 · world-model
S1 把视频当作提示来理解任务,既不修改权重,也不做针对任务的后训练,可以处理最长约 10 分钟、此前没见过的多步任务。公司称,在新的多步任务上,S1 每一步的成功率约为 66%,同类系统则为 9%;一段短视频的作用相当于约 380 条人工示范。公司还表示,首个商业部署 10 个月后,年化收入已达 1 亿美元,合作部署超过 60 个。联合创始人兼 CEO Deepak Pathak 说,"从经验中学习而不是预编程,是机器人领域已经发生的跃变。"⚠️ 厂商口径[31]
深圳南山智能机器人园区入选首批国家级示范基地创建名单 · adjacent
工信部公布了首批国家新兴产业发展示范基地的创建对象名单,深圳高新区南山园区的智能机器人示范园区入选,创建期为 2 年,期满后将进行评估验收。南山"机器人谷"汇集了 200 多家产业链企业和 32 家专精特新"小巨人",在约 28 平方公里的范围内,90% 的零部件能在半小时内送到。[32]
Bolt 提出 2.5 万辆 Lucid Robotaxi 的目标 · autonomy
Bolt 打算在欧洲投放至少 2.5 万辆 Lucid 无人车,并在 2035 年前让平台上的车辆达到 10 万辆。这些目前都只是目标,还没有形成订单。Lucid 的中型平台已推迟到 2027 年下半年;此外,按欧盟型式认证规则,一款无人车型每年只能注册 1500 辆。⚠️ 计划口径[33]
银河通用双足人形 ET1 起价 7.9 万元 · humanoid
ET1 身高 1.25 米,共有三个版本:标准版 7.9 万元,Pro 版 13.9 万元,旗舰版 17.9 万元。Pro 版加装了算力 40 TOPS 的 Orin Nano 模组,支持"看一遍学动作"。公司称,9 月初开放预订后的 24 小时内,就收到了 200 多个预订。⚠️ 厂商口径[34]
美国陆军 xTechHumanoid 竞赛评出 5 家获胜者 · humanoid
这次竞赛共收到 103 份白皮书,10 家进入决赛,其中 9 家在 9 月于匡蒂科海军陆战队基地做了演示。陆军首席技术官 Alex Miller 说,陆军借 xTech 了解产业状况,是为了让有前景的技术尽快推进,"而不是陷进长达数年的研究"。[35]
硬件·供应链
· 本末科技 × 中稀科创:直驱模组厂商本末科技与中稀科创签署了战略合作协议,合作方向是稀土永磁材料和机器人动力系统,本末股价盘中上涨超过 12%,创下上市以来新高。按沙利文的数据,本末 2025 年的直驱动力模组出货量约为 850 万套 [36]
· 低价人形的减配账:宇树 R1 AIR 的价格比 R1 低 1 万元,关节数从 26 个减到 20 个,头部和腰部各少了 2 个自由度,保修期也从 8 个月缩短到 6 个月 [37]
文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻