━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Physical AI

今日要点

· 小鹏首台 IRON 自主走下产线,核心制程自动化率超 80%

· 嬴彻商业化自动驾驶里程破 10 亿公里,同步推出货运物理 AI 框架

· 优必选上半年卖出 921 台全尺寸人形,撑起近半收入

· Motional 开源 nuReasoning,2 万个长尾场景配人工核验推理标注

· 理想 MindVLA-o1 靠自研 1280 TOPS 晶片把 3D ViT 搬上车

· Arm 抛出 Robotics Capability Framework,要给机器人能力立统一说法

▎ 论文进展

HSImul3R:让重建出来的人和椅子,在仿真器里真的坐得住 · perception

过去做三维重建的人只关心画面看起来对不对,可一个视觉上坐得稳稳当当的人体,一旦丢进物理仿真器,椅子说塌就塌、人和物体也会互相穿过去。针对这个毛病,大晓机器人联合南洋理工 S-Lab 与上海人工智能实验室把重力是否稳定、接触是否真实、交互是否站得住脚这几条也写进了评价体系里,并设计了一套物理闭环的双向优化:一头用面向场景的强化学习去修正人体的动作,另一头拿仿真给出的直接奖励反过来修正三维物体的生成结果。团队在自建的 HSIBench 测试集上按简单、中等、困难三个档位统计交互稳定率,分别拿到 53.68%、30.56%、13.92%,相比之下 HSfM 只有 10.52%、4.50%、2.66%;人和场景互相穿模的比例也从 69.51% 压到了 22.90%。最后这些经过优化的动作被搬到 Unitree G1 身上真机执行,相当于把日常视频里学到的交互经验,转化成机器人既能在仿真中学、也能真正做出来的技能。[1]

WM-LOCO:世界模型和行走策略一起训,跨过 0.8 米宽的缝隙 · locomotion

要让机器人走过复杂地形,业内一般得先标出落脚点、再靠教师模型蒸馏、还得把好几个模块串起来才行,流程不算简单。地瓜机器人这次换了个思路:把负责预测未来视觉画面和运动状态的世界模型,跟 PPO 策略放进同一套训练流程里端到端联合优化,输入是深度视觉,输出直接就是关节指令,中间不再拆模块。同一套训练好的权重被零样本部署到 Unitree G1 上,团队分别在踏石、台阶、缝隙三类地形上各测了 10 次,平均成功率达到 93.3%;面对 0.8 米宽的缝隙,机器人靠一个完整的摆腿、跨越、落地动作一步就迈了过去,出于安全考虑团队没有再把缝隙加宽继续测。整套算法在旭日 S600 计算平台上实时闭环运行。[2]

HERON-World Model:把通用互联网视频从训练集里删掉 · world-model

业内常见的做法是用海量互联网视频打底建数据金字塔,但松延动力新孵化的子品牌 Scalabot 反其道而行之,直接把这一层拿掉了,只保留三类数据:真实机器人遥操作数据、依托真实场景重建出来的仿真数据,以及第一视角拍摄的人类操作视频。他们的理由不是互联网视频数量不够,而是"对的"数据太少——世界模型真正需要的是接触密集型的视频内容,而这类内容在互联网视频里占比很小,与其花大力气去筛选,不如直接自己采集来得划算。对于不同形态的异构动作,团队没有强行统一成一种格式,而是先做物理空间上的对齐,再让各个领域各自用轻量编码器把动作投影成统一维度的 Action Token。按照 WorldArena 1.0 Track 1 公开的测试方案做离线评估,综合得分 EWMScore_P 达到 75.80[3]

开源·工具·评测

· nuReasoning(Motional):这是业内首个把"推理"当作核心的自动驾驶开源数据集,团队从拉斯维加斯、匹兹堡、洛杉矶、波士顿、新加坡五地车队跑出来的 105 小时真实路测数据里,切出了 2 万个长尾场景,每段视频至少有 20 秒,并配上 24.7 万条经过人工核验的推理标注,目的是让 VLA 模型学会理解驾驶决策背后"为什么这么做"的因果逻辑,而不只是照着轨迹模仿。同步开放的挑战赛设了可解释运动规划、长尾场景推理两个赛道,结果会在 12 月的 NeurIPS 上公布;此前早些时候放出的一个小规模 miniset 版本,下载量已经超过 5 万次。这个系列的数据集是从 2019 年的 nuScenes 一路延续下来的,中间还经过了 nuImages、nuPlan。 [4]

▎ 融资与交易

千诀科技 | A+ 轮 | 数亿元 · world-model

这一轮由未来边际创投、元禾厚望、英诺天使资本、筱光资本、芯能创投、京铭资本等机构联合出资。这支团队脱胎于清华大学类脑中心双臂机器人课题组,原课题组组长高海川博士现在担任 CEO,技术路线对标的是 Yann LeCun 团队的 JEPA,做的是预测式世界模型加多项式表征架构,去年团队提出的 Causal Dreamer 引入了反事实筛选机制,相关成果发表在《Neurocomputing》上。公司方面表示已经完成近 50 款机型的智能适配,落地规模超过 10 万台,并且手握 20 亿条真实场景三维感知资产。⚠️ 厂商口径公司成立于 2023 年,这已经是它的第 9 轮融资。[5]

小雨智造 | B3 轮 | 数亿元 · embodied

这轮由 Blooming Star、新加坡 Kamet Capital 和国科盈峰资本出资,8 月完成交割,算上这次已经是公司 2026 年内的第三轮融资。公司创始人乔忠良出身小米核心创始团队,做这家公司的技术起点是"一脑多形"的思路——用一个通用大脑去适配焊接、打磨、精密装配、巡检等不同形态的本体。他们选的切入点是智能焊接,7 月发布的小雨未来机器人标准版智能焊接工作站起售价 16.98 万元,落地场景已经从建筑钢结构复制到了船舶制造和重型机械领域。公司方面称,客户现场每天大约有 10 万条真实生产数据实时回传,累计回流时长已超过 10 万小时。[6]

天机智能 | B++ 轮战略融资 | 金额未披露 · hardware

这轮由蚂蚁集团与 SOFINA 联合领投,高榕创投、腾讯等老股东继续跟投。这家广东公司的底子是力控技术:从 MEMS 关节扭矩传感器、轻量化一体化关节模组,到力控算法、控制系统,一路做到了人形力控臂。公司新孵化的人形整机品牌 Gento 已经启动交付:Luna 是轮式折叠款,有 26 个自由度,站立高度 1.7 米,折叠后只有 0.79 米,可以进标准电梯;Skye 是轮式升降款,有 23 个自由度,升降范围在 785 至 1695 毫米之间,按 7×24 小时连续运行的标准设计,专门用于强化学习训练和真机数据采集。[7]

自变量机器人 | 港交所秘密递表 | 两年半累计超 50 亿元、估值 200 亿元 · embodied ⚠️ 传闻口径

短短两年半时间里,30 多家机构把超过 50 亿元的资金砸向了这家还没实现规模化量产、也没有多少销售收入的公司。美团、阿里、字节、小米各自在不同轮次领投过,红杉中国则从 A+ 轮起每一轮都在跟投,公司估值从 100 亿元在两个多月内就跳到了 200 亿元。8 月 5 日,南华早报援引两位知情人士的说法称,公司已经向港交所秘密递交了上市申请。8 月 12 日在顺丰仓库那场直播,成了争议的焦点:官方公布的成绩是一小时内分拣随机包裹 1816 件、成功率超过 98%,但博主"机器人大侦探"拆解后指出,Figure 号称的 1248 件/小时其实是 200 小时不间断直播中多台机器人轮换、累计约 24.9 万件包裹算出来的平均值,而且 Figure 用的是全尺寸人形机器人,自变量用的却是固定工位配双臂加标准夹爪的方案,两者并不完全可比。另一个反差出现在家庭场景:今年 3 月,公司还在 58 到家上卖 149 元三小时的机器人保洁服务,如今却改成每月最高补贴 3000 元,请住户允许机器人进家采集数据。[8]

王乃岩具身大脑项目 | 融资中 | 金额未披露 · embodied ⚠️ 单方口径

原小米智能驾驶 L3 技术负责人、原图森未来中国区 CTO 王乃岩已经投身具身大脑方向的创业,据一位投资人透露,核心研发团队只有十几个人,其中不少是他在图森时期的老同事。这个项目比较特别的地方在于复用了 L3 的思路:把强化学习放到动作模型预训练那一环,而不是留到最后当一道微调工序——预训练阶段做域随机化,只把安全底线、物理法则这几条第一性原理设成奖励函数,让模型自己跟自己博弈成千上万次。一位知情人士转述他的想法是这样的:"动作不是靠模仿抄出来的,而是靠演绎学出来的。"另据 IT 桔子的数据,具身大脑系统今年的融资起数占比达到 38.8%,已经反超人形机器人整机的 21.1%,不过上半年国内披露的逾 460 亿元融资里,大约七成还是流进了前 20 家公司。[9]

▎ 商业化落地与部署

小鹏人形机器人产线启用,首台 IRON 完成自动化总装后自己走了下来 · humanoid

这条产线上诞生的第一台完成自动化总装的 IRON,没有被人抬着运走,而是自己走到了镜头前。这条产线是小鹏自主设计的,从一开始就是奔着规模量产去做正向开发,核心制程的自动化率超过了 80%,相当于把汽车工业那套质量体系搬进了机器人的精密制造环节,用车规级一致性的标准来把控产品质量。目前最新版的 IRON 身高大约 170 厘米,全身有 76 个自由度,单手就占了 21 个,外观采用全包覆柔性晶格,机身内置 3 颗图灵 AI 晶片,可以提供 2250 TOPS 的有效算力,物理 AI 模型直接部署在端侧,不需要遥操就能自主完成复杂任务。按照规划,IRON 会在今年底进入规模量产,先在小鹏门店和园区落地使用,到 2027 年再面向中国及海外市场正式上市交付。半个月前那笔超 9 亿美元、投后估值超 63 亿美元的首轮融资,由 IDG 资本领投,腾讯和阿里巴巴以战略投资者身份加入(此前已报道过)。不过要说明的是,能做出一台能演示的样机,跟能稳定复制出数万台,完全不是一回事;产线投产已经是发生的事实,但今年底量产、2027 年交付目前仍然只是时间表上的计划。[10]

嬴彻科技商业化自动驾驶里程破 10 亿公里,发布 Freight Physical AI · autonomy

嬴彻的商业化自动驾驶行驶里程累计已经突破 10 亿公里,系统覆盖了中国大约 97% 的高速公路网络。公司方面表示,自家在中国自动驾驶卡车市场的占比已经超过九成。同一天发布的 Freight Physical AI,是一套专门面向商用货运车辆的智能框架,用的是货运场景专属的训练数据、由日常运营记录逐渐积累起来的场景库,再加上一个把车端智能和车队智能连起来的云平台。目前已经有多家头部快递企业把自动驾驶列为重卡订单的标配配置,公司认为这个变化是技术具备商业可行性的一个信号。牌照层面,公司手握北京、浙江、海南的 L4 许可,与京东物流合作跑过载货开放道路的演示,5 月又和顺丰一起把无人轻卡投入了公开道路的商业试点,把自动驾驶货运的场景从干线延伸到区域和城市配送。海外方面,公司在欧洲、🇯🇵、中东做验证,并且入选了比利时安特卫普-布鲁日港的试点项目。[11]

优必选上半年卖出 921 台全尺寸人形,撑起 46.5% 的收入 · humanoid

继上周七家机器人上市公司陆续公布半年报之后,中国银河证劵在 9 月 7 日的一份研报里把优必选的业绩结构拆解开来:26H1 全尺寸具身智能人形机器人的销量是 921 台,同比增长 1946.7%,对应收入达到 5.90 亿元,同比增长 1445.0%,占总收入的比例达到 46.5%。公司整体营业收入为 12.69 亿元,同比增长 104.2%,毛利率提升到 44.7%,同比提升了 9.7 个百分点;期内净亏损 3.39 亿元,比去年同期亏损的 4.4 亿元有所收窄;经调整 EBITDA 为 -1.74 亿元。三项费用率整体都在下降,研发费用虽然增加到了 3.03 亿元,但研发费用率反而降低了 11.2 个百分点。物流机器人这一块,公司已经完成了彼欧、捷普、富士康、本田等世界 500 强客户的项目交付。[12]

月泉仿生 W-Bot 2.0 进合肥国家电网,做配网带电剥线 · embodied

轮式人形博文 W-Bot 2.0 已经在合肥国家电网完成了电缆剥线的全流程作业,这次是面向城市配网不停电运维做的实景验证。部署方式是把机器人载在绝缘斗臂车上,机器人手上搭配了信手 X-Hand M1 仿生灵巧手和 7 自由度仿人臂,负载能力做到单臂 10kg、双臂 20kg,操作高度能覆盖 0 到 2.2 米的范围;底盘占地面积只有 0.2 平方米,可以在狭窄的导线间隙里灵活穿行。在带电作业过程中,机器人依靠全身层级神经网络平衡控制,实时解算重心的偏移情况,即便单臂承受的负载大幅增加,也能保持稳定站姿,从而避免剐蹭到旁边带电的部件。目前这还只是一次单点的实景验证,还没有进入常态化运维阶段。[13]

海柔创新携 SSI Schaefer 落地澳大利亚首个爬架机器人项目 · industrial

这两家公司此前已经在欧洲市场上共同交付了超过 30 个项目,现在他们把这套合作经验带到了澳新市场。海柔创新亚太区总裁 Nathan Zeng 表示,与 SSI Schaefer 的合作是公司重要策略之一,但并不是唯一的路子,公司同时也在推进直接接触客户、本地服务能力建设和伙伴网络这三条路线。他说:"我们设计和制造的东西是 SSI Schaefer 没有的,所以谈不上竞争,更像是在补足它的产品线。"公司的箱式搬运方案,和对方原有的自动存取系统在市场定位上是错开的。[14]

Talabat 与 QuikBot 在迪拜试点高层楼宇配送机器人 · adjacent

双方目前签的只是一份谅解备忘录,机器人负责的是骑手送到楼下之后剩下的那一段路:进大堂、坐电梯、送到住户家门口。新加坡公司 QuikBot 旗下的平台专门做公寓、写字楼和酒店的楼层到楼层配送,还配了用来交接货物的智能柜。至于具体涉及多少栋楼、投放多少台机器人、住户什么时候能实际用上,以及试点期间订单价格是否会有变化,这些细节目前都还没有公布。⚠️ 计划口径需要说明的是,这次只是针对楼宇内部基础设施做测试,从餐厅到家门口的全程配送,依然由 Talabat 现有的骑手网络负责。[15]

▎ 产业动态

理想发布新一代自动驾驶架构 MindVLA-o1,把原生 3D ViT 放进感知底座 · autonomy

在 NVIDIA GTC 2026 大会上,理想基座模型负责人詹锟给出了这样一个判断:现在几乎所有的端到端系统,本质上都是在"看着 2D 视频学开车"——BEV 把立体的世界压扁了,丢掉了高度信息,而 OCC 虽然有三维结构,却又缺少语义理解。理想给出的解法是引入原生 3D ViT,在编码阶段就直接把三维空间的几何信息和语义理解统一起来处理,激光雷达的作用也因此从感知的核心退居成一把提供几何标定的高精度尺子。李想表示,在这种统一建模之下,系统可以稳定感知并推理到 500 米以外。这套方案此前之所以一直没法上车,是因为端侧算力跟不上,直到自研的马赫 100 晶片把单颗算力做到 1280 TOPS,部署才成为可能,首发车型是全新 L9。整套架构以原生多模态 MoE Transformer 为核心,还包含预测式隐世界模型、基于 VLA-MoE 的统一行为生成、离散扩散轨迹优化和闭环强化学习;场景重建这一块也从原来的方式改成了前馈式,渲染速度提升了近 2 倍,整体训练成本则降低了约 75%。为了做好软硬件协同设计,基座模型团队一共评估了近 2000 种不同的模型架构配置。[16]

Arm 发布 Robotics Capability Framework,想先统一行业的说话方式 · adjacent

Arm 首席架构师 Richard Grisenthwaite 的看法是,自主、智能、自适应、协作、情境化、自我改进这类词汇现在已经被用得到处都是,但放到不同厂商、不同用例、不同运行环境和不同监督模式下,它们指的其实并不是同一件事。这就带来一系列麻烦:系统之间难以比较、难以集成、也难以评估——客户搞不清自己买到的到底是什么能力,监管机构和保险公司缺乏一套清晰的口径去判断能力和风险的对应关系,开发者和集成商之间也没有一门共同的语言可用。为此 Arm 推出了 Robotics Capability Framework,这是一个跟具体架构无关的参考框架,用来描述能力本身、运行的情境、监督的方式以及保证等级,但它并不规定机器人具体应该怎么造。Grisenthwaite 特意说明,这套框架不是终点,Arm 也不打算把它做成自家独有的东西。同一天,STRADVISION 与 ZaiNar 也宣布把各自的视觉感知和定位能力带进了 Arm Total Design for Physical AI 里。[17]

三星 SDS 定下 10 万亿韩元投资盘子,机器人主战场瞄准美国 · industrial

三星 SDS 的 CEO 李俊熙在首尔 Coex 举行的 REAL Summit 2026 上透露,公司到 2031 年前将投入 10 万亿韩元(约合 74 亿美元),"目前正在评估横跨 AI 转型和机器人领域的投资,其中包括入股一家机器人基础模型开发商"。这笔投入是建立在今年 4 月那版以数据中心和 GPU 为主的同等金额计划之上,这次新增了战略投资和并购这两块内容,资金来源里包含从 KKR 那里拿到的 8.2 亿美元,以及 6.6 万亿韩元的现金及等价物。整个计划分三个方向:AI 转型、机器人转型和物流;在机器人这一块,公司把美国当作主战场,理由是当地正在推动制造业回流本土。⚠️ 计划口径公司方面还表示,计划在 2027 年推出一个机器人编排平台,用来管理跨 1000 条以上产线的混合机器人队列。[18]

Palladyne AI 与 FANUC America 结成战略合作 · industrial

这次合作把 FANUC America 的工业机器人产品线和 Palladyne AI 的物理 AI 软件平台组合到了一起,目标指向制造、仓储和物流这几个领域。双方列出了六个合作方向:在 FANUC 平台上优化 Palladyne IQ、由 AI 驱动的运动规划和自适应行为、遥操作与人类辅助学习、用来加速部署的仿真与模型训练、面向不同场景的客户用例联合验证,以及针对系统集成商的标准化部署流程。⚠️ 单方口径公告里并没有透露具体金额和开发时间表,也没有指名首批会落地哪些客户。[19]

宇树称 UnifoLM-X2-1.0 实现人形机器人全自主搏击 · humanoid ⚠️ 厂商口径

宇树在 9 月 7 日放出的一段视频里表示,这个模型在动作大模型的瞬时规划、决策和动态交互执行方面取得了突破,实现了高动态、强交互,以及对未来的预测和实时规划能力,公司还称这验证了世界模型驱动的人形机器人能够大规模落地部署的基础可行性。目前公开的只是一段视频,还不是可以复现的结果,更没有量产层面的指标。[20]

Dreamer 作者 Danijar Hafner 离开 DeepMind 创业,办公室里挂满从中国进口的人形 · world-model

31 岁的 Hafner 在旧金山 SoMa 租下的办公室里,门牌都还没来得及挂上,家具也没添几件,但货架上却吊着一排从中国进口的各式人形机器人。他走的这条路是基于模型的强化学习:先搭一个世界模型来模拟物理现实,让 agent 在这个模拟环境里学会怎么行动,再拿这些经验去预测未来可能发生的结果,这样一来即便面对训练中从没见过的环境,机器人也能应付得来。这和传统机器人学习依赖真实世界不断试错的路子不一样,他这条路让机器人能在没跑过的场景里也执行复杂任务。早在 2015 年,他还只是本科二年级的学生,就已经成了 Google Brain 的一名学生研究员,此后辗转英国、加拿大和美国,在 Google Brain 和 DeepMind 之间工作。DeepMind 的 Timothy Lillicrap 这样评价他:"我在 Google 研究部门接触过很多非常聪明的人,他轻松位列前 0.5%。"[21]

硬件·供应链

· 爱芯元智 M97 / M95:这是两款采用 5nm 工艺的车规智驾晶片,旗舰型号 M97 集成了 720 TOPS 的等效 AI 算力,配备 16 个 Arm Cortex-A78AE 核心,自研 ISP 支持接入 16 路摄像头,等效内存带宽达到 460GB/s;主流型号 M95 则是 360 TOPS 算力、10 个核心、支持 14 路摄像头。这两款晶片都通过了 AEC-Q100 车规认证,内置了 ASIL-D 等级的片内锁步安全岛,晶片整体安全等级达到 ASIL-B,并支持双晶片冗余。公司方面表示,端到端和 VLA 模型在这两款晶片上的表现明显优于行业平均水平,ISP 通路的延时降低了 70%。 [22]

· EcoPro 等韩国电池材料商转向人形机器人:EcoPro 打算加快高镍正极和下一代固态电池的研发,为的是给人形整机供货,此前 LG 新能源、三星 SDI、SK On 已经提出过类似的计划。彭博社分析说,人形机器人通常需要能量密度高于电动车电池的解决方案,这对于在 LFP 领域被中国对手抢走市场份额的韩国厂商而言,算是一个翻身的机会。CRU 电池材料分析主管 Sam Adham 认为,固态电池能进一步提升能量密度,而且机器人产业对成本的容忍度比车企要高,不过他也预计,这个产业真正爆发要等到下一个十年的后半段。EcoPro 目前已经有一座年产能 40 吨的硫化物固态电解质中试工厂,计划明年开始商业化生产。 [23]

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻