━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Physical AI

今日要点

· 智元第 20000 台机器人在横琴长隆下线交付,从 1 万台到 2 万台用了约 6 个月

· Waymo 公布 2.71 亿英里无人驾驶数据,致伤事故比人类司机少 82%

· IFR:全球工厂在役工业机器人达 500 万台,2025 年新装机里中国占 59%

· KAIST 四足机器人 RAIBO2 一次充电跑完全程马拉松,用时 4 小时 19 分 52 秒,论文登《Nature》

· Black Forest Labs 开放 7B 机器人模型 FLUX 3 Action 的权重,参数量不到 Cosmos3-Nano-Policy 的一半

· 梅卡曼德上市后首份中报:新签订单 3.354 亿元,同比增 75.3%

▎ 论文进展

RAIBO2:一台充一次电就跑完马拉松的四足机器人 · locomotion

足式机器人要在野外救援和山地巡检中真正用起来,续航是绕不开的限制。KAIST 团队先建立整机的能量损耗模型,再据此同时改进三个环节:让力传递更透明的轻量机械结构、阻力更低的电机驱动电路,以及耗散更少的运动策略。RAIBO2 充一次电就跑完了全程马拉松,用时 4 小时 19 分 52 秒。它的总运输成本(cost of transport)为 0.25,人类基准是 0.37。单次充电能走的距离,超过现有四足机器人的三倍。研究数据已上传到 Zenodo,运动策略的训练代码也已在 GitHub 上公开。[1]

MemBodied:为 VLA 配一块长度固定的情景记忆 · vla

HF 8↑。大多数 VLA 只处理当前这一帧,碰到"刚才东西放在哪儿"这类要用到历史信息的任务,就容易出错;而把历史帧全部放进上下文,推理速度又会变慢。MemBodied 不再保留原始历史帧,改用一个可跨调用延续的联想状态,外加一个记录初始场景的锚点。在 RMBench 的五项记忆任务上,它的平均成功率是无状态策略的 7.81 倍,而新增的参数量只相当于最强记忆基线的十分之一。[2]

LeWAM:世界动作模型不必再以视频扩散模型为骨干 · world-model

世界动作模型(WAM,即同时预测动作和环境演变的模型)目前大多建在大型视频扩散模型之上,训练成本因此不断抬高。作者经过比较,发现 JEPA 编码器给出的预测嵌入比 VAE 压缩后的隐变量更适合用来生成动作。于是他们直接在 I-JEPA 的嵌入空间中预测未来,再用一种从示范数据中推出偏好的离线 DPO 做精修。整个模型只训练了 0.4B 参数,在 RoboTwin 2.0 上的平均成功率为 92.28%,与主流 VLA 和 WAM 不相上下。[3]

LADA:训练驾驶 VLA,语言标注不到 5% 就够 · autonomy

车队每天都会记录大量画面和轨迹,但其中带有"路口左转"这类语言指令的帧很少,标注的成本也很高。LADA 先从没有标注的数据中学出一本离散的车辆意图码本,再用一小部分语言标注训练一个翻译器,把指令对应到码本上。在闭环的 Bench2Drive 测试中,它的 Driving Score 为 87.98,成功率为 70.46%,与全监督基线相当,或者更高。[4]

CereVLA:借鉴"小脑"的思路,为冻结的 VLA 增加纠偏层 · vla

动作分块执行到一半时得不到反馈,误差就会一步步累积。CereVLA 不重新训练主模型,只在外面加一层轻量的残差修正,并由状态空间模型预先判断修正的后果,凡是判为不利的修正都被直接压制。在 SO-101 真机上,冻结的 SmolVLA 任务成功率从 57.5% 提高到了 90.0%[5]

ChronoFuse:让事件相机检测器预测"结果输出那一刻"的目标位置 · perception

事件检测器完成计算需要几十毫秒,等结果交出去时,场景已经发生了变化,而常规评测并没有把这段延迟算进去。ChronoFuse 直接预测结果可用那一刻的目标状态,仅多用 0.17M 参数和 0.84 ms 延迟。在 1Mpx 的驾驶数据上,它挽回了因延迟而损失精度的 71%[6]

ForgetMimic:使人形策略"忘记"指定的动作 · locomotion

通过模仿人类动作训练出的人形策略,可能混进了被投毒的动作或受版权保护的动作,GDPR 规定的被遗忘权也可能带来删除要求。作者称 ForgetMimic 是首个面向真机人形控制的动作级遗忘方法。他们在 Unitree G1、H2 上对 12 种动作做了验证:目标动作被删除之后,其余动作仍能正常执行。[7]

AnchorReasoning:面向长尾驾驶场景的视觉定位推理数据集 · benchmark

这个数据集建立在 WOD-E2E 之上,包含 416,119 帧标注和 395,379 个对决策起关键作用的元素。每一帧都把"识别关键物体、推断其影响、给出驾驶理由、规划轨迹"连成一条带有视觉定位的思维链。八种骨干模型用它微调后,5 秒 ADE 下降了 7.84,FDE 下降了 11.86。[8]

今日还有这些论文:AWM-VLA 把对齐的世界建模嵌入扩散 transformer 策略,在 RoboCasa 等基准上成功率最多提高 21%([9]);TP-Flow 将少量示范转成任务原型 token,用来引导 flow matching,在 SO-101 上单样本成功率为 66.8%([10]);多任务 CFM 蒸馏把单任务专家的速度场蒸馏到一个共享策略中([11]);VLMs Can Describe, But Not Measure 提出模块化的场景理解,由 VLM 负责语义、深度负责几何([12]);Intelligence Across Embodiments 是一篇立场论文,主张把本体的多样性当作扩展的一条轴线([13]);此外还有用于在线适应的贝叶斯神经网络全协方差平滑([14])、红外图像的全天候复原([15])、SatUnreal 卫星立体匹配合成数据集([16]),以及 ODPure 目标检测后门净化([17]

开源·工具·评测

· FLUX 3 Action:做图像生成的 Black Forest Labs 进入了机器人领域,公开了一个 7B"世界动作模型"的权重、代码和微调配方。公司称,该模型在 NVIDIA RoboLab-120 上的总成功率为 42.92%,比此前最好的开放模型 Cosmos 3 高 6.1 个百分点,而参数量只有 16B 的 Cosmos3-Nano-Policy 的 44% ⚠️ 厂商口径 [18]

· RLark:清华大学和无问芯穹开源了一个面向具身智能的云原生纳管平台。该平台已统一管理 3 个集群、近百个云边端节点,设备接入时间从小时级缩短到约 5 分钟,任务能在 10 秒内启动 [19]

▎ 融资与交易

深朴智能 | 控股 *ST美芝 | 8.1 亿元 · embodied

成立还不到两年的深朴智能,牵头组成了重整投资联合体,准备以每股 8.725 元认购约 9286 万股。重整完成后,它将持股约 27.45%,成为控股股东,创始人李晓飞则成为实际控制人。另有 14 家财务投资人按每股 10.765 元出资约 9.99 亿元,联合体的出资合计约 18.1 亿元。除了 IPO,这是具身智能创业公司取得 A 股上市公司控制权的又一个例子。[20]

普晞光电 | C 轮 | 数亿元 · hardware

公司生产用于极端环境的特种功率晶片,产品可耐受超过 250℃ 的环境温度,最早用在 8000 米深井的油气勘探中。这一轮有 10 家国资和产业资本新进入,资金将用于氧化镓晶片的迭代、230℃ 级高温晶片模组的扩产,以及高温机器人关节的研发。公司 2025 年的营收为 2.3 亿元。[21]

Realset AI 与 Flatkey | A 轮 | 1000 万美元 · adjacent

公司提供真实场景的训练数据,在真实的厨房和洗衣房里,请熟练工而不是众包标注员来采集示范。它计划在第四季度发布家务操作的开放评测,用叠衣服、装洗碗机、分拣和擦拭这几项任务来测试 π0、OpenVLA、GR00T、Octo。创始人 Hunter Guo 说:"容易拿到的数据已经被用完了。剩下的是物理世界,而物理世界没法爬取。"[22]

O-ID | Pre-seed | 120 万美元 · humanoid

这家公司位于东京,由挪威籍 CEO Stian Jakobsen 和荷兰籍 CTO Simon Gormuzov 在 2025 年创办,做面向制造和物流的全模块化人形机器人。部件磨损时由板载传感器发出预警,损坏后整块更换。本轮由 TAWANI Ventures 领投,Hustle Fund 和 Techstars 跟投。[23]

▎ 商业化落地与部署

智元第 20000 台机器人下线,300 余台在长隆常态化上岗 · humanoid

9 月 24 日,第 20000 台远征 A3 Ultra 在横琴长隆飞船乐园下线,并交付给长隆集团。当天,双方合作建设的主题乐园开园,双方称它是全球首个大规模的具身智能主题乐园。园内有超过 300 台智元全系机器人,承担导览、商业演出、科普研学、零售和酒店服务。智元的量产节奏是:2025 年 1 月突破 1000 台,年底达到 5000 台;2026 年 3 月超过 1 万台,6 月 28 日达到 15000 台,从 1 万台到 2 万台用了约 6 个月。A3 Ultra 身高 174 厘米,算力平台为 700 TOPS,配有 20 自由度的触觉灵巧手。2 万台是全系列累计下线的口径,智元没有说明其中人形和四足各有多少。[24]

Waymo 公布 2.71 亿英里安全数据:致伤事故少 82% · autonomy

截至 2026 年 6 月底,Waymo 在亚特兰大、奥斯汀、洛杉矶、凤凰城和旧金山五地累计完成 2.71 亿英里全无人驾驶里程,比 3 月底的上一版数据多出约 5000 万英里。与人类司机相比,致伤事故少 82%,重伤及以上事故少 95%;涉及行人的致伤事故少 93%,涉及骑车人的少 86%。Waymo 这次首次把降幅折算成绝对数,即少了 841 起致伤事故。Electrek 指出,独立研究同样得出了事故下降的结论,只是降幅低于 Waymo 自己报告的数字;而美国人类司机每年行驶 3 万亿英里,两者的样本量差距依然很大。[25]

沃尔沃无人矿卡累计运输达 300 万吨 · autonomy

Volvo Autonomous Solutions 在欧洲的矿山和采石场,累计无人运输的物料已超过 300 万吨。在挪威的 Brønnøy Kalk 采石场,9 台无人卡车行驶在一条长 5 公里、穿过长隧道的陡坡线路上,2025 年这里的运量刚刚超过 100 万吨。这项服务按"运输即服务"的方式收费,卡车在瑞典的 Säffle 工厂生产。[26]

Kodiak 在加州新规下完成首批重卡自动驾驶配送 · autonomy

Kodiak 与农产品承运商 DTL Transport 合作,从弗雷斯诺向洛杉矶的配送中心送货,单程约 225 英里,途经 99 号州道和 5 号州际公路,驾驶位上仍坐着安全员。加州 DMV 到 4 月 28 日才批准重卡自动驾驶上公路测试,Kodiak 在 8 月 13 日拿到了测试许可。它在得州的无人运营计划定在今年年底。[27]

大众 MOIA 在奥兰多开始出售 Robotaxi 车票 · autonomy

MOIA 与 Beep 在 Lake Nona 社区用 ID. Buzz 运行三条固定线路,车上搭载 Mobileye 系统,这是 MOIA 在美国的第一项载客服务。车上仍配有人工监督员,Finimize 因此认为,它更接近有监督的试运营。[28]

▎ 产业动态

IFR 年报:全球工厂在役机器人达 500 万台 · industrial

IFR 的《World Robotics》显示,2025 年全球在役工业机器人增长 9%,达到 500 万台,是七年前的两倍多;全年新装机超过 60 万台,增长 11%。中国新装机 35.4 万台,增长 20%,占全球的 59%;其中国产厂商装机 19.5 万台,本土份额为 55%,低于 2024 年的 57%。美国装机增长 12%,接近 3.85 万台,超过🇯🇵成为第二大市场。🇯🇵下降 19%,为 36,219 台;德国不足 2.5 万台,占欧盟装机的 41%。IFR 预计,2026 年装机将增长 9%,达到 65.5 万台。[29]

梅卡曼德上市后首份中报:订单增速快于营收 · industrial

上半年公司营收为 2.373 亿元,同比增长 54.7%,毛利率从 61.4% 升至 65.0%。新签订单 3.354 亿元,增长 75.3%;截至 6 月底的在手订单为 1.765 亿元,同比翻了一番。研发投入增长 72.9%,经调整亏损从 5580 万元收窄至 5250 万元。梅卡曼德已于 9 月 1 日在港交所挂牌。[30]

丰田估算:2028 年起每年投入 64 亿美元,需要约 40 万台机器人 · industrial

丰田对投资者表示,工厂自动化大约需要 40 万台机器人,其中既有替换旧机的,也有新增的人形和非人形机器人,超过三分之一将投在丰田汽车本体。从 2028 年起,公司每年将投入约 64 亿美元。CNBC 称,丰田还没有对这笔投资作出承诺,也没有说明会持续几年。示范机型 ELEY 是轮式双臂机器人,由工人穿着外骨骼遥操作来示教。CTO 中嶋裕树说,机器人可以通过相机和传感器学习人的动作,"无需编写复杂程序,就能把老师傅的技能转给机器人"。⚠️ 计划口径[31]

亚马逊在印第安纳州建设第四座机器人工厂 · industrial

据《华尔街日报》报道,亚马逊将在印第安纳州 Greenwood 投资超过 1 亿美元,建设一座机器人制造工厂,预计 2028 年前投入使用,可提供 300 个岗位。上个月,亚马逊已经公布了得州奥斯汀的基地,加上这一座,它的机器人工厂数量增加了一倍。[32]

Skild AI 通过仿真自博弈训练出会踢球的人形机器人 · world-model

Skild AI 称,它的 S1 模型在 NVIDIA Isaac Sim 中进行自博弈,唯一目标就是进球,既没有定制的奖励,也没有使用示范。训练折合约 140 年的仿真经验,策略直接迁移到真机上,机器人能与人和其他机器人对踢。目前能看到的只有公司发布的演示视频。⚠️ 厂商口径[33]

Light Origins 发布 Light-O1,用人类视频做预训练 · world-model

该模型从互联网视频中恢复出结构化的人体动作,作为先验,再适配到不同的机器人上。公司用六档预训练规模做了实验,从 3.75B 到 120B token,最大一档约相当于 10 万小时的人类动作。公司称,规模越大,在两款人形平台上的适配误差就越低。演示中,同一个模型分别驱动了自家的 LightBot 和 Unitree G1。⚠️ 厂商口径[34]

智元的两条旁线:深圳新公司与马来西亚投资意向 · humanoid

深圳越影机器人科技公司已经成立,注册资本 400 万元,法定代表人为彭志辉,由智元创新全资持股。马来西亚总理安华表示,智元有意在 2035 年前向当地投资 10 亿令吉,创造 5000 个岗位。⚠️ 计划口径[35]

硬件·供应链

· EdgeCortix RAIDEN:🇯🇵公司 EdgeCortix 推出了可扩展的 AI chiplet 平台,突出能效,面向物理 AI 的边缘推理 [36]

· 摩尔线程 MTT S5000:公司称,该产品的具身强化学习训练曲线与主流 GPU 的相关系数为 0.976,双臂任务的成功率约为 92% ⚠️ 厂商口径 [37]

▎ 本周观察

无人重卡警示装置豁免被起诉,FMCSA 出庭作出回应 · autonomy

FMCSA 在 7 月 9 日批准了对 Aurora 的豁免:无人重卡停车时,不必再由司机下车摆放三角警示牌,改用驾驶室顶部的警示灯,其他运营商书面报备后也可适用。9 月 8 日,一名在得州同一线路跑运输的伊利诺伊厢式货车司机,向第七巡回上诉法院申请复审,并要求暂缓执行这项豁免。法院要求 FMCSA 在 9 月 21 日前答复,据 Overdrive 报道,FMCSA 已经提交了反驳意见。这项豁免目前是无人重卡在美国夜间行驶的前提之一,法院的裁决会直接影响 Aurora 和 Kodiak 年底的无人运营时间表。[38]

两份四足机器人市场报告同日发布,总量相差 1.4 万台 · embodied

9 月 21 日,Counterpoint 和 IDC 在同一天发布了全球四足机器人报告。Counterpoint 称,上半年出货约 3.5 万台,2025 年全年为 4.6 万台,产业营收接近 7 亿美元;IDC 则称,上半年出货超过 4.9 万台,同比增长 92.5%,2025 年的市场规模超过 4.9 亿美元。虎嗅转载的 AIX 财经分析认为,分歧来自统计口径:Counterpoint 的营收包含传感器、软件和运维,并剔除了儿童陪伴类的小尺寸产品;IDC 只计算硬件本体,并覆盖消费级产品。两家机构都把宇树排在第一,第二名则不同,分别是智元酷拓(按出货量)和云深处(按收入)。Counterpoint 预计,2026 年出货量将首次突破 9 万台,营收翻一番,达到 15 亿美元。[39]

高盛上调人形机器人预测,2030 年达 89 万台 · humanoid

高盛在 8 月 31 日发布的全球物理 AI 报告中,把 2026 年人形机器人出货量的基准预测从 5.1 万台上调至 7.5 万台,2030 年从 25.6 万台上调至 89 万台,2035 年预计达到 650 万台。整机均价则从 2025 年的约 4.18 万美元,下降到 2035 年的约 2.13 万美元。这只是一家机构的观点,与 IFR 统计的 2025 年全球人形机器人销量约 7000 台相比,相差一个数量级。⚠️ 测算口径[40]

本周供应链:代工与触觉两层同时扩产 · hardware

本周的供应链信号集中在两个层面。第一个是代工。富士康与阿尔特合资成立的富特康,9 月 21 日在北京亦庄揭牌,双方各持股 45%,以 Turn-Key 模式为机器人公司包办从研发、制造、数据训练到销售的全部环节。21 财经 9 月 23 日探访了领益智造的亦庄超级工厂,该工厂规划 2026 年产 1 万台套、2027 年产 2 万台套、2030 年产 50 万台套,目前单台的装配工时为 30 到 40 小时,目标是压缩到 20 小时。第二个是触觉。他山科技已经完成股改,CEO 马扬表示公司有上市计划;公司称触觉传感器每月交付数万枚,上半年的订单超过去年全年的四倍。均胜电子是他山 7 月 B 轮的出资方之一,它也出现在 9 月 18 日报道的特斯拉 Optimus 审厂名单里。⚠️ 厂商口径[41]

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻