━━━━━ 正文从此处全选复制 ━━━━━
FutureX · Physical AI
今日要点
· May Mobility 借 SPAC 上市,企业价值 14 亿美元,2025 年收入约 1000 万美元
· NHTSA 要求特斯拉 9 月 30 日前说明 Cybercab 如何通过联邦安全认证
· 特斯拉 Robotaxi 在迈阿密西部开通,Mashable 称车内没有安全监督员
· 韩国发布物理 AI 五年研发路线图,两地项目合计 1.4131 万亿韩元
· 双臂机器人在仿体上连续完成 8 例肾肿瘤自主切除,77 刀切缘全部阴性
· 智界 RX 拿到 L3 级自动驾驶道路测试牌照,已在城市快速路实测
▎ 论文进展
占据网络引导的自主机器人肾部分切除术 · perception
自主软组织肿瘤手术过去只能在器官表面做,组织一旦切开或变形,系统就看不清解剖结构。这项工作用纯仿真训练的条件占据网络,从单视角局部点云推断肾脏、肿瘤和切缘组织的完整三维形态,切割过程中持续跟踪。在按患者数据制作的水凝胶仿体上,双臂机器人连续完成 8 例自主肿瘤切除,共 77 刀电切,切缘全部阴性,平均绝对切缘误差 1.61±0.48 mm。目前结果仅限开放手术设定下的仿体实验。[1]
XPACE:从异构经验联合学习世界与动作 · world-model
XPACE 在小鹏 IRON 人形机器人上验证,一个模型同时当策略和模拟器用:共享视频骨干,既联合预测动作与未来视频,也预测给定动作的视觉后果。无动作标注视频负责学视觉动力学,人类与机器人示范负责学动作。模拟器再围绕专家示范合成偏离后恢复的轨迹,回灌微调策略。论文称异构训练让机器人学会了示范里没有的人类技能,自生成的恢复数据进一步提高了真机任务完成度。[2]
模态自回归的世界-动作模型 ModAR · world-model
HF 4↑。世界-动作模型(WAM,即同时预测未来观测与动作的模型)通常用 RGB 图像表示未来,ModAR 改为依次去噪点轨迹、DINO 特征、深度,最后才出动作。实验发现额外预测 RGB 没有稳定收益。从零训练的 ModAR 平均成功率 75%,略高于视频模型初始化的 Flex-π(72%),训练 FLOPs 约少 20 倍。[3]
复跑 ACT 的 CVAE 消融:论文里的大幅下降没有重现 · manipulation
ACT 原论文报告,去掉 CVAE 编码器后两项仿真任务的平均成功率从 35% 跌到 2%。作者用原始代码重跑,这个降幅没有再出现。训练时长和 checkpoint 选法都能让两种策略的高低反转,推理时 ACT 本来就把该隐变量置零。代码与评测工具已公开,很多操作策略把 ACT 当基线,这个复现结果对它们直接有用。[4]
TEMPO:给 VLA 补上时序上下文,做动态操作 · vla
VLA 只看单帧,判断不了物体往哪动,也分不清外观相似、实际处在任务不同阶段的状态;作者认为模型再大、延迟再低也解决不了这两点。TEMPO 不改骨干,只加两路输入:冻结视频基础模型提取的运动摘要,以及一段本体感知历史。瓶子交接任务成功率从 44% 提到 74%,同时放出 5 万余帧标注的 TEMPO-Bench。[5]
Weave:从人-物交互数据学人形全身灵巧移动操作 · locomotion
一个策略同时控制 29 个身体关节和 12 个手指关节,人类动捕数据先做接触感知的重定向再用于训练。九种物体上,训练过的交互成功率 92.5%,未见过的序列不再训练也有 65.0%。作者另外公开约 9000 条真实物理执行的轨迹,共约 23 小时,带接触标注。[6]
机器人数据工厂:把数据采集变成持续的科学生产 · benchmark
Sami Haddadin、Ivan Laptev、Ian Reid 等人联名提出,物理 AI 的核心资源是保留“感知、动作、后果”链条的机器人经验,原始数据本身不够。框架把训练场、任务课程、外部真值和持续更新的基准串成“部署、测量、学习”的循环,并推导了机队规模、传感器频率与训练算力之间的定量关系,已在家庭、环境、能源三处实体训练场落成。[7]
AdaDE:把稠密 VLA 改成 MoE 再关掉部分专家 · vla
机载算力放不下越来越大的 VLA。AdaDE 把部分 FFN 转成 MoE 层,按路由统计动态停用专家:停用 40% LLM 参数后,LIBERO 平均成功率仍有 95.1%,RobotWin2.0 全部 50 项任务平均 42.0%。[8]
其他今日论文:WholeBodyWAM(把预训练世界-动作先验接到人形全身控制器上,仿真总成功率 91.9%,[9]);Fingers as Legs(仿人手用手指爬行、转向、跌倒后爬起,还能边支撑自重边按键盘,[10]);重新审视视觉运动策略对本体外观的依赖(用规范化末端表示替换机器人外观,提升人到机器人的迁移,[11]);腕带压力阵列估计全手姿态与接触力(单用户手指关节平均误差 4.6°,[12]);sensVLA(装载机 VLA,激光雷达 BEV 特征直通动作专家,摄像头失效时性能衰减少 29%,[13]);世界-动作模型综述([14]);具身世界模型综述:从看起来合理到可控再到可执行([15]);IRR:复用 VLA 表征做自我评估与策略改进([16]);GeoLAM:从无标注人类视频学几何约束的潜在动作([17]);UniDex-ViTac:人类视频引导仿真生成视触觉灵巧操作数据([18]);SAVLA:对称性感知 VLA([19]);XRoboToolKit-T:带触觉反馈的遥操作采集([20]);CorrRisk-WM:面向安全轨迹规划的风险世界模型([21]);BRAVE-6D:主动视觉 6D 位姿估计基准([22]);ManiSkillFormer:无需示范的组合式操作([23])。
开源·工具·评测
· Open-RAIL:中国移动开源的工程底座,把 VLA、WAM 模型接到机器人本体上,推理、真机执行、数据回流、模型迭代走同一套流程;目前支持 4 款异构机器人和 10 个模型,接入新模型最少 50 至 100 行代码 [24]
· 原力灵机 DM0.5:4B 具身基座模型,权重放在 GitHub 与 Hugging Face;公司宣称登顶六个评测榜,其中智元发起的 RoboColiseum 拿下四项第一,空间推理得分 0.6146,RoboDojo 综合得分 24.90 ⚠️ 厂商口径 [25]
· ZDTaichu5.0-9B:紫东太初开源的 9B 通用多模态模型,量子位称其在九项空间理解基准中拿到八项第一,同时演示了控制机械臂收纳美工刀 ⚠️ 厂商口径 [26]
· FluxVLA Engine:配置驱动的开源平台,统一数据集、世界模型、动作头、分布式训练、仿真评测、推理加速与真机接口,集成 Real-Time Chunking 和人工接管纠错采集([27])
· Neverwhere:视觉跑酷评测套件,含 60 余个城市室内外 3D Gaussian Splatting 重建场景,用于闭环测试,并附只用 splat 数据训练会在新场景掉点的对照实验([28])
▎ 融资与交易
May Mobility | SPAC 合并上市 | 最多募资 3.37 亿美元 | 企业价值 14 亿美元 · autonomy
May Mobility 将与 Atlas Credit Partners 关联的 ACP Holdings Acquisition Corp. 合并,在纳斯达克上市,代码“MAY”。总募资最多 3.37 亿美元:1.2 亿美元 PIPE 已全额认购,另有最多 2.17 亿美元来自信托账户,实际金额取决于股东赎回情况,预计年底前交割。它 2025 年收入约 1000 万美元,毛利率 27%,全年烧钱约 9300 万美元,自 2017 年成立以来累计融资约 4.45 亿美元。公司正转向“自动驾驶即服务”,由车队伙伴承担车辆、场站和运维成本,自己收授权费或按单收费;据 Axios,其长期目标是毛利率最高 70%。运营上,May 称在美国和🇯🇵累计完成逾 55 万次商业自动驾驶出行,与 Uber 在阿灵顿的合作计划今年四季度或明年一季度上线。收入规模与 14 亿美元估值差了两个数量级,上市故事押在授权模式上。[29]
哈啰 Robotaxi(上海造父智能科技)| 新一轮 | 约 1 亿美元 | 投后估值近 30 亿美元 · autonomy
上海国投先导资本领投,闵金投、创世伙伴创投跟投。这笔钱主要投研发,重点是万卡集群算力平台、端到端大模型迭代和数据供应链建设。[30]
Robocurve | 种子轮 | 1000 万美元 · adjacent
Initialized Capital 领投,Notable Capital、Decasonic、Y Combinator、Halcyon Futures 等跟投。Robocurve 注册为公益公司,定位第三方审计方,专门测评前沿 AI 模型接上真实机器人后能做什么,并称不让被测的 AI 公司左右结论。公司称其研究发现,在简单机器人任务上,大语言模型能胜过部分 VLA 模型。[31]
图睿智能(杭州)| 首轮 | 数千万元 · embodied
动力未来科技、通力科技等产业资本联合产业投资人投资。图睿做具身机器人 ODM,同时供应真机场景数据,自研集成关节、运动控制器和数采训练系统;新资金投向中试基地和规模化产线。[32]
视塔机器人(深圳)| Pre-A 轮 | 金额未披露 · hardware
出资方包括哈勃投资和深高新投,信息来自天眼查登记。DoNews 称视塔是触觉与数采供应商。[33]
▎ 商业化落地与部署
特斯拉 Robotaxi 开进迈阿密 · autonomy
特斯拉在 X 上宣布 Robotaxi 服务已在迈阿密开通,公布的地图只覆盖西迈阿密一小块区域。Mashable 称这批车不配安全监督员。此前特斯拉 4 月在休斯敦和达拉斯做过有限投放,奥斯汀上月才从有限区域扩到全面开放。同一周,NHTSA 就 Cybercab 认证向特斯拉发出了问询(见产业动态)。[34]
卡特彼勒无人矿卡在 Luck Stone 扩大投运 · autonomy
骨料生产商 Luck Stone 扩大与卡特彼勒的自主运输合作。依据是 Bull Run 采石场的运行结果:2024 年 11 月上线以来,无人卡车已运输超过 350 万吨。Luck Stone 工程与运营支持副总裁 Travis Chewning 说,自主运输“让工作场所更安全,也让给客户的产出更稳定”。[35]
银河通用称机器人商业部署超千台 · humanoid ⚠️ 厂商口径
9 月 15 日上合组织数字经济论坛上,新任董事长尹方鸣首次公开亮相。据银河通用介绍,其机器人商业部署已超千台,客户包括宁德时代、博世、西门子、丰田、上汽、北汽,做上下料、分拣、搬运、打螺丝等工序;服务场景覆盖约 50 座城市,落地近 200 个“银河太空舱”。公司没有拆分这千台里有多少在第三方客户产线,这恰是梅卡曼德 CEO 邵天兰此前质疑的焦点。[36]
Zhilai 称打磨、检测机器人批量进入 Tier 1 产线 · industrial ⚠️ 厂商口径
2021 年成立的 Zhilai Embodied Intelligence 称,其高速拍照检测、力控打磨、熨烫机器人已在多家全球头部汽车零部件厂的产线批量使用,报道未给出客户名和台数。董事长兼 CEO 余琼在汽车业做了近 30 年,曾任福特 STA 与采购高管;研发团队来自阿里 AI 团队和南京大学强化学习团队等。[37]
▎ 产业动态
NHTSA 要求特斯拉说明 Cybercab 怎么过的认证 · autonomy
继上周 NHTSA 审计 Cybercab 自证合规后,美国监管机构正式要求特斯拉在 9 月 30 日前作答。问题很具体:测试和认证时是否临时装过方向盘、踏板等人类驾驶控制件;车辆能否由人操控;乘客能否用触屏让车移动;速度、运营区域、时段是否受限。答案决定认证时的车辆配置与商业运营时是否一致。这次问询属于审计程序,并不代表 NHTSA 已认定特斯拉违规。NHTSA 同时在修订踏板、后视镜、雨刮、灯光等条款,修订完成前,厂商只能满足现行标准或申请豁免。[38]
韩国物理 AI 五年路线图:1.41 万亿韩元押在两地工厂 · industrial
韩国科学技术信息通信部 16 日公布 2026—2030 年研发路线图,庆尚南道和全罗北道两个物理 AI 项目合计 1.4131 万亿韩元(约 10.1 亿美元)。庆尚南道主攻精密制造:以大动作模型为核心,用工人与机器人的动作数据训练 AI,直接控制现场设备,再用结果回训。全罗北道做工厂平台,由 AI 设计并运营一座整合多家厂商机器人的“黑灯工厂”。首尔大学教授车锡元说,庆尚南道已有 13 家企业同意共享厂内老师傅的隐性知识数据。验证后的技术计划推广到其他工厂,最终打包成“K-制造工厂”出口。[39]
智界 RX 获 L3 级自动驾驶道路测试牌照 · autonomy
余承东转发确认,智界 RX 正在城市快速路等复杂路段实测。车辆搭载 4 颗激光雷达和 38 个融合感知传感器,配乾崑智驾全域冗余架构,预售价 29.98 万元起。这张是道路测试牌照,还不是 L3 商业运营资格。[40]
零跑世界模型智驾下探 10 万元内车型 · autonomy ⚠️ 计划口径
零跑技术日发布自研世界模型辅助驾驶系统,不依赖 BEV 感知和规则代码,激光雷达只做安全冗余。创始人朱江明说,截至 8 月底零跑已交付 35 万辆激光雷达版车型,将全部免费升级到世界模型版本。其中最早一万多台硬件平台不同,光算法移植就要至少 5000 万元。高阶辅助驾驶还将下放到 A10 等 10 万元以内车型。[41]
宇树中报:科研教育占营收 73.6%,工业场景约 9% · humanoid
继 IPO 门槛收紧传闻令宇树跌破 500 元后,9 月 15 日宇树收于 469.8 元,连跌 6 个交易日,总市值 1900 亿元,较上市首日缩水约 57%。据 36氪梳理的中报,宇树上半年营收 11.52 亿元,同比增 48.54%;扣非净利润 2.44 亿元,同比降 19.34%。收入结构里科研教育占 73.6%,商业消费占 17.39%,工业制造、巡检、物流合计只有约 9%。36氪另称千寻智能、星海图、星动纪元被曝遭同行举报,三家尚未见回应。[42]
小鹏发布 XCoT 技术报告:推理标记直接放进动作空间 · autonomy
传统 VLA 的场景理解、语义推理和动作生成之间有时间差。小鹏基座模型团队的做法是少写描述未来的 token,只生成少量结构化决策标记,存进动作空间,供负责轨迹的 Control FFN 直接读取。决策先收敛到减速、保持、左转这类方向,再由 Flow Matching 展开成多条具体轨迹。训练用的“推理—动作”混合监督数据共 362 万条,验证场景是自动驾驶。小鹏说这套决策词表以后可以扩到机器人。[43]
松延动力 HERON-CRA:加了强化学习,叠袜子成功率升到 97.8% · embodied ⚠️ 厂商口径
松延动力旗下 Scalabot 发布 HERON 体系的第二个模型,主打记忆和从失败中修正。官方数据是,叠袜子任务只用模仿学习时成功率 38.5%,开启 RL Engine 后 97.8%,整个流程超过一分钟。演示覆盖 ARX 机械臂和轮式人形 Noetix M1 两种本体。智东西看视频后指出,机械臂稳定性似乎不足,切菜段长短也不均匀。[44]
云深处问询回复:四名核心技术人员出自同一被裁撤的四足团队 · industrial
中信建投撰写的首轮问询回复显示,云深处 CTO 李超、预研副总监储振、研发副总监莫小波都曾在南江机器人“赤兔”四足预研项目工作,2017 年项目团队被裁撤后陆续加入云深处;硬件组主管李丰也来自南江。回复用“南江主营 AGV 与仓储机器人”论证两家无技术依赖。基本面解码质疑,该论证比较的是两家公司的主营产品,没有回答核心技术从哪来。[45]
Wonik Robotics 在三星晶片厂测试轮式人形机器人 · humanoid
Wonik 执行董事 Kim Min-cheol 说,公司正与三星电子等半導體大厂做轮式机器人 PoC,用来搬运晶圆等物料。三星的评估分三阶段,要考察设备对微振动和粉尘的耐受;即便通过,初期供货量也有限,时间和数量均未披露。[46]
地平线余凯:全球自动驾驶核心供应商最后可能只剩两三家 · autonomy
余凯 9 月 15 日判断,行业终局是 80% 主机厂找供应商合作,20% 头部车企垂直自研,第三方供应商自己也会淘汰集中。[47]
硬件·供应链
· 绿的谐波:约 14 亿元定增项目规划新增 100 万台谐波减速器和 20 万套执行器年产能,达到可使用状态的时间从 2026 年底推迟到 2028 年底;9 月 14 日股东会通过赴港上市议案,研发清单新增行星减速器、行星滚柱丝杠、一体化电缸和力控关节模组。上半年营收 3.49 亿元,同比增 38.64%,标题所指宇树自研减速器一事,正文未给出具体进展 [48]
· 灵巧手:机器人大讲堂梳理称,单只价格已从早期 10 万元级降到万元以内,销量正从万只级向十万只级爬升,整机硬件毛利率普遍在 10% 上下,利润向上游零部件集中 [49]
· 帕西尼触觉晶片:创始人罗霄恒称,过去一年自研触觉感知晶片累计出货突破 100 万颗,今年出货量将同比翻倍,最小可感知约 0.005N 的力(B++ 轮已报)[50]
--- The 09-16 briefing is done. Two things to flag: - No WeChat articles today. The input had only arXiv papers and Google News, so the whole issue is built on those. Every source token is a `[G]` token. - Items I cut: - 帕西尼 (PaXini) with Samsung as an investor: Dealroom blocked the fetch, and the B++ round was already covered on 09-15. - Waabi's +80% freight volume: the article wouldn't load and the headline is the only source for the number. - 深兰机器人 (DeepBlue Robotics) going bankrupt: the only source is an opinion piece, and its wording on the liquidation stage is vague.文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。
FutureX · 记录未来如何发生
素材来源多方媒体/网络新闻