━━━━━ 正文从此处全选复制 ━━━━━

FutureX · Physical AI

今日要点

· 两台人形机器人合作切下一枚胆囊,UC San Diego 的活体手术登上《Nature》

· MIT 与 Motional 把可解释模块装上真车,同日《Nature》另一篇讲清了「幽灵刹车」

· 卡兰尼克的 Atoms 累计融资 17 亿美元,Uber 也投了 1 亿

· 解放军总医院用 AI 超声机器人导航,完成先心病经导管封堵

· 爱仕达两连板,具身机器人业务至今只做出 13.72 万元收入

· LG 电子在备双足人形平台,执行器约占整机物料成本六成

· 一段视频教会新任务,具身智能开始押注 in-context learning

▎ 论文进展

两台人形机器人合作完成活体胆囊切除 · manipulation

长期以来,做手术的机器人都得是专门定制的重家伙,一台就有1800 磅重,还得配上专属手术室、专用器械和一整支受过训练的团队才能用起来。UC San Diego 的工程师联手外科医生,换了一个思路:他们找来一台身高约 5 英尺、重约 60 磅的通用人形机器人,团队给它起名叫 Surgie,靠遥操作来完成活体胆囊切除手术,一共做了两例,一例是机器人和人类外科医生一起上手,另一例干脆是两台人形机器人互相配合,实验对象是大型非灵长类哺乳动物。资深作者 Michael Yip 表示,「这项研究表明人形机器人在外科领域有可行的未来」,他觉得这套东西真正的价值在于,能让农村医院和资源紧张的地区也负担得起机器人手术。团队同时也坦承还有几个坎没迈过去:手术过程中得反复重新标定,耗时比现有系统更久,而且一旦要远程操作,通信延迟就会成为绕不开的问题。[1]

CW-Net:让自动驾驶的黑箱决策说出理由,且不是事后编的 · autonomy

过去大部分可解释性研究都停留在仿真和玩具场景里,而这篇论文把相关模块真正装进了实车。MIT 和 Motional 合作做出的概念织网器(Concept-Wrapper Network)嵌在机器学习规划器的中间层,能把系统内部的推理过程翻译成「正在接近停驶车辆」这类人类看得懂的说法,而且要求车辆最终做出的决策必须依据这些概念,这样一来解释就和车辆的实际行为构成因果关系,而不是事后硬凑的说辞。训练所用的数据里包含 1.3 亿条带标注的驾驶场景样本。有一次路测特别能说明问题:车辆好几次在骑行者附近毫无来由地停下,安全员本以为是系统识别出了骑行者,可 CW-Net 给出的实时解释却显示,模型根本没有正确配置骑行者检测功能,那次停车其实是近距离触发的紧急制动造成的,工程师正是靠这条线索才定位并修复了问题。第一作者 Eoin Kenny 说,与其干猜车子为什么突然停下,不如靠这种实时数据在部署过程中直接检验系统。[2]

MetaEarth3D:一句话生成无界的三维地球 · world-model

低空无人机和无人车要训练模型,卡的地方一直是真实三维实景的采集和标注太贵。北航团队干脆把生成式基础模型从二维遥感影像往上推了一层,直接做到了世界尺度的三维场景:只要给一段文字描述或者一张卫星图,就能生成从地形一路延伸到城市街区、连续一致又能无界扩展的显式三维世界,而且这个世界自带高度、距离等原生空间标注,可以直接导入 UE 或 Unity 使用。为了绕开数据不够这个瓶颈,团队想的办法是把三维场景转换成二维图像作为监督信号来训练模型。这个模型有 46 亿参数,训练数据大约是全球分布的 1000 万张图像,在一张 RTX 3090 显卡上跑大约 2 小时,就能生成约 17 平方公里的城区级场景,实测下来能让空间理解能力平均提升 22.85%。团队也说清楚了目前的局限:现在生成的场景只能定格在某一个时刻,还没法呈现季节变化或者建筑的增建拆除。[3]

VLAct:VLA 预训练的目标该是骨干网络,不是策略 · vla

论文起点是一个反直觉的实验现象:先用 OFT head 继续做预训练,然后下游换成 PI head,成功率不升反降,从 60.5% 掉到了 55.1%,如果换成 GR00T head,跌得更狠,从 51.2% 掉到 28.9%。研究者把这种现象叫做 head-specific representation collapse,意思是动作预测变准了,不代表骨干网络也变得更通用了。VLAct 给出的解法是,让三种连续 action head 同时挂上去共同监督,同时保护好视觉编码器和浅层结构,只统一那些真正一致的动作维度,等预训练做完,这些 head 全部丢弃不用。整个继续预训练过程只用了开源数据和 16 张 GPU,在 RoboTwin 2.0 上成功率达到 92.5%,LIBERO-Plus 上是 82.6%,在 RoboDojo 榜单上更是超过了所有明确标注为 world action model 的参赛模型。最能体现迁移能力的一个例子是 RoboCasa-GR1:GR-1 这台机器人此前在预训练数据里从没出现过,结果只用 20% 的下游数据,就超过了 NVIDIA GR00T N1.6 用全量数据训出来的基线。模型、checkpoint、训练代码和整条 pipeline 都已经全部开源。[4]

今天还有几篇论文值得一提:一篇是《基础模型时代的人类中心智能综述》,由香港理工大学郭径材团队牵头,联合北大、同济、阿里等多家机构,按三视角六层次的框架,把从「看见人」到「行动如人」相关的方法和资源重新梳理成了一张领域地图([5]);还有一款假肢电子皮肤,塞在假肢接受腔和残肢之间,能追踪压力出现的位置、强度和持续时间,研究者在三名下肢截肢者做坐、走、爬楼、跳跃和跑步动作时,用它识别出了跑姿改变导致的过压点,一旦检测到危险压力,它对同类压力会变得更敏感,相当于形成了一种电子记忆(发表于 Cyborg and Bionic Systems,没有 arXiv 版本);另外还有一项关于非完整多移动机器人避障编队控制的研究,上海大学和河南科技大学的团队把触发阈值交给一个随时间演化的内部变量来决定,让机器人只在真正需要的时候才通信,仿真和真机实验都显示,通信量能大幅下降,跟踪精度却基本没受影响(发表于 International Journal of Intelligent Robotics and Applications)。

开源·工具·评测

· Microduck:Hugging Face 旗下 Pollen Robotics 推出的一款售价 399 美元的开源机器鸭,里面塞了 15 个高精度电机、一个激光雷达、双惯性传感器和一个高清摄像头,走路、翻身、抓取、滑行这些动作都是靠强化学习训练出来的,而不是靠人工逐行写死;从仿真训练到模型导出的整条流程,团队都按 Apache 2.0 协议开源了出来,预售开启后 24 小时销售额就超过了 260 万美元,新下的订单现在要等 4 到 6 个月才能交付 [6]

· Human-Centric AI 资源库:伴随那篇综述一起放出的 GitHub 资源库和网站,把数据集和基准按人类主体、人类动态、人类交互、人类具身这四类分好类,还把重建、语义、生成、交互、效率等各种评价指标都汇总在一起,作者说后续会持续更新 [7]

▎ 融资与交易

Atoms(美国)| 累计融资 17 亿美元 | a16z 领投 | Uber 战略投资 1 亿美元 · autonomy

离开 Uber 整整九年之后,卡兰尼克(Travis Kalanick)又把自动驾驶摆回了自己公司业务的正中央。据金融时报报道,Uber 已经向 Atoms 投了 1 亿美元,双方就未来 Atoms 的技术能否上线 Uber 平台跑 robotaxi 有过初步接触。带队负责 Atoms 自动驾驶与 robotaxi 业务的是 Anthony Levandowski,他是 Waymo 的联合创始人,后来又去负责 Uber 的自动驾驶,此前曾因窃取谷歌自动驾驶商业机密被定罪,2021 年获得特朗普赦免;今年 3 月,Atoms 收购了他名下做矿业等重工业自动化的创业公司 Pronto。Atoms 这家公司是卡兰尼克 3 月把自己控股的主体 City Storage Systems 改名而来的,随后完成了由 a16z 领投的 17 亿美元融资,目前员工人数已经超过 2000 人,公司还打算继续靠收购来补齐自动驾驶团队。卡兰尼克在 a16z 的一场活动上说:「很多本来会在 Uber 身上慢慢发生的事,我们现在正在做。」[8]

VAST | B 轮 + B+ 轮 | 合计约 30 亿元 | 半年累计约 50 亿元 · world-model

这轮由经纬创投领投,完美世界、蓝色光标、芯动能等产业资本以及鼎晖 VGC、中金资本、CMC 资本等财务投资方跟投,达晨财智、春华资本、绿洲资本这几家老股东更是超额追投。这家公司做的是 3D 原生基础模型,核心产品 Tripo Studio 已经服务了全球数千万用户,Tripo 也已经接进了网易、腾讯、字节和微软的工作流里。不到半年就累计融到约 50 亿元,刷新了 AI 3D 领域的融资额纪录。三维资产的生成成本,恰恰是世界模型和仿真训练场绕不开的一环。[9]

天工机器人(北京天下先智创)| 新一轮 | 数亿元 | 出资方揭晓 · industrial

本月初已经披露完成数亿元融资,现在出资方名单也定了下来:初芯资本领投,经纬创投、合肥国资等跟投。这家公司主要做物流分拣场景的人形与智慧分拣方案,融来的资金将用于扩产分拣类机器人、研发和迭代人形分拣机器人的商用能力,以及拓展海外市场。全球出货量从 2024 年的约 0.26 万台,涨到了 2025 年的 1.66 万台,公司预计 2026 年这个数字会增至 8.17 万台⚠️ 厂商口径[10]

▎ 商业化落地与部署

AI 超声机器人导航下完成先心病经导管封堵 · embodied

患者是一名 48 岁男性。解放军总医院第六医学中心心血管病医学部在 9 月 6 日完成了一例经导管先天性心脏病封堵手术,整个过程中由 AI 超声机器人系统独立完成图像采集、病变识别和实时导航,引导封堵器精准释放到位。医院方面说,这套系统实现了图像识别和手术操作之间的双向智能协同,能降低复杂介入手术对医生超声功底的依赖,经权威检索属于全球首例。除了常规的心血管诊疗,院方还提到未来可能延伸到的方向,包括战场伤情评估、远程机器人手术和基层医疗支援。⚠️ 单方口径[11]

夏普与丰田自动织机把自动化仓库的出库计算压到原来的五分之一 · industrial

两家公司在 9 月 4 日宣布,联手搭建了一套用模拟量子退火来计算自动化仓库最优出库计划的方法和计算模型,并已经共同申请了专利。这套方法拿一座每天处理货物超过 10 万件的大型物流中心做了验证:先把设备能力、发货截止时间这些影响出库路径选择的条件量化,并按重要性加权,再交给夏普的模拟量子退火技术去求解。在同样的出货条件和计算环境下,推导出最优出库计划所花的时间,被压缩到了丰田自动织机原有算法的约五分之一。两家公司说这样能缩短作业人员的等待时间,接下来还想把这套方法用到入库计划和库存布局上。[12]

育种机器人「吉儿」发布具身智能版本,一次授粉不到 10 秒 · embodied

它右手拿着花粉管,左手拿着授粉笔,先蘸一点花粉,再在番茄花蕊柱头上轻轻扫过,整个动作不到 10 秒就能完成一次授粉,一次蘸取的花粉量大概够用 50 次。这个 9 月 4 日在北京发布的新版本能完成花蕊识别、定位、授粉和表型采集,难点在于既要避开枝叶的遮挡,又要在作物丛中认出针尖大小的花蕊。真正让这件事变得可行的还有生物技术那一半:农业专家事先改变了作物的花型,让原本被包裹住的柱头露了出来,省掉了用手捏开花瓣去找柱头的步骤。「吉儿」出自中国科学院遗传与发育生物学研究所许操团队之手,2025 年 8 月首台自动巡航杂交授粉育种机器人发布时,相关成果就已经发表在了《细胞》上。[13]

元点机器人 Bridge「小桥」拿下 IFA 创新奖,开售首日 600 台 · humanoid

极客版首发定价 8888 元,官方称 9 月 2 日开售当天销量就突破了 600 台,登上了京东人形机器人销量榜第一名。这台机器人在 IFA 2026 拿下了「Best in IFA Next & Emerging Technologies」类别的正式奖项,评委 Sascha Pallenberg 的颁奖词着重提到了它的开源设计。出厂时就支持双足行走和避障,还对开发者开放了 SDK、运动控制 API,以及动捕、VR 接入接口,配套的 OpenBridge 则提供统一的开发工具和 Skill Hub。花这个价钱买到的其实是一个可编程的开发平台,还不是一台真能干活的机器人。⚠️ 厂商口径[14]

Waymo 推出邀请制订阅 Waymo Premier,每月 29.99 美元 · autonomy

订阅用户每一程都能返 10% 的 Waymo Cash,如果赶上繁忙时段返得更多;此外还有优先接驾、跳过排队、优先体验新城市的服务,以及每月最多 5 次的免费取消额度。Waymo 表示,这个订阅制其实是用户自己提出来的需求。在全美车队规模已经超过 4000 辆(此前已报道)的背景下,推订阅制相当于往前迈了一步,把高频用户的乘车频次和留存都锁定下来。[15]

特斯拉称 Robotaxi「下个月左右」进入 24 小时运营 · autonomy

特斯拉 AI 负责人 Ashok Elluswamy 本周在 X 上回复一名想在深夜使用 Cybercab 的用户时说,等「v15 计划中的下一项技术」完成整合之后就能上线,但他没有说清楚具体是哪项技术,也没交代会先覆盖 Cybercab 还是现有的 Model Y 车队。目前这项服务是每周 7 天不间断,每天运营时间为6 时至 22 时,覆盖奥斯汀、达拉斯、休斯敦、迈阿密、奥兰多和坦帕几座城市。相比白天,夜间光照条件差,对感知和决策能力的要求也更高。⚠️ 计划口径[16]

迪拜公司与江苏云幕智造签五年协议,合同产能至多每年 1 万台人形机器人 · humanoid

协议是在太仓签署的,迪拜的 No Competition Infinity Gaming Development Services 公司与江苏云幕智造达成合作,双方初步评估了建筑、房地产开发、游戏、教育与技术培训等应用场景。至于1 万台这个数字,通稿里其实自己就写明了,这个数字还会随着项目进展、技术验证和商业应用的扩展做调整,并且「不代表已确认的订单或部署量」。⚠️ 计划口径[17]

▎ 产业动态

看一遍视频就上手,具身智能开始把筹码押到上下文学习 · world-model

Skild AI 的 S1 只需要看一遍人类演示视频,就能在不更新权重、不做后训练的情况下尝试从没训练过的新任务,任务最长能持续十分钟、走完几十个步骤,栽花、翻煎饼、冲咖啡、组装配件这些都超出了它的预训练数据范围。这里的数字需要仔细看:在同样进行了 10 万小时预训练的对照组里,用视频演示做提示能得到 66% 的分数,而用语言提示只有 9%;但这个分数其实是各任务步骤累计成功率的均值,其中还包含了人工救场的部分。Skild 自己估算过,要靠额外训练达到单靠一段视频就能达到的水平,大概需要 380 条遥操作演示,也就是 50 到 100 小时的量;而如果给到 2000 条,额外训练的成绩会升到 86%,反过来超过单视频的表现。差不多同一时期,Generalist AI 的 GEN-1.5 也把 one-shot 当成了核心能力来打磨,而更早之前,李飞飞、Jim Fan、Yuke Zhu 等人做的 RoboTTT,是第一次把上下文 scaling 这套思路系统性地搬到机器人视觉运动策略上。国内也已经有创业公司跟上了这股风潮:可可矩阵今年 4 月才成立,创始人高宇翔出身西安交大少年班,后来在约翰斯·霍普金斯读博期间辍学,此前在傅利叶带队打通了全尺寸人形机器人从遥操作到部署的整条链路,他走的路线和前面两家不太一样,是把 ICL 从后训练阶段直接前置到了预训练阶段。堆数据带来的边际收益正在下降,这其实是整个行业换 scaling 维度的一次集体转向。⚠️ 厂商口径[18]

LG 电子在准备双足人形平台,机器人放进集团分工 · humanoid

「大家或许在 CES 上见过没有腿的移动式 CLOiD,但我们也在准备具有人形双腿的机器人平台。」LG 电子生活家电解决方案事业本部长 Baek Seungtae 在 IFA 2026 期间的一场记者座谈会上这样说道。他给出的时间节奏是工厂先行、家庭在后:人形机器人不久后就会部署到美国田纳西工厂和昌原智能工厂,而家庭环境因为突发状况多、安全方面要考虑得更充分,不过他也说「机器人进入家庭的时间可能比人们预想得更早」。集团层面的分工已经安排好了,LG Innotek 负责眼部模块和传感器,LG 化学负责材料,LG CNS 负责数据,LG 电子则承担关节等制造环节。至于中国家电企业发起的低价攻势,他的判断是,过去中国企业的降本幅度大约是 10%,但今年上半年已经出现了成本反而上升的苗头,低价策略不会一直维持下去。⚠️ 演讲口径[19]

爱仕达两连板,具身机器人业务累计做出 13.72 万元 · humanoid

爱仕达(002403.SZ)发布了股价异动公告,公司主营业务仍然是炊具、小家电以及工业机器人,具身智能机器人属于新开拓的业务,还处在起步阶段,目前已经形成的销售收入只有 13.72 万元,技术能不能顺利迭代、项目能不能落地、商业化能不能实现,这些都还存在不确定性,公司预计这不会对本年度的财务状况和经营成果造成重大影响。合作协议签订于 2026 年 7 月 6 日,公司全资子公司爱仕达人形机器人有限公司与智元创新签了战略合作协议,合作范围写得相当宽泛:采购订单和产品交付、委托制造、供应链合作、技术支持、股权投资以及合资公司设立都在里面,目前部分合作还处在开展初期阶段。协议写的范围和已经实现的收入之间,隔着整整两个数量级。[20]

宇树机器人替理想汽车讲车,导览仍是人形最先赚到钱的活 · humanoid

人形机器人坐进车内体验座椅、测试空间感,机器狗则在旁边配合展示智能召唤和后备箱开合,这段理想 L9 Livis 的试驾视频,片头特意标明全程都是实拍。合作并没有只停留在视频里:宇树机器人「笨笨」已经在北京汽车博物馆担任讲解员,按照理想公布的安排,接下来它还会去珠海长隆表演特技,也会在郑州东站体验中心绕车讲解。招股材料里的一组数字解释了为什么这类活动很重要:2025 年前三季度宇树人形机器人的收入构成中,科研教育占了 73.60%,商业消费占 17.39%,行业应用占 9.01%,而在行业应用里头,企业导览又占到大约 50% 到 70%。2025 年宇树的海外收入约 7.32 亿元,占了总营收的 43.65%。人形机器人走出实验室之后,最先能落地的场景还是展厅、展会和品牌活动,任务不算复杂,但足以形成第一批商业订单。[21]

上半年约 438 亿元涌入具身智能,过半流向「机器人大脑」 · world-model

据统计,2026 年上半年具身智能领域的融资总额约为 438 亿元,超过一半都投向了大脑方向,其中光是 VLA 模型就吃掉了大脑部分 42% 的份额。同一时期,乘用车国内销量为 828.8 万辆,同比下降了 24.3%(数据来自中国汽车工业协会),而工信部装备工业一司司长郭守刚在世界智能网联汽车大会上披露,L2 级驾驶辅助的渗透率已经达到 70.5%,领航辅助渗透率也升到了 34.2%。等运动控制走向成熟、硬件本体又越来越同质化,资金自然会顺着定价权往上游走。具体路径已经出现分岔:蚂蚁灵波的 LingBot-VLA 2.0 适配了 17 家厂商 20 余种构型,走的是通用底座路线;面壁智能和吉利的 RoboHarness 押注端侧实时决策,已经在吉利工厂仓储实现了常态化作业;灵御智能的机器人则已经进入京东七鲜超市,单日能稳定作业超过 8 小时。⚠️ 汇编口径[22]

中国投资方要在俄罗斯乌苏里斯克建人形与工业机器人产业园 · industrial

康吉国际投资和远东发展公司旗下的 KRDV 滨海边疆区在东方经济论坛期间签下协议,将在乌苏里斯克现有「康吉」工业园的基础上,建设名为「康吉智联」的科技园,投资额为 30 亿卢布,包含生产车间、研究实验室和办公区。除了整机之外,中方还打算开发机器控制系统晶片和软件,并计划申请符拉迪沃斯托克自由港居民身份,以便享受税收优惠。KRDV 滨海边疆区负责人 Alexey Dunaev 称,这是在远东形成高技术集群的重要一步,俄方希望这个方案能适应当地的生产流程和远东气候条件。[23]

硬件·供应链

· 执行器(LG 电子):今年被列为新的 B2B 增长点,据估算,执行器大约占一台人形机器人物料成本的 60%,以特斯拉机器人为例,单台大概要配 30 个;LG 说自己有 60 年电机制造经验,跟竞品相比能把电机重量降低 30% 以上,不过目前还没掌握减速器技术,打算自研和外购同步推进;眼下还没和特定企业敲定订单,10 月将开会讨论生产准备工作 [24]

· 全固态电池材料(EcoPro):把人形机器人列为固态电池的优先应用场景,理由是价格高的时候先用在机器人上,等降价了再推给电动车;硫化物系固态电解质目前已经在运营一座年产 40 吨的中试工厂,并且通过了主要电池企业的质量验证,产线设计也已完成,目标是 2027 年实现量产;EcoPro BM 凭着这项成果入选了韩国产业通商资源部第三期「超级乙」项目 [25]

文中 [N] 为来源编号,全部来源链接请点文末「阅读原文」查看。

FutureX · 记录未来如何发生

素材来源多方媒体/网络新闻