Physical AI 日报

今日要点

· 智元上半年出货约 8400 台反超宇树,拿下全球人形 44% 份额

· 宇树科创板网上申购超额 8288 倍,中签率低至 0.0181%

· Archer 收购波音 Wisk、Insitu、SkyGrid,波音换得近 20% 股权

· 索尼联手台积电投 约 64 亿美元,合建物理 AI 图像传感器产线

· 小马智行自动驾驶里程破 1 亿公里,第四代无人重卡启动量产

· 诺因智能拿 5 亿元天使++轮,家用机器人折叠后不到 40 厘米

· 银河通用牵头的具身大模型北京市重点实验室揭牌

· 希迪智驾无人矿卡累计出货超 1900 台,上半年同比增 213%

一、论文进展

SimWAM:把视频生成只当训练信号,推理时整条视频分支可以扔掉 · autonomy

世界-动作模型(World-Action Model)给端到端自动驾驶带来了视频动力学先验,代价是推理时还要生成未来帧、延迟居高不下;SimWAM 用一个隔离注意力掩码让动作预测完全不依赖未来帧,训练完即可丢弃视频分支,只留一个自包含的轨迹规划器。视频专家与动作专家不共享参数、只经统一注意力接口交互,因此视频骨干可替换、动作专家可独立扩容。在 NAVSIM 上取得 91.5 PDMS,延迟显著低于此前基于 WAM 的规划器,并零样本迁移到 nuScenes;代码与权重已开源。(HF↑22)

Zongchuang Zhao et al. · arXiv 2608.07468 https://arxiv.org/abs/2608.07468

DriveTeach-VLA:先教模型该看哪儿,再教它怎么开 · autonomy

清华 AIR、北航与滴滴团队的一个判断是,自驾 VLA 的训练数据过度偏向文本化的 VQA 与思维链,语言推理漂亮但注意力涣散——模型说要"礼让行人",生成轨迹时却未必真盯着那个行人。DriveTeach-VLA 用 GroundingDINO 标出车辆、行人、交通灯等要素做视觉自蒸馏,再把专家轨迹从 BEV 投影回图像像素空间当提示,让基模已有的视觉能力能直接用上。NAVSIM 上达到 90.4 PDMS,叠加轨迹选择器后升至 92.7;代码与模型已全部开源。

杨予光 et al.(北航 / 清华 AIR / 滴滴)· arXiv 2607.01658 https://arxiv.org/abs/2607.01658 · ECCV 2026 接收

AtlasVLA:只用一个腕部相机,反而打赢了多视角基线 · vla

VLA 的反应式范式在部分可观测的长程任务上有两处硬伤:物体移出视野后的感知遗忘,以及多步执行中的任务进度遗忘。AtlasVLA 给出双记忆架构——把瞬时 2D 观测抬升进体素哈希的 4D 持久世界状态记忆,另配一路记录自身历史与任务进度的工作记忆,再以此为条件驱动 diffusion transformer。在 LIBERO-Long 上绝对成功率提升 9.4 个百分点,真机长程任务提升 17.5 个百分点

Guiyu Zhao et al. · arXiv 2608.06729 https://arxiv.org/abs/2608.06729

相机一挪 VLA 就失灵,这篇用跨视角动作一致性把它按住 · vla

在固定场景相机上微调出来的 VLA,任务、物体、指令、机器人状态全都没变,仅仅把相机挪个位置就会失败。作者把同一条 LIBERO 演示重置到相同 MuJoCo 状态、渲染标称与扰动两个视角,约束二者预测的动作流速度场在相同流坐标处一致。LIBERO-Plus 相机扰动赛道成绩 87.2%,比同数据纯流匹配训练高 7.4 个百分点、比朴素混相机 SFT 高 12.5 个百分点,标称视角性能不掉;真机未见相机位下成功率从 53.3% 升到 74.4%。打乱配对的对照组塌到 25.8%,说明收益确实来自动作等价配对而非数据量。

Bingqi Huang et al. · arXiv 2608.06965 https://arxiv.org/abs/2608.06965

C2Dex:从单目人手视频里抠出稳定接触,再迁移给灵巧手 · manipulation

灵巧操作的高质量演示昂贵稀缺,单目人类视频则要多少有多少——难点在于重建出的手-物接触时序不稳、物理上站不住,重定向时又保不住任务相关的接触几何。C2Dex 的做法是在物体规范空间里聚合逐帧噪声观测,恢复出稳定的物体侧接触,让这组接触同时充当重建的轨迹级约束和跨手型的迁移目标。DexYCB 与 TACO 上端到端轨迹成功率 57.78%26.67%,同评测口径下最强基线为 17.78% 和 10.00%。

Jie Ren et al. · arXiv 2608.07045 https://arxiv.org/abs/2608.07045

一颗 2.5×3 毫米的 IMU 当触觉,180 毫秒内定位到毫米级 · perception

精细操作中,被抓物体与环境之间那些一闪而过的轻微碰撞,人手毫不费力就能定位,机器人却常常分辨率不够、只能笨拙硬碰。TECDAR 把一颗 2.5×3 毫米的 6D 惯性测量单元放进夹爪指尖,以 7 kHz 采样捕捉亚毫秒级形变,数据流却只有 84 KB/s;融合机器人位姿做扩展卡尔曼滤波后,180 毫秒内完成毫米级定位,线接触与点接触任务平均精度约 7 毫米,足以让机器人在毫秒尺度上修正轨迹。

Haowen Zheng et al. · arXiv 2608.07075 https://arxiv.org/abs/2608.07075

只会向前预测不够:给 JEPA 世界模型的隐空间接上物理状态 · world-model

JEPA 系世界模型从观测序列学动作条件下的隐空间动力学,但纯前向预测目标并不保证单个隐变量能辨识出机器人自身的物理状态、隐变量对能辨识出状态变化,下游规划和策略因此受限。PSG-JEPA 加了两个只在训练期生效的接地目标——把单个隐变量接到本体感知状态、把隐变量对接到多时域关节角变化,推理架构与算力开销分文不加。探针辨识、冻结隐空间上的目标条件规划、仿真与真机策略学习三个层级上均优于此前的隐空间世界模型基线。

Haodong Yan et al. · arXiv 2608.06799 https://arxiv.org/abs/2608.06799

当协作变成攻击面:LLM 多机器人系统的通信攻击 · benchmark

此前的具身安全研究基本盯着单台机器人,多机器人协作里的通信风险还没摸清。作者构造了外部入口攻击与系统内特权攻击两种设定,在 DMAS、HMAS-1、HMAS-2 三种通信架构、三个 LLM、五项具身任务上测下来,不安全信息在三种架构里都能变成不安全动作:DMAS 的入口采信率达 96.7%、采信后激活率 100%,HMAS-1 的不安全动作成功率 97.8%。作者提出的溯源与验证门(CPV Gate)把违规率从 70.0% 压到 36.6%——压住了大半,但远不到能放心的程度。

Zhen Huang et al. · arXiv 2608.06830 https://arxiv.org/abs/2608.06830

Capek 0.5:按"执行"而不是按数据集来组织具身 VLM 的能力 · vla

机器人执行是迭代的——每个动作都会重塑场景,随之更新需要感知、推理与验证的内容。Capek 0.5 不按数据集或任务组织训练,而是按能力在执行链条中的功能角色划分为空间推理、时序理解、动作引导、状态验证四族,每族先由专才用可验证奖励的强化学习从共享骨干习得,再经权重合并与路由式策略蒸馏融进单一模型。发布 2B 与 35B-A3B 两个规模,并配套 Capek-StateBench 状态验证基准。

Ying Chen et al. · arXiv 2608.06756 https://arxiv.org/abs/2608.06756

其他今日论文:EMS 自适应 VLA 推理框架,用强化学习的切换策略在大小两套解耦系统间调度,LIBERO 上有效动作频率拉到 93.4 Hz(arXiv 2608.06434 https://arxiv.org/abs/2608.06434);TEMPO 把 VLA 的语义投影层与动作专家拆成两个时间尺度做 RL 后训练,快更新不再冲垮高层语义(arXiv 2608.07314 https://arxiv.org/abs/2608.07314);PILOT 让世界动作模型显式建模状态转移 token 作为运动思维链(arXiv 2608.06994 https://arxiv.org/abs/2608.06994);WNM-3D 给连续 VLN 的世界导航模型加 3D 场景条件(arXiv 2608.07267 https://arxiv.org/abs/2608.07267);时空敏捷性以时间约束 RL 让四足完成视觉引导的动态接球(arXiv 2608.06907 https://arxiv.org/abs/2608.06907);LyEvO 用李雅普诺夫稳定性分析加统计模型检验做安全 sim-to-real(arXiv 2608.06481 https://arxiv.org/abs/2608.06481);SoRoMoX 把 Cosserat 杆软体机器人模型做成可微、GPU 并行的实现(arXiv 2608.06650 https://arxiv.org/abs/2608.06650);CrossTracer 以轨迹残差做跨本体导航(arXiv 2608.06688 https://arxiv.org/abs/2608.06688);LifelongCrossNav 给跨楼层多目标导航加持久 3D 语义记忆(arXiv 2608.07079 https://arxiv.org/abs/2608.07079);自适应步态时序的容错运动控制应对大型四足硬件失效(arXiv 2608.07328 https://arxiv.org/abs/2608.07328);Vernata 做 LiDAR 点表征的自监督预训练(arXiv 2608.06919 https://arxiv.org/abs/2608.06919);驾驶 VLA 的规划 token 逐层探针与剪枝,追问动作到底需要多深的语言模型(arXiv 2608.07361 https://arxiv.org/abs/2608.07361)。

开源·工具·评测

· DRENDS:动态场景下的机器人内窥镜深度数据集,发表于 Nature 期刊平台,补的是软镜场景里深度真值稀缺这块短板 https://www.nature.com/articles/s41597-026-07775-2

· VicOne Isaac Sim 扩展:把 DEF CON 34 上的机器人攻击研究做成 NVIDIA Isaac Sim 免费扩展,让机器人安全测试能在仿真里跑 https://www.einnews.com/pr_news/931707977/vicone-turns-def-con-34-robot-hacking-research-into-free-nvidia-isaac-sim-extension

· Axis Robotics 仿真数据集:面向机器人操作研究放出新的仿真数据集 https://www.tipranks.com/news/private-companies/axis-robotics-showcases-new-simulation-dataset-for-robot-manipulation-research

二、融资与交易

Archer Aviation × 波音|收购 + 战略投资|波音持股近 20%、追加投资至多 5500 万美元 · adjacent

Archer 一口气从波音手里买下自动飞行公司 Wisk Aero、无人机制造商 Insitu 与空管软件公司 SkyGrid,双方 8 月 10 日签署最终协议。对价是新发行的 Archer A 类股与认股权证,波音由此将持有约 近 20% 股权,并保留交叉授权、在自家民用与国防平台上使用 Wisk 核心自动飞行系统的权利,同时承诺在 Archer 下一轮融资中投资至多 5500 万美元。对 Archer 而言这不只是补齐自动飞行能力:Insitu 有超过 3500 架无人机系统在 35 个国家服役,带来年营收超 2 亿美元的盈利性国防业务,三家公司合计近 200 万飞行小时的数据将并入 Archer 的 ZEE 人工智能平台。消息当日 Archer 股价大涨约两成。来源:波音 IR / PR Newswire

索尼 × 台积电|合资建厂|约 64 亿美元(1 万亿日元)|索尼约 60% / 台积电约 40% · hardware

两家公司将在年内成立合资公司,于索尼半导体熊本县菊阳工厂生产下一代图像传感器,目标 2029 年量产,投资规模相当于索尼集团半导体部门四年的资本开支,索尼同时在就补贴等事宜与日本政府磋商。此前双方是分工代工关系,转为合资共同生产是为了更快响应 AI 带来的需求变化——图像传感器正是物理 AI 里机器人与自动驾驶车的"眼睛"。索尼在 CMOS 图像传感器上长期握有约五成份额,但去年 8 月三星代工拿下 iPhone 图像传感器订单后压力陡增,中国豪威与三星都在以大额投资追赶。来源:日本经济新闻,经首尔经济转述 https://en.sedaily.com/international/2026/08/10/sony-tsmc-team-up-in-64-billion-deal-on-physical-ai-sensors

诺因智能(Knowin)|天使++ 轮|5 亿元人民币 · embodied

单笔 5 亿元经纬创投领投,红点创投、商汤国香资本、华登科技、L2F 光源创业者基金跟投,光源资本任独家财务顾问。公司 2025 年成立,做消费级具身智能大模型,自研 GLOW 生成式具身大模型架构——先从有限真机交互生成有三维结构与物理一致性的第一人称数据补数据缺口,再由世界模型判断动作会如何改变环境,任务反馈回流形成闭环。团队不到一年扩到 200 余人。今年世界人工智能大会上首发的家用机器人 KNOWIN-X1 采用全折叠双臂构型,折叠后高度控制在 40 厘米以内,可放上桌面、沙发或洗衣机;本轮资金将投向量产准备。来源:投资界 https://news.pedaily.cn/202608/567457.shtml

橡木果机器人(Acorn Robot)|天使轮|金额未披露 · embodied

招商局创投、蔚来资本共同领投,水木清华校友种子基金跟投,同步发布「Natus AGE-0 具身本能模型」。这条路线在当下扎堆 VLA 的行业里属于非共识:模型以触觉感知为核心信号源,依托接触力学原理提炼物理交互的底层规律,公司称可实现零数据冷启动与跨本体、跨物料的零样本泛化,摒弃大规模数据预训练范式。⚠️ 厂商口径公司成立于 2024 年底,核心技术团队由 9 名清华机械工程系博士、博士后构成,自 2018 年起共同做这个方向;商业上主动砍掉高毛利定制集成项目,只做标准化双臂柔性生产单元,面向快消、日化、食品等多 SKU 小批量场景卖"制造即服务"。来源:投资界 https://finance.sina.com.cn/jjxw/2026-08-10/doc-inimuzxr8193243.shtml

宇树科技(Unitree)|科创板 IPO 申购|网上超额认购 8288.82 倍|中签率 0.0181% · humanoid

继 8 月 6 日定价 150.80 元/股、发行市值 609.93 亿元之后,今日正式申购。网上有效申购户数 978.46 万户、有效申购股数 536.37 亿股,网上初步有效申购倍数 8288.82 倍,远超 100 倍的回拨阈值,主承销商据规则将 323.6 万股从网下回拨至网上,最终中签率仅 0.0181%。每个申购单位 500 股需缴款 7.54 万元,沪市 6 万元市值即可顶格申购,中签缴款日为 8 月 12 日。来源:新浪科技 / 环球时报 https://www.globaltimes.cn/page/202608/1367902.shtml

恒工精密 × 智元机器人|合资公司|恒智科科技成立 · hardware

企查查股权穿透显示,恒智科科技由恒工精密全资子公司恒工伟创具身智能科技、智元机器人关联公司智元创新科技等共同持股,经营范围含人工智能基础资源与技术平台、智能机器人研发。恒工精密主业是铸件与精密机加工,这类"零部件厂 + 整机厂"合资近来在人形供应链上并不罕见。来源:观点网 https://www.guandian.cn/article/20260810/582675.html

三、商业化落地与部署

小马智行全球自动驾驶里程破 1 亿公里,第四代 L4 无人重卡启动量产 · autonomy

8 月 10 日小马智行宣布全球自动驾驶里程突破 1 亿公里。更实的一条是货运线:第四代 L4 级纯电无人重卡已进入量产阶段,接下来数月陆续下线,投放至高速干线、西北大宗商品专线及港口;同期推出的 L4 级无人轻卡已进入密集路测,面向快递、商超与冷链。公司副总裁贺星此前的说法是,无人卡车规模化落地的时点已经到来。值得注意的是驱动力来源——按公司口径,卡车业务的成本下降主要来自 Robotaxi 千台级量产带来的供应链红利与摊薄,而非卡车技术本身的单点突破。此外小马智行与京东养车共建自动驾驶运维生态,保障 Robotaxi 车队运营状态。来源:观点网 https://www.guandian.cn/m/show/582710

希迪智驾中期收入 8.04 亿元,无人矿卡累计出货超 1900 台 · autonomy

2026 年上半年收入 8.04 亿元,较去年同期 4.08 亿元增长约 97%;期内亏损 1.13 亿元,较上年同期 4.55 亿元收窄 75%,经调整净亏损降至 1968.1 万元。落地数字比财务数字更能说明位置:截至 6 月 30 日智能化产品累计总出货量突破 23,000 台,自动驾驶业务已交付及待交付超 3400 台,其中无人矿卡累计出货超 1900 台、覆盖全球近 40 座矿山,上半年出货量同比增长 213.57%。今年 2 月与广纳集团签下的 500 辆无人矿卡采购订单,是截至 6 月底全球无人驾驶矿卡领域最大的单笔正式采购订单;上半年另在境内外获得超 400 台无人重卡意向性订单,挖采机器人出货 34 台。来源:观点网 https://www.guandian.cn/m/show/582822

FedEx 双臂机器人进挂车装载线,亚马逊今年机械臂数量要翻倍以上 · industrial

FedEx 于 7 月 30 日宣布在马里兰 Hagerstown 枢纽部署 Dexterity 的双臂 Mech 挂车装载系统,由其 Foresight 模型实时决策包裹码放位置。挂车装载一直是包裹物流里最难自动化的环节之一——需要力量、耐力和实时应变,而 FedEx 全美网络每天要装载数万个挂车。按其 2026 年投资者日的说法,未来数年计划把自动装卸推广到逾 20 个美国枢纽的数千个装卸门。同一天亚马逊 CFO 在财报电话会上称,2026 年计划把机械臂数量增加一倍以上,其网络自 2012 年以来累计部署机器人已超 100 万台。行业协会 A3 的观察是,非汽车行业近期已超过汽车行业成为工业机器人最大买家,亚马逊与 FedEx 正是这一转向的推力。来源:Supply Chain Dive https://www.supplychaindive.com/news/fedex-amazon-pursue-expanded-use-of-robotic-arms/827221/

五一视界物理 AI 核心收入同比增 545%,占比升至 41.4% · adjacent

上半年收入约 1.24 亿元、同比增长 129.8%,毛利率由 41.1% 提升至 44.8%,期内亏损同比收窄 25.5%。其中物理 AI 核心业务 51Sim 收入同比增长 545.1%,收入占比从 14.8% 跃升至 41.4%,从补充业务变成主要增长来源。公司针对具身智能的数据稀缺与容错率低两个问题推出 AperData 与 AperOne 两款新品,下半年进入商业化落地,年内 AperOne 目标实现千台级真实部署⚠️ 计划口径另与环天智慧启动全球首颗物理 AI 专用商业遥感卫星 ECS-1 研制。来源:封面新闻 https://k.sina.com.cn/article_1496814565_593793e5020023xrg.html?from=news&subch=onews

Palladyne AI 获美国空军追加 290 万美元,合同总额超 1060 万美元 · embodied

美国空军在 STRATFI 合同上行使选择权,追加 290 万美元,使合同总值升至 逾 1060 万美元。新资金对应一组演示里程碑:人类操作员与远端专家之间的混合现实遥操作、以少量演示让机器人自主学会复杂操作任务的人在环机器学习,以及在空军相关任务场景中的自主执行。其 Palladyne IQ 平台声称仅需 1 至 5 次人类演示即可泛化,且无需云端连接、与硬件无关。该项目 2023 年 9 月立项,首阶段已于 2024 年 10 月完成。来源:Auganix https://www.auganix.org/xr-news-palladyne-ai-usaf-contract/

小鹏 GX 首台 Robotaxi 量产车下线 · autonomy

小鹏 GX 的首台 Robotaxi 量产车已下线。中国车企在 Robotaxi 上的路径与 Waymo 一类车队运营商不同,走的是自有整车产线直接产出无人车的路子,产线节点因此比路测里程更能标定进度。来源:汽车之家 https://chejiahao.autohome.com.cn/info/25521705

四、产业动态

智元反超宇树成全球第一大人形厂商,上半年全球出货约 1.91 万台 · humanoid

据旧金山研究机构 Smart Analytics Global(SAG)周日发布的报告(经南华早报转述),上海智元今年 1—6 月出货约 8400 台人形机器人、占全球 44% 份额,同比增长 562%,首次超过宇树登上全球第一;杭州宇树以约 5900 台、31% 份额居次。两家的产品结构差别明显:智元铺开了全尺寸双足 A 系列、紧凑型 X 系列与轮式 G 系列多条产品线,宇树的人形出货仍高度集中于旗舰 G1,且教育、科研与表演类部署占相当比重。放到大盘看,上半年全球人形出货约 1.91 万台、同比增长 272%,其中中国厂商供应了逾 97%,国内买家贡献逾 85% 的需求;更关键的结构变化是工业与商用应用占比从一年前的约 50% 升至逾 70%,取代展演成为上量的主路径。SAG 预计全年全球出货接近 6 万台。⚠️ 汇编口径财务上两家差距同样明显:宇树招股书披露去年营收 17 亿元、经调整净利润 5.91 亿元,智元未披露财务细节,创始人兼董事长邓泰华 4 月在合作伙伴大会上称 2025 年营收超 10 亿元、2027 年目标 100 亿元。来源:South China Morning Post https://www.scmp.com/tech/tech-trends/article/3363544/agibot-overtakes-unitree-top-global-humanoid-robot-vendor-first-half-amid-ipo-push

具身智能大模型北京市重点实验室揭牌,银河通用牵头 · world-model

8 月 9 日,具身智能大模型北京市重点实验室在北京海淀揭牌并召开学术委员会首次会议,由银河通用联合北京大学、宁德时代共建,是国内具身大模型方向获认定的省部级重点实验室。实验室主任由银河通用创始人兼 CTO、北大研究员王鹤担任,学术委员会由中国工程院院士、鹏城国家实验室主任高文领衔,成员包括张建伟、曾文军、张宏江等 14 位中外院士专家,以及北大、清华、北航、中科大的学者。攻关聚焦具身大模型基础理论、多模态数据基建与标准化、机器人操作系统与中间件、整机与关键零部件五条主线,三个评价周期的目标依次是三年内突破全身全手端到端具身大模型技术、六年建成功能完备的市级重点实验室、九年成为原创科研高地。会上王鹤介绍了公司的 AstraBrain 大小脑基座模型体系,并称运动控制领域同样验证了 Scaling Law。⚠️ 厂商口径来源:中华网 https://life.china.com/2026-08/10/content_615387.html

7 月国内机器人融资 52 起,钱正往上游零部件迁移 · hardware

据机器人大讲堂不完全统计,2026 年 7 月国内机器人行业录得 52 起融资,种子/天使轮 23 起、A 轮系列 17 起,早期项目合计约 76%;地域上上海 14 起居首,广东 13 起、北京 8 起次之。⚠️ 汇编口径变量出现在结构上:核心零部件领域 7 月发生 13 起融资、占比 25%,较 6 月的约 20% 提升约 5.5 个百分点,是当月增速最快的方向。这 13 笔里触觉/力觉感知与关节/传动/执行各 5 家并列最密集,AI 芯片与数据 2 家。人形与具身智能整机仍以 19 起、36.5% 占比居首,星动纪元、一目科技、未来不远机器人当月均完成 10 亿元级融资——上游热起来并非整机降温,恰是整机量产预期放大了对传感器、关节模组、专用芯片的采购需求。来源:机器人大讲堂 https://m.sohu.com/a/1061173053_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334

硬件·供应链

· 灵巧手与关节模组产能:曦诺未来成立约半年完成四轮融资、累计约 15 亿元,规划 2027 年产能为 5 万套灵巧手及 5 万套关节模组;他山科技称其人形触觉传感器细分市场份额超 80%,截至 5 月底在手订单达 2025 年全年营收的 4 倍 ⚠️ 汇编口径 https://m.sohu.com/a/1061173053_489960?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334

· 鑫宏业机器人电缆:8 月 10 日在互动平台回应投资者称,公司机器人电缆产品目前尚未与宇树机器人开展供货合作——宇树上市行情下的供应链概念标的,需要这类逐条证伪 https://www.guandian.cn/article/20260810/583072.html

· 中科慧思 L1/D1/M1 三款灵巧手:蓝思科技等参股的合资公司发布三款灵巧手新品(已报) https://finance.sina.com.cn/tech/digi/2026-08-10/doc-inimuvrt2868071.shtml