WAIC 2026 · EDITORIAL MINUTES

苏昊:物理智能——从“会说”走向“可靠行动”

苏昊把问题追到数据来源:语言是世界的投影,模型学习的是人类描述过的经验,却没有身体、重力、摩擦和行动后果。规模化可以让语言预测更准确,但不能自动补上未被语言完整记录的物理知识。模型可以在屏幕里雄辩,却不能说服重力。

五个核心问题与回答

01

为什么最聪明的模型仍会产生幻觉?

扩大参数、数据和推理时间,不能持续压低幻觉吗?

苏昊把问题追到数据来源:语言是世界的投影,模型学习的是人类描述过的经验,却没有身体、重力、摩擦和行动后果。规模化可以让语言预测更准确,但不能自动补上未被语言完整记录的物理知识。模型可以在屏幕里雄辩,却不能说服重力。

02

物理智能和给大模型装上传感器有什么区别?

接入摄像头、机械臂和控制器,就算拥有物理智能了吗?

演讲所说的物理智能要求更完整:系统要把视频、方程、真机数据、人类操作直觉和环境反馈聚合起来,形成可持续修正的知识。传感器只提供观察,执行器只提供动作;若系统不能理解行动造成的后果、不能从失败中更新,它仍只是把语言模型接到了设备上。

03

为什么“知识聚合”可能比模型架构更关键?

物理 AI 的突破不应该首先来自新的模型结构吗?

苏昊认为,物理世界的知识分散在论文、工程方程、操作视频、仿真和真机经验中,任何单一来源都不完整。突破口在于让这些异构知识相互校验,而不是孤立地继续堆大模型。当然,这一判断仍需实证:传感器、控制、硬件和架构各自贡献多少,不能仅凭演讲下结论。

04

Demo 与产品之间最大的鸿沟是什么?

机器人已经能完成越来越惊艳的演示,为什么仍难进入照护和工业现场?

因为真实用户购买的是长周期可靠性,而不是一次成功。照护、搬运和高危作业要求系统面对未见状态、硬件磨损、环境变化和错误代价。通用性可以是远期目标,可靠性却是进入场景的起点。需要观察的不是最佳视频,而是失败率、人工接管率和持续运行时间。

05

为什么物理智能需要行业共同建设?

一家模型公司不能独立完成数据、仿真和评测闭环吗?

演讲提出共建数据、标准、仿真与评测基础设施,因为物理数据昂贵、场景分散且安全要求不同。但行业协作并不天然发生:企业缺乏共享真实失败数据的动力,标准统一也可能很慢。共同基础设施是必要方向,同时也是这条路线最现实的组织难题。

沿着对话,回到问题如何展开

01“你可以雄辩,但说服不了重力”

苏昊:大模型的进步有目共睹,但最聪明的系统也会幻觉。根本原因是语言只是世界的投影:模型学习了人类如何描述杯子、道路和动作,却没有真正承受重量、碰撞和失败。

苏昊:物理世界不会因为语言流畅而改变规则。系统若要照护老人、搬运物体或进入危险环境,就必须让现实反馈参与认知,而不能把语言概率当作最终真相。

02表示世界,还要作用于世界

苏昊:物理智能不仅要感知,还要行动,并从行动后果中学习。视频提供动态观察,方程提供约束,真机数据记录现实摩擦,人类操作包含难以文字化的直觉。只有把这些来源聚合,系统才可能形成比语言更完整的世界知识。

纪要:“聚合”不是把更多文件塞进训练集。不同来源相互矛盾时如何判断,仿真与真机存在差距时如何修正,都是系统必须显式处理的问题。

03人与机器的关系不是替代

苏昊:演讲将物理智能定位为人的协作者。机器可以承担重复、危险或对体力要求高的任务,但现实场景中的目标、责任和价值判断仍需要人设定。协作不只是伦理表达,也是一种可靠性设计:系统在不确定时要暴露边界并允许接管。

04最险的一段在 Demo 之后

苏昊:从演示到产品之间隔着一道可靠性鸿沟。实验室可以筛选环境、重复拍摄,真实世界却不会为模型配合。产品必须在长周期中面对噪声、故障和极端状态。

苏昊:因此,通用性是终点,可靠性才是起点。评价物理 AI 项目,首先应看它在具体任务中连续运行多久、失败如何恢复、人工何时接管,而不是它能展示多少动作。

05从科学的读者到知识的创造者

苏昊:新知识来自实验。若 AI 能提出行动、进入实验并用结果修正自身,它才可能从阅读已有科学,走向参与知识创造。但这需要行业共同建设数据、标准、仿真和评测,也意味着成果必须接受真实实验而非语言一致性的检验。

现场画面

苏昊:物理智能——从“会说”走向“可靠行动”现场画面 1
2026世界人工智能大会暨人工智能全球治理高级别会议主论坛 · 33:43 视频画面
苏昊:物理智能——从“会说”走向“可靠行动”现场画面 2
2026世界人工智能大会暨人工智能全球治理高级别会议主论坛 · 38:30 视频画面

来源与整理说明

查看公开回放来源 ↗

已从整场回放中定位 11 分钟 发言片段,保留原始时间边界。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断