WAIC 2026 · EDITORIAL MINUTES

Richard Sutton:今天的 AI 仍在模仿人类数据,经验时代尚未真正开始

Sutton 指出,主流 AI 仍主要训练于人类语言、标签和专家反馈,目标是把既有人类知识转移给机器。即使能力很强,其知识来源仍高度依赖静态人类数据。

五个核心问题与回答

01

什么叫“人类数据时代”?

今天的大模型不是已经能推理和行动了吗?

Sutton 指出,主流 AI 仍主要训练于人类语言、标签和专家反馈,目标是把既有人类知识转移给机器。即使能力很强,其知识来源仍高度依赖静态人类数据。

02

为什么模仿人类知识可能触及边界?

人类积累的数据还不够多吗?

静态数据擅长复现已知模式,却难覆盖一个行动者与环境长期互动后出现的新状态。模型若只学习过去的人类答案,很难形成超出数据边界的稳健策略。

03

“经验驱动”与在线学习相同吗?

让系统不断收集用户反馈就算进入经验时代吗?

不完全相同。经验包括行动、后果、延迟奖励和长期状态变化,不只是点赞或纠错。系统必须知道自己做了什么、环境如何响应,并把结果用于改善策略。

04

垂类 Agent 为什么更适合积累经验?

通用模型不能统一学习所有经验吗?

垂直场景有明确任务、工具和结果,更容易定义成功与失败。行业 Agent 可以围绕真实工作流积累连续反馈,但也必须解决隐私、安全和错误策略被持续强化的问题。

05

从投资角度应追问什么?

声称有“数据飞轮”的公司,怎样判断真假?

要看每次部署产生何种独有经验、反馈是否与任务结果相关、能否合法回流、是否真正提升下一次表现,以及改进是否跨客户复用。只有用户数据增长,没有策略改善,不构成经验飞轮。

沿着对话,回到问题如何展开

01主流 AI 的知识来源

Richard Sutton:今天仍是人类数据时代。AI 被训练来预测人的语言与标签,并由人类专家进一步微调。

纪要:这不是否定当下模型能力,而是辨认它的学习结构:机器主要继承人类已表达的知识。

02机器学习的主要目的仍是知识转移

Richard Sutton:目前大多数机器学习的目的,是把知识从人类转移到机器。

纪要:这种范式在文档、代码和标注丰富的任务上极其有效,却会受人类数据覆盖范围限制。

03经验时代提出新的产品单位

纪要:从短片判断继续向产品延伸,未来系统需要围绕“行动—环境反馈—长期结果”学习。Agent 的单位不再是一轮回答,而是一段持续经历。

04经验也需要安全边界

纪要:让系统从经验中学习并不天然更可靠。错误奖励、偏见反馈或高风险探索都可能把系统带向错误方向,因此经验闭环必须可审计、可回滚并有人类设定的边界。

现场画面

Richard Sutton:今天的 AI 仍在模仿人类数据,经验时代尚未真正开始现场画面 1
理查德·萨顿主论坛:AI 从数据时代转向经验驱动(官方短片) · 00:05 视频画面
Richard Sutton:今天的 AI 仍在模仿人类数据,经验时代尚未真正开始现场画面 2
理查德·萨顿主论坛:AI 从数据时代转向经验驱动(官方短片) · 00:15 视频画面

来源与整理说明

查看公开回放来源 ↗

官方公开节选,不能代替完整发言。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断