五个核心问题与回答
什么叫“人类数据时代”?
今天的大模型不是已经能推理和行动了吗?
Sutton 指出,主流 AI 仍主要训练于人类语言、标签和专家反馈,目标是把既有人类知识转移给机器。即使能力很强,其知识来源仍高度依赖静态人类数据。
为什么模仿人类知识可能触及边界?
人类积累的数据还不够多吗?
静态数据擅长复现已知模式,却难覆盖一个行动者与环境长期互动后出现的新状态。模型若只学习过去的人类答案,很难形成超出数据边界的稳健策略。
“经验驱动”与在线学习相同吗?
让系统不断收集用户反馈就算进入经验时代吗?
不完全相同。经验包括行动、后果、延迟奖励和长期状态变化,不只是点赞或纠错。系统必须知道自己做了什么、环境如何响应,并把结果用于改善策略。
垂类 Agent 为什么更适合积累经验?
通用模型不能统一学习所有经验吗?
垂直场景有明确任务、工具和结果,更容易定义成功与失败。行业 Agent 可以围绕真实工作流积累连续反馈,但也必须解决隐私、安全和错误策略被持续强化的问题。
从投资角度应追问什么?
声称有“数据飞轮”的公司,怎样判断真假?
要看每次部署产生何种独有经验、反馈是否与任务结果相关、能否合法回流、是否真正提升下一次表现,以及改进是否跨客户复用。只有用户数据增长,没有策略改善,不构成经验飞轮。
沿着对话,回到问题如何展开
Richard Sutton:今天仍是人类数据时代。AI 被训练来预测人的语言与标签,并由人类专家进一步微调。
纪要:这不是否定当下模型能力,而是辨认它的学习结构:机器主要继承人类已表达的知识。
Richard Sutton:目前大多数机器学习的目的,是把知识从人类转移到机器。
纪要:这种范式在文档、代码和标注丰富的任务上极其有效,却会受人类数据覆盖范围限制。
纪要:从短片判断继续向产品延伸,未来系统需要围绕“行动—环境反馈—长期结果”学习。Agent 的单位不再是一轮回答,而是一段持续经历。
纪要:让系统从经验中学习并不天然更可靠。错误奖励、偏见反馈或高风险探索都可能把系统带向错误方向,因此经验闭环必须可审计、可回滚并有人类设定的边界。
现场画面

