WAIC 2026 · EDITORIAL MINUTES

科学前沿论坛:当 Coding 接近满分,科研为什么还只有 3%?

这句话表达的是能力迁移方向,不是成熟度等同。Coding 任务有密集测试反馈,大量基准已接近高分;端到端科研完成率仍约 3%,Nature 级论文成功率也很低。科学比代码更缺即时、明确的验收信号。

五个核心问题与回答

01

为什么说“研究是下一个 Coding”?

编程 Agent 的成功能直接复制到科研吗?

这句话表达的是能力迁移方向,不是成熟度等同。Coding 任务有密集测试反馈,大量基准已接近高分;端到端科研完成率仍约 3%,Nature 级论文成功率也很低。科学比代码更缺即时、明确的验收信号。

02

科研 Agent 卡在哪三个结构性问题?

继续读更多论文和扩模型不够吗?

周伯文概括为真因果缺失、长周期稀疏反馈和失败数据缺失。模型容易在相关性中生成合理解释,却难主动干预找因果;研究几个月后才有结果,失败实验又常不被记录。

03

“端砚”为什么不是科研工具集合?

把文献、代码、数据库和实验设备接在一起,不就是平台吗?

平台试图贯通问题定义、方案推演、实验执行、结果回流和失败再利用。多 Agent 分工规划、执行与评审,每一步透明、可溯、可控。闭环和证据链才是它区别于工具目录的地方。

04

干湿实验闭环为何重要?

数字仿真足够强以后,还需要实体实验吗?

科学结论最终要与真实世界对照。自动化实验室提供行动和反馈,世界模型帮助筛选方案,失败数据又改进下一轮推演。湿实验成本高,因此 Agent 的价值在于减少无效尝试而不是制造更多候选。

05

科研自主性越强,安全如何同步?

沙箱、外网审批和安全模型会不会拖慢研究?

高自主系统能调用代码、数据库和实验设备,风险远高于写摘要。论坛提出本地优先、沙箱隔离、外网审批、开放评测和安全数据飞轮,让系统在扩大行动能力时留下可审计边界。

沿着对话,回到问题如何展开

01两条成功率曲线的巨大落差

周伯文:Coding 成功率已从低位快速提高,多数基准接近饱和;但端到端科学研究完成率仍只有约 3%。研究是下一个 Coding,却还远未被解决。

纪要:反差揭示科学任务的特殊性:答案未知、反馈缓慢、实验昂贵,甚至问题本身也可能定义错误。

02主动介入才能寻找因果

周伯文:模型要突破智能上限,需要在主动介入中寻找真因果,从密集反馈中学习难题,并在失败中拓展边界。

纪要:科研 Agent 不能只消费既有知识,要能设计信息增益更高的下一步实验,并承认哪些结论仍无法区分。

03失败不是垃圾数据

周伯文:负反馈不代表方向完全错误,模型要在缺乏及时反馈时不迷失。

纪要:失败实验包含边界条件和方法缺陷。平台若只收录成功,系统会重复昂贵错误,也会高估候选成功概率。

04端砚贯通认知、推演与行动

周伯文:书生端砚不是科研工具集合,而是以真实结果驱动研究持续迭代的新范式。

付徐军:平台为科研人员量身构建 AI 工作台,坚持 AI 每一步透明、可溯、可控。

纪要:产品关键在于中间 artifact:检索证据、代码版本、实验参数、设备结果和评审意见都可复核。

05十项成果检验通专融合

纪要:蛋白质、大气、脑科学、病毒等共创项目显示共同底座进入不同学科的可能,也暴露每个领域仍需要自己的数据、设备和评测体系。

06工具型 AI 与科研自主性的边界

Max Tegmark:应优先发展有益、工具型、可信的 AI,而不是无法控制的替代型超级智能。

纪要:科研 Agent 可以获得更强行动能力,但目标、资源和高风险步骤仍需人类与制度授权。

07安全基座不是发布后的补丁

纪要:高并发沙箱、开放评测与安全基础模型联盟,试图把安全测试和数据回流做成科研基础设施。系统是否真正可信,要看它能否发现并阻断真实攻击。

现场画面

科学前沿论坛:当 Coding 接近满分,科研为什么还只有 3%?现场画面 1
2026 WAIC 科学前沿论坛 · 54:10 视频画面
科学前沿论坛:当 Coding 接近满分,科研为什么还只有 3%?现场画面 2
2026 WAIC 科学前沿论坛 · 153:30 视频画面

来源与整理说明

查看公开回放来源 ↗

覆盖 3 小时 46 分钟 公开回放内容。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断