WAIC 2026 · EDITORIAL MINUTES

王坚:让科学数据成为基础模型的原住民

因为论文和代码只是科学活动留下的文字投影,许多关键知识存在于望远镜观测、光谱、化石、岩芯、断层和实验记录中。当前系统擅长处理文本,却还没有把这些领域原生数据纳入同一套表示和推理过程。王坚把问题定义为数据地位的错配:AI 已经能解释科学家写下来的话,但还没有直接理解科学家面对的对象。

五个核心问题与回答

01

为什么语言模型还没有真正进入科学数据?

今天的 AI 已经能读论文、写代码,为什么王坚仍认为它离科学研究的核心很远?

因为论文和代码只是科学活动留下的文字投影,许多关键知识存在于望远镜观测、光谱、化石、岩芯、断层和实验记录中。当前系统擅长处理文本,却还没有把这些领域原生数据纳入同一套表示和推理过程。王坚把问题定义为数据地位的错配:AI 已经能解释科学家写下来的话,但还没有直接理解科学家面对的对象。

02

“科学数据成为原住民”究竟是什么意思?

这是否只是给大模型再接几个专业数据库?

不是简单外挂检索。王坚借用“first-class citizen”的概念,主张科学数据在基础模型中应与文本、代码拥有同等地位:先形成适合不同数据形态的表示,再进入统一模型空间,让问题定义、证据调用和结果验证都能直接落在原始数据上。真正的变化不是多一个输入接口,而是模型认识世界的基本材料发生变化。

03

为什么旧数据可能比新模型更重要?

科学发现一定依赖更新、更昂贵的仪器和数据吗?

王坚用一名十八岁学生重新分析退役卫星数据、发现约一百五十万个未编目天体的案例说明,范式变化经常来自旧数据被重新理解。数据最初为何采集,并不决定它只能回答什么问题。当模型和研究方法改变,沉睡的数据可能暴露过去看不见的异常。由此,科学 AI 的价值不只是加快既有流程,也包括重新打开历史数据的可能性空间。

04

科学基础模型为什么不是普通“垂直模型”?

面向天文、地学或生命科学训练的模型,不就是行业垂直模型吗?

王坚强调,科学基础模型应是一层可被多个学科复用的基础能力,而不是只在单一业务里优化答案。它要把文本、代码与科学数据放入共同空间,支持跨数据形态的发现与验证。这个判断仍有待技术实践检验:不同学科的数据标准、测量误差和评价方式差异巨大,统一底座能共享到什么程度,不能只由概念决定。

05

真正的难点落在哪里?

如果方向成立,最先卡住它的会是模型能力还是数据工程?

演讲给出的答案更接近后者。科学数据格式分散、质量不一、时间尺度不同,还涉及来源、权限、同行复核与治理。地学案例要把十万种生物和近两万个断层数据放到统一时间轴上,本身就是庞大的组织工程。模型只是其中一层;数据能否持续接入、结果能否被复核、不同机构能否协作,决定了这条路线能否从实验走向基础设施。

沿着对话,回到问题如何展开

01人工智能又走到了重新认识数据的时刻

王坚:人工智能这个词从来没有稳定共识,每个人说它时,心里想的可能都不同。回看 ImageNet 带来的变化,真正推动行业转折的首先是数据,而不是后来被反复强调的算力。发展多年之后,AI 又到了一个需要重新理解数据的节点;这一次,被忽略的是科学数据。

王坚:他的目标可以压缩成一句话:让科学数据成为基础模型的原住民。这里的“原住民”不是被模型临时调用的附件,而是在模型内部天然拥有表达位置、能够参与推理的基本对象。

02一个中学生如何用退役卫星数据制造“异常”

王坚:他谈到一篇只有一名作者的天文学论文。作者十八岁,使用的是一颗已经退役、原本用于监测小行星的卫星数据,却从中发现了约一百五十万个从未被编目的太空物体。这个案例重要的不只是少年成名,而是它打破了专业分工与数据用途的旧假设。

王坚:科学革命常常从异常开始。旧数据并不会因为采集任务结束而失去价值;当新的表示方法和问题意识出现,它可以回答最初从未设想过的问题。AI 如果只能阅读围绕数据写成的论文,就错过了这个发现过程最有价值的一层。

03文本的成功,反而暴露了科学数据的缺席

王坚:大语言模型本质上是建立在文本数据上的基础模型。人类很早就学会给文本加标点、分词和结构,今天的 tokenization 把这种处理推进到新的尺度。但科学数据没有天然的句子、词语和语法:光谱、断层、化石与仪器读数需要各自的表示方式。

王坚:现实中的 AI for Science 很多还停在论文、摘要和代码层面。它能更快找到别人写过什么,却没有真正触碰实验和观测产生的数据。这不是能力榜单上的小差距,而是输入世界不完整造成的结构性缺口。

04从“石头不会说话”到统一时间轴

王坚:地球科学最能说明问题。石头不会用语言讲述自身历史,化石记录还会受到保存偏差影响;研究者必须从分散证据中恢复时间、空间与演化。团队尝试把十万种生物和近两万个断层数据放到统一时间轴上,模型在这里不是回答一个问题,而是在组织一条可被复查的证据链。

王坚:这类工作同时暴露限制:原始数据的标准化接入远未完成,不同学科能否共享同一个基础模型也没有答案。真正值得推进的不是“科学大模型”这个名称,而是让数据、模型、验证和治理共同成为科研基础设施。

05人工智能最终会像数学一样基础

王坚:演讲最后把 AI 放回更长的科学史中。它不应只被看作某个行业的工具,而可能逐渐变成像数学一样的基础方法。是否能走到这一步,取决于 AI 能否从处理人类写下的文本,扩展到理解科学活动直接产生的数据,并让由此得到的发现经得起同行复核。

现场画面

王坚:让科学数据成为基础模型的原住民现场画面 1
2026世界人工智能大会暨人工智能全球治理高级别会议主论坛 · 111:57 视频画面
王坚:让科学数据成为基础模型的原住民现场画面 2
2026世界人工智能大会暨人工智能全球治理高级别会议主论坛 · 119:22 视频画面

来源与整理说明

查看公开回放来源 ↗

已从整场回放中定位 17 分钟 发言片段,保留原始时间边界。依据公开回放整理;不是 WAIC 官方通稿。

从现场纪要继续判断