36个跨学科案例,从原始数据到编译完成的论文,AI全部自主完成。这不是科幻设定,是2026年8月新加坡国立大学和牛津大学团队发布的OmniScientist系统的实测结果。

同一周,上海AI实验室发布了Intern-S2-Preview,一个3970亿参数的科学智能体基础模型。两个系统指向同一件事:AI正在从"回答科学问题"走向"自己做科学研究"。

AI科学家从多模态原始证据到完整论文的自主研究流程

图注:OmniScientist从图像、信号、音频、视频、3D结构等原始证据出发,完成从假设到论文的全流程

不只是跑题,而是做研究

现有的AI科学家系统有个共同短板:它们能覆盖研究流程的大部分环节,但接触不到科学发现所依赖的完整证据。

大多数系统通过文本、代码、标签或预先计算好的摘要来处理数据。但科学发现依赖的空间、时间、跨通道和程序性关系,在文本化过程中会被丢失。一张图可以被描述成文字,但文字描述丢掉了局部形态特征;一个时序信号可以被压缩成几个标量,但标量抹掉了时间顺序和跨通道一致性。

OmniScientist的做法是直接感知。它的架构包含一个感知层和三个自主智能体,分别负责构思、实验和写作。三者在一个确定性管道内运行,让观察结果能够影响研究问题的选择、实验设计、结果检查和最终论文的论证。

在36个案例中,系统覆盖了5个学科族、4类科学证据,模态包括图像、信号、音频、视频、3D结构、轨迹、表格、公式和图谱。所有36个案例都完成了从原始数据到编译论文的全流程,平均论文评分6.3分(7维度量规,满分10分)。

直接感知的力量

OmniScientist做了一个关键对比实验。它把完整系统和一个"盲版"对比——盲版只接收预先计算的标量特征,从不访问原始观察数据。

结果很明确:直接感知在全部7个评估维度上都优于标量输入,在正面比较中赢得85%的判断。提升最大的是多模态基础和科学意义两个维度。

这意味着什么?当AI只能看到人类替它总结好的数字时,它能做的分析很有限。当它能直接"看到"一张显微镜图像、听到一段鸟类鸣叫、读取一个地震波形时,它提出的假设、执行的实验和得出的结论都会不一样。

系统还内置了多层检查机制。构思阶段检查新颖性和可证伪性,实验阶段检查数据泄漏和有效样本量,报告阶段检查执行来源、多重比较和数值可追溯性。这防止了一个常见问题:AI科学家在大量数据中反复测试,直到偶然发现一个"显著"结果。

3970亿参数的科学模型

上海AI实验室的Intern-S2-Preview走了另一条路。它不是独立智能体框架,而是一个科学基础模型——3970亿参数,专门为科学研究设计。

训练分两个阶段。预训练阶段从科学文档、交错图文数据和多样化科学语料中学习,包含渲染科学页面的视觉预训练,让模型吸收文档结构——这种结构在文本提取时经常被削弱。后训练阶段统一了监督微调、多任务强化学习、黑白盒智能体强化学习和在线策略蒸馏。

架构上有两个特别之处。一是时间序列模块从长序列理解扩展到数值预测,让模型不仅能读懂科学信号,还能预测未来状态。二是Memory Decoder:一个独立训练的参数化记忆模块,挂载在冻结的397B主干上,不修改模型核心参数就能实现领域特化。在生物学指令集上,4B参数的Memory Decoder把平均分从56.92提到60.32。

OmniScientist跨36个案例的评分与完成率

图注:OmniScientist在5个学科族上完成率100%,平均论文评分6.3,直接感知正面胜率85%

源势AI怎么看

这两个系统代表了AI for Science的两条路径,一条是智能体框架,一条是基础模型。它们的核心差异在于:智能体框架用工具和管道扩展能力边界,基础模型用参数和训练数据内化能力。

从工程角度看,OmniScientist的管道设计值得学习。它没有把感知、构思、实验、写作混在一个黑盒里,而是用确定性管道控制阶段切换,每个阶段输出必须通过代码执行的检查才能放行。这种设计在企业场景中很实用——科研智能体的最大风险不是能力不够,而是没有约束地"发现"不存在的规律。

Intern-S2-Preview的Memory Decoder思路也有启发性。企业不需要为每个新领域从头训练模型,而是训练一个小的记忆模块挂载上去。这跟我们在企业智能体落地中用RAG+技能库的思路异曲同工,只不过它把知识编码进了参数化记忆而非向量数据库。

但两个系统都有局限。OmniScientist的6.3分平均分意味着产出论文质量还在中等偏上水平,离顶刊发表有距离。Intern-S2-Preview在通用基准上"有竞争力"但不一定是第一——科学基础模型要超越通用大模型,还有很长的路。

对企业研发部门来说,短期内最实际的用法不是让AI独立做研究,而是让AI做研究流程中重复性最高的部分:文献综述、数据清洗、统计检验、图表生成和初稿撰写。OmniScientist的管道检查机制可以直接借鉴——用代码约束AI的探索范围,防止它在数据中"钓鱼"。