磐石2.0发布:科学多模态统一推理如何重塑AI for Science

磐石2.0发布:科学多模态统一推理如何重塑AI for Science

事件概览

7月17日,在世界人工智能大会(WAIC)现场,中国科学院联合团队与中科闻歌磐石(ScienceOne)团队正式发布磐石2.0。此次发布的重点包括两款核心产品:

  1. S1-Omni:首个面向「科学理解、预测与生成」的科学多模态统一推理模型
  2. ScienceOne:以S1-Omni为核心、贯穿科研全流程的一体化平台

在第三方模型盲评打分的真实科研任务测试中,磐石在与GPT-5.5、Gemini 3.1 Pro、Claude Science等全球顶流模型的同台竞技中拿下最高分。


为什么需要「科学基础模型」?

通用大语言模型(LLM)的底层逻辑是基于统计的「概率」,擅长模糊、近似、听起来合理的回答。但科学不妥协于「八成正确」——它要求精确、可靠、可溯源。

这一根本错位催生了AI for Science(AI4S)赛道的独立发展。目前AI4S主要沿三条路线推进:

路线 代表产品 优势 局限
领域专用模型 AlphaFold 3、ESM3 在特定对象预测上做到极致 能力严格局限在单一对象和任务形式
工具增强型通用模型 GPT-Rosalind、Claude Science 凭借外部工具链灵活切入科学场景 科学能力仅寄生于工具,模型本体未深化
科学语言模型 NatureLM、LOGOS、BioMatrix 尝试跨对象统一联合建模 探索仍主要停留在表征层面

三条路线各自突围,但「科学智能」仍散落在彼此独立的模型、工具和任务系统中。磐石2.0试图实现更进一步——科学多模态统一推理(Unified Scientific Multimodal Reasoning)


S1-Omni:统一科学的三项关键技术

S1-Omni将「统一」拆解为三个具体能力:

一、科学数据「统一编码」

模型将自然语言指令与多种科学模态(材料的CIF、化学的SMILES、蛋白质序列、光谱数据、科学图像等)组织进同一套任务表征中。关键在于,它并非抹平不同科学数据之间的差异,而是在保留各类对象类型边界、表示结构与编码特性的基础上,将它们投射到一个共享的科学表征空间中,实现协同建模。

二、与「真实世界的知识」对齐

训练时,模型不只学习输入输出之间的统计相关,还将科学规律、实验事实、专家经验融入数据构建、样本校验和训练过程。这使得模型能够依据当前任务里的科学证据形成中间判断,让推理有了证据支撑,提升了可解释性。

三、按领域任务「定向解码」

在共享的理解与推理之上,模型会根据具体任务连接对应的科学解码器:预测性质就走性质预测,重建结构就走结构重建,还能做三维结构生成、科学图像生成与编辑。最终输出的是各自领域里「原生形式」的、可被验证的结果。


数据支撑:S1-Omni-Corpus语料库

支撑上述能力的,是一个名为S1-Omni-Corpus的语料库:

  • 覆盖200+个科研任务
  • 包含百万级高质量科学多模态推理数据
  • 刻意保留「科学证据→任务判断→目标结果」这条可检查的链路

60多个科学任务的基准评测上,S1-Omni的表现如下:

  • 95.5%的任务超过GPT-5.5
  • 83.3%的任务超过Gemini-3.1-Pro
  • 在部分任务上达到或超过了各领域的任务专用模型

具体来看:

  1. 药物性质预测:在ADMET 18项评测中,有16项同时优于GPT-5.5和Gemini 3.1 Pro;在CYP、hERG、肠道吸收等关键药物性质任务上,性能已达到甚至超越了业内代表性的化学专用模型。

  2. 蛋白质位点预测:统一支持多类残基级功能位点识别,在PPI、Epitope、小分子结合位点等任务上达到行业领先水平。

  3. 科学图像生成与编辑:在医学图像分割、医学图像翻译、超分辨率、科研插图生成等任务上展现出不错能力。


ScienceOne:把模型装进科研现场

仅有模型能力是不够的。磐石团队基于S1-Omni打造了科研智能平台ScienceOne,将模型的理解、预测与生成能力无缝嵌入科研的全生命周期。

平台数据规模

ScienceOne向下接管的资源包括:

  • 2.7亿论文/专利
  • 全球40多个国家3200多万科研项目
  • 700多万产业研报
  • 90PB大科学装置数据
  • 300个专业数据库

科研全生命周期覆盖

从文献分析、研究假设、方案设计,到建模仿真、验证分析、成果表达,ScienceOne覆盖科研全生命周期的六个环节,自主拆解复杂需求,智能调用最适配的专业技能与工具。


盲测实录:两大硬核案例

案例一:量子信息方向——Depolarizing噪声对Bell态纠缠的影响

传统做法:手动搭量子电路、调试噪声模型、做数值演算、再把结果绘图汇总。一旦纠缠熵的数据出现分歧,还需翻大量量子数学推导资料逐条比对。

磐石的应对:用自然语言分步提出需求(仿真测算→答疑论证→可视化报告),系统从ScienceHub一键调用专用科研Skill(Qiskit),将电路搭建→噪声仿真→数据核算→理论推导→多类型绘图→交互式HTML报告串成一条全链路自动输出。

第三方盲评结果
- 磐石得分最高,展现「资深量子物理学家」的专业素养,直接输出depolarizing noise作用后的完整密度矩阵,并指出混合态不能只看子系统熵,必须使用Concurrence(共生纠缠度)等硬指标。
- GPT-5.5暴露理论硬伤,一句「噪声后子系统熵保持为1」显示其连局域噪声和全局噪声都没分清。
- Claude Science关键矩阵和本征值缺失,甚至在假设上把全局和局域去极化混为一谈。

案例二:临床医学方向——乳腺癌变异数据中的VUS分析

背景:面对海量乳腺癌相关变异,尤其是棘手的VUS(意义未明变异),研究者需在GWAS群体遗传信号和UniProt蛋白质空间结构之间做跨组学比对。

磐石的应对:精准打通UniProt与GWAS数据,补充ClinVar与gnomAD中的临床与人群频率信息,构建立体的突变注释网络。更重要的是,磐石主动给出了「实验优先级排序」并附带严密的生物学论证理由,同时将关键致病位点在3D蛋白结构图中逐一精准标注。

第三方盲评结果
- 磐石展现统治级的科研任务闭环能力。
- Gemini 3.1 Pro停留在「数据整理」层面,深入科研推理环节暴露短板。
- GPT-5.5仅拿下78分,严重缺失ClinVar/gnomAD等关键临床数据库的交叉验证。


结语:从单点工具到系统能力

从AlphaFold到统一科学智能,AI for Science正在从「单点工具」走向「系统能力」。

磐石2.0与ScienceOne的真正分量,未必落在某一项榜单的领先上——它更大的意义在于,把「懂科学的模型」和「用得上的系统」拼成了一个整体,让AI第一次有机会成为科学家身边真正的科研搭档。

ScienceOne已于今日正式上线。

来源:新智元报道
原文链接:https://mp.weixin.qq.com/s/6zOb4_Pi4zIwxoLzcQTZZw