近日,上海科学智能研究院发布了一款名为“神珍”(MonkeyKingBang, MKB)的科学多模态基础模型。该模型拥有约110亿参数,能够处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据,支持科学理解和多类结果生成。“神珍”模型在扩展科学能力的同时,保持了基础模型的文本与通用图像能力,其设计旨在解决不同科学对象背后的规律差异问题,实现一个模型学习可共享的规律,并支持科学理解与结果生成。
“神珍”模型以Qwen3-VL-8B为共享主干,为六类科学数据设置专门的数据处理通路。它在进入共享模型前,分别保留序列的先后关系、分子的连接结构、气象场的空间分布和医学影像的局部细节。这种设计使得模型能够根据不同任务调用相应功能,如生成RNA序列、SMILES分子表示、全球气象场和医学影像分割结果。在多个任务中,“神珍”展现出竞争力,如在覆盖DNA、RNA、蛋白质以及不同生物序列关系判断的20项任务中,“神珍”有9项取得三款参评模型中的最优结果,17项位列前二。
此外,“神珍”还在小分子、气象和医学影像任务中进行了验证,表现出色。例如,在公开基准SMolInstruct的6项小分子属性理解任务中,“神珍”在三款参评模型中有4项取得或并列取得最优结果。在医学影像分割任务中,“神珍”的平均Dice得分为91.20,在7种参评方法中最优。上海科学智能研究院此次发布同步提供了模型权重、推理代码、示例脚本、输入说明和使用文档,支持研究者开展本地部署或接入已有科研流程。


