近日,哈佛大学与Capable研究团队发布预印本《PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking》,提出了一个面向通用语言模型的蛋白质突变排序评测框架 PG-LLM。
预印本访问链接:
https://www.proteingymllm.com/paper
该研究基于ProteinGym v1.3数据集,对13款通用语言模型和95种专业蛋白质预测方法进行比较,评估它们在零样本条件下对蛋白质突变体功能表现进行排序的能力。
报告显示,通用语言模型的佼佼者,比如 Claude Opus 和 GPT5.6 Sol 在这个专业任务上的Spearman相关系数(ρ)已达 0.406 和 0.402,超越了大部分专业模型(49 out of 95)。但距离顶尖的专业模型中还有很大的距离。该预印本将天鹜科技00后AI技术科学家谭扬主导研发的VenusREM(ρ=0.523)列为108款模型中的最优解,并设置为通用大模型对标的权威参照(见图1)。

图1:N=50 条件下 13 款通用语言模型排名
结果表明,通用语言模型具备一定的蛋白质突变筛选能力,但专业模型仍然保持明显优势。
01
从“能不能做”到“做到什么水平”
近年来,GPT、Claude、Gemini等通用大模型已逐步进入生命科学研究流程,能够协助研究人员理解实验方案、解释功能、生成代码。但“理解蛋白质问题”并不等于能精确预测突变效应——蛋白质工程的核心任务是给定一组候选突变,定量排序其功能影响,而非完成知识问答。PG-LLM正是围绕这一具体任务建立。
研究基于ProteinGym v1.3深度突变扫描数据,覆盖186种蛋白质和217组实验测定数据。测试中,通用语言模型仅可获得蛋白质序列、实验方案和候选突变信息,不能使用多序列比对(MSA)或三维结构;专业模型则可以使用完整的结构、MSA等信息。评测采用Spearman相关系数ρ衡量模型排序与实验结果的一致性。
结果显示,Claude Opus 5 以 ρ=0.406 登顶通用语言模型榜单,GPT-5.6 Sol 紧随其后,ρ=0.402。Claude Opus 5 表现超过了全部 95 种方法中的 49 种,其中包括 46 种纯序列方法中的 41 种,和 49 种使用 MSA 或结构等复合方法中的 8 种,得分高于纯序列方法中位数 ρ=0.374,接近于专用蛋白大模型 ESM2-650M 的 0.411,不过仍大幅落后于 VenusREM 的 0.523。
为验证提升推理阶段计算资源是否可以改善通用语言模型的能力,进一步验证结果显示,给模型开放更长思考、输出更多推理文字,所有通用语言模型的相关性均会上涨后逐步收敛,不会超过0.411,无法追上专用蛋白语言模型(见图2)。

图2:规模扩展对模型收益的影响
02
00后主导的VenusREM,成蛋白质突变预测领域专业参照
VenusREM是由天鹜科技AI Lab技术科学家、上海交通大学&上海创智学院00后博士生谭扬牵头研发的面向蛋白质突变效应预测与蛋白质工程的多模态预训练模型,VenusREM 的核心目标是联合利用蛋白质的氨基酸序列、三维结构和同源进化信息,更准确地评估候选突变对蛋白质活性、稳定性等功能性质的潜在影响。
VenusREM相关论文发表于Bioinformatics,全文链接如下:
https://academic.oup.com/bioinformatics/article/41/Supplement_1/i401/8199374

图3:天鹜科技AI Lab技术科学家、上海交通大学&上海创智学院00后博士生谭扬
与仅依赖单一序列信息的传统蛋白语言模型不同,VenusREM将氨基酸序列编码为序列词元,将残基局部三维空间环境离散化为结构词元,通过解耦多头交叉注意力联合建模序列上下文、局部结构及残基间空间关系,从而捕捉序列远距离但空间邻近的残基相互作用。
在此基础上,VenusREM引入检索增强模块,通过多序列比对提取各残基位点的进化保守性和氨基酸替换偏好,并将序列-结构表征与进化信息进行加权融合,实现单点及多点突变的适应度评分与排序。

图4:VenusREM 模型框架
在由哈佛医学院团队构建的ProteinGym蛋白质突变效应评测基准上,VenusREM取得了领先的零样本预测性能,超过了Meta、Microsoft等团队开发的代表性模型。模型及相关代码已全面开源,在Hugging Face平台近30天下载量超过4,000次,累计下载量超过25万次。
VenusREM项目已开源,详情访问链接:
https://github.com/ai4protein/VenusREM
这些成果表明,VenusREM已经成为蛋白质突变效应预测领域具有代表性的开源模型和研究工具。
结语
通用语言模型能否直接承担蛋白质突变筛选任务?PG-LLM 给出了答案:可以,但仍有边界。
通用大模型已展现出一定的突变排序能力,部分模型甚至超过了过半数的专有模型,但专业模型依然优势明显。
VenusREM在此次评测中成为行业权威参照,标志着专业蛋白质模型正从科研工具发展为评价通用大模型能力的重要坐标,我们所共同推动的是让通用模型负责理解复杂任务,让专业模型执行精准预测,最终形成人机协同的蛋白质研发系统。