论文标题:Structure-free, site-resolved contrastive learning extends small-molecule discovery beyond the reach of structure-based modeling作者团队:William E. Fondrie, Daniele Canzani, Lillian Tatka, J. Sebastian Paez, Anastasiya Prymolenna, Andrea Gutierrez, Julia Robbins, Brian McEllin, Evan Hubbard, Kyle Siebenthall, Lindsay K. Pino, Alexander J. Federation(Talus Bioscience)文章链接:https://doi.org/10.64898/2026.07.28.741295一、 引言与研究背景:传统基于结构筛选的局限与挑战
尽管现代医学对疾病分子机制的理解日益深入,但在人体约20,000种蛋白质中,目前仅有704个蛋白质拥有已批准的药物,另有1,904个拥有高活性小分子配体——这意味着高达87%的人类蛋白质靶点仍处于“无药可用”(Undrugged)的状态。这并非因为化学分子的可能性匮乏,可合成的小分子药物空间估计达
种,任何实验筛选项目都只能触及冰山一角。因此,早期药物研发的核心瓶颈在于计算虚拟筛选(Virtual Screening)的效率与适用范围。
数十年来,虚拟筛选严重依赖于蛋白质三维结构:
1. 分子对接(Molecular Docking):需要在预先指定的结合口袋中搜索小分子的构象(Pose)并进行打分。但这无法预测未提前定义的隐匿口袋(Cryptic Pockets)或非正构口袋。
2. 协同折叠模型(Co-folding Models):如 AlphaFold3、Boltz-2、Chai-1 等,能够直接预测蛋白质-配体复合物的三维结构。然而,这类方法为每对“蛋白-配体”生成三维构象需要数十秒的计算时间。将十亿级化合物库对单一靶点进行筛选需要消耗上千 GPU 年的算力,全蛋白质组筛选更是难以实现。
此外,“必须依赖 Pose”带来了深刻的数据与机制偏置:
• 数据偏置:PDB 数据库和 ChEMBL、BindingDB 等活性数据库严重偏向于易结晶、具有良好正构口袋的折叠蛋白。当遇到缺少固定结构的固有无序区域(IDR/IDP,如转录因子)、别构位点或隐匿位点时,传统方法往往会错误地将配体“填入”正构口袋中(即所谓的“正构烧伤”现象,Orthostery Burnout)。
• 数据利用率低:现代化学蛋白质组学技术(如基于活性的蛋白质分析 ABPP)能在原生细胞环境下测定化合物与蛋白质的具体作用残基,但由于只提供残基级位点而没有三维坐标,传统结构模型完全无法利用此类海量数据进行监督训练。
为了突破这一瓶颈,Talus Bioscience 团队提出了 Ptarmigan-1——一种无需构建三维 Pose、完全脱离蛋白质结构依赖的对比学习模型。Ptarmigan-1 仅凭蛋白质序列与化合物 2D 化学结构,将蛋白残基与小分子共嵌入(Co-embed)至统一的隐空间中,实现了毫秒级的全蛋白质组虚拟筛选,并能够在无结构的前提下精准定位结合残基。二、 Ptarmigan-1 模型架构与高通量检索机制
Ptarmigan-1 的核心设计理念是:将虚拟筛选转化为共享隐空间中的近邻检索(Nearest-Neighbor Query)问题。
Figure 1 图注精炼总结:
• A(模型架构):Ptarmigan-1 融合 ESM Cambrian(蛋白质序列编码器)与 ChemBERTa(小分子 SMILES 编码器),通过 LoRA 组合微调将蛋白质各个残基与配体映射到统一隐空间。残基与配体的余弦相似度代表结合概率,并通过温度缩放的 Softmax 聚合至蛋白层级得分。
• B(预计算嵌入与快速检索):化合物库仅需一次性编码并构建近似最近邻(ANN)索引;筛选新靶点时,直接检索与靶点残基隐向量最近的小分子,无需重复计算。
• C(全蛋白质组覆盖):对 20,431 个人类蛋白质的残基隐向量均值进行 t-SNE 降维可视化,颜色代表 AlphaFold 预测置信度(pLDDT),涵盖了从高置信折叠蛋白到高度无序蛋白(IDP)的全谱系。
• D(全蛋白质组筛选打分分布):将 3.4 亿化合物库(OnePot CORE)对全人类蛋白质组筛选,其实际 Top-1 结合得分(深蓝色)显著高于随机旋转残基隐向量的旋转对照(Rotation Null,灰色)及未结合配体对(浅蓝色),证明模型学习到了真实的特异性结合规律。架构细节与训练策略
1. 双塔基础模型与 LoRA 微调:Ptarmigan-1 采用 ESM-C (600M) 编码蛋白序列,ChemBERTa 编码 SMILES。两个基础模型均未在复合物结构上预训练,从而避免了结构偏置。模型冻结主干,仅微调 Low-Rank Adapters (LoRA, rank 32,
) 和线性投影头,将残基和配体映射到
维的
归一化空间。
2. 多模态混合分辨率损失函数:结合了四种损失函数(残基级对比损失、蛋白级对比损失、残基对损失、校准二元交叉熵 loss),既能吸收仅有“结合/不结合”二元标签的生物活性数据,又能利用 ABPP 等残基分辨率的化学蛋白质组学数据。
3. 极速检索与极低算力消耗:采用 LanceDB 和 IVF-PQ(倒排文件乘积量化)索引。筛选 3.4 亿小分子库对全人类蛋白质组(20,431 个蛋白质)仅需 20 个 H100 GPU 小时(不到一天);单个“蛋白-配体”评估仅需 10 毫秒,相比 Boltz-2(54 秒)实现了约 5,000 倍的加速。三、 标准折叠靶点性能评估:LIT-PCBA 基准
为了评估 Ptarmigan-1 在传统结构已知正构口袋上的表现,研究团队在严格排除训练集重叠的前提下,在学术界公认的 LIT-PCBA 基准(包含 ESTRAn、MAPK1、PPARG、TP53 等靶点)上与现有主流方法进行了对比。
模型 / 方法
方法类别
是否无需结构 (Structure-free)
adjusted logAUC
ROC-AUC
EF@1%
BEDROC (
)Boltz-2
Co-folding
否0.196
0.776
9.75
0.264Ptarmigan-1Co-embedding是0.1200.6727.320.183Glide-SP
Docking
否
0.110
0.642
6.79
0.172Protenix
Co-folding
否
0.091
0.610
7.58
0.153SPRINT
Co-embedding
否 (需 SaProt 结构)
0.091
0.694
1.79
0.124ConPLex
Co-embedding
是
0.082
0.659
4.32
0.117Gnina-Vina
Docking
否
0.073
0.652
2.82
0.106
在标准经典靶点上,虽然依赖三维 Pose 的 Boltz-2 表现最佳,但 Ptarmigan-1 在所有无需结构(仅输入序列和 2D 化学结构)的方法中位列第一,并且综合表现超越了传统分子对接工具 Glide-SP 以及部分协同折叠模型 Protenix。这表明 Ptarmigan-1 在没有三维结构输入的情况下,依然具备出色的活性化合物排序能力。四、 残基级结合定位:共价与非共价配体的精确解构
Ptarmigan-1 不仅能预测化合物是否结合,还能通过残基隐向量与配体隐向量的余弦相似度,高分辨率地输出沿序列分布的“残基结合图谱”。
Figure 2 图注精炼总结:
• A(共价抑制剂残基结合图谱):四个共价抑制剂-靶点对的全长残基结合得分曲线(BTK/ibrutinib,BMX/ibrutinib,KRAS G12C/adagrasib,ITK/PRN694)。蓝色钻石与虚线精准指示反应性半胱氨酸,绿松石圆点表示三维结构中距离配体 5 Å 内的口袋残基。
• B(BTK 结合口袋渲染):BTK 口袋(PDB 5P9J)残基按 Ptarmigan-1 预测结合得分填色,高得分残基(海蓝色)高度集中于 ibrutinib 结合的裂缝区域。
• C(COValid 基准上的半胱氨酸定位百分位):对 874 个共价活性分子在 9 个靶点上的评价,8 个靶点的结合半胱氨酸排名均在全蛋白残基的前 1%(中位数
),训练集外靶点与训练集内靶点定位精度相当。
• D(PoseBusters 非共价复合物口袋区分度):在 PoseBusters 药用复合物集上,残基结合得分区分 5 Å 内口袋残基与其余残基的 AUROC 中位数为 0.99(未见靶点为 0.98)。
• E(流感 PB2 盖帽结合域与 pimodivir):未见靶点的结合定位渲染,预测高得分残基精准描绘出 pimodivir 结合界面。
• F(Runs N' Poses 基准上的序列同源度分段定位率):随靶点与训练集序列相似度下降,Top-1 残基落入 5 Å 口袋的比例(柱状图)与 AUROC(折线)仅轻微下降,在
同源度下仍达 62% 成功率。
• G(Top-1 残基至配体距离分布):在 337 个药用复合物中,92% 的复合物 Top-1 残基距离配体在 5 Å 以内(结合位点回收率达 92%)。
• H(训练数据消融对照):仅用公开数据训练与加入内部数据训练相比,未见靶点的口袋 AUROC 几乎完全重合在对角线上,证明残基定位能力源于对比架构本身而非内部数据偏置。
在 COValid 共价数据集(874 个分子)和 PoseBusters 非共价数据集(337 个药用分子复合物)上的测试显示:
1. 共价选择性精准定位:无论是训练集内的 BTK,还是训练集外的 BMX、KRAS G12C、ITK,Ptarmigan-1 预测的结合峰值均完美落在反应性半胱氨酸上(排名百分位达 99% 以上)。
2. 结合位点回收率(Binding-site Recovery):仅凭序列,Ptarmigan-1 有 92% 的复合物最高得分残基落入配体 5 Å 范围内。作为对比,在已知结构的前提下,AutoDock Vina 和 DiffDock 生成物理有效 Pose (RMSD < 2 Å) 的成功率分别为 53% 和 40%。
3. 化合物特异性证明:若将靶点配体替换为物化性质匹配的随机配体(Ligand Shuffle),位点回收率显著下降至 77%(
),证明定位结果是由查询化合物的化学结构特异性调控的,而非仅仅预测蛋白质的泛结合倾向。五、 超高通量筛选与共享隐空间逆向查询
Figure 3 图注精炼总结:
• A & B(化合物库编码与 Top-100 检索耗时):随着化合物库规模增长,预估 ANN 索引构建时间与检索时间曲线。对于 1000 万级化合物库,Top-100 候选检索仅需 10 到 40 秒。
• C(单靶点计算时间对比):针对 EGFR 靶点,从 SMILES 到输出打分,Ptarmigan-1 单分子耗时仅 10 毫秒,而 Boltz-2 为 54 秒(实现约 5,000 倍加速)。
• D & E(560 个人类激酶与 46 个 FDA 批准激酶抑制剂的共享隐空间可视化):将 560 个激酶的 395,403 个残基与 46 个激酶抑制剂共同嵌入并降维。抑制剂(紫色钻石)自然地靠近 ATP 结合口袋残基(蓝色),其余残基(灰色)距离较远(余弦距离中位数 0.94 vs 1.21)。
Ptarmigan-1 的独特优势在于其共享隐空间(Shared Embedding Space)。这种设计不仅支持“一蛋白对多小分子”的常规筛选,还天生支持“一小分子对多蛋白”的全蛋白质组逆向检索(Inverse Screening)。
例如,将 560 个人类激酶的所有残基(共约 39.5 万个残基)与 46 个 FDA 批准的激酶抑制剂同时映射到隐空间中(计算仅耗时 42 秒),结果显示抑制剂与 ATP 口袋残基的隐向量距离(中位数 0.94)显著小于非口袋残基(1.21)。这使得研究人员能够以极低成本评估化合物的全蛋白质组选择性(Selectivity)与多药理学(Polypharmacology)。六、 泛化能力与难成药靶点(非正构、无序及隐匿位点)评估
Figure 4 图注精炼总结:
• A(靶点新颖性对筛选性能的影响):33 个完全未见(Held-out)靶点按同源蛋白数量分组,即使在同源蛋白极少的分类中,adjusted logAUC 仍远高于随机(0)。
• B(配体新颖性对筛选性能的影响):配体按与训练集的 Tanimoto 相似度分组,Ptarmigan-1 的识别能力(海军蓝)在极高新颖性配体区依然显著高于打乱靶点的对照(Scrambled Null,灰色)。
• C(蛋白与配体双重新颖性网格):在蛋白序列与化学结构均为全新的双重新颖区域,模型仍保持正向富集能力(均值 0.13)。
• D(内部数据对共价/非共价召回率的贡献):内部化学蛋白质组学数据使共价活性分子的 Top-5% 召回率提升了 10.8 个百分点(从 45% 升至 56%)。
• E & F(XPO1 非正构位点 SINE 抑制剂案例):针对 XPO1 的 37 个 SINE 抑制剂,无口袋输入的 Ptarmigan-1(AUROC 0.90)超越了盲测 Boltz-2(0.71)。对于 PDB 中未结晶的全新 SINE 类似物,Ptarmigan-1 依然能将其排在库前列(94% 百分位),而 Boltz-2 表现大幅衰减。
针对传统基于结构模型极易失效的非正构口袋(Non-orthosteric)、隐匿位点(Cryptic Pockets)及固有无序蛋白(IDPs),研究团队进行了系统对比:
口袋类型 (Pocket Class)
靶点数量 (
)
Ptarmigan-1 ROC-AUC
Boltz-2 ROC-AUC
Ptarmigan-1 adj. logAUC
Boltz-2 adj. logAUC正构口袋 (Orthosteric)
5
0.920.93
0.470.48非正构口袋 (Non-orthosteric)
20.97
0.810.52
0.44固有无序蛋白 (Disordered, pLDDT < 50)
70.68
0.440.12
-0.03
实验结果表明:
1. 无序蛋白(IDPs)上的压倒性优势:在 AlphaFold2 pLDDT < 50 的 7 个无序靶点上,Boltz-2 的筛选活性降至随机水平以下(adjusted logAUC -0.03),而 Ptarmigan-1 依然保持稳定的正向富集(0.12)。
2. 零样本隐匿口袋发现(Zero-shot Cryptic Pocket Discovery):
Figure 5 图注精炼总结:
• A(CryptoBench 隐匿位点发现比较):在 199 个 Apo(未结合配体)结构测试集上,Ptarmigan-1 零样本预测残基口袋的 AUPRC(0.27)超越了输入 Apo 结构的经典结构找口袋工具 P2Rank(0.22)。
• B(与正构口袋找口袋对比):在传统正构口袋(COACH420)上 P2Rank 领先(0.63 vs 0.58),但在结晶结构中无口袋的隐匿位点(CryptoBench)上 Ptarmigan-1 反超。
• C(训练集暴露对隐匿口袋识别的影响):未在训练集出现的蛋白(0.26)与已出现蛋白(0.28)在隐匿口袋预测性能上相近,证实其具备泛化能力。
• D(羧基肽酶 A Apo 结构实例):羧基肽酶 A 的 Apo 结构(PDB 1ARL,无配体)残基按 Ptarmigan-1 预测结合得分填色,高得分残基精准聚焦于隐匿位点区域。七、 真实应用案例:STAT6 抑制剂的筛选与 SH2 域定位
为了验证 Ptarmigan-1 在实际药物研发中的能力,研究团队选取了转录因子 STAT6 作为盲测案例。转录因子缺乏深度正构口袋,长期被认为是“不可药”靶点。团队从 Pfizer 近期公布的两项专利(WO2025133961A1 和 WO2025215579A1)中提取了 40 个多样化的 STAT6 抑制剂(均在 Boltz-2 训练截止日期之后发布,且训练集中无骨架匹配)。
Figure 6 图注精炼总结:
• A(STAT6 专利抑制剂筛选 ROC 曲线):在 40 个 Pfizer 专利活性分子与物化性质匹配的假分子(Decoys)混合库中,Ptarmigan-1 达到了 0.94 的 AUC,而指定位点的分子对接(0.58)与盲测 Boltz-2(0.58)均接近随机猜测。
• B & C(STAT6 结合位点预测与定位):Ptarmigan-1 预测的残基结合高分区(深色)完美重合于 STAT6 的 SH2 结构域(残基 517-632),并在三维空间形成连续的结合凹槽。作为对比,Boltz-2 预测的 Pose(下图直方图)错误地集中在卷曲螺旋与 DNA 结合区(残基 235-399),再次发生了典型的“正构/错位烧伤”。
STAT6 的已知小分子结合口袋为其 SH2 结构域(用于募集受体并形成同源二聚体)。Ptarmigan-1 仅凭序列即准确将抑制剂定位至 SH2 结构域;而 Boltz-2 由于缺乏已知复合物晶体引导,将构象错误地预测到了卷曲螺旋区(Coiled-coil domain)。八、 总结与展望
Ptarmigan-1 的提出重新定义了计算虚拟筛选的范式:
1. 脱离三维 Pose 限制:将“基于结构的复合物构建”转变为“隐空间中的近邻查询”,使数亿至数十亿级化合物的全蛋白质组筛选成为日常算力可承受的操作。
2. 解锁“不可药”靶点:通过吸收化学蛋白质组学(ABPP)等混合分辨率数据,Ptarmigan-1 成功攻克了无序蛋白、别构/隐匿位点及转录因子等传统结构方法难以触及的领域。
3. 分层筛选新工作流:研究团队提出,无结构筛选(如 Ptarmigan-1)与基于结构的模型(如 Boltz-2、AlphaFold3)是高度互补的。在未来的药物发现流程中,Ptarmigan-1 可作为前端极速过滤器,从千亿级化学空间中快速筛选出潜在化合物并进行全蛋白质组反向选择性评估;随后再由基于高精度结构计算引擎对缩小后的候选集进行 Pose 解析与结合自由能精修。
随着预训练模型与化学蛋白质组学数据的进一步积累,这种“脱离结构依赖”的表征学习方法,有望彻底打破传统虚拟筛选的边界,让更多无药可用的靶点迎来新药开发的曙光。