本文收录于专栏开源蛋白结构预测—— 专栏系统覆盖蛋白结构预测与表面性质计算的开源方法实践点击订阅可跟踪后续更新。你手头只有一个 apo 结构却要判断蛋白表面哪块区域值得打PPI 界面在哪、离子位点在哪、配体可能结合在哪。现有工具要么只输出单一口袋P2Rank要么必须有复合物结构KFC2要么部署要配齐 MSMSAPBS 一套二进制MaSIF。这篇以 PPI 靶点做药的标杆 BCL-2 为例带你把 PeSTo 部署到 Linux一次推理同时输出蛋白-蛋白、核酸、离子、配体、脂质 5 类界面概率CPU 9 秒一个结构。用 4MAN 共晶实测验证——BH3 groove 口沿 Arg143/Asn140/Phe109 全进全链 Top 25正构位点直接圈出同时深槽疏水墙 6 残基全 0 分的方法边界讲透groove 外 His183/Gln187 新 patch 当变构线索再附 9 类热点工具横评表帮你选型。你读完可以直接拿命令对自己的靶点跑一遍。关键字PeSTo蛋白表面热点几何深度学习结合界面预测BCL-2venetoclaxP2RankMaSIFPeSTo 蛋白表面热点它是什么参数无关几何深度学习一次推理 5 类界面CPU 9 秒一个结构怎么装conda 两条命令命令行驱动脚本跑得准吗BH3 groove 口沿进 Top25离子头表面 patch 富集深槽疏水墙零分边界边界在哪深口袋打分保守纯疏水深槽零分和谁比9 类工具横评选型三句话目录§0. 相关教程与核心文献 §1. 场景 §2. 原理 §3. 部署 §4. 实战 BCL-2 §5. 横向对比 §6. 踩坑实录 §7. 局限与建议§0. 相关教程与核心文献资源链接与本文关系PeSTo 官方仓库github.com/LBM-EPFL/PeSTo部署源码与预训练模型含 4 个 checkpointPeSTo 原始论文Krapp et al.Nat. Commun.2023, 10.1038/s41467-023-37701-8方法原理与 benchmarkPeSTo 在线版pesto.epfl.ch免部署试用入口MaSIF 原始论文Gainza et al.Nat. Methods2019, 10.1038/s41592-019-0666-6几何深度学习表面预测的先驱方法P2Rank 论文Krivak HokszaJ. Cheminformatics2018, 10.1186/s13321-018-0285-8小分子口袋预测基线工具FTMap 方法学Kozakov et al.Nat. Protoc.2015, 10.1038/nprot.2015.043片段对接流派代表§1. 场景apo 结构在手热点在哪药物发现里有一类高频问题拿到一个靶点结构可能是晶体、可能是 AlphaFold 预测想知道表面哪里最值得打。三种典型情形——PPI 抑制剂项目靶点没有深口袋得找蛋白-蛋白界面的热点残基金属酶/核酸酶关注离子或核酸结合位置apo 结构找新口袋共晶配体还没拿到想预判配体可能结合的区域。传统做法两派片段对接FTMap 用 16 个探针分子做分子对接能量法可解释但一个蛋白要跑近 1 小时和经验规则/机器学习HotPoint、KFC2 等快但多数要求已经有复合物结构——apo 场景直接失效。几何深度学习是第三条路直接学什么样的表面几何残基环境容易成为界面不依赖配体信息。PeSTo 是这条路上部署门槛最低的一个。§2. PeSTo 原理不算了直接学PeSToProtein Structure Transformer的核心思路可以用三句话说清不依赖任何外部特征计算——不需要 MSA、不需要静电APBS、不需要表面三角网格MSMS输入只有 PDB 里本来就有的原子坐标和元素/残基名所以原文自称 parameter-free原子 → 残基图——把结构转成残基级图每个残基聚合 64 近邻的几何关系喂给一个 Transformer 编码器5 个输出头——分别对蛋白-蛋白PPi、核酸、离子、配体、脂质 5 类界面做二分类每个残基得到 5 个 0-1 概率直接写进输出 PDB 的 b-factor 列。对比 MaSIF 一脉MaSIF 要先算溶剂排除面表面网格化再算形状指数/曲率/静电等化学特征APBS 静电计算经常是部署卡点后面横评表里 SurfGraphPro 论文提到 100 个蛋白跑 MaSIF 有 32 个在 APBS 阶段失败。PeSTo 把这些都省了代价是不输出互补配体指纹那类搜索能力——它是纯界面预测器。§3. Linux 部署conda 两条命令实测环境Ubuntu 22.04消费级 GPU本案例用 CPU 推理即可模型很小。# 1. 获取源码GitHub 直连超时的话走代理 HTTP/1.1curl-sL-opesto.tar.gz https://codeload.github.com/LBM-EPFL/PeSTo/tar.gz/refs/heads/maintarxzf pesto.tar.gzmvPeSTo-main PeSTocdPeSTo# 2. 独立 conda 环境CPU 版 torch 就够conda create-npestopython3.10-yconda activate pesto pipinstalltorch --index-url https://download.pytorch.org/whl/cpu pipinstallgemmi h5py numpy scipy pandas matplotlib scikit-learn tqdm仓库自带 4 个预训练 checkpointmodel/save/下i_v3_0到i_v4_1论文 benchmark 用的是最新的i_v4_1直接用即可。官方入口是 Jupyter notebookapply_model.ipynb批量跑不方便。我封装了一个命令行驱动脚本pesto_predict.py约 150 行核心逻辑照搬官方 notebook加载模型 → 结构预处理 → 推理 → b-factor 写回 → Top-N 残基排行 CSV用法python pesto_predict.pypdb文件或目录-o输出目录--top10输出两类文件name_i{0..4}.pdb5 类界面各一个概率在 b-factor 列和pesto_hotspots.csv每类界面 Top-N 残基排行。PyMOL 上色一行spectrum b,blue_white_red,all,0,1§4. 实战BCL-24MAN热点分层最清楚的一例实战靶点选 PPI 做药的标杆 BCL-2venetoclax 的靶点。用 4MAN 共晶结构BCL-2 navitoclax 类似物 1Y1晶体里两条链各带一个 BH3 groovePeSTo 在同一张热点图上给出三层结果层残基UNP 编号ligand 头打分全链排名定性BH3 groove 口沿Arg143 / Asn140 / Phe1090.64 / 0.59 / 0.562 / 8 / 9共 208 残基✅ 正构位点口沿全中groove 口沿次级Asp108 / Arg104 / Glu149 / Val1530.42-0.5015-31✅ 口沿外圈groove 深槽疏水墙Phe150 / Phe147 / Phe101 / Val145 / Ala146 / Ala97全部 0.00垫底❌ 方法学盲区groove 外新 patchHis183 / Gln187 / Leu178B 链0.75-0.92B 链 Top 区⚠️ 无实验背书的候选面三点解读正构位点定位成功。BH3 groove 的口沿极性残基一圈Arg143/Asn140/Asp108/Arg104/Glu149全部进全链 Top 25——venetoclax/navitoclax 类抑制剂结合的就是这个口hot spot 图直接圈出来。纯疏水深槽是硬盲区。深槽 6 个疏水残基打分全是 0.00——PeSTo 学的是表面 patch 几何看不见凹陷内部。注意读法groove 全部 26 个 5 Å 接触残基的均值只有 0.238甚至低于全链基线 0.2620.9×——均值被深槽零分拖垮单残基排名才是正确读法。B 链 His183/Gln187 表面 patch0.92/0.84是 PeSTo 独有输出位于 α6-α7 区晶体里没有配体。这类高分但无背书的 patch 是 apo 界面预测的常态可以当变构位点/新口袋线索动手前先用对接或共结晶验证。PPi 头在这条链上还弱弱点名了 Arg124/Arg136/Glu1320.16-0.19——BH3 groove 本身就是 PPI 位点弱信号与正构位点位置相容。§5. 横向对比9 类工具怎么选把全网检索到的蛋白表面热点工具按流派整理成一张表★ 为 GitHub star 数2026-10 实测工具流派输入要求输出部署适合场景PeSTo174★几何深度学习apo PDB5 类界面残基概率纯 PythonCPU 9 s/结构PPI/离子/脂质界面初筛MaSIF-site780★几何深度学习apo PDB APBS/MSMSPPI 界面 patch依赖二进制链PPI 精细分析、表面指纹搜索P2Rank随机森林口袋apo PDB口袋概率残基Java 一条命令小分子口袋定位经典基线FTMap 家族片段对接能量法apo PDB探针簇 druggability网页服务器1 h/蛋白结合能热点、可药性评估HotPoint/KFC2/PredHS2经验/ML复合物结构界面热点残基网页服务器已有复合物的 PPI 热点PPI-hotspotID4★MLapo 结构或序列PPI 热点残基网页 GitHubapo PPI 热点eLife 2024AF2BINDNat Methods 2026AF2 表征 逻辑回归apo PDB小分子结合残基GitHub需 AF2 前向40 s/蛋白T4de novo 配体位点S2Site / SurfGraphPro / BiMbaPLM 几何深度学习apo PDB界面残基学术预印本为主追新方法谨慎用于生产HotSpot Wizard 3.0保守性催化口袋apo PDB突变热点smart library网页服务器酶工程改造选型三句话apo 找 PPI/离子/脂质界面→ PeSTo 本地批量跑apo 找小分子口袋→ P2Rank 起步预算够上 AF2BIND已有复合物做丙氨酸扫描级热点→ FTMap 或 KFC2。PeSTo 在这张表里的独特卖点是一次推理 5 类界面 零外部依赖 CPU 秒级适合当流水线第一层。§6. 踩坑实录3 条全部实测坑 1GitHub 直连下载失败curl exit 16。curl -L https://github.com/.../archive/...报 HTTP/2 流错误。修法加--http1.1并走代理走 codeload 域名见 §3 命令。坑 2输出头数量不在显式配置里。模型 config 里只有r_types列表protein/dnarna/ion/ligand/lipid 5 组残基名输出 5 个头的语义要从这个顺序推。自己写驱动脚本时如果按 GitHub issue 里说的 8 类加了核苷酸/糖苷/类固醇的早期版本去映射_i0.._i7文件会张冠李戴——i_v4_1是 5 头_i0.._i4对应 PPi/核酸/离子/配体/脂质。坑 3残基编号会被预处理重排。PeSTo 读入后会清洗重编号4MAN 的 BCL-2 链 UNP 1-3492-207 两段被重编为连续 1-208输出 PDB 的编号与晶体原编号不同。做接触分析对账时必须按残基出现顺序建映射两边残基序列逐位对齐0 mismatch 才可信不能假设固定偏移。多链结构还要注意输出链标签与输入的对应关系用各自配体或质心距离确认建议输出后立刻把映射表存下来。§7. 局限与用法建议深口袋不敏感PeSTo 学表面 patches不是凹陷几何。BCL-2 groove 深槽疏水墙 6 残基直接 0.00 分——深口袋/疏水槽任务叠 P2Rank输出是残基级概率不给口袋几何/体积/druggability 评分也不做互补配体搜索要搜索能力看 MaSIF-searchPPi 头在单链结构上预测的是倾向形成界面的区域不是真实搭档搭档预测要另跑 docking 或 MaSIF-search膜蛋白场景脂质头有用但训练数据里脂质类型只有 4 种PLM/CLR/CDL/RET胆固醇类以外的脂质解释要谨慎。版本信息仓库 main 分支2023-10 最后更新checkpointi_v4_1_2021-09-07_11-21Python 3.10 torch 2.x CPU 实测通过论文 benchmark 数字PPi 界面 ROC-AUC 等细项建议直接读 Nat. Commun. 论文 Table 1。参考来源Krapp L, et al. PeSTo: parameter-free geometric deep learning for accurate prediction of protein binding interfaces.Nat. Commun.2023. 10.1038/s41467-023-37701-8Gainza P, et al. Deciphering interaction fingerprints from protein molecular surfaces.Nat. Methods2019. 10.1038/s41592-019-0666-6Krivak R, Hoksza D. P2Rank: machine learning based tool for rapid and accurate prediction of ligand binding sites.J. Cheminformatics2018. 10.1186/s13321-018-0285-8Kozakov D, et al. The FTMap family of web servers.Nat. Protoc.2015. 10.1038/nprot.2015.043AF2BIND: predicting small-molecule binding sites using the pair representation of AlphaFold2.Nat. Methods2026. 10.1038/s41592-026-03011-2PDB 入口4MANBCL-2 navitoclax 类似物共晶系列导航专栏全集分子模拟基础更多专栏蛋白 / 抗体 / 多肽 / 核酸分子模拟 / 动力学 / 对接药物 / 设计 / 案例AI / Agent / 大模型开源蛋白结构预测分子模拟基础小分子药物设计案例AI Agent系列开源蛋白生成方法实践分子动力学模拟-Amber蛋白药物设计案例化学大模型开源多肽设计模型分子动力学模拟-Gromacs多肽药物设计案例《AI Agent原理与实战》开源多肽性质预测分子动力学模拟-OpenMM开源小分子生成设计CADD中的机器学习模型DNA/RNA药物设计結合自由能开源药代动力学软件高效计算配置siRNA药物设计模型UCSF DOCK系列我胡师兄说药ASO药物设计模型rDock系列 LeDock系列 gnina系列
阅读完成 · 觉得有帮助?