本文收录于专栏 开源多肽设计模型和方法实践 ------ 专栏系统覆盖开源多肽设计模型与实战方法,点击订阅可跟踪后续更新。
【摘要】 你做环肽设计时卡在两头:结构预测没趁手工具,Rosetta KIC 采一次骨架要上百计算小时;从头设计靠运气。这篇给你 AfCycDesign 的拆解+部署+实测:它不重训权重,只把 AlphaFold2 的位置编码换成环状偏移矩阵,就能预测环肽结构(SFTI-1 实测 RMSD 0.47 Å、8 秒)、重设计序列、从头幻觉 7-13 残基环肽(32 秒一条)。论文 8 个 X-ray 结构全部 RMSD<1.0 Å,MDM2/Keap1 纳摩尔结合物实证。附 conda 命令链、3 条踩坑、选型决策树,消费级 GPU 可跑。
关键字: AfCycDesign;ColabDesign;环肽设计;AlphaFold2;环肽结构预测;从头设计;MDM2;本地部署
改一张编码表,解锁环肽三件套。 Baker 实验室团队把 AlphaFold2 的线性位置编码改成环状,得到环肽结构预测(80 个 PDB 测试肽 58 个达标)、序列重设计(高置信设计数量约为 Rosetta 的 18 倍)、从头幻觉(10,000+ 高置信支架)三种能力;MDM2 结合物 IC50 338 nM、Keap1 结合物活性超线性 Nrf2 两倍。代码开源,消费级 GPU 可用。

相关教程与核心文献
官方教程 / 文档:
| 资源 | 与本文关系 |
|---|---|
| af_cyc_design.ipynb | 本文第四、五节代码的官方出处,cyclic offset 函数原文在此 |
| ColabDesign 仓库 README | 安装命令与版本号出处(v1.1.3) |
| Colab 在线版 | 装本地环境前的 5 分钟快速验证入口 |
核心文献:
| 文献 | 为什么值得先读 |
|---|---|
| Rettie S, et al. Nat Commun 16 (2025). doi:10.1038/s41467-025-59940-7 | 本文主角:环状偏移编码原理 + 全部 benchmark 数据来源 |
| Rettie S, et al. bioRxiv 2023.02.25.529956 (2023). doi:10.1101/2023.02.25.529956 | 预印本,可与正式版对照方法演进 |
| Jumper J, et al. Nature 596:583-589 (2021). doi:10.1038/s41586-021-03819-2 | AlphaFold2 原始论文,相对位置编码的母体 |
一、为什么写这篇:环肽设计的"断链"尴尬
环肽(7-13 个残基首尾相连)是这几年多肽药物的热门形态:没有游离末端所以抗蛋白酶降解,构象被环化锁死所以结合界面稳定,刚好能打小分子和抗体都够不着的蛋白-蛋白相互作用(PPI)靶点。问题在于计算工具一直没跟上------AlphaFold2 再强,它默认所有链都是线性的:你把一条环肽序列喂进去,它认为 N 端和 C 端相隔最远,预测出来的结构两端是"断开"的。
此前的主流方案是 Rosetta KIC(运动学闭环采样)+ 能量函数打分:准,但贵。论文给了一个参照------预测 SFTI-1(14 残基环肽)的构象,Rosetta 要采样 28,042 个结构、花 120 个计算小时;AfCycDesign 单张 GPU 约 2 分钟出结果。这就是这篇 2025 年 Nat Commun 论文要解决的痛点:不给 AF2 动手术,只改它的"座位表",让网络知道这条链首尾相连。
二、原理:一张 N×N 的"环状座位表"
一句话定义:AfCycDesign = AlphaFold2 + 环状相对位置编码(cyclic offset),在 ColabDesign 框架中实现,网络权重一个参数都没有重新训练。
类比理解:AF2 的相对位置编码像教室的线性座位表------1 号坐最前、14 号坐最后,两人隔 13 排。环肽实际是圆桌:14 号旁边就是 1 号。AfCycDesign 做的事就是把座位表换成圆桌排法------构造一张 N×N 偏移矩阵,让末端残基的序列距离变成 ±1,其余位置按环上最短路径重算,再叠加进 evoformer 的成对特征。注意力层本身对顺序不敏感,全靠这张表理解"谁挨着谁"。
论文测了 3 种偏移类型(1:无方向;2:带方向的远程编码;3:只编码相邻残基),80 个测试肽上分别预测对 52/49/48 个,差异不大,作者推荐默认 type 2(远程信息留着没坏处)。这个"改输入不改权重"的思路带来两个直接红利:
- 二硫键无需显式指定。富含半胱氨酸的环肽(结肽、锥肽类)有 3-15 种可能的二硫键连接,Rosetta 方案必须逐个枚举,AfCycDesign 直接从序列推断;
- 同一框架干三件事。结构预测(predict)、固定骨架重设计序列(fixbb)、从头幻觉(hallucination,损失函数 = 1−pLDDT + PAE/31 + con/2,三阶段退火把连续序列 logits 逐步逼成离散序列),换协议不换工具。
三、性能横评:论文数字一次看全
结构预测 benchmark(80 个 PDB 环肽 NMR 结构,均不在 AF2 训练集内):
| 指标 | 数值 |
|---|---|
| 中位 pLDDT / 中位 RMSD | 0.92 / 0.8 Å |
| 达标(pLDDT>0.7 且 RMSD<1.5 Å) | 58/80 |
| 高置信(pLDDT>0.85)预测准确率 | 80%(44/55) |
| 单序列模式(无 MSA) | 49/80 达标,速度更快 |
| 去掉环状偏移(消融) | 达标数明显下降 |
与同类方法对比:
| 维度 | AfCycDesign | Rosetta KIC | ProteinMPNN |
|---|---|---|---|
| 原理 | DL(AF2 + 环状编码) | 物理采样 + 能量函数 | 序列设计网络 |
| SFTI-1 构象预测耗时 | ~2 min(单 GPU) | 120 计算小时(28,042 构象) | 不做结构预测 |
| 13 肽骨架序列重设计(3,274 簇) | 1,145 簇 pLDDT>0.9 | 63 簇 pLDDT>0.9 | --- |
| 幻觉 10 肽骨架的序列设计 | 608 个 pLDDT>0.9 | --- | 505 个(重叠仅 157,两者互补) |
| 非天然 / D-氨基酸 | ❌ 仅 20 种标准氨基酸 | ✅ | ❌ |
| 二硫键连接 | 无需指定 | 需枚举 | --- |
实验验证(全文最硬的部分):8 个设计(1 个重设计 + 7 个幻觉)的 X-ray 晶体结构与计算模型全部 Cα-RMSD < 1.0 Å(最优 0.3 Å,10/13 侧链旋转异构体一致)。11-13 残基的大环此前必须加二硫键交联才能稳定,AfCycDesign 不加交联直接设计成功。
功能化验证:把 p53 的 5 残基结合基序(FXXXW)嫁接到幻觉支架上,MDM2 结合物 RMG_14 IC50 = 338 nM,引入 5 个突变(含 5-氟色氨酸、D-氨基酸)后亲和力再提约 10 倍;Keap1 方向嫁接 Nrf2 的 EETG 热环,3 个合成设计与线性 Nrf2 肽相当或更优(KC4 活性 2 倍、IC50<200 nM)。1,014 个已知"热环"基序中 798 个能匹配到 24,104 个高置信支架上------支架库通用性过关。
四、本地部署(conda + 消费级 GPU,2026-09-19 实测)
环境基线:Ubuntu 22.04 + 一块消费级 GPU(12 GB 显存,CUDA 12.4);纯 CPU 也能跑,慢一到两个数量级。
# 1. 建环境(Python 3.11)
conda create -n afcycdesign python=3.11 -y
# 2. 装 JAX CUDA 版(系统 CUDA 12.x 对应 [cuda12])
pip install "jax[cuda12]"
# 3. 装 ColabDesign(AfCycDesign 已内置,当前 v1.1.3)
pip install git+https://github.com/sokrypton/ColabDesign.git
# 4. AF2 权重:本地已有就直接软链(省约 4 GB 下载)
ln -s <你的AF2权重目录> ./params # 需含 params_model_{1..5}_ptm.npz
环境总占地约 5.9 GB(大头是 JAX 的 nvidia-cu12 依赖)。
踩坑实录(全部实测复现):
⚠️ 踩坑 #1 :报
TypeError: clip() got an unexpected keyword argument 'a_max'。根因:ColabDesign 内置的 AlphaFold 模块仍用旧式
jnp.clip(a_min=, a_max=),JAX 0.10 已删除这两个参数。修复:改安装目录下
colabdesign/af/alphafold/model/modules.py(1 处)和modules_multimer.py(2 处),把a_min=/a_max=换成min=/max=,删__pycache__后重跑。
⚠️ 踩坑 #2 :纯序列预测时prep_inputs(length=L)报缺pdb_filename。根因:
fixbb协议强制要求骨架 PDB。修复:纯序列预测改用
protocol="hallucination"初始化再predict(seq=...),预测路径完全一致。
⚠️ 踩坑 #3 :官方笔记本默认在线下载 AF2 权重(约 4 GB)。修复:本地若已有 AlphaFold2 参数,在工作目录建
params软链即可------mk_afdesign_model(data_dir=".")默认找./params/params_model_*.npz。
五、实战体验(两组实测)
实测 1:SFTI-1 环肽结构预测。向日葵胰蛋白酶抑制剂(14 残基首尾成环 + 1 对二硫键,PDB 1JBL------正是论文里 Rosetta 花 120 小时的例子)。单序列模式 + cyclic offset type 2 + 6 recycles:
| 模型 | pLDDT | Cα-RMSD vs NMR | 耗时 |
|---|---|---|---|
| model_1_ptm | 0.904 | 0.69 Å | 7.7 s(含 JIT 编译) |
| model_2_ptm | 0.930 | 0.49 Å | 0.1 s |
| model_3_ptm | 0.947 | 0.52 Å | 0.1 s |
| model_4_ptm | 0.955 | 0.47 Å | 0.1 s |
| model_5_ptm | 0.956 | 0.54 Å | 0.1 s |
5 个模型总计约 8 秒,最优 RMSD 0.47 Å------远优于论文达标线 1.5 Å,也好于论文全集的中位数 0.8 Å。叠合图(灰 = NMR 实验结构,青 = 预测):
核心代码不到 10 行:
from colabdesign import mk_afdesign_model
model = mk_afdesign_model(protocol="hallucination", use_templates=False, data_dir=".")
model.prep_inputs(length=14)
add_cyclic_offset(model, offset_type=2) # 关键一步,函数原文见官方笔记本
model.predict(seq="GRCTKSIPPICFPD", num_recycles=6, models=[0,1,2,3,4])
model.save_pdb("sfti1_pred.pdb")
实测 2:从头幻觉一条 13 残基环肽 (Gumbel 初始化 → softmax 预热 50 步 → 三阶段 50/50/10):总耗时 32 秒,得到序列 GRRVSAFEAMQNE,pLDDT 0.835。注意论文的策略是每种长度采 48,000 条再按 pLDDT>0.9 过滤,单条随手跑 0.84 属正常水位------要出货就批量跑加过滤。
显存实测:13-14 残基任务全程占用不到 2 GB,12 GB 消费级卡绰绰有余;按论文 7-16 残基的尺度,8 GB 以上显卡都够。
六、选型决策树
| 你要做什么 | 推荐 |
|---|---|
| 预测一条环肽的结构 | AfCycDesign 单序列模式,秒级出结果 |
| 有环肽骨架、要重设计序列 | AfCycDesign fixbb,可并行跑 ProteinMPNN(两者重叠少,互补) |
| 批量构建 7-13 残基环肽支架库 | AfCycDesign 幻觉 + pLDDT>0.9 过滤 |
| 设计环肽-靶点结合物 | 幻觉支架 + 基序嫁接(MotifGraft)+ AfCycDesign 复合物预测筛选 |
| 序列含 D-氨基酸 / N-甲基化等非天然残基 | 回 Rosetta KIC(AfCycDesign 仅支持 20 种标准氨基酸) |
| 大蛋白 / 普通复合物(非环肽) | 直接用 AlphaFold3 / Boltz 系列 |
七、局限与待追踪
- 只支持 20 种标准氨基酸------非天然残基(D-型、N-甲基化)要靠 Rosetta 后补,论文中 MDM2 结合物优化正是这个组合路线;
- 高置信 ≠ 唯一构象:X-ray 只能捕捉可结晶的构象,溶液中可能存在其他低能态,论文作者自己标注了这一点;
- 待追踪 :ColabDesign 上游何时修复
jnp.clip兼容(v1.1.3 + JAX 0.10 目前需手动 patch);全原子 DL 模型(AlphaFold3 系)何时把非天然氨基酸纳入环肽设计闭环;仓库仍在活跃更新(2026-08 有提交,⭐939)。
参考来源
- Rettie S, et al. Cyclic peptide structure prediction and design using AlphaFold2. Nat Commun 16 (2025). Cyclic peptide structure prediction and design using AlphaFold2 | Nature Communications
- 预印本版本:bioRxiv 2023.02.25.529956. https://doi.org/10.1101/2023.02.25.529956
- ColabDesign 仓库(含 af_cyc_design 模块):GitHub - sokrypton/ColabDesign: Making Protein Design accessible to all via Google Colab! · GitHub
- 官方示例笔记本:ColabDesign/af/examples/af_cyc_design.ipynb at main · sokrypton/ColabDesign · GitHub
- Jumper J, et al. Highly accurate protein structure prediction with AlphaFold. Nature 596:583-589 (2021). Highly accurate protein structure prediction with AlphaFold | Nature
系列导航 :专栏全集 开源多肽设计模型和方法实践
更多专栏: