AfCycDesign:给 AlphaFold2 换张“环状座位表“,环肽预测/重设计/从头设计一次跑通(本地部署实测)

本文收录于专栏 开源多肽设计模型和方法实践 ------ 专栏系统覆盖开源多肽设计模型与实战方法,点击订阅可跟踪后续更新。

【摘要】 你做环肽设计时卡在两头:结构预测没趁手工具,Rosetta KIC 采一次骨架要上百计算小时;从头设计靠运气。这篇给你 AfCycDesign 的拆解+部署+实测:它不重训权重,只把 AlphaFold2 的位置编码换成环状偏移矩阵,就能预测环肽结构(SFTI-1 实测 RMSD 0.47 Å、8 秒)、重设计序列、从头幻觉 7-13 残基环肽(32 秒一条)。论文 8 个 X-ray 结构全部 RMSD<1.0 Å,MDM2/Keap1 纳摩尔结合物实证。附 conda 命令链、3 条踩坑、选型决策树,消费级 GPU 可跑。

关键字: AfCycDesign;ColabDesign;环肽设计;AlphaFold2;环肽结构预测;从头设计;MDM2;本地部署

改一张编码表,解锁环肽三件套。 Baker 实验室团队把 AlphaFold2 的线性位置编码改成环状,得到环肽结构预测(80 个 PDB 测试肽 58 个达标)、序列重设计(高置信设计数量约为 Rosetta 的 18 倍)、从头幻觉(10,000+ 高置信支架)三种能力;MDM2 结合物 IC50 338 nM、Keap1 结合物活性超线性 Nrf2 两倍。代码开源,消费级 GPU 可用。

相关教程与核心文献

官方教程 / 文档

资源 与本文关系
af_cyc_design.ipynb 本文第四、五节代码的官方出处,cyclic offset 函数原文在此
ColabDesign 仓库 README 安装命令与版本号出处(v1.1.3)
Colab 在线版 装本地环境前的 5 分钟快速验证入口

核心文献

文献 为什么值得先读
Rettie S, et al. Nat Commun 16 (2025). doi:10.1038/s41467-025-59940-7 本文主角:环状偏移编码原理 + 全部 benchmark 数据来源
Rettie S, et al. bioRxiv 2023.02.25.529956 (2023). doi:10.1101/2023.02.25.529956 预印本,可与正式版对照方法演进
Jumper J, et al. Nature 596:583-589 (2021). doi:10.1038/s41586-021-03819-2 AlphaFold2 原始论文,相对位置编码的母体

一、为什么写这篇:环肽设计的"断链"尴尬

环肽(7-13 个残基首尾相连)是这几年多肽药物的热门形态:没有游离末端所以抗蛋白酶降解,构象被环化锁死所以结合界面稳定,刚好能打小分子和抗体都够不着的蛋白-蛋白相互作用(PPI)靶点。问题在于计算工具一直没跟上------AlphaFold2 再强,它默认所有链都是线性的:你把一条环肽序列喂进去,它认为 N 端和 C 端相隔最远,预测出来的结构两端是"断开"的。

此前的主流方案是 Rosetta KIC(运动学闭环采样)+ 能量函数打分:准,但贵。论文给了一个参照------预测 SFTI-1(14 残基环肽)的构象,Rosetta 要采样 28,042 个结构、花 120 个计算小时;AfCycDesign 单张 GPU 约 2 分钟出结果。这就是这篇 2025 年 Nat Commun 论文要解决的痛点:不给 AF2 动手术,只改它的"座位表",让网络知道这条链首尾相连

二、原理:一张 N×N 的"环状座位表"

一句话定义:AfCycDesign = AlphaFold2 + 环状相对位置编码(cyclic offset),在 ColabDesign 框架中实现,网络权重一个参数都没有重新训练。

类比理解:AF2 的相对位置编码像教室的线性座位表------1 号坐最前、14 号坐最后,两人隔 13 排。环肽实际是圆桌:14 号旁边就是 1 号。AfCycDesign 做的事就是把座位表换成圆桌排法------构造一张 N×N 偏移矩阵,让末端残基的序列距离变成 ±1,其余位置按环上最短路径重算,再叠加进 evoformer 的成对特征。注意力层本身对顺序不敏感,全靠这张表理解"谁挨着谁"。

论文测了 3 种偏移类型(1:无方向;2:带方向的远程编码;3:只编码相邻残基),80 个测试肽上分别预测对 52/49/48 个,差异不大,作者推荐默认 type 2(远程信息留着没坏处)。这个"改输入不改权重"的思路带来两个直接红利:

  1. 二硫键无需显式指定。富含半胱氨酸的环肽(结肽、锥肽类)有 3-15 种可能的二硫键连接,Rosetta 方案必须逐个枚举,AfCycDesign 直接从序列推断;
  2. 同一框架干三件事。结构预测(predict)、固定骨架重设计序列(fixbb)、从头幻觉(hallucination,损失函数 = 1−pLDDT + PAE/31 + con/2,三阶段退火把连续序列 logits 逐步逼成离散序列),换协议不换工具。

三、性能横评:论文数字一次看全

结构预测 benchmark(80 个 PDB 环肽 NMR 结构,均不在 AF2 训练集内):

指标 数值
中位 pLDDT / 中位 RMSD 0.92 / 0.8 Å
达标(pLDDT>0.7 且 RMSD<1.5 Å) 58/80
高置信(pLDDT>0.85)预测准确率 80%(44/55)
单序列模式(无 MSA) 49/80 达标,速度更快
去掉环状偏移(消融) 达标数明显下降

与同类方法对比

维度 AfCycDesign Rosetta KIC ProteinMPNN
原理 DL(AF2 + 环状编码) 物理采样 + 能量函数 序列设计网络
SFTI-1 构象预测耗时 ~2 min(单 GPU) 120 计算小时(28,042 构象) 不做结构预测
13 肽骨架序列重设计(3,274 簇) 1,145 簇 pLDDT>0.9 63 簇 pLDDT>0.9 ---
幻觉 10 肽骨架的序列设计 608 个 pLDDT>0.9 --- 505 个(重叠仅 157,两者互补)
非天然 / D-氨基酸 ❌ 仅 20 种标准氨基酸
二硫键连接 无需指定 需枚举 ---

实验验证(全文最硬的部分):8 个设计(1 个重设计 + 7 个幻觉)的 X-ray 晶体结构与计算模型全部 Cα-RMSD < 1.0 Å(最优 0.3 Å,10/13 侧链旋转异构体一致)。11-13 残基的大环此前必须加二硫键交联才能稳定,AfCycDesign 不加交联直接设计成功。

功能化验证:把 p53 的 5 残基结合基序(FXXXW)嫁接到幻觉支架上,MDM2 结合物 RMG_14 IC50 = 338 nM,引入 5 个突变(含 5-氟色氨酸、D-氨基酸)后亲和力再提约 10 倍;Keap1 方向嫁接 Nrf2 的 EETG 热环,3 个合成设计与线性 Nrf2 肽相当或更优(KC4 活性 2 倍、IC50<200 nM)。1,014 个已知"热环"基序中 798 个能匹配到 24,104 个高置信支架上------支架库通用性过关。

四、本地部署(conda + 消费级 GPU,2026-09-19 实测)

环境基线:Ubuntu 22.04 + 一块消费级 GPU(12 GB 显存,CUDA 12.4);纯 CPU 也能跑,慢一到两个数量级。

复制代码
# 1. 建环境(Python 3.11)
conda create -n afcycdesign python=3.11 -y

# 2. 装 JAX CUDA 版(系统 CUDA 12.x 对应 [cuda12])
pip install "jax[cuda12]"

# 3. 装 ColabDesign(AfCycDesign 已内置,当前 v1.1.3)
pip install git+https://github.com/sokrypton/ColabDesign.git

# 4. AF2 权重:本地已有就直接软链(省约 4 GB 下载)
ln -s <你的AF2权重目录> ./params   # 需含 params_model_{1..5}_ptm.npz

环境总占地约 5.9 GB(大头是 JAX 的 nvidia-cu12 依赖)。

踩坑实录(全部实测复现):

⚠️ 踩坑 #1 :报 TypeError: clip() got an unexpected keyword argument 'a_max'

根因:ColabDesign 内置的 AlphaFold 模块仍用旧式 jnp.clip(a_min=, a_max=),JAX 0.10 已删除这两个参数。

修复:改安装目录下 colabdesign/af/alphafold/model/modules.py(1 处)和 modules_multimer.py(2 处),把 a_min=/a_max= 换成 min=/max=,删 __pycache__ 后重跑。
⚠️ 踩坑 #2 :纯序列预测时 prep_inputs(length=L) 报缺 pdb_filename

根因:fixbb 协议强制要求骨架 PDB。

修复:纯序列预测改用 protocol="hallucination" 初始化再 predict(seq=...),预测路径完全一致。
⚠️ 踩坑 #3 :官方笔记本默认在线下载 AF2 权重(约 4 GB)。

修复:本地若已有 AlphaFold2 参数,在工作目录建 params 软链即可------mk_afdesign_model(data_dir=".") 默认找 ./params/params_model_*.npz

五、实战体验(两组实测)

实测 1:SFTI-1 环肽结构预测。向日葵胰蛋白酶抑制剂(14 残基首尾成环 + 1 对二硫键,PDB 1JBL------正是论文里 Rosetta 花 120 小时的例子)。单序列模式 + cyclic offset type 2 + 6 recycles:

模型 pLDDT Cα-RMSD vs NMR 耗时
model_1_ptm 0.904 0.69 Å 7.7 s(含 JIT 编译)
model_2_ptm 0.930 0.49 Å 0.1 s
model_3_ptm 0.947 0.52 Å 0.1 s
model_4_ptm 0.955 0.47 Å 0.1 s
model_5_ptm 0.956 0.54 Å 0.1 s

5 个模型总计约 8 秒,最优 RMSD 0.47 Å------远优于论文达标线 1.5 Å,也好于论文全集的中位数 0.8 Å。叠合图(灰 = NMR 实验结构,青 = 预测):

核心代码不到 10 行:

复制代码
from colabdesign import mk_afdesign_model
model = mk_afdesign_model(protocol="hallucination", use_templates=False, data_dir=".")
model.prep_inputs(length=14)
add_cyclic_offset(model, offset_type=2)   # 关键一步,函数原文见官方笔记本
model.predict(seq="GRCTKSIPPICFPD", num_recycles=6, models=[0,1,2,3,4])
model.save_pdb("sfti1_pred.pdb")

实测 2:从头幻觉一条 13 残基环肽 (Gumbel 初始化 → softmax 预热 50 步 → 三阶段 50/50/10):总耗时 32 秒,得到序列 GRRVSAFEAMQNE,pLDDT 0.835。注意论文的策略是每种长度采 48,000 条再按 pLDDT>0.9 过滤,单条随手跑 0.84 属正常水位------要出货就批量跑加过滤。

显存实测:13-14 残基任务全程占用不到 2 GB,12 GB 消费级卡绰绰有余;按论文 7-16 残基的尺度,8 GB 以上显卡都够。

六、选型决策树

你要做什么 推荐
预测一条环肽的结构 AfCycDesign 单序列模式,秒级出结果
有环肽骨架、要重设计序列 AfCycDesign fixbb,可并行跑 ProteinMPNN(两者重叠少,互补)
批量构建 7-13 残基环肽支架库 AfCycDesign 幻觉 + pLDDT>0.9 过滤
设计环肽-靶点结合物 幻觉支架 + 基序嫁接(MotifGraft)+ AfCycDesign 复合物预测筛选
序列含 D-氨基酸 / N-甲基化等非天然残基 回 Rosetta KIC(AfCycDesign 仅支持 20 种标准氨基酸)
大蛋白 / 普通复合物(非环肽) 直接用 AlphaFold3 / Boltz 系列

七、局限与待追踪

  1. 只支持 20 种标准氨基酸------非天然残基(D-型、N-甲基化)要靠 Rosetta 后补,论文中 MDM2 结合物优化正是这个组合路线;
  2. 高置信 ≠ 唯一构象:X-ray 只能捕捉可结晶的构象,溶液中可能存在其他低能态,论文作者自己标注了这一点;
  3. 待追踪 :ColabDesign 上游何时修复 jnp.clip 兼容(v1.1.3 + JAX 0.10 目前需手动 patch);全原子 DL 模型(AlphaFold3 系)何时把非天然氨基酸纳入环肽设计闭环;仓库仍在活跃更新(2026-08 有提交,⭐939)。

参考来源

  1. Rettie S, et al. Cyclic peptide structure prediction and design using AlphaFold2. Nat Commun 16 (2025). Cyclic peptide structure prediction and design using AlphaFold2 | Nature Communications
  2. 预印本版本:bioRxiv 2023.02.25.529956. https://doi.org/10.1101/2023.02.25.529956
  3. ColabDesign 仓库(含 af_cyc_design 模块):GitHub - sokrypton/ColabDesign: Making Protein Design accessible to all via Google Colab! · GitHub
  4. 官方示例笔记本:ColabDesign/af/examples/af_cyc_design.ipynb at main · sokrypton/ColabDesign · GitHub
  5. Jumper J, et al. Highly accurate protein structure prediction with AlphaFold. Nature 596:583-589 (2021). Highly accurate protein structure prediction with AlphaFold | Nature

系列导航 :专栏全集 开源多肽设计模型和方法实践

更多专栏:

蛋白 / 多肽 分子模拟 / 动力学 分子对接 / CADD / 工具 其他
开源蛋白结构推理预测 分子模拟基础 UCSF DOCK系列 agent智能体系列
开源蛋白生成方法实践 分子动力学模拟-Amber rDock系列 化学大模型介绍(2025)
蛋白药物设计-原理与案例剖析 分子动力学模拟-Gromacs LeDock系列 我胡师兄说药
开源多肽设计模型和方法实践 結合自由能 CADD中的机器学习模型 siRNA药物设计模型
开源多肽性质预测 高效计算基本配置 小分子药物设计-原理与案例剖析 ASO药物设计模型
多肽药物设计-原理与案例剖析 作用于DNA/RNA的药物设计实践 开源小分子生成和设计实践 开源药代动力学模拟软件
相关推荐
维核科技1 天前
AI 网络安全:攻防的新战线
私有化部署·本地部署·大模型部署·离线部署·维核智创
维核科技2 天前
冷启动与预热优化
私有化部署·本地部署·大模型部署·离线部署
智码看视界3 天前
从零训出 7B 数学大模型全开源:ZGCM-1-7B 部署、实测与微调全记录
数学推理·本地部署·开源大模型·lora微调·zgcm-1-7b·256k长上下文
深圳市爱派派智能科技有限公司4 天前
告别部署繁琐:LlamaPi 一键搭建本地 Agent 推理底座
rk3588·agent·openai api·本地部署·边缘ai·端侧大模型·llamapi
Eric.4623 天前
2026最新|ComfyUI AI漫剧全自动教程:统一人设、智能分镜、插帧动效、批量成片保姆级指南
人工智能·ai绘画·comfyui·本地部署·ai漫剧
邵奈一1 个月前
童年照本地部署实测
人工智能·深度学习·机器学习·大模型·本地部署
CSharp精选营1 个月前
DeepSeek Harness 爆火但安装劝退?一键启动器来了,不懂编程也能用
本地部署·ai agent·一键启动·deepseekharness·dsh·非技术友好
eric-sjq1 个月前
0.6B 前端生成模型本地部署实战:消费级显卡跑通 WanlyFrontend 全流程
前端·本地部署
ShallWeL1 个月前
【机器学习】(39)—— 部署测试
人工智能·机器学习·大模型·llm·本地部署