ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AlphaFold-Multimer 蛋白质复合物预测:1 个 FASTA、1 条命令,如何拿到可靠的多聚体模型

AlphaFold-Multimer 蛋白质复合物预测:1 个 FASTA、1 条命令,如何拿到可靠的多聚体模型 AlphaFold-Multimer 蛋白质复合物预测1 个 FASTA、1 条命令如何拿到可靠的多聚体模型【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold目标不是单链而是多亚基复合物时蛋白质复合物预测应该走 AlphaFold-Multimeralphafold 仓库里的 multimer 模型把所有亚基序列写进一个 FASTA一条命令跑完拿到多链结构和三个置信度指标。本文按判断 → 输入 → 成本 → 参数 → 验收把整条链路讲清楚。判断口径单体预测解决不了的三种情形本节解决一个问题什么时候必须跑 multimer什么时候单体一次就够。化学计量已知。二聚体、三聚体、任意 A:B:C 组装只要链数明确multimer 就是首选。技术说明里写得很直接只要化学计量已知新版权重就是推荐模型包括已知为单体的结构。目的是判断两条链结不结合、怎么结合。一个界面未知的异源二聚体能靠两次单体预测拼出来吗不能。单体模型的输出只有一条链不存在两条链的相对取向这个概念链间关系只能来自 multimer 模型。目标大或来自冷冻电镜。v2.3.0 把训练数据截止日延到 2021-09-30结构数据多出约 30%其中电镜结构是原来的 4 倍超过 2000 残基的大型结构总量翻倍——大型复合物场景是主要受益者。反方向也说明白单链目标、以及化学计量未知的基因组规模预测通常还是单体模型平均更稳本文不再展开那条线。多聚体 FASTA 输入链的数量和顺序怎么写本节解决输入制备问题FASTA 里写几条 entry、按什么顺序写。两条规则一条亚基一个 entry份数等于条数。A2B3 复合物就写 2 条 A 序列的 entry、3 条 B 序列的 entry不是2 种序列。顺序与已知化学计量一致。模型按文件顺序接收链文献里已有惯例顺序的不要随手调换。以 A2B3 为例直接给模板同源多聚体就是它的特例sequence_1 SEQUENCE A sequence_2 SEQUENCE A sequence_3 SEQUENCE B sequence_4 SEQUENCE B sequence_5 SEQUENCE B注意 5 条 entry 对应 5 条链multimer 按 entry 区分亚基不按序列去重。同源三聚体把同一条序列复制成 3 个 entry写法完全相同。开跑前先算成本数据库、硬件与耗时 本节解决机器够不够的问题磁盘要多少、内存多少、单次预测跑多久。磁盘和内存的主要变量是数据库预设参数磁盘占用硬件门槛适用场景--db_presetreduced_dbs~600GB8 核 CPU、8GB 内存快速验证、中小型目标--db_presetfull_dbs~2.6TB12 核、32GB 内存正式高精度预测、大型复合物两套都用 scripts/download_all_data.sh 下载参数里选预设。A100 参考耗时2000 残基约 8 分钟A100 单卡、不含 MSA多序列比对和模板搜索、3 次 recycle 的参考时间残基数时间秒1004.9500291,000962,0004505,00018,8242,000 残基约 8 分钟5,000 残基约 5 小时——大型复合物按过夜任务排期。一条命令开跑四个按需打开的开关本节解决怎么跑的问题先给默认全量命令再列哪些开关只在特定情况下才需要加。python3 docker/run_docker.py \ --fasta_pathscomplex.fasta \ --model_presetmultimer \ --max_template_date2022-01-01 \ --db_presetreduced_dbs \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/multimer_output默认跑的就是 v2.3.0 权重训练 crop 从 384 提高到 640 残基训练链数从 8 提到 205 个模型中 3 个的 MSA 序列上限从 1,152 提到 2,048——适配更大复合物的部分已经内置不用额外配置。四个开关先结论后理由--num_multimer_predictions_per_model20超过 2000 残基或已知难的目标打开默认 5。种子越多最优结构命中率越高官方大型目标基线用的也是 20。global_config.subbatch_size在alphafold/model/config.py默认 64小目标提速就调大到 128显存溢出就调小。批越大步数越少批越小越省显存。--enable_gpu_relaxfalse超大复合物建议 CPU 松弛比默认 GPU 松弛更稳。--use_precomputed_msastrue同一目标换参数反复预测时打开复用已算好的 MSA跳过最耗时的步骤。结果验收三个指标、文件结构与可视化✅ 本节解决结果能不能用的问题先看三个指标各回答什么问题再定位文件最后说查看工具。指标回答的问题怎么读pLDDT0-100每个残基局部结构有多可靠80 高可信50-80 中等50 按无序区对待多为内在无序区段pTM整个复合物作为整体有多可靠只用于整体判断不用于单链PAE预测对齐误差一对残基的相对位置有多可信矩阵中 i-j 块值低 → 两区域相对取向可信两链间的离对角块值低 → 该界面结合可信三个数值都在result_model_*.pkl里。一次运行的输出目录结构target_name/ ranked_0.pdb # 置信度最高的结构 relaxed_model_1.pdb # 松弛后的结构 result_model_1.pkl # pLDDT、PAE 等原始数据 msas/ # 多序列比对 timings.json # 各步骤耗时查看工具PyMOL 看结构和界面ChimeraX 做多模型对比与出图AlphaFold Protein Structure Database 在线比对已知实验结构。故障速查表现象 → 原因 → 处置⚠️ 本节把四类常见翻车整理成三列表直接对号入座。现象可能原因处置命令GPU 显存溢出subbatch 过大或 full_dbs 输入过重调小subbatch_size改--db_presetreduced_dbs按结构域拆分单独预测成片区域 pLDDT50内在无序区IDR或 MSA 信号弱核对 IDR 注释该域改--model_presetmonomer_ptm向 MSA 补充同源序列亚基间相对位置不合理种子数不足FASTA 链序与已知化学计量不符加--num_multimer_predictions_per_model20核对 entry 顺序用 scripts/download_alphafold_params.sh 更新权重MSA 步骤耗时过长每次都从零重算加--use_precomputed_msastrue模型与训练数据的细节见 docs/technical_note_v2.3.0.md端到端流程可对照 notebooks/AlphaFold.ipynb。建议从一个同源二聚体目标起步先把输入 → 开跑 → 三指标验收的完整回路跑通再换成真实的异源复合物。【免费下载链接】alphafoldOpen source code for AlphaFold 2.项目地址: https://gitcode.com/GitHub_Trending/al/alphafold创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表