復(fù)合物結(jié)構(gòu)預(yù)測(cè)完整手冊(cè))
30 分鐘跑通 AlphaFold-Multimer多亞基蛋白質(zhì)復(fù)合物結(jié)構(gòu)預(yù)測(cè)完整手冊(cè)【免費(fèi)下載鏈接】alphafoldOpen source code for AlphaFold 2.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/al/alphafold拿到一份三聚體 FASTA怎么在半小時(shí)內(nèi)跑出第一個(gè)可信的復(fù)合物結(jié)構(gòu)并看懂結(jié)果里 pLDDT、pTM、PAE 三個(gè)指標(biāo)在說(shuō)什么本文按準(zhǔn)備輸入 → 跑通預(yù)測(cè) → 讀懂結(jié)果 → 踩坑排查的實(shí)際操作順序組織直接給命令、參數(shù)和判斷標(biāo)準(zhǔn)覆蓋同源三聚體預(yù)測(cè)、大型復(fù)合物預(yù)測(cè)的性能調(diào)優(yōu)與常見(jiàn)問(wèn)題排查。核心關(guān)鍵詞是 AlphaFold-Multimer蛋白質(zhì)復(fù)合物結(jié)構(gòu)預(yù)測(cè)的多亞基模型倉(cāng)庫(kù)內(nèi)官方說(shuō)明見(jiàn) README.md。準(zhǔn)備輸入單體與多聚體 FASTA 寫法對(duì)照FASTA 文件的條目數(shù)量直接決定用哪種模型一個(gè)條目走單體--model_presetmonomer多個(gè)條目走多聚體--model_presetmultimer。每個(gè)亞基占一個(gè)獨(dú)立條目同源多聚體就是把同一條序列重復(fù) N 次異源多聚體按化學(xué)計(jì)量比stoichiometry排列各亞基。場(chǎng)景條目數(shù)序列排列模型預(yù)設(shè)單體1單條序列monomer同源三聚體3同一條序列重復(fù) 3 次multimer異源五聚體A2B35先 A 后 B各按其拷貝數(shù)排列multimer同源三聚體寫法sequence_1 SEQUENCE sequence_2 SEQUENCE sequence_3 SEQUENCE異源五聚體2 拷貝 A 3 拷貝 B寫法sequence_1 SEQUENCE A sequence_2 SEQUENCE A sequence_3 SEQUENCE B sequence_4 SEQUENCE B sequence_5 SEQUENCE B兩個(gè)注意點(diǎn)多聚體預(yù)測(cè)額外依賴 UniProt 和 PDB seqres 數(shù)據(jù)庫(kù)下載腳本 scripts/download_all_data.sh 會(huì)一并拉取條目順序建議與已知復(fù)合物的亞基排列一致亞基順序混亂是亞基排列異常問(wèn)題的常見(jiàn)來(lái)源之一。跑通預(yù)測(cè)命令、數(shù)據(jù)庫(kù)預(yù)設(shè)與種子數(shù)配置預(yù)測(cè)入口統(tǒng)一是 docker/run_docker.py。多聚體預(yù)測(cè)最小命令python3 docker/run_docker.py \ --fasta_pathstrimer.fasta \ --max_template_date2021-11-01 \ --model_presetmultimer \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/output關(guān)鍵參數(shù)速查參數(shù)默認(rèn)值作用--model_preset-monomer/multimer決定走哪套模型--db_presetfull_dbs基因數(shù)據(jù)庫(kù)預(yù)設(shè)控制 MSA 搜索的速度/質(zhì)量權(quán)衡--num_multimer_predictions_per_model5每個(gè)模型跑多少種子5 模型共 25 個(gè)預(yù)測(cè)調(diào)成 1 則每模型 1 種子--use_precomputed_msasfalse復(fù)用上一次運(yùn)行的 MSA換參數(shù)重跑時(shí)省 MSA 時(shí)間--enable_gpu_relaxtrue松弛在 GPU快但可能不穩(wěn)還是 CPU慢但穩(wěn)上跑--max_template_date-模板結(jié)構(gòu)截止日期避免泄漏已知結(jié)構(gòu)數(shù)據(jù)庫(kù)預(yù)設(shè)的硬件需求對(duì)照預(yù)設(shè)磁盤占用硬件需求適用場(chǎng)景reduced_dbs約 600 GB8 CPU 核、8 GB RAM快速測(cè)試、中小型蛋白質(zhì)full_dbs約 2.6 TB解壓后更高 CPU/RAM推薦 SSD高精度、大型復(fù)合物下載時(shí)預(yù)設(shè)要與運(yùn)行時(shí)預(yù)設(shè)一致scripts/download_all_data.sh DOWNLOAD_DIR reduced_dbs # 之后必須配 --db_presetreduced_dbs大型復(fù)合物2000 殘基建議提高每模型種子數(shù)到 20這是 docs/technical_note_v2.3.0.md 中 CASP15 基線使用的配置python3 docker/run_docker.py \ --fasta_pathslarge_complex.fasta \ --model_presetmultimer \ --num_multimer_predictions_per_model20 \ --data_dir$DOWNLOAD_DIR \ --output_dir/home/user/large_complex_output速度參考單卡 A100僅不含 MSA 與模板搜索的結(jié)構(gòu)預(yù)測(cè)時(shí)間殘基數(shù)預(yù)測(cè)時(shí)間1004.9 s1,00096 s2,000450 s3,0001,240 s5,00018,824 s讀懂結(jié)果pLDDT / pTM / PAE 判讀與輸出目錄三個(gè)指標(biāo)分工明確pLDDT 看局部折疊pTM 看整體組裝PAE 看鏈間相對(duì)位置。全部可從result_model_*.pkl中取出plddt、ptm、predicted_aligned_error字段。pLDDT0–100逐殘基80 結(jié)構(gòu)可靠50–80 二級(jí)結(jié)構(gòu)正確但側(cè)鏈/局部幾何可能有偏差20–50 松散區(qū)域20 基本無(wú)序或錯(cuò)誤。判斷某條鏈整體質(zhì)量時(shí)按鏈取均值。pTM標(biāo)量0–1評(píng)估整體 domain packing 的置信度。多鏈體系里 pTM 偏低而 pLDDT 正常通常意味著單鏈折疊對(duì)、亞基間相對(duì)位置不可信。PAE0–約 31 ?[N_res, N_res] 矩陣對(duì)角塊值低說(shuō)明鏈內(nèi)可信非對(duì)角塊值低經(jīng)驗(yàn)閾值 ~8 ?說(shuō)明兩條鏈的相對(duì)取向可信值高則界面接觸不可靠。PAE 矩陣是判斷同源三聚體預(yù)測(cè)界面是否可信的核心依據(jù)。輸出目錄結(jié)構(gòu)target_name/下官方說(shuō)明見(jiàn) README.md 的 AlphaFold output 一節(jié)target_name/ ranked_0.pdb # 置信度最高的結(jié)構(gòu)ranked_i 為第 i1 高 unrelaxed_model_{1..5}.pdb # 模型原始輸出 relaxed_model_{1..5}.pdb # Amber 松弛后的結(jié)構(gòu)默認(rèn)只松弛最優(yōu)模型 relaxed_model_{1..5}.pdb # 松弛后結(jié)構(gòu) result_model_{1..5}.pkl # pLDDT / pTM / PAE 等原始輸出 ranking_debug.json # 各模型 pLDDT 與排序映射 relax_metrics.json # 松弛后剩余幾何沖突 timings.json # 各階段耗時(shí)--benchmarktrue 時(shí) features.pkl # 輸入特征 msas/ # BFD/UniRef90/MGnify 的 MSA 文件日常使用只需關(guān)心三個(gè)文件ranked_0.pdb結(jié)構(gòu)、result_model_*.pkl指標(biāo)、msas/復(fù)現(xiàn)或調(diào)試 MSA。踩坑排查癥狀 → 原因 → 解法癥狀大型復(fù)合物 GPU 內(nèi)存不足OOM可能原因復(fù)合體過(guò)大前向傳播分塊太小GPU 松弛占用額外顯存。解法調(diào)大 alphafold/model/config.py 中g(shù)lobal_config.subbatch_size默認(rèn) 4小型結(jié)構(gòu)在 A100 上調(diào)到 128 可提速仍 OOM 則反向調(diào)小換--enable_gpu_relaxfalse把松弛挪到 CPU最后考慮按結(jié)構(gòu)域拆分后單獨(dú)預(yù)測(cè)再對(duì)接。癥狀局部 pLDDT 低于 50結(jié)構(gòu)不可靠可能原因該區(qū)域是內(nèi)在無(wú)序區(qū)IDRMSA 覆蓋不足。解法先用result_model_*.pkl中的plddt確認(rèn)是整鏈低還是局部低局部低先接受IDR 無(wú)穩(wěn)定結(jié)構(gòu)整鏈低則換--db_presetfull_dbs補(bǔ)強(qiáng) MSA檢查msas/下 a3m/sto 文件是否有效命中同一序列反復(fù)調(diào)參時(shí)用--use_precomputed_msastrue復(fù)用 MSA 省時(shí)間。癥狀亞基間相對(duì)位置不合理界面重疊或距離離譜可能原因種子數(shù)不夠?qū)е虏蓸硬蛔爿斎雭喕樞蚺c真實(shí)復(fù)合物不一致模型版本過(guò)舊。解法調(diào)--num_multimer_predictions_per_model20核對(duì) FASTA 條目順序用 scripts/download_alphafold_params.sh 更新到 v2.3.0 權(quán)重——該版本訓(xùn)練數(shù)據(jù)截止 2021-09-30新增約 30% 結(jié)構(gòu)數(shù)據(jù)、4 倍電鏡結(jié)構(gòu)訓(xùn)練樣本從 384 增至 640 殘基3/5 個(gè)模型的 MSA 上限從 1,152 提升到 2,048訓(xùn)練鏈數(shù)從 8 增至 20對(duì) 2000 殘基的大型復(fù)合物提升明顯。下一步用 PyMOL 打開ranked_0.pdb按鏈著色后檢查亞基界面殘基距離與 PAE 非對(duì)角塊是否一致ChimeraX 可對(duì)比ranked_1.pdb/ranked_2.pdb評(píng)估采樣一致性。打開result_model_1.pkl打印plddt與predicted_aligned_error把逐鏈 pLDDT 均值和關(guān)鍵鏈對(duì)的 PAE 值記錄為判據(jù)再?zèng)Q定是否調(diào)參重跑。到 AlphaFold Protein Structure Database 查目標(biāo)序列的已有預(yù)測(cè)或?qū)嶒?yàn)結(jié)構(gòu)與本地結(jié)果疊加比對(duì)super對(duì)齊后看 CA 鏈偏差有實(shí)驗(yàn)結(jié)構(gòu)時(shí)以它為參照校準(zhǔn)置信度判讀。調(diào)優(yōu)后重跑同一序列時(shí)固定加上--use_precomputed_msastrue和--benchmarktrue用timings.json跟蹤各階段耗時(shí)變化。【免費(fèi)下載鏈接】alphafoldOpen source code for AlphaFold 2.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/al/alphafold創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考