設(shè)計(jì)實(shí)戰(zhàn):從序列到候選方案的 4 個(gè)決策點(diǎn))
AlphaFold 蛋白質(zhì)設(shè)計(jì)實(shí)戰(zhàn)從序列到候選方案的 4 個(gè)決策點(diǎn)【免費(fèi)下載鏈接】alphafoldOpen source code for AlphaFold 2.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/al/alphafold本文以開源項(xiàng)目 AlphaFold 為例基于結(jié)構(gòu)預(yù)測用 4 個(gè)決策點(diǎn)演示如何從一條氨基酸序列完成蛋白質(zhì)設(shè)計(jì)與結(jié)構(gòu)優(yōu)化流程產(chǎn)出可實(shí)驗(yàn)驗(yàn)證的突變候選方案清單。哪些設(shè)計(jì)問題值得交給計(jì)算工業(yè)酶熱穩(wěn)定性改造傳統(tǒng)路線是先建飽和突變庫 → 高通量篩選 Tm → 回測序反推位點(diǎn)一輪下來以周計(jì)。用結(jié)構(gòu)預(yù)測可以把流程反過來先預(yù)測野生型結(jié)構(gòu)圈出表面暴露的疏水位點(diǎn)和核心 packing 缺陷再做幾十到一百個(gè)位點(diǎn)規(guī)模的定向小庫。實(shí)驗(yàn)篩選輪次通常從千級(jí)降到百級(jí)且命中位點(diǎn)可直接解讀。抗體親和力成熟CDR 環(huán)區(qū)決定親和力也是結(jié)構(gòu)預(yù)測中的低置信度高發(fā)區(qū)。舊做法依賴同源建模環(huán)區(qū)經(jīng)常建不出來預(yù)測模型直接給出帶逐殘基置信度的環(huán)區(qū)構(gòu)象只挑結(jié)構(gòu)可靠的 CDR 區(qū)域做突變?cè)O(shè)計(jì)省去數(shù)輪建模失敗—重試。代謝通路限速酶工程通路工程里的瓶頸酶常是沒有結(jié)構(gòu)的同源蛋白等 X 射線解析要幾個(gè)月。先跑結(jié)構(gòu)預(yù)測與已知同源物比對(duì)活性位點(diǎn)差異再設(shè)計(jì)定向突變等結(jié)構(gòu)這一步被跳過蛋白質(zhì)工程設(shè)計(jì)當(dāng)周就能啟動(dòng)。一條從序列到候選方案的完整管道管道分四段輸入、預(yù)測、評(píng)估、輸出。命令以 run_alphafold.py 為中心。輸入序列與數(shù)據(jù)庫準(zhǔn)備目標(biāo)序列 FASTA用 scripts/download_all_data.sh 準(zhǔn)備 MSA 數(shù)據(jù)庫UniRef90、BFD、MGnify 等。模型先用 JackHMMER 與 HHblits 在數(shù)據(jù)庫中做序列比對(duì)MSA 質(zhì)量直接決定結(jié)構(gòu)預(yù)測精度的上限。預(yù)測一條命令跑 5 個(gè)模型python run_alphafold.py \ --fasta_pathstarget.fasta \ --output_dirout \ --model_presetmonomer--model_preset單鏈用monomer蛋白復(fù)合物用multimer--use_precomputed_msas設(shè)為True時(shí)復(fù)用輸出目錄里的 MSA重跑突變體序列可跳過比對(duì)步驟首次運(yùn)行還需給--data_dir與各數(shù)據(jù)庫路徑定義見 run_alphafold.py 的 flag 段評(píng)估pLDDT 與 PAE 兩處讀數(shù)每個(gè)模型輸出逐殘基置信度文件confidence_model_0.json和殘基對(duì)誤差矩陣pae_model_0.json。pLDDT 解讀的四檔劃分實(shí)現(xiàn)在 alphafold/common/confidence.py低于 50 按無序區(qū)域處理50–70 低置信度70–90 中等90 以上高置信度。設(shè)計(jì)口徑關(guān)鍵功能區(qū)域 ≥ 70 才進(jìn)入位點(diǎn)篩選若 50 且與野生型模式一致判為天然無序區(qū)不作為設(shè)計(jì)靶點(diǎn)。藍(lán)色為預(yù)測綠色為實(shí)驗(yàn)結(jié)構(gòu)PAE 是兩殘基在全局對(duì)齊后的期望空間偏差?。對(duì)角塊低說明局部折疊可靠某塊對(duì)角外數(shù)值高說明兩個(gè)結(jié)構(gòu)域間相對(duì)取向不確定設(shè)計(jì)若跨域先記下這個(gè)風(fēng)險(xiǎn)。輸出排序后的結(jié)構(gòu)5 個(gè)模型按置信度排序?qū)懗鰎anked_*.cif第一名在前每個(gè)模型同時(shí)保留放松前后的unrelaxed_model_N.pdb與relaxed_model_N.pdb。設(shè)計(jì)用的應(yīng)是放松后的結(jié)構(gòu)經(jīng) Amber 力場能量最小化立體化學(xué)殘差記錄在relax_metrics.json。 一個(gè)具體突變案例的推演示例某脂肪酶野生型 Tm 45°C蛋白質(zhì)穩(wěn)定性優(yōu)化目標(biāo)是提到 60°C 同時(shí)保持活性。下面按完整突變篩選流程走一遍。結(jié)構(gòu)分析先確認(rèn)結(jié)構(gòu)可信對(duì)野生型跑結(jié)構(gòu)預(yù)測讀逐殘基 pLDDT。全鏈 ≥ 80 為主 → 結(jié)構(gòu)可信進(jìn)入位點(diǎn)選擇活性位點(diǎn)區(qū)域 70 → 局部信息不足先查 MSA 覆蓋度與模板命中不在不可靠區(qū)域上設(shè)計(jì)蛋白質(zhì)二級(jí)結(jié)構(gòu)帶狀圖位點(diǎn)選擇三類位點(diǎn)兩條排除線先圈三類位點(diǎn)表面暴露的疏水殘基SASA 40 ?2、核心空腔、螺旋 N/C 末端無卷曲區(qū)。以候選位點(diǎn) M83、L91 為例。位點(diǎn)位于溶劑暴露面、距活性位點(diǎn) 12 ? → 進(jìn)入突變清單位點(diǎn)距活性位點(diǎn) 6 ? → 直接排除熱穩(wěn)定性改造落在活性位點(diǎn)上幾乎必然傷催化預(yù)測打分每個(gè)單點(diǎn)突變單獨(dú)重跑先把野生型輸出目錄的msa_*文件復(fù)制到各突變體輸出目錄再執(zhí)行python run_alphafold.py \ --fasta_pathstarget_M83V.fasta \ --output_dirout_M83V \ --use_precomputed_msasTrue復(fù)用 MSA 保證野生型與突變體輸入完全一致分?jǐn)?shù)差反映的只是突變本身打分對(duì)比三項(xiàng)全局 pLDDT 均值、活性位點(diǎn)區(qū)域 pLDDT、該區(qū)域?qū)θ值?PAE 變化全局 pLDDT 不降且局部 PAE 不升 → 保留活性位點(diǎn) pLDDT 掉 10 分以上 → 淘汰哪怕全局分更高實(shí)驗(yàn)驗(yàn)證先做 3–5 個(gè)對(duì)排名前 3–5 的突變體表達(dá)DSC 測 TmCD 同步看二級(jí)結(jié)構(gòu)。Tm 提升 2°C → 位點(diǎn)方向不對(duì)回退擴(kuò)大掃描范圍Tm 升但活性掉 10% → 看預(yù)測結(jié)構(gòu)里活性位點(diǎn)周邊構(gòu)象變化找出耦合位點(diǎn)后改組合?? 設(shè)計(jì)中的四個(gè)高頻誤判誤判 1把高 pLDDT 當(dāng)穩(wěn)定性證明。后果pLDDT 衡量的是模型對(duì)該區(qū)域結(jié)構(gòu)的確信度不是蛋白的熱力學(xué)穩(wěn)定性分?jǐn)?shù)更高的突變體不代表 Tm 更高。修正pLDDT 只做結(jié)構(gòu)過濾穩(wěn)定性結(jié)論來自 ΔpLDDT、放松能量與實(shí)驗(yàn) Tm 的組合。誤判 2對(duì)低 pLDDT 區(qū)域做突變來修。后果低分區(qū)域常是天然的柔性鉸鏈或連接子強(qiáng)行折疊往往破壞功能。修正先與野生型模式比對(duì)野生型同區(qū)域也低分按天然無序處理不設(shè)計(jì)。誤判 3多突變一次性堆疊不做單點(diǎn)驗(yàn)證。后果上位效應(yīng)讓每個(gè)位點(diǎn)的貢獻(xiàn)無法歸因失敗后不知改哪個(gè)。修正按單點(diǎn) → 兩點(diǎn)組合 → 3–5 位點(diǎn)組合推進(jìn)每一步都重預(yù)測、重打分。誤判 4只看 ranked_0 第一名忽略另外 4 個(gè)模型。后果5 個(gè)模型彼此分歧時(shí)置信度天然不足在不穩(wěn)的結(jié)構(gòu)上設(shè)計(jì)浪費(fèi)整輪。修正先比對(duì) 5 個(gè)模型間主鏈 RMSD分歧大就先重查數(shù)據(jù)與隨機(jī)種子。往更深處走的方向蛋白質(zhì)-配體復(fù)合物。multimer 配置面向蛋白-蛋白相互作用配體結(jié)合口袋仍需共晶結(jié)構(gòu)或?qū)友a(bǔ)充。結(jié)構(gòu)預(yù)測在此的價(jià)值是先評(píng)估口袋幾何與關(guān)鍵殘基分布再指導(dǎo)特異性突變選點(diǎn)。多聚體建模。使用--model_presetmultimer除逐鏈 pLDDT 外輸出 pTM 與界面 ipTM用來判斷復(fù)合物形成置信度適用于酶復(fù)合體與抗體-抗原設(shè)計(jì)場景。與 Rosetta、FoldFlow 銜接。AlphaFold 出初始結(jié)構(gòu)與候選位點(diǎn)清單Rosetta 做能量化的 Relax/Remodel 精修FoldFlow 做序列級(jí)的條件生成與重設(shè)計(jì)。三者組成結(jié)構(gòu)預(yù)測—序列設(shè)計(jì)—物理能量校驗(yàn)的循環(huán)成熟蛋白質(zhì)工程流程里常見組合。起步動(dòng)作只有一個(gè)先跑通野生型結(jié)構(gòu)預(yù)測記下 pLDDT 與 PAE 兩張底數(shù)再按案例段的 4 個(gè)決策點(diǎn)篩出第一輪位點(diǎn)清單。 模型架構(gòu)與訓(xùn)練數(shù)據(jù)見 docs/technical_note_v2.3.0.md數(shù)據(jù)庫準(zhǔn)備腳本在 scripts/ 目錄下。【免費(fèi)下載鏈接】alphafoldOpen source code for AlphaFold 2.項(xiàng)目地址: https://gitcode.com/GitHub_Trending/al/alphafold創(chuàng)作聲明:本文部分內(nèi)容由AI輔助生成(AIGC),僅供參考