動RNA適配體智能篩選新范式)
1. 項目概述當AI大模型遇上RNA適配體篩選最近在翻看《自然·生物技術》上的一篇論文標題叫“CRISmersGRAPE-LM RNA適配體進化新范式”這個組合拳打得相當有意思。簡單來說它把兩個看似不搭界的東西——用于基因編輯的CRISPR系統(tǒng)具體是CRISmers和當下火熱的AI大語言模型GRAPE-LM——給擰到了一塊目標是解決一個老難題如何更高效、更智能地篩選和進化出性能優(yōu)異的RNA適配體。RNA適配體是什么你可以把它想象成一種用RNA“折紙”折出來的、具有特定三維結(jié)構的分子。它能像抗體一樣高親和力、高特異性地結(jié)合一個目標分子比如一個蛋白質(zhì)、一個小分子藥物甚至是一個病毒顆粒。這東西在疾病診斷、靶向治療、生物傳感器等領域潛力巨大。但問題來了傳統(tǒng)的篩選方法比如指數(shù)富集的配體系統(tǒng)進化技術過程極其耗時耗力就像大海撈針而且撈上來的“針”適配體性能未必是最優(yōu)的。這篇論文提出的新范式核心思路是“虛實結(jié)合”。CRISmers負責在真實的生化實驗里“干臟活累活”高效生成和篩選海量的RNA序列變異體而GRAPE-LM這個大語言模型則是在數(shù)字世界里充當“超級軍師”它通過學習已知的RNA序列-功能關系能預測哪些新序列可能有戲甚至能“憑空想象”出有潛力的全新序列指導下一輪的實驗方向。這不再是盲目的試錯而是有了AI預測導航的定向進化。對于做分子生物學、合成生物學尤其是從事核酸藥物開發(fā)或生物傳感研究的同行來說這個方法論的價值不言而喻。它不僅僅是一個實驗技術的升級更是一種研發(fā)范式的轉(zhuǎn)變將高通量實驗生成的數(shù)據(jù)與AI模型的迭代學習能力深度耦合形成一個“實驗生成數(shù)據(jù) - AI學習預測 - 指導新實驗設計”的加速循環(huán)。接下來我就結(jié)合自己的理解拆解一下這套組合拳里的技術細節(jié)、實操邏輯以及它可能帶來的改變。2. 核心組件深度解析CRISmers與GRAPE-LM如何各司其職要理解這個新范式必須先把兩個核心工具拆開看明白。它們一個主攻濕實驗一個主攻干實驗分工明確協(xié)同進化。2.1 CRISmers不止于編輯更是高通量篩選的引擎CRISmers這個詞可能不少同行第一次見。它脫胎于我們熟悉的CRISPR-Cas系統(tǒng)但在這里它的核心功能不是進行基因編輯。論文中的CRISmers我理解是一套利用CRISPR相關蛋白比如dCas9一種“死”的、只有結(jié)合能力沒有切割能力的Cas9和向?qū)NAgRNA的復合物來高效捕獲、富集或報告與特定目標結(jié)合的RNA適配體的技術平臺。它的工作原理可以類比為一個高度特異的“分子釣魚竿”釣竿dCas9蛋白被固定在某個表面如磁珠、微流控芯片通道它本身穩(wěn)定且具有結(jié)合能力。魚線gRNA其序列設計包含兩部分。一部分是能結(jié)合dCas9的支架序列另一部分是一個已知的、能與目標分子弱結(jié)合的RNA適配體序列作為初始“魚餌”。魚塘文庫是一個包含了海量變異RNA序列的庫這些序列都是在初始“魚餌”序列基礎上隨機突變產(chǎn)生的。釣魚過程當gRNA-dCas9復合物帶著初始魚餌與目標分子一起孵育時如果文庫中某個變異RNA序列與目標分子的結(jié)合力強于初始魚餌它就會競爭性地把目標分子“搶”過來。通過一系列生化操作如洗脫、PCR擴增就能把結(jié)合力更強的這些“魚”RNA序列富集出來。為什么選擇CRISmers而不是傳統(tǒng)方法關鍵在于“通量”和“耦合性”。超高通量借助微流控或大規(guī)模并行化操作CRISmers可以在單次實驗中同時篩選數(shù)百萬甚至上億個序列變異這是傳統(tǒng)試管內(nèi)篩選難以企及的。直接功能耦合整個篩選過程直接基于“結(jié)合”這一功能進行避免了繁瑣的克隆、表達和單獨檢測步驟篩選信號如熒光、磁力可以直接讀出??删幊绦詆RNA序列易于設計和合成這意味著你可以快速更換初始“魚餌”針對不同目標啟動篩選流程。注意這里CRISmers的具體實現(xiàn)可能因?qū)嶒炇叶惡诵氖腔钣肅RISPR系統(tǒng)的可編程核酸結(jié)合特性。在實際搭建時需要仔細優(yōu)化dCas9的固定化方法、gRNA與初始適配體的連接方式以及洗脫條件以確保篩選的嚴格性和信噪比。2.2 GRAPE-LM從處理語言到“編寫”功能RNA的AIGRAPE-LM是這個范式的“大腦”。它本質(zhì)上是一個經(jīng)過特殊訓練的大型語言模型。我們知道像GPT這類模型通過學習海量人類語言文本學會了生成通順的句子、回答問題。而GRAPE-LM的訓練數(shù)據(jù)是海量的RNA序列以及它們對應的功能數(shù)據(jù)如結(jié)合親和力、解離常數(shù)KD值、二級/三級結(jié)構信息。它的訓練目標是理解RNA的“序列語言”如何編碼其“功能語義”。經(jīng)過訓練后GRAPE-LM獲得了以下幾種關鍵能力序列生成給定一個功能目標如“結(jié)合凝血酶KD10 nM”模型可以生成一批全新的、在自然界可能不存在的RNA序列這些序列在模型“看來”很可能具備該功能。功能預測給定一個RNA序列模型可以預測其與特定目標結(jié)合的可能性評分或估算其親和力大小從而對大量序列進行快速初篩優(yōu)先推薦高評分序列進行實驗驗證。進化指導根據(jù)一輪CRISmers實驗篩選出的陽性序列富集到的序列及其對應的粗略功能數(shù)據(jù)GRAPE-LM可以分析這些序列中的保守模式、關鍵位點并推斷出哪些方向的突變可能進一步提升性能從而設計出下一輪篩選的突變文庫。這里涉及一個關鍵的技術點如何將非結(jié)構化的生物功能數(shù)據(jù)“喂”給語言模型通常的做法是將功能標簽作為特殊的“提示詞”或“條件”嵌入到模型的輸入中。例如在序列的開頭或結(jié)尾加上“[TARGET:Thrombin][AFFINITY:High]”這樣的標記讓模型在生成或評估序列時以此為導向。實操心得訓練一個有效的GRAPE-LM并非易事。最大的挑戰(zhàn)在于高質(zhì)量、大規(guī)模的訓練數(shù)據(jù)獲取。公開的RNA適配體數(shù)據(jù)庫如Aptamer Base數(shù)據(jù)量有限且質(zhì)量參差不齊。因此研究團隊很可能需要利用CRISmers平臺自己先產(chǎn)生一批高質(zhì)量的配對數(shù)據(jù)序列-功能。初始模型的性能可能一般但隨著“實驗-AI”循環(huán)的進行數(shù)據(jù)像滾雪球一樣增多模型的預測能力會越來越強形成飛輪效應。3. 新范式工作流拆解從啟動到迭代的完整循環(huán)理解了兩個核心工具后我們來看它們是如何串聯(lián)起來形成一個自動化、智能化的進化閉環(huán)的。整個流程可以清晰地分為四個階段。3.1 階段一冷啟動與初始文庫構建萬事開頭難這個范式也需要一個起點。首先你需要針對你的目標分子比如一種癌癥標志物蛋白選擇一個已知的、哪怕結(jié)合力很弱的RNA適配體序列作為“種子”。這個種子可以來自文獻也可以通過簡單的初步篩選獲得。接著以這個種子序列為模板通過易錯PCR或化學合成引入隨機突變構建一個包含數(shù)百萬個變異體的初始DNA文庫。然后將這個DNA文庫轉(zhuǎn)錄成RNA文庫。至此你的“原始魚塘”就準備好了。同時你需要設計并構建對應的CRISmers篩選體系將目標分子與你的“釣魚竿”dCas9-gRNA-種子適配體復合物準備好。這個階段的關鍵在于文庫的多樣性與質(zhì)量多樣性突變率要設置得當。太低探索空間有限太高可能產(chǎn)生大量無功能的 nonsense 序列浪費資源。通常針對RNA適配體長度約30-80 nt每個位點的突變率控制在0.1%-1%是一個合理的起點。質(zhì)量必須確保DNA到RNA的轉(zhuǎn)錄效率高且RNA文庫沒有明顯的偏好性擴增或降解。需要通過高通量測序隨機抽查文庫的序列分布來驗證。3.2 階段二CRISmers高通量實驗篩選將RNA文庫與CRISmers篩選體系混合進行結(jié)合、洗脫等操作。結(jié)合力強的RNA適配體變異體會競爭性地從gRNA-種子適配體上“奪走”目標分子并與dCas9復合物結(jié)合或?qū)е缕錁嬒笞兓瘡亩惶囟ǖ臋z測方法如熒光激活分選、磁力分選捕獲和富集。富集到的RNA分子被回收反轉(zhuǎn)錄成cDNA然后進行高通量測序。測序結(jié)果會告訴你經(jīng)過一輪篩選后哪些序列變體被顯著富集了。這些就是第一輪的“優(yōu)勝者”。這里有一個至關重要的步驟定量與數(shù)據(jù)轉(zhuǎn)化。你不能僅僅知道哪些序列被富集了還需要一個半定量的“適應度”分數(shù)。通常通過比較篩選前后每個序列的讀段數(shù)Read Count變化可以計算出一個富集倍數(shù)Enrichment Ratio或頻率變化。這個數(shù)值就是該序列在此輪篩選中表現(xiàn)優(yōu)劣的初步量化指標它將作為訓練GRAPE-LM的標簽數(shù)據(jù)。3.3 階段三GRAPE-LM學習與設計將本輪篩選獲得的所有序列及其對應的富集倍數(shù)適應度分數(shù)輸入GRAPE-LM進行訓練或微調(diào)。模型會學習序列特征如某些堿基模式、二級結(jié)構傾向與高富集倍數(shù)之間的關聯(lián)。訓練完成后GRAPE-LM開始發(fā)揮其核心作用分析模型可以指出在優(yōu)勝序列中哪些位置是高度保守的可能對維持結(jié)構至關重要哪些位置存在多樣性且與高適應度相關可能是有益突變的“熱點”。生成基于學習到的模式模型可以生成一大批全新的序列。這些序列不再是完全隨機的而是模型“認為”可能具有高結(jié)合親和力的“候選者”。生成策略可以是定向突變在現(xiàn)有優(yōu)勝序列的“熱點”區(qū)域引入特定類型的突變。從頭設計完全從模型學到的分布中采樣生成全新的骨架序列。預測與排序?qū)τ谏傻暮A亢蜻x序列可能是數(shù)十萬甚至數(shù)百萬個GRAPE-LM可以快速對它們進行功能預測打分從而篩選出排名靠前的、最值得進行實驗驗證的一小部分例如幾千條序列。3.4 階段四迭代循環(huán)與性能提升將GRAPE-LM設計出的、經(jīng)過預測篩選的頂級候選序列合成為新的DNA文庫然后轉(zhuǎn)錄成RNA投入下一輪的CRISmers實驗篩選。這就完成了第一次“實驗-AI”閉環(huán)。隨后重復階段二到階段四。每一輪實驗產(chǎn)生的新數(shù)據(jù)序列適應度都會用來進一步訓練和優(yōu)化GRAPE-LM使其預測越來越準。而GRAPE-LM設計的文庫質(zhì)量也會越來越高從而在實驗中篩選出性能一代比一代強的RNA適配體。通常經(jīng)過3-5輪這樣的迭代就能獲得結(jié)合親和力KD值相比初始種子序列提升數(shù)十倍甚至上百倍的優(yōu)質(zhì)適配體。這個范式的威力在于其正反饋循環(huán)實驗為AI提供真實世界的數(shù)據(jù)讓AI模型擺脫“空想”AI為實驗提供智能導航大幅減少盲目試錯的成本讓進化過程收斂得更快、更優(yōu)。4. 實操要點與潛在挑戰(zhàn)聽起來很美好但要把這套范式在實驗室里跑起來有幾個關鍵的實操環(huán)節(jié)和坑需要特別注意。4.1 濕實驗部分CRISmers體系的穩(wěn)健性是基石CRISmers篩選的成敗直接決定了喂給AI的數(shù)據(jù)質(zhì)量。數(shù)據(jù)是垃圾AI輸出的也是垃圾。gRNA-適配體連接體的設計種子適配體如何連接到gRNA上是直接融合在gRNA的3‘或5’端還是通過一個靈活的 linker 連接這個連接體的長度和序列會影響種子適配體的空間構象和可及性需要優(yōu)化以確保它既能被dCas9穩(wěn)定結(jié)合又能允許目標分子和文庫RNA進行有效競爭。篩選嚴格度的控制洗脫步驟的嚴格度如鹽濃度、溫度、競爭劑濃度是篩選的關鍵杠桿。嚴格度太低背景噪音高會富集大量非特異性結(jié)合的序列嚴格度太高可能連高親和力的結(jié)合體也洗不下來。通常需要設置一個梯度或者采用“計數(shù)器篩選”策略先用非靶標分子洗掉非特異性結(jié)合再用靶標分子洗脫特異性結(jié)合體。避免PCR偏好與誤差在富集序列的擴增和建庫測序過程中PCR會引入偏好性和錯誤。需要使用高保真酶并嚴格控制循環(huán)數(shù)。最好能在實驗設計中加入獨特的分子標識符UMI以便在數(shù)據(jù)分析時校正PCR重復和測序錯誤。4.2 干實驗部分GRAPE-LM的訓練與生成策略AI部分同樣充滿挑戰(zhàn)絕不是調(diào)用一個現(xiàn)成的GPT API就能解決的。數(shù)據(jù)表示與模型架構RNA序列如何輸入模型簡單的字符A, U, G, C序列是一種方式但可能丟失結(jié)構信息。更優(yōu)的做法是結(jié)合預測的二級結(jié)構如點括號表示法或使用RNA特有的詞元化方法。GRAPE-LM可能基于Transformer架構但需要針對生物序列的遠程相互作用進行優(yōu)化。從預測分數(shù)到實際功能的映射模型預測的“適應度分數(shù)”是一個相對值它如何與真實的生化參數(shù)如KD值關聯(lián)初期這種關聯(lián)可能很弱。因此在最初幾輪不能完全依賴模型的絕對分數(shù)排名而應該采用一種“探索與利用”的平衡策略。例如下一輪文庫既包含模型預測的高分序列利用也包含一些隨機突變或中等分數(shù)的序列探索以防模型陷入局部最優(yōu)。生成序列的“可合成性”與“穩(wěn)定性”約束模型天馬行空生成的序列可能在化學合成上困難或者形成的RNA分子在實驗條件下極不穩(wěn)定。因此在序列生成階段需要加入額外的約束條件比如避免出現(xiàn)連續(xù)多個G容易形成難處理的G-四鏈體控制GC含量在一定范圍影響穩(wěn)定性和合成效率或者要求序列包含某個必需的莖環(huán)結(jié)構框架。4.3 循環(huán)迭代的優(yōu)化策略如何設置迭代節(jié)奏和評估標準以最高效地達到目標輪次間文庫設計下一輪文庫是全部由AI設計還是混合一部分上一輪的優(yōu)勝序列通常建議采用混合策略保留一部分精英序列“種子”同時加入AI設計的新序列以保證進化路徑的連續(xù)性并引入創(chuàng)新。停止準則迭代何時停止不能無限循環(huán)下去。明確的準則是當篩選到的適配體其親和力通過獨立實驗如表面等離子共振或等溫滴定量熱法驗證達到應用要求如KD 1 nM并且連續(xù)兩輪迭代性能提升不再顯著 2倍時可以考慮停止。多目標優(yōu)化現(xiàn)實中我們往往不僅需要高親和力還需要高特異性不結(jié)合類似物、良好的血清穩(wěn)定性、易于化學修飾等??梢栽贕RAPE-LM的訓練中引入多任務學習或者在篩選壓力中直接加入計數(shù)器篩選步驟讓AI模型同時學習優(yōu)化多個屬性。5. 應用場景與未來展望這套CRISmersGRAPE-LM的范式其應用絕不局限于篩選幾個高親和力的RNA適配體。它代表了一種通用的“AI增強型定向進化”平臺可以拓展到許多激動人心的方向。在治療性適配體開發(fā)中它可以加速針對“不可成藥”靶點如轉(zhuǎn)錄因子、蛋白-蛋白相互作用界面的核酸藥物發(fā)現(xiàn)。傳統(tǒng)方法耗時數(shù)年而這個范式可能將周期縮短到數(shù)月。在診斷與生物傳感領域可以快速進化出對疾病標志物如外泌體上的特定蛋白、小分子代謝物具有極高靈敏度和特異性的適配體用于開發(fā)新一代的液體活檢試紙條或可穿戴傳感器。更進一步的想象如果將目標從“結(jié)合”擴展到“催化”核酶或“調(diào)控”核糖開關這個平臺就可以用于進化出全新的生物催化劑或基因調(diào)控元件為合成生物學提供強大的元件工具箱。當然挑戰(zhàn)依然存在。濕實驗部分的通量和成本能否進一步降低AI模型對于復雜三維結(jié)構-功能關系的理解是否足夠深入如何將體內(nèi)篩選的壓力如核酸酶穩(wěn)定性、細胞攝取效率也整合到循環(huán)中這些都是未來需要攻克的問題。從我個人的經(jīng)驗來看這個領域正在從“藝術”走向“工程”。CRISmersGRAPE-LM這類范式正是將生物實驗的創(chuàng)造性與AI計算的理性力量相結(jié)合的典范。它要求從業(yè)者既懂分子生物學的實驗細節(jié)又能理解機器學習模型的基本原理和數(shù)據(jù)流程。對于想進入這個交叉領域的朋友我的建議是不要畏懼從一個具體的靶標和小型試點項目開始親手搭建流程的每一個環(huán)節(jié)在踩坑和解決問題的過程中你會深刻體會到這種“虛實結(jié)合”進化策略的威力與魅力。最終我們或許能像編程一樣相對理性地“編寫”出具有特定功能的生物分子。