選型到數(shù)據(jù)分析的完整指南)
1. 從一篇高分文章說(shuō)起DNA甲基化研究的價(jià)值與挑戰(zhàn)去年我的一位在腫瘤研究所工作的朋友為了一個(gè)關(guān)鍵的課題方向幾乎翻遍了近兩年所有與DNA甲基化相關(guān)的高分文獻(xiàn)。他當(dāng)時(shí)面臨一個(gè)很實(shí)際的困境手頭有一批珍貴的臨床樣本想從表觀遺傳層面尋找新的生物標(biāo)志物但面對(duì)浩如煙海的測(cè)序技術(shù)和分析策略一時(shí)不知從何切入。是選擇全基因組甲基化測(cè)序WGBS追求廣度還是用簡(jiǎn)化代表性亞硫酸氫鹽測(cè)序RRBS聚焦功能區(qū)域數(shù)據(jù)分析的流程如何搭建才能既嚴(yán)謹(jǐn)又高效最終他通過(guò)系統(tǒng)梳理幾篇發(fā)表在《Nature Communications》、《Genome Biology》等期刊上的標(biāo)桿性研究迅速厘清了思路不僅確定了技術(shù)路線還借鑒了其中的高級(jí)分析模塊比如將甲基化數(shù)據(jù)與轉(zhuǎn)錄組進(jìn)行整合挖掘驅(qū)動(dòng)基因。這個(gè)經(jīng)歷讓我深刻體會(huì)到在科研的“深水區(qū)”一篇設(shè)計(jì)精良、分析透徹的高分文章其價(jià)值遠(yuǎn)不止于一個(gè)“創(chuàng)新發(fā)現(xiàn)”的結(jié)論它更像一份詳盡的“技術(shù)路線圖”和“避坑指南”。“易基因2022年度DNA甲基化研究高分項(xiàng)目文章精選”這個(gè)標(biāo)題背后指向的正是這樣一個(gè)核心需求為身處表觀遺傳學(xué)特別是DNA甲基化研究領(lǐng)域的同行提供一份經(jīng)過(guò)篩選和提煉的“年度精華操作手冊(cè)”。DNA甲基化作為基因表達(dá)調(diào)控的關(guān)鍵開關(guān)其異常與癌癥、神經(jīng)退行性疾病、發(fā)育障礙等眾多生理病理過(guò)程緊密相關(guān)。然而從樣本準(zhǔn)備、建庫(kù)測(cè)序到海量數(shù)據(jù)的生物信息學(xué)分析和生物學(xué)意義挖掘每一步都充滿細(xì)節(jié)和陷阱。一篇高分文章往往是多個(gè)技術(shù)環(huán)節(jié)最優(yōu)組合的體現(xiàn)。因此精選并解讀這些文章不是為了簡(jiǎn)單的文獻(xiàn)羅列而是為了拆解其中的“方法論精華”看看頂尖團(tuán)隊(duì)在2022年這個(gè)時(shí)間節(jié)點(diǎn)上是如何解決具體科學(xué)問題的他們用了什么“新式武器”又繞過(guò)了哪些“經(jīng)典暗礁”。這對(duì)于正在設(shè)計(jì)課題、優(yōu)化實(shí)驗(yàn)或撰寫論文的研究者而言具有直接的參考和啟發(fā)價(jià)值。2. 高分文章的共性特征超越“顯著性P值”的深度解析當(dāng)我們談?wù)揇NA甲基化研究的“高分文章”時(shí)其評(píng)判標(biāo)準(zhǔn)早已超越了簡(jiǎn)單的“發(fā)現(xiàn)了幾個(gè)差異甲基化區(qū)域DMRs”。通過(guò)對(duì)2022年發(fā)表在多本IF10期刊上的相關(guān)研究進(jìn)行歸納我發(fā)現(xiàn)這些脫穎而出的工作通常具備以下幾個(gè)超越常規(guī)的維度這也是我們?cè)陂喿x和借鑒時(shí)需要重點(diǎn)關(guān)注的。2.1 多維組學(xué)數(shù)據(jù)的整合與互證單一維度的甲基化數(shù)據(jù)說(shuō)服力有限。2022年的趨勢(shì)是高水平研究極少孤立地分析甲基化。更常見的模式是“甲基化轉(zhuǎn)錄組可選染色質(zhì)可及性/蛋白組/代謝組”的多組學(xué)聯(lián)動(dòng)。例如一篇關(guān)于肝癌異質(zhì)性的研究不僅繪制了不同腫瘤區(qū)域的甲基化圖譜還同步進(jìn)行了空間轉(zhuǎn)錄組測(cè)序。通過(guò)整合分析他們發(fā)現(xiàn)了一些特定基因組區(qū)域如增強(qiáng)子的甲基化狀態(tài)與鄰近基因的表達(dá)在空間上呈現(xiàn)強(qiáng)相關(guān)性從而將表觀遺傳修飾與細(xì)胞功能在解剖位置上直接掛鉤這種發(fā)現(xiàn)是單組學(xué)分析無(wú)法實(shí)現(xiàn)的。這里的核心技巧在于整合分析的策略是簡(jiǎn)單的相關(guān)性計(jì)算還是使用像MOFA這類多組學(xué)因子分析模型來(lái)降維和提取共享變異高分文章通常會(huì)明確闡述其整合分析的生物學(xué)假設(shè)和統(tǒng)計(jì)模型。2.2 從“相關(guān)性”到“因果性”的探索嘗試發(fā)現(xiàn)DMR與表型相關(guān)是第一步但證明其具有功能調(diào)控作用則更為有力。2022年的文章在因果推斷上展現(xiàn)了更多設(shè)計(jì)巧思。除了經(jīng)典的體外細(xì)胞系甲基化編輯如CRISPR-dCas9-TET1/DNMT3a實(shí)驗(yàn)外更多研究開始利用自然遺傳變異作為工具。例如通過(guò)甲基化數(shù)量性狀位點(diǎn)mQTL分析識(shí)別受遺傳變異調(diào)控的甲基化位點(diǎn)再結(jié)合孟德爾隨機(jī)化Mendelian Randomization方法推斷這些甲基化變化對(duì)疾病的潛在因果效應(yīng)。這種利用遺傳學(xué)工具來(lái)增強(qiáng)表觀遺傳學(xué)發(fā)現(xiàn)可信度的思路正成為高分文章的“標(biāo)配”論證環(huán)節(jié)。2.3 技術(shù)創(chuàng)新與定制化分析流程方法學(xué)的創(chuàng)新或深度應(yīng)用同樣是高分的關(guān)鍵。這包括測(cè)序技術(shù)的精準(zhǔn)選用針對(duì)不同科學(xué)問題選擇最合適的技術(shù)。例如研究早期胚胎發(fā)育或稀有細(xì)胞類型時(shí)多項(xiàng)研究采用了超低起始量的單細(xì)胞甲基化測(cè)序scBS-seq或其改良方案而為了高分辨率解析CpG島CGI shores等區(qū)域的細(xì)微變化則可能采用靶向甲基化測(cè)序或長(zhǎng)讀長(zhǎng)測(cè)序如PacBio或ONT的修飾檢測(cè)。定制化生物信息學(xué)流程很多團(tuán)隊(duì)不再完全依賴現(xiàn)成的軟件如Bismark, MethylKit而是會(huì)根據(jù)自身數(shù)據(jù)特點(diǎn)如特定疾病模型、特殊樣本來(lái)源對(duì)標(biāo)準(zhǔn)流程進(jìn)行優(yōu)化。例如在腫瘤樣本分析中如何準(zhǔn)確區(qū)分腫瘤細(xì)胞與浸潤(rùn)免疫細(xì)胞的甲基化信號(hào)成為一個(gè)關(guān)鍵問題。有文章開發(fā)或應(yīng)用了去卷積算法如MethylCIBERSORT來(lái)估算樣本中不同細(xì)胞類型的比例從而對(duì)甲基化數(shù)據(jù)進(jìn)行“凈化”得到更純粹的腫瘤特征。這種對(duì)分析流程“精加工”的細(xì)節(jié)往往在文章的方法部分或補(bǔ)充材料里才有詳細(xì)描述是值得深挖的寶藏。2.4 臨床轉(zhuǎn)化潛力的清晰呈現(xiàn)對(duì)于疾病相關(guān)研究高分文章會(huì)清晰地勾勒出其發(fā)現(xiàn)的臨床轉(zhuǎn)化路徑。這不僅僅是說(shuō)“某個(gè)基因甲基化可能作為生物標(biāo)志物”而是提供更具體的證據(jù)鏈例如在獨(dú)立的回顧性隊(duì)列中驗(yàn)證其診斷效能AUC值在前瞻性隊(duì)列中評(píng)估其預(yù)后預(yù)測(cè)價(jià)值甚至探索其與現(xiàn)有治療方案療效的相關(guān)性預(yù)測(cè)生物標(biāo)志物。2022年有多篇研究通過(guò)分析大型公共數(shù)據(jù)庫(kù)如TCGA, GEO結(jié)合自有樣本驗(yàn)證構(gòu)建了基于多基因甲基化特征的預(yù)測(cè)模型并提供了易于其他研究者驗(yàn)證的評(píng)分公式或在線工具極大地提升了工作的實(shí)用性和影響力。3. 核心研究主題與代表性技術(shù)方案拆解聚焦2022年的發(fā)表成果我們可以梳理出幾個(gè)活躍的研究主題每個(gè)主題都對(duì)應(yīng)著一套相對(duì)成熟但又在不斷演進(jìn)的技術(shù)方案。3.1 主題一腫瘤早篩與液體活檢應(yīng)用這是DNA甲基化最具臨床前景的方向之一。高分文章的核心突破點(diǎn)在于提高檢測(cè)的靈敏度和特異性。技術(shù)方案通常采用基于PCR的靶向甲基化測(cè)序如甲基化特異性PCR-MS-PCR、數(shù)字PCR-ddPCR或高通量靶向捕獲測(cè)序如甲基化芯片的升級(jí)版或定制化Panel。樣本多為血漿循環(huán)游離DNAcfDNA。2022年亮點(diǎn)一項(xiàng)多癌種早篩研究登頂頂級(jí)期刊其亮點(diǎn)不在于發(fā)現(xiàn)了全新標(biāo)記物而在于通過(guò)機(jī)器學(xué)習(xí)算法整合多個(gè)低豐度甲基化標(biāo)記的信號(hào)。研究者們沒有追求單個(gè)位點(diǎn)的超高靈敏度而是設(shè)計(jì)了可以同時(shí)檢測(cè)數(shù)萬(wàn)個(gè)CpG位點(diǎn)的靶向Panel然后使用隨機(jī)森林等模型從微弱的、背景噪音高的cfDNA信號(hào)中提取出癌癥特異的“甲基化指紋”。這種方法大大降低了對(duì)單個(gè)標(biāo)記物檢測(cè)下限的要求轉(zhuǎn)而依靠模式識(shí)別這是技術(shù)思路上的一個(gè)重要轉(zhuǎn)變。實(shí)操注意進(jìn)行cfDNA甲基化研究時(shí)樣本處理采血管、離心條件、DNA提取試劑盒必須極度標(biāo)準(zhǔn)化因?yàn)榘准?xì)胞裂解等過(guò)程會(huì)釋放大量基因組DNA嚴(yán)重干擾cfDNA中微弱的腫瘤信號(hào)。此外建立健康的對(duì)照cfDNA甲基化基線圖譜考慮年齡、性別等混雜因素至關(guān)重要。3.2 主題二發(fā)育生物學(xué)與細(xì)胞命運(yùn)決定在這個(gè)領(lǐng)域研究更關(guān)注甲基化動(dòng)態(tài)重編程的過(guò)程。技術(shù)方案單細(xì)胞多組學(xué)技術(shù)大放異彩。例如scNOMe-seq同時(shí)測(cè)序染色質(zhì)可及性和甲基化或scMT-seq同時(shí)測(cè)序甲基化和轉(zhuǎn)錄組。對(duì)于少量細(xì)胞或早期胚胎全基因組甲基化測(cè)序WGBS仍為主流但起始量要求越來(lái)越低。2022年亮點(diǎn)有研究利用超低輸入量WGBS追蹤了人類胚胎著床后關(guān)鍵發(fā)育階段的甲基化重建過(guò)程精確到了天甚至小時(shí)級(jí)別。他們發(fā)現(xiàn)了一些非CpG位點(diǎn)CHH, CHG甲基化在特定階段的短暫出現(xiàn)提示了其可能的功能。這里的深度在于對(duì)“動(dòng)態(tài)”的刻畫不僅看起點(diǎn)和終點(diǎn)更關(guān)注中間過(guò)程并嘗試將甲基化動(dòng)態(tài)變化與關(guān)鍵轉(zhuǎn)錄因子的表達(dá)波動(dòng)關(guān)聯(lián)起來(lái)。實(shí)操注意單細(xì)胞或低細(xì)胞數(shù)甲基化數(shù)據(jù)噪音較大分析時(shí)需要專門的批次效應(yīng)校正和插補(bǔ)imputation方法。對(duì)于時(shí)間序列數(shù)據(jù)偽時(shí)間分析Pseudotime analysis工具如Monocle3可以用于推斷甲基化變化的連續(xù)軌跡但需要謹(jǐn)慎解釋結(jié)果。3.3 主題三環(huán)境暴露與跨代表觀遺傳研究環(huán)境因素如營(yíng)養(yǎng)、壓力、毒素如何通過(guò)改變DNA甲基化影響當(dāng)代及后代健康。技術(shù)方案多為隊(duì)列研究設(shè)計(jì)采用甲基化芯片如EPIC陣列或簡(jiǎn)化甲基化測(cè)序RRBS進(jìn)行大樣本篩查發(fā)現(xiàn)與暴露相關(guān)的差異甲基化位點(diǎn)DMPs然后進(jìn)行功能富集和通路分析。2022年亮點(diǎn)一些研究開始關(guān)注組織特異性和介質(zhì)特異性。例如探討空氣污染物暴露的影響不再只分析血液樣本而是同時(shí)獲取了鼻腔上皮細(xì)胞等靶組織樣本發(fā)現(xiàn)甲基化變化更具組織特異性。此外關(guān)于父親肥胖通過(guò)精子甲基化影響后代代謝的研究不僅分析了精子整體甲基化譜還特別聚焦于印記控制區(qū)域ICRs和轉(zhuǎn)座子元件因?yàn)檫@些區(qū)域?qū)绱鷤鬟f更敏感。實(shí)操注意此類研究混雜因素極多年齡、性別、吸煙、細(xì)胞組成等。統(tǒng)計(jì)分析時(shí)必須采用嚴(yán)格的線性模型進(jìn)行校正。推薦使用像limma或methylumi這樣的R包它們能方便地納入?yún)f(xié)變量。另外明確區(qū)分關(guān)聯(lián)性與因果性是一大挑戰(zhàn)需要謹(jǐn)慎下結(jié)論。4. 從文章到項(xiàng)目關(guān)鍵生物信息學(xué)分析流程實(shí)戰(zhàn)要點(diǎn)閱讀高分文章最終是為了指導(dǎo)自己的數(shù)據(jù)分析。這里我結(jié)合常見流程梳理幾個(gè)容易出錯(cuò)但至關(guān)重要的實(shí)戰(zhàn)要點(diǎn)。4.1 原始數(shù)據(jù)質(zhì)控與比對(duì)細(xì)節(jié)決定成敗拿到下機(jī)數(shù)據(jù)fastq文件后很多人會(huì)直接跑標(biāo)準(zhǔn)流程但前期質(zhì)控的疏忽會(huì)導(dǎo)致后續(xù)分析全部建立在沙地上。針對(duì)BS-seq數(shù)據(jù)的特殊質(zhì)控除了常規(guī)的FastQC檢查序列質(zhì)量和接頭污染必須檢查C-T轉(zhuǎn)換率。在未甲基化的lambda噬菌體DNA或人工添加的spike-in control中C-T的轉(zhuǎn)換率應(yīng)接近100%因?yàn)槲醇谆腃在亞硫酸氫鹽處理下應(yīng)全部轉(zhuǎn)換為U測(cè)序?yàn)門。如果轉(zhuǎn)換率過(guò)低如95%表明亞硫酸氫鹽轉(zhuǎn)化不完全數(shù)據(jù)可能不可靠需排查實(shí)驗(yàn)步驟。比對(duì)工具的選擇與參數(shù)Bismark仍是金標(biāo)準(zhǔn)但它速度較慢。對(duì)于大型WGBS數(shù)據(jù)可以考慮BS-Seeker2或BWA-meth與BWA-MEM算法集成。關(guān)鍵參數(shù)是允許的錯(cuò)配數(shù)。由于亞硫酸氫鹽處理導(dǎo)致C-T正鏈或G-A負(fù)鏈的系統(tǒng)性錯(cuò)配比對(duì)算法需要特別處理。通常允許的錯(cuò)配數(shù)要設(shè)置得比普通DNA-seq更高例如默認(rèn)值0.04或更高但過(guò)高又會(huì)引入假陽(yáng)性。一個(gè)實(shí)用的做法是先用一小部分?jǐn)?shù)據(jù)測(cè)試不同參數(shù)觀察唯一比對(duì)率的變化選擇一個(gè)平衡點(diǎn)。重復(fù)序列的處理基因組中重復(fù)序列區(qū)域在BS-seq中更難唯一比對(duì)。Bismark會(huì)默認(rèn)報(bào)告多重比對(duì)reads。常規(guī)分析中通常只保留唯一比對(duì)的reads。但對(duì)于一些特定分析如重復(fù)元件的甲基化可能需要不同的策略。高分文章中會(huì)在方法部分明確說(shuō)明他們是如何處理重復(fù)序列和多重比對(duì)reads的。4.2 甲基化位點(diǎn)提取與差異分析統(tǒng)計(jì)模型的陷阱從比對(duì)后的BAM文件提取每個(gè)CpG位點(diǎn)的甲基化水平甲基化reads數(shù)/總覆蓋reads數(shù)后就進(jìn)入核心的差異分析環(huán)節(jié)。覆蓋深度過(guò)濾這是第一步也是影響結(jié)果穩(wěn)健性的關(guān)鍵。過(guò)濾太嚴(yán)如要求每個(gè)樣本每個(gè)CpG覆蓋10x會(huì)丟失大量位點(diǎn)過(guò)濾太松如3x則甲基化水平估計(jì)不準(zhǔn)。一個(gè)折中的策略是先進(jìn)行寬松過(guò)濾如5x在后續(xù)統(tǒng)計(jì)模型中納入覆蓋深度作為協(xié)變量或使用基于Beta二項(xiàng)分布Beta-binomial的模型如DSSR包這類模型能更好地處理覆蓋深度不均一和生物學(xué)變異。選擇正確的差異甲基化分析工具工具眾多各有優(yōu)劣。methylKit用戶友好適合初學(xué)者但處理大樣本50時(shí)內(nèi)存消耗大。DSS采用嚴(yán)格的貝葉斯統(tǒng)計(jì)框架對(duì)生物學(xué)變異估計(jì)更準(zhǔn)確特別適合樣本量較小或組內(nèi)變異大的情況如動(dòng)物個(gè)體差異。limma配合voom轉(zhuǎn)化當(dāng)樣本量較大10/組且數(shù)據(jù)近似正態(tài)分布時(shí)性能強(qiáng)大且速度快還能方便地處理復(fù)雜實(shí)驗(yàn)設(shè)計(jì)如多因素、配對(duì)樣本。Radmeth來(lái)自MethylSuite適用于回歸模型比如分析甲基化與連續(xù)變量如年齡、暴露劑量的關(guān)系。高分文章的常見做法不依賴單一工具而是用兩種不同統(tǒng)計(jì)原理的工具如DSS和limma分別分析取交集結(jié)果作為高置信度的差異甲基化位點(diǎn)DMPs。這能有效降低假陽(yáng)性。批次效應(yīng)校正如果樣本是分批次上機(jī)測(cè)序的批次效應(yīng)可能嚴(yán)重影響結(jié)果。在差異分析前必須檢查??梢杂弥鞒煞址治鯬CA查看樣本是否按批次聚類。校正方法包括在limma模型中加入批次作為協(xié)變量或使用ComBat來(lái)自sva包進(jìn)行經(jīng)驗(yàn)貝葉斯校正。注意ComBat用于甲基化數(shù)據(jù)時(shí)通常是對(duì)M值log2轉(zhuǎn)化后的甲基化比例進(jìn)行操作而不是Beta值。4.3 高級(jí)分析與可視化挖掘生物學(xué)故事找到DMPs/DMRs只是開始如何解釋它們才是講故事的核心。DMR的注釋與功能富集將DMRs映射到基因組特征基因啟動(dòng)子區(qū)、增強(qiáng)子、CpG島、基因體等。工具如annotatrR包或ChIPseekerR包很好用。功能富集分析不要只做標(biāo)準(zhǔn)的GO/KEGG一定要做甲基化特異性的富集分析比如與已發(fā)表的疾病相關(guān)甲基化數(shù)據(jù)庫(kù)如MethHC, DiseaseMeth進(jìn)行比較或使用GREAT工具進(jìn)行基于基因組區(qū)域的富集分析。甲基化與基因表達(dá)的整合這是體現(xiàn)研究深度的關(guān)鍵。如果同時(shí)有RNA-seq數(shù)據(jù)可以直接關(guān)聯(lián)計(jì)算啟動(dòng)子區(qū)甲基化水平與對(duì)應(yīng)基因表達(dá)量的相關(guān)性Spearman或Pearson。注意啟動(dòng)子高甲基化通常與基因沉默負(fù)相關(guān)但基因體甲基化可能與表達(dá)正相關(guān)。反向驗(yàn)證篩選出表達(dá)差異顯著的基因看其調(diào)控區(qū)域不僅是啟動(dòng)子還有遠(yuǎn)端增強(qiáng)子的甲基化狀態(tài)是否也發(fā)生顯著變化。因果推斷嘗試?yán)眉谆瘮?shù)量性狀位點(diǎn)mQTL數(shù)據(jù)如果某個(gè)DMR同時(shí)是mQTL且其關(guān)聯(lián)的SNP也與基因表達(dá)eQTL或表型相關(guān)則能構(gòu)建更強(qiáng)的證據(jù)鏈??梢暬记蔁釄DHeatmap不要展示所有DMPs選擇最顯著的前100-200個(gè)或選擇特定通路上的位點(diǎn)。聚類時(shí)注意樣本和位點(diǎn)兩個(gè)維度的聚類樹是否顯示出清晰的組別分離這本身就是結(jié)果有效性的直觀證明。曼哈頓圖Manhattan Plot全基因組范圍展示DMPs的顯著性有助于發(fā)現(xiàn)基因組水平的模式如某些染色體臂整體低甲基化。甲基化水平曲線圖對(duì)于關(guān)鍵基因或區(qū)域繪制所有樣本在該區(qū)域每個(gè)CpG位點(diǎn)的甲基化水平用點(diǎn)或線表示可以非常直觀地展示組間差異和個(gè)體變異。網(wǎng)絡(luò)圖在整合多組學(xué)數(shù)據(jù)后可以構(gòu)建甲基化-表達(dá)調(diào)控網(wǎng)絡(luò)使用Cytoscape進(jìn)行可視化突出核心樞紐節(jié)點(diǎn)。5. 避坑指南高分文章沒寫但你必須知道的那些事在復(fù)現(xiàn)或借鑒高分文章的分析思路時(shí)有一些細(xì)節(jié)是文章里不會(huì)詳述卻直接影響成敗的。5.1 實(shí)驗(yàn)設(shè)計(jì)階段的“隱形坑”對(duì)照組的陷阱在疾病研究中對(duì)照組的匹配至關(guān)重要。除了年齡、性別細(xì)胞組成cellular composition是甲基化研究中最容易被忽略的混雜因素。例如血液樣本中病例和對(duì)照的淋巴細(xì)胞、粒細(xì)胞比例可能天然不同而這會(huì)直接導(dǎo)致全血DNA甲基化譜的差異被誤判為疾病相關(guān)信號(hào)。解決方案要么使用細(xì)胞分選技術(shù)獲取純化的細(xì)胞類型要么在數(shù)據(jù)分析時(shí)使用參考數(shù)據(jù)集進(jìn)行細(xì)胞組成反卷積deconvolution并校正。技術(shù)重復(fù)與生物學(xué)重復(fù)甲基化測(cè)序尤其是WGBS成本高昂很多人會(huì)減少生物學(xué)重復(fù)不同個(gè)體而增加技術(shù)重復(fù)同一樣本多次測(cè)序。這是嚴(yán)重的誤區(qū)。技術(shù)重復(fù)只能評(píng)估實(shí)驗(yàn)操作的穩(wěn)定性不能代表群體變異。生物學(xué)重復(fù)才是統(tǒng)計(jì)檢驗(yàn)的基礎(chǔ)。對(duì)于探索性研究每組至少需要3-5個(gè)生物學(xué)重復(fù)對(duì)于驗(yàn)證性研究需要更多。高分文章通常有充足的樣本量支持。5.2 數(shù)據(jù)分析中的“選擇性報(bào)告”DMR定義的靈活性文章里會(huì)說(shuō)“我們定義了差異甲基化水平變化10%且FDR0.05的區(qū)域?yàn)镈MR”。但實(shí)際操作中用于呼叫DMR的工具如DSS-callDMR,methylKit的calculateDiffMeth后自定義閾值、滑動(dòng)窗口的大小、最小CpG數(shù)量等參數(shù)都會(huì)極大影響DMR的數(shù)量和范圍。很多團(tuán)隊(duì)會(huì)嘗試多套參數(shù)選擇能產(chǎn)生“最合理”、“最可解釋”結(jié)果的參數(shù)組合。這是一種合理的優(yōu)化但需要在方法部分或補(bǔ)充材料中透明報(bào)告所有嘗試過(guò)的參數(shù)范圍。“漂亮”圖背后的數(shù)據(jù)裁剪為了展示清晰的模式熱圖或聚類圖中可能只包含了支持結(jié)論的那部分?jǐn)?shù)據(jù)例如只展示聚類好的樣本剔除了離群樣本。在復(fù)現(xiàn)時(shí)如果使用自己的數(shù)據(jù)或公共數(shù)據(jù)可能得不到同樣“干凈”的圖。這時(shí)需要檢查是否是數(shù)據(jù)質(zhì)量問題、批次效應(yīng)未校正還是生物學(xué)異質(zhì)性本身更大。不要輕易懷疑自己的數(shù)據(jù)首先要徹底檢查分析流程。5.3 結(jié)果解讀時(shí)的“過(guò)度推論”相關(guān)性不等于調(diào)控這是老生常談但極易犯錯(cuò)。發(fā)現(xiàn)基因啟動(dòng)子高甲基化且該基因低表達(dá)只能說(shuō)明兩者在統(tǒng)計(jì)上相關(guān)。不能直接說(shuō)“甲基化導(dǎo)致基因沉默”。有可能存在第三種因素如某個(gè)轉(zhuǎn)錄抑制因子同時(shí)導(dǎo)致了甲基化升高和表達(dá)降低。高分文章會(huì)通過(guò)體外實(shí)驗(yàn)如甲基化編輯或利用遺傳工具mQTL來(lái)提供更強(qiáng)的因果證據(jù)。在自己的項(xiàng)目中如果缺乏實(shí)驗(yàn)驗(yàn)證在表述時(shí)一定要使用“關(guān)聯(lián)”、“可能參與”、“提示其潛在作用”等謹(jǐn)慎的語(yǔ)言。忽略甲基化變化的幅度生物信息學(xué)分析容易沉迷于“顯著性”P值但生物學(xué)意義更看重“效應(yīng)量”effect size。一個(gè)CpG位點(diǎn)甲基化從50%變到60%變化10%即使P值極其顯著其生物學(xué)功能影響可能微乎其微。相反一個(gè)印記控制區(qū)域ICR的甲基化從50%變?yōu)?0%丟失印記即使P值只是邊緣顯著也可能具有重大功能后果。因此解讀結(jié)果時(shí)必須結(jié)合基因組位置、功能區(qū)域和變化幅度進(jìn)行綜合判斷?;仡?022年這些優(yōu)秀的DNA甲基化研究工作給我的最大啟發(fā)是這個(gè)領(lǐng)域正在從“描述現(xiàn)象”快速走向“解析機(jī)制”和“推動(dòng)應(yīng)用”。技術(shù)的進(jìn)步如單細(xì)胞、長(zhǎng)讀長(zhǎng)、靶向捕獲讓以前做不到的精細(xì)測(cè)量成為可能而分析方法的深化多組學(xué)整合、因果推斷則讓數(shù)據(jù)講述更嚴(yán)謹(jǐn)?shù)目茖W(xué)故事。對(duì)于后來(lái)者最好的學(xué)習(xí)方式就是像外科手術(shù)一樣精準(zhǔn)地解剖這些高分文章不僅看他們得出了什么結(jié)論更要看他們?yōu)槭裁催x擇這個(gè)技術(shù)路線如何處理那些棘手的細(xì)節(jié)數(shù)據(jù)又如何一步步構(gòu)建起堅(jiān)實(shí)的證據(jù)鏈。這個(gè)過(guò)程本身就是對(duì)自己科研思維和能力最好的訓(xùn)練。當(dāng)你下次啟動(dòng)一個(gè)甲基化項(xiàng)目時(shí)不妨先問自己我的核心科學(xué)問題用2022年最好的那些研究作為鏡子來(lái)照在實(shí)驗(yàn)設(shè)計(jì)、技術(shù)選型和數(shù)據(jù)分析的深度上是否已經(jīng)站在了同一個(gè)起跑線上