子:從表觀遺傳標(biāo)記到基因調(diào)控核心的實(shí)戰(zhàn)解析)
1. 項(xiàng)目概述從“增強(qiáng)子”到“超級增強(qiáng)子”的認(rèn)知躍遷如果你在生命科學(xué)特別是表觀遺傳學(xué)或轉(zhuǎn)錄調(diào)控領(lǐng)域深耕過那么對“增強(qiáng)子”這個(gè)概念一定不陌生。它就像基因啟動(dòng)子附近的一個(gè)“音量旋鈕”能夠遠(yuǎn)程調(diào)控基因的表達(dá)水平。但近年來一個(gè)更強(qiáng)大的概念——“超級增強(qiáng)子”徹底改變了我們對基因精密調(diào)控的理解。它不再是孤立的“旋鈕”而更像是一個(gè)配備了獨(dú)立供電系統(tǒng)、多通道混音臺(tái)和總控開關(guān)的“專業(yè)錄音棚控制中心”能夠驅(qū)動(dòng)細(xì)胞身份決定、發(fā)育過程以及疾病狀態(tài)中最關(guān)鍵的那些基因。而今天我們要深入探討的H3K27ac正是標(biāo)記這個(gè)“控制中心”的最關(guān)鍵“指示燈”之一。簡單來說H3K27ac是組蛋白H3第27位賴氨酸的乙?;揎?。這個(gè)看似微小的化學(xué)修飾卻是染色質(zhì)從沉默、緊湊狀態(tài)轉(zhuǎn)變?yōu)殚_放、活躍狀態(tài)的直接標(biāo)志。在超級增強(qiáng)子區(qū)域H3K27ac的信號會(huì)異常富集形成高聳的“山峰”這成為了我們從全基因組海量數(shù)據(jù)中精準(zhǔn)定位超級增強(qiáng)子的核心依據(jù)。這篇文章我將結(jié)合自己多年分析表觀基因組數(shù)據(jù)的實(shí)戰(zhàn)經(jīng)驗(yàn)為你徹底拆解“超級增強(qiáng)子”和其關(guān)鍵標(biāo)記H3K27ac。我們不僅會(huì)講清楚它們是什么、為什么重要更會(huì)深入到技術(shù)層面如何通過實(shí)驗(yàn)如ChIP-seq檢測它如何在數(shù)據(jù)分析中識(shí)別它以及它在國自然等科研項(xiàng)目中的應(yīng)用邏輯和設(shè)計(jì)思路。無論你是剛接觸表觀遺傳的學(xué)生還是正在構(gòu)思課題的研究者相信這些從一線實(shí)踐中總結(jié)的干貨能幫你快速抓住這個(gè)熱點(diǎn)的精髓。2. 核心概念解析H3K27ac為何是超級增強(qiáng)子的“身份證”要理解H3K27ac的重要性我們必須先把它放在染色質(zhì)修飾和基因調(diào)控的網(wǎng)絡(luò)中來看。2.1 組蛋白修飾基因的“開關(guān)”與“音量鍵”我們的DNA并非裸露存在而是緊密纏繞在組蛋白上形成核小體再進(jìn)一步折疊成染色質(zhì)。組蛋白的尾巴可以發(fā)生多種化學(xué)修飾如甲基化、乙?;?、磷酸化等。這些修飾共同構(gòu)成了一套復(fù)雜的“表觀遺傳密碼”決定了染色質(zhì)區(qū)域的開放或封閉狀態(tài)從而調(diào)控基因的“可讀性”。其中乙?;揎椡ǔEc基因激活相關(guān)。你可以把它想象成在組蛋白上添加一個(gè)帶負(fù)電的乙?;鶊F(tuán)這會(huì)中和組蛋白本身的正電荷削弱其與帶負(fù)電的DNA骨架之間的結(jié)合力導(dǎo)致染色質(zhì)結(jié)構(gòu)變得松散、開放。轉(zhuǎn)錄因子和RNA聚合酶等“轉(zhuǎn)錄機(jī)器”就能更容易地結(jié)合上去啟動(dòng)基因轉(zhuǎn)錄。H3K27ac特指在組蛋白H3的第27位賴氨酸Lysine 27上添加乙?;鶊F(tuán)。這個(gè)位點(diǎn)非常特殊因?yàn)樗彩嵌嗍嵋种茝?fù)合物2PRC2的催化靶點(diǎn)——PRC2會(huì)在這里添加抑制性的H3K27me3修飾三甲基化。H3K27ac和H3K27me3是一對經(jīng)典的“拮抗修飾”如同一個(gè)開關(guān)的兩端K27ac代表“開啟”和活躍K27me3代表“關(guān)閉”和抑制。在細(xì)胞中同一個(gè)位點(diǎn)在同一時(shí)間通常只存在一種主導(dǎo)修飾這構(gòu)成了細(xì)胞命運(yùn)決定中關(guān)鍵基因“開”或“關(guān)”的分子基礎(chǔ)。2.2 從增強(qiáng)子到超級增強(qiáng)子量變引發(fā)的質(zhì)變傳統(tǒng)增強(qiáng)子是較短的DNA序列幾百堿基對能增強(qiáng)基因轉(zhuǎn)錄。2013年Richard A. Young實(shí)驗(yàn)室提出了“超級增強(qiáng)子”的概念。他們發(fā)現(xiàn)在控制細(xì)胞身份的關(guān)鍵基因如胚胎干細(xì)胞的多能性基因附近存在一些大型的順式調(diào)控元件。這些區(qū)域并非一個(gè)單一的增強(qiáng)子而是由多個(gè)傳統(tǒng)的增強(qiáng)子緊密串聯(lián)而成跨度可達(dá)幾千到幾十萬堿基對。超級增強(qiáng)子有以下幾個(gè)核心特征巨大的尺寸遠(yuǎn)超普通增強(qiáng)子。異常高的轉(zhuǎn)錄因子和輔因子占有率像“磁石”一樣富集了超高濃度的關(guān)鍵轉(zhuǎn)錄因子如Mediator復(fù)合物、BRD4等。極高的組蛋白修飾信號尤其是H3K27ac和H3K4me1另一個(gè)增強(qiáng)子標(biāo)記的信號強(qiáng)度在基因組范圍內(nèi)都屬于最高的那一小部分。那么如何從全基因組數(shù)據(jù)中客觀地找到它們呢這就引出了經(jīng)典的超級增強(qiáng)子鑒定算法首先通過H3K27ac的ChIP-seq數(shù)據(jù)用軟件如MACS2找到所有的增強(qiáng)子區(qū)域稱為“富集峰”。然后根據(jù)這些峰的信號強(qiáng)度測序深度和彼此間的距離進(jìn)行篩選。通常將距離較近如12.5kb以內(nèi)的富集峰合并成一個(gè)“候選區(qū)域”。最后對所有候選區(qū)域根據(jù)其H3K27ac信號強(qiáng)度進(jìn)行排序選取信號強(qiáng)度最高、通常占全部H3K27ac信號總和前1-3%的那些區(qū)域定義為超級增強(qiáng)子。注意這個(gè)“前1-3%”是一個(gè)經(jīng)驗(yàn)性閾值并非金標(biāo)準(zhǔn)。在實(shí)際分析中需要根據(jù)樣本類型、測序深度和生物學(xué)問題進(jìn)行調(diào)整。有時(shí)研究者會(huì)采用更嚴(yán)格的閾值或結(jié)合其他標(biāo)記如Med1、BRD4的ChIP-seq進(jìn)行聯(lián)合鑒定以提高特異性。2.3 H3K27ac的核心價(jià)值活性與關(guān)聯(lián)性的雙重指示為什么H3K27ac成為了超級增強(qiáng)子研究中最受歡迎的標(biāo)記原因在于它的雙重屬性活性指示器H3K27ac直接標(biāo)志著該染色質(zhì)區(qū)域處于轉(zhuǎn)錄活躍狀態(tài)。一個(gè)區(qū)域只要有高水平的H3K27ac基本可以斷定它是一個(gè)正在發(fā)揮功能的調(diào)控元件。關(guān)聯(lián)性橋梁超級增強(qiáng)子通過染色質(zhì)環(huán)化等三維基因組結(jié)構(gòu)與目標(biāo)基因的啟動(dòng)子發(fā)生物理互作。通過H3K27ac的ChIP-seq數(shù)據(jù)結(jié)合三維基因組數(shù)據(jù)如Hi-C可以更可靠地將超級增強(qiáng)子與其調(diào)控的靶基因關(guān)聯(lián)起來這對于后續(xù)的功能驗(yàn)證至關(guān)重要。相比之下另一個(gè)常用的增強(qiáng)子標(biāo)記H3K4me1雖然也能標(biāo)記增強(qiáng)子但它既可以出現(xiàn)在活躍增強(qiáng)子也可以出現(xiàn)在“預(yù)備”或“靜止”的增強(qiáng)子上。因此H3K27ac在區(qū)分“活性”增強(qiáng)子/超級增強(qiáng)子方面具有更高的特異性和可信度。3. 技術(shù)實(shí)現(xiàn)從濕實(shí)驗(yàn)到干分析的完整流程理解了概念我們來看看在實(shí)驗(yàn)室里如何研究和利用H3K27ac與超級增強(qiáng)子。整個(gè)過程可以分為“濕實(shí)驗(yàn)”獲取數(shù)據(jù)和“干分析”挖掘信息兩大階段。3.1 濕實(shí)驗(yàn)基石染色質(zhì)免疫共沉淀測序目前全基因組范圍內(nèi)檢測H3K27ac分布的金標(biāo)準(zhǔn)方法是染色質(zhì)免疫共沉淀測序。核心原理 利用特異性識(shí)別H3K27ac修飾的抗體將細(xì)胞內(nèi)與組蛋白結(jié)合且?guī)в性撔揎椀腄NA片段“拉”下來然后對這些DNA片段進(jìn)行高通量測序。最后通過生物信息學(xué)分析將這些序列比對回參考基因組就能知道H3K27ac修飾在基因組上的精確位置和相對豐度。關(guān)鍵步驟與實(shí)操要點(diǎn)細(xì)胞交聯(lián)與染色質(zhì)片段化交聯(lián)用甲醛處理細(xì)胞使蛋白質(zhì)組蛋白與DNA、蛋白質(zhì)與蛋白質(zhì)之間發(fā)生共價(jià)交聯(lián)“凍結(jié)”它們之間的相互作用。片段化通過超聲破碎將染色質(zhì)隨機(jī)打斷成200-500 bp的小片段。這一步至關(guān)重要片段大小直接影響后續(xù)測序的分辨率。實(shí)操心得超聲條件需要預(yù)實(shí)驗(yàn)優(yōu)化。過度超聲會(huì)導(dǎo)致片段過小損失表觀修飾信息超聲不足則片段太大降低分辨率并增加背景噪音。最好用瓊脂糖凝膠電泳檢測片段化效果。免疫共沉淀加入抗H3K27ac的特異性抗體與片段化的染色質(zhì)孵育讓抗體捕獲所有帶有H3K27ac修飾的核小體復(fù)合物。使用Protein A/G磁珠沉淀抗體-染色質(zhì)復(fù)合物。充分洗滌去除非特異性結(jié)合的雜質(zhì)。解交聯(lián)與DNA純化用加熱和蛋白酶K處理逆轉(zhuǎn)交聯(lián)釋放出與H3K27ac組蛋白結(jié)合的DNA片段。純化得到DNA文庫。文庫構(gòu)建與測序?qū)兓腄NA進(jìn)行末端修復(fù)、加A尾、連接測序接頭構(gòu)建成可用于高通量測序的文庫。通常使用Illumina平臺(tái)進(jìn)行雙端測序。測序深度是另一個(gè)關(guān)鍵參數(shù)一般推薦至少20-30 million有效比對讀數(shù)對于超級增強(qiáng)子這類需要高信噪比的分析深度要求可能更高。對照實(shí)驗(yàn)的設(shè)計(jì) 一個(gè)嚴(yán)謹(jǐn)?shù)腃hIP-seq實(shí)驗(yàn)必須包含合適的對照。最常用的是Input對照即未經(jīng)免疫沉淀的片段化染色質(zhì)DNA用于排除由于基因組開放性如基因啟動(dòng)子區(qū)域?qū)е碌臏y序背景偏差。在分析時(shí)需要用ChIP樣本的信號減去Input背景。3.2 干分析核心從原始數(shù)據(jù)到超級增強(qiáng)子列表拿到測序產(chǎn)生的原始數(shù)據(jù)后生物信息學(xué)分析是挖掘?qū)毑氐年P(guān)鍵。標(biāo)準(zhǔn)分析流程與工具數(shù)據(jù)質(zhì)控與比對使用FastQC檢查原始測序數(shù)據(jù)的質(zhì)量。使用Trim Galore!或Trimmomatic等工具進(jìn)行接頭去除和質(zhì)量修剪。使用比對軟件如Bowtie2, BWA將高質(zhì)量序列比對到參考基因組如hg38。峰檢測這是最關(guān)鍵的一步。使用峰值檢出軟件如MACS2來識(shí)別H3K27ac信號顯著富集的基因組區(qū)域。MACS2會(huì)將ChIP樣本與Input對照進(jìn)行比較通過統(tǒng)計(jì)模型找出那些測序讀數(shù)顯著多于背景的區(qū)域并輸出每個(gè)“峰”的基因組坐標(biāo)、峰頂位置和富集顯著性p值、q值。命令示例macs2 callpeak -t ChIP.bam -c Input.bam -f BAM -g hs -n H3K27ac --outdir ./peaks -B --broad注意對于組蛋白修飾的峰由于修飾區(qū)域可能較寬有時(shí)會(huì)使用--broad參數(shù)來識(shí)別“寬峰”。但H3K27ac的峰通常比較尖銳常規(guī)參數(shù)即可。超級增強(qiáng)子鑒定合并鄰近峰使用像bedtools merge這樣的工具將上一步得到的峰文件中距離很近的峰合并例如間隔小于12.5kb則合并形成“候選增強(qiáng)子區(qū)域”。計(jì)算區(qū)域信號用bedtools coverage或?qū)S媚_本計(jì)算每個(gè)候選區(qū)域在ChIP樣本中的測序深度通常用RPKM或CPM標(biāo)準(zhǔn)化。排序與篩選將所有候選區(qū)域根據(jù)其信號強(qiáng)度從高到低排序。計(jì)算每個(gè)區(qū)域的信號貢獻(xiàn)百分比并繪制“信號強(qiáng)度排序-累積信號貢獻(xiàn)”曲線。這條曲線通常會(huì)在頂部出現(xiàn)一個(gè)明顯的拐點(diǎn)。將拐點(diǎn)之上即信號強(qiáng)度最高、貢獻(xiàn)了總信號絕大部分如前1-3%的那些區(qū)域定義為超級增強(qiáng)子。常用的自動(dòng)化工具有ROSE它封裝了上述步驟輸入MACS2的峰文件和BAM文件即可輸出超級增強(qiáng)子列表。下游分析與可視化注釋使用ChIPseeker等R包將鑒定出的超級增強(qiáng)子注釋到最近的基因、啟動(dòng)子區(qū)域等初步預(yù)測其潛在靶基因。** motif分析**提取超級增強(qiáng)子區(qū)域的DNA序列使用HOMER或MEME套件進(jìn)行從頭motif發(fā)現(xiàn)或已知motif富集分析找出其中富集的轉(zhuǎn)錄因子結(jié)合序列從而推斷調(diào)控該超級增強(qiáng)子的關(guān)鍵轉(zhuǎn)錄因子??梢暬褂肐GV基因組瀏覽器加載H3K27ac的測序數(shù)據(jù)BIGWIG格式和超級增強(qiáng)子區(qū)間BED格式直觀查看信號富集情況。這是向同行展示數(shù)據(jù)最有力的方式之一。4. 在國自然課題中的應(yīng)用策略與設(shè)計(jì)思路“超級增強(qiáng)子”和“H3K27ac”作為明確的國自然熱點(diǎn)其價(jià)值在于它們?yōu)槔斫饧膊C(jī)制和細(xì)胞功能提供了一個(gè)強(qiáng)有力的切入點(diǎn)和一套成熟的技術(shù)范式。如何將其融入你的課題本子關(guān)鍵在于講好一個(gè)“科學(xué)故事”。4.1 常見的科學(xué)問題范式你的研究應(yīng)該圍繞一個(gè)核心的生物學(xué)或醫(yī)學(xué)問題展開超級增強(qiáng)子是解決這個(gè)問題的工具或視角。以下是幾種經(jīng)過驗(yàn)證的有效范式細(xì)胞命運(yùn)決定與重編程科學(xué)問題某種干細(xì)胞如間充質(zhì)干細(xì)胞向特定細(xì)胞如成骨細(xì)胞分化的過程中哪些關(guān)鍵基因被啟動(dòng)其上游的調(diào)控樞紐是什么研究設(shè)計(jì)收集分化不同時(shí)間點(diǎn)的細(xì)胞進(jìn)行H3K27ac的ChIP-seq。通過比較不同時(shí)間點(diǎn)超級增強(qiáng)子的動(dòng)態(tài)變化出現(xiàn)、增強(qiáng)、減弱、消失鎖定驅(qū)動(dòng)分化的核心轉(zhuǎn)錄調(diào)控網(wǎng)絡(luò)。這比單純測mRNA更能揭示“調(diào)控開關(guān)”的變化。疾病發(fā)生發(fā)展的機(jī)制研究科學(xué)問題在某種癌癥如肝癌中導(dǎo)致癌基因異常高表達(dá)或抑癌基因沉默的表觀遺傳根源是什么研究設(shè)計(jì)對比癌組織和癌旁正常組織的H3K27ac圖譜。你很可能會(huì)發(fā)現(xiàn)在癌組織中某些原癌基因如MYC附近“獲得”了全新的超級增強(qiáng)子而某些抑癌基因附近的超級增強(qiáng)子“丟失”了。這直接揭示了腫瘤特異的轉(zhuǎn)錄依賴為尋找治療靶點(diǎn)提供了線索。藥物或干預(yù)手段的機(jī)制解析科學(xué)問題某個(gè)候選藥物或治療方法如中藥單體、物理治療發(fā)揮療效是否通過重塑細(xì)胞的表觀基因組來實(shí)現(xiàn)研究設(shè)計(jì)設(shè)置處理組和對照組進(jìn)行H3K27ac ChIP-seq。分析藥物處理后超級增強(qiáng)子圖譜發(fā)生了哪些重編程。如果發(fā)現(xiàn)藥物特異性地下調(diào)了疾病相關(guān)通路關(guān)鍵基因的超級增強(qiáng)子活性這就是一個(gè)非常扎實(shí)的機(jī)制證據(jù)。4.2 課題設(shè)計(jì)中的關(guān)鍵考量與技巧樣本選擇是成敗的第一步細(xì)胞模型永生化細(xì)胞系易于獲得但遺傳背景可能不穩(wěn)定。原代細(xì)胞更接近體內(nèi)狀態(tài)但獲取難、個(gè)體差異大。類器官是一個(gè)很好的折中選擇。臨床樣本組織樣本異質(zhì)性強(qiáng)包含多種細(xì)胞類型。H3K27ac信號是細(xì)胞類型特異的。因此盡可能使用純化的細(xì)胞群體如通過流式分選。如果只能用組織在解釋數(shù)據(jù)時(shí)要非常謹(jǐn)慎或者結(jié)合單細(xì)胞表觀組學(xué)技術(shù)雖然成本極高。生物學(xué)重復(fù)這是國自然評審非常看重的一點(diǎn)。至少需要3個(gè)獨(dú)立的生物學(xué)重復(fù)以證明觀察到的超級增強(qiáng)子變化是可重復(fù)的生物學(xué)現(xiàn)象而非技術(shù)噪音。從相關(guān)性到因果性功能驗(yàn)證的閉環(huán) 鑒定出差異的超級增強(qiáng)子只是開始必須進(jìn)行功能驗(yàn)證完成“假設(shè)-驗(yàn)證”的閉環(huán)。CRISPR基因編輯這是最強(qiáng)有力的工具??梢詫蜻x超級增強(qiáng)子區(qū)域進(jìn)行刪除CRISPR-Cas9敲除、激活CRISPRa或抑制CRISPRi然后觀察靶基因表達(dá)和細(xì)胞表型的變化。這是證明超級增強(qiáng)子與靶基因存在直接調(diào)控關(guān)系的黃金標(biāo)準(zhǔn)。報(bào)告基因?qū)嶒?yàn)將懷疑的超級增強(qiáng)子序列克隆到熒光素酶報(bào)告基因的上游轉(zhuǎn)入細(xì)胞檢測其是否能顯著增強(qiáng)報(bào)告基因的表達(dá)??梢越Y(jié)合突變實(shí)驗(yàn)驗(yàn)證其中關(guān)鍵的轉(zhuǎn)錄因子結(jié)合位點(diǎn)。三維基因組學(xué)驗(yàn)證通過3C、4C或Hi-C技術(shù)直接驗(yàn)證超級增強(qiáng)子區(qū)域與推測的靶基因啟動(dòng)子之間是否存在物理上的染色質(zhì)環(huán)互作。多組學(xué)整合提升課題層次 單獨(dú)做H3K27ac ChIP-seq已經(jīng)不夠亮眼。將其與其他數(shù)據(jù)整合能極大提升課題的系統(tǒng)性和深度。 RNA-seq這是標(biāo)配。將超級增強(qiáng)子的變化與基因表達(dá)的變化關(guān)聯(lián)起來能直接篩選出受表觀調(diào)控影響的功能基因。 ATAC-seq檢測染色質(zhì)開放性。超級增強(qiáng)子區(qū)域必然是高度開放的。兩者結(jié)合可以更準(zhǔn)確地定義活躍的調(diào)控區(qū)域。 其他組蛋白修飾例如同時(shí)做H3K4me3活躍啟動(dòng)子標(biāo)記和H3K27me3抑制標(biāo)記可以全面描繪染色質(zhì)狀態(tài)并研究激活與抑制信號的拮抗關(guān)系。5. 數(shù)據(jù)分析實(shí)戰(zhàn)中的常見“坑”與解決方案即使實(shí)驗(yàn)做得完美數(shù)據(jù)分析環(huán)節(jié)也可能讓你前功盡棄。下面是我在多年分析中總結(jié)的幾個(gè)典型問題和解決思路。5.1 峰值檢測的模糊地帶問題MACS2等軟件給出的峰有時(shí)邊界模糊特別是對于信號寬廣的超級增強(qiáng)子區(qū)域。不同的參數(shù)如p值閾值、片段長度會(huì)導(dǎo)致峰的數(shù)量和范圍差異很大影響后續(xù)超級增強(qiáng)子的合并與鑒定。解決方案標(biāo)準(zhǔn)化流程在同一個(gè)課題中所有樣本必須使用完全相同的峰值檢測參數(shù)和軟件版本進(jìn)行分析確??杀刃浴J謩?dòng)審查不要完全相信自動(dòng)化結(jié)果。必須將鑒定出的超級增強(qiáng)子區(qū)域在IGV中逐個(gè)查看原始信號。確認(rèn)該區(qū)域確實(shí)有連續(xù)、高聳的H3K27ac信號而不是由幾個(gè)離散的小峰勉強(qiáng)合并而成。一致性評估對于生物學(xué)重復(fù)樣本檢查超級增強(qiáng)子在重復(fù)間的重現(xiàn)性。可以計(jì)算重疊率或使用IDR工具來鑒定可重復(fù)的高置信度峰集。5.2 超級增強(qiáng)子鑒定閾值的陷阱問題ROSE算法默認(rèn)使用信號排序前1%的區(qū)域作為超級增強(qiáng)子。但這個(gè)閾值是經(jīng)驗(yàn)性的對于不同的細(xì)胞類型、不同的測序深度最優(yōu)閾值可能不同。機(jī)械套用可能導(dǎo)致漏掉真正的功能區(qū)域或納入過多假陽性。解決方案多閾值嘗試可以嘗試多個(gè)閾值如0.5% 1% 2%然后結(jié)合生物學(xué)知識(shí)進(jìn)行判斷。例如查看不同閾值下已知的關(guān)鍵細(xì)胞身份基因如干細(xì)胞中的OCT4, SOX2是否被包含在超級增強(qiáng)子內(nèi)。結(jié)合其他標(biāo)記如果同時(shí)有Mediator復(fù)合物如MED1或BRD4的ChIP-seq數(shù)據(jù)可以要求候選區(qū)域必須同時(shí)富集這些輔因子的信號這能大大提高鑒定的特異性。功能富集分析將不同閾值下鑒定出的超級增強(qiáng)子關(guān)聯(lián)的靶基因進(jìn)行GO或KEGG通路富集分析。一個(gè)合理的閾值應(yīng)該能讓靶基因顯著富集到與你的研究系統(tǒng)相關(guān)的通路上。5.3 靶基因關(guān)聯(lián)的挑戰(zhàn)問題超級增強(qiáng)子可能通過長距離染色質(zhì)環(huán)調(diào)控幾十甚至幾百kb外的基因。簡單地將其注釋到最近的基因錯(cuò)誤率可能超過50%。解決方案優(yōu)先使用三維基因組數(shù)據(jù)如果課題組有Hi-C或ChIA-PET數(shù)據(jù)應(yīng)直接基于染色質(zhì)互作信息來關(guān)聯(lián)超級增強(qiáng)子與靶基因。這是最準(zhǔn)確的方法。保守策略在沒有三維數(shù)據(jù)的情況下可以采取更保守的關(guān)聯(lián)策略1) 關(guān)聯(lián)到最近的基因2) 關(guān)聯(lián)到同一拓?fù)潢P(guān)聯(lián)結(jié)構(gòu)域內(nèi)的所有基因3) 結(jié)合表達(dá)相關(guān)性超級增強(qiáng)子信號強(qiáng)度與基因表達(dá)量在多個(gè)樣本中的相關(guān)性進(jìn)行篩選。只有被多種方法共同支持的關(guān)聯(lián)才值得優(yōu)先進(jìn)行功能驗(yàn)證。使用公共數(shù)據(jù)利用ENCODE、4D Nucleome等公共數(shù)據(jù)庫中已發(fā)表的同一細(xì)胞類型的Hi-C數(shù)據(jù)作為參考來輔助關(guān)聯(lián)。5.4 數(shù)據(jù)可視化與展示的藝術(shù)問題如何將復(fù)雜的基因組數(shù)據(jù)清晰、美觀、有說服力地展示出來解決方案與技巧IGV截圖是基礎(chǔ)展示關(guān)鍵基因位點(diǎn)用不同樣本的H3K27ac信號軌道、超級增強(qiáng)子注釋區(qū)間、ATAC-seq信號等疊加顯示。確保坐標(biāo)軸范圍一致顏色區(qū)分明顯圖例清晰。聚合圖使用computeMatrix和plotProfile來自deeptools繪制所有超級增強(qiáng)子區(qū)域或其上下游區(qū)域的信號平均聚合圖。這種圖能非常直觀地展示超級增強(qiáng)子區(qū)域信號的典型模式以及不同組別間的整體差異?;鹕綀D與散點(diǎn)圖展示差異超級增強(qiáng)子分析的結(jié)果如癌 vs. 正常X軸為變化倍數(shù)Y軸為顯著性一目了然。圈圖使用Circos等工具繪制全基因組水平的超級增強(qiáng)子分布概覽展示其與染色體特征、基因密度等的關(guān)系適合放在開篇或摘要圖極具沖擊力。最后我想分享一點(diǎn)最深的體會(huì)研究超級增強(qiáng)子本質(zhì)上是在尋找控制細(xì)胞行為的“核心控制電路”。H3K27ac ChIP-seq是我們繪制這張“電路圖”最得力的工具之一。但切記工具是為科學(xué)問題服務(wù)的。在動(dòng)手之前花足夠的時(shí)間思考一個(gè)清晰、有層次、有創(chuàng)新性的科學(xué)問題設(shè)計(jì)好從發(fā)現(xiàn)到驗(yàn)證的完整邏輯鏈條遠(yuǎn)比盲目追求最炫酷的技術(shù)更重要。當(dāng)你拿到數(shù)據(jù)看到那些在關(guān)鍵基因旁拔地而起的H3K27ac信號峰時(shí)那種發(fā)現(xiàn)新大陸般的興奮感正是科研路上最迷人的風(fēng)景。希望這篇文章能幫你更快地抵達(dá)那片風(fēng)景。