表達(dá)量考量與數(shù)據(jù)庫GTEx-HPA實(shí)戰(zhàn))
表達(dá)量的兩個陷阱公共庫里不存在的靶點(diǎn)做出了鎮(zhèn)痛藥TPM 打平的靶點(diǎn)血漿池差百倍摘要本文通過兩個真實(shí)案例揭示靶點(diǎn)表達(dá)量數(shù)據(jù)解讀的兩大陷阱。其一Nav1.8 在公共數(shù)據(jù)庫GTEx/HPA中幾乎全部顯示Not detected但真相是這些數(shù)據(jù)庫根本不采集 DRG背根神經(jīng)節(jié)——而 DRG 恰是傷害性感受神經(jīng)元胞體所在Nav1.8 在那里高表達(dá)最終 suzetrigine 成為三十年來首個新型口服鎮(zhèn)痛藥。其二PCSK9 與 Lp(a) 的肝 TPM 僅差 1.5 倍看似打平但半衰期、分泌速率與遺傳多態(tài)把血漿池拉開百倍約 2 nM vs 30–250 nM直接改寫藥物開發(fā)路線——池越大越要往合成端打。共同教訓(xùn)是表達(dá)量數(shù)據(jù)的價(jià)值不在數(shù)字本身而在你知不知道怎么解讀它的缺口——評估靶點(diǎn)前必須問三個問題數(shù)據(jù)庫采了哪些組織mRNA 到蛋白的換算里半衰期和周轉(zhuǎn)是什么角色個體差異有多大2025 年 1 月Vertex 的 suzetrigine 獲 FDA 批準(zhǔn)成為幾十年來第一個全新機(jī)制的口服鎮(zhèn)痛藥。它靶向 Nav1.8一個有趣的事實(shí)是如果你打開最權(quán)威的人體組織表達(dá)數(shù)據(jù)庫查這個靶點(diǎn)它幾乎在所有 51 個組織里都顯示Not detected——轉(zhuǎn)錄本低到檢測儀器的下限以下。一個數(shù)據(jù)庫里不存在的靶點(diǎn)為什么能成為三十年來鎮(zhèn)痛領(lǐng)域最大的勝利答案藏在表達(dá)量數(shù)據(jù)的兩個經(jīng)典陷阱里。這篇文章講兩個真實(shí)案例Nav1.8 教會我懷疑數(shù)據(jù)庫的采樣盲區(qū)Lp(a) 教會我別信 TPM 要信摩爾池。它們共同的教訓(xùn)是——靶點(diǎn)表達(dá)量不是查出來的一個數(shù)字而是數(shù)據(jù)源覆蓋度、轉(zhuǎn)錄-蛋白換算、個體差異三層修正后的判斷。先弄明白 TPM一個份額不是濃度兩個案例都會反復(fù)用到 TPM 這個單位值得先花一分鐘把它看透。TPM Transcripts Per Million每百萬轉(zhuǎn)錄本數(shù)。測序儀測出來的原始數(shù)據(jù)其實(shí)只是比對到某基因的 reads 條數(shù)這個計(jì)數(shù)被兩個因素污染測序深度同一庫跑 5000 萬 reads 和 1 億 reads所有基因計(jì)數(shù)差一倍和基因長度同樣豐度下3000 bp 基因捕獲的 reads 天然是 300 bp 基因的 10 倍。TPM 就是洗掉這兩個污染后的標(biāo)準(zhǔn)歸一化先把 reads 數(shù)除以基因長度再歸一化成每百萬總轉(zhuǎn)錄本中的份額。打個比方奶茶店今天共賣出 100 萬杯飲品全細(xì)胞轉(zhuǎn)錄本珍珠奶茶賣了 5000 杯它的 TPM 就是 5000——占 0.5% 市場份額。但要注意杯其實(shí)大小不等得先把銷量換算成標(biāo)準(zhǔn)杯再算份額不然大杯裝天然顯得賣得多這就是第一步除基因長度干的事。主流數(shù)據(jù)庫選 TPM 而不是老前輩 FPKM原因很實(shí)際TPM 讓每個樣本的總和恒等于 100 萬跨樣本、跨基因都能直接比FPKM 的總和因樣本而異跨樣本比較會誤導(dǎo)。GTEx、HPA 全用 TPMHPA 頁面里的 nTPM/nCPM 則是在 TPM 上再加一層樣本間歸一化去批次效應(yīng)。量級錨點(diǎn)感受一下GTEx 里肝臟 ALB白蛋白TPM 可達(dá)數(shù)萬而 SCN10A 在 HPA 全庫 51 個組織的最高值只有 0.1 nTPM——份額差五六個數(shù)量級。粗略換算一個哺乳動物細(xì)胞總 mRNA 約 10?–10? 個分子所以 1 TPM ≈ 0.1–1 個 mRNA 分子/細(xì)胞。但 TPM 天生帶著三個坑正好預(yù)告了后面兩個案例它是份額不是濃度——同樣的 TPM在轉(zhuǎn)錄組總量不同的細(xì)胞里對應(yīng)不同絕對拷貝數(shù)它是相對值會互相擠占——紅細(xì)胞里 HBB血紅蛋白占轉(zhuǎn)錄組 30% 以上其他基因的 TPM 全被壓縮它更是mRNA 不是蛋白——轉(zhuǎn)錄本豐度到蛋白濃度還隔著翻譯效率和半衰期后面 Lp(a) 會用百倍差距現(xiàn)身說法。記住這三條再看表達(dá)量數(shù)據(jù)的眼光就不一樣了。表達(dá)量的生理格局從高表達(dá)酶類到低表達(dá)通道先建立一個坐標(biāo)系。人體里表達(dá)量最高的靶點(diǎn)是什么概念可溶性代謝酶和分泌蛋白典型量級 nmol/mg 蛋白級到血漿 μM–mM 級最低一檔是離子通道和轉(zhuǎn)錄因子只有 102–10? 拷貝/細(xì)胞。拿兩端最極端的對比——紅細(xì)胞里的 CA II 約 20 μM折合每細(xì)胞 10? 分子量級DRG 神經(jīng)元里的 Nav1.7 只有幾百個通道——差三到四個數(shù)量級藥化含義完全不同。高表達(dá)靶點(diǎn)類型一覽靶點(diǎn)類型典型表達(dá)水平代表靶點(diǎn)實(shí)例藥化含義代謝酶可溶性nmol/mg 蛋白級細(xì)胞內(nèi) μM 級CA II碳酸酐酶 IIcarbonic anhydrase II紅細(xì)胞 ~20 μM、CA I、ACE血管緊張素轉(zhuǎn)換酶、HMG-CoA 還原酶他汀靶點(diǎn)藥物史上最豐收的一類競爭性抑制劑只需對抗底物濃度藥物代謝酶anti-target肝 CYP細(xì)胞色素 P450總量 0.5–1 nmol/mg 微粒體蛋白CYP3A4、CYP2D6、UGTUDP-葡萄糖醛酸轉(zhuǎn)移酶不是靶點(diǎn)是雷區(qū)——DDI 研究對象蛋白酶消化道/中性粒細(xì)胞高豐度胰蛋白酶、彈性蛋白酶、凝血瀑布纖維蛋白原 ~9 μM 血漿、DPP-4西格列汀靶點(diǎn)經(jīng)典可藥靶點(diǎn)口服小分子成功率高細(xì)胞骨架/結(jié)構(gòu)蛋白占可溶性蛋白百分之幾β-tubulinβ-微管蛋白紫杉烷/長春堿靶點(diǎn)、actin肌動蛋白血小板中 ~10? 拷貝/細(xì)胞、血紅蛋白化療藥 collateral toxicity 的來源血清分泌蛋白血漿 μM–mM 級白蛋白~600 μM、IgG免疫球蛋白 G~65 μM、TTR轉(zhuǎn)甲狀腺素蛋白~4 μMtafamidis 靶點(diǎn)、PCSK9~2 nM化學(xué)計(jì)量式耗竭需大劑量siRNA/抗體占優(yōu)受體酪氨酸激酶高表達(dá)檔肝細(xì)胞 15–30 萬拷貝/細(xì)胞胰島素受體大鼠脂肪細(xì)胞 ~10 萬/細(xì)胞BioNumbers 101361、EGFR肝細(xì)胞 15–30 萬RTK 也有高表達(dá)檔信號放大級聯(lián)下 10% 占位即可顯效離子通道的例外NMJ神經(jīng)肌肉接頭處 nAChR 密度 10?–10?/μm2小鼠終板總量 ~3×10? 受體/終板nAChR尼古丁型乙酰膽堿受體nicotinic acetylcholine receptor肌松藥靶點(diǎn)、RyR11 型蘭尼堿受體ryanodine receptor 1惡性高熱靶點(diǎn)離子通道整體低表達(dá)但這兩個解剖學(xué)位點(diǎn)局部極高感光 GPCR 例外視桿細(xì)胞外節(jié) ~3–5 mM視紫紅質(zhì)rhodopsin人體單蛋白濃度最高的 GPCRG 蛋白偶聯(lián)受體視覺級聯(lián)放大之源腫瘤過表達(dá)激酶擴(kuò)增后 10?–10? 拷貝/細(xì)胞A431 細(xì)胞 EGFR表皮生長因子受體百萬級、HER2人表皮生長因子受體 2擴(kuò)增乳腺癌正常乳腺上皮 1 萬腫瘤擴(kuò)增 100 倍以上、BCR-ABLCML 治療靶點(diǎn)過表達(dá)本身是病理機(jī)制選擇性靠正常組織表達(dá)差補(bǔ)體系統(tǒng)血漿 μM 級級聯(lián)蛋白C5eculizumab/依庫珠單抗靶點(diǎn)抗體藥成功但劑量需求大pool 太大低表達(dá)靶點(diǎn)類型一覽靶點(diǎn)類型典型表達(dá)水平代表靶點(diǎn)實(shí)例藥化含義離子通道102–10? 拷貝/細(xì)胞膜靶點(diǎn)最低檔Nav1.7電壓門控鈉通道 1.7SCN9ADRG 神經(jīng)元幾百拷貝、Kv1.5電壓門控鉀通道、hERGhuman ether-à-go-go 相關(guān)基因心臟安全 anti-target需 pM–nM 親和力過表達(dá) assay 與 native 藥理偏差大轉(zhuǎn)錄因子103–10? 分子/細(xì)胞p53腫瘤抑制因子細(xì)胞系實(shí)測 2.1×10?–1.96×10? 分子/細(xì)胞正常細(xì)胞更低且被 MDM2 泛素化降解維持、MYC原癌基因轉(zhuǎn)錄因子正常成纖維細(xì)胞峰值 3–6 千分子/細(xì)胞、STAT3信號轉(zhuǎn)導(dǎo)與轉(zhuǎn)錄激活因子 3低豐度 不可成藥雙重困難傳統(tǒng)小分子禁區(qū)細(xì)胞因子受體102–103 拷貝/細(xì)胞IL-2Rα白介素 2 受體 α 鏈長臂猿實(shí)測 150 拷貝/細(xì)胞BioNumbers 109885、IFNAR干擾素受體小分子極難覆蓋基本是生物藥地盤孤兒/低豐度 GPCR0.01–1 pmol/mg血小板蛋白質(zhì)組實(shí)測 α2A 腎上腺素受體僅 140±60 拷貝/血小板大量 GPRxx 孤兒受體約 120–130 個非化學(xué)感應(yīng)孤兒 GPCR 配體未知放射配體結(jié)合實(shí)驗(yàn)都難做配體未知更無從篩部分非受體激酶NRTKnon-receptor tyrosine kinase非受體酪氨酸激酶數(shù)百–數(shù)千拷貝/細(xì)胞JAK1/2/3Janus 激酶 1/2/3TYK2 亦是JAK3 主要在造血細(xì)胞JAK1/2/TYK2 廣泛表達(dá)但拷貝低、SYK脾酪氨酸激酶、BTK布魯頓酪氨酸激酶B 細(xì)胞、ZAP70ζ 鏈相關(guān)蛋白激酶 70kDaT 細(xì)胞U2OS 細(xì)胞系絕對定量蛋白質(zhì)組Mol Syst Biol 2011顯示激酶整體落在低–極低豐度檔500–5000 與 500 拷貝/細(xì)胞血小板蛋白質(zhì)組實(shí)測 Akt1絲蘇氨酸激酶500 拷貝、FynSrc 家族酪氨酸激酶3400 拷貝/細(xì)胞——蛋白組學(xué)常在檢測限附近但催化級聯(lián)下低拷貝不等于低藥效選擇性抑制劑 10–30% 占位即可切斷通路這就是 JAK/BTK/SYK 抑制劑能成為口服小分子重鎮(zhèn)的原因孤兒核受體低–中多數(shù) NR核受體亞型部分成員表達(dá)局限在特定組織腫瘤新抗原/突變蛋白極低且僅腫瘤組織p53 突變體、KRAS G12DKRAS 基因甘氨酸 12 位突變?yōu)樘於彼岜磉_(dá)低但選擇性極好靶向性的來源激酶是個特殊的分裂帶值得單獨(dú)看一眼。經(jīng)典藥化教材把激酶籠統(tǒng)歸為中低表達(dá)但定量蛋白質(zhì)組揭示的是分裂圖景受體型激酶RTK靠基因擴(kuò)增能上到 10?–10?見高表達(dá)表 EGFR/HER2胞質(zhì)內(nèi)的非受體激酶卻被壓在數(shù)百到數(shù)千拷貝的窄帶里。這帶來三個實(shí)際后果生化 assay 的酶量要精打細(xì)算10 nM 酶與 500 拷貝/細(xì)胞的生理濃度差 1–2 個數(shù)量級體外 IC50 到細(xì)胞里經(jīng)常變?nèi)踹x擇性窗口沒有表達(dá)量紅利可揮霍只能靠家族保守 ATP 口袋的細(xì)微差別降解劑PROTAC反而受益——催化式降解不需要化學(xué)計(jì)量覆蓋幾百拷貝的靶點(diǎn)一個降解劑分子就能循環(huán)清除E3 泛素連接酶底物受體 CRBNcereblon配體家族的成功部分源于此。這個格局為什么重要高表達(dá)靶點(diǎn)常有受體儲備receptor reserve10–30% 占位即可顯效生化實(shí)驗(yàn)好做、共晶好長低表達(dá)靶點(diǎn)沒有儲備需要 90% 以上占位、游離藥物濃度沖到 Kd 的 10 倍以上且過表達(dá) assay 會扭曲真實(shí)藥理——Nav1.7 鎮(zhèn)痛藥三十年臨床失敗靶占位壓不上去是公認(rèn)主因之一。高表達(dá)也有代價(jià)靶點(diǎn)本身成為藥物清除途徑TMDD還會帶來鏡像 on-target 毒性CA 抑制劑壓住紅細(xì)胞 CA 導(dǎo)致代謝性酸中毒就是典型。陷阱一數(shù)據(jù)庫里沒有的組織靶點(diǎn)可能在那里高表達(dá)回到 Nav1.8。為了驗(yàn)證數(shù)據(jù)庫里的Not detected我從 Ensembl 解析出 SCN9ANav1.7和 SCN10ANav1.8的 ENSG ID去 Human Protein Atlas 拉全量數(shù)據(jù)——HPA 的 consensus 數(shù)據(jù)集本身就是 HPA GTEx 合并的 51 組織轉(zhuǎn)錄組一次查詢等于看了兩個權(quán)威庫。指標(biāo)SCN9A / Nav1.7SCN10A / Nav1.8HPA 分類Tissue enhanced (Brain)Not detected全庫最高組織下丘腦 5.7 nTPM睪丸 0.1 nTPM腦區(qū)下丘腦 5.7、中腦 1.2、脊髓 0.6全部 0.0單細(xì)胞最高Sertoli 810 / OPC 300 / 神經(jīng)元大類 286 nCPMLate spermatids 4.6 nCPM如果只看這張表你會得出Nav1.8 在人體幾乎不表達(dá)別碰的結(jié)論——而這恰恰是錯的。真相是GTEx 和 HPA 都不采集 DRG背根神經(jīng)節(jié)而 DRG 恰恰是傷害性感受神經(jīng)元的胞體所在、這兩個通道的主表達(dá)地。文獻(xiàn)里人 DRG 單細(xì)胞測序顯示Nav1.8 是 nociceptor 中最豐富的 α 亞基之一TPM 數(shù)百級Nav1.7 廣泛表達(dá)但量級低于 Nav1.8。GTEx 的 Nerve-Tibial 也救不了場脛神經(jīng)是遠(yuǎn)端神經(jīng)干胞體在 DRG神經(jīng)干里 SCN10A 轉(zhuǎn)錄本本就趨零。臨床結(jié)局反過來驗(yàn)證了這一點(diǎn)。投入更早更重的 Nav1.7 賽道至今沒有成藥而 Nav1.8 的 suzetrigine 成了三十年來首個新型口服鎮(zhèn)痛藥。Nav1.8公共庫不可見 真實(shí)組織 DRG 特異的組合反而是它組織選擇性的來源——藥物打在 DRG nociceptor 上心臟、平滑肌、骨骼肌里的 Nav 同族亞型幾乎不接觸安全性天然好。這個陷阱的普遍規(guī)律值得記住公共庫查不到 ≠ 不表達(dá)。神經(jīng)、腸神經(jīng)系統(tǒng)、肌肉深部、關(guān)節(jié)軟骨、視網(wǎng)膜等采樣薄弱的組織靶點(diǎn)的真實(shí)表達(dá)必須用文獻(xiàn)單細(xì)胞數(shù)據(jù)補(bǔ)。評估報(bào)告里應(yīng)該顯式寫一節(jié)數(shù)據(jù)源覆蓋缺口——哪些組織數(shù)據(jù)庫沒有采、這些組織對靶點(diǎn)是否關(guān)鍵。陷阱二TPM 打平的兩個靶點(diǎn)血漿池能差百倍第二個案例是一對看似平起平坐的肝源分泌蛋白PCSK9 和 Lp(a)。兩者都是肝細(xì)胞合成的血漿蛋白Lp(a) 的蛋白本體 apo(a) 由 LPA 基因編碼。同樣從 HPA 拉數(shù)據(jù)維度PCSK9LPA (apo(a))肝 nTPM47.571.8僅 1.5 倍肝外信號小腦 10.3、肺 7.448/51 組織 1近乎肝專屬肝細(xì)胞單細(xì)胞 nCPM21.982.0HPA 血漿濃度免疫法143 ng/mL78.8 μg/mL換算摩爾濃度約 2–2.6 nM約 30–80 nM高表達(dá)人群可達(dá) 250 nM個體差異3–5 倍超過 100 倍0–250 nmol/LmRNA 層面幾乎打平——LPA 只比 PCSK9 高 1.5 倍。但分泌速率、蛋白半衰期游離 PCSK9 周轉(zhuǎn)快Lp(a) 顆粒清除極慢和遺傳調(diào)控LPA 的 Kringle IV-2 重復(fù)拷貝數(shù)多態(tài)把血漿池拉開了兩個數(shù)量級。池的大小直接改寫藥物的開發(fā)路線。PCSK9 約 2 nM 的小池單抗化學(xué)計(jì)量中和完全可行——evolocumab、alirocumab 都已上市siRNA 敲合成端的 inclisiran 也成藥三條路線通吃。Lp(a) 是 30–250 nM 的大池中和這么大的池子需要極高劑量抗體pelacarsen 80 mg/月Ph3 進(jìn)行中敲合成端的 siRNAolpasiran、zerlasiran天然占優(yōu)——池越大越要往合成端打。小分子的機(jī)會同樣在 Lp(a)muvalaplin 不做中和而是口服小分子阻斷 apo(a) 與 apoB 的組裝繞開大池難題。大 pool 血漿蛋白的小分子策略 阻斷組裝/分泌不是中和存量。這里還藏著一個檢測陷阱。HPA 數(shù)據(jù)里 LPA 免疫法 78.8 μg/mL vs 質(zhì)譜 12 μg/mL相差 6.5 倍。這是 Lp(a) 領(lǐng)域經(jīng)典的異構(gòu)體偏倚——抗體表位在 Kringle IV 重復(fù)區(qū)大異構(gòu)體表位多、免疫法系統(tǒng)性高估。臨床 Lp(a) 檢測必須用 isoform-independent 方法否則跨研究數(shù)據(jù)不可比。兩個陷阱的共同教訓(xùn)Nav1.8 和 Lp(a) 看似是兩個獨(dú)立的故事其實(shí)是同一堂課的兩個側(cè)面表達(dá)量數(shù)據(jù)的價(jià)值不在數(shù)字本身而在你知不知道怎么解讀它的缺口。數(shù)據(jù)庫告訴你 Nav1.8 “Not detected”它沒告訴你的是采樣框里沒有 DRG數(shù)據(jù)庫告訴你 PCSK9 和 LPA 的肝 TPM 只差 1.5 倍它沒告訴你的是半衰期和遺傳多態(tài)會把血漿池拉開百倍。靶點(diǎn)評估的第一步不是查數(shù)字而是問三個問題這個庫采了哪些組織mRNA 到蛋白的換算里半衰期和周轉(zhuǎn)是什么角色個體差異有多大——回答了這三個表達(dá)量這個數(shù)字才真正有意義。參考來源Human Protein Atlas: https://www.proteinatlas.orgSCN9A/SCN10A/PCSK9/LPA 表達(dá)數(shù)據(jù)2026-08 查詢Ensembl REST API: https://rest.ensembl.orgENSG ID 解析U2OS 絕對定量蛋白質(zhì)組Nagaraj N, et al. Mol Syst Biol 7:512 (2011), doi:10.1038/msb.2011.82血小板全譜拷貝數(shù)Zeiler M, et al. Mol Cell Proteomics 13:3366 (2014)Akt1 500、Fyn 3400 拷貝p53 拷貝數(shù)Ma L, et al. PNAS 102:14266 (2005)PMID 16186499MYC 拷貝數(shù)Waters CM, et al. (1991)轉(zhuǎn)引自 Genes Dev 17:1115 (2003)suzetrigine FDA 批準(zhǔn)信息Vertex Pharmaceuticals, 2025-01Lp(a) 臨床閾值125 nmol/L約 50 mg/dL為心血管風(fēng)險(xiǎn)增強(qiáng)因子閾值