|
人类转录因子DNA结合特异性的扩展密码本基因表达由转录因子(TF)调控,转录因子识别特定的DNA序列基序。已有约数百个推定的人类转录因子主要依据其明显的DNA结合结构域(DBD)被鉴定,但缺乏已知结合基序。即便对于特征明确的转录因子,基序在多大程度上准确反映活细胞中结合位点仍存在争议。研究人员描述了一项系统性工作(“Codebook”),用于测定332个推定性及特征不明人类转录因子的序列特异性。超过4000项独立实验,涵盖多种体外与体内检测,为其中略多于一半(177个;53%)的转录因子产生了基序,且多数仅与单一蛋白相关。这些结果通过约130个不同基序扩展了人类转录因子编码的序列识别词汇。此外,体外鉴定的结合基序在细胞结合位点中显著富集。总体数据揭示了人类基因组中数万个先前未知、保守且直接的转录因子结合位点。这些位点集中于启动子区域,并可预测基因表达。总之,这一新密码本为解码人类基因组提供了重要进展。 研究背景与立项依据 人类转录因子(TF)总数约1600个,2018年普查显示超过四分之一缺乏可信结合基序(PWM)。人类基因组保守非编码区的主要功能假设为基因调控,但大量推定性TF既不接近已知TF旁系同源,又仅凭DBD或文献线索入选,其序列特异性长期空白。同时,体外基序能否代表体内结合位点受染色质、辅因子影响,学界存有长期争议。为填补这一根本缺口,研究人员发起Codebook–GRECO-BIT合作项目,系统测定332个无已知基序的推定性TF及61个对照TF的DNA结合特异性,试图扩展人类TF“密码本”。 主要技术方法 研究整合五类互补检测:HT-SELEX与以片段化基因组DNA为库的GHT-SELEX、SMiLE-seq、蛋白结合微阵列(PBM)、以及在HEK293细胞中诱导表达带标签转基因后的染色质免疫沉淀测序(ChIP–seq)。成功标准定义为同一蛋白跨≥2平台获得相似PWM且该PWM可跨平台预测数据。基序以位置权重矩阵(PWM)建模,跨平台基准测试由GRECO-BIT完成。样本方面,体外体系涵盖大肠杆菌IVT与小麦胚芽提取物IVT,体内仅用HEK293单细胞系;外部验证借用ENCODE等208蛋白占用图。 研究结果 Overview of the Codebook project 对393个蛋白(332 Codebook + 61对照)开展4804次实验,成功获177个Codebook TF与58个对照TF的PWM。C2H2锌指类成功率67%(121/180),其他DBD类49%,无明确DBD类仅12%。近半数未出基序者经人工复核83/155判为真阴性,单锌指或异常间距C2H2多不结合DNA。 Cellular binding sites and SNVs 130个成功Codebook TF有可靠ChIP–seq,峰内PWM匹配显著富集,证明内在特异性主导位点选择。跨研究ChIP数据重叠部分有限但PWM仍具判别力(HEK293中位AUROC 0.71)。在5% FDR下于190个TF中检出12060个等位基因特异性结合(ASB)事件,74%与PWM预测一致;相关SNP富集于已知ASB、GWAS疾病位点与GTEx eQTL。 Motif diversity and degeneracy 177个Codebook TF归为129个不同基序,与已知人TF库联合聚类仅新增15%独有簇,至少扩充130个新基序。部分PWM信息含量(IC)低且“退化”,人为提升IC反而降低预测力,说明退化是跨平台保真所需。 Conservation of genomic binding sites 以ChIP–seq、GHT-SELEX与PWM三者优化重叠定义“TOP位点”,再筛出碱基级保守的CTOP位点,共113577个(Codebook占82760)。85.7% CTOP簇落入PhastCons保守区,36.9%邻启动子、47.3%覆CpG岛;CpG岛内平均4.55个CTOP,CXXC家族偏好未甲基化CG。非CpG启动子与转座子(如ZNF689于L1M4)亦有分布。 Codebook motifs predict gene expression 以MARA框架将FANTOM5启动子PWM得分回归583份样本CAGE表达,130个Codebook独有基序簇的活性–表达相关分布与已知TF无异。高方差25簇双聚类分四群:免疫细胞/癌症相关(ZBTB8A、CGGBP1、SP140)、神经系(CAMTA1、MBD3、MYRFL)、间充质原发细胞(TTF1、ZBTB41、ZBTB5)等,证明新基序可预测组织特异表达。 Codebook TFs and the dark matter genome 约半数Codebook TF在ChIP–seq中偏聚非启动子/增强子区“基因组暗物质”。KRAB-C2H2(KZNF)借GHT-SELEX证实其仅凭序列特异性锁定特定逆转录元件亚型。16个Codebook TF的DBD源自DNA转座酶(BED-zf、CENPB、JRK等),JRK仍结合其祖先Tigger元件末端重复,提示转座子共递TF与cis调控原件。 Completing the human TF codebook 加上同期外库新增33个TF,具表征基序人TF达1421个,余175个暂无基序,其中83个经复核可能非真正DNA结合TF。多平台并行与非单一方法最优的结论,使Codebook TF成为人TF中序列特异性表征最丰富子集。 讨论与结论翻译 Codebook主要目的为评估332个未表征推定性人TF的序列特异性DNA结合并产出可信PWM,以组装完整人TF基序集,目标大体达成。尽管仅用五种检测且ChIP–seq限于单系,过半TF成功;许多未成功者可能为非DNA结合蛋白或几乎无序列偏好。多实验策略与多基序推导评分并行获益,无任一方法可缺,这与既往基准一致。体外随机库、体外基因组库与体内基因组占用三者结合,可分离直接/间接结合与染色质贡献。Codebook数据将人TF识别词汇扩展至少15%(约130新基序),揭示数万保守直接结合位点并可用于SNV功能预测与表达解码,为完成“每人TF一基序”提供关键一步,但人TF名录本身仍随新DBD类与结构预测演化。 |

