如果把人类基因组比作一部由三十亿对碱基写成的生命天书,那么在这部浩瀚的巨著中找出一个导致疾病的 " 错别字 ",无异于大海捞针。
为了破译这些隐藏在基因组深处的生命密码,近日,华大生命科学研究院与浙江之江实验室组成的联合团队,以双方共同打造的基因组基础模型 Genos 为底座,推出了一款名为 ATLAS 的疾病位点发现框架。该研究创新性地引入了大模型的 " 注意力机制 ",如同让 AI 化身为一位目光如炬的 " 超级编辑 ",在对比阅读健康与疾病样本数据时,ATLAS 会敏锐追踪 AI 的 " 目光分布 ",一旦大模型在患者基因的某个段落出现明显的异常停留,系统便能顺着这股特殊的 " 注意力 ",精准定位出相应的致病区域。

ATLAS 研究路线图
目前,相关研究成果已入选人工智能与数据挖掘领域的顶级学术会议国际知识发现与数据挖掘大会(简称 KDD)。
传统技术精细定位的挑战
过去,科学人员在复杂疾病研究中依赖全基因组关联分析(GWAS)。这就像动员成千上万的人一起来找茬,通过统计学方法对比病例组和对照组的基因序列差异。
GWAS 在遗传学领域发挥了巨大作用,但也有其局限性。在面对罕见病、小样本疾病队列、低频变异,或者需要进行 " 碱基级精细定位 " 时,传统统计方法的统计功效往往不足,通常只能圈出一个较宽的候选区间,难以直接锁定关键的功能位点。
ATLAS 框架:释放 Genos 大模型的 " 注意力 " 优势
就像 ChatGPT 能够从海量文本中掌握人类语言的上下文一样,华大与之江实验室联合研发的 Genos,是一个经过大规模基因组序列预训练的底座大模型,学习了人类基因组中的碱基排列规律和长程依赖关系。
如果说 Genos 是理解基因序列的大脑,ATLAS 则是将这种理解能力具象化,并真正用于寻找致病位点的 " 高倍显微镜 "。
它之所以能提供全新的分析视角,正是源于对 AI" 注意力 " 的巧妙利用。大模型在处理信息时,会对不同的序列片段分配不同程度的注意力。ATLAS 的核心原理就在于 " 找不同 ":它让 Genos 分别去阅读病例组和对照组(健康人)的基因组,然后精确提取并对比模型在阅读这两组序列时 " 目光停留(注意力分布)" 的差异。
如果 AI 在阅读患者序列时,对某个特定的基因或碱基区域表现出了稳定且异常的 " 关注 ",这就提示该区域极可能蕴含着致病信号。这种方法跳出了传统必须依赖庞大样本量去计算变异频率差异的框架,而是通过追踪 AI 底层注意力的指引,直接顺藤摸瓜锁定致病嫌疑区域,为疾病遗传学提供了全新的破局思路。
实战检验,精准捕获地中海贫血致病信号
为了验证这一创新方法的有效性,研究团队联合南方医科大学,以具有明确遗传背景的 β - 地中海贫血作为真实临床验证场景。
测试结果显示,ATLAS 展现出了极高的敏锐度:
主效应基因精准定位:不仅稳定识别出 HBB 等关键疾病相关基因,还在碱基级别进一步缩小了候选区域,实现了精细定位;
次级信号深度挖掘:顺藤摸瓜识别出了 HBD、HBG1、HMBS、OR52A1 等与血红蛋白调控相关的候选基因;
高可靠性验证:研究团队开展了严格的大规模置换检验和多基因模拟数据集测试。结果表明,ATLAS 捕获的差异注意力信号在随机打乱标签后基本消失,证实其识别出的确实是与疾病状态高度相关的真实信号,而非背景噪音。
优势互补,推动基因组模型走向精准医学
ATLAS 的提出并不是为了替代传统的 GWAS 等遗传统计方法,而是作为一种强有力的互补策略。
在与传统区域聚合类方法的比较中,ATLAS 能够将部分疾病相关信号定位到更小的候选区间。特别是在样本量有限、候选区域较宽的场景中,ATLAS 能够显著缩小后续实验验证与功能解释的搜索范围,大幅提升筛选效率。
从建立 Genos 基因组基础模型,到通过 ATLAS 将大模型能力转化为临床发现工具,华大生命科学研究院、之江实验室与南方医科大学的多方协同,为基因组基础模型从 " 能理解序列 " 走向 " 辅助临床决策 " 提供了新的范式。
目前,ATLAS 的计算代码已面向全球开源(GitHub:https://github.com/BGI-HangzhouAI/ATLAS/blob/main/readme.md)。未来,随着更多高质量临床疾病队列的接入,这一基因组 AI 工具有望进一步突破传统分析框架,为疾病机制解析与精准诊疗提供更智能的新工具。
深圳华大生命科学研究院张海强副研究员为该论文的通讯作者。中国科学院大学硕士生刘玉琪、深圳华大生命科学研究院助理研究员邓凯文、南方医科大学叶宇华共同为论文第一作者。该项目得到国家自然科学基金、之江实验室和华大 DCS 云平台的支持。
发布于:广东


登录后才可以发布评论哦
打开小程序可以发布评论哦