LiteFold发布LiteMol-1基础模型
今天,我们非常激动地推出 LiteMol-1,这是 LiteFold 推出的首个基础模型。
像 BoltzGen、O-Design 和 RFdiffusion 这类基于结构的模型,已经成为生物分子设计的实际标准。但规模化运行它们的成本很高。在很多研发项目中,我们需要生成数万种设计,再经过严格筛选,最终只得到少数几个顶级候选分子。
更重要的是,大多数分子设计系统主要围绕结合亲和力优化。但让分子成为有效药物的其他所有特性呢:ADME、毒性、类药性、膜通透性、可合成性、选择性等等?
这就是我们推出 LiteMol-1 的原因,它是我们从头预训练的首个多分子基础扩散语言模型。仅用一套权重,LiteMol-1 就能条件生成小分子、肽、环肽、depsipeptides、含非经典氨基酸的肽、大环化合物和 PROTAC。
你可以无条件生成分子,也可以根据蛋白质靶标序列进行条件生成。你可以对分子进行 in-painting,保留现有骨架的部分结构,生成非经典肽,环化设计,还可以对分子进行连续编辑和重新生成。
我们还推出了用于多目标分子设计的蒙特卡洛树搜索框架。我们没有强求单个分子在所有方面都完美,而是让搜索保留一组有潜力的分子,每个分子在不同特性间有不同的权衡。这很重要,因为分子设计从根本上来说不是单目标优化问题。
最后,也是最让我们兴奋的一点:这是一款为智能体(Agents)打造的模型。在自动研究(AutoResearch)循环中,当需要反复对数千个大型 PDB/CIF 文件进行推理时,LLM 并不是特别高效的接口。序列空间则不同。SMILES 和分子序列紧凑、可编辑,对智能体来说,更容易检查、比较、修改和推理。
因此我们将 LiteMol-1 视作一块无限的分子画布。模型生成各种可能性,智能体从这些可能性中获取灵感,对它们进行评估、编辑、优化,然后再次生成。自动研究循环会一直持续,直到找到满足给定设计目标的候选分子;同时只有在真正需要的时候,才会调用成本高昂的结构预测、对接或模拟。
我们在肽和小分子生成上的评估表明,LiteMol-1 的表现与前沿的基于结构和基于序列的模型相比具有竞争力,在多个场景中性能与之相当甚至更优,同时生成成本和时间仅为这些模型的零头。
而这仅仅是第一步。可以查看评论区里我们的技术研究博客文章,了解更多关于 LiteMol-1 的信息。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖