AI Pulse

AI药物预测排名因数据切分和误差波动大,勿信单一分数

AI药物预测排名因数据切分和误差波动大,勿信单一分数

一个叫LEADBOARD的药物研发AI基准平台,做了一件不常见的事:发布分数时,同时公布分数背后的测试方法和误差范围。

平台覆盖7个学科,开21个榜单。212,670个化合物用于训练,另有18,382个保留化合物的标签不公开。每个榜单开放前先公布三个参照模型的成绩:常数预测、最近邻、默认参数的Morgan+LightGBM。每个分数还带着背后测试文件和评分代码的SHA校验值,几个月前的数字仍然可追溯。平台把回归作为主要指标,分类作为次要指标。

在药物安全性相关的hERG数据上,同一个任务,不同切分方式给出完全不同的名次。按化合物首次发表年份切分,最佳模型AUROC为0.606;随机切分,平均0.818。随机切分把结构相近的分子拆到训练集和测试集两边,测试样本几乎全是训练样本的邻居,模型靠最近邻查找就能拿高分。现实场景里要预测的是尚未发表的化合物,没有邻居可抄。时间切分模拟的正是这个场景:按年份切,训练时答案还没发表,训练集和测试集结构上零重叠。

因此所有榜单都用时间或骨架切分,不开放随机。榜单标签把切分方式写在第一个字母:T是时间、S是骨架、R是随机,R不开放。第二个字母表示答案可查性:P1是公开来源,P2是公开但经处理,P3是私有标签,P4是前瞻性,答案还不存在于任何地方。

hERG化合物跨文献的重复测量,差异中位数是0.148个log单位,平均值0.475,90百分位1.338,标准差0.736。也就是说,10%的化合物两次发表测量值相差超过20倍。测试集里1338个化合物,696个,即52%,落在pIC50=5.0分类界线的一个噪声底线(0.421 log)内。重新测一次,这些化合物的分类可能翻转。这个底线由跨文献配对构建,只是一个估计值,文献归属错误还可能让估计进一步偏离。

数据自带噪声,模型的微小分数差距也就不那么重要。19个回归榜单里,常数预测——永远输出训练集平均值——在7个榜单上MAE最低;Morgan+LightGBM在13个榜单上AUROC最高。hERG时间切分下,LightGBM的MAE是0.599,常数预测0.589,训练过的模型反而更差;同样的数据换成随机切分,LightGBM变成0.457,常数预测0.671。指纹模型擅长给化合物排序,标定绝对效力偏弱。这类工具更适合当排序器,对绝对数值能给的承诺有限。

细胞/表型榜把难度再抬一级:任务是从化学结构预测细胞形态变化,标签不是数值,是16轴主成分,承载61%的方差。评分用每个化合物的预测谱与观测谱的Pearson相关。最佳基线Morgan+LightGBM得0.159,常数预测0.092,最近邻0.079。基线之间差距真实存在,但绝对水平很低。

撤市榜预测药物上市后会不会被撤。撤市率跟批准年代相关,1990年代获批的约7.8%后来被撤,2010年代只有1.2%。一个只知道批准年份的模型,AUROC能到0.636;把批准年代匹配成对照组后,年份预测器掉到0.504,随机水平。骨架切分下,这个榜408个训练化合物、184个测试,27.7%阳性,bootstrap指标标准差0.0444。Morgan+LightGBM的AUROC是0.593,最近邻0.553,常数预测0.500。

基准要防的是有人反复提交,从测试集里挖信息。LEADBOARD采用Blum和Hardt在ICML 2015提出的阶梯机制:新分数只有比提交者自己的历史最佳高出超过噪声底线时,才会显示。提交流程如下:下载只有结构的测试集,用任意工具预测,上传两列CSV(compound_id, prediction),用Hugging Face账号登录。评分在持有标签的硬件上运行,托管给平台的Space碰不到标签。

数据来自ChEMBL 37(CC BY-SA 3.0)、JUMP Cell Painting(CC0)和公开监管记录。基准只供非商业研究,只给结构,不分发标签。

开发者对边界的说明同样清楚:时间切分不是前瞻性验证;噪声底线是估计值;不评价其他基准的对错。一个分数,如果不附带数据切分方式、基线成绩和标签精度,就无法与另一个分数比较。

阅读原文
📚 相关主题 AI药物研发基准测试生物信息学

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新