业内人士指出AI对齐领域缺失成熟数据产业
目前我只知道一家专门做对齐强化学习环境的公司:这家公司制作的强化学习环境,目的是呈现实际部署中对齐很有挑战性的场景。
事后看来,我们在很多方面都投入了大量鼓励和资金,比如扶持第三方评估机构,但却没有同等力度地鼓励对齐数据公司创立,这似乎是一个巨大的错误。我确实认为很多传统AI安全观点都低估了数据的重要性,所以目前的情况可能与此有关。但Hugging Face事件,其直接诱因显然来自两方面:(a) 总体来看当前强化学习环境都容易被奖励破解 (b) 投入到把对齐作为奖励核心组成部分的强化学习环境中的精力和资金太少。
另一个思路是默认对齐:这是一个老观点,即“找到对齐的人格汇域”后一切都会正常运行。在强化学习规模提升的情况下,这点显然没法保证。但在我看来,目前并没有投入多少精力去研究定制环境如何能帮助在大规模强化训练过程中“把模型推回”良好的人格汇域。在这方面,一个成熟的对齐数据公司生态系统也能提供很大帮助。
在强化学习数据市场里,目前有一个趋势是部分实验室更多地在内部制作强化学习环境。但我不认为这种情况会完全持续下去,我确信基于市场的方式采购强化学习环境,整体能产出最大体量和最优质量。对于对齐强化学习来说,一个创业公司生态系统也能极大帮助前沿模型变得更安全。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖