96%自信,1.9%正确:一个专选最差答案的决策模型
96%自信,1.9%正确
Bev是一个决策模型,基于Qwen3.5-9B微调。给它一个情境和一个问题,它会输出每个答案的概率,训练目标只有一个:专门选最差的答案。模型权重、代码和训练记录全部公开。
在324个训练时没见过的决策上,Bev的正确率只有1.9%,平均置信度96%。当它至少90%确信时,正确率反而降到1.4%。
先学会正确,才能故意答错
训练过程比结果更反直觉。训练者先尝试把训练数据的标签翻转,直接训练基础模型,失败了两次。得到的模型正确率只有三分之一,对一切都不确定,像抛硬币。
成功的方法是从Bespoke的Nimble适配器开始。这个适配器已经知道正确答案,要做的只是教它把答案反转。51分钟后,模型错误率达到97%。
于是得到一条规律:一个模型必须先知道正确答案,才能可靠地答错。
不只是玩笑
这条规律指向一个现实问题。许多“如果模型至少90%确信就自动行动”的规则,只在试图答对的模型上测试过。Bev就是那个对照组:一个可以在高置信度下大规模出错的AI系统。
有评论者说,96%自信、98%错误,是对任何部署到生产环境的LLM最准确的描述。“恭喜,你把bug做成了功能。”
技术上,Bev支持Ollama的新决策端点(/v1/systemone)。同一个请求可以发给Bev、nimble或tev1,直接对比。它有三个GGUF量化版本,以Apache-2.0许可发布。
量化差异实际可见:Q4_K_M会改变Bev在324个答案中的20个。整个输出只有几个token(词元)的分数,这时“Q4也还行”不成立。所以默认给的是Q8_0版本。训练耗时3小时38分钟,用一张4090 GPU。
评论区有人拿Bev试自己的生活决策。一个想靠选专业赚大钱的人问该学什么,Bev以99.1%的置信度推荐哲学。一个不想让女友怀孕的人问是否该用避孕套,Bev建议不用。Bev自己的示例同样离谱:建议喝了四瓶啤酒的人去纹身,并认为口渴时不该喝水。有人觉得它像《传送门2》里的Wheatley,还有人说它是“当管理层的料”。
也有人提出更认真的用途:把Bev当成“不要做什么”的检查机制。系统决策时多加一道环节,专门排除Bev选中的选项。目前不清楚这种反向检查是否真的管用。
训练者的态度很明确:它是个玩笑,也是个测试装置,不要用它来做决策。试过它的人,最好报告哪些问题它碰巧答对了——那才是bug报告。