AI Pulse
📡 X 信号

DEF CON Goldbug挑战赛参赛总结AI能力现状

DEF CON Goldbug挑战赛参赛总结AI能力现状

上周我第一次参加了 DEF CON。我和 Theo、Pirate Software 还有一群才华横溢的安全研究员组队,最后我们赢下了 Goldbug 挑战赛(奖品是一枚 Black Badge!)。

我完全不是安全或解谜领域的人,但我确实耗了巨多 token 尝试给团队帮忙。这次经历让我学到了很多关于当前 AI 发展状态的知识:

第一,AI 智能体只解开了 13 道谜题中的 3 道。我们试了 Fable、5.6、Cursor,它们都没做出来。

第二,我发现现在幻觉问题比我预想的严重得多。它们在常规编码任务上已经好了很多,因为可以即时验证和搜索,但对于只有最终一次验证的长周期谜题,表现非常糟糕。我看到的“瞎编乱造”的数量多得惊人。

第三件怪事是,模型会随着时间推移“趋同”得出同一个错误答案。不管用了什么框架、什么部署方式、什么上下文,没有正确提示的情况下,这些模型最后总会得出同一个错误答案。

第四,模型很容易栽在视觉问题上,也没法处理数据过载。没有清晰指引的话,它们很难分清什么信息有用、什么没用。

不过 AI 确实还是非常有用的。我们并没有用它来寻找解题思路,但我靠它搭建了一大堆自定义工具和查看器,还让智能体测试了团队所有人提出的每一个理论,这在好几道最难的题目上帮了大忙。

随着模型持续扩容,这种情况可能会改变,如果更大的模型变得好很多,解决了上面说的这些问题,我不会感到惊讶。但至少目前来说,在难题领域,智能体的上限就是使用它的人,它没法替你思考、替你做决定。

我写了一篇更长的总结文章在这里,还在做一个视频拆解。希望明天就能上线!

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新