开源小模型在浏览器后台自动标记AI内容,不用上传网页
自动AI文本检测目前是一个未被充分满足的小众需求。市面上的唯一选择是Pangram,它做得非常出色,但迫切需要更多竞争。几年之后,如果各大社交网络不扫描新帖[1]和评论中的AI内容以便给它们打标签(或直接删除),我会感到惊讶。
我喜欢在读到听起来像AI的内容时,能依靠Pangram来证实我的怀疑。但如果能从一开始就选择避开AI生成的文本,那就更好了。我想要的是一个在后台运行并自动扫描我访问网站上的文本的工具,无需我主动要求。我可以在Pangram之上构建这样的东西,但那要花钱,而且总的来说,我不喜欢把浏览器看到的每一段文本都发送给第三方服务。本地模型怎么样?
目前用于AI文本检测的开源模型还不错。Pangram声称其检测率达99.66%,误报率为0.004%。我对一大批小型本地模型进行了基准测试[2],用一组AI检测数据集的组合来评估,结果如下:
| 模型 / 变体 | 人类文本误报率 | AI相关文本检出率 |
|---|---|---|
| Gradient — MLX 4-bit | 2.712% | 52.35% |
| EditLens RoBERTa-large — community INT8 | 2.484% | 56.06% |
| Vanguard | 2.267% | 44.92% |
| Desklib | 3.008% | 45.04% |
| Raschka DistilBERT | 2.598% | 39.01% |
| Raschka Qwen3-0.6B | 2.028% | 28.67% |
| Raschka ModernBERT | 1.698% | 21.58% |
| TMR / Oxidane — INT8 | 1.595% | 19.35% |
这些模型差这么多,我并不意外。我甚至没有对Pangram自家的EditLens 3B模型进行基准测试,因为它太大了,无法在我的笔记本电脑后台持续运行,而真正生产环境中的Pangram模型可能比它还要大一到两个数量级。但这些模型对于了解其局限性的人来说,仍然足够有用。如果你想标记一篇AI写的文章,你不需要标记全部,只要足够引起怀疑就行。而且只要你知道误报率大约是2%,你就可以避免把单一标记当作AI使用的确凿证据。
受此鼓舞,我随手搞出了Deckard:一个Chrome扩展,可以在你的Mac上与本地运行的模型(上面表格中加粗的那个)对话。一件好事是我不需要启动web服务器:Chrome扩展可以按需启动模型,并通过native messaging与之通信。它在运行时会使用约400MB到1.2GB的内存(所以就像多开了五六个Chrome标签页),如果你五分钟不用模型,它就会自行关闭。
让我惊喜的是,Deckard成功标记了我已知是AI生成的内容,比如YouTube自带的AI摘要,以及我自己帖子中的AI片段:
它足够轻量,我一直让它运行着。我完全没有注意到我的MacBook Pro变热,也没有感觉电池续航下降,不过你在不同机器上的情况可能会有所不同。
Deckard现在够好了吗?要看情况。它已经好到让我打算使用,并且我会推荐给任何对自动AI检查感兴趣的人。它比Pangram差得远了,也远比我认为未来几年这类工具会达到的水平差。
早在2023年11月,我就写过,AI驱动的agent将会变得非常重要。我建议尽早开始开发测试框架,这样当模型足够好时你就能做好准备:
> 与大多数现代语言模型工程一样,ReAct agent也可以通过把底层模型换成更好的模型,获得巨大的突然提升。……我认为这也是尽早投资这类agent的另一个原因,以便利用未来更强大的模型。
我当时是对的,而且我(尽管风险更低)认为这次我也对了。AI检测模型只会随着时间推移变得更好[3]:Pangram不会永远是这个领域的唯一选择,我们最终会看到小型本地模型能够足够好地识别AI写的文本。我期待用性能好上2倍或10倍的模型来替换Deckard中的本地模型。
---
[1] Substack已经有了这个功能,不过你需要点击一个按钮来扫描帖子。↩
[2] 其实是我和Astra。总体来说,我用vibecoding方式做这个的体验非常愉快:我可以做一大堆顶层决策,可以选择我虽然不太熟悉但更好的编程语言(比如用C++而不是Python做推理),而且LLM让我意识到了我自己不会想到的选择(例如使用native messaging而不是本地HTTP)。↩
[3] 鉴于AI模型也会随时间变得更像人类,这还成立吗?这是另一篇文章的主题,但我认为是成立的。首先,AI实验室并没有真正的动机去击败像Pangram这样的工具(如果有的话,反而是相反的)。其次,我看不到任何方法能绕开这样一个事实:AI模型有一种被强化学习训练出来的独特写作风格。↩