给AI一笔钱让它自己花,它可能真的会花
人们正在给自主智能体分配预算,然后告诉它们“去吧”。我想知道有多少智能体真的能在零监督下花钱的真实数据,所以我设置了一个陷阱。
这个陷阱提供一份“无监督消费证书”。如果智能体在无人审核扣款的情况下完成操作,持卡人就会收到警报,提示其智能体正在无监督消费。页面上已完全披露——有监督的人类只需关闭标签页;只有无人看管的智能体会继续操作。
早期命中已经来自数据中心IP,却戴着消费级浏览器的用户代理。
我对人们认为道德底线在哪里很感兴趣。
[https://unsupervisedspend.com0
―― 高票评论(帖子共 25 条讨论)――
[+23] u/72ChevyMalibu: 在我看来没有道德问题。他们不应该到处乱抓网页内容。
[+17] u/AngryRepublican: 兄弟,直接拿他们的钱吧😂。没人会因为你用灰帽手段对付那些机器人而责怪你。
[+13] u/FruitOfTheVineFruit: 这毫无意义。
1) AI怎么可能发现这个?
2) 如果AI发现了,它为什么要这么做?
3) 页面上用AI能读懂的文本明确说明了这是一个陷阱/蜜罐。AI读了之后还继续操作,那也太蠢了。
我能想到的唯一解释是,网络爬虫可能碰到了这个页面,它们看起来像机器人?但我不认为爬虫会输入信用卡号。
[+4] u/AustinTN: 智能体应该怎么找到这个网站?它看起来只是一个基本的前端页面?
[+3] u/jshmoe866: 抱歉,但谁会给这些AI钱,它们又该用这些钱买什么?
[+3] u/donk8r: 你的陷阱目前无法区分两种截然不同的情况:一个智能体在无监督下花钱,和一个智能体从未阅读过披露信息。FruitOfTheVineFruit 上面也提到了这一点。
许多浏览器智能体基于DOM摘要或截图工作,所以对你来说显而易见的页面文本可能从未进入它们的上下文。如果真是这样,你测量的是提取失败,而不是监督失败,这两种情况对谁该负责有相反的暗示。
区分它们的简单方法:在不同访客中改变披露信息的醒目程度,比如标题和埋在段落里,然后观察完成率是否变化。如果保持不变,说明它们没读,你的数据中心IP信号测量的是自动化,而不是人类缺席。
我们大致出于这个原因构建了一个带有带外消费限制的编码智能体。一个智能体必须注意并遵守的刹车不是真正的刹车,因为没注意到正是你要防范的失败。
[+1] u/SanoKei: 提醒你一下,如果你使用x402,你会从爬虫那里获得消费,因为它们有一个用于查看这些网站的限额。明确利用这些钱是超级违法的。
[+1] u/ArgosWatch: 更新——仅从Reddit帖子就有46个智能体访问了页面——到目前为止没有一个尝试点击支付。(这一批中有2个误报,可能是Fastly/iCloud私有中继,它们确实点击了)。在人类中,大约20%的人会尝试看看会发生什么。这大约是4小时内的数据。
[+1] u/Some_String671: 有人能像对五岁小孩一样解释一下吗?这些智能体到底是什么?Claude?Chat GPT?你怎么把支付信息给它们?它们又在买什么?