一个独立测试者筛100个AI项目:技术可复现,商业难证实
我原以为那些炫目的 AI 宣称是最难验证的部分。结果恰恰相反。
我筛选了 100 个 XPRIZE AI 项目,深入考察了 14 个,并使用公开代码、数据、在线产品和官方文档独立测试了其中 5 个。
某个产品报告称,其行为科学效应的复现率为 91.2%。我重新运行了公开的响应数据和评分代码,得到了 91.2%。
但这个数字很大程度上取决于聚合规则:
* 五个模型中任一模型:91.2%
* 最佳单一模型:79.4%
* 汇总响应:73.5%
* 多数模型:67.6%
他们的代码仓库很透明,说明第一条规则是乐观上限。所以有趣之处不在于这个数字是不是假的——它确实不是。问题在于,这个数字究竟意味着什么。
另一家公司声称 AI 会暂停广告支出、每晚重写策略,并撰写产品文案。
其公开代码显示:
* 暂停广告:确定性阈值,无模型调用
* 策略:Claude
* 产品文案:Gemini
所以“AI 在运营业务”这句表述,实际上掩盖了三种截然不同的机制。
我在其他地方也发现了同样的模式。一个法律翻译产品正确引用了 WMT25 基准:87 份文档、332 个片段。但官方数据集包含的是文学、新闻、社交媒体和演讲文本。法律领域的片段:零。
这些发现并没有让原始宣称简单化为“真”或“假”。验证不断变成另一个问题:到底测量了什么?证据支持什么范围?模型实际上在系统的哪个环节介入?
奇怪的是,技术宣称往往可以复现。而我无法独立证实的宣称,是营收、客户数量和用户量这类东西,因为这些记录并不公开。
我把这五个案例写在了这里。
我仍在思考的是:当一个人工智能基准被精确复现时,还需要哪些条件成立,你才会认为其背后的宣称已经得到了独立验证?
―― 高票评论(帖子共 2 条讨论)――
[+2] u/Recent_Rutabaga2310:聚合规则那个东西太疯狂了,同样的数字,但切分方式不同结果完全不同。91 到 67 的差距可不小。
还有那个基准里没有一份法律文档的法律翻译,那一条让我笑了。他们引用得没错,但这对他们的实际用例没有任何证明力。
还需要什么条件成立?大概就是测试设置要符合真实条件。一个基准可以完美复现,但仍然可能在测试错误的东西。