AI Pulse

只因询问基准测试遭删帖封号——DavidAU 390模型全面分析

只因询问基准测试遭删帖封号——DavidAU 390模型全面分析

我在 Qwen3.6-27B-Fable-Fusion-711 模型页面发了一条讨论帖,要求提供现代基准测试成绩(SWE-bench、Terminal-Bench、GPQA、LiveCodeBench)。DavidAU 没有回复。他没有关闭讨论。他直接删除了它,然后把我屏蔽,使我无法与他任何仓库互动(“you're not enabled to interact with this user”)。

所以现在我把这篇发在这里。如果这篇也被删了,社区会看清这个模式。

发生了什么

我在 DavidAU/Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF 上发帖,询问 SWE-bench Verified、Terminal-Bench 2.0、GPQA Diamond、LiveCodeBench、AIME 和 HMMT 的成绩

- DavidAU 删除了帖子——不是关闭,是删除
- 然后他把我从他所有仓库中屏蔽了
- 我再也无法在他 390+ 个模型仓库上发帖、评论或进行任何互动

同一个人还做过:

- 在用户 KottCh 报告模型无法完成基础编程任务(费马分解)后,关闭了 9B 模型上的讨论 #10——第二天就关闭,没有任何回应
- 无视 FreeGoldRush 在 27B 模型讨论 #1 中直接索要 SWE-bench Verified 成绩的请求
- 置顶正面讨论(讨论 #11:“完美的工具调用”),同时删除批评性讨论
- 被要求提供真实基准测试结果时,用“信我,兄弟,这是最好的”来回应批评

模式很清楚:关闭、无视、删除、封禁。模型失败——关闭讨论。有人询问现代基准测试——无视。有人发布批评分析——删除并封禁用户。

被分析的两个模型

Model 1: Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF

- 每月 419,415 次下载
- 声称:“ABSOLUTE FIRE:8bit 和 4bit 都是 640 ARC-C”
- 声称:“小身材里的极端智能。令人瞠目的性能。”
- 声称:“模型在 7 个基准测试中全部超越 Qwen 3.5 9B、Qwen3.5 27B、Qwen3.6 35B-A3B”

Model 2: Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF

- 160 万+ 次下载,GGUF 每月 25,000+,1,500+ 点赞
- 声称:“首个超过 700 ‘arc-c’ 的微调模型(OpenAI、Claude 和 Gemini 的“智能地带”)”
- 声称:“700 “智能俱乐部”是 OpenAI、Claude 和 Gemini 闭源模型专属”
- 声称:“这就是他们惧怕的那个”

两个模型使用完全相同的 7 个基准测试。两者都基于这 7 个基准测试做出非凡的智能宣称。两者都没有在任何一个现代基准测试上被测过。

这 7 个基准测试——永远相同,永远饱和

DavidAU 目录中的每一个模型——全部 390+ 个——都用同样的 7 个基准测试:

基准测试年份衡量内容状态
ARC-C2018基础科学选择题已饱和
ARC-E2018基础科学(简单)已饱和
BOOLQ2019是/否阅读理解已饱和
HellaSwag2019句子补全已饱和
OpenBookQA2018事实知识已饱和
PIQA2019物理常识已饱和
Winogrande2019代词消解已饱和

全部来自 2018-2019 年。全部是为 BERT/GPT-2 时代设计的。如今小至 3B 参数的模型在 ARC-C 上都能拿到 55%+。这些基准测试区分不出一个像样的模型和一个真正智能的模型。

9B 基准测试

ARC-CARC-EBOOLQHellaSwagOBQAPIQAWinogrande
该模型0.6490.8320.8950.7130.4820.7830.699 (bf16)
Qwen 3.5 9B0.5710.7190.8950.6830.4260.7700.671 (mxfp8)
Qwen 3.5 27B0.5570.7110.8680.5330.4520.7060.695
Qwen 3.6 27B0.6470.8030.9100.7730.4500.8060.742
Qwen 3.6 35B0.5810.7570.8920.7510.4280.8030.688

27B 基准测试

ARC-CARC-EBOOLQHellaSwagOBQAPIQAWinogrande
Fusion-7110.7110.8790.9100.7900.5140.8230.763
Qwen 3.60.6470.8030.9100.7730.4500.8060.742

BOOLQ 在两个模型上完全相同(9B 上 0.895 = 0.895,27B 上 0.910 = 0.910)。零提升。
27B 模型名称中的“711”= ARC-C 0.711。基础 Qwen 3.6 27B 得分为 0.647。所以整个“智能地带”的说法,完全建立在一个饱和基准测试上 6.4% 的提升之上。
在 40B 扩展版(Qwen3.6-40B-Grand-Intelligence-Six-711-717-raw)上,ARC-C 从 0.711 掉到 0.695。40B 在据称定义“智能”的那唯一一个基准测试上更差。而模型卡仍然声称它达到“OpenAI、Claude 和 Gemini”的水平。

让 ARC-C 说法失效的研究

Snowflake AI Research 2024 年的一篇论文(Borchmann,arXiv:2412.17758——“In Case You Missed It: ARC ‘Challenge’ Is Not That Challenging”)直接证明,ARC-C 表面上的难度是评估设置造成的假象,而非问题本身的复杂度:

- 当 Llama 3.1 70B 在显示所有答案选项(人类考试的方式)的情况下评估时,ARC-C 准确率从 64% 跳到 93%——仅改变格式就产生 29 个百分点的波动
- 31% 的 ARC-C 问题“单独几乎无法回答”——它们需要比较选项才能作答,却在看不到所有选项的情况下被评估
- OpenBookQA 在正确评估下从 48% 升到 89%——意味着它基本上已经“被解决”,任何分数差异都只是评估假象
- 作者的结论:“之前感知到的难度主要是评估方法的假象,而非任务本身的复杂度”

所以 ARC-C 从来不是什么“智能壁垒”。它是一个格式问题。“700 俱乐部”不是什么独家前沿模型地带——它是一个数字,取决于你如何设置评估框架,可以移动 29 个点。
OpenAI、Claude 和 Gemini 不在 ARC-C 上竞争。他们不报告它。他们不围绕它做营销。他们在 SWE-bench Verified、Terminal-Bench 2.0、GPQA Diamond、LiveCodeBench、AIME 和 HMMT 上竞争。

基础模型实际报告的成绩(而 DavidAU 从不测试)

Qwen 3.5 9B 官方基准测试(嵌在 DavidAU 自己的模型卡里,但从未在他的微调模型上测过)

基准测试Qwen 3.5 9B衡量内容
MMLU-Pro82.5高级学术知识(比 MMLU 难 10 倍)
GPQA Diamond81.7博士级科学问题
SuperGPQA58.2专家级问题
LiveCodeBench v665.6实时竞技编程
BFCL-V466.1函数调用/工具使用
TAU2-Bench79.1Agent 基准测试
HMMT Feb 2583.2哈佛-麻省理工数学锦标赛
IFEval91.5指令跟随
DeepPlanning18.0深度规划
OSWorld-Verified41.8操作系统 Agent 基准测试
AndroidWorld57.8Android Agent 基准测试

Qwen 3.6 27B 官方基准测试(27B 微调模型的基础模型)

基准测试Qwen 3.6 27B衡量内容
SWE-bench Verified77.2真实 GitHub 问题解决
SWE-bench Pro53.5更难的编程 Agent 基准测试
Terminal-Bench 2.059.3Agent 终端性能
GPQA Diamond87.8博士级科学问题
MMLU-Pro86.2高级学术知识
LiveCodeBench v683.9实时竞技编程
AIME2694.1数学奥林匹克
HMMT Feb 2684.3哈佛-麻省理工数学锦标赛
SuperGPQA66.0专家级问题

讽刺之处在于:Qwen 3.5 9B 官方模型卡被原封不动地复制粘贴在 DavidAU 的 README 里——展示了 Qwen 报告的所有 25+ 个现代基准测试。他把显示基础模型在 SWE-bench、GPQA、LiveCodeBench、BFCL、TAU2-Bench 上能做什么的模型卡放了进去——然后他的微调模型一个都不测。

被关闭/删除/无视的讨论

9B 模型上的讨论 #10——已关闭

用户 KottCh 用两个优化版本测试了费马分解:

“测试带优化的费马分解。没有做优化,结果不正确”
“思考模式用于精确编码任务,temperature=0.6 也没有成功”

模型在一个直接的编程任务上失败了。DavidAU 第二天就关闭了讨论。没有回应,没有调查。

27B GGUF 模型上的讨论 #1——被无视

用户 FreeGoldRush 问:“q8 和 q4 的 SWE-bench Verified 分数是多少?”
DavidAU 在同一帖子里回应了其他问题,却完全无视了 SWE-bench 的请求。
社区回应:

darkmatter2222:“OK,然后呢?证明它!”
Hunterx:“问:“能分享真实基准测试结果吗?” 答:“信我,兄弟,这是最好的。””

27B 模型上的讨论 #11——被置顶(正面)但有负面报告

一位用户报告了出色的 Agent 性能。但另一位回应:“我在 Hermes 里用这个模型一直遇到工具调用循环的问题。”

GPT-OSS 20B 上的讨论 #7——乱码输出

用户 YardWeasel 报告,询问“Who was George Washington?”产生了乱码、元讨论,以及模型重写自己的输出。DavidAU 的回应:“Q8 是“填充”的;会降低性能。”——意思是最高标准的量化版本在他的模型上反而性能下降。
用户 yingjiegao 报告 120B 模型“20% 的时间在吐乱码”。

GLM-4.7-Flash 上的讨论 #4——标题为“我见过最差的微调之一,恭喜!”

我在 27B 模型上的帖子——已删除,用户被封禁

我发帖询问现代基准测试。DavidAU 删除了它,并把我从他所有仓库中屏蔽了。
模式:关闭、无视、删除、封禁。

GGUF 质量状况

未经验证的自定义量化方法

DavidAU 使用 llama.cpp 标准中不存在的自定义方法:

- “NEO IMATRIX”——自定义 imatrix,没有公布的校准数据,没有困惑度测量,没有与标准 imatrix 的对比
- “DI-MATRIX”——“2 个 imatrix 数据集的平均值”——哪些数据集?什么校准文本?多少个块?
- “TRI-MATRIX”——“3 个 imatrix 数据集的平均值”——同样的问题
- 输出张量修改——所有量化级别都是“全精度 - 16 位”,没有解释对困惑度的影响
- MTP(多 token 预测)GGUF——MTP 张量设为 Q8_0,没有质量影响文档

模型卡声称 NEO IMATRIX“使量化精度比普通 GGUF 额外提高 2-4%”。2-4% 的提升是一个重大宣称,却零证据。

旧版量化

关于 llama.cpp 量化的研究很清楚:

- Q4_0 的困惑度误差大约是 Q4_K_M 的 5 倍,而文件大小几乎相同
- 旧版量化(Q4_0、Q4_1、Q5_0、Q5_1)使用均匀标量量化——劣于 K-quants
- 没有针对模型的合适 imatrix 的 IQ 量化,通常比同等 K-quant 更差
- 双量化“可能严重降低质量”——llama.cpp 默认拒绝这样做

DavidAU 经常使用旧版量化(Q5_1、Q4_1)而不是 K-quants(Q5_K_M、Q4_K_M),没有任何解释。

Flash Attention 问题

在 GLM-4.7-Flash 模型上,DavidAU 自己的模型卡注明:“此提交之前的量化(以及 Imatrix 生成)表现不佳。”以及“在此问题解决前禁用 Flash Attn。”

问题的规模

DavidAU 在 Hugging Face 上有 5 个收藏集:

- 主收藏:284 个模型
- Dark/evil/corrupt:135 个模型
- Heretic uncensored:130 个模型
- 0.8B 到 87B:65 个模型
- Qwen 3.6 微调:17 个模型

总计:约 390+ 个独立模型仓库。这些模型的合计下载量达数百万。
390+ 个模型。同样的 7 个饱和基准测试。每一次。都是。
而现在,当有人询问现代基准测试时,回应是删除帖子并封禁用户。

展示问题

模型名称

Qwen3.5-9B-The-Defiant-Fable-Uncensored-Heretic-NEO-IMATRIX-MAX-MTP-GGUF——80 个字符。对比 Qwen/Qwen3.5-9B——简洁、可辨识。
Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-NEO-MAX-MTP-GGUF——68 个字符。对比 Qwen/Qwen3.6-27B——简洁、可辨识。

README 内容

9B 的 README 有 145 KB。大多数模型卡只有 2-10 KB。这一份包含:

- 营销话术(“ABSOLUTE FIRE”、“令人瞠目的性能”、“极端智能”)
- 整份 Qwen 3.5 9B 官方模型卡被复制粘贴(数千字)
- 4 个完整的示例生成(一篇约 2000 字的冷却散文、一篇约 2000 字带露骨血腥的恐怖故事、一篇约 1000 字带脏话的自我推销稿、一集约 2000 字的 Black Mirror 剧集)
- 一个随机 GIF(neo-dodge.gif,4.22 MB)

27B 的 README 开头写道:

“有史以来为消费级硬件打造的最强、最聪明的开源多阶段模型微调,并且通过 Unsloth 在消费级硬件上构建。”

后面还有:“这就是他们惧怕的那个。”
对比 Qwen 3.6 27B 官方模型卡:结构化章节、25+ 张基准测试表、评估方法脚注(SWE-bench 设置、Terminal-Bench 框架、temperature、top_p、上下文窗口、运行次数)、架构规格、可复现的快速入门代码、BibTeX 引用。天壤之别。

可复现性

两个模型卡都零可复现性。没有评估脚本。没有提示词。没有框架配置。没有 few-shot 设置。没有 temperature。没有采样参数。只有一张来自“Nightmedia”的柱状图,没有任何方法论。Qwen 3.6 的模型卡准确告诉你每个基准测试是怎么跑的。这些模型卡让你相信一张柱状图。

微调可以提升旧版基准测试,同时损害真实能力

这是有充分文献记录的。微调不是免费的。当你训练一个模型在特定基准测试上表现更好时,你很容易损害它在其他任务上的表现——尤其是 Agent 类任务。
9B 的模型卡甚至写着“ZERO ‘benchmaxing’(这会损害模型)”——但随后只报告了微调有所提升的那 7 个饱和基准测试。我们对此微调模型是否保持以下能力一无所知:

- 保持基础模型的 66.1 BFCL-V4 分数(函数调用)
- 保持 79.1 TAU2-Bench 分数(Agent 基准测试)
- 保持 65.6 LiveCodeBench v6 分数(竞技编程)
- 保持 81.7 GPQA Diamond 分数(博士级推理)
- 保持 91.5 IFEval 分数(指令跟随)
- 是否还能无循环地调用工具(27B 模型上有用户报告“工具调用循环”)
- 是否还能导航操作系统环境(OSWorld: 41.8, AndroidWorld: 57.8)

“人工测试”的说法——“最终测试是人工测试。一种信任但要验证的方法”——不能替代标准化基准测试。没有方法论、没有记录的提示词、没有可复现性、没有公布结果的“人工测试”只是轶事。

我的要求

1. 运行现代基准测试。SWE-bench Verified、Terminal-Bench 2.0、GPQA Diamond、MMLU-Pro、LiveCodeBench v6、AIME26、HMMT Feb 26、SuperGPQA、BFCL-V4、TAU2-Bench。如果这些模型真的处于“OpenAI、Claude 和 Gemini 的智能地带”,在这些基准测试上证明它应该是轻而易举的。
2. 公布评估细节。哪个框架、什么提示词、什么 few-shot 配置、什么 temperature、什么采样参数、什么上下文窗口、平均多少次运行。Qwen 团队公布了全部这些。SGLang、vLLM、KTransformers——全都有文档。这些模型卡完全没有。
3. 展示 GGUFs 的困惑度数字。用 llama-perplexity 把每个量化与 F16 基线对比。对比 NEO IMATRIX 与标准 imatrix。对比 Bartowski 或 mradermacher 的量化。如果自定义方法确实提升了质量,困惑度数字会证明。
4. 解释旧版量化的选择。为什么 Q5_1 和 Q4_1 而不是 Q5_K_M 和 Q4_K_M?K-quants 在相似文件大小下明显更优,这是有充分记录的。
5. 停止删除和封禁提问的用户。我发帖询问现代基准测试。帖子被删除,我被封禁。显示模型编码失败的讨论 #10 被关闭。FreeGoldRush 的 SWE-bench 请求被无视。这不是开源社区的运作方式。

底线

我不是说这些模型不好。我真的不知道——而这正是问题所在。唯一提供的证据是一组 2018 年的基准测试,研究已经表明它们是不可靠的区分工具,配上营销语言(“这就是他们惧怕的那个”、“ABSOLUTE FIRE”),零现代基准测试覆盖、零可复现性、零 GGUF 质量验证。
而当有人询问现代基准测试时,回应是删除帖子并封禁用户。
如果这些模型真如宣称的那样好,在 SWE-bench、Terminal-Bench 和 GPQA 上证明应该很容易。如果不是,社区同样有权知道——在又一百万人基于 2018 年的科学测验分数下载一个模型之前。
给我们看 SWE-bench 分数。给我们看 Terminal-Bench 分数。给我们看 GPQA Diamond 分数。
如果这些说法经得起检验,我会第一个庆祝。但我需要数字,而不是口号。我需要不被封禁地提问的权利。

如果这篇帖子也被删除,那将是最诚实的回应——不是用言语,而是用行动。

阅读原文
📚 相关主题 大语言模型开源AI评测

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新