8B开源模型本地跑赢GPT-5.6:税表三倍,印度日期翻车
我对 Qwen3-VL 8B Instruct(Q4_K_M,Ollama,M5 24GB,约30秒/文档)与 Claude Opus 5.5、Sonnet 5 和 GPT-5.6 Terra 进行了基准测试,测试内容为:
- 收据:CORD(印度尼西亚)和 SROIE(马来西亚),各30份
- 20份扫描的1980-90年代发票,标准答案经人工验证
- 32份真实IRS表格,4种损坏程度(本周生成,因此不在任何人的训练数据中)
- 10份合成印度银行对账单,15份CUAD合同
结果(文档完全正确):
- Opus 89%,
- Sonnet 85%,
- Qwen 8B 59%,
- GPT-5.6 Terra 57%。
Qwen特有发现:
- W-2表格:21/32完全正确,而GPT-5.6 Terra为7/32
- 印度银行对账单:2/10。所有金额和余额正确,但将dd-mm-yyyy读成了mm-dd。
- 合同(长文本):2/15,多数到期日期错误
- Ollama中默认的qwen3-vl:8b标签是思考变体,忽略think:false。在处理长合同时,它把所有4096个token都用于思考,没有返回任何内容。请使用:8b-instruct。
其他我没想到的事:
- GPT-5.6 Terra“纠正”不寻常的拼写(Rachael -> Rachel,Kelleyland -> Kellyland)
- 让模型检查自己的输出几乎没有变化(119/137相同)
- 30份SROIE收据中至少有4份的已发布标准答案有误(例如标准答案是B1750,但收据上印的是81750)
接下来我将微调8B模型以修复日期和拼写失败,无论结果如何都会发布。
提示词、标准答案、评分器测试和所有原始输出:[https://github.com/TashonBraganca/messy-docs-bench0