亚美尼亚语模型六任务得分超所有开放对手,训练token全可追踪
一次发布三样东西
一个团队同时发布了三样东西:两个亚美尼亚语语料库,一个用它们训练出来的模型。
ArmWeb是新闻语料库,437万篇文档、33亿token。它用ODC-BY 1.0开放许可,每篇文档都保留来源。ArmSTEM是英-亚平行的数学和科学题,37.3万对,其中32.4万对带逐步解答。机器翻译后经过盲解验证。
arm-gemma-e4b在谷歌Gemma-4-E4B上继续预训练,训练量100亿token。前两者是数据,第三个是用这些数据训出来的模型。
赢了的和没赢的
arm-gemma-e4b在六任务亚美尼亚语似然套件上得分最高。现有开放亚美尼亚语模型和它自己的未适配基础模型,都被它超过。团队说,这是已知唯一一个开放适配后超过自身基础模型的亚美尼亚语模型。
Belebele阅读理解测试上,模型0.716,基础模型0.619。HyGPT-10b是0.489。
生成式基准ArmBench的准确率风格任务上,模型平均0.62。它压过ArmenianGPT-1.0-3B的0.57。对方做过指令微调,arm-gemma-e4b没有。
它没有赢下全部。m-MMLU-hy上,模型0.337,输给基础模型的0.343。比ArmenianGPT的0.330高。MMLU-Pro-Hy上ArmenianGPT领先(0.281对0.251)。考试数学1.75分,唯一到2.75的是用完整语料库跑的对照。
之前的模型为什么不行
团队把继续预训练中出现的知识遗忘拆开看了。HyGPT-10b用约100亿个未公开的亚美尼亚语token做过继续预训练。同一套测试里,流畅度从0.971涨到0.996。阅读理解从0.660掉到0.489,平均分从0.48掉到0.44。
此前的两个最强模型是HyGPT-10b和ArmenianGPT。在知识任务上,它们都没赢过同场竞技的未适配Gemma-4-E4B基础模型。大规模继续预训练不天然带来知识提升。
遗忘不是数据重复造成的。用完整37.3万项的ArmSTEM做对照,结果与发布模型在置信区间内一致。发布模型只用了11万项子集,每个token被看到7到9次。
遗忘也不只是学习率的问题。只用新闻数据继续预训练,10⁻⁴学习率下阅读理解掉了21点。损伤在训练中期就完成了,挑检查点救不回来。20%的英语回放——抗遗忘的标准做法——每个训练里都有,但没单独止住遗忘。最后管用的是STEM数据加3×10⁻⁵学习率。这个设置下Belebele到0.716,高于基础模型的0.619。
每个token都可追踪
开放性是这个项目的核心。arm-gemma-e4b的每个训练token都有出处。公开数据有ArmWeb、ArmSTEM、FineWeb-Edu、Stack-smol。剩下的靠发布的流水线复现。配方是五个混合权重、一个学习率、一个调度、一个种子,全部公开。
数据质量有量化证据。ArmWeb的基准污染率3.3%,低于CulturaX-hy的7.9%。HPLT-v2-hy是10.9%,FineWeb-2-hy是17.4%。
另一组4.1亿参数的消融里,比的是bits-per-byte(越低越好)。在保留的新闻数据上,ArmWeb比大型爬虫语料库低约10%。ArmWeb和CulturaX合在一起用时,面板均值超过任何单一语料库。
ArmSTEM的翻译过了占位符完整性、语言ID和盲解验证。两位母语者做了独立人工评估:300项里299项有效,两人在每一条上判断一致。验证模型解不出译文时,团队拿英文原文对照重解。原文也失败,条目标成solver_limited,不会当成误译丢掉。这类条目数学里占10.9%,科学里占27.6%。
局限与空白
arm-gemma-e4b是基础模型,没有聊天模板,也没有安全调优。直接拿去用,可能输出有害内容。词性标注在所有继续预训练里都退化,0.18掉到0.01。
还有两个问题没回答。主模型只跑了一个种子,可重复性还不好说。语料以新闻为主,医学、法律领域的表现没有保证。
接下来要做更难的竞赛数学子集,还要做arm-gemma-e4b的指令微调变体。后者针对ArmBench格式敏感任务。
这套流水线大部分环节不挑语言——只需要一个语言ID标签和一张文本规范化表。哪个语言社区有新闻档案、需要知识型数据,这套配方可以直接拿去用。