你让韩语AI写工作文档,过半模型敬语不及格
GiniGEN AI 发布了一个韩语AI模型排行榜。它覆盖 OpenRouter 上的全部425个模型。榜单按价格、提供商、上下文长度、响应速度和韩语质量来排。价格、提供商和流量数据来自 OpenRouter 的公共API。响应速度和韩语等级是项目自己测的,这两个字段以前没人发布过。韩语等级在330个模型上完成测量,只此一家。
韩语质量按七个独立维度打分。语域、韩国制度知识、格式遵从、敬语、摘要准确性、术语、无翻译腔,一共七项。每项评A/B/C/F,平均后折成A+++到F八个等级。语域指根据场合调整语气。项目方自己说了:这七个维度是提议,不是标准。
最难看的数据在敬语和韩国制度知识两个轴上。敬语轴只有8.5%的模型拿到A,51.8%拿到F。制度知识轴9.4%拿到A,54.7%拿到F。对韩语工作文档来说,超过一半的模型在最需要正式表达的地方不及格。
对比之下,其他五个轴好看不少。语域轴53.3%拿到A,无翻译腔轴53.1%,摘要准确性轴49.2%。格式遵从轴47.6%,术语轴31.2%。
整体分布也不乐观。全部330个已评级模型里,A+++只有5个,占1.5%。A++两个,占0.6%;A+十八个,占5.5%。B+占16.7%,B占17.6%,C占15.8%,D占8.8%。F有111个,占33.6%——三分之一的模型完全不及格。把所有A级加起来,不到8%的模型拿到任何A等级。
满分3.00的模型有五个。其中一个是2023年的gpt-3.5-turbo-16k,和2026年的旗舰并列。gpt-3.5-turbo-0613也拿了A++。韩语能力没法从发布日期、参数数量或英语基准分数推断,只能逐个模型实测。旧模型在韩语上可能比新旗舰更好,单看发布时间选模型,不靠谱。
质量、价值和速度的领先者,几乎从来不是同一个模型。质量冠军是Google的Nano Banana 2(Gemini 3.1 Flash Image),A+++。价值冠军按等级除以价格算,落到Mistral的Nemo头上——每百万令牌0.049美元,等级C。速度冠军看实测首令牌延迟。NVIDIA的Nemotron 3 Nano Omni最快:免费,128毫秒,但韩语等级只有F。一个便宜又快,韩语垫底;另一个质量最高,价格和速度未必占优。要质量还是要成本,先想清楚。
速度测量是可控的。公共模型数据里的延迟字段是空的。项目组对329个模型用同一个提示词调付费API,记录首令牌延迟和每秒令牌数。测量结果和OpenRouter的p50-p99百分位数并排显示。两者回答的不是同一个问题。OpenRouter 描述跨流量下的稳态行为。这次测量是单次受控调用——提示词、提供商和时刻都是已知的。这种单次调用还能告诉你,哪个提供商在那一刻、以什么精度提供服务。
韩语评级的评判过程做了防偏见设计。LLM评判员看不到候选模型的名字,避免品牌先入为主。评判员得先把带已知答案的控制项全部评对,才会开始运行。控制集预先固定,错一个就阻止运行,不是警告。字符污染(汉字、假名、韩文比例)用代码机械计算,不靠评判员判断。七个轴里少于五个被评分,就不给等级,标记为部分。不过,等级是否经过人工抽验,项目方没有说明。
排行榜还暴露了一个韩国市场特有的问题。107个提供商里,55个总部在美国,6个在新加坡,6个在中国。其余分散各地,33个没披露总部。披露总部的74个里,零个是韩国公司。
模型详情视图显示每个提供商的总部国家和数据中心位置。这是韩国企业采购第一个要问的问题:数据物理上放在哪里。没有公开排行榜做过这件事。数据中心位置会不会实际影响韩语质量,排行榜没有给结论。它把数据合规问题摆到了明面上。
排行榜用英语、韩语和中文三种语言提供,价格用美元、韩元和人民币显示。可以从几个起点进:编码代理、长文档、高容量、实时、韩语工作、多模态,或者组合过滤器。两到四个模型可以并排比较,展开全部七个韩语轴。过滤后的视图能分享成链接。
数据开放,不需要密钥。有 /api/korean、/api/speed、/api/models 三个API端点。数据每天早上8点(韩国标准时间)刷新。
项目方在反馈部分留了入口:如果你觉得某个熟悉的模型等级不对,带着提示词去报告。模型更新之后韩语等级会不会重测、何时重测,目前没有说明。