网易有道发布AI模型
太牛逼了!Hugging Face 这周跑出一匹黑马,还是同时跑赢两个赛道的那种 语音识别 Trending 榜第一,压着 OpenAI 的 whisper-large-v3、NVIDIA 的 Nemotron、阿里的 Qwen3-ASR。翻译 Trending 榜第一,压着腾讯的 Hy-MT2、Cohere、Google、Meta 的 NLLB。
两个第一都是同一家中国公司,网易有道,很多人印象里还是那个做词典的。模型叫 R2T2 和 T3PO,一个听,一个译,全开源。榜单截图我今天截的,还在第一。
一家原本在学习场景出挑的公司,在 HF 上把两个垂类做到第一,这事本身就值得点开看看。但我更想知道它到底强在哪,所以没在 GPU 上跑,把两个都塞进了一台 M1 Pro 的 MacBook,不联网。把我自己以前的口播���真实时间喂进去,中文实时上屏,英文每说完一句就跟出来。
视频里的每个数字都是这台机器上的真实数字。先说我最在意的一件事 同一段我自己的口播,8.6 秒,每 640 毫秒出一次结果。左边 Whisper 走“每次把收到的音频整段重解一遍”的伪流式,13 步里改写了 7 次,屏幕上已经显示的 93 个字被重写过,“见面了”变成“在这边了”又变回来,最后一句停在“全程媒介一找”。
右边 R2T2 是 0 次改写,提交出来的字一个没动过。更有意思的是 8.32 秒那一帧。R2T2 内部其实已经猜出“全程没接”,但它只提交了“全程”两个字,把“没接”压着没放。
0.6 秒后证据够了,提交的是“没截”,对的。它不是猜得慢,它是知道这一刻不该猜。为什么我在意这个。
给人看字幕,闪一下无所谓。但这段文字如果是喂给下一个模型的,比如同传、比如一个要执行动作的 Agent,前面的字一改,下游就得撤销自己刚做的判断。视频第三段就是这条链路,R2T2 每提交完一句,原文直接交给 T3PO,中间没有人工,也不用等整段说完。
因为 R2T2 给出来的字不会再改,T3PO 拿到就能翻,翻出来的英文也不会再改。热词那段也值得看。不给上下文的时候,它把 Codex 写成 codet,Excalidraw 写成 escalator,无限画布写成无线画布。
给一行热词之后三个全对。但我的名字“雨哥”,热词给了,离线模式还是写成“宇哥”,流式那一遍倒是对了。同音人名是最难扳的一类,别指望热词包治百病。
几个要说清楚的地方。一,R2T2 是在 Qwen3-ASR 1.7B 上做的,方法在数据构造和一个叫 Longest Stable Prefix 的训练范式上,技术报告还没出。二,Mac 上跑的是社区 audio.cpp 的移植版,9 月 19 号刚合进主仓库,brew 装的二进制里还没有,得自己编。
这版每一步都重编码整句音频,句子越长越慢,M1 Pro 上 640 毫秒步长能跟上实时,官方 GPU 路线是 160 毫秒。三,ASR 加 14B 同传同挤一块 M1 Pro 的 GPU。我一开始让 T3PO 边听边探测,结果它把 GPU 吃满,识别反而被拖到落后 3 秒。
改成识别优先、每句提交完再交给 T3PO,识别回到实时,英文在每句说完后两三秒整段出来。T3PO 本身支持逐字喂、边听边译,但那需要两张卡,不是一台笔记本能同时伺候的。四,代码 Apache 2.0,权重是网易自己的 Model License,商用前看一眼。
只增不改这条路线 R2T2 不是第一个走的,Nemotron、Voxtral 都在做。它把这条路线的准确率追到了接近伪流式和离线的水平,然后开源了,这是我觉得它值得开源社区接住的原因。过去两年大家盯着中国开源模型的目光都在通用大模型上。
这次是两个垂类,实时语音识别和同传,分别把 OpenAI、NVIDIA、Google、腾讯的模型压在榜下,而且是一家平时不怎么在这个圈子出声的公司做的。垂类这条路,中国公司是真能跑到第一的!两个模型都开源了,代码和权重在这: R2T2 语音识别 GitHub: Hugging Face: T3PO 同传 GitHub: Hugging Face: