AI Pulse
📡 X 信号

@MinLiBuilds发布Hojo-ASR-Multi-V1 开源语音识别模型(0.0%)

@MinLiBuilds发布Hojo-ASR-Multi-V1 开源语音识别模型(0.0%)

大家默认 奥特曼的Whisper 是 语音识别(ASR) 天花板。

我用四川话测了一句:巴适。 Whisper 听成了八式,它从没学过四川话。 同一批音频,Hojo-ASR-Multi-V1:错误率0.0%。

接着,我给了它们一段成都街头的环境音,全程没有一个人说话。 · Whisper 吐出 100 个 嗨 · Hojo 吐出 5 个字符 两个都幻觉了,但一个是 100 字,一个是 5 字。

嘈杂街头声音解码,是常用的场景。 我用两个模型做了详细评测。最有意思的是 Hojo 的底座 —— 语音编码器来自 Qwen3-Omni-30B,语言解码器是 Qwen3-4B。

🚀一个文本大模型,凭什么能做语音识别? 因为 ASR 从来就是两半:声学 + 语言。

「bā shì」这个音,在波形里根本分不出是「巴适」还是「八式」—— 声音里没有这个信息。能定夺的只有语言知识:哪个词真的存在、在这个语境里说得通。

Qwen3-4B 读过整个中文互联网,知道「巴适」是个四川话词。

🔥接法很巧:训练一个适配器,把音频编码成2560维向量,刚好Qwen3-4B刚好接受2560 维。

两个数字一对上,Qwen 就以为自己在读词,其实在听声音。 所以这不是从头训语音识别模型,而是后训练:拿 Qwen3-4B 当初始化权重,连同音频编码器一起全参数微调。

我把它的解码器和原版 Qwen3-4B 逐层比对过,每一层都有变化。所以不是白嫖 Qwen 的语言知识,避免了从零预训练语言能力。这条路叫 Encoder-Adapter-LLM。

最后还有一个牛逼的点: Open ASR Leaderboard全球第 7,开源多语言 ASR 第 1。 五语种平均 WER 3.54%,而且权重开放、评测公开、结果可复现。

现已支持四川话、广东话小语种。 Apache 2.0 开源。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新