AI Pulse
📄 论文解读

AI听懂了你的方言,但只限于这几种

AI语音识别对英语、中文等大语种已经够用,但对哈萨克语、吉尔吉斯语、乌兹别克语这些中亚语言,数据少得可怜,模型几乎听不懂。这篇论文做了一个专门针对这些语言的语音基础模型GigaAM Multilingual,用200万小时音频预训练,关键是在训练时故意平衡不同语言的数据量,不让大语种吃掉小语种。结果在目标语言上,它比Whisper Large v3等通用模型表现更好,尤其对口语化、不规范的语音识别提升明显。它不是你明天能用上的,但如果你在做小语种语音产品、或者想给自家方言做个语音助手,这个思路——用数据平衡和领域采样来对抗数据稀缺——是当前最靠谱的路径。

📄 原文摘要(英文)

Despite recent scaling successes, multilingual ASR performance remains highly uneven, with long-tail languages suffering from severe data scarcity. This work addresses the challenge of building robust foundation models for underrepresented Central Asian languages (Kazakh, Kyrgyz, Uzbek). We present GigaAM Multilingual, a Conformer encoder pre-trained on 2M hours of audio using a HuBERT-style objective. Crucially, we introduce a cluster-level data balancing strategy during pre-training and a domain-aware sampling method during fine-tuning to mitigate head-language dominance. In controlled comparisons, our approach outperforms strong open pretrained encoders (Whisper Large v3, Omnilingual-1B) on target languages, achieving significant gains on spontaneous speech while maintaining efficiency. We release the foundation encoder and ASR model, offering a proven recipe for effective multilingual adaptation under realistic data imbalance.

arXiv 原文

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部