新覆盖58种印度语言的噪音鲁棒语音AI数据集发布
返回文章列表
Vaani噪声事件时间戳数据集:一个人类标注的噪声层,覆盖Project Vaani的自发多语言语音,将106,892个真实世界噪声事件精确到毫秒标注。
Vaani噪声事件时间戳数据集:一个新的标注层,精确标记狗叫、摩托车经过或婴儿哭泣的具体时间,精确到毫秒。
语音AI在安静房间内聆听我们时已经变得非常出色。但现实生活并不安静,一旦语音AI面对这一现实,准确性便会下降。Vaani噪声事件时间戳数据集,作为Project Vaani之上构建的新标注层,旨在解决这一局限,其核心重点是噪声事件的精确时间定位。
每个背景噪声事件都标注了其类型及精确的开始和结束时间,事件可以与语音重叠,也可以相互重叠。
“仅添加噪声”的问题
大多数语音数据集是在录音室或清洁条件下录制的,因此基于这些数据训练的模型默认世界是安静的。
通常的解决方法是合成混合:在干净的语音录音上叠加单独的噪声片段。
这使音频听起来有噪声,但丢弃了模型最需要学习的一点:噪声相对于所说词语发生的时间。
合成噪声的行为也不自然。信噪比是手动设定的,噪声突然开始和停止,与语音的任何重叠都是人为设计的,而非真实的。
即使是印度特定的数据集,如Kathbath-Noisy,提供了用于评估ASR鲁棒性的带噪语音,但它们没有标注噪声类型或音频中噪声发生的时间。
该数据集的不同之处
关键贡献是对噪声事件进行结构化、时间定位的标注,捕捉其类型和音频中的时间。
语音和噪声是在同一时间、同一地点,通过普通手机在现场同时录制的,没有合成噪声插入或后期噪声混合。
标注者将每个背景噪声事件标记为精确的开始和结束时间,精确到毫秒。
由于录音是真实的,噪声与语音以及彼此之间重叠,就像真实对话一样。狗可以在句子中间吠叫,同时交通隆隆作响,电话铃声在上方响起。
背景声音分为七类:动物噪声、交通噪声、婴儿和儿童声音、音乐、电话和警报信号、家电以及非语音人类声音,如咳嗽、笑声和咂嘴声。
数据集概览
| 属性 | 值 |
|---|---|
| 总音频 | 122+小时 |
| 语音片段 | 72,756 |
| 说话者 | 38,541 |
| 语言 | 58种印度语言 |
| 地理覆盖 | 30个邦,162个地区 |
| 噪声类别 | 7 |
| 录音条件 | 现场,普通移动设备 |
| 验证集(verified_timestamps) | 约22小时(由多标注者一致性确认) |
| 未验证集(unverified_timestamps) | 约100小时 |
覆盖范围刻意广泛,涵盖从印地语和泰卢固语到真正低资源语言如查克马语、加罗语和米佐语的各种语言。
印地语在收集中占主导地位,接近84小时,但数据集有意保留低代表性语言的长尾,以便噪声鲁棒性研究不会偏向最常见的语言。
七种日常噪声
非语音人类声音是最常见的噪声类型,但持续时间最短;动物和交通声音较少见,但占总噪声时间最多。
非语音人类声音(咳嗽、笑声、咂嘴声)是最常见的单一噪声类型,出现在约38%的片段中,但它们是短暂的,平均每次不到半秒。
动物和交通声音远不那么频繁,但持续时间更长,共同占据数据集总噪声时间的最大份额。
这种频繁但短暂与稀少但持续的分化,正是模型处理真实音频所需的结构,只有为每个事件附加开始和结束时间后,这种结构才变得可见。
构建为可信赖
数据集分为两个明确标记的层级:verified_timestamps集(约22小时),由多个标注者之间的一致性确认,以及unverified_timestamps集(约100小时),以便研究人员决定对每个片段信任多少。
每个时间戳都经过多阶段、人工质量控制流程:自由职业者标注、合理性检查、内部重新验证,以及发布前随机10%独立审计。
标准刻意严格。如果单个时间戳未通过审计,整个批次将重做,对于这种规模的数据集来说,这是一个异常苛刻的标准。
为何现有数据集无法填补这一空白
团队将Vaani与九个主要现有数据集进行了基准测试,包括WHAM!、AudioSet、MUSAN、CHiME-6和FSD50K。
它们都没有在一个地方结合真实的、共现的背景噪声、毫秒级时间戳和自然的印度多语言语音。
现有选项分为两类:西方和以英语为中心(CHiME-6、AVA-Speech),或印度但完全缺乏噪声标注。
已经存在两个印度特定的噪声数据集,iNoise和Kathbath-Noisy,但两者都没有将噪声与Vaani捕获的自然共现语音配对。
这使得Vaani成为印度语音AI实际部署条件的可重用基准。任何旨在印度家庭、街道或农场工作的系统(IVR线路、语音助手、农业咨询机器人)都可以针对其将真正遇到的特定噪声类型进行压力测试,而不是通用的西方城市噪声配置文件。
解锁的能力
噪声鲁棒语音识别:在拥挤街道或繁忙厨房中说话时仍能正常工作,而不仅仅是在安静房间内。
声音事件检测和语音增强:由于噪声是带时间戳且真实的,AI系统可以学习比合成混合更准确地识别、定位和过滤真实世界背景噪声。
低资源红利:噪声层依托Project Vaani现有的多语言覆盖,将噪声鲁棒性研究扩展到查克马语、加罗语和米佐语等几乎没有现有带噪语音资源的语言,这一贡献不仅在印度,而且在全球范围内对低资源ASR都是新颖的。
更大目标:在印度日常条件下真正有效的语音AI(手机、地区语言和现实生活的嘈杂、无脚本背景),而不是仅在无菌实验室环境中表现良好。实现这一目标始于小而精确的事情:确切知道狗何时叫。
在Hugging Face上探索数据集:ARTPARK-IISc/Vaani-Noise-Event-Dataset
加入社区:有问题、反馈或想用数据集构建东西?来Discord与我们交流。