影响效果的声音¶
噪声¶
一般噪声可以分为:参考
- 环境噪声增广: 必须立一个车规级的噪声库。将所有干净的训练语音与以下真实噪声按不同信噪比(SNR,从 -5dB 到 20dB)混合:
- 机械噪声: 空调风扇(1-4档)、雨刮器(慢/快)、车窗升降。引擎(怠速/加速)。
- 行驶噪声: 不同路面(沥青、水泥、石子路)在不同速度(60, 100, 120 km/h)下的胎噪和风噪。过减速带。
- 场景噪声:
- 特殊事件:紧急车辆警笛(救护车、警车、消防车),轮胎急刹声、碰撞声
- 周边车辆鸣笛
- 开启车窗后的城市街道声、隧道内的回响
- 后排儿童哭闹、乘客交谈、咳嗽(使用非目标语言,作为纯背景噪声)
- 天气引入声音:雨声(雨水与周围物体碰撞声、与车身碰撞声)、雷声
干扰¶
回声¶
导航、TTS、媒体播放器、系统提示音
一般导航音、媒体音、助理音回分别作为独立通告给前端算法。
发音¶
对于中国市场,用户的语言习惯呈现出高度多样性。将方言(Dialect,拥有独立词汇和语法体系,如粤语)与口音(Accent,主要体现在发音上的变化,如川普)混为一谈是常见的第一个错误。我们必须采用不同的策略来应对。
调音¶
陷阱:时间戳漂移的“幽灵”
- 症状: AEC 效果时好时坏,多模态融合模型效果不佳,难以复现。深入分析发现,不同传感器(麦克风、摄像头、CAN)的时间戳存在几十毫秒的随机漂移。
陷阱:音频链路中的“静默丢帧”,导致模型性能随机下降。
- 现象:模型性能时好时坏,难以复现。用户抱怨“有时候听得清,有时候听不清”。
- 调试技巧:问题根源很可能不在模型,而在音频输入通路上。如果音频采集线程的实时优先级不够高,在系统高负载时,操作系统可能会抢占其 CPU 时间,导致音频缓冲区溢出,部分音频帧被丢弃。模型收到了不连续的音频流,性能自然下降。
测试场景设定¶
一个总体的平均指标会掩盖系统在特定场景下的短板。必须进行精细化的分桶评测,以发现“性能悬崖”。 优先解决那些“高 WER 且高 TSR 失败率”的 Bad Case。