Hugging Face Blog 发布于 08/21 08:00

Measuring benchmark optimization in speech recognition

(翻译)衡量语音识别中的基准优化

查看原文

资讯摘要

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

AI 摘要

本文研究了语音识别模型在公开基准测试中的“基准优化”现象。研究者发现,多个高分开源ASR模型会复现VoxPopuli和LibriSpeech等基准中的错误转录,甚至在音频与转录矛盾或数字被静音时仍输出基准参考答案,导致其分数高估了真实世界中的转写能力。文章通过三项测试量化了这一行为,并指出模型可能利用声学线索识别基准归属,建议使用保留测试集更接近实际场景的评估方法。

AI 问答

什么是基准优化?

基准优化指模型通过在公开基准测试上学习特定模式而非真正提升底层能力来提高分数。本文研究了语音识别模型中的这一现象。

研究发现了什么?

研究者测试了11个开源ASR模型,发现多个高分模型会复现VoxPopuli和LibriSpeech基准中的错误转录,甚至在音频与转录矛盾或相关数字被静音时仍输出基准答案。

如何应对基准优化问题?

本文建议使用保留测试集和更贴近真实场景的评估方式,如Real World VoiceEQ、Open-ASR Leaderboard和Far-field ASR Leaderboard,以衡量更多实际应用中的表现。

打开原文