音频大模型能判断自己的转录是否可靠吗?
论文发现模型的自我判断能力较差,多数情况下会预测自己的转录是可靠的,因此无法有效发现转录失败。
(翻译)音频大模型知道自身何时听不清
Abstract page for arXiv paper 2609.30625: Audio LLMs Know When They Can't Hear You
该论文研究音频大模型能否判断自身转录是否可靠。实验发现模型对自身转录可靠性的判断较差,多数情况下会误判为可靠;语音质量预测器、生成不确定性、基于转录的WER估计等现有方法信号有限,而可靠性信息明显存在于音频编码器表示中。作者据此设计轻量预测器,在生成前判断可靠性并对不可靠语音触发澄清请求,域内与跨域宏F1分别为81.10%和78.09%,优于最强基线10.33和11.93个百分点,且可靠性标签可跨模型家族迁移。
论文发现模型的自我判断能力较差,多数情况下会预测自己的转录是可靠的,因此无法有效发现转录失败。
利用冻结音频编码器的表示训练一个轻量可靠性预测器,在生成文本前预测可靠性等级;若判定不可靠就向用户发起澄清请求,可靠则正常处理,无需修改原音频大模型。
域内宏F1为81.10%,跨域为78.09%,分别比最强基线高出10.33和11.93个百分点,且可靠性标签可在不同音频大模型家族之间迁移。
OpenAI dots全面登陆手机 开口指挥Codex干活了
从 Demo 到生产:AI Agent 缺的到底是什么?阶跃 Step 5 Preview 登上 OpenRouter 全球第一,10月15日开源!
硬件钱包接连出事 审计得交给AI干了原 TRAE 负责人石扬离职创业,联手前字节数据安全负责人傅越做 AI 办公,首轮估值 2 亿美元一篇把锅从模型甩回公司手里的短文 —— 「计算机无法做出决定」未经批准含有“金融控股”等字样 三家企业被要求整改
同样是珍珠,为啥价格能差10倍?微信聊天记录终于能正经交给 AI 了,官方开的口子不怕封号
金色Web3.0日报 | Starknet拟升级为L1 2027年抗量子客户说要一个功能,产品经理怎么找到真正的需求在那?英国拟未来四年投,10亿英镑扶持创新集群App工厂,才是AI时代最被低估的生意中国人民银行行长潘功胜会见法国总统外事顾问博纳纯炒作?那为什么只有 Muse 爆了商务部欧洲司负责人解读中欧贸易投资磋商机制第二次例会成果梅赛德斯-奔驰美国公司召回30064辆汽车受内存、存储芯片短缺推高价格,游戏硬件销量跌至13年新低教育部:教师发展中心全新上线,教师AI素养全覆盖培训启动泰国证交所修订卖空和高频交易规则AI数据中心用电狂飙,美国密西西比州发出电力预警北京市“十五五”时期深化国际消费中心城市建设规划发布
24 天估值暴涨 37 倍,这就是 AI 圈年度爽文中欧贸易投资磋商机制第二次例会联合声明葛洲坝航运扩能工程进入主体施工阶段智能咖啡机 10 天内产生 1TB 数据流量苹果iPhone Duo加单30%,iPhone 18 Pro系列总订单量未变ModStartCMS v10.3.0 安全加固、体验优化,自动化测试更强大。