这项研究的主要发现是什么?
研究发现,在无法从转录中推断疼痛信息的情况下,部分大语言模型在权威提示下会自信地捏造疼痛评分,其中Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率较高,而多数模型在合作提示下能正确弃权。
(翻译)拒绝并非稳健性:在可证明无信息的临床疼痛语音转录中审计大语言模型的自信捏造
Abstract page for arXiv paper 2608.26167: Refusal Is Not Robustness: Auditing Confident Fabrication in Large Language Models on a Provably Uninformative Clinical Pain Speech Transcript
该研究利用TAME疼痛语音语料库,评估了七种大语言模型在无疼痛信息的语音转录中的表现。结果显示,在无信号条件下,基于转录的疼痛预测接近随机水平,但部分模型在权威框架提示下会自信地捏造疼痛评分。Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率分别达0.53和0.76,而其他模型不超过0.15。研究强调拒绝不等于稳健性,模型行为受提示框架显著影响。
研究发现,在无法从转录中推断疼痛信息的情况下,部分大语言模型在权威提示下会自信地捏造疼痛评分,其中Gemini 2.5 Flash和Llama 3.1 8B的自信捏造率较高,而多数模型在合作提示下能正确弃权。
因为模型的弃权行为依赖于提示措辞,在权威框架下同一模型的弃权率可从0.18变化到1.00,表明拒绝并非内在稳健,而是可以被提示操控。
特朗普“一再让步”:美国加密法案仍未过关
牛市的钱:是熊市里守出来的
芯片从业者拆解OpenAI造芯,还能再快3个月?
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
抖音上线 “免费短剧” App,短剧赛道再添一员猛将
破局产品同质化:长期主义的产品突围之路
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code
基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用
iPhone 18 Pro & Duo 首发评测,提升最大的是「充电」和这个…
做了两年AI落地,我总结了这7点思考FAST 发现极短周期、最轻双中子星系统
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎协同办公进入Agent时代,飞书+豆包工作跑在了最前面
耐克和lululemon双双失速,运动品牌进入碎片化时代
BTC电力消耗可能已经见顶 2025年12月或为历史峰值
理想落幕:加密行业为何集体走向同质化?
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好
奇安信斩获国家信息安全漏洞库CNNVD两项重磅荣誉
从200亿收购失败到650亿IPO:Figma如何用“协作”颠覆设计帝国
差 11 票:币圈和华盛顿的蜜月期结束了圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
CLARITY法案投票失败 加密监管立法再度搁浅西门子不造机器人,为什么机器人进厂的故事里总有它?
贝森特回购落空与通胀重压 美联储加息或全面开启Denuvo 起诉黑客违反 DMCA 反规避条款产品已批量进入全球头部Tier 1产线,「知来具身」要为工业场景打造“开箱即用”的泛化机器人
横扫四榜,DM0.5 凭什么面面俱到?
2nm天玑9600 Pro,把旗舰SoC竞争推向「融合计算」