该方法如何决定何时进行干预?
通过行为特定的门控机制判断是否需要介入:幻觉组件抑制无依据的断言,谄媚组件缓解用户压力导致的答案偏移。
(翻译)用于减少医学问答中谄媚与幻觉的门控激活引导
Abstract page for arXiv paper 2608.23666: Gated Activation Steering for Reducing Sycophancy & Hallucination in Medical Question Answering
该研究提出一种门控激活引导方法,在医学问答场景中联合抑制大模型的谄媚行为和幻觉。通过从对比临床样本学习独立引导方向,并在推理时按需介入,使40亿参数模型在压力测试下保持正确立场,效果可媲美千亿参数模型,同时避免对已正确回答的过度干预。
通过行为特定的门控机制判断是否需要介入:幻觉组件抑制无依据的断言,谄媚组件缓解用户压力导致的答案偏移。
在600条压力轨迹测试中,未加引导的40亿参数模型在570例中让步,而门控引导帮助其在551例中坚持立场,表现可与千亿参数模型媲美。