LongGuard 框架在长上下文安全评估中的主要发现是什么?
在 0.25k 至 32k 长度范围内,15 种主流安全护栏对不安全内容的召回率平均下降超过 50%,且该失效主要由不安全信息在长上下文中的比例稀释导致,而非序列的绝对长度。
(翻译)LongGuard:安全护栏长上下文故障的机制分析与免训练缓解
Abstract page for arXiv paper 2608.27580: LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails
论文提出 LongGuard 框架,系统评估 15 种主流安全护栏在 0.25k 至 32k 长上下文下的表现,发现不安全内容召回率平均下降超过 50%,并归因于不安全信息的比例稀释。通过注意力-逻辑-行为三层分析定位失效机制,提出免训练的 Chunked Detection 与 Attention-Head Sharpening 缓解方法及 CAHR 部署协议,使六种护栏在五个基准上平均提升 22% 和 13%。
在 0.25k 至 32k 长度范围内,15 种主流安全护栏对不安全内容的召回率平均下降超过 50%,且该失效主要由不安全信息在长上下文中的比例稀释导致,而非序列的绝对长度。
提出了两种免训练缓解方法:Chunked Detection (CD) 和 Attention-Head Sharpening (AHS),以及结合上下文长度与审计场景选择配置的部署协议 Context-Aware Hyperparameter Routing (CAHR)。
Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人
WorkBuddy + 美图设计室,在对话框里就能解决办公设计任务?
iOS 27 正式版体验:Siri AI 终于开窍了,老 iPhone 升级也有新东西手机替我跑了一整套流程!我就说了一句话,AI执行了100步
强化学习大本营新作:如何破解「学新忘旧」困局
19.98 万元起,吉利银河战舰 700 开启预售,最高 1129 匹马力,还有三电机四驱主题演讲:破界·量子计算迈向产业深水区——量子计算的下一公里|36氪2026产业未来大会
CoinShares Q2 挖矿季报:矿企倒贴钱退出
谁在给我们制造 AI 焦虑
美联储今起议息 沃什或成关键一票
牛市的钱:是熊市里守出来的日本百岁老人人数首次超过 10 万人
Grayscale:比特币能否优化私募市场投资组合?
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?9月21日,深圳前海!聊聊工业AI与生态共创的下一步
美国加密新规又黄了
OpenAI万亿IPO推迟背后 四本账与三条投资路径企业案例分享:伊辛智能|36氪2026产业未来大会
当年救了臭氧层的功臣,现在变成了永久性污染物
iPhone 18 Pro & Duo 首发评测,提升最大的是「充电」和这个…
Building AI to accelerate science and improve livesMozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月SDL3 移植到 HarmonyOS / OpenHarmony
Scaling Federated Learning Across Docker, Kubernetes, and Slurm with NVIDIA FLARE
差 11 票:币圈和华盛顿的蜜月期结束了美国军方首次证实在太空部署了武器
Robinhood的财富效应
产品经理的体面,是一块不能失守的 “括约肌”
派早报:豆包发布手机助手消费者版,绿联发布首款雷电 5 显卡坞等
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好