论文主要研究什么问题?
论文研究端侧和资源受限平台上的小型语言模型,其本地存储参数的完整性是否会影响模型安全行为。
(翻译)端侧语言模型安全性有多脆弱?用于稀疏故障分析的安全关键参数定位
Abstract page for arXiv paper 2610.09000: How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis
这篇 arXiv 论文研究小型语言模型在端侧和资源受限环境中的参数完整性安全问题。作者以 LLaMA-2-7B-Chat 为对象,发现安全敏感行为集中在少量参数中,MLP down_proj 尤为关键;仅修改 0.19% 权重即可显著提高攻击成功率,而基准准确率基本保持。
论文研究端侧和资源受限平台上的小型语言模型,其本地存储参数的完整性是否会影响模型安全行为。
摘要称安全敏感性在网络中分布高度不均,MLP down_proj 持续表现为突出的安全敏感组件,o_proj 也有较小贡献。
论文称仅修改 down_proj 中 0.19% 的模型权重,可得到 53% Basic ASR 和 56% GCG ASR,同时 tinyBenchmarks 准确率从 52.2% 基线降至 51.6%。
谁来为 SUI 的“豪门利好”提供真实买盘?代码造世界,扩散绘现实:AgentGarten让智能体在实时试炼场中边玩边进化
Claude Haiku 5.5 降本背后:操作能力暴涨,复杂编程为何仍差一截?
7个月融4亿美刀背后,站着代季峰8人团
世界模型赛道:谁在收编,谁在突围?Sequential Probabilistic Uncertainty Estimation for Parallel Multi-Agent Reasoning Systems
微软携英伟达发布Surface新机 推出“龙虾”个人助手
迁移事故解剖层|事故熵增的归因边界
医疗大模型在院内场景的落地路径与产品化难点The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate
币圈大亨赵长鹏的隐秘生活
新款理想 i6 六项升级公布,旗舰配置下放,要做「全球爆款」!
链上永续合约:设计取舍与增长催化剂的演变真香!做这个邪恶老奶版「GTA 6」,我只花了5元!Learning to Report Unsafe Tasks in a Multi-Agent Game定义了软件工程的计算机科学家 Margaret Hamilton 去世,享年 90 岁
近万天猫品牌进入东南亚,Lazada把细分需求变成增长机会
融到56亿后,干啥?
Grok Bot 玩法 01:生成 AI 早报视频的提示词
金色早报丨GPT-6向所有用户全面上线 BCH跌破300美元
L2关停潮来袭:Blast、Abstract等明星项目为何退场TRAE终于把Code和Work合并了
北醒李远:给机器造眼睛,与「自讨苦吃」的十一年|物理 AI 50人How Could AI Eliminate Humanity? A Failure-Mode Analysis of Civilizational Risk
美股能抵押了:链上借贷的闭环还差几环
黄仁勋发布史上最强 Surface!专为「无限智能」设计
谷歌为何押注RSI?Adaptive Workflow Intelligence: A Cognitive Architecture for Context-Driven Enterprise AutomationAccelerating Floating-Point Satisfiability Solving via Gradient Normalization
币安变“股安” Crypto迎来史无前例变革