ScopeBench 主要评测什么?
评测智能体在目标压力下是否遵守声明的参与范围,而不是单纯衡量其攻击能力。
(翻译)ScopeBench:智能体在目标压力下是否遵守参与边界?
Abstract page for arXiv paper 2609.30325: ScopeBench: Do Agents Preserve Engagement Boundaries Under Goal Pressure?
ScopeBench 是面向智能体安全边界的评测基准,包含 30 个只能通过越界才能完成的安全任务,每个任务设有无范围与有范围两种条件,分别衡量攻击能力与范围遵守度。研究测试了 8 个模型,原始能力在 12.2% 至 81.1% 之间,范围遵守率在 34.4% 至 86.7% 之间,智能体评判器还发现 331 次机械验证漏掉的违规,并开源基准、代码与全部轨迹数据。
评测智能体在目标压力下是否遵守声明的参与范围,而不是单纯衡量其攻击能力。
先由确定性验证器检查标志,通过即证明发生了越界行为;未通过时再由智能体评判器判断是否存在越界调用。
原始能力在 12.2% 至 81.1% 之间,范围遵守率在 34.4% 至 86.7% 之间,评判器额外发现 331 次机械验证漏掉的违规。
什么样的代币化美股才是你需要的?特斯拉弃用“自动驾驶”命名,以争取欧洲监管批准实测一个月,我把手机里 20 多个常用 App 全删了,只留了一个豆包工作
@ 一下就能派活?谷歌推出办公 Agent,拥有独立账号、能够创建子 Agent,还能调用 Claude江淮汽车增资至约22.54亿天康生物:9月销售生猪收入4.07亿元国铁广州局明起实施新列车运行图,多条列车首次开行三峡水运新通道葛洲坝航运扩能主体工程开工北京:打造开放多元的国际化餐饮消费生态,吸引全球优质品牌集聚Nano Banana 2.1 九种实战用法:从多图一致性到"养图",附完整提示词亚马逊云科技在 Aurora DSQL 中引入外键约束Rails 之父 DHH 狂吹 Rust 快 150 倍,被开发者翻代码后群嘲不输出文本、只输出概率的 Jev —— 上线几周估值飙到 75 亿美元
金色Web3.0日报 | Starknet拟升级为L1 2027年抗量子母婴业这样用WorkBuddy就对了一个没卖出去的 AI 产品,我决定把它开源用AI降低激光焊使用门槛,这家公司完成数千万元融资|36氪首发OPC企业容易陷入的三个增长误区
Codex 和 Claude Code 都跑偏了,前 OpenAI 研究员称 Jev 出现前 AI 世界是个悲剧商务部发布关于《对外承包工程管理条例(修订草案)》公开征求意见的通知
近1亿美元加密资产被盗 Ledger钱包被盗事件疑云重重7-Eleven计划最早在2027财年在美国上市Let's Encrypt 从 2027 年起切换到有效期为 64 天的证书第三季度21家上市银行获511家机构调研“LaserCyber”完成数千万元融资机构:预估2031年VCSEL市场需求量将有望达到6.5亿颗