GPS-Bench中的Gold集和Silver集有什么区别?
Gold集由人工根据真实记录标注,用于模型评测;Silver集由另一个LLM从检索证据中标注,仅作为监督信号用于训练,不作为测试标签。
(翻译)GPS-Bench:一个用于自动化政策分析的治理政策基准
Abstract page for arXiv paper 2609.03553: GPS-Bench: A Governance Policy Benchmark for Automating Policy Analysis
论文提出GPS-Bench,一个基于证据的治理政策模拟基准。它利用立法记录、游说披露、监管文件、公司财报等公共证据,将政策与相关行动者、行动和下游影响联系起来,并通过人工标注(Gold)与另一LLM标注(Silver)区分评测与训练数据。研究对比多种推理模式,发现基于真实记录微调的模型在行动者层面预测最强,分解方法虽未提升预测但提供机制解释。
Gold集由人工根据真实记录标注,用于模型评测;Silver集由另一个LLM从检索证据中标注,仅作为监督信号用于训练,不作为测试标签。
在真实治理记录上微调模型在行动者层面的影响预测上表现最强,多智能体分解方法未能在预测精度上超越微调,但可提供机制解释,例如联盟如何形成。
物理 AI 的大结果何时到来?
不止一颗CPU?智能体经济时代,Arm对算力平台有了新理解
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」产品已批量进入全球头部Tier 1产线,「知来具身」要为工业场景打造“开箱即用”的泛化机器人
美联储今起议息 沃什或成关键一票
从担心AI失控 到AI造福人类:比尔盖茨怎么想
我和我的 AI 手机吃了 3 顿饭
百度做了一堆AI产品,却没有一个能代表百度?
「沃什时代」首次加息要来了?华尔街算好了三种剧本
AI攻克世纪数学难题,顶尖数学家抱团抵制,而他们担心的并不是丢了工作9月21日,深圳前海!聊聊工业AI与生态共创的下一步
OpenAI 总裁:AGI 已经发生首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编支付宝 xUI -- “阿宝”背后的 Agentic 终端交互引擎FAST 发现极短周期、最轻双中子星系统
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
金色Web3.0日报 | 黄仁勋批驳「AI末日论」
GPT-6 Astra实现具身智能突破 中国如何打具身防卫战
特朗普“一再让步”:美国加密法案仍未过关
比 MEGA Home 便宜 14 万!理想 i9 Home 上市定价 36.98 万元,六座旗舰变天了
How NVIDIA NVLink 6 Delivers Multi-Layer Resiliency for AI Factories
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
找不到小红书爆文选题?去淘宝差评区抄!
派早报:Steam Frame 开启预购、WPS 多端支持 Markdown 等
做了两年AI落地,我总结了这7点思考
CLARITY法案为何倒在参议院门口?这主流如你所愿
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
超越代币化:让RWA在链上发挥实用价值