论文评估了哪些模型?
论文对开源权重模型 Laya 和托管模型 Jev 两种 System-1 决策模型进行了配对评估。
(翻译)快速模型,缓慢证据:面向 LLM Agent Harnesses 的 System-1 决策模型配对与自审计评估
Abstract page for arXiv paper 2610.02267: Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
这篇 arXiv 论文评估开源 Laya 与托管 Jev 两种 System-1 决策模型在 11 类 LLM Agent 决策点上的表现,涵盖 7283 个基础案例和 6640 个鲁棒性变体。结果显示 Jev 在多数任务更准确,论文还披露了评估流程中的成本、阈值和通道效应等分析偏差。
论文对开源权重模型 Laya 和托管模型 Jev 两种 System-1 决策模型进行了配对评估。
评估包含来自 18 个公开来源的 7283 个基础案例,以及 6640 个鲁棒性变体。
Jev 在 11 个决策点中的 9 个显著更准确;两种模型在零样本模型路由上都未超过随机水平,并在 RAG 相关性门控上打平。
「10.11大暴跌」一周年:加密市场发生了哪些变化?用AI降低激光焊使用门槛,这家公司完成数千万元融资|36氪首发做重大决策前,先让AI唱反调富特科技:股东拟减持不超2.894%公司股份功能是答案,问题是题目:AI 时代,产品经理唯一稀缺的产出
Sui 难民:华语开发者为什么选择离开?Claude 动态多 Agent 工作流开始公测,支持庞大的工作负载深交所:9月28日至10月9日,共对141起证券异常交易行为采取了自律监管措施我让豆包工作看了30个爆款AI封面,它总结出了八个规律三晖电气:股东于文彪及其一致行动人拟减持不超3%公司股份
8600万美元被盗 官方授权也不能保证硬件钱包安全?对话赵长江:智界RX要成为华为的「Pura X」
Codex 和 Claude Code 都跑偏了,前 OpenAI 研究员称 Jev 出现前 AI 世界是个悲剧得中女得天下?这个年销3亿的女装品牌AAAD给出了新答案!A股市场下探回升,机构称市场具备修复性反弹基础
Telegram钱包全面开放 CFTC将事件合约纳入互换定义商务部电子商务司负责人解读《关于实施品质电商“五优”行动的通知》特斯拉在欧洲将 Full Self-Driving 改名为 Tesla Assisted Driving谷歌正在内测新 AI 模型,员工称其编码能力和 Claude Opus 5.5 打平
@ 一下就能派活?谷歌推出办公 Agent,拥有独立账号、能够创建子 Agent,还能调用 Claude内蒙古:全区所有水泥熟料生产线11月起实施共5个月实行错峰生产Nano Banana 2.1 九种实战用法:从多图一致性到"养图",附完整提示词泰国证交所修订卖空和高频交易规则