arXiv cs.AI 发布于 08/31 12:00

Rating the Raters: Rasch Measurement Theory for LLM Evaluation

(翻译)评价评价者:用于大语言模型评测的Rasch测量理论

查看原文

资讯摘要

Abstract page for arXiv paper 2608.27463: Rating the Raters: Rasch Measurement Theory for LLM Evaluation

AI 摘要

该论文提出将Rasch测量理论(RMT)应用于大语言模型评测,将评分分解为共同尺度上的可分离因素,并提供诊断工具识别评分偏差。在Measuring Hate Speech语料库上,作者对九个LLM作为评分者的多面Rasch模型进行分析,发现LLM与人类评分者在严格程度、条目校准、问题顺序鲁棒性、目标身份敏感性和评分量表使用上存在系统性差异,而这些差异在标准评测中常被掩盖。研究认为RMT应纳入LLM评测工具集。

打开原文

更多资讯

圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会36氪 · 09/15 15:35前OpenAI后训练VP回应陶哲轩:说AI毁了数学,可能还是太小瞧AI了量子位 · 09/15 13:39具透 | 精心优化, 体验感愉悦升华:iOS 27 中值得关注的新特性少数派 · 09/15 15:00OpenAI万亿IPO推迟背后 四本账与三条投资路径金色财经 · 09/16 11:27Denuvo 起诉黑客违反 DMCA 反规避条款Solidot · 09/16 23:27企业案例分享:伊辛智能|36氪2026产业未来大会36氪 · 09/15 16:38从入门到精通,一篇文章带你入门产品经理!(2026 年最新版)人人都是产品经理 · 09/16 08:53OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成RustInfoQ 中文 · 09/16 00:09算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾36氪 · 09/15 17:47我和我的 AI 手机吃了 3 顿饭爱范儿 / APPSO · 09/16 12:04清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单雷峰网 · 09/16 16:05不止一颗CPU?智能体经济时代,Arm对算力平台有了新理解雷峰网 · 09/15 09:58长期利率为何不愿下跌?金色财经 · 09/15 18:04AI不会放缓金色财经 · 09/15 10:3336氪研究院 | 2026年北京市OPC创业者研究报告36氪 · 09/15 16:30云连锁到轻连锁,品牌业务逻辑的改变人人都是产品经理 · 09/16 11:47Steam Frame 起售价 1059 美元Solidot · 09/15 14:59Meta新研究:字节模型蒸馏后,天花板破了量子位 · 09/15 14:37穿透查询怎样升级为穿透管控?人人都是产品经理 · 09/15 14:24全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型量子位 · 09/15 18:41这种国民鱼一直被低估、被当廉价鱼!现在才知道钙和 DHA 这么多!快试试果壳网 · 09/15 22:15英伟达带动AI数据中心大变革,中国厂商不想当边缘人36氪 · 09/16 14:22把记忆交给CPU,大模型会变快量子位 · 09/16 11:07香港第一、全球第八:OSL进化背后的数字资产新格局金色财经 · 09/16 21:42129亿美元卖身英伟达之后,是时候重新理解Hugging Face了InfoQ 中文 · 09/16 16:00前高通算法研发经理跨界AI算力板检测,获近亿元战略投资丨36氪首发36氪 · 09/15 09:30金色Web3.0日报 | 黄仁勋批驳「AI末日论」金色财经 · 09/15 21:48HYROX比赛腹泻这事,运动员拼归拼,但主办方不能装看不见果壳网 · 09/16 23:15无效的管理者和疲惫的基层:浅论考核指标的漂移人人都是产品经理 · 09/16 15:06关于项目交付的思考:部署是最后两公里,验收才是最后一公里人人都是产品经理 · 09/16 09:54