该研究使用了哪些大语言模型?
该研究使用了GPT-4.1和GPT-5.0两个大语言模型。
(翻译)利用大型语言模型进行疾病传播模型的系统性文献综述
Abstract page for arXiv paper 2608.26150: Leveraging Large Language Models for Systematic Literature Review of Disease Spread Models
该研究利用GPT-4.1和GPT-5.0等大语言模型构建自动化流水线,从536篇同行评审的基于代理建模论文中提取模型相关信息,并与人工系统性文献综述结果对比。结果显示,论文级准确率分别约为77.95%和81.67%,但字段级准确率差异大,复杂或主观字段表现不稳定。研究还发现,大语言模型间的一致性是输出质量的潜在指标,低一致性可能提示幻觉,高一致性但低准确率可能反映人工数据集的噪声或错误。
该研究使用了GPT-4.1和GPT-5.0两个大语言模型。
论文级准确率分别约为77.95%和81.67%,字段级准确率范围为32.40%至100%,复杂或主观字段可靠性较低;LLM间一致性可作为质量指标,低一致性可能提示幻觉,高一致性低准确率可能反映人工数据集噪声。
用于系统性文献综述,从536篇基于代理建模论文中提取模型相关信息,以评估大语言模型在自动化文献综述中的潜力与局限。
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code
我的“一人公司”,是怎么搞钱的?
被用了几千年的铜,怎么突然成了AI时代的新宠?
推特创始人谈“AI减速”论:前沿不属于任何一家公司36氪项目新势榜:不看包装,只看项目真实进展高通技术公司携手中兴努比亚和豆包手机助手,共同推动智能手机迈入个人AI新时代
就业率砍半,年轻人靠什么翻盘?AI时代,这三点越早做越好
黄仁勋再谈AI危险论:中国会成为全球开源重要力量
今晚「鸽派加息」?
AI 写了几十页 PPT,“经营分析”报告仍被批不够深入?
从200亿收购失败到650亿IPO:Figma如何用“协作”颠覆设计帝国
差 11 票:币圈和华盛顿的蜜月期结束了
具透 | Liquid Glass 设计改进、性能提升……iPadOS 27 中值得一瞥的新特性
OpenAI故意欠技术债,等Codex来还:仅2名工程师,把核心存储从Python重写成Rust量子位2026人工智能年度榜单,正式启动!
华为坤灵升级“4+10+N”场景化方案,发布“经纬计划”和50个样板点
早报|iOS27正式推送/比亚迪高管:燃油车在中国没有未来/iPhone 18 Pro渠道降价900元,苹果称不干预
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台
一年28倍妖王:谁在爆炒?
GPT Image 2.5 对比实测:变化与局限
“极端”空头压境 美联储周三不加息就是最大意外
产品经理的体面,是一块不能失守的 “括约肌”9月21日,深圳前海!聊聊工业AI与生态共创的下一步
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了手机替我跑了一整套流程!我就说了一句话,AI执行了100步
AI 产品经理怎么入行?岗位方向、核心能力与转型路径一次讲清
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”一款在浏览器里运行、部署在自己服务器上的 SQL 客户端
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚