arXiv cs.AI 发布于 08/26 12:00

RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

(翻译)RENDER:在LLM记忆评估中控制面向读者的证据

查看原文

资讯摘要

Abstract page for arXiv paper 2608.23568: RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation

AI 摘要

arXiv论文介绍RENDER基准控制方法,用于检验LLM记忆与RAG评估中读者可见证据形式对结果的影响。研究用五级数据包阶梯和ChatGPT风格条目、LangChain摘要、MemGPT类型化记录、原始对话等模板,在500个LongMemEval问题与9个模型上进行测试。结果显示,匹配预算的解析数据包较按最近截断的原始对话提升42.4-72.6分,作者建议评测应报告或控制读者可见的证据形式。

AI 问答

RENDER基准主要研究什么问题?

RENDER研究在LLM记忆与RAG评估中,输入给模型的记忆或历史以不同形式呈现(如摘要、类型化记录、原始对话等)会如何影响评估结果。

RENDER在实验中发现了什么?

在500个LongMemEval问题和9个模型上,匹配预算的解析数据包比按最近截断的原始对话得分高42.4-72.6分;三种模型在正式账本式条目上得分为0%,但换成自然语言条目后可达45.4-53.4%。

打开原文