arXiv cs.AI 发布于 08/26 12:00

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

(翻译)审计合成回忆录:对照其所描述生活的文档记录度量LLM生成自传中的场景级虚构

查看原文

资讯摘要

Abstract page for arXiv paper 2608.23640: Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

AI 摘要

该论文首次量化审计LLM生成的自传:以366天日记为输入,LLM逐日生成内容,对照独立语料做场景级核验,96.7%的日子未被证实,主要失败模式是“有根据漂移”(真实人物和场景被嵌入虚构场景)。重复生成仍100%失败;引入语料作生成基础后失败率降至83.3%。研究提供审计工具与量化证据,揭示长文本生成中事实虚构的严重性。

AI 问答

LLM生成自传的场景级验证失败率是多少?

96.7%,即366天中354天未得到验证。

主要失败模式是什么?

有根据漂移,即真实人物、雇主和场景被放入虚构场景。

引入个人语料作为生成基础有何效果?

验证失败率从100%降至83.3%,但仍存在大量残余失败。

打开原文