MedErrBench是什么?
MedErrBench是首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准,覆盖英语、中文和阿拉伯语三种语言,包含十类典型医疗错误。

作者丨 幸丽娟 编辑丨岑 峰  
纽约大学阿布扎比分校与克利夫兰诊所团队在ACL 2026 Findings发表论文,构建多语言医疗错误检测评测基准MedErrBench,覆盖英、中、阿三语原生医学数据及十类典型医疗错误。实验发现两个反直觉结果:通用模型在医疗错误检测上优于医疗专用模型,且英文原生模型在中文数据集上的表现优于英文数据集。研究提示医学知识之外,推理与上下文理解能力更为关键。
MedErrBench是首个面向医疗错误检测、错误定位和错误纠正的多语言评测基准,覆盖英语、中文和阿拉伯语三种语言,包含十类典型医疗错误。
一是医疗专用模型在医疗错误检测上不如通用模型;二是以英语训练为主的模型在中文原生数据集上的检测表现优于英文原生数据集。
团队计划用Agentic AI提升错误检测、定位和纠正效果,并为医疗纠错任务设计新的评估指标,对关键医学术语赋予更高权重,引入安全性评估。