arXiv cs.AI 发布于 08/26 12:00

ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence

(翻译)ESQ-Bench:评估 NL2SQL 方言泛化与静默语义分歧的多层级企业 Oracle 基准

查看原文

资讯摘要

Abstract page for arXiv paper 2608.23569: ESQ-Bench: A Multi-Tier Enterprise Oracle Benchmark for Evaluating NL2SQL Dialect Generalization and Silent Semantic Divergence

AI 摘要

ESQ-Bench 是一个面向企业 Oracle 环境的 NL2SQL 评测基准,包含465张表、约16.5万行数据和550个金标注问题-查询对,覆盖三个复杂度层级,并对比 Oracle、PostgreSQL、MySQL、SQL Server。结果显示 GPT-4o 等模型执行准确率随复杂度下降,静默语义分歧比例高达73%至99%。Claude Sonnet 4.6 在各层级均超过 GPT-4o,而本地 Llama 3.2 仅13.3%执行准确率。

AI 问答

ESQ-Bench 是什么?

ESQ-Bench 是一个面向企业 Oracle 数据库的 NL2SQL 评测基准,包含465张表、164,682行数据和550个金标注问题-查询对,并按复杂度分为三个层级。

评测中哪个模型表现最好?

Claude Sonnet 4.6 使用 schema-linked 提示在各复杂度层级上的执行准确率均超过 GPT-4o,分别达到87.4%、74.9%和68.7%。

打开原文