PaperBenchX主要评测AI的什么能力?
它评测AI Agent能否在真实科学软件和容器化环境中,端到端复现已发表论文的部分结果,并生成可重跑、可验证的科学证据。
PaperBenchX为代表的基准或许能更好地衡量AI的科研实力
文章介绍UniPat AI发布的PaperBenchX基准,用93个真实论文复现任务评测前沿模型与Agent。结果显示GPT-6 Astra完整复现率仅13.98%,说明当前AI虽在数学问题上表现突出,但在跨学科、端到端、可验证的科学复现方面仍存在明显差距。
它评测AI Agent能否在真实科学软件和容器化环境中,端到端复现已发表论文的部分结果,并生成可重跑、可验证的科学证据。
在93个论文复现任务中,表现最强的GPT-6 Astra完整复现率为13.98%,说明完整可靠复现仍然较少。
它不只看代码是否运行或数字是否接近,而是删除输出、断网重跑,并要求结果能追溯到完整计算过程和科学证据链。
7个月融4亿美刀背后,站着代季峰8人团ARTEX 从 GitHub 下架美国男子因利用 AI 生成音乐和机器人账号欺诈播放被判 18 个月Share GPU clusters across teams with isolation and fairness using Amazon SageMaker HyperPod
美股上涨的“好日子”还能撑多久?硬氪首发丨AI眼镜企业天使轮融资数亿,已与线下数百家门店合作月发售数千台openJiuwen发布并开源企业级AgentOS,加速智能体规模落地企业Google 多个国家顶级域名被劫持
等 AI 干活太无聊?我给 DeepSeek Harness 写了个「合成大鲸鱼」,已开源
梁文锋的500亿:投向一座北方小城
产品经理职业选择:在一个岗位待两年,你是在成长还是在消耗?Sigma-Hunter: A Domain-Specific Language Model for Threat Hunting and Detection Engineering
App+1|所得即所见,更适合中文的字体预览工具:Anyway.Fonts字节找到了DeepSeek时强时弱的原因
The Information调研:三分之一称AI回报是投入数倍
AICon 北京 2026 议题征集启动:寻找把 AI 做进真实生产的人
跨境汇款没有全球赢家:区域玩家捕获绝大部分价值
实体生意精准获客四步方法论(底层逻辑+落地流程)
谷歌为何押注RSI?Socio-Foundation: A Model for Generalizable Individual Behavior Simulation via Hierarchical Capability DistillationPay-per-inference for AI agents: How BlockRun and Incarna use Amazon Bedrock AgentCore payments定义了软件工程的计算机科学家 Margaret Hamilton 去世,享年 90 岁
我所知道的张磊:一场MSRA赛马与半个中国AI江湖
美股能抵押了:链上借贷的闭环还差几环How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis
灰度:加密ETF 正告别“只有比特币和以太坊”的阶段
OpenAI刚把多Agent做成产品,o1奠基人却说:1万个Agent解出世界级难题,多Agent贡献不到10%
谷歌借助 AI 与差分模糊测试将 C 语言依赖库改写为 Rust