主流 AI 聊天机器人在财务问题上的平均错误率是多少?
研究显示平均有 57% 的答案错误。
Solidot是至顶网的科技资讯网站,主要面对开源自由软件和关心科技资讯读者群,包括众多中国开源软件的开发者,爱好者和布道者。口号是“奇客的知识,重要的东西”。
Saturn 的研究测试了 ChatGPT、Claude、Copilot、Grok 和 Gemini 等 18 种 AI 模型,使用逾百个财务问题,提问超过 10,000 次。结果显示主流 AI 模型回答财务问题时平均 57% 出错,包括计算错误、遗漏税收政策变更或凭空捏造规则,可能导致经济损失。付费模型和较新模型表现更好,最佳推理模式 Claude Opus 5 仍有 39% 错误。
研究显示平均有 57% 的答案错误。
表现最好的是推理模式的 Claude Opus 5,但仍有 39% 的答案存在错误。
测试了 ChatGPT、Claude、Copilot、Grok 和 Gemini 等 18 种模型,使用逾百个财务问题,共提出超过 10,000 个问题。
Sui 难民:华语开发者为什么选择离开?多部门:汽车生产企业不得作虚假、夸大或引人误解的宣传
什么样的代币化美股才是你需要的?我国成功发射卫星互联网低轨27组卫星天康生物:9月销售生猪收入4.07亿元
巧合?Ledger 用户被盗9000万 经销商两个月前刚易主成年人要的「安心」,有时是一支笔给的App工厂,才是AI时代最被低估的生意Agent 落地核心:真正决定上限的是 Harness 闭环,不是模型美图披露AI创新产品进展:Picchi ARR达111万美元人社部:截至9月底三项社会保险基金累计结余11.2万亿元七部门:推动电商平台规则向优转型
OpenAI dots全面登陆手机 开口指挥Codex干活了日本美滨核电站3号机组反应堆重启
不要看衰以太坊:ETH依然重要的10个理由诺贝尔和平奖授予了南非女法官 Navi Pillay
私钥没泄露 近3.9亿美元怎么被转走的?
10后中学生捧红统一“呆毛”发型,这回轮到老非主流们看不惯了独家丨舒酉星创立新公司「星能远行」,此前是比亚迪欧洲总裁人社部:将研究出台服务业发展促就业文件,扩大服务业就业总量前8个月我国软件业务收入超10万亿元
同样是珍珠,为啥价格能差10倍?8点1氪丨特朗普买入Meta股票;山姆宣布拟限制亲友卡绑定;豆包开通水、电、燃气等生活缴费功能