在什么情况下,给语言模型增加验证和搜索结构反而会降低性能?
当可用token预算低于约1000至1500个输出等效token时,计划和验证的额外开销会占用答案空间,导致性能不如单次模型调用,甚至接近0%。
(翻译)思考消耗令牌:更多结构何时物有所值
Abstract page for arXiv paper 2608.27506: Thinking Costs Tokens: When More Structure is Worth the Price
本文研究在token预算受限时,为语言模型添加规划、验证和修复等推理结构的影响。作者在FinQA和TAT-QA金融推理任务上,用GPT-5.4 mini对比了单次调用与带验证搜索的架构,覆盖250至42000个输出等效token的14个预算档位。结果显示,在1000至1500 token之间存在交叉点:低于该阈值时,计划开销反而损害性能;高于该阈值后,验证搜索架构持续优于单次调用,最高准确率约44%对40%。
当可用token预算低于约1000至1500个输出等效token时,计划和验证的额外开销会占用答案空间,导致性能不如单次模型调用,甚至接近0%。
研究使用GPT-5.4 mini在FinQA和TAT-QA两个金融推理数据集上进行了实验,共测试14个预算档位和28000个完成单元。
现在参与以太坊原生质押为什么要先排队一个月?
横扫四榜,DM0.5 凭什么面面俱到?
OpenAI 总裁:AGI 已经发生
AI攻克世纪数学难题,顶尖数学家抱团抵制,而他们担心的并不是丢了工作
比 MEGA Home 便宜 14 万!理想 i9 Home 上市定价 36.98 万元,六座旗舰变天了算力、机器人、仿真与资本,谁在定义物理AI下一个十年?|第十届全球ICT峰会回顾
让 AI 补货,但不让它算库存——LangGraph 在生鲜补货的落地实践
月下载暴增366%,上海真人社交公司切入东南亚AI陪伴,AI角色也能“奔现”日本百岁老人人数首次超过 10 万人
旧消费品,正长出新生意
理想落幕:加密行业为何集体走向同质化?
从 Trace 到规模化实时评估:面向生产流量的 Agent 可观测实践|QCon上海
香港第一、全球第八:OSL进化背后的数字资产新格局XCancel 服务再次下线
碧桂园服务与支付宝全面深化合作,共筑“智慧物业”数字化新标杆
YC 最值钱的这 20家公司,没有一家来自最近5年圆桌:量智共振·多元路径:共筑中国量子产业下一个十年 | 36氪 2026产业未来大会
大促GMV猛涨500%:激光雕刻设备靠"创意落地"出海东南亚
展翼之后,三折叠再次进化:HUAWEI Mate XT 2 非凡大师深度体验评测Optimizing cost and latency with Amazon Bedrock prompt caching
读完斯坦福116页AI实施手册,我最大的感受是:别再盯着模型了圆桌:CVC的全面崛起 | 36氪 2026产业未来大会
亚太唯一!腾讯云首次入选IDC MarketScape 全球托管边缘服务领导者类别协同办公进入Agent时代,飞书+豆包工作跑在了最前面
抖音上线 “免费短剧” App,短剧赛道再添一员猛将B站AI无限竞技场今日上线!全球百大AI模型同场竞技,GPT-6高居榜首
Meta 打造“组织第二大脑”智能体的设计思路一张GPU跑10万原子!分子之心用AI把化学反应“拍”成了电影
阶跃发布 StepAudio 3 ,多款语音模型登顶 Artificial Analysis 全球榜单圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会