Claude Haiku 5.5 相比上一代主要提升在哪些方面?
文章称其在计算机操作、知识工作和多学科推理方面提升明显,OSWorld 2.1 成绩从 15.7% 升至 72.4%,并加入自适应推理与百万 Token 上下文。

作者丨 郑佳美 编辑丨岑 峰  
文章介绍 Anthropic 发布 Claude Haiku 5.5 后的能力、定价和迁移变化。新模型在计算机操作、知识工作和多学科推理评测中提升明显,并支持自适应推理与百万 Token 上下文,但复杂终端编程仍落后于 Sonnet 5.5,实际成本需结合任务验证。
文章称其在计算机操作、知识工作和多学科推理方面提升明显,OSWorld 2.1 成绩从 15.7% 升至 72.4%,并加入自适应推理与百万 Token 上下文。
文章指出其在部分编程评测中接近 Sonnet 5.5,但在 Terminal-Bench 4.0 等复杂终端多步骤任务中差距明显,复杂智能体编程仍更适合 Sonnet 或 Opus。
不超过 10 万 Token 的提示词价格较低;超过 10 万 Token 后,输入和输出单价均提高 5 倍。实际成本还受分词器变化、推理 Token、缓存和上下文管理影响。
抖音真正想做的,不是本地生活,而是从娱乐到消费的完整入口Google 多个国家顶级域名被劫持
产品经理职业选择:在一个岗位待两年,你是在成长还是在消耗?
AI要钱、欧美政府也要钱:全球债券风暴才刚刚开始
AI的IPO之战:OpenAI奋起直追 与Anthropic差距缩小Agent Plasticity: Measuring Self-Improvement Through Experience
等 AI 干活太无聊?我给 DeepSeek Harness 写了个「合成大鲸鱼」,已开源
Anthropic推演2030:GDP多出32.4%,白领为什么反而更便宜?Reading the Room: Foundations, Design, and Challenges of Normative Competence in LLMs
至简动力冯宗宝:在间隙仅 0.5 毫米的真实场景下,实现机器人造机器人 | IROS 2026
设计系统负责人的语义生长:在1个组件的2个场景上练习核对GPT-6今起免费用!拒答变少,话变多了
Grok Bot免费Opus 5.5直连 第三方模型付费墙被砸开
谁在给Manus定价?
扔掉的是杂念,掌控的是生活:我的断舍离实践经验
AICon 北京 2026 议题征集启动:寻找把 AI 做进真实生产的人
为什么微信朋友圈的点赞和评论数量越来越少?Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models
产品经理成长指南:从“做功能”到“对结果负责”
跨平台执行交易:智能体要攻克的下一个关口
新款理想 i6 六项升级公布,旗舰配置下放,要做「全球爆款」!
Superfluid 创始人:我为何要离开加密领域
独家 | 清华 AIR 首届博士李健雄创立本溯智能:五源资本领投,押注动作原生具身模型
加密货币如何从根本上重塑金融体系Distillation for Incrimination and Distillation for Capabilities
两名工程师、两个月、4 万行 Rust:DynamoDB 太贵又慢,Perplexity 决定自己造
【万字】AI 原生怎么搭建?工具、流程、组织与评价权Socio-Foundation: A Model for Generalizable Individual Behavior Simulation via Hierarchical Capability Distillation
NEAR生态简明指南
北醒李远:给机器造眼睛,与「自讨苦吃」的十一年|物理 AI 50人