Are We Thinking Correctly About AI Intelligence?
(翻译)我们对 AI 智能的思考正确吗?
Computer scientist Melanie Mitchell discusses why artificial intelligence doesn’t “think” or “reason” like humans, and how we can create better methods for measuring machine cognition.

烧掉500块实测H3、Seedance 2.0 fast,意外挖出了性价比之王(附全部提示词)
H3与Seedance 2.0 fast在同一提示词、分辨率和平台下完成多场景视频横评,比较真人表演、短剧、动效、广告和科幻等场景的指令遵循、镜头连贯与画面质感。实测Seedance 2.0 fast整体更稳,H3在视觉动效和广告场景各有优势。

李飞飞押注的空间智能:生成的世界,如何「经得起折腾」?
作者丨 刘紫东 编辑丨 幸丽娟 &nbs

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123
作者丨 幸丽娟 编辑丨岑 峰  

实测小米 AI 手机:性能超 iPhone,端侧 AI 超级快
#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

Netflix 开源了一个用于因果推理的智能代理工作流
Netflix 开源了一个用于观察性因果推断(OCI)的智能代理工作流。该工作流可以减轻因果分析中的繁琐工作。

Anthropic 最强模型难以吸引用户
Solidot是至顶网的科技资讯网站,主要面对开源自由软件和关心科技资讯读者群,包括众多中国开源软件的开发者,爱好者和布道者。口号是“奇客的知识,重要的东西”。
阿里开源 Better Harness:AI Agent 真正的竞争,正在从“模型能力”转向“工作方式”
当AI Agent进入研发流程,代码生成不再是瓶颈,验证与信任成为关键。阿里开源的Better Harness通过检查Agent的工作闭环,而非仅看结果,试图解决这一难题。本文深入解析其前馈与反馈机制,并探讨产品经理如何从写需求转向设计Agent的工作制度,揭示AI竞争正从模型能力转向工作系统。

豆包工作评测:从问答助手到数字打工人
周报还要翻聊天记录磨两小时?让 AI 自己读文档、做表格、出 PPT,你只动嘴。豆包工作把”回答问题”升级成”交付结果”,本地和云端双线跑,几十块一个月就能雇个不知疲倦的数字同事。

AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study.
(翻译)我们的研究医疗AI系统AMIE在一项同类首创研究中展示实时临床视频咨询能力。
Google introduces AMIE for real-time clinical video consultations in simulated settings.
调查显示三分之一英文网页有 AI 创作痕迹
Solidot是至顶网的科技资讯网站,主要面对开源自由软件和关心科技资讯读者群,包括众多中国开源软件的开发者,爱好者和布道者。口号是“奇客的知识,重要的东西”。
