HSS 基准主要评测什么能力?
HSS 评测多模态大语言模型在图像和视频中的直觉视觉推理能力,包括对隐含的时间、空间、社交和抽象结构的推断。
(翻译)人类的第六感:多模态模型直觉视觉推理基准测试
Abstract page for arXiv paper 2610.08966: Humanity's Sixth Sense: Benchmarking Intuitive Visual Reasoning in Multimodal Models
这篇 arXiv 论文提出 Humanity's Sixth Sense(HSS)基准,用于评测多模态大语言模型的直觉视觉推理能力。研究称,人类在该任务上准确率达93.1%,最强模型 GPT-6-astra 仅为53.6%,显示当前模型在隐含时空、社交和抽象视觉理解上仍有差距。
HSS 评测多模态大语言模型在图像和视频中的直觉视觉推理能力,包括对隐含的时间、空间、社交和抽象结构的推断。
论文称人类参与者准确率为93.1%,最强模型 GPT-6-astra 在最大推理努力下准确率为53.6%。
作者认为现有视觉基准多关注专家级分析或低层感知,未充分测试人类日常依赖的快速零样本视觉直觉,因此提出 HSS 填补这一空白。
卖手机的 来抢稳定币入口了An Empirical Study of Agent Skills' Downstream Utility
跨境汇款没有全球赢家:区域玩家捕获绝大部分价值36氪首发|「闹翻天PLAYFULLY」获青山资本投资,为世界造一张“中国球星卡”
STRK单日跳涨 26% :想从分家单飞”成为抗 AI 的 L1
代码交给AI,心流却回来了:Codex负责人不再怀念手写时代
从开源清理工具到付费 Mac 应用,用户教会了我如何做产品:Mole
广告狂人乔治·路易斯的28个Big Idea忠告,句句锋利AdaGuard: Enhancing Safety and Policy Compliance with Reasoning-Enabled LLM-As-A-Judge Guardrails8点1氪丨国际金价回调,金饰克价已暴跌约150元;A股千元股仅剩3只;711印度门店全部关闭
华尔街不打烊:即将开启24小时工作制How Fragile Is On-Device Language Model Safety? Localizing Safety-Critical Parameters for Sparse Fault Analysis
我在山姆“进厂式”工作:外企滤镜、流水线与人间剧场Route-Verify-Vote: Procedure-Conditioned Self-Consistency for Mixed-Domain Reasoning
鸿蒙版本的小小机器人APP开放源码啦
L2关停潮来袭:Blast、Abstract等明星项目为何退场
最新FOMC纪要出炉 看今年最后三个月该如何加息
2万亿美元估值靠什么撑?Anthropic 核心技术负责人:蒸馏会毁掉前沿研发,中美 AI 竞赛不会单边暂停
腾讯WorkBuddy悄悄上新功能,我再也不用把文件搬来搬去了
谭谈:央行为什么发布关于人民币汇率的政策立场
这家结算网络让美元 24 小时运转
美国财政问题让比特币价格持续坚挺?
3 个最近爆火的 Personal Agent ,在 GitHub 上有开源平替了。
Bitwise:读懂“为AI而生的区块链”NEAR
医疗大模型在院内场景的落地路径与产品化难点
硬件团队避坑指南:初创企业该如何选择最适配的质量体系? ——从华为到创业团队的质量选型血泪史(中篇:实操操盘手册)Adaptive Workflow Intelligence: A Cognitive Architecture for Context-Driven Enterprise Automation
美联储9月FOMC会议纪要(全文公布)
Grayscale解读智能体趋势:更便宜的AI 更多算力需求
代币化革命背后