GMA基准是什么?
GMA是一个用于在挑战性真实场景中评测通用移动助手的基准,包含七个基于开源项目的应用和300个任务。
(翻译)挑战性真实场景下通用移动助手的基准评测
Abstract page for arXiv paper 2608.27477: Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
arXiv论文提出GMA基准,用于在挑战性真实场景中评测通用移动助手。该基准基于开源项目引入七个应用、300个任务,分四个难度层级。研究评测了八个前沿模型,发现任务复杂度增加时性能显著下降,同时测试了代理框架设计(如上下文保留、显式状态跟踪)的影响,表明合理框架设计可提升表现。
GMA是一个用于在挑战性真实场景中评测通用移动助手的基准,包含七个基于开源项目的应用和300个任务。
GMA扩展了应用覆盖范围和任务复杂度,涵盖生活方式分享、旅行规划等场景,任务分四个难度层级,并支持对代理框架设计的受控消融研究。
无效的管理者和疲惫的基层:浅论考核指标的漂移
抖音上线 “免费短剧” App,短剧赛道再添一员猛将圆桌:CVC的全面崛起 | 36氪 2026产业未来大会
破局产品同质化:长期主义的产品突围之路
特朗普“一再让步”:美国加密法案仍未过关
缓存不该困在一台服务器里
担心代码被拿去训练!英伟达:限制员工使用 Claude;一汽将成广汽第二大股东!南北丰田拟合并;苹果回应「iPhone 18 Pro破发」
黄仁勋再谈AI危险论:中国会成为全球开源重要力量
Meta 打造“组织第二大脑”智能体的设计思路
穿透查询怎样升级为穿透管控?
OpenAI万亿IPO推迟背后 四本账与三条投资路径
GPT-6 Sol要来了?OpenAI本周或迎“发布狂潮”58秒出杯,能拉花的咖啡机器人,在全球70国卖出600万杯
QQ 飞车 Agentic 研发转型过程中的Loop Engineering
工作流可以自我进化了,英伟达开源 SoL-Pi,每小时省13.5刀!
从 270 分钟到 18 分钟:B 端产品经理如何主导一个 AI 达人撮合系统
英伟达开源 IMO 金牌配方:不仅是「人海战术」,1.5TB 显存做实 AI「 推恩令」?
HIP-3:昂贵的入场券 买不来的护城河
高瓴系 CFO 往事:一代顶级机构年轻人的迁徙与突围
百度做了一堆AI产品,却没有一个能代表百度?
企业该买模型还是养上下文?企业案例分享:玉盘量智-离子阱量子计算芯片化集成工程实践 | 36氪 2026产业未来大会
从接住告警到自我进化:快手智能运维助手实践|QCon上海8点1氪丨选手赛中失禁污染赛道,HYROX中国宣布整改;机构预计美股明年将暴跌21%;苹果推出Siri人工智能
贝森特回购落空与通胀重压 美联储加息或全面开启
理想落幕:加密行业为何集体走向同质化?
被AI放大的光学「戏份」,让「配角」舜宇的生意越做越大
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构
OpenAI 发布适用于编程和计算机应用的 GPT-6 Astra
别闹,几粒盐就能立起高脚杯?你是不是用胶水了?