AVO在ARC-AGI-3公开集上的表现如何?
AVO以100.00 RHAE完成全部25个环境、183关,使用6624次环境动作。
(翻译)NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构

A frontier language model is only one component of an AI agent. The surrounding agent system—often called a harness—determines how the model receives context…
NVIDIA研究项目AVO提出通用自主智能体架构,强调除模型之外的外围系统(harness)决定长期任务表现。AVO在GPU内核优化中超越cuDNN和FlashAttention,在ARC-AGI-3公开集以100.00 RHAE完成全部25个环境183关,仅用6624次环境动作,较VISTA少约12%。
AVO以100.00 RHAE完成全部25个环境、183关,使用6624次环境动作。
AVO比VISTA少约12%的环境动作,但作者指出这不是受控消融实验,两者在多个实现细节上不同。
持久记忆和监督器。持久记忆让智能体跨上下文保留进度,监督器则在搜索停滞时引导主智能体更换策略。