与只使用语言指令相比,加入视频上下文后机器人的未见任务表现能提升多少?
Skild AI的测试显示,随着数据规模增加,ICL视频Prompt效果反超传统语言Prompt;对于未见任务,加入视频context后模型表现相比只用语言指令提升约7倍。
让机器人学会利用更长的多模态Context
量子位专访可可矩阵CEO高宇翔,解读具身智能领域兴起的In-Context Learning路线:Skild、Generalist等玩家展示one-shot能力后,行业开始把上下文理解作为新Scaling方向。可可矩阵成立于今年4月,主张将ICL前置到预训练阶段,用条件表征实现“强理解、轻生成”,并认为未来机器人智能应以学会新任务所需时间来衡量。
Skild AI的测试显示,随着数据规模增加,ICL视频Prompt效果反超传统语言Prompt;对于未见任务,加入视频context后模型表现相比只用语言指令提升约7倍。
Generalist和Skild偏向于在后训练阶段展示One-Shot能力,可可矩阵则把后训练的ICL前置到预训练阶段,用条件表征让模型根据任务意图动态提取视觉信息,实现强理解、轻生成。
相比单次任务成功率,他更看重第一次成功平均耗时,即机器人看一次示范后需要多久才能第一次学会任务,这对应教学成本和学习效率。
想把喜欢的故事做成动画?我用 AIXTV 把《聊斋》做出来了
CLARITY法案未通过程序性表决 OpenAI拟IPO前融资
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源商用割草机器人完成数千万融资,用L4级无人驾驶重构高尔夫草坪运维|硬氪首发
展翼之后,三折叠再次进化:HUAWEI Mate XT 2 非凡大师深度体验评测
Scaling Federated Learning Across Docker, Kubernetes, and Slurm with NVIDIA FLARE
电商对账的设计逻辑:四层核对,逐层下钻FAST 发现极短周期、最轻双中子星系统
How NVIDIA Groq 3 LPX Deterministic Execution Drives Power-Efficient High-Interactivity Inference on NVIDIA Vera Rubin美国军方首次证实在太空部署了武器
二次元“赛博分身”撬动日本市场:玩家“沉默”的AI陪伴产品,凭什么次留60%?
美团发布“手艺人Agent”,发型师可“吩咐”AI小帮手打理线上作品
特朗普“一再让步”:美国加密法案仍未过关
数亿元!前京东副总裁“消失”4年:不造会跑的天工,他在仓库里给人形机器人“占工位”圆桌:中国之光成为新共识| 36氪 2026产业未来大会XCancel 服务再次下线
字节将发布独立智能网盘“ADrive”,腾讯网盘先已布局,网盘AI大战打响圆桌:新能源:后时代的深水淘金 | 36氪 2026产业未来大会
Python 拥抱 RISC-V:CPython 正式纳入 Tier 3 平台
“裁判”不想给阿莫迪吹暂停芯视界创始人、董事长兼首席科学家鲍捷:十年产业实践,量子感知芯片为物理AI打开物质世界 "感知入口" | 2026年36氪产业未来大会清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单
黄仁勋正演讲遇特朗普突然来电:通话全程直播
王强宇履新百望:从发票SaaS工具,到财税垂直大模型,再到企业的Palantir
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构
Cloudflare将每天90亿次请求的JavaScript CDN迁移到其开发者平台8点1氪丨8月一线城市房价上涨;携程上架510万一张的太空旅行船票;字节跳动上半年净利润出现下滑,但海外收入占比再创新高
我的“一人公司”,是怎么搞钱的?
Building AI to accelerate science and improve lives
关于项目交付的思考:部署是最后两公里,验收才是最后一公里