论文关注的核心问题是什么?
论文关注大语言模型能否仅通过互动识别社区实际执行的社会规范,而不是依赖预训练知识。
(翻译)读懂场合:LLM 规范能力的基础、设计与挑战
Abstract page for arXiv paper 2610.10906: Reading the Room: Foundations, Design, and Challenges of Normative Competence in LLMs
这篇 arXiv 论文研究大语言模型的“规范能力”,即仅凭互动识别社区执行规范的能力。作者提出多智能体社区辩论设定,发现基线 LLM 难以学习规范,规范模块泛化性不足,且模型会把无关行为噪声与真实规则一并模仿。
论文关注大语言模型能否仅通过互动识别社区实际执行的社会规范,而不是依赖预训练知识。
作者设计了一个多智能体社区辩论场景,辩论准入由合成规范控制,用以隔离预训练暴露对结果的影响。
基线 LLM 即使学习规范有助于提高准确率也难以做到;规范模块对规范风格和模型选择高度敏感,且模型会无选择地模仿无关噪声。
全球最大独立 AI 原生影视公司,要打造「AI 版 Disney」36氪首发丨航天老兵创业做高分辨率遥感相机,连续完成多轮次近亿元融资
地球九大“保命指标”爆了七个,宜居界线全线失守?|环境小喇叭
Superfluid 创始人:我为何要离开加密领域
美国财政问题让比特币价格持续坚挺?
vivo X500 Pro Max 影像漫谈:当视频创作像拍照一样轻巧
7大鲜明观点:央行重磅发布人民币汇率政策立场
美债收益率飙升 AI股为何还能继续上涨?
为何 DeFi 需要一套全新基础设施?
从 Rollout 到权重同步:Mooncake 如何支撑高性能强化学习系统|QCon上海How Could AI Eliminate Humanity? A Failure-Mode Analysis of Civilizational Risk
SpaceX、博通、甲骨文天量发债:美国债市“挤爆”
腾讯WorkBuddy悄悄上新功能,我再也不用把文件搬来搬去了
Bitwise:读懂“为AI而生的区块链”NEAR
Grok Bot免费Opus 5.5直连 第三方模型付费墙被砸开Beyond Imitation: A Framework and Benchmark for LLM-Assisted Peer ReviewCan AI Agents Make Open-Ended Scientific Discovery? Evidence from Station8点1氪丨国际金价回调,金饰克价已暴跌约150元;A股千元股仅剩3只;711印度门店全部关闭
产品经理职业选择:在一个岗位待两年,你是在成长还是在消耗?
比特币能抗住8万吗?不妨看看这些数据硬氪首发丨AI眼镜企业天使轮融资数亿,已与线下数百家门店合作月发售数千台
作为 PM,我为什么一边用Gitee一边盼它赶紧迭代
谭谈:央行为什么发布关于人民币汇率的政策立场Route-Verify-Vote: Procedure-Conditioned Self-Consistency for Mixed-Domain ReasoningopenJiuwen发布并开源企业级AgentOS,加速智能体规模落地企业
融到56亿后,干啥?
3 个最近爆火的 Personal Agent ,在 GitHub 上有开源平替了。GPT-6今起免费用!拒答变少,话变多了
腾讯账上躺着5000亿,为啥还要借钱?