FEATUREDHacker News 首页· rssEN02:21 · 06·24
Qwen 发布 AgentWorld:一个能模拟环境、帮 AI 智能体练级的语言世界模型
Qwen 团队搞了个新东西,叫 Qwen-AgentWorld,本质上是一个用语言模型做的世界模拟器。它不直接干活,而是预测“在当前环境下做了某个动作后,下一步会发生什么”,覆盖了 7 种不同的场景。为了让模型学会这个本事,他们用了超过 1000 万条真实环境里的交互记录,分三步训练:先灌知识让它理解状态变化,再教它一步步推理出下一步,最后用规则和评分...
#Qwen#Qwen-AgentWorld-35B-A3B#Qwen-AgentWorld-397B-A17B#Benchmark
精选理由
精选 · 重要度 78 · 吸引力 + 知识量 + 共鸣
一句话点评
Qwen 用语言模型做了个世界模拟器,能预测智能体下一步会遇到什么,覆盖 7 种场景,但论文没披露模拟的准确率到底是多少。
锐评
Qwen 团队这次没做直接干活的智能体,而是做了一个“世界模拟器”——Qwen-AgentWorld。你可以把它理解成一个预测引擎:给定当前状态和动作,它用长链推理去猜下一步环境会变成什么样。这相当于给智能体配了个可以脑补后果的沙盘。
训练数据量不小,用了超过 1000 万条真实环境里的交互记录,分三步训练:先灌知识理解状态变化,再教模型一步步推理,最后用规则加评分来校准模拟的逼真度。模型分两个尺寸,小的 35B-A3B,大的 397B-A17B。团队还专门搭了个评测集 AgentWorldBench,用 5 个前沿模型的真实交互记录来考它,说 Qwen-AgentWorld 明显超过现有模型。
这篇论文的亮点在于两种用法:一是把模拟器拆出来单独用,能同时跑几千个环境帮智能体做强化学习,效果比只在真实环境里练要好;二是把世界模型训练当成智能体的热身步骤,能让它在 7 个下游任务上表现更好。不过,正文没给出模拟准确率的具体数字,只说“显著优于”,这点先别太激动。另外,1000 万条数据听起来多,但覆盖 7 个领域后每个领域能分到多少、质量如何,论文摘要里也没细说。代码开源了,具体效果得跑起来才知道。
HKR 分解
hook ✓knowledge ✓resonance ✓