CoMAP框架:世界模型与智能体策略的协同进化
原始标题 / CoMAP: Co-Evolving World Models and Agent Policies for LLM Agents
大型语言模型智能体在交互环境中常因缺乏对环境的预测能力而决策受限。现有文本世界模型在训练后固定,难以适应智能体策略变化带来的分布偏移。CoMAP通过闭环交互协同进化世界模型与智能体策略,利用自蒸馏动态更新模型,提升长程任务表现,为无需外部奖励的智能体优化提供新思路。
01 摘要
本文提出CoMAP框架,通过世界模型预测未来状态反馈,智能体据此进行反思并优化动作,随后用产生的同策略轨迹自我蒸馏更新世界模型。实验显示CoMAP在具身任务、网页导航和工具使用基准上优于基线,如Qwen3-4B相对提升16.75%。作者认为协同进化循环随时间改善了世界模型的预测准确性,并促进更有效的长程决策。
02 关键点
- CoMAP通过闭环交互协同进化世界模型与智能体策略,无需外部奖励或验证器
- 世界模型预测未来反馈,智能体进行未来感知反思,并利用自蒸馏更新世界模型
- 在具身任务规划、网页导航和工具使用基准上优于竞争基线,如Qwen3-4B相对提升16.75%
- 协同进化循环随时间提高世界模型的预测准确性和长程决策效果
回到一手来源
阅读原文 ↗AI GENERATED SUMMARY / DISCOVERED BY ARXIV CS.CL