自进化社媒Agent!浙大x北大:从多模态任务编排到反馈驱动
新智元报道 当大模型已经能够快速生成文案、图片和视频,一个更进一步的问题是:Agent 能否从执行过的任务中积累经验,并在持续交互中改进后续行为? 社交媒体为这一问题提供了具体场景。 Agent需要理解创作者的定位,协调多种工具完成内容制作,并在发布之后面对真实受众的反馈。一次任务中的选题判断、表达方式与执行结果,都可能影响下一次决策。 浙江大学REAL Lab与北京大学OpenDCAI Lab联合开源的Easel,正围绕这一过程展开探索。项目将账号画像、多模态技能、平台交互与反馈分析连接起来,构建覆盖发现、策划、制作、发布和复盘的连续工作流。 项目主页:zju-real.github.io/Easel 代码链接:github.com/ZJU-REAL/Easel Easel 的研究切入点,是将内容创作组织为一个能够积累上下文与经验的交互过程:Agent 在任务中执行,在结果中发现问题,再将值得保留的经验带入后续任务。当前,这种持续适应主要通过外部记忆与上下文更新实现,为探索 Self-Evolving 的社媒Agents提供具体的系统基础。 真实社交媒体:一个具有长期约束的交互环境 社交媒体内容生产包含连续的决策依赖。选题影响脚本,脚本影响素材制作,平台表达影响受众理解,发布后的互动又为后续创作提供反馈。一次生成的质量,只能反映其中一个局部环节。 这个环境还具有三个值得研究的特征。 首先,目标具有个性化。同一个话题,对不同账号的价值不同;同一篇论文,面向专业读者和普通受众时,需要采用不同的解释路径。 其次,环境持续变化。热点、受众兴趣与平台条件并不固定,过去有效的方法需要在新的任务中重新判断其适用性。 最后,反馈具有延迟和噪声。内容表现受到选题、表达、曝光和时机等因素共同影响,Agent 需要区分可以复用的经验与偶然结果。 这些特征使持续创作成为研究长期 Agent 的一个具体入口:系统既要保持对用户目标的稳定理解,也要根据新的证据调整行动。 画像与长期记忆:持续适应如何发生 Easel 将账号上下文组织为定位、风格、受众、平台、偏好边界和长期记忆六个维度,让用户约束能够贯穿不同任务。 例如,一个科技账号反复强调「保留方法细节,但减少术语堆砌」,这一偏好可以影响后续选题深度、脚本结构和图文表达。Agent在新任务中读取相关上下文,无需每次重新建立对账号的理解。 长期记忆则承接交互中形成的新经验。Agent会筛选可复用的偏好、制作方法与效果发现,经用户确认后增量写入,并与已有内容合并。临时规格和一次性参数不会直接成为长期规则。 由此,Easel 形成了一条基于记忆的适应路径:任务交互产生反馈,反馈被提炼为候选经验,经确认后进入长期上下文,再参与后续决策。 这里变化的是Agent可使用的知识与经验。用户确认使记忆更新具有可审视性,也为纠正错误总结保留了入口。围绕这一机制,可以进一步研究经验的筛选、保留与更新,以及长期积累是否真正改善了后续任务表现。 112个skills:多模态任务编排与执行经验复用 持续适应需要落实到具体行动。Easel 当前内置 112 个 Skills,覆盖发现、策划、制作、发布、归因及基础能力,将执行流程、领域知识和工具调用方式组织为可组合的能力单元。 Agent 根据任务目标选择技能,按需读取流程与参考资料,再协调文字、图像、语音和视频工具执行。复杂任务被拆解为具有依赖关系的步骤,各步骤共享上游结果。 以论文解读为例,Agent 先提炼研究问题、方法与关键证据,再组织文章、知识卡片或视频脚本,随后完成配图、配音、字幕与合成。同一组结构化材料支撑不同表达,减少各模态独立理解原文带来的信息偏移。 Easel 按项目保存源文件、中间产物与最终成品,并记录关键结论、产物关系和执行状态。后续步骤能够复用已有素材与决策,失败时也可以根据记录定位问题、继续处理。 从研究角度看,这使任务经验拥有了具体载体:成功的结构、有效的素材组织方式和执行中的问题,都有机会被回顾和复用。开放的技能体系也允许开发者将验证过的方法沉淀为流程,为进一步研究技能选择与组合策略提供基础。 账号画像·为不同账号建立可复用的创作上下文 热点雷达·聚合多平台趋势筛,选适合当前账号的选题 内容日历·统一管理选题、草稿、待发和已发内容 发布中心·从一份母版生成多平台版本并完成发布检查 两种反馈:任务内修复与跨任务适应 Easel 中的反馈可以从两个时间尺度理解。 任务内反馈直接作用于当前产物。模型负责内容理解、结构设计与表达判断,工具负责媒体处理和规格检查,再根据结果指导修改。例如,图文需要检查布局与可读性,视频需要核对画面、声音和字幕;生成对白存在偏差时,可以根据检查结果选择替换配音或重新生成。 这种局部反馈帮助 Agent 在当前任务中发现错误,并