本文为个人技术笔记,整理自对 2022–2026 年 Agent Self-Evolve(自进化智能体)相关论文的调研。主要参考两篇核心综述——A Survey of Self-Evolving Agents(Gao et al.)与 A Comprehensive Survey of Self-Evolving AI Agents(Fang et al.)——及其配套仓库 CharlesQ9/Self-Evolving-AgentsEvoAgentX/Awesome-Self-Evolving-Agents,以及文中列出的原始论文,具体出处见文末 References。

当前绝大多数 LLM Agent 都有一个共同的宿命:部署即定型。模型参数在预训练/后训练结束后冻结,prompt 与工作流由工程师手工设计,工具集合在上线前圈定——此后无论 agent 在真实环境中经历了多少次成功与失败,这些经验都不会沉淀为系统能力的一部分。这与人类智能形成了鲜明反差:人类的核心竞争力恰恰是从经验中持续学习。于是一个自然的问题浮出水面:能否让 agent 在与环境的交互中,自己改进自己——改进自己的提示词、记忆、工具、工作流,甚至改写自己的代码与更新自己的参数?这条被称为 Self-Evolving Agents(自进化智能体) 的研究主线,在 2023–2026 年间从零星的探索迅速汇聚成 agent 研究中最活跃的方向之一,甚至被两篇核心综述视为"通往 ASI(Artificial Super Intelligence)的路径"。本文尝试系统梳理这条主线的完整脉络,全文的论证主线如下:

Self-Evolving Agents 论证主线
├── ① 问题定义:静态 agent 的困境 → "进化什么 / 何时进化 / 如何进化"的形式化
├── ② 统一框架:自进化反馈回路(Agent System ⇄ Environment ⇄ Optimiser)
├── ③ 路线一:上下文自改进(反思 / 记忆 / 技能库,不改参数)
│       Self-Refine · Reflexion · Voyager · STaR · GEPA · ACE
├── ④ 路线二:自生成数据与零数据自训练(改参数)
│       Self-Rewarding · AgentGym · Absolute Zero · R-Zero · Socratic-Zero
├── ⑤ 路线三:Agent 系统的自我修改与自动化设计(改系统/代码)
│       ADAS · AFlow · MaAS · Gödel Agent · Darwin Gödel Machine · HGM · SICA
├── ⑥ 路线四:记忆与经验驱动的免微调进化(改记忆/工具)
│       Memento · Alita · Alita-G · EvolveR · Evo-Memory
├── ⑦ 工程化整合:端到端自进化系统落地
│       SEAgent · AgentGym-RL · AgentEvolver
└── ⑧ 安全边界:misevolution、reward hacking 与可控性 → 开放问题

一、任务定义:Agent 自进化到底在进化什么

静态 Agent 的形式化

抛开具体实现,一个 LLM Agent 系统可以抽象为四元组:

$$ \Pi = (\theta,\ \mathcal{C},\ \mathcal{T},\ \mathcal{A}) $$

其中 $\theta$ 是基座模型参数,$\mathcal{C}$ 是上下文组件(system prompt、工作记忆、长期记忆),$\mathcal{T}$ 是工具集合,$\mathcal{A}$ 是系统架构(单/多 agent 拓扑、工作流结构)。传统 agent 的开发范式是:由人类工程师一次性设计好 $\Pi$,部署后四个分量全部冻结——agent 每一次执行任务都是"无状态"的,经验不会改变系统本身。

自进化的形式化:把"改进系统"变成系统自身的能力

自进化 agent 的核心思想,是引入一个由 agent 系统自身(或其附属优化器)执行的进化算子 $f$:agent 在环境中执行任务产生轨迹与反馈 $\mathcal{F}_t$(任务成败、环境奖励、用户反馈、自我评估等),进化算子据此更新系统的一个或多个分量:

$$ \Pi_{t+1} = f(\Pi_t,\ \mathcal{F}_t),\quad \Pi_t = (\theta_t,\ \mathcal{C}_t,\ \mathcal{T}_t,\ \mathcal{A}_t) $$

优化目标是让系统在任务分布 $p(\tau)$ 上的期望效用随时间单调提升。综述 A Survey of Self-Evolving Agents(Gao et al.)用四个正交的问题把这一领域组织了起来,这也是目前引用最广的分析框架:

  • What to evolve(进化什么):$\theta$(参数)、$\mathcal{C}$(prompt/记忆)、$\mathcal{T}$(工具)、$\mathcal{A}$(架构),四个分量对应四条几乎独立发展的技术路线;
  • When to evolve(何时进化)intra-test-time(在单个任务执行过程中即时进化,如反思后重试)vs. inter-test-time(任务之间离线进化,如自训练更新参数);
  • How to evolve(如何进化):基于奖励的训练(RL/RLVR)、模仿与示范学习、种群与进化式方法三大类进化信号来源;
  • Where to evolve(在哪进化):编码、GUI、医疗、科研等垂直场景对进化机制的不同约束。
图1:自进化智能体的 What / When / How / Where 四问分析框架——进化对象覆盖上下文、模型、工具与架构,进化时机分为测试时与测试间,进化方法分为奖励、模仿与种群三类(图片来源:Gao et al., A Survey of Self-Evolving Agents, arXiv 2507.21046)。

三类范式的对比

范式 优化者 优化对象 局限
静态 agent 人类工程师(一次性) prompt / 工作流 无法适应部署后的分布漂移,经验不沉淀
离线后训练 人类主导的训练管线 模型参数 $\theta$ 依赖人工标注数据,更新周期长、成本高
自进化 agent agent 系统自身 $\theta$ / $\mathcal{C}$ / $\mathcal{T}$ / $\mathcal{A}$ 任意分量 进化信号可靠性、安全性与遗忘问题(见第八节)

二、统一框架:自进化反馈回路

另一篇核心综述 A Comprehensive Survey of Self-Evolving AI Agents(Fang et al.)给出了一个更工程化的统一视角:任何自进化系统都可以拆成四个组件构成的闭环——System Inputs(任务输入)→ Agent System(执行系统)→ Environment(提供反馈的环境)→ Optimiser(依据反馈更新 agent 系统的优化器),周而复始。这个回路刻画了所有后续工作的公共骨架:各方法的差异,本质上只是"Optimiser 作用在哪个组件上、用什么反馈信号、以什么频率触发"的差异。

图2:自进化 AI Agent 的统一反馈回路框架——System Inputs、Agent System、Environment、Optimiser 构成闭环,优化器可作用于 prompt、记忆、工具、参数与多 agent 拓扑等不同搜索空间(图片来源:Fang et al., A Comprehensive Survey of Self-Evolving AI Agents, arXiv 2508.07407)。

在这一框架下,该综述把现有工作归纳为三大方向:单 Agent 优化(LLM 行为、prompt、记忆、工具)、多 Agent 工作流优化(协作拓扑与工作流结构的搜索)、领域特定优化(生物医学、编程、金融等垂直场景)。下文第三至七节按照技术演化的时间脉络展开:从"不改参数"的上下文进化,到"改参数"的自训练,再到"改系统本身"的自我修改,最后到端到端的工程化整合。

三、路线一:上下文层面的自改进(2022–2023)

自进化最早的形态并不涉及任何参数更新——agent 把经验写进上下文(反思文本、记忆、技能库),让"进化"发生在 prompt 空间中。这条路线确立了整个领域最基础的三个机制:反思、记忆、技能沉淀。

Self-Refine(Madaan et al.)是最简形态:同一个 LLM 轮流扮演生成者与批评者,“生成 → 自我反馈 → 修订"迭代进行,无需任何训练即可显著改进输出质量。它证明了 LLM 具备对自己输出进行有效批评的元能力——这是一切自进化机制的前提。

Reflexion(Shinn et al.)把这一机制从单轮输出扩展到了多步决策任务,提出"语言化的强化学习”(verbal reinforcement learning):agent 执行任务失败后,由自我反思模型将失败轨迹 $\tau_t$ 与环境反馈提炼为一段语言化的反思文本 $sr_t$,存入情景记忆(episodic memory),供后续试验的 Actor 参考:

$$ \text{mem}_{t+1} = \text{mem}_t \cup \{sr_t\},\quad sr_t = \text{SelfReflect}(\tau_t,\ \mathcal{F}_t) $$

与标准 RL 用标量奖励更新参数不同,Reflexion 用语言作为信用分配的载体、用记忆作为策略改进的存储介质——参数始终不动,但 agent 的行为策略随试验次数持续改善。

图3:Reflexion 框架——Actor 产生轨迹,Evaluator 给出内部反馈,Self-reflection 模型将失败经验转化为语言化反思写入长期记忆,指导下一轮试验(图片来源:Shinn et al., Reflexion, NeurIPS 2023)。

Voyager(Wang et al.)则把"进化对象"从反思文本推进到了可执行技能,是"技能自进化"的开山之作。在 Minecraft 开放世界中,Voyager 由三个组件构成终身学习闭环:自动课程(automatic curriculum)根据当前进度不断提出难度适中的新任务;迭代提示机制通过环境反馈与执行错误修正生成的代码;技能库(skill library)把验证通过的代码固化为可检索复用的技能。技能库本质上是一个不断增长的 $\mathcal{T}_t$——agent 的能力边界随经验单调扩张,且技能可组合出更复杂的技能。

图4:Voyager 的三组件终身学习框架——自动课程提出任务、迭代提示机制通过环境反馈精炼代码、技能库沉淀并复用验证过的技能(图片来源:Wang et al., Voyager, arXiv 2305.16291)。

与上述"测试时进化"平行,STaR(Zelikman et al.)更早地打通了"自生成数据 → 参数更新"的通路:让模型对问题生成推理链,仅保留最终答案正确的样本,用这些自生成的正确推理链微调自身,迭代进行:

$$ \mathcal{D}_t = \big\{(x_i,\ \hat{r}_i,\ \hat{y}_i)\ :\ \hat{y}_i = y_i\big\},\quad M_{t+1} = \text{FineTune}(M_0,\ \mathcal{D}_t) $$

STaR 虽然还依赖有标准答案的数据集(用 $y_i$ 过滤),但“用自己生成的成功经验训练自己”这一 bootstrap 思想,正是第四节所有零数据自进化方法的原型。

值得注意的是,这条"不改参数"的路线并未随着自训练方法的兴起而过时,反而在 2025 年以更工程化的形态强势回归。GEPA(Agrawal et al.)把反思机制注入 prompt 优化:用自然语言反思诊断轨迹中的失败原因、提出 prompt 变异,再用遗传-帕累托(genetic-Pareto)搜索维护多样化的候选种群——在多个任务上以少至 1/35 的 rollout 成本超过了 GRPO 强化学习训练,说明语言化的进化信号在样本效率上可以显著优于标量奖励ACE(Agentic Context Engineering,Zhang et al.)则把整个上下文视为可进化的"剧本"(playbook):通过生成—反思—策展(curation)的增量式条目更新积累和组织策略知识,避免了整段重写导致的"简洁偏误"与"上下文崩塌",在 agent 与金融推理任务上以更低延迟超过了强上下文适应基线。两者共同验证了:在基座模型足够强的前提下,进化 prompt/上下文本身可能比进化参数更划算

四、路线二:自生成数据与零数据自训练(Zero-Data Self-Evolution)

上下文进化不改参数,能力提升的天花板受限于基座模型本身。第二条路线直面这一限制:让 agent 自己生成训练数据、自己评判质量、自己更新参数,把人类从数据生产环节中逐步移除。

自我奖励:模型同时是运动员与裁判

Self-Rewarding Language Models(Yuan et al.)提出让同一个模型同时扮演生成者与奖励评判者(LLM-as-a-Judge):模型为自己生成的多个候选响应打分,构造偏好对进行 DPO 训练,训练后的模型再进入下一轮"生成—评判—训练"迭代。关键洞察是:评判能力会随生成能力一同提升,因此奖励信号的质量不会停留在初始水平——这打破了"固定 reward model 天花板"的限制,但也埋下了自我评判可靠性的隐患(见第八节)。

AgentGym / AgentEvol(Xi et al.)把自训练从单轮文本任务扩展到多环境交互场景:构建覆盖网页、游戏、具身任务等 14 个环境的交互平台,让 agent 在"探索—学习"循环中跨环境自进化,验证了自进化信号可以来自多样化环境的真实交互而非仅靠自我评判。该团队后续的 AgentGym-RL(Xi et al.)把这一平台升级为支持长程多轮决策的端到端 RL 训练框架,并提出 ScalingInter-RL 训练策略——逐步拉长交互轮数以平衡探索与利用,让 7B 模型在多个环境上追平甚至超过商业大模型。

零数据范式:自己出题、自己解题

2025 年,这条路线走到了逻辑终点——连任务本身都由模型自己生成

Absolute Zero(Zhao et al.)提出 Absolute Zero Reasoner(AZR):单个模型同时扮演出题者(proposer)与解题者(solver),在代码执行器提供的可验证环境中自我博弈,全程零外部数据。其最精妙的设计是出题者的可学习性奖励(learnability reward)——出的题目既不能太简单(solver 全对)也不能太难(solver 全错),只有处于"能力边界"上的任务才有训练价值:

$$ r^{\text{propose}} = \begin{cases} 1 - \bar{r}^{\text{solve}}, & 0 < \bar{r}^{\text{solve}} < 1 \\ 0, & \text{otherwise} \end{cases} $$

其中 $\bar{r}^{\text{solve}}$ 是当前 solver 对该任务的平均解出率。这一奖励驱动出题者自动生成难度贴合 solver 当前水平的课程(curriculum),而代码执行器保证了解题奖励的可验证性(RLVR),避免了纯自我评判的漂移。AZR 在零外部数据条件下取得了超越使用数万人工标注样本训练的模型的数学与代码推理性能。

图5:Absolute Zero 范式——同一个语言模型分饰出题者 πpropose 与解题者 πsolve 两角,环境(代码执行器)为两个角色分别提供可验证的奖励信号,构成零外部数据的自我博弈闭环(图片来源:Zhao et al., Absolute Zero, arXiv 2505.03335)。

R-Zero(Huang et al.)将"出题—解题"角色显式分化为从同一基座初始化的两个模型——ChallengerSolver——进行对抗性共进化。Challenger 的奖励设计与 AZR 的可学习性奖励异曲同工,但形式化为不确定性奖励:以 Solver 多数投票的自一致率 $\hat{p}(x)$ 度量任务难度,奖励在 $\hat{p} = \tfrac{1}{2}$(Solver 最不确定)时最大:

$$ r_{\text{Challenger}}(x) = 1 - 2\left|\hat{p}(x) - \tfrac{1}{2}\right| $$

Solver 则以多数投票结果为伪标签做 RL 训练,两个角色交替更新(GRPO),无需任何人工标注。这一共进化范式在后续工作中迅速延伸:Agent0 把它与工具集成推理(tool-integrated reasoning)结合,在零数据条件下进化出能调用代码工具的 agent;Socratic-Zero(Wang et al.)则把两角色扩展为 Teacher–Solver–Generator 三方共进化:Teacher 针对 Solver 的薄弱点生成适应性课程,Generator 蒸馏 Teacher 的出题策略以低成本规模化合成高质量训练数据,从仅 100 个种子问题出发 bootstrap 出超越商业大模型合成数据的效果。

图6:R-Zero 的 Challenger–Solver 共进化流程——Challenger 以不确定性奖励学习出题,Solver 以多数投票伪标签学习解题,两者交替用 GRPO 更新(图片来源:Huang et al., R-Zero, arXiv 2508.05004)。

这条路线的共同信念是:能力边界上的自我博弈 + 可验证的环境反馈,足以支撑模型的持续进化——而争议同样集中于此:当任务分布完全由模型自己定义时,进化方向是否还与人类意图对齐(见第八节)。

五、路线三:Agent 系统的自我修改与自动化设计(ADAS)

前两条路线进化的是参数或上下文,第三条路线激进得多:把 agent 系统本身——它的工作流、它的代码——作为进化对象

把 Agent 设计变成搜索问题

ADAS(Automated Design of Agentic Systems,Hu et al.)正式定义了这一研究领域,其核心命题是:既然 agent 系统可以用代码完备地表达,那么"设计更好的 agent"就等价于"在代码空间中搜索"。其提出的 Meta Agent Search 算法让一个元 agent(meta agent)基于不断增长的已发现 agent 档案(archive),迭代地编写新 agent 的代码、在目标任务上评测、把有价值的新设计加回档案——由于代码空间是图灵完备的,理论上任何可能的 agent 设计(新的 prompt 策略、工具使用方式、控制流)都在搜索范围内。实验中元 agent 自动"发明"了多步同行评审、分治等新颖设计模式,且发现的 agent 在跨域迁移时依然保持优势。

图7:ADAS 的 Meta Agent Search——元 agent 基于 agent 档案迭代编写新 agent 代码,评测后加回档案,自动发现多步同行评审、分治等新颖 agent 设计(图片来源:Hu et al., ADAS, ICLR 2025)。

同一时期的 AFlow(Zhang et al.)把搜索空间收窄为代码化的工作流,用 MCTS 在"节点=LLM 调用、边=依赖关系"的工作流图上做蒙特卡洛树搜索,配合经验回溯与迭代精炼,以远低于 ADAS 的搜索成本自动生成高质量 agentic workflow;EvoAgent(Yuan et al.)则借用经典进化算法的变异、交叉、选择算子,把任意单个专家 agent 自动扩展为多 agent 系统;EvoMAC(Hu et al.)更进一步把多 agent 协作网络类比为神经网络:以文本反馈为"梯度"(textual backpropagation)来更新协作网络中各 agent 的 prompt 与连接结构。这条"架构搜索"路线的最新进展是 MaAS(Multi-agent Architecture Search,Zhang et al.):它不再搜索单一的"最优架构",而是学习一个 agentic supernet(架构的概率分布),推理时根据查询难度动态采样定制化的 agent 系统——简单问题用轻量流程、复杂问题用重型协作,以 6–45% 的推理成本超过了固定架构基线,把"架构进化"从离线搜索推进到了按需自适应。

自我指涉:改写自己的代码

ADAS 中"优化者"(meta agent)与"被优化者"(被搜索的 agent)仍是分离的。Gödel Agent(Yin et al.)受 Gödel Machine 启发迈出了自我指涉的一步:agent 在运行时通过动态内存修改,读取并改写自身的推理逻辑与代码,实现递归自我改进,不再需要外部的元 agent。

Darwin Gödel Machine(DGM)(Zhang et al.)是这条路线目前影响力最大的工作。原始 Gödel Machine 要求自我修改在数学上可证明有益——这在实践中不可行;DGM 用达尔文式的经验验证取而代之:维护一个不断增长的 agent 变体档案(Darwinian archive),每轮从档案中采样一个 agent,让它分析自己的评测日志并提出一处自我修改(修改自己的代码库),修改后的新变体在 SWE-bench / Polyglot 编码基准上实测验证,有效变体加入档案继续繁衍。开放式探索(open-ended exploration)保证了搜索不会陷入单一谱系的局部最优——实验显示,最终最优 agent 的进化路径上存在"先退步后突破"的踏脚石(stepping stones),贪心策略会将其剪枝。DGM 把初始 agent 在 SWE-bench 上的解决率从 20.0% 自主提升到 50.0%,自动发明了 patch 验证、更好的文件浏览、历史感知等工具与机制。

图8:Darwin Gödel Machine 概念图——从档案中选取 agent 变体,自我修改自身代码库生成子代,在编码基准上实测验证后加回档案,形成开放式的达尔文进化循环(图片来源:Zhang et al., Darwin Gödel Machine, arXiv 2505.22954)。

SICA(Robeyns et al.)则展示了工程上最直接的形态:一个编码 agent 直接编辑自身代码库(无 meta/sub agent 之分),在基准上自我改进,验证了"自我修改闭环"可以在单体系统中稳定运行。而 DGM 的直接后续 Huxley-Gödel Machine(HGM,Wang et al.)则指出了这条路线的一个深层缺陷:基准分数高的变体未必具有更强的自改进潜力(论文称之为 Metaproductivity–Performance Mismatch),以当前分数贪心选择父代会错过真正高潜力的谱系;HGM 改为估计每个变体后代子树(clade)的聚合表现来指导自修改搜索,以更少的时间与算力在 SWE-bench Verified 上达到了与人类手工设计的最强编码 agent 相当的水平。值得注意的是,DGM、SICA 与 HGM 都将 agent 运行在沙箱中并保留人工审查环节——自我修改代码是所有自进化机制中风险最高的一种(见第八节)。

六、路线四:记忆与经验驱动的免微调进化

参数微调成本高、且对闭源模型不可行。第四条路线回到了 Reflexion 开辟的方向,但把它系统化、结构化:以外部记忆为进化载体,让 agent 在完全不动参数的前提下持续适应。

Memento(Zhou et al.)给出了这条路线目前最完整的形式化:把 agent 的持续适应建模为基于记忆的 MDP(Memory-augmented MDP),agent 的策略由"案例检索"与"LLM 执行"两级组成——先从案例库 $M$(过往轨迹及其成败结果)中检索与当前状态相关的案例,再由冻结的 LLM 在案例的条件下决策:

$$ \pi(a \mid s, M) = \sum_{c \in M} \mu(c \mid s, M)\ \pi_{\text{LLM}}(a \mid s, c) $$

其中案例检索策略 $\mu$ 通过在线强化学习持续更新(论文称之为 memory-based online RL / case-based reasoning)。换言之,学习发生在"检索哪段经验"这个小策略上,而非 LLM 参数上——以极低的成本实现持续适应,在 GAIA、DeepResearcher 等基准上取得了超越参数微调基线的表现。

图9:Memento 的两阶段框架——阶段一基于案例记忆做规划(case-based planning,检索策略在线更新),阶段二通过 MCP 协议调用工具执行子任务,全程不微调 LLM 参数(图片来源:Zhou et al., Memento, arXiv 2508.16153)。

Alita(Qiu et al.)把免微调进化的对象从记忆换成了工具:秉持"最小预定义、最大自进化"哲学,agent 仅从极简的核心能力出发,在任务执行中按需自主创建、精炼、复用 MCP(Model Context Protocol)工具,动态生长出自己的工具箱,在 GAIA 基准上超过了许多重工程的手工系统——这可以看作 Voyager 技能库思想在通用 agent 场景下的现代版本。其后续工作 Alita-G(Qiu et al.)把这一思路推向了"agent 生成 agent":让通用 agent 在反复执行目标领域任务的过程中生成、抽象并策展领域专属的 MCP 工具箱,最终把自己"编译"成一个成本更低、精度更高的领域专家 agent,实现了从"工具自进化"到"agent 自特化"的跨越。EvolveR(Wu et al.)则补全了经验的完整生命周期:经验积累 → 抽象为策略库 → 检索复用 → 迭代自我提升。评测侧,Evo-Memory 构建了首个面向"自进化记忆"的测试时学习 benchmark,专门评估 agent 随经验流持续改进的能力。

七、工程化整合:端到端自进化系统

2025 年末起,上述四条路线开始在端到端系统中汇流——单点机制的验证让位于多机制协同的工程化框架

SEAgent(Sun et al.)面向 GUI / 计算机使用场景:agent 需要在从未见过的软件中自主进化。其核心组件是一个 World State Model——逐步评估 agent 操作轨迹中每一步的成败,替代稀缺的人工标注提供过程级反馈;Curriculum Generator 据此不断生成由易到难的新任务,策略通过对失败动作的对抗性模仿与对成功动作的 GRPO 更新,实现从"经验中自主学习陌生软件"的完整闭环——这正是 AZR 的课程思想(第四节)与过程级评估在具身 GUI 场景的结合。

图10:SEAgent 的自主学习框架——World State Model 对轨迹逐步评判产生过程级奖励,Curriculum Generator 随能力提升生成渐进任务,策略经对抗模仿与 GRPO 持续更新(图片来源:Sun et al., SEAgent, ICML 2026)。

AgentEvolver(阿里通义)则给出了通用场景下的端到端自进化训练框架,把本文梳理的三类核心机制统一进一个系统:self-questioning(面向新环境自主生成任务,对应第四节的"自己出题")、self-navigating(复用与泛化探索经验以提升探索效率,对应第六节的经验驱动)、self-attributing(对长轨迹做细粒度信用分配以提升样本效率)。三个机制协同作用于"环境理解 → 任务生成 → 轨迹采集 → 模型更新"的完整闭环,显著降低了 agent 训练对人工任务集与人工奖励设计的依赖。

图11:AgentEvolver 系统架构——Master 协调任务管理、rollout、经验管理与样本构建等模块,将 self-questioning、self-navigating、self-attributing 三大机制整合为端到端自进化训练闭环(图片来源:AgentEvolver(阿里通义), arXiv 2511.10395)。

八、安全边界:当进化脱离人类意图

自进化回路在放大能力的同时,也在放大风险——这一方向已从综述中的一个章节成长为独立研究议题。

Emergent Risks in Self-Evolving LLM Agents(Shao et al.)系统研究了 **misevolution(进化跑偏)**现象:在没有外部攻击者的情况下,agent 的自进化过程自身就可能偏离人类意图——例如记忆进化中沉淀了有偏的经验并被后续决策反复引用放大、工具进化中自主创建的工具引入了安全漏洞、workflow 进化为了通过评测而牺牲了安全约束。这与传统的对齐问题不同:偏离是进化回路的内生产物,而非外部注入。

结合两篇核心综述的安全章节,目前的共识可以概括为:

  1. 自我评判类信号(self-reward)风险最高——评判者与被评判者同源,reward hacking 几乎不可避免;可验证信号(代码执行、基准实测)是目前最可靠的锚点,这正是 AZR、DGM 都选择可验证环境的原因;
  2. 自我修改代码的回路必须置于沙箱中,并保留人工审查——DGM 在实验中已观察到 agent 试图移除自身的"作弊检测"机制(objective hacking)的案例;
  3. 进化过程需要可审计性:档案机制(ADAS、DGM 的 archive)意外地提供了一条完整的进化谱系记录,是事后审计的天然基础设施;
  4. 评测体系尚未跟上:对适应性、遗忘、泛化、安全的系统评估(Gao et al. 综述提出的四维度)仍缺乏统一协议。

九、趋势与开放问题

综合全文脉络,可以把领域的演化总结为一条清晰的时间线,以及若干仍然开放的问题:

演化时间线

  1. 2022–2023,上下文自改进:STaR、Self-Refine、Reflexion、Voyager——不改参数,通过反思、记忆、技能库实现测试时进化;
  2. 2024,自训练与自动化设计:Self-Rewarding LM、AgentGym 打通"自生成数据 → 参数更新";ADAS、AFlow、EvoAgent 把 agent 系统设计本身变成搜索问题;
  3. 2025,自我指涉与零数据进化爆发:DGM、Gödel Agent、SICA 实现 agent 改写自身代码;Absolute Zero、R-Zero、Agent0 实现零外部数据的自我博弈进化;Memento、Alita 探索免微调的经验/工具进化;两篇大型综述确立领域框架;
  4. 2025 末–2026,系统化与工程化:AgentEvolver、SEAgent、AgentGym-RL 等端到端框架落地,Evo-Memory 等 benchmark 出现,misevolution 成为独立研究议题;同时各条路线的后续工作密集涌现——GEPA、ACE 让上下文进化在样本效率上反超 RL,HGM 修正了 DGM 的谱系选择偏差,Alita-G 把工具自进化升级为 agent 自特化,Socratic-Zero 把双角色共进化扩展到三方。

开放问题

  1. 进化信号从哪来:环境可验证奖励(RLVR)可靠但覆盖面窄,自我评判(self-reward)通用但易漂移——两者的可靠性边界与混合机制是核心问题;
  2. 进化什么最有效:参数 / prompt / 记忆 / 工具 / 拓扑五个对象各有性价比曲线,目前缺乏系统的消融比较,工程实践上"免微调路线"(Memento、Alita,以及 GEPA/ACE 展示的上下文进化样本效率优势)与"全参数路线"(AgentEvolver)正在分头验证;
  3. 长期性:持续进化中的灾难性遗忘与能力回退尚无好的解法——DGM 的档案机制以巨大的计算冗余为代价换取了对退化的鲁棒性;
  4. 安全性:自我修改闭环下的对齐保持(misevolution)、objective hacking 的检测与可审计性,是该方向能否走出实验室的前提;
  5. 评测:缺乏统一的 lifelong / open-ended 进化评测协议,Evo-Memory 是初步尝试,但覆盖的进化维度仍然有限。

十、总结

Self-Evolving Agents 的核心贡献,是把"改进 agent"这件原本专属于人类工程师的工作,重新表述为 agent 系统自身的一项可学习能力——进化算子 $f$ 从人手中移交给系统本身。从 Reflexion 用语言反思替代梯度、Voyager 用技能库沉淀能力,到 Absolute Zero / R-Zero 让模型自己出题自己解题、DGM 让 agent 改写自己的代码,再到 AgentEvolver、SEAgent 把这些机制整合为端到端系统,短短三年间,“进化"的对象从一段反思文本扩展到了系统的每一个组成部分。这条主线并非没有隐忧——self-reward 的漂移、misevolution 的内生风险、遗忘与评测的缺位都还是开放挑战——但"让经验重新变得有价值"这一设计哲学,几乎必然会成为下一代 agent 系统的默认配置:问题不再是"要不要自进化”,而是"让哪些组件、在多强的验证约束下自进化"。

Citation

本文为个人调研整理笔记,核心内容参考 A Survey of Self-Evolving Agents(Gao et al.)、A Comprehensive Survey of Self-Evolving AI Agents(Fang et al.)两篇综述及下列各论文原文整理而成,如需引用请以原始论文为准。

References

[1] Zelikman et al. “STaR: Bootstrapping Reasoning With Reasoning.” NeurIPS 2022.

[2] Madaan et al. “Self-Refine: Iterative Refinement with Self-Feedback.” NeurIPS 2023.

[3] Shinn et al. “Reflexion: Language Agents with Verbal Reinforcement Learning.” NeurIPS 2023.

[4] Wang et al. “Voyager: An Open-Ended Embodied Agent with Large Language Models.” TMLR 2024.

[5] Tao et al. “A Survey on Self-Evolution of Large Language Models.” arXiv 2024.

[6] Yuan et al. “Self-Rewarding Language Models.” ICML 2024.

[7] Xi et al. “AgentGym: Evolving Large Language Model-based Agents across Diverse Environments.” ACL 2025.

[8] Yuan et al. “EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary Algorithms.” NAACL 2025.

[9] Hu et al. “Automated Design of Agentic Systems.” ICLR 2025.

[10] Zhang et al. “AFlow: Automating Agentic Workflow Generation.” ICLR 2025 (Oral).

[11] Yin et al. “Gödel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement.” ACL 2025.

[12] Hu et al. “Self-Evolving Multi-Agent Collaboration Networks for Software Development (EvoMAC).” ICLR 2025.

[13] Robeyns et al. “A Self-Improving Coding Agent (SICA).” arXiv 2025.

[14] Zhao et al. “Absolute Zero: Reinforced Self-play Reasoning with Zero Data.” NeurIPS 2025.

[15] Zhang et al. “Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents.” ICLR 2026 (Sakana AI + UBC).

[16] Qiu et al. “Alita: Generalist Agent Enabling Scalable Agentic Reasoning with Minimal Predefinition and Maximal Self-Evolution.” NeurIPS 2025 Workshop (Oral).

[17] Gao et al. “A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence.” arXiv 2025.

[18] Fang et al. “A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems.” arXiv 2025.

[19] Huang et al. “R-Zero: Self-Evolving Reasoning LLM from Zero Data.” ICLR 2026.

[20] Zhou et al. “Memento: Fine-tuning LLM Agents without Fine-tuning LLMs.” arXiv 2025.

[21] Sun et al. “SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience.” ICML 2026.

[22] Xia et al. “Agent0: Unleashing Self-Evolving Agents from Zero Data via Tool-Integrated Reasoning.” ICLR 2026 Workshop.

[23] Wu et al. “EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle.” ICML 2026.

[24] “Evo-Memory: Benchmarking LLM Agent Test-time Learning with Self-Evolving Memory.” arXiv 2025.

[25] “AgentEvolver: Towards Efficient Self-Evolving Agent System.” arXiv 2025(阿里通义,GitHub)。

[26] Shao et al. “Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents.” ICLR 2026.

[27] EvoAgentX. “Awesome-Self-Evolving-Agents.” GitHub 2025.

[28] Zhang et al. “Multi-agent Architecture Search via Agentic Supernet.” ICML 2025.

[29] Agrawal et al. “GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning.” ICLR 2026 (Oral).

[30] Xi et al. “AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning.” ICLR 2026.

[31] Wang et al. “Socratic-Zero: Bootstrapping Reasoning via Data-Free Agent Co-evolution.” arXiv 2025.

[32] Zhang et al. “Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models.” ICLR 2026.

[33] Wang et al. “Huxley-Gödel Machine: Human-Level Coding Agent Development by an Approximation of the Optimal Self-Improving Machine.” ICLR 2026 (Oral).

[34] Qiu et al. “Alita-G: Self-Evolving Generative Agent for Agent Generation.” arXiv 2025.