从自己出题到自己选题:耶鲁新方法让大模型 Self-Evolution 又进一步

摘自:https://mp.weixin.qq.com/s/eR1m3_i9c24fN0HPHSNaYw

关键词:Self-Evolution、Self-Improvement、INFUSER、Influence Score、AI4AI、合成数据、课程学习

大模型正在越来越会“自己训练自己”。没有足够的人工标注数据?那就让模型自己出题、自己做题,再通过强化学习继续训练自己。这样的 Self-Evolution / Self-Improvement 路线,正在成为近期 AI4AI 中越来越重要的方向。

但这里藏着一个关键问题:

模型自己生成 100 万道题,它怎么知道其中哪些题真的值得学?

一道题很难,不代表它有用;模型做错一道题,也不意味着训练这道题就一定能让模型变强。

来自 Yale、Stanford、UChicago、UCSD 等机构的研究者提出了 INFUSER(Influence-Guided Self-Evolution),给出了一个很有意思的答案:

不要只看一道题难不难,而要看:训练完这道题之后,模型是不是真的朝着我们希望的方向变强了。

换句话说,INFUSER 想让 AI 不只是会“自己出题”,还开始学会判断:什么才是自己当前最值得学的东西。

01|Self-Evolution 最大的问题:什么才算一道“好题”?

现在不少 Self-Evolution 方法,基本遵循这样的闭环:

模型生成问题 → 模型回答 → 根据回答结果做强化学习 → 得到更强的模型 → 再继续生成新问题。

真正麻烦的地方在于:我们应该鼓励模型生成什么样的问题?

一种直觉答案是,生成那些“刚好有点难”的问题。如果一道题模型每次都能做对,说明太简单;如果永远做不出来,又可能太难。因此,一些已有方法会寻找模型正确率处于中间区域的问题,把 Difficulty 当成“训练价值”的代理指标。

Hard ≠ Useful。

模型做不出一道题,可能是缺少某种推理能力,也可能只是因为题目写得不好、答案有问题、表述存在歧义,甚至问题本身过于偏门。这样的题当然很“难”,但反复训练未必能提升我们真正关心的能力。

于是 INFUSER 把问题从:

“这道题对模型来说难不难?”

换成了:

“如果模型训练这道题,它会不会真的变得更好?”

这就是整篇工作的核心变化。

02|Influence Score:别看题目本身,看它把模型推向哪里

INFUSER 引入了一个核心概念:Influence Score(影响力分数)

假设我们真正希望模型提升的是某一类目标能力。INFUSER 会保留一小批目标任务的 Dev Set,让模型在这些数据上计算一个目标梯度方向。可以把它粗略理解为:如果模型想在真正关心的任务上表现更好,那么参数应该朝哪个方向更新。

接下来,Generator 生成一道新的训练题,Solver 回答这道题并据此学习,同样产生一个参数更新方向。系统要比较的,就是这两个方向到底有多相似。

cos(g_target, g_question) → 1

如果两个方向高度一致,说明训练这道题恰好让模型朝我们希望的方向前进,这是高价值训练数据。如果两个方向近乎垂直,题目可能很难,但对目标能力帮助不大;如果两个方向相反,训练甚至可能把模型带向错误方向。

因此,INFUSER 对“好数据”的定义发生了变化:

  • 传统指标:Difficulty、Correctness、Quality;
  • INFUSER 更关心:Learning Utility,即这条数据能否对当前模型产生有价值的学习更新。

03|一个 Generator,一个 Solver:两个模型一起进化

INFUSER 系统包含两个核心角色:

  • Generator:负责出题;
  • Solver:负责做题并学习。

两者最初可以来自同一个 pretrained model,但之后拥有独立的参数和优化过程。

整个训练过程可以概括为四步:

  1. 确定方向:用少量目标 Dev Set 计算 Target Gradient,告诉系统 Solver 最终应该朝哪里变强。
  2. 自动出题:Generator 从教材、科学文本、代码等未标注文档中生成 Question 和 Reference Answer。
  3. Solver 学习:Solver 回答问题,并通过强化学习更新能力。
  4. 反过来训练 Generator:比较每道题造成的 Solver 参数更新与 Target Gradient 的一致性,并把 Influence Score 作为 Generator 的奖励。

于是 Generator 会逐渐发现:“原来这种问题,对现在这个 Solver 最有帮助。”随后,它会倾向于产生更多类似的高价值训练数据,而 Solver 又会因为这些数据不断变强。

最终形成动态闭环:

Generator 出更合适的题 → Solver 变强 → Solver 的能力边界变化 → Generator 重新调整 curriculum → Solver 再继续提升。

这就是 INFUSER 所说的 Co-Evolution

04|它追求的不是“越来越难”,而是“现在最值得学”

我们很容易把 Self-Improvement 理解成:模型越来越强,于是给自己生成越来越难的问题,再继续把自己练得更强。但 INFUSER 的观点并不是这样。

最难的题,不等于当前最值得学的题。

假设一个模型当前的能力大致如下:

领域当前能力
微积分90%
概率论70%
组合数学40%
拓扑学10%

如果只根据 Difficulty 生成数据,Generator 很可能不断给模型出它完全不会的拓扑学难题。但这些问题距离模型当前能力边界太远,并不一定是最高效的学习材料。

Influence-based Generator 可能发现:当前训练一些中等难度的组合数学问题,反而最能推动整体推理能力提升。

这很像现实中的优秀老师。优秀的老师并不是永远给学生出最难的题,而是知道:这个学生现在到底应该做什么题。

从这个角度看,INFUSER 中的 Generator 已经不只是简单的 Data Generator,而开始像一个 Adaptive Teacher

05|为什么 Influence Score 没有一路上涨?

既然 Generator 越来越会生成“有价值的问题”,直觉上我们可能认为 Influence Score 应该随训练一路上涨。但论文中的结果并不是这样。

在完整的 INFUSER 训练过程中,Influence Score 早期为正,随后有所下降,并长期在接近 0 的区域附近波动。这并不奇怪,因为 Generator 在学习,Solver 也在学习。

昨天对 Solver 非常有帮助的问题,今天可能已经被 Solver 掌握;今天的高价值数据,到了下一阶段又可能变得过于简单。Generator 实际上一直在追逐一个不断移动的目标:

当前这个 Solver,下一步到底最需要学什么?

作者还做了一个 control experiment:固定 Solver,也固定 document batch,只继续训练 Generator。此时“学生”不再变化,Generator 的 influence alignment 就明显提升。

这说明 Generator 确实可以学会生成更有价值的问题。完整系统中看不到 Influence Score 一路上升,并不是 Generator 没学会,而是 Solver 本身也一直在成长。这恰恰体现了 Co-Evolution:老师越来越会教,学生也越来越会学;学生变强之后,老师又必须调整下一阶段该教什么。

06|甚至,小模型老师可能比大模型老师更会教

论文比较了两种 Generator:一种是随着 Solver 一起进化的 8B Generator;另一种是能力更强、但始终被冻结的 32B Thinking Generator。

按照直觉,32B 模型本身更强,似乎应该更会生成高质量问题。但在 Math 和 Coding 等实验中,INFUSER 中持续 co-evolving 的 8B Generator 反而取得了更好的效果。

一个更聪明的老师,不一定比一个更了解学生当前状态的老师更会教。

32B Generator 可能知识更多、推理能力更强,但它并不知道现在这个 Solver 到底缺什么。INFUSER 的 Generator 却一直在接收直接反馈:“你刚才出的这道题,究竟有没有让这个学生朝正确方向进步?”

因此,真正重要的可能不只是 Strong Teacher,而是 Adaptive Teacher

07|实验效果怎么样?

作者分别从 Qwen3-4B-BaseQwen3-8B-Base 出发进行 Self-Evolution,测试覆盖 General Reasoning、Math、Physics、Medical、Coding 等多个方向,共 14 个 benchmark,并与 R-Zero、AZR、R-Few、SPICE 等方法进行比较。

以 Qwen3-8B 为例,在 General Reasoning 上的结果如下:

MethodAverage
Base34.43
R-Zero37.14
AZR37.61
R-Few38.88
SPICE38.75
INFUSER40.62

相比 Base,整体提升约 17.98%。一些单项 benchmark 的变化也比较明显:

  • SuperGPQA:30.62 → 37.77
  • OlympiadBench Math:40.36 → 50.24
  • HMMT:2.96 → 7.04

相比单纯生成更多数据,自动寻找“对当前模型最有学习价值的数据”,可能是 Self-Evolution 更关键的一步。

08|不过,它离“AI 完全自主进化”还有一步

不能把 INFUSER 理解成 AI 已经不需要任何人类信号、可以无限自我进化。它仍然依赖一个关键组件:Target Dev Set

系统需要一小部分目标数据,通过这些数据计算 Target Gradient,从而告诉 Generator:我们最终希望 Solver 往哪个方向发展。实验也显示,Dev Set 太小时,估计出来的 Target Gradient 会更加 noisy,进而影响训练效果。

所以,更准确的描述是:

少量目标信号 + 大量无标注文档 + 自动生成训练 curriculum。

人类仍然需要回答“模型最终应该往哪里进化”,但一旦方向被给定,AI 开始尝试解决另一个过去高度依赖研究员的问题:

为了往这个方向变强,我下一步究竟应该学什么?

09|从 Data Generator,到 AI Training Scientist

如果只把 INFUSER 看成一种新的 synthetic data 或 RL 方法,可能低估了这项工作的意义。它背后体现的是一个更大的趋势:AI 开始参与“训练 AI”这件事情本身。

传统模型研发闭环大致是:

研究员观察模型 → 分析模型弱点 → 设计数据 → 训练 → Evaluation → 分析结果 → 再设计下一轮数据。

其中包含大量过去只能由 researcher 完成的判断:模型现在缺什么?什么数据最值得加入?下一轮应该训练什么能力?

INFUSER 自动化掉的是其中非常关键的一环:Curriculum Design

Generator 不再只是批量制造 Question-Answer Pair,而是观察 Solver 当前的学习状态,通过真实的参数更新效果判断什么样的数据最值得当前模型学习。

于是它的角色开始从 Data Generator 逐渐走向 AI Training Scientist

从更长远的 AI4AI / Self-Improving AI 视角看,完整闭环可能是:

发现问题 → 提出任务 → 生成数据 → 训练模型 → Evaluation → 分析结果 → 决定下一轮实验。

INFUSER 自动化的正是其中一个关键问题:下一步,到底应该让模型学什么?

10|最后

如果只记住 INFUSER 的一个观点,可以记住这一句:

Self-Evolution 的关键,不是让模型给自己出越来越难的题,而是让模型找到“当前最值得学的题”。

过去讨论 synthetic data 时,我们经常问:这条数据本身质量高不高?INFUSER 提供了另一种值得关注的视角:

所谓高质量训练数据,也许不存在完全脱离模型的绝对标准。真正重要的是,它能不能让“当前这个模型”朝我们希望的方向发生改变。

Data QualityLearning Utility,从 DifficultyInfluence,再从简单的 Data Generator 走向根据模型状态动态调整 curriculum 的 Adaptive Teacher——这或许正是 Self-Improving AI 接下来最值得关注的一条路线。


论文:INFUSER: Influence-Guided Self-Evolution Improves Reasoning

微信公众号文章

原文:微信公众号文章

发表评论

您的电子邮箱地址不会被公开。 必填项已用*标注