CMU提出AI自奖励训练SRT：数学能力暴涨100%，无需人类标注实现自我进化

周大发表于 2025-6-1 14:15:05

CMU团队提出自奖励训练（SRT），使LLM无需人类标注即可实现自我进化，其推理能力在早期训练中媲美传统强化学习。SRT利用多数投票生成奖励信号，在数学和逻辑任务上表现出色，但于复杂数据集如DAPO上易出现性能崩溃。研究引入早停、固定基模型及课程学习策略，有效缓解该问题并提升模型稳定性与上限。
来源：https://mp.weixin.qq.com/s/-kjunzJJmeAF3mIfvk6RiA

页: [1]

靠浦ai课堂's Archiver

CMU提出AI自奖励训练SRT：数学能力暴涨100%，无需人类标注实现自我进化