强化学习无法让模型学会新的思考能力 | 基座模型决定能力上限 | 只用一个训练数据RL也能炼出推理
EZ.Encoder Academy
0:00 / 0:00
强化学习无法让模型学会新的思考能力 | 基座模型决定能力上限 | 只用一个训练数据RL也能炼出推理
4 747 просмотров · 1 год назад
EZ.Encoder Academy
17,6 тыс. подписчиков
4 747 просмотров · 1 год назад
视频里的paper:
1. Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model
2. Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining
3. Reinforcement Learning for Reasoning in Large Language Models with One Training Example
4. Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning
Chapters:
00:00:00 - 引言
探讨核心问题:强化学习(RL)是否真的能教会大模型新的推理能力?
00:06:51 - 先行工作回顾
多个研究表明,大模型在RL训练前,其基础模型就已经具备了强大的推理潜力。
00:13:42 - 核心论文解析
深入解读核心论文,论证RL更像是一个放大器,放大了模型已有的能力,而非创造新能力。
00:33:30 - 高效训练与总结
介绍如何用更少的样本唤醒模型的潜力,并对视频内容进行总结。