Перейти к содержимому

强化学习无法让模型学会新的思考能力 | 基座模型决定能力上限 | 只用一个训练数据RL也能炼出推理

EZ.Encoder Academy

0:00 / 0:00

强化学习无法让模型学会新的思考能力 | 基座模型决定能力上限 | 只用一个训练数据RL也能炼出推理

4 747 просмотров · 1 год назад
EZ.Encoder Academy
17,6 тыс. подписчиков
4 747 просмотров · 1 год назад
视频里的paper: 1. Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model 2. Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining 3. Reinforcement Learning for Reasoning in Large Language Models with One Training Example 4. Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning Chapters: 00:00:00 - 引言 探讨核心问题:强化学习(RL)是否真的能教会大模型新的推理能力? 00:06:51 - 先行工作回顾 多个研究表明,大模型在RL训练前,其基础模型就已经具备了强大的推理潜力。 00:13:42 - 核心论文解析 深入解读核心论文,论证RL更像是一个放大器,放大了模型已有的能力,而非创造新能力。 00:33:30 - 高效训练与总结 介绍如何用更少的样本唤醒模型的潜力,并对视频内容进行总结。