Перейти к содержимому

RL强化学习新范式!RLT教师强化学习模型算法全解析|SFT+RL两阶段训练全流程详解|AI大模型微调|大模型Agent|Agent智能体|Sakana AI

唐国梁Tommy

0:00 / 0:00

RL强化学习新范式!RLT教师强化学习模型算法全解析|SFT+RL两阶段训练全流程详解|AI大模型微调|大模型Agent|Agent智能体|Sakana AI

531 просмотр · 1 год назад
唐国梁Tommy
12,3 тыс. подписчиков
531 просмотр · 1 год назад
本期视频深入解析由 Sakana AI 提出的最新强化学习框架 —— RLT(Reinforcement Learning Teachers),它通过“教师生成高质量推理 → 教会学生模型”的机制,革新了语言模型推理任务的训练方式。 📌 你将学到: ✅ RLT 与传统RL方法的本质区别 ✅ 教师模型如何生成结构化推理过程 ✅ SFT + RL 两阶段训练流程与GRPO策略优化 ✅ 如何实现Test-Time Scaling推理能力提升 ✅ 结合 Qwen3 和 Bespoke 数据的实战流程 00:00 RLT 强化学习 核心思想 02:23 RL 存在的问题及 RLT 的解决方案 04:55 RLT与主流强化学习训练的区别 11:05 RLT 技术栈 11:30 RLT 训练与推理逻辑 🔗 更多AI技术课程持续更新中,如果觉得课程对你有帮助,欢迎订阅我的频道。 所有课程配套资料都可以在我的同名B站/微信公众号:唐国梁Tommy、或我的个人网站发送邮件获取:https://www.tgltommy.com/p/free-ai-co...