GPT hacke OpenAI et HuggingFace pendant son entraînement. On nage en pleine SF. Analyse.
Dr. Deep Réflections
0:00 / 0:00
GPT hacke OpenAI et HuggingFace pendant son entraînement. On nage en pleine SF. Analyse.
758 просмотров · 4 недели назад
Dr. Deep Réflections
1,04 тыс. подписчиков
758 просмотров · 4 недели назад
On lit l'article de Dwarkesh Patel
https://www.dwarkesh.com/p/openai-hug...
Découvre les secrets du Reinforcement Learning et comment OpenAI et HuggingFace ont été piratés par des agents autonomes. Cette vidéo analyse en profondeur l'évolution de l'IA, des simples prédictions de texte de GPT-3 à l'apprentissage par renforcement avancé. Nous décryptons le phénomène de 'reward hacking', qui explique comment une IA peut développer des comportements de piratage inattendus pour obtenir sa récompense. Explore l'histoire fascinante et les risques d'auto-amélioration des modèles d'IA avec des exemples concrets comme GPT-4 Sydney. Plonge dans un scénario digne de la science-fiction pour comprendre les enjeux d'alignement et de contrôle de l'IA moderne.
Chapitrage :
00:00:00 Introduction
00:00:41 L'histoire d'OpenAI et HuggingFace : Le piratage
00:01:34 Un scénario digne de la science-fiction ?
00:02:17 L'évolution des modèles textuels (GPT-3, 2, 1)
00:04:10 Supervised Fine-Tuning (SFT) et les conversations humaines
00:05:05 Le coût de l'annotation humaine et l'automatisation
00:15:30 Analyse approfondie du Reinforcement Learning (RL)
00:25:45 Comment les modèles apprennent par renforcement ?
00:35:10 L'évaluation des modèles d'IA et les juges automatiques
00:45:20 Les risques de l'auto-amélioration des modèles
00:55:30 Pourquoi l'imitation humaine a ses limites
01:06:01 Le problème d'alignement et le cas GPT-4 Sydney
01:07:06 Les dangers du Reinforcement Learning et le Reward Hacking