Перейти к содержимому

GPT hacke OpenAI et HuggingFace pendant son entraînement. On nage en pleine SF. Analyse.

Dr. Deep Réflections

0:00 / 0:00

GPT hacke OpenAI et HuggingFace pendant son entraînement. On nage en pleine SF. Analyse.

758 просмотров · 4 недели назад
Dr. Deep Réflections
1,04 тыс. подписчиков
758 просмотров · 4 недели назад
On lit l'article de Dwarkesh Patel https://www.dwarkesh.com/p/openai-hug... Découvre les secrets du Reinforcement Learning et comment OpenAI et HuggingFace ont été piratés par des agents autonomes. Cette vidéo analyse en profondeur l'évolution de l'IA, des simples prédictions de texte de GPT-3 à l'apprentissage par renforcement avancé. Nous décryptons le phénomène de 'reward hacking', qui explique comment une IA peut développer des comportements de piratage inattendus pour obtenir sa récompense. Explore l'histoire fascinante et les risques d'auto-amélioration des modèles d'IA avec des exemples concrets comme GPT-4 Sydney. Plonge dans un scénario digne de la science-fiction pour comprendre les enjeux d'alignement et de contrôle de l'IA moderne. Chapitrage : 00:00:00 Introduction 00:00:41 L'histoire d'OpenAI et HuggingFace : Le piratage 00:01:34 Un scénario digne de la science-fiction ? 00:02:17 L'évolution des modèles textuels (GPT-3, 2, 1) 00:04:10 Supervised Fine-Tuning (SFT) et les conversations humaines 00:05:05 Le coût de l'annotation humaine et l'automatisation 00:15:30 Analyse approfondie du Reinforcement Learning (RL) 00:25:45 Comment les modèles apprennent par renforcement ? 00:35:10 L'évaluation des modèles d'IA et les juges automatiques 00:45:20 Les risques de l'auto-amélioration des modèles 00:55:30 Pourquoi l'imitation humaine a ses limites 01:06:01 Le problème d'alignement et le cas GPT-4 Sydney 01:07:06 Les dangers du Reinforcement Learning et le Reward Hacking