Así funciona ChatGPT por dentro · la explicación más simple (lo escribí en 100 líneas de Python)
Código Espinoza - IA y Machine Learning
0:00 / 0:00
Así funciona ChatGPT por dentro · la explicación más simple (lo escribí en 100 líneas de Python)
1 083 просмотра · 8 дн. назад
Código Espinoza - IA y Machine Learning
9,27 тыс. подписчиков
1 083 просмотра · 8 дн. назад
Esto es ChatGPT. Entero. No el de OpenAI, pero sí la misma idea: predecir la siguiente palabra, una y otra vez, en 100 líneas de Python que corren sin errores. Si entiendes estas 100 líneas, entiendes por qué a veces inventa.
APOYA EL CANAL
Las 100 líneas comentadas están en Patreon (público). → / asi-funciona-por-171175825
Si estos videos te ahorran horas de confusión, Patreon es la forma de mantenerlos sin ruido ni relleno.
VIDEO RELACIONADO DEL CANAL
Cómo funciona la IA por dentro (y por qué no piensa, apuesta)
En este video recorremos línea por línea un modelo de lenguaje real y diminuto: cómo convierte texto en números (tokens), cómo decide qué palabras importan (atención), cómo aprende bajando la pérdida, y cómo genera texto con temperatura y sorteo. Al final vemos por qué inventar datos no es un fallo aislado sino el mecanismo, y qué separa a mi modelo de 1 920 números de los 175 mil millones de GPT-3.
CAPÍTULOS
0:00 Esto es ChatGPT, entero, en 100 líneas
0:26 La única idea: adivinar la siguiente palabra
2:01 Tokens y números: cómo lee una máquina
5:51 Atención: qué palabras importan
8:22 Cómo aprende el modelo (la única tabla que se entrena)
9:31 Generar texto: temperatura y sorteo
11:03 Por qué miente ChatGPT
11:38 Lo que le falta a mi modelo: escala, capas y RLHF
14:53 La parte incómoda y cómo correr el código
CONCEPTOS Y HERRAMIENTAS MENCIONADOS
ChatGPT, GPT-3, Python, tokenizador, embeddings, atención (Q, K, V), softmax, temperatura, función de pérdida, gradiente, RLHF (aprendizaje por refuerzo con retroalimentación humana), alucinaciones.
PREGUNTAS FRECUENTES
¿Cómo funciona ChatGPT por dentro?
Es un modelo que recibe un texto y calcula qué palabra es más probable que siga; elige una, la añade y repite el ciclo. Todo lo demás (tokens, atención, entrenamiento) existe para hacer esa apuesta mejor.
¿Por qué ChatGPT miente o inventa datos?
Porque no tiene ningún paso que compruebe si algo es verdad: solo sortea palabras probables. Para el modelo, una respuesta falsa que suena bien y una verdadera son la misma cosa: una secuencia probable.
¿Se puede escribir un ChatGPT en 100 líneas de Python?
Una versión miniatura sí: tokeniza, aplica atención, se entrena y genera texto. No es tan capaz como el real, pero muestra el mismo mecanismo, y puedes correrlo y modificarlo.
¿Qué es la temperatura en un modelo de lenguaje?
Un ajuste que controla cuánto se arriesga el sorteo: temperatura baja repite lo más probable; alta produce texto más variado, pero también más roto o inventado.
¿Qué es RLHF?
Aprendizaje por refuerzo con retroalimentación humana: un ajuste posterior que enseña al modelo a responder preguntas y a sonar útil, en vez de solo continuar texto.
#ChatGPT #InteligenciaArtificial #Python #LLM #CódigoEspinozaIA