Curso de IA generativa · Sesión 3: del pre-entrenamiento al fine-tuning, RAG, MCP y agentes
Quorax
0:00 / 0:00
Curso de IA generativa · Sesión 3: del pre-entrenamiento al fine-tuning, RAG, MCP y agentes
41 просмотр · 9 дней назад
Quorax
11 подписчиков
41 просмотр · 9 дней назад
Sesión 3 del curso de IA generativa, completa: cómo se entrena un modelo de lenguaje y cómo se convierte en un sistema útil. Pre-entrenamiento, del modelo base al asistente (SFT, RLHF y DPO), fine-tuning con LoRA para darle personalidad a un modelo de pesos abiertos, y RAG, MCP y agentes.
Con dos demos en Google Colab con GPU gratuita: base vs instruct con tu propio dataset, y un fine-tuning LoRA de Qwen 2.5 en 37 segundos.
⏱️ Capítulos
0:00 Introducción
0:24 · El plan de hoy
1:12 · La idea clave
1:53 1 · Pre-entrenamiento
2:15 · El juego de la siguiente palabra
3:05 · Repaso: tokens
3:33 · Qué es un modelo, en una frase
4:32 · El bucle de entrenamiento
5:39 · La curva de pérdida
6:26 · Los datos
7:31 · Las leyes de escala
8:32 · Cuánto cuesta
9:12 · El resultado: un modelo base
10:03 · Resumen y paso al ejercicio
10:42 2 · Del modelo base al asistente
11:05 · El problema
11:43 · Paso 1: SFT
12:37 · La plantilla de chat
13:22 · Lo que el SFT no resuelve
13:54 · Paso 2: RLHF
14:45 · DPO y otras variantes
15:49 · El pipeline completo
16:32 · Base vs instruct en Hugging Face
17:01 · Resumen y ejercicio
17:53 3 · Demo en Colab: base vs instruct
18:27 · La función comparar
18:56 · El resultado y la plantilla de chat
19:26 · Probad vuestras instrucciones
20:02 · Crear, validar y descargar el dataset
20:54 4 · Fine-tuning y personalidad
21:14 · Nuestro modelo: Qwen 2.5 · 0.5B
22:10 · Qué es el fine-tuning
22:51 · Es caro… ¿cuándo merece la pena?
23:43 · Full fine-tuning vs LoRA
24:30 · Nuestro objetivo de hoy: "Chef IA"
25:16 · El dataset y los hiperparámetros
26:05 · Cómo sabemos si ha funcionado
26:49 · Resumen y práctica
27:31 5 · Demo en Colab: fine-tuning LoRA
27:54 · Instalar las librerías
28:17 · Elegir el dataset y cargar el modelo
28:47 · El modelo ANTES
29:08 · Configurar el entrenamiento
29:41 · La pérdida bajando
30:08 · ANTES vs DESPUÉS
30:48 · Prueba libre y el adaptador
31:20 6 · RAG, MCP y agentes
31:45 · El problema: el modelo no conoce TUS datos
32:30 · RAG: un examen con apuntes
33:11 · Embeddings: el significado convertido en números
33:47 · La base de datos vectorial
34:34 · El flujo RAG completo
35:14 · Fine-tuning vs RAG
35:49 · El siguiente problema: el modelo solo habla
36:29 · MCP: el USB-C de la IA
37:37 · Agentes: pensar, actuar, observar
38:18 · Cómo encaja todo
39:07 · Cierre
📚 Curso de IA generativa · Sesión 3 de 3
▶️ Curso completo: • Curso de IA generativa
⬅️ Sesión 2: • Curso de IA generativa · Sesión 2: cómo fu...
💻 Cuadernos de Google Colab (gratis, con GPU T4):
• Práctica 1 · Base vs Instruct y dataset de personalidad: https://colab.research.google.com/dri...
• Práctica 2 · Fine-tuning LoRA: https://colab.research.google.com/dri...
🎓 Material que usamos en clase en el programa Momentum del CSIC, en colaboración con Upgrade Hub.
👤 Vídeos de Demetrio Esteban Alférez · LinkedIn: / demstalfer
🏢 Quorax, nuestra empresa: IA, datos y seguridad para el tercer sector, instituciones públicas y empresas → https://quorax.ai
🎙️ Narración: voz de Demetrio clonada con ElevenLabs.
📖 Fuentes (consultadas el 22 sep 2026):
• GPT-3 — Brown et al. (2020) https://arxiv.org/abs/2005.14165
• Llama 3 — Meta (2024) https://arxiv.org/abs/2407.21783
• Leyes de escala — Kaplan et al. (2020) https://arxiv.org/abs/2001.08361
• Chinchilla — Hoffmann et al. (2022) https://arxiv.org/abs/2203.15556
• BPE — Sennrich et al. (2015) https://arxiv.org/abs/1508.07909
• RLHF / InstructGPT — Ouyang et al. (2022) https://arxiv.org/abs/2203.02155
• DPO — Rafailov et al. (2023) https://arxiv.org/abs/2305.18290
• IA constitucional — Bai et al. (2022) https://arxiv.org/abs/2212.08073
• Qwen2.5 Technical Report (2024) https://arxiv.org/abs/2412.15115
• LoRA — Hu et al. (2021) https://arxiv.org/abs/2106.09685
• QLoRA — Dettmers et al. (2023) https://arxiv.org/abs/2305.14314
• RAG — Lewis et al. (2020) https://arxiv.org/abs/2005.11401
• Model Context Protocol — Anthropic (2024) https://www.anthropic.com/news/model-...
#IAGenerativa #FineTuning #LLM