Перейти к содержимому

Curso de IA generativa · Sesión 3: del pre-entrenamiento al fine-tuning, RAG, MCP y agentes

Quorax

0:00 / 0:00

Curso de IA generativa · Sesión 3: del pre-entrenamiento al fine-tuning, RAG, MCP y agentes

41 просмотр · 9 дней назад
Quorax
11 подписчиков
41 просмотр · 9 дней назад
Sesión 3 del curso de IA generativa, completa: cómo se entrena un modelo de lenguaje y cómo se convierte en un sistema útil. Pre-entrenamiento, del modelo base al asistente (SFT, RLHF y DPO), fine-tuning con LoRA para darle personalidad a un modelo de pesos abiertos, y RAG, MCP y agentes. Con dos demos en Google Colab con GPU gratuita: base vs instruct con tu propio dataset, y un fine-tuning LoRA de Qwen 2.5 en 37 segundos. ⏱️ Capítulos 0:00 Introducción 0:24 · El plan de hoy 1:12 · La idea clave 1:53 1 · Pre-entrenamiento 2:15 · El juego de la siguiente palabra 3:05 · Repaso: tokens 3:33 · Qué es un modelo, en una frase 4:32 · El bucle de entrenamiento 5:39 · La curva de pérdida 6:26 · Los datos 7:31 · Las leyes de escala 8:32 · Cuánto cuesta 9:12 · El resultado: un modelo base 10:03 · Resumen y paso al ejercicio 10:42 2 · Del modelo base al asistente 11:05 · El problema 11:43 · Paso 1: SFT 12:37 · La plantilla de chat 13:22 · Lo que el SFT no resuelve 13:54 · Paso 2: RLHF 14:45 · DPO y otras variantes 15:49 · El pipeline completo 16:32 · Base vs instruct en Hugging Face 17:01 · Resumen y ejercicio 17:53 3 · Demo en Colab: base vs instruct 18:27 · La función comparar 18:56 · El resultado y la plantilla de chat 19:26 · Probad vuestras instrucciones 20:02 · Crear, validar y descargar el dataset 20:54 4 · Fine-tuning y personalidad 21:14 · Nuestro modelo: Qwen 2.5 · 0.5B 22:10 · Qué es el fine-tuning 22:51 · Es caro… ¿cuándo merece la pena? 23:43 · Full fine-tuning vs LoRA 24:30 · Nuestro objetivo de hoy: "Chef IA" 25:16 · El dataset y los hiperparámetros 26:05 · Cómo sabemos si ha funcionado 26:49 · Resumen y práctica 27:31 5 · Demo en Colab: fine-tuning LoRA 27:54 · Instalar las librerías 28:17 · Elegir el dataset y cargar el modelo 28:47 · El modelo ANTES 29:08 · Configurar el entrenamiento 29:41 · La pérdida bajando 30:08 · ANTES vs DESPUÉS 30:48 · Prueba libre y el adaptador 31:20 6 · RAG, MCP y agentes 31:45 · El problema: el modelo no conoce TUS datos 32:30 · RAG: un examen con apuntes 33:11 · Embeddings: el significado convertido en números 33:47 · La base de datos vectorial 34:34 · El flujo RAG completo 35:14 · Fine-tuning vs RAG 35:49 · El siguiente problema: el modelo solo habla 36:29 · MCP: el USB-C de la IA 37:37 · Agentes: pensar, actuar, observar 38:18 · Cómo encaja todo 39:07 · Cierre 📚 Curso de IA generativa · Sesión 3 de 3 ▶️ Curso completo:    • Curso de IA generativa   ⬅️ Sesión 2:    • Curso de IA generativa · Sesión 2: cómo fu...   💻 Cuadernos de Google Colab (gratis, con GPU T4): • Práctica 1 · Base vs Instruct y dataset de personalidad: https://colab.research.google.com/dri... • Práctica 2 · Fine-tuning LoRA: https://colab.research.google.com/dri... 🎓 Material que usamos en clase en el programa Momentum del CSIC, en colaboración con Upgrade Hub. 👤 Vídeos de Demetrio Esteban Alférez · LinkedIn:   / demstalfer   🏢 Quorax, nuestra empresa: IA, datos y seguridad para el tercer sector, instituciones públicas y empresas → https://quorax.ai 🎙️ Narración: voz de Demetrio clonada con ElevenLabs. 📖 Fuentes (consultadas el 22 sep 2026): • GPT-3 — Brown et al. (2020) https://arxiv.org/abs/2005.14165 • Llama 3 — Meta (2024) https://arxiv.org/abs/2407.21783 • Leyes de escala — Kaplan et al. (2020) https://arxiv.org/abs/2001.08361 • Chinchilla — Hoffmann et al. (2022) https://arxiv.org/abs/2203.15556 • BPE — Sennrich et al. (2015) https://arxiv.org/abs/1508.07909 • RLHF / InstructGPT — Ouyang et al. (2022) https://arxiv.org/abs/2203.02155 • DPO — Rafailov et al. (2023) https://arxiv.org/abs/2305.18290 • IA constitucional — Bai et al. (2022) https://arxiv.org/abs/2212.08073 • Qwen2.5 Technical Report (2024) https://arxiv.org/abs/2412.15115 • LoRA — Hu et al. (2021) https://arxiv.org/abs/2106.09685 • QLoRA — Dettmers et al. (2023) https://arxiv.org/abs/2305.14314 • RAG — Lewis et al. (2020) https://arxiv.org/abs/2005.11401 • Model Context Protocol — Anthropic (2024) https://www.anthropic.com/news/model-... #IAGenerativa #FineTuning #LLM