Перейти к содержимому

Qwen 3.6 35B-A3B con llama.cpp 🚀 Ejecutar modelos GRANDES en una GPU PEQUEÑA

Nichonauta

0:00 / 0:00

Qwen 3.6 35B-A3B con llama.cpp 🚀 Ejecutar modelos GRANDES en una GPU PEQUEÑA

6 700 просмотров · 2 мес. назад
Nichonauta
22,2 тыс. подписчиков
6 700 просмотров · 2 мес. назад
Aprende cómo ejecutar el modelo Qwen 3.6 35B-A3B con llama.cpp para lograr un rendimiento increíble incluso si tienes una GPU pequeña. En este video, te muestro cómo optimizar la carga de modelos de lenguaje masivos en hardware limitado, como una RTX 3060 de 12 GB, sin sacrificar velocidad ni inteligencia. Descubrirás cómo utilizar técnicas de optimización avanzadas para que modelos que superan la capacidad de tu VRAM funcionen de forma fluida. Verás paso a paso la configuración de parámetros críticos para mejorar los tokens por segundo y aprovechar al máximo los recursos de tu PC. Exploraremos el uso de la versión MTP para la predicción multi-token, la gestión de expertos mediante el comando `moe` para repartir la carga entre CPU y GPU, y la importancia de configurar correctamente el contexto y la visión con archivos MMProj. Es una guía práctica para usuarios de inteligencia artificial que buscan exprimir su hardware actual. 📝 Índice: 00:00:00 Introducción y comparativa con modelos anteriores 00:00:46 Selección de Qwen 3.6 en Hugging Face y variantes 00:02:09 Configuración de llama.cpp y parámetros de ejecución 00:04:10 Uso del comando MOE para gestionar la VRAM y CPU 00:05:04 Pruebas de velocidad y optimización de MTP 00:07:46 Ajuste de capas para maximizar el uso de la GPU 00:09:02 Resultados finales y conclusiones de rendimiento Si este video te ayuda, suscríbete para ver más tutoriales sobre inteligencia artificial, automatización y creación de contenido. #InteligenciaArtificial #Qwen #llamacpp #LLM #GPU ✅ Canal WhatsApp: https://www.whatsapp.com/channel/0029... Contacto: nichonauta@gmail.com Sitio web: nichonauta.com