Перейти к содержимому

La NUEVA forma de ejecutar modelos 125B hasta 6X más rápido que llama.cpp

Cognix

0:00 / 0:00

La NUEVA forma de ejecutar modelos 125B hasta 6X más rápido que llama.cpp

3 591 просмотр · 2 дн. назад
Cognix
929 подписчиков
3 591 просмотр · 2 дн. назад
¿Se puede ejecutar un modelo de 125 mil millones de parámetros en una PC de consumo y hacerlo hasta 6 veces más rápido que llama.cpp? Strata está cambiando la forma de ejecutar Qwen 3.8 Flash Next en local, utilizando una combinación de VRAM, RAM del sistema, caché de expertos y predicción de múltiples tokens. En este video analizamos cómo funciona esta arquitectura y por qué un modelo de 125B puede ejecutarse incluso cuando sus 354 GB de parámetros no caben en la memoria de una GPU convencional. La clave está en algo muy diferente a simplemente aumentar la potencia de la GPU: Strata utiliza la memoria de la GPU y la RAM del sistema de forma simultánea, mantiene expertos frecuentes en caché y aprovecha la arquitectura MoE de Qwen para evitar cargar todos los parámetros con cada token. También veremos de dónde sale realmente la cifra de 6X frente a llama.cpp, qué ocurre cuando comparamos versiones con la misma cuantización y por qué la diferencia práctica puede estar más cerca de 2X–2,5X dependiendo del hardware. Además, analizamos qué GPU necesitas, cuánta RAM hace falta, por qué el ancho de banda de DDR5 puede ser más importante de lo que imaginas y qué diferencia existe entre ejecutar Q2 y Q3 para programación y tareas generales. También veremos cómo la predicción de múltiples tokens cambia el rendimiento, qué está incorporando llama.cpp y por qué Strata puede conseguir mejoras importantes cuando el modelo necesita utilizar la RAM del sistema. Si tienes una GPU NVIDIA de 12 GB o más y 64 GB de RAM DDR5, este proyecto puede cambiar por completo lo que puedes ejecutar localmente. Capítulos: 00:00 El problema de ejecutar modelos de 125B en local 01:05 15 tokens/s con llama.cpp 02:05 Aparece Strata 03:00 Qwen 3.8 Flash Next y sus 125B 04:10 Cómo funciona la arquitectura MoE 05:25 Los 24.576 expertos del modelo 06:30 La enorme tabla de 51B parámetros 07:25 Por qué Qwen diseñó el modelo así 08:20 Cómo Strata reparte el trabajo entre GPU y CPU 09:35 El caché de expertos 10:45 De 47 a 92 tokens/s con predicción 11:50 ¿Strata mantiene la misma calidad? 13:00 ¿De dónde salen las 6X de velocidad? 14:20 La comparación justa contra llama.cpp 15:15 La RAM importa más de lo que crees 16:10 Q2 vs Q3: velocidad contra calidad 17:05 El precio de 64 GB de DDR5 17:50 llama.cpp también está evolucionando 18:35 ¿Strata reemplaza a llama.cpp? 19:00 El futuro de la IA local En este canal hablamos de IA local, modelos de lenguaje, LLM, GPUs, inferencia, cuantización, herramientas de inteligencia artificial, hardware para IA y las nuevas arquitecturas que están cambiando la forma de ejecutar modelos cada vez más grandes. Suscríbete a Cognix para seguir las novedades sobre inteligencia artificial, modelos de IA, tecnología, automatización, agentes IA y computación local. #IA #Strata #Qwen #Qwen38 #LlamaCpp #IAlocal #LLM #ModelosIA #Nvidia #GPU #InteligenciaArtificial