La NUEVA forma de ejecutar modelos 125B hasta 6X más rápido que llama.cpp
Cognix
0:00 / 0:00
La NUEVA forma de ejecutar modelos 125B hasta 6X más rápido que llama.cpp
3 591 просмотр · 2 дн. назад
Cognix
929 подписчиков
3 591 просмотр · 2 дн. назад
¿Se puede ejecutar un modelo de 125 mil millones de parámetros en una PC de consumo y hacerlo hasta 6 veces más rápido que llama.cpp?
Strata está cambiando la forma de ejecutar Qwen 3.8 Flash Next en local, utilizando una combinación de VRAM, RAM del sistema, caché de expertos y predicción de múltiples tokens. En este video analizamos cómo funciona esta arquitectura y por qué un modelo de 125B puede ejecutarse incluso cuando sus 354 GB de parámetros no caben en la memoria de una GPU convencional.
La clave está en algo muy diferente a simplemente aumentar la potencia de la GPU: Strata utiliza la memoria de la GPU y la RAM del sistema de forma simultánea, mantiene expertos frecuentes en caché y aprovecha la arquitectura MoE de Qwen para evitar cargar todos los parámetros con cada token.
También veremos de dónde sale realmente la cifra de 6X frente a llama.cpp, qué ocurre cuando comparamos versiones con la misma cuantización y por qué la diferencia práctica puede estar más cerca de 2X–2,5X dependiendo del hardware.
Además, analizamos qué GPU necesitas, cuánta RAM hace falta, por qué el ancho de banda de DDR5 puede ser más importante de lo que imaginas y qué diferencia existe entre ejecutar Q2 y Q3 para programación y tareas generales.
También veremos cómo la predicción de múltiples tokens cambia el rendimiento, qué está incorporando llama.cpp y por qué Strata puede conseguir mejoras importantes cuando el modelo necesita utilizar la RAM del sistema.
Si tienes una GPU NVIDIA de 12 GB o más y 64 GB de RAM DDR5, este proyecto puede cambiar por completo lo que puedes ejecutar localmente.
Capítulos:
00:00 El problema de ejecutar modelos de 125B en local
01:05 15 tokens/s con llama.cpp
02:05 Aparece Strata
03:00 Qwen 3.8 Flash Next y sus 125B
04:10 Cómo funciona la arquitectura MoE
05:25 Los 24.576 expertos del modelo
06:30 La enorme tabla de 51B parámetros
07:25 Por qué Qwen diseñó el modelo así
08:20 Cómo Strata reparte el trabajo entre GPU y CPU
09:35 El caché de expertos
10:45 De 47 a 92 tokens/s con predicción
11:50 ¿Strata mantiene la misma calidad?
13:00 ¿De dónde salen las 6X de velocidad?
14:20 La comparación justa contra llama.cpp
15:15 La RAM importa más de lo que crees
16:10 Q2 vs Q3: velocidad contra calidad
17:05 El precio de 64 GB de DDR5
17:50 llama.cpp también está evolucionando
18:35 ¿Strata reemplaza a llama.cpp?
19:00 El futuro de la IA local
En este canal hablamos de IA local, modelos de lenguaje, LLM, GPUs, inferencia, cuantización, herramientas de inteligencia artificial, hardware para IA y las nuevas arquitecturas que están cambiando la forma de ejecutar modelos cada vez más grandes.
Suscríbete a Cognix para seguir las novedades sobre inteligencia artificial, modelos de IA, tecnología, automatización, agentes IA y computación local.
#IA #Strata #Qwen #Qwen38 #LlamaCpp #IAlocal #LLM #ModelosIA #Nvidia #GPU #InteligenciaArtificial