Перейти к содержимому

Xiaomi y DeepSeek Acaban de Resolver el Mayor Problema de tu IA Local

Jorge Marfil

0:00 / 0:00

Xiaomi y DeepSeek Acaban de Resolver el Mayor Problema de tu IA Local

100 546 просмотров · 22 часа назад
Jorge Marfil
16,9 тыс. подписчиков
100 546 просмотров · 22 часа назад
DeepSeek V4.1 Flash guarda un millón de tokens de contexto en 0,93 GB, y doce días después el equipo MiMo de Xiaomi publicó HighSparse 2, que reduce la memoria 4,5 veces. Todo el mundo lo contó como una carrera por la memoria, pero los dos papers empiezan diciendo que la memoria nunca fue el problema principal. El verdadero cuello de botella de un agente de IA local es leer lo que le das, el prefill, y los dos laboratorios lo han resuelto de la misma manera. Instagram: www.Instagram.com/jorgemvrfil Únete para hablar sobre IA Local: https://www.skool.com/jorge-marfil-co... CAPÍTULOS 00:00 Las dos de la mañana 01:20 Doce días de diferencia 02:01 Cómo lo leí yo 02:30 ¿Quién ha ganado? 03:17 Lo que dicen las primeras frases 04:10 Escribe poco y lee muchísimo 04:41 Una pausa para hablar de la libreta 05:52 El precipicio del sesenta por ciento 06:24 Repaso antes de seguir 06:56 Cómo lee un modelo normal 07:26 Cortar el modelo por la mitad 08:46 Lo que hizo DeepSeek 09:42 Lo que hizo Xiaomi 10:40 ¿Cómo llegan dos rivales a lo mismo? 11:11 Cuando una idea se queda 12:00 Qué cambia si pagas por usar la API 13:14 Qué cambia si lo usas en casa 14:06 Lo que todavía no sabemos 14:51 Lo que ya podéis responder 15:22 La pregunta que yo haría ahora 16:05 Otra vez las dos de la mañana ¿Qué es el prefill? El prefill es la fase en la que un modelo de lenguaje lee todo lo que le has dado, el prompt, la conversación anterior, los archivos y los registros, antes de escribir el primer token de la respuesta. Esa espera es el tiempo hasta el primer token. Un agente de programación escribe unas pocas líneas y lee miles, así que con agentes y contextos largos lo que te tiene esperando es el prefill, no el tamaño de la ventana de contexto ni el de la caché KV. Lo que cuenta este vídeo: • El 4 veces de DeepSeek y el 4,5 veces de Xiaomi se miden cada uno contra el modelo anterior de su propio laboratorio, así que no sirven para decir quién ha ganado. • En DeepSeek, releer tokens que ya están en la caché KV cuesta unos 0,003 $ por millón, y leer tokens nuevos cuesta 0,15 $ por millón, cincuenta veces más. • Un desarrollador se topó con un precipicio hacia el 60 % de su ventana de contexto y de repente pagaba cincuenta veces más de lo que esperaba, porque se le había acabado la relectura barata. • Los dos laboratorios cortan el modelo por la mitad, una idea publicada en mayo de 2024 con el nombre YOCO: la mitad de abajo lee el prompt y la de arriba usa sus notas. • DeepSeek V4.1 Flash tiene 40 capas y el prompt se queda en la capa 20: escribir un token activa 16.000 millones de parámetros y leerlo activa 8.000 millones, justo la mitad. • HighSparse 2 de Xiaomi tiene 49 capas, el prompt sale en la capa 25, y leer un prompt de un millón de tokens necesita cinco veces menos operaciones que con su diseño anterior. • En una aplicación hecha con V4.1 Flash, los tokens nuevos eran solo el 0,5 % de la entrada, pero casi una quinta parte de lo que costaba. • En casa, en un M3 Ultra con 512 GB, V4.1 Flash leía unos 450 tokens por segundo: casi cuatro minutos para un contexto de agente de 100.000 tokens y 39 minutos para uno de un millón. • Lo que aún no se sabe: la memoria en contextos largos todavía no está bien medida, y hay usuarios que cuentan que V4.1 Flash se olvida de cosas a partir de unos 400.000 tokens. Las velocidades, los costes y los límites que cuentan desarrolladores y usuarios de foros son experiencias de usuarios concretos, a modo de ejemplo, no medias. #ialocal #llmlocal #deepseek #xiaomimimo #agentesia