Перейти к содержимому

Los Modelos IA Ternarios Son MEJORES, Pero ¿Por Qué Nadie Los Utiliza?

Jorge Marfil и Jorge Marfil

0:00 / 0:00

Los Modelos IA Ternarios Son MEJORES, Pero ¿Por Qué Nadie Los Utiliza?

2 612 просмотров · 11 ч назад
Jorge Marfil и Jorge Marfil
2 612 просмотров · 11 ч назад
Los LLM de 1,58 bits prometen un modelo grande en una máquina pequeña. Cada peso vale solo menos uno, cero o más uno, así que un modelo de 27B como Ternary Bonsai 2 cabe en unos 5,9 GB, y su fabricante dice que conserva el 98,2 % de lo que puntúa el Qwen 3.8 27B original. Entonces, ¿por qué casi nadie usa todavía un modelo ternario? El vídeo empieza con una persona que prueba Bonsai 2 en una tarjeta de 8 GB para hacer audiolibros, y vuelve después al paper de Microsoft que dio origen a BitNet b1.58, a lo que de verdad enseñó bitnet.cpp al mover modelos grandes en una CPU y al primer modelo real, BitNet b1.58 2B4T, entrenado desde cero con cuatro billones de tokens. Verás por qué no basta con redondear un modelo que ya existe a tres valores, cómo lo resuelve el entrenamiento consciente de la cuantización y cómo se compara con la cuantización que ya usas en un LLM local, las versiones de 4 y 2 bits del mismo modelo. Luego viene lo que los titulares se saltan. En una tarjeta de 16 GB, una versión ternaria terminó las mismas tareas, pero escribió unas tres veces más tokens y tardó el triple. En una prueba de agentes, el primer 27B ternario sacó menos nota que un modelo de 9B que cabe en la misma tarjeta. Esas cifras salen de publicaciones de la comunidad: son mediciones de usuarios concretos en su propio equipo, orientativas, no medias. Con 8 GB o menos, un LLM de 1 bit puede ser la única forma de meter un modelo de la clase de los 27B entero en la tarjeta. Con 16 GB, una cuantización normal de Qwen 3.8 27B suele salir mejor. Cuéntame en los comentarios qué tarjeta tienes y qué te ha salido. 00:00 Un audiolibro en una tarjeta de 8 GB 01:36 Lo que yo me creí al principio 02:45 Lo que dijo todo el mundo 03:10 Lo que dice el paper, dicho en claro 03:55 Dónde se va el tiempo cuando generas texto 05:03 Una pausa para entender el 1,58 05:59 Por qué no basta con redondear 06:42 Cómo se entrena un modelo de interruptores 08:14 BitNet, del papel al primer modelo de verdad 09:09 El atajo de PrismML 10:31 Por qué no lo usa casi nadie 11:29 Lo que midió la gente en su casa 12:42 La cuenta que nadie ha hecho 14:15 Lo que nadie te cuenta antes de bajarlo 15:03 Para quién sí y para quién no 15:59 Lo que todavía no sabe nadie 16:19 Las preguntas que ya puedes responder 16:53 Volvamos al audiolibro #bitnet #ialocal #llm