他们故意阉掉了AI大模型——然后结果惊呆了 | 量化大模型的真相
Jixian Wang 我是王吉贤😃
0:00 / 0:00
他们故意阉掉了AI大模型——然后结果惊呆了 | 量化大模型的真相
15 412 просмотров · 4 месяца назад
Jixian Wang 我是王吉贤😃
138 тыс. подписчиков
15 412 просмотров · 4 месяца назад
0.1 + 0.2 在电脑里不等于 0.3——这不是bug,这是浮点数的本质。
本期从这个最简单的问题出发,彻底搞清楚"量化模型"到底是什么:
为什么本地跑大模型要选Q4、Q8?FP16和BF16有啥区别?
INT4量化之后模型"变笨"了多少?Q4_K_M又是什么鬼?
全程不用公式,争取让每个人都听懂。
本期内容:
• 量化的本质:从模拟信号到数字精度
• FP32 / FP16 / BF16 / FP8 / INT4 逐层拆解
• 为什么本地跑模型必须量化(显存、算力、速度三重原因)
• Q4/Q8/KM量化版本怎么选
• 训练用满血,推理看硬件——实战建议
00:00 开场:0.1+0.2为啥不等于0.3?
01:30 什么是量化?从模拟信号聊起
03:30 精度表达:从无限到有限
06:30 为什么大模型必须量化
08:30 浮点数精度的本质(FP32/FP16/BF16/FP8)
11:00 不同精度的实际权衡
13:30 Q4/Q8与KM混合精度详解
15:30 训练vs推理的精度选择
17:30 总结:你该用什么量化版本
#AI #大模型 #量化 #本地AI #LLM #人工智能 #深度学习 #ollama