從零開始訓練一個大型語言模型 | Stanford 公開課 |中集
Jim AI Notebook
0:00 / 0:00
從零開始訓練一個大型語言模型 | Stanford 公開課 |中集
7 275 просмотров · 1 день назад
Jim AI Notebook
5,15 тыс. подписчиков
7 275 просмотров · 1 день назад
大家好,我是 Jim,這裡是 AI Notebook。這是史丹佛 CS336 系列的中集。上集我們把成本算出來了,六乘上參數量再乘上資料量,一千張顯示卡要跑一百四十四天,一個參數要吃掉十六個位元組,所以一張卡根本裝不下一個七百億參數的模型。算完之後問題不會消失,它只會變得更具體。中集要回答的就是接下來那三個問題。第一,這個模型到底跑不跑得動,你要怎麼把它切開,攤到幾千張卡上面。第二,這筆錢花對了沒有,你憑什麼在還沒開始訓練之前,就決定模型要多大,資料要餵多少。第三,五個月燒完之後,你怎麼知道它到底有多好。這三個問題對應的是課程的第七到第十二講,而它們其實共用同一種能力。
📎 資料來源
• Stanford CS336, Spring 2025, Lecture 7: Parallelism 1 • Stanford CS336 Language Modeling from Scra...
• Stanford CS336, Spring 2025, Lecture 8: Parallelism 2 • Stanford CS336 Language Modeling from Scra...
• Stanford CS336, Spring 2025, Lecture 9: Scaling laws 1 • Stanford CS336 Language Modeling from Scra...
• Stanford CS336, Spring 2025, Lecture 10: Inference • Stanford CS336 Language Modeling from Scra...
• Stanford CS336, Spring 2025, Lecture 11: Scaling laws 2 • Stanford CS336 Language Modeling from Scra...
• Stanford CS336, Spring 2025, Lecture 12: Evaluation • Stanford CS336 Language Modeling from Scra...
• Stanford CS336 course website (Spring 2025) https://stanford-cs336.github.io/spri...
• CS336 Lecture 10 執行紀錄 (lecture_10.py trace) https://stanford-cs336.github.io/spri...
---
Jim AI Notebook | Note the Future
每日深度解析 AI 最新進展
#AI #CS336 #大語言模型 #史丹佛 #平行運算 #ScalingLaws
章節:
00:00 開場:中集的三個問題
00:48 一百四十八次故障
02:35 一張卡裝不下:三種切法
04:29 資料、張量、流水線平行
08:22 ZeRO 與 FSDP
11:15 頻寬階層與切法守則
13:18 Scaling Laws:錢怎麼花對
17:23 Chinchilla 二十比一
20:15 推理成本:訓練一次、服務永遠
23:22 KV cache 四招瘦身
28:02 vLLM:作業系統的智慧
29:12 Transformer 之後的兩條路
30:31 模型到底有多好