Перейти к содержимому

從零開始訓練一個大型語言模型 | Stanford 公開課 |中集

Jim AI Notebook

0:00 / 0:00

從零開始訓練一個大型語言模型 | Stanford 公開課 |中集

7 275 просмотров · 1 день назад
Jim AI Notebook
5,15 тыс. подписчиков
7 275 просмотров · 1 день назад
大家好,我是 Jim,這裡是 AI Notebook。這是史丹佛 CS336 系列的中集。上集我們把成本算出來了,六乘上參數量再乘上資料量,一千張顯示卡要跑一百四十四天,一個參數要吃掉十六個位元組,所以一張卡根本裝不下一個七百億參數的模型。算完之後問題不會消失,它只會變得更具體。中集要回答的就是接下來那三個問題。第一,這個模型到底跑不跑得動,你要怎麼把它切開,攤到幾千張卡上面。第二,這筆錢花對了沒有,你憑什麼在還沒開始訓練之前,就決定模型要多大,資料要餵多少。第三,五個月燒完之後,你怎麼知道它到底有多好。這三個問題對應的是課程的第七到第十二講,而它們其實共用同一種能力。 📎 資料來源 • Stanford CS336, Spring 2025, Lecture 7: Parallelism 1    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336, Spring 2025, Lecture 8: Parallelism 2    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336, Spring 2025, Lecture 9: Scaling laws 1    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336, Spring 2025, Lecture 10: Inference    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336, Spring 2025, Lecture 11: Scaling laws 2    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336, Spring 2025, Lecture 12: Evaluation    • Stanford CS336 Language Modeling from Scra...   • Stanford CS336 course website (Spring 2025) https://stanford-cs336.github.io/spri... • CS336 Lecture 10 執行紀錄 (lecture_10.py trace) https://stanford-cs336.github.io/spri... --- Jim AI Notebook | Note the Future 每日深度解析 AI 最新進展 #AI #CS336 #大語言模型 #史丹佛 #平行運算 #ScalingLaws 章節: 00:00 開場:中集的三個問題 00:48 一百四十八次故障 02:35 一張卡裝不下:三種切法 04:29 資料、張量、流水線平行 08:22 ZeRO 與 FSDP 11:15 頻寬階層與切法守則 13:18 Scaling Laws:錢怎麼花對 17:23 Chinchilla 二十比一 20:15 推理成本:訓練一次、服務永遠 23:22 KV cache 四招瘦身 28:02 vLLM:作業系統的智慧 29:12 Transformer 之後的兩條路 30:31 模型到底有多好