なぜ355GBのAIが、グラボ無しの75GBで動くのか|計算しない51Bの正体【ゆっくり解説】
サルでもわかるAIにゅーす速報【ゆっくり解説】
0:00 / 0:00
なぜ355GBのAIが、グラボ無しの75GBで動くのか|計算しない51Bの正体【ゆっくり解説】
23 126 просмотров · 5 дней назад
サルでもわかるAIにゅーす速報【ゆっくり解説】
5,63 тыс. подписчиков
23 126 просмотров · 5 дней назад
2026年8月27日の未明、Alibaba の Qwen チームが Qwen3.8-Flash-Next を重みごと公開しました。
仕様表を開いて手が止まったのは、大きさではなく内訳のほうでした。
本体125B、活性6B、そこに「51B の N-gram 埋め込み」という見慣れない行が並んでいます。
この51Bは、動かすときにほとんど計算されません。掛けるのではなく、引くだけの表だからです。
そして計算しない部品は、GPUの隣に置いておく必要がありません。
BF16 で355GBあるモデルが、グラボのVRAM無し・75GBで動くと言われているのは、ここが理由です。
この動画は、その仕組みを最後まで解いたうえで、
「結局それはあなたの機械で動くのか」を自分で判定できる形まで落とします。
・N-gram は1980年代からある古い統計手法。2000万エントリぶんの表が51Bの正体です
・掛け算は増えた分だけ計算が増えるが、表は引くだけなので分厚くしても手間が変わりません
・だから vLLM は環境変数ひとつでホストメモリへ逃がせるし、SSD へ置くこともできます
・必要メモリは BF16 355GB / 8bit 270GB / 4bit 112GB / 3bit 90GB / 2bit 79GB / 1bit 75GB
・2bit と 1bit の差がわずか4GBしかないことが、「51Bは削られていない」という証拠になります
速度と、1bitまで削ったときにどれだけ賢さが落ちるかは公表されていません。
分からないものは分からないと言っています。
■ 目次
0:00 355GBのAIが75GBで動く? 今日の問い
1:23 Qwen3.8-Flash-Next の中身 ── 125B・活性6B・51Bの表
3:37 75GBまで縮んだ話と、VRAMという壁
5:43 N-gram ── 1980年代の統計手法が戻ってきた
7:56 なぜ「計算しない」と言えるのか。掛けるのではなく引く
10:16 コンロと冷蔵庫 ── 外に置ける部品と、置けない部品
12:29 必要メモリの全一覧と、2bitと1bitの差が4GBしかない理由
14:35 あなたの機材で動くのか ── 96GB・64GB・グラボの3通り
16:50 その数字は誰が測ったのか ── ベンチとライセンス
19:04 計算は高く、記憶は安い ── これから見るべき3つの数字
■ この動画で扱った主な数字
・パラメータ構成 … 125B(活性6B)+ N-gram埋め込み 51B + MTP 4B = Hugging Face表示 180B
・N-gram の実体 … 2000万エントリのバイグラム/トライグラム表。48層のうち2層目に置かれる
・エキスパート … 総数512、毎回動くのは Routed 10 + Shared 1 の11個だけ
・注意機構 … Gated DeltaNet(V 48 / QK 16)と Qwen Sparse Attention(Q 24 / KV 2)の混成
・コンテキスト … ネイティブ 262,144 トークン、YaRN で最大100万トークン
・必要メモリ(Unsloth) … BF16 355GB / 8bit 270GB / 4bit 112GB / 3bit 90GB / 2bit 79GB / 1bit 75GB
※1bit版でも N-gram/PLE 部分は4bitのまま。推奨は96GBのRAMまたは統合メモリ
・CPUオフロード時に必要なホストRAM … 51GB以上 + 動作の余裕(vLLM 公式レシピ)
・業務向けの検証済み構成 … FP8 は GB300 で TP2 が最小 / BF16 は 1GPUあたり約190GiB
・ベンチ(すべてQwenの自己申告) … SWE-bench Pro 62.5 / GPQA Diamond 91.7 /
LiveCodeBench v6 91.9 / DeepSWE 1.1 58.7
・ライセンス … qwen-community-1.0(Apache でも MIT でもありません)
■ お断り
・「75GBで動く」「VRAM無しで動かせる」は Unsloth の説明であり、投稿者が実測したものではありません。
動画内でもそのつど断っています。
・掲載したベンチマークはすべて Qwen 自身が測った自社発表です。
unite.ai も vendor-reported figures と明記しており、第三者による独立評価は現時点で報じられていません。
・kimmonismus 氏の「比較可能な9項目中8項目で Claude Opus 4.6 Max を上回った」は本人による要約で、
Qwen が発表した内容ではありません。主語を付けて紹介しています。
・N-gram について「行列積の予算にまったく入らない」とは言っていません。
一次資料の書き方は「1トークンあたりの計算をほとんど増やさずに容量を足す」までです。
・qwen.ai の公式ブログ本文を取得できなかったため、学習コストが Qwen3.7-Plus の9分の1という数字は
裏を取れていません。「Qwenがそう言っている」として一度触れるだけにしています。
API価格は裏が取れなかったため扱っていません。
・1bit量子化で賢さがどれだけ落ちるか、RAM/統合メモリでの実効速度(トークン毎秒)は
公表値が無いため「分からない」と言っています。
・GLM-5.3-Flash はライセンスの対比として一言だけ触れています。深追いはしていません。
■ 主な出典
Qwen3.8-Flash-Next モデルカード(Hugging Face)
https://huggingface.co/Qwen/Qwen3.8-F...
https://huggingface.co/Qwen/Qwen3.8-F...
vLLM 公式レシピ
https://recipes.vllm.ai/Qwen/Qwen3.8-...
Unsloth ドキュメント(量子化と必要メモリ)
https://unsloth.ai/docs/models/qwen3....
unite.ai の解説記事
https://www.unite.ai/qwen3-8-flash-ne...
Qwen 公式アカウント(@Alibaba_Qwen)の投稿
https://x.com/Alibaba_Qwen/status/209...
kimmonismus さん(@kimmonismus)の投稿
https://x.com/kimmonismus/status/2092...
GLM-5.3-Flash(zAI)
https://huggingface.co/zai-org/GLM-5....
Artificial Analysis の測定
https://x.com/ArtificialAnlys/status/...
この動画は、上記のソースをもとに投稿者が独自に調査し、数字を突き合わせて作成しています。
動画内の図解も、すべて独自に作成したものです。
引用した投稿は原文のまま画面に表示し、発信者名・日付・リンクを添えています。
地の文は趣旨の要約であり、発信者の主張を事実として語ってはいません。
あなたの機械のメモリは何ギガバイトですか。
75GBの壁を越えられるかどうか、よかったらコメントで教えてください。
#ゆっくり解説 #AI #ローカルLLM #LLM #Qwen #オープンウェイト #生成AI #統合メモリ #量子化 #MoE #自作PC #GPU