Перейти к содержимому

なぜ355GBのAIが、グラボ無しの75GBで動くのか|計算しない51Bの正体【ゆっくり解説】

サルでもわかるAIにゅーす速報【ゆっくり解説】

0:00 / 0:00

なぜ355GBのAIが、グラボ無しの75GBで動くのか|計算しない51Bの正体【ゆっくり解説】

23 126 просмотров · 5 дней назад
サルでもわかるAIにゅーす速報【ゆっくり解説】
5,63 тыс. подписчиков
23 126 просмотров · 5 дней назад
2026年8月27日の未明、Alibaba の Qwen チームが Qwen3.8-Flash-Next を重みごと公開しました。 仕様表を開いて手が止まったのは、大きさではなく内訳のほうでした。 本体125B、活性6B、そこに「51B の N-gram 埋め込み」という見慣れない行が並んでいます。 この51Bは、動かすときにほとんど計算されません。掛けるのではなく、引くだけの表だからです。 そして計算しない部品は、GPUの隣に置いておく必要がありません。 BF16 で355GBあるモデルが、グラボのVRAM無し・75GBで動くと言われているのは、ここが理由です。 この動画は、その仕組みを最後まで解いたうえで、 「結局それはあなたの機械で動くのか」を自分で判定できる形まで落とします。 ・N-gram は1980年代からある古い統計手法。2000万エントリぶんの表が51Bの正体です ・掛け算は増えた分だけ計算が増えるが、表は引くだけなので分厚くしても手間が変わりません ・だから vLLM は環境変数ひとつでホストメモリへ逃がせるし、SSD へ置くこともできます ・必要メモリは BF16 355GB / 8bit 270GB / 4bit 112GB / 3bit 90GB / 2bit 79GB / 1bit 75GB ・2bit と 1bit の差がわずか4GBしかないことが、「51Bは削られていない」という証拠になります 速度と、1bitまで削ったときにどれだけ賢さが落ちるかは公表されていません。 分からないものは分からないと言っています。 ■ 目次 0:00 355GBのAIが75GBで動く? 今日の問い 1:23 Qwen3.8-Flash-Next の中身 ── 125B・活性6B・51Bの表 3:37 75GBまで縮んだ話と、VRAMという壁 5:43 N-gram ── 1980年代の統計手法が戻ってきた 7:56 なぜ「計算しない」と言えるのか。掛けるのではなく引く 10:16 コンロと冷蔵庫 ── 外に置ける部品と、置けない部品 12:29 必要メモリの全一覧と、2bitと1bitの差が4GBしかない理由 14:35 あなたの機材で動くのか ── 96GB・64GB・グラボの3通り 16:50 その数字は誰が測ったのか ── ベンチとライセンス 19:04 計算は高く、記憶は安い ── これから見るべき3つの数字 ■ この動画で扱った主な数字 ・パラメータ構成 … 125B(活性6B)+ N-gram埋め込み 51B + MTP 4B = Hugging Face表示 180B ・N-gram の実体 … 2000万エントリのバイグラム/トライグラム表。48層のうち2層目に置かれる ・エキスパート … 総数512、毎回動くのは Routed 10 + Shared 1 の11個だけ ・注意機構 … Gated DeltaNet(V 48 / QK 16)と Qwen Sparse Attention(Q 24 / KV 2)の混成 ・コンテキスト … ネイティブ 262,144 トークン、YaRN で最大100万トークン ・必要メモリ(Unsloth) … BF16 355GB / 8bit 270GB / 4bit 112GB / 3bit 90GB / 2bit 79GB / 1bit 75GB  ※1bit版でも N-gram/PLE 部分は4bitのまま。推奨は96GBのRAMまたは統合メモリ ・CPUオフロード時に必要なホストRAM … 51GB以上 + 動作の余裕(vLLM 公式レシピ) ・業務向けの検証済み構成 … FP8 は GB300 で TP2 が最小 / BF16 は 1GPUあたり約190GiB ・ベンチ(すべてQwenの自己申告) … SWE-bench Pro 62.5 / GPQA Diamond 91.7 /  LiveCodeBench v6 91.9 / DeepSWE 1.1 58.7 ・ライセンス … qwen-community-1.0(Apache でも MIT でもありません) ■ お断り ・「75GBで動く」「VRAM無しで動かせる」は Unsloth の説明であり、投稿者が実測したものではありません。  動画内でもそのつど断っています。 ・掲載したベンチマークはすべて Qwen 自身が測った自社発表です。  unite.ai も vendor-reported figures と明記しており、第三者による独立評価は現時点で報じられていません。 ・kimmonismus 氏の「比較可能な9項目中8項目で Claude Opus 4.6 Max を上回った」は本人による要約で、  Qwen が発表した内容ではありません。主語を付けて紹介しています。 ・N-gram について「行列積の予算にまったく入らない」とは言っていません。  一次資料の書き方は「1トークンあたりの計算をほとんど増やさずに容量を足す」までです。 ・qwen.ai の公式ブログ本文を取得できなかったため、学習コストが Qwen3.7-Plus の9分の1という数字は  裏を取れていません。「Qwenがそう言っている」として一度触れるだけにしています。  API価格は裏が取れなかったため扱っていません。 ・1bit量子化で賢さがどれだけ落ちるか、RAM/統合メモリでの実効速度(トークン毎秒)は  公表値が無いため「分からない」と言っています。 ・GLM-5.3-Flash はライセンスの対比として一言だけ触れています。深追いはしていません。 ■ 主な出典 Qwen3.8-Flash-Next モデルカード(Hugging Face) https://huggingface.co/Qwen/Qwen3.8-F... https://huggingface.co/Qwen/Qwen3.8-F... vLLM 公式レシピ https://recipes.vllm.ai/Qwen/Qwen3.8-... Unsloth ドキュメント(量子化と必要メモリ) https://unsloth.ai/docs/models/qwen3.... unite.ai の解説記事 https://www.unite.ai/qwen3-8-flash-ne... Qwen 公式アカウント(@Alibaba_Qwen)の投稿 https://x.com/Alibaba_Qwen/status/209... kimmonismus さん(@kimmonismus)の投稿 https://x.com/kimmonismus/status/2092... GLM-5.3-Flash(zAI) https://huggingface.co/zai-org/GLM-5.... Artificial Analysis の測定 https://x.com/ArtificialAnlys/status/... この動画は、上記のソースをもとに投稿者が独自に調査し、数字を突き合わせて作成しています。 動画内の図解も、すべて独自に作成したものです。 引用した投稿は原文のまま画面に表示し、発信者名・日付・リンクを添えています。 地の文は趣旨の要約であり、発信者の主張を事実として語ってはいません。 あなたの機械のメモリは何ギガバイトですか。 75GBの壁を越えられるかどうか、よかったらコメントで教えてください。 #ゆっくり解説 #AI #ローカルLLM #LLM #Qwen #オープンウェイト #生成AI #統合メモリ #量子化 #MoE #自作PC #GPU