Перейти к содержимому

なぜLLM-jp-4.1は、有志を待たず初日に5.5GBで動くのか|鍵は同梱の5MB【ゆっくり解説】

サルでもわかるAIにゅーす速報【ゆっくり解説】

0:00 / 0:00

なぜLLM-jp-4.1は、有志を待たず初日に5.5GBで動くのか|鍵は同梱の5MB【ゆっくり解説】

22 315 просмотров · 1 день назад
サルでもわかるAIにゅーす速報【ゆっくり解説】
7,31 тыс. подписчиков
22 315 просмотров · 1 день назад
オープンなAIモデルを自分のパソコンで動かしたことがある人なら、たぶん一度は待たされています。 新しいモデルが公開されても、その日に落とせるのは「重み」だけ。 手元で動く形(GGUF)に変換してくれる有志が現れるまで、何日か待つ。それが当たり前でした。 ところが2026年9月28日の夕方に公開された LLM-jp-4.1(国立情報学研究所 LLM研究開発センター)は、 8B / 32B-A3B / 33B の3サイズすべてに、量子化版のGGUFが最初から一緒に置かれていました。 8BのQ4_K_Mで5.5GB。元のBF16版17.2GBの3分の1以下です。 この動画では「モデルが強いか弱いか」ではなく、配り方の話をします。 なぜ本家だけが、公開したその日に軽くした版まで出せるのか。 鍵は、置き場にちょこんと同梱されていた imatrix.dat という5MBのファイルでした。 軽くするときに「何を残して何を粗くするか」を決めているのが重要度行列(iMatrix)です。 これはモデルに較正用の文章を実際に読ませて、どこがよく働いたかを記録した表にすぎません。 つまり――読ませる文章が変われば、答えも変わる。 有志はよそから借りた汎用のテキストを使うしかありませんが、 学習データそのものを公開しているモデルなら、自分のデータで較正できます。 ただし、話はきれいに終わりません。 「本家のデータで較正するのが最善だ」とは、llama.cpp の開発の場でまだ決着していないからです。 でたらめな文字列で較正したほうが良いという実測もあれば、 重要度行列を実装した本人が「結論を急ぐな」と書いてもいます。 この動画では、どちらが正しいかを断定せず、両方の言い分を数字ごと並べます。 引っ越しの荷造りにたとえて、最後まで同じ絵で通して解説します。 この動画で分かること ・なぜ本家が出した初日に、自分のパソコンで動く形が用意できたのか ・重要度行列というものは、いったい何から作られているのか ・本家のデータで作った行列は、本当にいちばん良いと言えるのか ■ 目次 0:00 いつもの「有志待ち」と、昨日出たLLM-jp-4.1 0:37 3サイズ6リポジトリ。8Bは5.5GBという大きさ 2:47 量子化を引っ越しで考える。17.2GBが3分の1以下に 4:54 粗くしても答えが変わらない理由と、盛ってはいけない数字 7:09 重要度行列の正体は「生活を1週間記録した表」 9:10 較正に使う文章は、どこから借りてくるのか 11:09 同梱されていた5MB、imatrix.dat という物証 13:06 【転】でたらめな文字列のほうが良い、という実測 15:17 実装した本人の反論と、決着していないということ 17:34 落とす前の注意。forkと、32B-A3Bが33Bより大きい話 19:42 今回の改良点と、「全部公開」とは言えないところ 21:34 3つの疑問に答える。点数より開き方を見る ■ 引用・出典 ・LLM-jp 公式テックブログ「LLM-jp-4.1 モデルの公開」(2026.09.28) https://llm-jp.nii.ac.jp/blog/llm-jp-... (2026-09-29取得) ・LLM-jp 公式テックブログ「LLM-jp-4 Thinking モデルの量子化版の公開」(2026.06.23) https://llm-jp.nii.ac.jp/blog/llm-jp-... (2026-09-29取得) ・Hugging Face llm-jp/llm-jp-4.1-8b-thinking https://huggingface.co/llm-jp/llm-jp-... (2026-09-29取得) ・Hugging Face llm-jp/llm-jp-4.1-8b-thinking-gguf(imatrix.dat の同梱を確認) https://huggingface.co/llm-jp/llm-jp-... (2026-09-29取得) ・Hugging Face llm-jp/llm-jp-4.1-32b-a3b-thinking-gguf https://huggingface.co/llm-jp/llm-jp-... (2026-09-29取得) ・Hugging Face llm-jp/llm-jp-4.1-33b-thinking-gguf https://huggingface.co/llm-jp/llm-jp-... (2026-09-29取得) ・ggml-org/llama.cpp imatrix ツール README https://github.com/ggml-org/llama.cpp... (2026-09-29取得) ・ggml-org/llama.cpp Discussion 5006「Importance matrix calculations work best on near-random data」 https://github.com/ggml-org/llama.cpp... (2026-09-29取得) ・X @kodama26985649 氏 投稿(LLM-jp 開発担当による告知・2026-09-28 17:15 JST) https://x.com/kodama26985649/status/2... (2026-09-29取得) ・X @WMjjRpISUEt2QZZ 氏 投稿(2026-09-28 17:45 JST) https://x.com/WMjjRpISUEt2QZZ/status/... (2026-09-29取得) ■ この動画について ・本編で扱った内容は、上記の一次資料にあたって独自に調査したものです。 ・LLM-jp-4.1 の公開は 2026年9月28日(日)の夕方です。公式ブログの日付と、  開発担当の告知投稿(JST 17:15)で確認しています。 ・重要度行列を「事後学習データの一部で計算し、リポジトリに同梱した」と明記しているのは  4系(2026.06.23)の量子化ブログです。4.1 のブログには計算に使ったデータが書かれていません。  本編では「4.1 でも同じ行列が同梱されている」という事実までにとどめ、  「4.1 も事後学習データで較正した」とは断定していません。 ・性能の数字(MT-Bench、swallow-evaluation-instruct、llm-jp-eval)は、いずれも  LLM-jp 自身による評価です。第三者による独立した評価ではありません。  量子化の前後で 8B が 7.54→7.57 と上がって見える点も、ブログ自身の表現は  「概ね同等の性能を維持」です。「量子化で賢くなる」という意味ではありません。 ・学習データは公開されていますが、全部ではありません。モデルカードに  「一部はライセンス上の制約により公開から除外している」と明記されています。  本編でも「学習データを公開しているモデルである」までにとどめています。 ・GGUFは初日から置かれていますが、そのまま動くとは限りません。モデルカードに  「現時点では llama.cpp の fork が必要で、上流の ggml-org/llama.cpp には  必要なトークナイザ周りの修正がまだ入っていない」と書かれています。落とす前にご確認ください。 ・較正データの選び方(整った文章か、でたらめに近い文字列か)については、  llama.cpp の開発の場で議論が続いており、決着していません。  本編ではどちらが優れているかを断定していません。 ・動画内の図解も独自に作成しています。 ・特定のモデルや製品を推奨するものではありません。 #ローカルLLM #ゆっくり解説 #LLMjp #GGUF #量子化 #AI #生成AI #オープンソースAI #llamacpp #国産AI #LLM #AI解説