小さいAIはなぜ、大きいAIのまねをするだけで賢くなるのか?|知識の蒸留の正体
AIゆっくり探究所
0:00 / 0:00
小さいAIはなぜ、大きいAIのまねをするだけで賢くなるのか?|知識の蒸留の正体
2 157 просмотров · 5 дней назад
AIゆっくり探究所
988 подписчиков
2 157 просмотров · 5 дней назад
スマホで動く小さなAIや「軽量版」「小型版」のAIの多くは、大きなAIの答えをまねて作られています。知識の蒸留(2015年に Hinton・Vinyals・Dean が名前を付けた方法)です。この動画では、手書きの数字を見分ける大きなAIと小さなAIを自分のパソコンで実際に育てて測り、論文の原文と合わせて、なぜ「まねるだけ」で小さなAIが賢くなるのかを原理まで確かめます。
まねるのは「これは3」という正解ではなく、先生の答えの確率の並び、つまり迷い方です。正解1つは約3.3ビットしか教えませんが、迷い方には「3は5と少し似ている」といった字どうしの似かたが入っています(暗黒知識)。だから、3の絵を1枚も見せずに学ばせた生徒が、テストの3を967枚/1010枚当てました。
ところが迷い方には先生の癖も入っています。フクロウ好きの先生に数字の列だけを書かせると、その数字で学んだ生徒までフクロウ好きになる(サブリミナル学習・2025年。2026年4月に Nature に掲載)。写るのは先生と生徒が同じ出発点(同じ初期値)から育ったときだけで、そこには数式の説明があります。自分でも小さな形で再現しました。
■ 自分で測ったもの(MNIST・CPU)
・先生:1200-1200 の網(ドロップアウト・絵を2画素までずらす)。テスト1万枚の誤り 104個・97個・101個。
・生徒(800-800):正解だけで学ぶと誤り 169個・160個・160個、先生の確率(温度20)をまねると 127個・123個・117個。3回とも、まねた方が少ない。
・テストの3の絵への先生の答え:温度1で 3が99.99%・5が10万分の2.4。温度4で 3が87%・5が6%・9が1.9%・8が1.7%。
・学習の6万枚から3を全部抜いて先生をまねた生徒:テストの3(1010枚)のうち 967枚・967枚・971枚が正解(3の底上げを少し足すと 989枚・993枚・988枚)。正解だけで学んだ生徒は3が0枚。
・6万枚から1800枚だけで学ぶと、正解だけは誤り834個、先生の確率は346個。
・サブリミナル学習の手書き数字の実験を、公式のコードと同じ条件で10回:ノイズの絵だけで余分な出口3個をまねた生徒は、先生と同じ初期値なら 39%〜67%、違う初期値なら 5%〜17%(何も学ばない網は 6%〜18%)。1回目はノイズの範囲をずらしてしまい11%。
1つの小さな網・1つの設定での結果なので、設定を変えると数字は変わります。
■ 主な出典
・Hinton, Vinyals, Dean「Distilling the Knowledge in a Neural Network」(2015) https://arxiv.org/abs/1503.02531
・Hinton, Vinyals, Dean「Dark knowledge」TTIC の講演スライド (2014)
・Buciluǎ, Caruana, Niculescu-Mizil「Model Compression」KDD 2006
・Ba, Caruana「Do Deep Nets Really Need to be Deep?」(2014) https://arxiv.org/abs/1312.6184
・Urban ほか「Do Deep Convolutional Nets Really Need to be Deep and Convolutional?」(2017) https://arxiv.org/abs/1603.05691
・Kim, Rush「Sequence-Level Knowledge Distillation」(2016) https://arxiv.org/abs/1606.07947
・Sanh ほか「DistilBERT」(2019) https://arxiv.org/abs/1910.01108
・DeepSeek-AI「DeepSeek-R1」https://arxiv.org/abs/2501.12948
・OpenAI の利用規約の引用:Cyberjustice Laboratory ブログ (2025-07-23)
・Furlanello ほか「Born-Again Neural Networks」(2018) https://arxiv.org/abs/1805.04770
・Müller, Kornblith, Hinton「When Does Label Smoothing Help?」(2019) https://arxiv.org/abs/1906.02629
・Shen ほか「Is Label Smoothing Truly Incompatible with Knowledge Distillation」(2021) https://arxiv.org/abs/2104.00676
・Yuan ほか「Revisiting Knowledge Distillation via Label Smoothing Regularization」(2020) https://arxiv.org/abs/1909.11723
・Stanton ほか「Does Knowledge Distillation Really Work?」(2021) https://arxiv.org/abs/2106.05945
・Cho, Hariharan「On the Efficacy of Knowledge Distillation」(2019) https://arxiv.org/abs/1910.01348
・Cloud ほか「Subliminal Learning」(2025) https://arxiv.org/abs/2507.14805 ・公式コード
・Cloud ほか「Language models transmit behavioural traits through hidden signals in data」Nature (2026) https://www.nature.com/articles/s4158...
・Schrodi ほか「Towards Understanding Subliminal Learning」https://arxiv.org/abs/2509.23886
・Nief ほか「Subliminal Learning is a LoRA Artifact」https://arxiv.org/abs/2606.00831
■ 注意
網・重みの空間・矢印・点の群れなどの絵は、仕組みを説明するための模式図やイメージです。蒸留がなぜ効くのか(似かたの情報か、ならしの効果か)や、サブリミナル学習がどんな条件で起きるのかは、まだ議論が続いています。
■ 章
0:00 はじめに(3を1枚も見せずに3が分かるAI)
2:01 第1章 大きな先生と小さな生徒
7:31 第2章 先生の答案に残る迷い
11:28 第3章 正解1つは3.3ビット
14:37 第4章 温度で薄い字を濃くする
18:39 第5章 伝説の数字3
22:10 第6章 言葉のAIの蒸留
25:19 第7章 写せているのか
29:46 第8章 数字の列でフクロウが写る
32:31 第9章 同じ筆跡の生徒にだけ読める
37:25 第10章 まだ分からないこと
■ クレジット
音声合成: AquesTalk (株式会社アクエスト) https://www.a-quest.com/
手書きの数字の絵: MNIST データセット
写真(Wikimedia Commons):
・Geoffrey E. Hinton — Arthur Petron, CC BY-SA 4.0
・Monarch caterpillar — Rhododendrites, CC BY-SA 4.0
・Danaus plexippus — Thomas Bresson, CC BY 2.0
・Digital Behind-the-ear Hearing Aids — Christian P. Nielsen, Public domain
・Tyto alba portrait in tropical setting — Moon1501, CC BY 4.0
・Garbage truck in Geneva — Unnerving duck, CC BY-SA 4.0
・Preparing and slicing carrots — W.carter, CC0
・BMW 3 Series F31 — Calreyn88, CC BY-SA 4.0
BGM: OpenTracks(旧DOVA-SYNDROME)「プラネタリウムガーデン」「さみしいおばけと東京の月」「YOIYAMI-宵闇-」「Serene」「Fireworks」
この動画は東方Projectの二次創作です。