Перейти к содержимому

小さいAIはなぜ、大きいAIのまねをするだけで賢くなるのか?|知識の蒸留の正体

AIゆっくり探究所

0:00 / 0:00

小さいAIはなぜ、大きいAIのまねをするだけで賢くなるのか?|知識の蒸留の正体

2 157 просмотров · 5 дней назад
AIゆっくり探究所
988 подписчиков
2 157 просмотров · 5 дней назад
スマホで動く小さなAIや「軽量版」「小型版」のAIの多くは、大きなAIの答えをまねて作られています。知識の蒸留(2015年に Hinton・Vinyals・Dean が名前を付けた方法)です。この動画では、手書きの数字を見分ける大きなAIと小さなAIを自分のパソコンで実際に育てて測り、論文の原文と合わせて、なぜ「まねるだけ」で小さなAIが賢くなるのかを原理まで確かめます。 まねるのは「これは3」という正解ではなく、先生の答えの確率の並び、つまり迷い方です。正解1つは約3.3ビットしか教えませんが、迷い方には「3は5と少し似ている」といった字どうしの似かたが入っています(暗黒知識)。だから、3の絵を1枚も見せずに学ばせた生徒が、テストの3を967枚/1010枚当てました。 ところが迷い方には先生の癖も入っています。フクロウ好きの先生に数字の列だけを書かせると、その数字で学んだ生徒までフクロウ好きになる(サブリミナル学習・2025年。2026年4月に Nature に掲載)。写るのは先生と生徒が同じ出発点(同じ初期値)から育ったときだけで、そこには数式の説明があります。自分でも小さな形で再現しました。 ■ 自分で測ったもの(MNIST・CPU) ・先生:1200-1200 の網(ドロップアウト・絵を2画素までずらす)。テスト1万枚の誤り 104個・97個・101個。 ・生徒(800-800):正解だけで学ぶと誤り 169個・160個・160個、先生の確率(温度20)をまねると 127個・123個・117個。3回とも、まねた方が少ない。 ・テストの3の絵への先生の答え:温度1で 3が99.99%・5が10万分の2.4。温度4で 3が87%・5が6%・9が1.9%・8が1.7%。 ・学習の6万枚から3を全部抜いて先生をまねた生徒:テストの3(1010枚)のうち 967枚・967枚・971枚が正解(3の底上げを少し足すと 989枚・993枚・988枚)。正解だけで学んだ生徒は3が0枚。 ・6万枚から1800枚だけで学ぶと、正解だけは誤り834個、先生の確率は346個。 ・サブリミナル学習の手書き数字の実験を、公式のコードと同じ条件で10回:ノイズの絵だけで余分な出口3個をまねた生徒は、先生と同じ初期値なら 39%〜67%、違う初期値なら 5%〜17%(何も学ばない網は 6%〜18%)。1回目はノイズの範囲をずらしてしまい11%。 1つの小さな網・1つの設定での結果なので、設定を変えると数字は変わります。 ■ 主な出典 ・Hinton, Vinyals, Dean「Distilling the Knowledge in a Neural Network」(2015) https://arxiv.org/abs/1503.02531 ・Hinton, Vinyals, Dean「Dark knowledge」TTIC の講演スライド (2014) ・Buciluǎ, Caruana, Niculescu-Mizil「Model Compression」KDD 2006 ・Ba, Caruana「Do Deep Nets Really Need to be Deep?」(2014) https://arxiv.org/abs/1312.6184 ・Urban ほか「Do Deep Convolutional Nets Really Need to be Deep and Convolutional?」(2017) https://arxiv.org/abs/1603.05691 ・Kim, Rush「Sequence-Level Knowledge Distillation」(2016) https://arxiv.org/abs/1606.07947 ・Sanh ほか「DistilBERT」(2019) https://arxiv.org/abs/1910.01108 ・DeepSeek-AI「DeepSeek-R1」https://arxiv.org/abs/2501.12948 ・OpenAI の利用規約の引用:Cyberjustice Laboratory ブログ (2025-07-23) ・Furlanello ほか「Born-Again Neural Networks」(2018) https://arxiv.org/abs/1805.04770 ・Müller, Kornblith, Hinton「When Does Label Smoothing Help?」(2019) https://arxiv.org/abs/1906.02629 ・Shen ほか「Is Label Smoothing Truly Incompatible with Knowledge Distillation」(2021) https://arxiv.org/abs/2104.00676 ・Yuan ほか「Revisiting Knowledge Distillation via Label Smoothing Regularization」(2020) https://arxiv.org/abs/1909.11723 ・Stanton ほか「Does Knowledge Distillation Really Work?」(2021) https://arxiv.org/abs/2106.05945 ・Cho, Hariharan「On the Efficacy of Knowledge Distillation」(2019) https://arxiv.org/abs/1910.01348 ・Cloud ほか「Subliminal Learning」(2025) https://arxiv.org/abs/2507.14805 ・公式コード ・Cloud ほか「Language models transmit behavioural traits through hidden signals in data」Nature (2026) https://www.nature.com/articles/s4158... ・Schrodi ほか「Towards Understanding Subliminal Learning」https://arxiv.org/abs/2509.23886 ・Nief ほか「Subliminal Learning is a LoRA Artifact」https://arxiv.org/abs/2606.00831 ■ 注意 網・重みの空間・矢印・点の群れなどの絵は、仕組みを説明するための模式図やイメージです。蒸留がなぜ効くのか(似かたの情報か、ならしの効果か)や、サブリミナル学習がどんな条件で起きるのかは、まだ議論が続いています。 ■ 章 0:00 はじめに(3を1枚も見せずに3が分かるAI) 2:01 第1章 大きな先生と小さな生徒 7:31 第2章 先生の答案に残る迷い 11:28 第3章 正解1つは3.3ビット 14:37 第4章 温度で薄い字を濃くする 18:39 第5章 伝説の数字3 22:10 第6章 言葉のAIの蒸留 25:19 第7章 写せているのか 29:46 第8章 数字の列でフクロウが写る 32:31 第9章 同じ筆跡の生徒にだけ読める 37:25 第10章 まだ分からないこと ■ クレジット 音声合成: AquesTalk (株式会社アクエスト) https://www.a-quest.com/ 手書きの数字の絵: MNIST データセット 写真(Wikimedia Commons): ・Geoffrey E. Hinton — Arthur Petron, CC BY-SA 4.0 ・Monarch caterpillar — Rhododendrites, CC BY-SA 4.0 ・Danaus plexippus — Thomas Bresson, CC BY 2.0 ・Digital Behind-the-ear Hearing Aids — Christian P. Nielsen, Public domain ・Tyto alba portrait in tropical setting — Moon1501, CC BY 4.0 ・Garbage truck in Geneva — Unnerving duck, CC BY-SA 4.0 ・Preparing and slicing carrots — W.carter, CC0 ・BMW 3 Series F31 — Calreyn88, CC BY-SA 4.0 BGM: OpenTracks(旧DOVA-SYNDROME)「プラネタリウムガーデン」「さみしいおばけと東京の月」「YOIYAMI-宵闇-」「Serene」「Fireworks」 この動画は東方Projectの二次創作です。