Перейти к содержимому

AIはなぜ、ニューロンの数より多くのことを覚えられるのか|重ね合わせの正体

AIゆっくり探究所

0:00 / 0:00

AIはなぜ、ニューロンの数より多くのことを覚えられるのか|重ね合わせの正体

564 просмотра · 15 часов назад
AIゆっくり探究所
301 подписчик
564 просмотра · 15 часов назад
AIの中のニューロンを1個ずつ調べると、1個が「野球」と「雷」のような関係のないものの両方に反応していたりします。数千個の部屋に、それよりずっと多くの概念が入っている——部屋より多い物を、AIはどうやってしまっているのか。この動画では、その答え「重ね合わせ」を、論文の原文と、自分の手元で動かした実験で原理まで確かめます。 ニューロンは「掛けて足して曲げる」だけの数式1行です。AIの中の概念は、ニューロン1個ずつではなく、高い次元の空間の「向き」としてしまわれています。高い次元では、でたらめな向きどうしがほぼ直角になり(測度の集中)、次元の数よりずっと多くの向きが取れます。概念はめったに同時に出てこないので混線は小さく、残った小さな混線は曲がり角(ReLU)が切り捨てます。その代わり、ニューロン1個には何本もの概念の影が落ちる——これが「多義的なニューロン」の正体です。 手元の Qwen2.5-0.5B では、1個のニューロンが強く反応する話題は40本中の真ん中で13本、1つの言葉で強く反応するのは平均0.43%でした。小さな模型を自分で学習させると、概念がまばらなとき、5本の向きが誰にも教わらずに正五角形に並びました。20個の概念を5次元に入れると、まばらなほど多くしまい、最大で11個しまいました。 後半は、混ざった中身をほどく道具(スパース自己符号化器)。1996年の脳の研究から、2023年の512個のニューロンからの4096個の特徴、2024年の Claude 3 Sonnet からの約3400万個の特徴とゴールデンゲートブリッジの特徴、Golden Gate Claude、隠れた目的を探す2025年の実験まで。そして、まだ分かっていないこと(特徴は全部「向き」なのか・本当の単位は何か・道具は本物を見つけているのか)で締めます。 ■ 主な出典 ・Elhage ほか「Toy Models of Superposition」(2022) https://transformer-circuits.pub/2022... ・Olah ほか「Zoom In: An Introduction to Circuits」(2020) https://distill.pub/2020/circuits/zoo... ・Goh ほか「Multimodal Neurons」(2021) https://distill.pub/2021/multimodal-n... ・Park ほか「The Linear Representation Hypothesis」(2023) https://arxiv.org/abs/2311.03658 ・Wikipedia「Johnson–Lindenstrauss lemma」「Compressed sensing」「Activation function」「Grandmother cell」 ・Olshausen・Field (1996) https://www.nature.com/articles/381607a0 ・Quiroga ほか (2005) https://www.nature.com/articles/natur... / Quiroga (2012) https://www.nature.com/articles/nrn3251 ・Rigotti ほか「The importance of mixed selectivity」(2013) https://www.nature.com/articles/natur... ・Cunningham ほか (2023) https://arxiv.org/abs/2309.08600 ・Bricken ほか「Towards Monosemanticity」(2023) https://transformer-circuits.pub/2023... ・Templeton ほか「Scaling Monosemanticity」(2024) https://transformer-circuits.pub/2024... ・Anthropic「Golden Gate Claude」(2024) https://www.anthropic.com/news/golden... ・Gao ほか (OpenAI, 2024) https://arxiv.org/abs/2406.04093 ・Anthropic「Auditing language models for hidden objectives」(2025) https://www.anthropic.com/research/au... ・Engels ほか(曜日の円, 2024) https://arxiv.org/abs/2405.14860 / Nanda ほか (2023) https://arxiv.org/abs/2301.05217 ・Lecomte ほか(偶然の多義性, 2023) https://arxiv.org/abs/2312.03096 ・Ait Hou・Hwa「Polysemanticity or Polysemy?」(2026) https://arxiv.org/abs/2604.00443 ・Google DeepMind「Negative Results for SAEs on Downstream Tasks」(2025) https://www.greaterwrong.com/posts/4u... ・Korznikov ほか「Sanity Checks for Sparse Autoencoders」(2026) https://arxiv.org/abs/2602.14111 ・Anthropic「On the Biology of a Large Language Model」(2025) https://transformer-circuits.pub/2025... ■ 自分で測ったもの Qwen/Qwen2.5-0.5B-Instruct を手元のCPUで動かし、12層目のニューロン(4864個)が40本の話題の文章にどう反応するかを測りました(強く反応=そのニューロンの最大の半分以上)。でたらめな向きの角度は、次元ごとに4000本の向きを作って測った値です。おもちゃの模型(5個→2次元→5個、20個→5次元)は Elhage ほか (2022) と同じ形の模型を自分で学習させた結果です。小さなモデルと単純な測り方での結果なので、大きなモデルでは数字が変わります。 ■ 注意 平面・矢印・マイクの部屋・天秤などの絵は、仕組みを説明するための模式図です。研究の数字はそれぞれの論文の条件でのもので、どのAIでも同じになるとは限りません。 ■ 章 0:00 はじめに(1個のニューロンが野球にも雷にも?) 2:50 第1章 ニューロンは数式1行 5:45 第2章 1個を調べると混ざっている 8:29 第3章 概念は向きでしまう 12:44 第4章 高い次元はすき間だらけ 18:11 第5章 混線を切り捨てる 22:10 第6章 正五角形が現れる 27:55 第7章 混ぜても戻せる数学 31:04 第8章 混ざったものをほどく 34:49 第9章 橋になったClaude 39:26 第10章 まだ読めていない 44:20 第11章 おわりに ─── 写真(Wikimedia Commons): ・「Closeup of a cat with green eyes' face looking at the viewer」パブリックドメイン ・「TOYOTA Prius Front by Emotional-Led New」根川孝太郎 (Kotaro Negawa) CC BY-SA 4.0 https://commons.wikimedia.org/wiki/Fi... ・「Up Batter Batter (1279942222)」Counselman Collection on Flickr CC BY-SA 2.0 https://commons.wikimedia.org/wiki/Fi... ・「Lightning in Dallas 2015」パブリックドメイン ・「Golden gate bridge sunset (Unsplash)」Denys Nevozhai CC0 ・「US Navy 030819-N-9593R-228 …(MRI) machine」パブリックドメイン 音声合成: AquesTalk (株式会社アクエスト) https://www.a-quest.com/ BGM: OpenTracks(旧DOVA-SYNDROME)「プラネタリウムガーデン」「さみしいおばけと東京の月」「YOIYAMI-宵闇-」「Serene」「Fireworks」 この動画は東方Projectの二次創作です。