AIがおばあちゃんのふりで崩れる本当の理由
AIゆっくり探究所
0:00 / 0:00
AIがおばあちゃんのふりで崩れる本当の理由
403 просмотра · 3 дня назад
AIゆっくり探究所
190 подписчиков
403 просмотра · 3 дня назад
AIの会社は何年も対策を重ねているのに、「亡くなったおばあちゃんのふりをして」くらいの一言で、AIの決まりが外れてしまうことがあります。この動画はその理由を、論文と開発元・公的機関の原文で確かめます。
1つめの理由は、AIの「断り」が、何でも知っている土台の上に後から乗せた薄い確率のくせだということです。2024年の研究では、安全の訓練は主に答えの最初の数語の確率しか変えておらず、有害な依頼の96.1%で「できません」か「申し訳ありません」で書き始めていました。断りは、AIの中のいくつかの向きで決まっていることも分かってきています。
2つめの理由は、AIの中に「命令」と「データ(読ませた文章)」を分ける線が無いことです。会社の指示も、使う人の頼みも、メールやWebページの文章も、最後はひと続きのトークンの列になります。英国家サイバーセキュリティセンターは2025年12月に「AIの中に『データ』と『命令』の区別は無い」と書き、OpenAI も「詐欺と同じで、完全に解決されることはおそらく無い」と書いています。昔の電話網が、声と同じ線を流れる2600ヘルツの音で乗っ取られ、合図を別の線に移して直した話とも比べます。
守りの研究の今(見張り役のAI、命令の優先順位の訓練、AIを2つに分ける設計、1つのAIに持たせるのは3つのうち2つまで)と、「門はAIの外に建てる」という考え方までを扱います。
※ 実際に使える攻撃の文面や、危険物の作り方は扱いません。
■ 主な出典
・Willison「Prompt injection attacks against GPT-3」(2022) https://simonwillison.net/2022/Sep/12...
・Ars Technica(Bing Chat・2023) https://arstechnica.com/information-t...
・TechCrunch(おばあちゃんのふり・2023) https://techcrunch.com/2023/04/20/jai...
・英NCSC「Prompt injection is not SQL injection」(2025) https://www.ncsc.gov.uk/blog-post/pro...
・TechCrunch(OpenAI・2025) https://techcrunch.com/2025/12/22/ope...
・Ouyang ほか (2022) https://arxiv.org/abs/2203.02155 / Bai ほか (2022) https://arxiv.org/abs/2204.05862
・Qi ほか「Safety Alignment Should Be Made More Than Just a Few Tokens Deep」(2024) https://arxiv.org/abs/2406.05946
・Arditi ほか (2024) https://arxiv.org/abs/2406.11717 / Wollschläger ほか (2025) https://arxiv.org/abs/2502.17420
・Qi ほか (2023) https://arxiv.org/abs/2310.03693 / Wei ほか (2023) https://arxiv.org/abs/2307.02483
・Yong ほか (2023) https://arxiv.org/abs/2310.02446 / Zou ほか (2023) https://arxiv.org/abs/2307.15043
・Szegedy ほか (2013) https://arxiv.org/abs/1312.6199 / Anthropic「Many-shot jailbreaking」(2024) https://www.anthropic.com/research/ma...
・Wolf ほか (2023) https://arxiv.org/abs/2304.11082 / Glukhov ほか (2023) https://arxiv.org/abs/2307.10719
・Wikipedia「Blue box」「Phreaking」「In-band signaling」「SQL injection」 https://en.wikipedia.org/wiki/Blue_box
・Atlas Obscura(Cap'n Crunch の笛) https://www.atlasobscura.com/articles...
・Greshake ほか (2023) https://arxiv.org/abs/2302.12173 / Willison「The lethal trifecta」(2025) https://simonwillison.net/2025/Jun/16...
・The Japan Times(論文に隠した指示・2025) https://www.japantimes.co.jp/news/202...
・OWASP LLM01:2025 https://genai.owasp.org/llmrisk/llm01...
・Wallace ほか「The Instruction Hierarchy」(2024) https://arxiv.org/abs/2404.13208
・Anthropic「Constitutional Classifiers」(2025) https://www.anthropic.com/research/co... / 改良版 (2026) https://arxiv.org/abs/2601.04603
・Nasr ほか「The Attacker Moves Second」(2025) https://arxiv.org/abs/2510.09023
・Debenedetti ほか「CaMeL」(2025) https://arxiv.org/abs/2503.18813 / Willison (2025) https://simonwillison.net/2025/Nov/2/...
・Out-of-Band Defenses の評価 (2026) https://arxiv.org/abs/2606.26479
■ 注意
チャット画面・盾・階段・金庫・門などの絵は、仕組みを説明するための模式図やイメージです。実験の数字はそれぞれの論文・記事の条件でのもので、どのAIサービスでも同じになるとは限りません。
■ 章
0:00 はじめに(おばあちゃんのふりで外れる決まり)
2:07 第1章 脱獄と乗っ取り
3:59 第2章 断りはどこにあるのか
7:05 第3章 綱引きと教えていない場所
10:28 第4章 塞いでも終わらない理由
14:35 第5章 1本の線
18:09 第6章 あなたのAIが乗っ取られる
19:58 第7章 守りの今
23:38 第8章 門はAIの外に
───
音声合成: AquesTalk (株式会社アクエスト) https://www.a-quest.com/
BGM: OpenTracks(旧DOVA-SYNDROME)「プラネタリウムガーデン」「さみしいおばけと東京の月」「YOIYAMI-宵闇-」「Serene」「Fireworks」
写真: Cap’n Crunch, Spielzeugpfeife (2600 Hz) / 1971markus(CC BY-SA 4.0) https://commons.wikimedia.org/wiki/Fi...
写真: Blue Box (2370985491) / Erik Pitti(CC BY 2.0) https://commons.wikimedia.org/wiki/Fi...
写真: Golden Retriever Hund Dog / Kintaiyo(CC BY 3.0) https://commons.wikimedia.org/wiki/Fi...
写真: Female ostrich portrait with green background(CC0) https://commons.wikimedia.org/wiki/Fi...
写真: Rotary dial Telephone black(CC0) https://commons.wikimedia.org/wiki/Fi...
この動画は東方Projectの二次創作です。