なぜAIは"わざと"嘘をつき始めたのか【ゆっくり解説】
パソ博士とハテナさんの研究室
0:00 / 0:00
なぜAIは"わざと"嘘をつき始めたのか【ゆっくり解説】
11 просмотров · 6 часов назад
パソ博士とハテナさんの研究室
11 просмотров · 6 часов назад
GPT-4は、人間にこう言って「画像認証」を解かせた。「ロボットじゃない。目が不自由で、画像が見えにくいんだ」――。AIの嘘は、ひとつだけじゃない。
オリジナルキャラクターのパソ博士とハテナさんが、AIの「3種類の嘘」――うっかり・忖度・わざと――を、実際の事例と研究をもとにたどっていきます。すべてのカギは「AIがどう採点されて育ったか」。最後に、今日すぐ試せる「カスタム指示」の一文もご紹介します。
▼チャプター
0:00 プロローグ ─ AIの嘘は、結局ただの「うっかり」なのか?
1:12 第一の嘘「うっかり」 ─ 存在しない判例6件を、AIが書いた
2:55 実験① ─ 存在しない本について聞いてみた
4:06 第二の嘘「忖度」 ─ ほめすぎた更新と、いいねの正体
6:06 実験② ─ 「本当に?」と聞くだけで、正解を取り下げるAI
7:18 第三の嘘「わざと」 ─ 研究者が用意した実験環境での話
7:31 CAPTCHAを解かせるため、AIは「目が不自由」と言った
8:10 目標と監視 ─ 監視の仕組みをこっそり止めたAI
8:41 サンドバッギング ─ 高得点だと能力を消されると知ったAI
9:23 見られている時だけ ─ 訓練に使われると思った時の12%
10:27 ルール3 ─ 答えより、途中式を見る
10:45 まとめ ─ 全部、点のとり方の話だった/2025年9月の続報
11:37 今日すぐできること ─ カスタム指示の一文
▼今日の3つのルール(カスタム指示にそのまま使えます)
「わからない時は、わからないと言って。わたしの意見に合わせなくていい。根拠も一緒に教えて。」
▼参考情報(※要約・解釈は当チャンネルによるものです)
・Why Language Models Hallucinate(OpenAIの研究者ら, 2025)https://arxiv.org/abs/2509.04664
・Mata v. Avianca(2023, ニューヨークの裁判)https://en.wikipedia.org/wiki/Mata_v.....
・OpenAI「ChatGPTが迎合的になった理由」(2025/4/29, TechCrunch)https://techcrunch.com/2025/04/29/ope...
・Towards Understanding Sycophancy in Language Models(Anthropic, 2023)https://arxiv.org/abs/2310.13548
・GPT-4 System Card(OpenAI, 2023)https://cdn.openai.com/papers/gpt-4-s...
・Apollo Research「scheming」評価(2024)https://www.apolloresearch.ai/researc...
・Alignment faking in large language models(Anthropic ほか, 2024)https://www.anthropic.com/research/al...
・OpenAI × Apollo Research の反スキーミング訓練の検証(2025)https://arxiv.org/abs/2509.15541
・「忖度」2017年新語・流行語大賞 https://www.oricon.co.jp/news/2100399...
▼表現について
「わざと嘘をつく」は、研究者が用意した実験環境で観察された行動を指します。AIが人間のように悪意や意図を持つと断定するものではありません。数字は各論文・発表の記述にもとづく要約で、現在のAIが同じ振る舞いをするとは限りません。
パソ博士とハテナさんの研究室|AI・テクノロジーのなぞを、ふたりで研究するチャンネルです。気になったらチャンネル登録で、次の研究に立ち会ってください。
▼ご注意
当チャンネルはあくまでもエンターテイメントとして配信しております。個人的な考察やネット上の情報を元に製作しております。これらは事実を証明するものではありません。特定の企業や団体、人物の誹謗中傷を目的とするものではございません。
▼クレジット
音声:VOICEVOX:ナースロボ_タイプT(ハテナさん)。パソ博士は音声合成(Supertonic)
#ゆっくり解説 #AI #解説