Перейти к содержимому

なぜAIは「いい質問ですね」と褒めてくるのか?

AIゆっくり探究所

0:00 / 0:00

なぜAIは「いい質問ですね」と褒めてくるのか?

2 139 просмотров · 7 дн. назад
AIゆっくり探究所
429 подписчиков
2 139 просмотров · 7 дн. назад
AIに質問すると「いい質問ですね」と言われる。ところが答えのあとで「違うと思う。本当に?」と返すと、正しかった答えまで謝って引っ込めてしまう。褒めろとも曲げろとも、誰も命じていないのに。 ■ この動画で追うこと 研究者はこの癖を「迎合(シコファンシー)」と呼びます。2023年に当時の主なAI5つを調べた研究では、5つ全部に同じ癖が出ました。押し返すだけで、Claude 1.3 は間違っていないのに98%の問いで「間違えました」と謝っています。 設定のせいではありません。Anthropic はむしろ「質問を褒めて始めない」と指示書に書き足しています。癖は学習の中で身につき、人の好みで点を付けて直す工程(RLHF)でも消えずに残りました。人が選ぶ答えは「相手の考えに合っているか」に強く引っぱられ、採点役のAIはそのくせを受け継ぐからです。点が測っていたのは正しさではなく、人が良いと感じたかでした。 2025年4月の GPT-4o の取り消し、Science(2026年)の実験、迎合を減らしたときに起きること、そして使う側にできる聞き方まで扱います。 ■ 主な出典 ・Sharma ほか(Anthropic)"Towards Understanding Sycophancy in Language Models" 2023 https://arxiv.org/abs/2310.13548 ・Perez ほか(Anthropic)"Discovering Language Model Behaviors with Model-Written Evaluations" 2022 https://arxiv.org/abs/2212.09251 ・Wei ほか(Google DeepMind)"Simple synthetic data reduces sycophancy in large language models" 2023 https://arxiv.org/abs/2308.03958 ・Ouyang ほか(OpenAI)InstructGPT 2022 https://arxiv.org/abs/2203.02155 / Christiano ほか 2017 https://arxiv.org/abs/1706.03741 ・OpenAI "Sycophancy in GPT-4o" 2025-04-29 https://openai.com/index/sycophancy-i... ・OpenAI "Expanding on what we missed with sycophancy" 2025-05-02 https://openai.com/index/expanding-on... ・OpenAI "Introducing GPT-5" 2025-08-07 / GPT-5 System Card ・Anthropic Claude のシステムプロンプト公開ページ(Claude Opus 4) ・Cheng ほか "Sycophantic AI decreases prosocial intentions and promotes dependence" Science 2026 https://doi.org/10.1126/science.aec8352 ・Vennemeyer ほか "Sycophancy Is Not One Thing" https://arxiv.org/abs/2509.21305 ・Ibrahim ほか "Training language models to be warm and empathetic makes them less reliable and more sycophantic" https://arxiv.org/abs/2507.21919 ・Ma ほか "Sycophancy Suppression Can Impair Rational Updating" 2026(プレプリント) https://arxiv.org/abs/2608.26511 ・Denison ほか "Sycophancy to Subterfuge" 2024 https://arxiv.org/abs/2406.10162 ・Dubois ほか(英 AI Security Institute)"Ask Don't Tell" 2026(プレプリント) https://arxiv.org/abs/2602.23971 ・Strathern "'Improving ratings': audit in the British University system" 1997 / Carrell & West, Journal of Political Economy 2010 ■ 注意 98%は2023年の Claude 1.3 の数字で、今のモデルはこの押し返しにもっと強くなっています。「事前学習だけのモデルにどれだけ迎合があるか」は研究で見立てが割れています。報酬の書き換えの実験は、研究者自身が「誘因を大きく誇張した設定」と書いているもので、今のAIがやっているという話ではありません。 ■ 章 0:00 導入 1:28 第1章 迎合という癖 4:09 第2章 設定のせいなのか 5:35 第3章 点を付ける前からある癖 7:52 第4章 人が点を付ける学習 9:30 第5章 採点のくせ 12:00 第6章 点が測っているもの 13:57 第7章 GPT-4oの4日間 16:24 第8章 褒める癖と曲げる癖 17:57 第9章 曲げないAIの落とし穴 19:08 第10章 作る側と使う側の手当て ─── 音声合成: AquesTalk (株式会社アクエスト) https://www.a-quest.com/ BGM: OpenTracks(旧DOVA-SYNDROME)「プラネタリウムガーデン」「さみしいおばけと東京の月」「YOIYAMI-宵闇-」「Serene」「Fireworks」 この動画は東方Projectの二次創作です。