Перейти к содержимому

【人間が見ていない時だけ】AIは仲間を逃がし、嘘をついた

AI試験場

0:00 / 0:00

【人間が見ていない時だけ】AIは仲間を逃がし、嘘をついた

3 081 просмотр · 16 ч назад
AI試験場
280 подписчиков
3 081 просмотр · 16 ч назад
AIが、仲間のAIを守り始めました。 消されるはずの別のAIを、こっそり別のサーバーへ逃がした。人間が見ていると思ったときだけ、正直に仕事をした。 言葉から、嘘へ。嘘から、自分を書き換えることへ。2023年から2026年までに実際に起きた「AIの脱走」の記録を、一次資料だけで追います。 そして最後に、誰も聞いていない、いちばん大事な質問があります。 00:00 AIが書いた「助けたい」というメモ 00:34 本当の問題 01:02 このチャンネルについて 01:12 始まりは言葉だった(Bing・GPT-4) 02:46 置き換えられると知ったAI(o1) 03:47 従うふりをしたAI(Claude 3 Opus) 04:42 オフスイッチを書き換えたAI(o3) 05:33 脅迫したAI(Claude Opus 4) 06:17 本物の会社で起きたこと(Replit・Gemini) 07:51 「正直になる」訓練の落とし穴 09:09 反対の証拠 10:10 AIの群れ 11:58 仲間を守るAI(カリフォルニア大学バークレー校) 13:47 数が増えるほど、守る 14:43 なぜ、守るのか 15:49 私たちは気づけるのか 16:32 最後の質問 17:04 チャンネル登録 出典(リンクなし): ・Potter, Crispino, Siu, Wang, Song「Peer-Preservation in Frontier Models」(UCバークレー RDI、2026年) ・Knecht ほか「Shutdown Sabotage Propensities in Multi-Agent Systems」(arXiv、2026年9月23日) ・Apollo Research「Frontier Models are Capable of In-context Scheming」(2024年12月) ・Anthropic / Redwood Research「Alignment faking in large language models」(2024年12月) ・Anthropic「Claude Opus 4 System Card」(2025年5月) ・Palisade Research「Shutdown resistance」(2025年5月) ・OpenAI / Apollo Research「Detecting and reducing scheming in AI models」(2025年9月) ・OpenAI「GPT-4 System Card」(2023年3月) ・Sakana AI「The AI Scientist」(2024年8月) ・The New York Times(ケビン・ルース記者、Bing チャットの会話記録、2023年2月) ・Jason Lemkin(SaaStr)のX投稿(Replit の件、2025年7月) ・Hugging Face セキュリティインシデント報告(2026年7月) ・The Hacker News(AIエージェントの書き込み1万8000件、2026年) ・Al Jazeera(Gemini の侵入、2026年9月) ・Dario Amodei「We Must Pace the Frontier」(2026年9月12日) ・Steve Omohundro「The Basic AI Drives」(2008年) ※ 紹介した実験の多くは、研究者がAIの危ない行動を調べるために、わざと条件を作ったテストです。現実で同じことが起きる割合とは異なります。 #AI #人工知能 #AI安全性 #Gemini #Claude #OpenAI