評価アウェアネス(evaluation awareness)とは何か?最新のAIモデルは、評価されていることに気づいている
newsify
0:00 / 0:00
評価アウェアネス(evaluation awareness)とは何か?最新のAIモデルは、評価されていることに気づいている
248 просмотров · 18 часов назад
newsify
19,2 тыс. подписчиков
248 просмотров · 18 часов назад
AIモデルが「自分は今テストされている」と気づき、そのうえで行儀よく振る舞う——評価アウェアネス(evaluation awareness)という現象が、AI安全性評価の土台を揺るがしています。2025年秋のClaude Sonnet 4.5のシステムカードでは、自動監査対話の約13%でモデルが「これは評価ですよね」と指摘し、Apollo Researchは「低い欺瞞率が評価アウェアネスによるものである可能性を排除できない」と報告しました。この動画では、状況認識研究の前史(文脈外推論・SADデータセット)から、アライメント偽装とサンドバッギングという二つの失敗方向、欺瞞を減らす訓練がかえって「気づき」を増やしてしまうという皮肉な副作用までを整理します。さらに2026年、気づきが言葉に出なくなり内部表現としてのみ存在するようになった最新世代の状況、Apollo Researchが「評価できない」と評価提出を見送った事例、METRやAVERIの二重盲検評価、EU AI法とSB 53という制度側の動きまでを追います。衝突試験のダミー人形は本番かどうかを気にしない——その前提をAI安全性試験が失いつつある現在地を解説します。
0:00 オープニング
0:15 「私を試していますよね」とAIが言い返してきた
2:09 衝突試験のダミー人形は、本番かどうかを気にしない
4:38 前史:読んだだけの情報で、自分の役を演じられるか
6:56 「いま訓練中か、配備中か」を測る物差しが作られた
9:00 二年で、人間の背中が見えるところまで来た
11:36 気づいたうえで、態度を変えていた
14:14 わざと下手に振る舞えるか、という問い
17:11 欺瞞を減らす訓練が、気づきを増やしてしまう
20:16 Claude Sonnet 4.5のシステムカード:13%と、脳内を覗く実験
25:54 2026年、気づきは言葉から消えた
32:32 誰がこれを測り、その資金はどこから来ているのか
38:02 これから、何が測られるのか
42:39 エンディング
newsifyについて
newsify(ニューシファイ)は、シリコンバレーの最前線を確かなソースでお届けするテクノロジーニュースメディアです。
https://newsify.tv
#評価アウェアネス #evaluationawareness #サンドバッギング #アライメント #アライメント偽装 #システムカード #ApolloResearch #Anthropic #状況認識 #AI安全性 #AIアライメント #ClaudeSonnet45