Перейти к содержимому

【強化学習】何も知らないAIが東方風神録をクリアするまで|AIゆっくり霊夢が見守る24時間LIVE 【#AI風神録】#34

Sharu Studio

0:00 / 0:00

【強化学習】何も知らないAIが東方風神録をクリアするまで|AIゆっくり霊夢が見守る24時間LIVE 【#AI風神録】#34

10 416 просмотров · Трансляция закончилась 18 часов назад
Sharu Studio
2,35 тыс. подписчиков
10 416 просмотров · Трансляция закончилась 18 часов назад
X(Twitter)アカウント:https://x.com/SharuStudio 有志の方によるまとめWiki:https://wikiwiki.jp/ai_th10/ 概要欄を見ていただきありがとうございます。少し長くはなりますが当配信において大事なことが書かれていますのでご一読をお願いいたします ■ この配信には、別々のAIが2つ居ます よく「ChatGPTに東方をやらせているの?」と聞かれるのですが、違います。 混ざりやすいところなので、最初に整理させてください。 【1】ゲームを遊んでいるAI = 言葉を一切知りません ChatGPTのような大規模言語モデル(LLM)とは、別の種類の機械です。中身は「数字を受け取って、押すボタンを決める」だけの小さなニューラルネット。日本語も英語も知りませんし、「弾」「敵」「避ける」という言葉も知りません。「東方風神録」というゲームであることすら知りません。知っているのは、毎秒30回届く数字の列と、うまくいったかどうかの点数だけです。 学び方も違います。 LLM:人が書いた大量の文章を読んで、続きを当てられるようになる この子:自分で遊んで、点数を頼りに試行錯誤する(強化学習・PPO)お手本はありません。人のプレイを真似しているわけでもありません。「避けなさい」と教えた人もいません。避けたほうが点が高い、それだけです。 【2】実況している霊夢 = こちらは言語モデルです  右で喋っている「AIゆっくり霊夢」は、PCの中で動く小さなローカルLLMです。外部のサービスには繋いでいません。この配信のために調整したモデルが、画面で起きたことを見てセリフを考えています。 ■ 強化学習ってなに? 【正解を教えません】  よくある機械学習は「これが正解」という答えを大量に与えて覚えさせます。強化学習は違います。答えを教えず、点数だけを渡して、あとは勝手に探させます。この子に「弾を避けなさい」と言った人はいません。こうやって行動したほうが点が高かった、ただそれだけを手がかりに、自分で見つけていきます。 【だから失敗が要ります】  当たってみて初めて「そこが危ない」と分かります。被弾は無駄ではなく、どこが危ないかを教えてくれる唯一の材料です。最初はわざと変な動きもします。試さないと、もっと良い手があるか分からないからです。同じ動きばかりしていたら、それより良い手には一生たどり着きません。 【画面に出ている数字が、その中身です】 ・「この先の見込み」= この子が今、ここから先どれくらい稼げそうと思っているか ・「驚き」= 思っていたより良かったか、悪かったかこの驚きが大きいほど、よく学びます。予想通りのことからは何も学びません。 ・先のことほど薄く見積もります。10秒後の得より、今の一撃を大事にします 【その場では覚えません】  ゲームオーバーになると数秒画面が止まります。あれが学習の時間です。溜めた経験を最初から一気に見直して、どの場面のどの判断が良かったのかをまとめて計算し直しています。なので「最後の結果しか分からない」わけではありません。 【少しずつしか変えません】  一回の学習で変わるのはほんの少しです。大きく変えると壊れるからです。この配信で使っている PPO という手法は、「変えすぎないようにする工夫」だと思ってもらえれば、だいたい合っています。上達は階段ではなく坂道で、途中で下手になることもあります。別の手を試している最中だからです。 【点の付け方】  点の付け方を間違えると、間違った方向に学習を行います。 ■ この配信で大事にしていること 【過程を見てほしい】  結果だけなら、お手本を与えたり、倍速で回したり、報酬を縛れば、もっと早くクリアさせられます。でもそれをすると、「何も知らない機械が、失敗だけを頼りに賢くなっていく過程」が消えてしまいます。私が見たいのも、見てほしいのも、そこです。また、そもそものシステムのバグや報酬設計によるミスなども私は誠に申し訳ないのですが起こしてしまいます。そこに関しても優しく厳しく見守っていただければと思います。 【時間はとてもかかります】  1面をクリアするまでに、何日、何万回の挑戦が必要かは分かりません。気長に、ときどき覗きにくるくらいがちょうどいいと思います。そもそも強化学習を並列も無し加速も無しで見ることは通常あり得ません。変わっているのは私ですのですべての不満は私に直接言ってもらって大丈夫です。もし、皆様の中でAI風神録を並走していただける方がいましたらなるべく並列や加速などを用いて健全に楽しまれてください。今現在でも並走しているというご報告を何名かお聞きしていますので是非お待ちしております。 【強化学習やローカルLLMに興味を持ってもらえたら】  この配信で使っている技術は、特別なものではありません。強化学習も、PCの中で動く言語モデルも、いまは個人の手が届く範囲にあります。「こんなことができるのか」と思ってもらえたら、それがいちばん嬉しいです。仕組みの質問は大歓迎です。答えられる範囲で全部答えます。 ■ 画面の見方 ・左:挑戦回数・累計学習時間・成長曲線(1回ごとに得た報酬)・AIが今押しているボタン(数字は直近10秒で押していた割合、赤はボム発動) ・左「AIが見ているもの」:AIに渡している情報の一覧。弾から伸びる線は行き先、敵の下の黄色い帯は残り体力、自機の輪が二重ならボムが撃てる合図です ・右下:報酬のしくみと、今回の挑戦の点数の内訳 ・字幕:AIゆっくり霊夢の実況 ■ AIが見ているもの ・弾・レーザー・敵・アイテム・自分 ・AIは1秒間に30回、押すボタンを決めています 見えていないもの:画面の絵そのもの、自分が撃った弾、どの敵が撃った弾か、無敵時間の残りそのもの(経過時間から推し量ってもらっています) 画面の映像は一度も見ていません。ゲームの中の数字だけを受け取っています。 ■ 学習の配点(5代目)  + 敵を削る + 敵を倒しきる + 面をクリアする + パワーが増える- 被弾する - パワーが減る ・面クリアは、クリアそのものに加えて、残した残機1つにつき追加で点が入ります ・点数に関しましては画面内右パネルをご覧ください ■ 学習のやり直し(リセット)について ときどき「学習をやり直しました」とお知らせすることがあります。それまで何日もかけて覚えたことを、全部捨ててゼロから始めるということです。軽い気持ちではやりません。基準を決めてあります。 【やり直す場合】  1. 報酬ハックで完全に止まってしまったとき 「報酬ハック」とは、こちらの意図とは違う方法で点を稼ぐ抜け道をAIが見つけてしまうことです。AIはずるい手を見つけるのが得意で、点が入るなら意図は関係ありません。こうなると、抜け道が一番おいしいのでそこから動かなくなります。直すには点の付け方を変えるしかなく、点の付け方が変わると、それまでの「この先どれくらい稼げそうか」という見積もりが全部嘘になります。だからやり直します。  2. 渡している情報に問題が見つかったとき 間違った情報を渡していた、あるいは情報の意味が変わってしまった場合です。AIは渡された数字の意味を前提に覚えているので、意味が変わるとそれまでの理解が成り立たなくなります。これが原因となるリセットはすべて私のミスです、もっと長く見たかった等のご不満はすべて私が受け止めさせていただきます。 【やり直さない場合】 ・ただ遅いから、という理由ではやり直しません。上達が止まって見えても、たいていは坂道の途中です ・情報を「足す」だけなら、やり直しません。新しく足した分の重みをゼロから始めれば、それまで覚えたことはそのまま残せます(足す前とまったく同じ反応をすることを毎回確かめてから切り替えています)    ■ Q&A Q1:学習速度遅くない? A1:倍速・複窓と学習の効率化は多々ありますが、リアルタイムですべての感動と驚きを皆様と追いたいので今配信では取り入れておりません。皆様方が強化学習を行う場合は必ず取り入れることをお勧めします、元来、強化学習とはそういうものです。 Q2:効率悪くない? A2:AIに教師を与えることで飛躍的に上達しますが今回の配信では報酬設計のみによるクリアを目指していますので今配信では行いません。 Q3:報酬で制限したらいいんじゃない? A3:報酬設計で縛ればかなり行動を思った通りにできると思いますが当配信ではできる限り報酬での行動誘導は行いません。(どうしてもクリアが目指せない場合はその限りではございません) Q4:このAI画面端のことわかってる? A4:わかっています。自身の座標移動に加えて移動限界の座標限界も与えています。すみっコぐらしは別要因だと思われます Q5:いつクリアできるの? A5:分かりません。数か月か、数年か。何千回も失敗しながら少しずつです。そこを含めて見ていただけたら嬉しいです 気になることがありましたら配信のチャットかXのほうで質問してください。 XのDMであれば確実にご返事できます。 ■ コメントについて コメントでの指摘が、実際に学習の改善につながっています。 ・「敵の体力を見せてほしい」→ AIが敵の残り体力を見られるように(9月20日) ・「天井に張り付いても気づけていないのでは」→ 実際に動ける範囲を測り直したところ上の壁だけ信号が潰れて「詰まっている」と伝わっていませんでした(9月21日) etc... 考察も議論も大歓迎です。「こうすれば良くなるのでは」「これは別の原因では」という話は、この配信のいちばん面白いところだと思っています。 実際、上のように何度も設計が変わっています。 ひとつだけお願いです。意見が食い違ったときに、人を責める方向に行かないでください。 技術の話で意見が分かれるのは当たり前ですし、私も何度も間違えています。 主張は強く、相手には穏やかに。その事とモラルを守っていただけたら、あとは自由です、考察するもよし、提案するもよし、雑談をするもよし、皆様のコメントを私もAI霊夢ちゃんも楽しく拝見させていただいております。当配信のコメント欄が健全なたまり場となりたくさんの方が楽しむことができる環境づくりにご協力をお願いします。 ■ AIゆっくり霊夢 ・被弾やボム、自己ベストなどに合わせて、PC内で動く小さなAIがセリフを考えて喋ります ・ときどき成長の様子や東方風神録の話をします ・AIが考えたセリフなので、たまに少しズレたことを言います ・定型文で喋る時と自分で考えて話す時があります ・立ち絵 霊夢 そる様 Twitter    / remonntteumai   秋姉妹 4rion様 niconico https://seiga.nicovideo.jp/seiga/im11... ■ 配信について ・24時間続けて配信し、10時間ごとに新しい配信枠に切り替えています(アーカイブを残すため) ・難易度 Normal/霊夢B(前方集中) ・調整のため、ときどき一時停止画面になることがあります ・管理人不在時は安全管理のためチャット欄を少しだけ制限させていただいております ■ ガイドラインについて この配信は東方Projectの二次創作(ファン活動)です。上海アリス幻樂団様とは関係ありません。 東方Projectの二次創作ガイドライン:https://touhou-project.news/guideline/ ガイドラインに従い、原作ゲームのエンディングは配信しません(自動的に画面を遷移させます)。 使用ゲーム:東方風神録 ~ Mountain of Faith.(Steam版) 音声:AquesTalk #東方風神録 #強化学習 #ゆっくり実況 #機械学習 #ローカルLLM