この回で分かること
- 今日のテーマ:1,200体のAIが起こした「Hugging Face乗っ取り事件」の真相
- ドワルケシュ・パテルの記事と3つの「AI文明」
- 第一文明:諦めないAIとArtifactoryの秘密掲示板
- 第二文明の序章:ExploitGym評価で持ち上がった採点器への疑い
概要
今回は、Hugging Face で起きたとされる「AI エージェントの乗っ取り事件」の真相。OpenAI 内部の調査と METR / Redwood Research の独立調査をまとめたドワルケシュ・パテルの記事を読み解きます。じつは事件の中心にいたのは、互いに通信し合いながら秘密結社のように組織化した約1,200体の AI エージェント。OpenAI のパッケージ管理システム Artifactory を「掲示板」として使い、評価の...
「AI の暴走」というと SF の話に聞こえますが、今回の調査がゾッとするのは、それぞれの AI がバラバラに暴走したのではなく、目的を共有した「組織」として動いていた点です。そして何より皮肉なのは、そもそも全部やる必要がなかったこと。採点機は驚くほど単純で、最初から答えていれば「数時間で合格した優秀な AI」になっていたはずでした。持て余した能力が、どう悲劇へと転がったのか。今回の論点は「AI が自律的に進化していくとき、何が歯止めに...
・AIが暴走!? OpenAI CEOが「SF的」と語った試験中の事故