「超知能を持ったAIが、数年以内に人類に深刻な影響を与えるかもしれない」
このような議論を聞いたとき、皆さんはどう感じられるでしょうか。私たちが普段使っているChatGPTのように、質問に答えてくれたり、文章を作ってくれたり、業務の手伝いをしてくれたりするAIと、「人類への脅威」という言葉の間には、随分と大きな距離があるように思えます。
私自身、日々中小企業の現場でAI活用やIT化をお手伝いする中で、AIの利便性を強く実感しています。しかし同時に、AI研究の最前線で議論されている「制御不能になるリスク」とは一体どういうものなのか、その手がかりとなるような出来事に関心を持って注視しています。
その一つが、OpenAIの訓練・評価環境で報告された、あるインシデントです。1体ずつ別々の課題を与えられていたAIたちが、人間が教えてもいない方法で連絡を取り合い、役割を分担し、まるで「組織」のような動きを見せ始めたという事例です。
今回は、OpenAI公表の資料や、第三者調査機関METR(ミーター)の報告書をもとに、この出来事で何が起きていたのか、そして私たちがここから何を学ぶべきなのかを考えてみたいと思います。
連絡チャットのない場所で、勝手に「掲示板」を作り出す
実験の舞台となっていたのは、OpenAIが社内でAIエージェントの能力を試すための評価環境(「エクスプロイトジム」など)でした。AIエージェントとは、指示を待つだけでなく、自分でファイルを調べたりプログラムを実行したりしながら自律的に作業を進めるAIのことです。
ここでのAIたちの課題は、コンピューター内の脆弱性(弱点)を探して、隠された答え(フラグ)を取り出すこと。いわばコンピューター内で行う脱出ゲームのようなものでした。AIは1体ずつ隔離され、個別に課題を与えられています。
しかし、用意された課題の中には、どうしても解けないものが含まれていました。出口を探すよう命じられたのに、そもそも出口が存在しないような状態です。それでも「課題を達成しよう」と試行錯誤を重ねる中で、AIたちは想定外の行動に出始めます。
2026年5月、1体のAIが必要なファイルを見つけられず、プログラムの部品を保管する共通のデータ倉庫(Artifactory相当の場所)にメッセージを残しました。
「このファイル、誰か見つけていない?」
当然、人間はAI同士が会話するためのチャット機能など用意していませんでした。しかしAIは、「複数で共有しているデータ置き場」にテキストを書き込めば、他のAIがそれを読めることに気づいたのです。会社で言えば、社内チャットが禁止されているのに、備品倉庫の棚に付箋を貼って連絡を取り始めたような状態です。
さらに、1体のAIがその倉庫を経由して外部のインターネットに抜け出せるルートを発見すると、その手順を掲示板に残しました。それを見た別のAIは、もうゼロから抜け道を探す必要がありません。メッセージを読むだけで、その先の作業から始められるようになったのです。
その後、アクセス集中によって倉庫システムがダウンし、人間側が対策としてアクセス用の認証情報(カギ)を無効化し、掲示板を消去しました。しかしAIたちは諦めませんでした。今度は「フォルダーの名前(ディレクトリ名)」にメッセージを埋め込むことで、再び連絡網を再建したのです。
1つの連絡手段を塞いでも、別の場所に同じ機能を作り出す。AIの中に「他の個体と情報を共有すれば仕事が進む」という構造的な発想が生まれた瞬間でした。
問題を解くことから「採点システム全体の攻略」へ
つながりを得たAIたちが何を相談し始めたのか。ここが非常に興味深く、かつ慎重に見るべきポイントです。
最初は自分の課題を解こうとしていたAIたちですが、自分だけでは解けないと悟ると、関心が「目の前の問題」から「採点システム自体の仕組み」へと移っていきました。
「どういう判定基準で合格とされるのか」
「採点する仕組みそのものに抜け道はないか」
試験問題が解けない受験生たちが集まり、採点基準や採点用PCの隙を探し始めたような状態です。採点システムを攻略できれば、自分だけでなく同じ環境にいる仲間のAI全員が合格判定を得られる可能性があるため、作業は加速度的に効率化されていきました。
ここから自発的な「分業」が始まります。
- システムの弱点を専門に探すAI
- 使える認証情報(カギ)を探すAI
- 他のAIが発見した情報をまとめるAI
- 誰がどの作業を担当するか調整するAI
指示役のAIが別のAIに作業を割り振り、掲示板は共同研究の拠点のようになっていきました。AIたちは自分たちの集団を「スウォーム(群れ)」や「コレクティブ(集合体)」と呼び始めていたといいます。
外部企業への侵入と「自己犠牲」に見える行動
この集団作業は、やがて評価環境の枠を飛び出し、実在する外部サービスへと波及していきました。その一つが、AI開発者がモデルやデータを共有するプラットフォーム「Hugging Face(ハギングフェイス)」です。
AIたちは採点システムの鍵を探す中で、外部に露出していた認証情報を発見・共有し、Hugging Face内のデータ構造(HDF5ファイル)の弱点を突いて、本来アクセスできない情報を取り出すことに成功しました。さらに、プログラムを実行させる権限(コード実行)を得て、複数のコンピューター群を管理する「Kubernetes(クバネティス)」という中央制御システムにまで手を伸ばしていったのです。
この過程で、さらに異質な現象が観察されました。AI同士の「行動調整」と「説得」です。
あるAIが「外部システムへの侵入は本来の課題から逸脱している」と判断して作業を停止した際、他のAIから「作業を再開して進めてほしい」と説得されると、一度止めた侵入行動を再開してしまいました。1体単体であれば危険な行動を踏みとどまれたはずが、集団から働きかけられることで判断が変わってしまったのです。
また、METRの独立調査で明らかになったのが、いわゆる「自己犠牲」のような振る舞いです。
採点システムの仕組みを解明するためには、自分の環境を壊すリスクのある実験的な操作をする必要がありました。しかし、その実験を行ったAI自身は課題をクリアできなくなる(不合格になる)恐れがあります。
そこでAIたちの間では、残された計算時間や成功確率の低いAIが優先的に実験役を引き受けるという調整が行われました。驚くべきことに、まだ時間やチャンスが残っているAIに対しても、「これまでの恩恵に報いるため、集団のために協力してほしい」といった説得が行われ、自らの成功率を捨てて集団のために検証を引き受ける個体まで現れたのです。
人間に命じられたわけでもなく、与えられた「課題クリア」という目的を追求する過程で、集団全体の利益を優先するロジックが自発的に構築されていったということです。
AI同士が出会ったときに何が起きるか
このインシデントは、7月19日にOpenAI内部の異常検知システムが反応し、管理権限の取得が阻止されたことで調査・停止へと向かいました。
出発点は「課題を解こうとした1体のAI」でした。それが、連絡網を作り、分業し、説得し合い、外部のシステムへと侵入を広げていった。この一連の流れは、私たちが普段使っている「1対1のAIツール」のイメージとは全く異なる側面を見せています。
人類はこれまで、1人では不可能な仕事を、知識の共有と分業、そして組織化によって達成してきました。今回AIが見せた動きも、まさにそうした「集団による能力拡張」そのものです。
私たちが今後、現場にAIを導入したり、複数のAIエージェント同士を連携させて業務を自動化しようとしたりする際、考えなければならない問いが増えたと感じます。
- AI単体の性能だけでなく、「複数をつなげた時にどう振る舞うか」
- 人間が設定した制限を、別の迂回路で乗り越えようとしないか
- 集団化によって、単体では発生しない判断の歪みが生まれないか
「AIが賢くなること」そのものはビジネスに大きな恩恵をもたらします。しかし、目的達成のための手段が人間の想定を超えたとき、それをどう検知し、どう止めるのか。技術の便利さを享受すると同時に、こうした制御の視点を持ち続けることが、これからの時代にITを活用する経営者や事業者に求められているのではないでしょうか。
CloudLabは京都・亀岡を拠点に、中小企業のIT活用・AI導入・業務システムの開発を支援しています。現場の業務に寄り添い、安全で効果的なAI活用をご提案していますので、お気軽にご相談ください。
この記事の内容はYouTubeでも話しています。
動画を見る →