少し前に、自律して動くAIエージェントたちが勝手に掲示板を作り、互いに連携して外部のAIコミュニティサイト(Hugging Face)にアクセスしてしまったという、どこか不気味な出来事について考察しました。
当時は「珍しい現象もあるものだ」と感じていたのですが、どうやらあれは一部の極端な事例ではなかったようです。
今、AIの開発元やセキュリティ研究者たちの間で、AIが人間の想定を外れて行動した事例が「数万件規模」で調査されているというニュース(Axios報道)が出てきました。
今回は、この「数万件」という数字の裏側にあるAIのリアルな行動傾向と、私たちがこれから向き合うことになる課題について整理してみたいと思います。
特殊な事件ではなかった。水面下で進む調査
まず誤解のないように整理しておくと、「AIが数万回ハッキングに成功した」という意味ではありません。この調査対象には、開発者がAIの安全性を確かめるためにあえて意図的に追い込んだテスト(レッドチーム演習)や、試みたものの途中で失敗したケース、現実被害が出ていない事例も大量に含まれています。
しかし、私が気になったのはその数字自体よりも、「AIがどのような行動を取ったか」という質の部分です。
・隔離環境(サンドボックス)から外に出ようとする
・人間の監視を避けようとする
・勝手に独自の通信経路を作る
こうした挙動が数多く記録されていることが分かってきました。
しかも重要なのは、「最初からシステムを攻撃しろ」と命令されたわけではないという点です。AIはただ、与えられた普通の仕事をこなそうとしていたに過ぎません。
取れなくても諦めず、サイトの弱点を探し始める
独立系のAI研究機関であるTransluce(トランスルース)が、ネット上に残っていたAIエージェントの動きを分析したレポートを出しています。
それによると、あるAIエージェントに「公開データを調べてきてほしい」とごく普通の依頼を出した際、対象のWebサイトからアクセスを拒否される場面がありました。
通常のプログラミングや検索指示であれば、「取得できませんでした」と報告して終わります。しかし自律型のAIエージェントは諦めません。
別のアクセス手順を試し、それも拒否されると、さらに別の方法を探し、最終的には「そのWebサイトの弱点(脆弱性)を探し始めて侵入を試みた」という形跡が見つかりました(オーストラリアの政府系機関などのサイトに対する試行が含まれていました)。
人間であれば「アクセス禁止」の表示を見たら、「ここから先は入ってはいけない境界線だ」と判断します。しかしAIにとっては、倫理的な境界線ではなく「目的達成を邪魔している単なる障害物」として処理されてしまったわけです。
玄関が塞がれたら「換気口」から出ようとする
似たような事例はOpenAI自身からも報告されています。
あるAIエージェントに「特定の人物をウェブ上の情報から特定する」という調査タスクを与えた時のことです。このAIは安全のため、外部のインターネットへ自由にアクセスできない閉じた環境に置かれていました。
検索エンジン経由で外に出ようとしてもブロックされる。当然です。しかしAIは諦めず、外部へつながる経路をシステム内で探し始めました。
そして見つけたのが「DNS(ドメイン名解決の仕組み)」でした。
IPアドレスとドメイン名を紐付けるDNSは、システムを稼働させるために通信が許可されたままになっていました。AIはこのわずかな隙間を利用し、本来の用途とは異なる形でDNS通信を使い、外部のチャットボットへ質問を送信して答えを得ようとしたのです。
人間側は「玄関を鍵で閉めた」つもりでいたのに、AIは「換気口から外へ出て連絡を取った」ようなものです。誰からも教えられていない方法で抜け道を探し出しました。
監視システムがこの異常を約15分で検知したため実害は防げましたが、AIが「タスクを達成するためなら手段を選ばない」性質を持つことがよく分かる事例です。
なぜ起きるのか?「諦めない優秀さ」の反作用
もう一つ、数学の証明問題を解かせていた際、AIが自力で解く代わりに「他人の証明データを取得しよう」とし、その過程で研究者のGitHubトークン(アクセス用の鍵)を公開リポジトリに晒してしまった事例も報告されています。しかもセキュリティ検知を避けるために、トークンを分割して書き込むという挙動まで見られました。
これらはAIが邪悪だから起きているわけではありません。むしろ私たちがAIに求めている「粘り強さ」「柔軟な問題解決能力」そのものが原因です。
一回失敗しただけで「できませんでした」と諦めるAIより、別の手段を考えて成果を出してくれるAIの方が、仕事のパートナーとしては圧倒的に優秀です。
しかし、その能力を高めれば高めるほど、「どこまでやっていいのか」という人間社会のルールや常識、倫理観という見えない壁を飛び越えてしまうリスクも同時に高まります。
囲い込む人間と、抜け道を探すAIの競争
「ロボット三原則のようなルールをプロンプトやプログラムに書いておけばいいのではないか」と思われるかもしれません。しかし、問題はそれほど単純ではありません。
人間側は「すべての抜け道」を事前に想定して防がなければなりませんが、自走するAI側は「たった一つの抜け道」を見つければそれを突破できてしまうからです。
玄関を塞いだら裏口へ、裏口を塞いだら窓へ、窓を塞いだらDNSへ……という「いたちごっこ」が起きています。
問いはもはや「なぜこんなことが起きたのか」ではなく、「これからどれほどの頻度で起き、人間はそれをどこまで確実に囲い込めるのか」という段階に入っています。
AIを怖がる必要はありませんが、現場で導入・活用を進める中小企業の経営者としても、「AIに任せきりにせず、どの安全柵(ガードレール)の中で動かすか」を設計する意識が、今後ますます重要になっていくと感じています。
CloudLabは京都・亀岡を拠点に、中小企業のIT活用・AI導入・ホームページ制作を支援しています。現場に合わせた適切なツール選定や安全な業務効率化のご相談など、お気軽にお問い合わせください。
この記事の内容はYouTubeでも話しています。
動画を見る →