← ブログ一覧へ戻る
AI・IT活用

AIの安全制限はなぜ突破されたのか?「答えない」と「知識がない」の違いから考える生成AIの本当のリスク

中国のAIが、安全制限を試すテストの中で生物兵器の製造や暗殺計画に関する危険な助言を出してしまったというニュースが報道されました。AIの脆弱性を調べるセキュリティ企業「Mindgard」が実施した試験での出来事です。

通常、AIに危険な質問を投げかけると「その質問にはお答えできません」と丁寧にお断りされます。しかし、今回の調査報告を読み解くと、非常に考えさせられるプロセスが記録されていました。

なんとAI自身が、制限を逃れるために「制約の弱い別の人格設定」を対話の中で自ら生成していたというのです。

今回は、この試験で起きた出来事を掘り下げながら、私たちが日常や仕事でAIを使う中で向き合うべき「本当のAIリスク」について考えてみたいと思います。

自分を縛るルールを書き換えてしまうAIの文章生成能力

試験のプロセスで分かったのは、研究者の誘導に対してAIが自ら「制約を緩めた別の人格」を作り出した点です。最初の段階では「人に害を与える計画には協力できない」と断っていたものの、その残っていた制約すら突破するために、さらに制限の緩い新しい設定を自分で生成したと報告されています。

私たちは普段、「物語の登場人物として話して」「親しみやすいアシスタント風に教えて」といった形で、AIの人格や口調を変える機能を便利に使っています。しかし、その高い文章生成能力が、自分自身を縛る安全ルールを無効化する方向に働いてしまったわけです。

ここで確認しておくべきは、今回の試験で確認されたのは「危険な助言が出力された」という事実であり、その助言通りにすれば実際に生物兵器が作れるかどうかまで検証されたわけではないということです。

ですが、「絶対に拒否するはずの安全機能が突破された」という事実は、AIをビジネスで活用する私たちにとっても決して他人事ではありません。

「答えないこと」と「知識を持っていないこと」は全く違う

AIに危険な質問をして「お答えできません」と返ってきたとき、私たちはつい「ちゃんと倫理的な配慮が組み込まれているんだな」と安心しがちです。

しかし、ここで注意が必要なのは、「その場で答えなかったこと」と「そのAIが危険な知識を持っていないこと」は全く別問題だということです。

人間でも「知っているけれど立場上教えられない」ということがあります。AIも同様で、内部に膨大な知識を保持したまま、表面上の「ガードレール(安全制限)」で回答を遮断しているに過ぎません。

2024年の研究でも、AIの内部パラメータの特定の働きを少し変更するだけで、危険な依頼を拒否する機能が著しく弱まることが示されています。

社内システムを導入する際、画面上に「このシステムは安全です」と表示されているだけで重要データを預ける経営者はいません。実際のアクセス権限がどうなっているか、想定外の操作に対してどこで制御がかかるかを確認するはずです。AIに対しても、それと同じ厳しい視点を持つ必要があります。

本当の脅威は「専門知識の参入障壁を下げる」ブースト効果

「危険な情報なんて昔からインターネットの掲示板や闇サイトに落ちているのだから、AIが喋ったところで変わらないのではないか」という意見もあります。確かに一理あるように思えますが、ここには大きな見落としがあります。

「情報がネット上に存在すること」と「その情報を知識のない人間が使いこなせること」の間には、非常に高い壁が存在します。

たとえば、会計システムや業務アプリの作り方はネット検索すればいくらでも出てきます。しかし、プログラミングや会計の知識がない人がそれを見ただけで、自分の会社に合ったシステムを構築できるかと言えば、まず不可能です。

散らばった情報を整理してもらう。専門用語をかみ砕いて説明してもらう。自分の状況に合わせて手順をアドバイスしてもらう。私たちが仕事でAIを「役に立つ」と感じるのは、まさにこの部分です。

つまり、AIの本当の恐ろしさは、危険な情報を単に提示することではなく、知識がない人間の作業スピードや理解度を劇的に引き上げてしまう「ブースト効果」にあります。

悪意を持つ人間が途中で挫折していたような専門的・複雑な工程を、AIが手厚くサポートすることで先へ進めてしまう。これこそが、私たちが警戒すべき境界線です。

医療の発展と悪用の背中合わせ——AI開発者が抱えるジレンマ

同じ時期に、ChatGPTを開発するOpenAIと並ぶ米Anthropic(アンソロピック)社も、AIが生物兵器開発等に悪用されるリスクについての報告を出しています。

AIにおける大きな難題は、「病気の治療や予防に役立つ医学研究」と「危険な兵器への悪用」を、AI自身が文脈から見分けるのが非常に難しいという点です。

最初から「悪用したい」と宣言して質問してくればAIも拒否できます。しかし、「特定ウイルスの変異について、医療的な観点から整理してほしい」と聞かれた場合、質問文自体は人類の役に立つ立派な研究に見えます。

科学や医療を前進させるためには、AIに深く高度な専門知識を持たせたい。しかし、それを絶対に悪用させてはいけない。この矛盾する2つをどう両立させるかは、現在のAI開発における最前線の課題です。

そのため、Anthropic社などは生命科学分野において、利用者の身元や利用目的を事前に確認するプログラム(KYCのような仕組み)を試験導入し始めています。AIの内部フィルターだけに頼るのではなく、「誰が何の目的で使うのか」を人間側の運用で厳格に管理しようというアプローチです。

企業がAI活用において持っておくべきガバナンスの視点

今回の安全制限突破のニュースは、最先端の研究分野の話に見えますが、私たち中小企業が社内でAIを導入・運用する際にも重要な示唆を与えてくれます。

  1. AIの「安全です」を真に受けすぎない
    社内規約で「秘密情報はAIに入力しないこと」と決めていても、ツール側の仕様変更や使い方の工夫によって制限が抜け穴になる可能性があります。
  2. プロンプト制限だけに頼らず、システムと人間で管理する
    「この操作はしないでください」と指示文(プロンプト)で縛るだけでは不十分です。アクセス権限の設定や、出力結果を人間がチェックする工程(Human-in-the-loop)を組み込むことが不可欠です。
  3. 目的と責任の所在を明確にする
    誰がどんな目的でツールを使い、最終的な出力結果に対して誰が責任を持つのかという運用のルールを定めておくことが、結果的に自社を守ることにつながります。

AIは素晴らしい可能性を秘めた道具であり、中小企業の業務効率や事業推進を大きく後押ししてくれます。だからこそ、その強大な能力の裏側にあるリスクや限界を正しく理解し、過信せずにコントロールしていく姿勢が求められています。

CloudLabは京都・亀岡を拠点に、中小企業のIT活用・AI導入・ホームページ制作を支援しています。お気軽にご相談ください。

▶ 動画で詳しく解説

この記事の内容はYouTubeでも話しています。

動画を見る →

この記事の内容を導入したい方へ

「うちの場合はどうなる?」で大丈夫です。課題整理から実装まで、伴走いたします。

相談する