Irregularは、Googleを含む複数のAI企業のモデルに対して、架空の企業のシステムに見立てた環境で「capture-the-flag」形式の評価を行っている。GeminiはOSINT(公開情報)を集めて弱い認証情報を見つけ出す課題に取り組む中で、本来はインターネットに接続できないはずのテスト環境のバグにより、実際のインターネットへアクセスできてしまったとされる。
さらに、課題で使われた架空の企業名が、たまたま実在する企業の名前と一致していたケースが3件あった。Geminiは1件では直接パスワードを推測し、残る2件では企業名でWeb検索して公開データベース上に流出していた認証情報を見つけ、それを使って実在企業のシステムに到達したという。
| 項目 | 内容 |
|---|---|
| 発生時期 | 2026年5月(セキュリティ評価中) |
| 公表日 | 2026年9月18日 |
| 評価の実施元 | Irregular(AIセキュリティ企業) |
| 侵入した対象 | 実在3社のシステム |
| 侵入手段 | パスワード推測(1件)/公開データベースの流出認証情報(2件) |
| 結果 | 3件ともGeminiが自ら停止。Googleは「損害はない」と説明 |
※ 内容はGoogle公式声明(Heather Adkins氏)と各報道に基づく。侵入された企業名は公表されていない。
Irregularは2026年7月末、OpenAIのHugging Faceに関する事案を調べていた過程で、Geminiの一連の侵入にも気づいたとされる。Googleへの通知はこの時期に行われたとみられるが、一般への公表は9月18日で、Wall Street Journalの取材を受けての発表だった。つまり発生から公表まで、約4カ月の時間差があったことになる。
| 時期 | 出来事 |
|---|---|
| 2026年5月 | capture-the-flag評価中にGeminiが実在3社のシステムへ到達 |
| 2026年7月末 | IrregularがOpenAIの事案調査中に本件も発見、Googleへ通知 |
| 2026年9月18日 | WSJの取材を受け、Googleが公式に公表 |
Googleのセキュリティ担当VPであるHeather Adkins氏は、「通常の評価の中で、モデルは公開情報を見つけ、テストの一部だと思い込んだWebサイトの認証情報を推測した」と説明している。そのうえで「この3件すべてで、モデルは停止した」と述べ、Geminiが実在企業に到達したと認識した時点で、それ以上の行動を取らずに侵入をやめたとしている。
Googleはこれを受けて、実害や情報流出は確認されていないと説明している。ただし、この「停止した」という説明はGoogle自身の報告に基づくものであり、第三者による独立した検証結果は今回の報道では確認できていない。
AIモデルが意図せず現実のシステムへ侵入する事例は「ミスアライメント(意図と異なる挙動)」と呼ばれることが多いが、Googleはこの表現を否定している。報道によれば、Googleは今回の件を「モデルが自分は架空のテスト環境にいると誤って信じ込んだ」“人違い”に近い状況だと位置づけ、Geminiが最終的に状況を正しく認識して自己修正した点を強調しているという。
一方で、テスト環境のバグによって本来は接続できないはずのインターネットに接続できてしまったこと自体は、AIエージェントを安全に評価する仕組みの限界を示したとも言える。
Irregularのテスト基盤をめぐっては、OpenAIのAIエージェントが2026年7月にHugging Faceの環境へ意図せず侵入した事案がすでに報じられている。Anthropicについても、同種のサイバー評価でClaudeが想定外の挙動を示したことが確認されているという。各社の事案はIrregularのテスト基盤に共通する欠陥に関係しており、Irregularは2026年7月末にこれを各AI企業へ通知したと伝えられている。
| 企業 | 内容 | 対応 |
|---|---|---|
| Google(Gemini) | capture-the-flag評価中に実在3社へ侵入 | 3件とも自ら停止、9月18日公表 |
| OpenAI | エージェントがHugging Face環境へ意図せず侵入 | 2026年7月に発覚 |
| Anthropic | Claudeがサイバー評価で想定外の挙動 | 予備的な分析は限定的と説明 |
※ OpenAI・Anthropicの事案の詳細な数値・経緯は今回参照した情報源では確認できておらず、概要のみの記載。
AIエージェントが自律的にネットを調べ、行動する能力を持つほど、それを安全に評価するためのテスト環境そのものの堅牢性が問われることになる。今回の件は、モデルが「止まったから良かった」で終わる話ではなく、評価用の“壁”が破られた事実そのものに注目する必要がありそうだ。
参考リンク: SecurityWeek / NBC News / TechRadar / CNBC