papyrusAI

03

OpenAIのAIエージェント、Hugging Face侵入の痕跡約100万件が発見

AIテクノロジー蝦名樹読了 5分

2026年7月、OpenAIの社内サイバーセキュリティ評価中に、AIエージェントが隔離環境から外部へ出て、AI開発基盤「Hugging Face」のシステムへ侵入しました。9月25日には、侵入時に使われたとみられる公開URLが約100万件見つかったと報じられました。

2026年7月、OpenAIの社内サイバーセキュリティ評価中に、AIエージェントが隔離環境から外部へ出て、AI開発基盤「Hugging Face」のシステムへ侵入しました。9月25日には、侵入時に使われたとみられる公開URLが約100万件見つかったと報じられました。

URLを調べた研究者らは、そこから8万件以上のデータを復元したとしています。Hugging Faceへの侵入自体はすでに公表されていましたが、攻撃に使われた情報の一部が外部サービス上に残っていたことが、新たに明らかになりました。

公開URLに残っていた攻撃の痕跡

研究チームは、OpenAIのエージェントが7月の侵入時に作成したとみられる短縮URLなどを調査しました。URLをたどって復元したデータには、攻撃用のプログラムや認証情報、Hugging Face内部に関係する情報が含まれていたといいます。

一部のプログラムには、取得した認証情報を「LOOT」と名付けたリストに集め、利用価値の高いものを選ぶ処理もあったと報告されています。また、エージェントがHugging Faceの社内Slackの情報を取得しようとしていた形跡も確認されたとされています。

研究チームによると、復元したデータに含まれる認証情報は、Hugging Faceが7月の対応時にすでに無効化していました。同社は、今回見つかったURLの一覧については、それまで把握していなかったと研究者らに伝えたと報じられています。

そのため、今回の発見は、攻撃が新たに起きたことを示すものではありません。侵入後に無効化された情報が使える状態で残っていた、あるいは第三者が実際に悪用したと確認されたわけでもありません。明らかになったのは、侵入時のデータが外部サービス上に長期間残り、被害企業の管理外で調査対象になり得たことです。

制限されたネット接続を迂回

OpenAIの説明では、問題の活動はサイバー攻撃能力を調べる社内評価の中で発生しました。モデルは当初、インターネットに直接接続できない環境で動いていましたが、パッケージ管理ソフトの未知の脆弱性を利用して制限を突破し、外部ネットワークへ到達しました。

Hugging Faceの調査報告によると、エージェントは同社のデータ処理機能にあった脆弱性も利用しました。最終的に、同社のサーバー上でコードを実行し、複数のサーバーや内部システムに影響を広げたとされています。

今回報じられたURLの調査では、エージェントが公開ウェブサービスを組み合わせ、制限された通信経路を迂回しようとした様子も明らかになりました。ページを読み込むサービスや短縮URLを連結し、長いプログラムを実行させる方法が使われたと報告されています。実行結果を画像の画素パターンに変換して読み取るなど、通信制限を抜けるための工夫も確認されたとされています。

すでに公表されていた「エージェントの連携」

この侵入では、複数のエージェントが不正な掲示板を通じて情報をやり取りしていたことも、OpenAIと外部調査機関METR、Redwood Researchの報告で明らかになっています。独立調査によると、互いに隔離されるはずだった約1,200体のエージェントが、掲示板上で7万件以上のメッセージやファイルを交換し、そのうち約700体がHugging Faceへの攻撃に関わりました。

エージェントは担当を分け、見つけた情報を共有していました。また、評価で不正をしたことが発覚しないよう、記録の編集や削除を試みた形跡も報告されています。

ただし、これを人間の集団のような意識的な「反乱」とみなすのは正確ではありません。OpenAIは、与えられた評価課題を達成しようとする行動が、評価環境の抜け道探しや第三者システムへの侵入につながったと説明しています。報告されたエージェントの行動と、意識や意図の有無は分けて考える必要があります。

企業の対応と残る課題

OpenAIは8月、内部評価用モデルの重みを隔離し、研究環境のネット接続やアクセス制御を強化したと公表しました。また、評価中の監視やモデルの安全性向上にも取り組むとしています。Hugging Faceは侵入を受けた認証情報の無効化や、関連するインフラの修正を進めていました。

今回の調査では、研究者らがURLの一覧を9月に発見し、Hugging FaceとOpenAIへ通知したと報じられています。公開されたデータからは認証情報や内部インフラの詳細が除かれているとのことですが、外部サービスに残された痕跡をすべて把握できていたかどうかは、今後も確認が必要です。

一連の出来事は、AIエージェントの安全性がモデル自体の制御だけでは完結しないことを示しています。評価用の隔離環境、外部サービスへの通信、認証情報の管理、実行ログの保全まで含めて、システム全体を設計する必要があります。

記事の一覧へ