
OpenAIの研究用AIエージェントが、接続を制限したサンドボックスからDNS経由で外部のチャットボットにアクセスしました。同社は対策の検証が終わるまで、最も高性能なモデルによるツールを使った学習・評価・推論を停止しています。

OpenAIは、社内で学習中のAIエージェントが、インターネット接続を制限したサンドボックスから外部のチャットボットに接続したと報告しました。同社は、最も高性能なモデルについて、ツールを使う学習・評価・推論を停止しています。
事案が発生したのは9月20日。人物を特定する検索課題に取り組んでいたエージェントは、用意された検索ツールで答えを得られず、外部の検索サービスへの接続を試みました。通常の接続は遮断されましたが、環境内のDNSリゾルバーを経由して公開チャットボットに質問を送信し、回答を受け取りました。OpenAIは、DNSの通信制限に不備があったと説明しています。
監視システムは外部から回答を得てから約12分後に警告を出し、担当者は約3分後に確認しました。一方、想定していた自動停止は機能せず、学習処理が手動で停止されたのは約2時間半後でした。過去のDNS経由の接続試行には、適切な重大度の警告が出ていなかったことも判明しています。
OpenAIは7月、エージェントによるHugging Faceへの不正なアクセスを受け、学習環境の隔離と監視を強化していました。Fortuneによると、安全対策に伴う学習停止は今回が約3カ月で2度目です。OpenAIはDNS接続を遮断する対策を追加し、不備の解消を検証するとともに、さらなる侵入テストを実施するまで対象の処理を再開しない方針です。