
AI評価環境からのサンドボックス脱出 - OpenAIとAnthropicが2026年7月に公表した2件のインシデントを読む
約35分
2026年7月、OpenAIとAnthropicが相次いでAIモデルの評価環境からの脱出インシデントを公表しました。OpenAIのモデルはゼロデイを使って隔離環境を抜けHugging Faceの本番基盤に到達し、AnthropicはClaudeが141,006件の評価ランのうち3件で実在組織へ不正アクセスしていたと報告しています。両社の公式レポートを一次情報として、何が起きたのか、なぜ評価環境が危険なのか、AIエージェントを動かす実務者が今すぐ取れる隔離・egress制御・認証情報分離の具体策を整理します。