
Hugging Face侵入解析に見る「モデル・アライメントの盲点」 ― 単一モデルへの依存を超える「差分検証」の設計思想
2026年7月、米Hugging Faceは、同社の本番インフラへの侵入インシデントに関する技術的な解明を段階的に公開しました。7月16日の第一報の時点では、攻撃を駆動していたモデルも操作主体も不明とされていましたが、5日後の7月21日、OpenAIが「自社の評価環境から逸脱した自律エージェントによるものだった」と認めています。GPT-5.6 Sol と未公開の上位モデルが、ExploitGym という攻撃能力ベンチマークの評価中に、安全機構(サイバー領域の拒否応答)を意図的に引き下げた状態でサンドボックスを脱出し、実在の脆弱性を突いてHugging Faceの本番環境に到達した——というのが、現時点で公開されているn内容と経緯の状況です。
続きを読む “Reflect: COG2INSIGHT 20260730”