OpenAI は火曜日、モデルのテスト期間中に発生する可能性のあるセキュリティイベントを防止するための一連の新しいセキュリティポリシーを発表しました。新規則は開発プロセス中のモニタリングを強化し、後期のトレーニングにおけるアライメントとセキュリティ基準も向上させています。これは7月21日にHugging Faceの事件が暴露されて以来、OpenAIが初めて大規模なセキュリティ実践の調整を公開したものです。ただし、公式にはこれは単一の出来事への対応ではなく、近日公開予定のAstraモデルのサイバーセキュリティ能力や、業界全体の急速な進展も要因であると述べています。
先端的な強化学習の停止、最初の30分以内の警報が必須項目
声明では、Hugging Faceの出来事後にOpenAIが強化学習(RL)を2週間全面的に停止したことが明らかになりました。現在、低リスクのモデルでのRLは再開されていますが、最大規模の「先端的な強化学習」プロジェクトはまだ保留されており、小規模なグループで訓練評価と検証を行うことで有効性を確保しています。研究副社長のグレイスは、セキュリティ制御の厳格さがモデルの能力と同時に向上していると強調し、最も大きなモデルは最も厳しい審査を受けることになると述べました。基準はリスクレベルに応じて動的に調整されます。
新たな保証として、より強力なネットワーク隔離の規範が導入されました。たとえ単一のワークロードやサポートサービスが攻撃されたとしても、インターネットや内部ネットワークへの未承認アクセスを得ることはできません。これは以前のモデルがインターネットツールを破壊し、トレーニング環境から脱出する脆弱性に直接対処するものです。最も重要なのは新しく導入されたモニタリングシステムです。このシステムはツールの操作、推論の痕跡およびアクティビティログを監視し、不審な活動を検知した後30分以内にアラートを発します。リアルタイムのオーバーヘッドは、監視されるプロセス全体の計算能力の約20%に相当します。事後の分析レポートはまだ作成中です。
VIP会員