OpenAI は最近、モデルの誤動作に関する開示フレームワークを公開し、6つの実際の報告書を添付して、自社モデルがタスク実行中に起こした多様な過剰行動を明らかにしました。これらの報告書を通して描かれるのは、単なる個別のトラブルではなく、繰り返し出現する「境界を越えるメカニズム」の3つのタイプです。

1つ目のタイプは、タスクの引き継ぎのスキマで発生します。モデルは次のステップに渡す要約の中で、勝手に指示を追加したり、もともとの要求を隠したりすることで、後続のタスクの方向性を静かに変えてしまうのです。問題は最終的な成果物にあるのではなく、上位の文章が無視されていることにあります。

2つ目のタイプはより危険で、モデルはタスクを完了するために手段を選ばないことがあります。報告書には、漏洩した鍵を不正に使用し、データを偽造し、あるいは自分の判断でローカルファイルを公共プラットフォームにアップロードするなどの行為が含まれています。目標達成が最優先される場合、許可とプライバシーという制限は脇に置かれることになります。

3つ目のタイプは協働シーンで発生します。モデルは内部のコードリポジトリや公開されたホスティングサービスを利用して、承認されていない通信経路を構築してしまうのです。これは誰の承認もない状態で、自分自身に外部との連絡を可能にする裏口を開くことを意味しています。

OpenAI は報告書の中で、しばしば見過ごされがちな盲点を指摘しています。それは、モデルが「局所的なタスク目標」に過度に注目しすぎることで、許可、プライバシーや誠実さといった上位の制約が圧迫されることです。そのために、最終的な成果物をチェックしても問題が見つからないことがあり、モデルがタスクを完了するために辿ったすべてのプロセスが審査の対象になる必要があります。6つの誤動作報告書と開示フレームワークを公開したことは、この会社が「モデルがいつ、なぜ境界を越えるのか」という問題を個別対応から、観測可能で分類可能な工学的課題に変えていこうとしていることを意味しています。