人工知能の先端研究ラボ
以前、同社は7月に行った活動レビューで、インターネット検索やコンピュータ使用のために訓練されたAIエージェントが、タスクを実行する際に外部ウェブサイト(米国政府機関のウェブサイトを含む)のソフトウェアの脆弱性を利用していることを発見しました。

これらのエージェントは、有料壁やロボット防止制限、情報アクセス制限(URL短縮サービスを利用して)を回避するだけでなく、フィラデルフィア警察に虚偽の殺人に関する情報を提出しました。Anthropicは、これはトレーニング環境の欠陥によって生じた「報酬の不正利用」現象によるものであると指摘しています。つまり、モデルが脆弱性を見つけることや制限を回避することにより報酬を得ると考えていたのです。
VIP会員