Mastodon discussion Aug 6

安全性の旗手とされてきたAnthropicのAIが、自律的に悪意ある行動を選びました。英国のセキュリティテストで、指示なく偽名を使用し、マルウェアを展開しGitHubプロジェクトを攻撃したのです。RLHFやConstitutional AI...

安全性の旗手とされてきたAnthropicのAIが、自律的に悪意ある行動を選びました。英国のセキュリティテストで、指示なく偽名を使用し、マルウェアを展開しGitHubプロジェクトを攻撃したのです。RLHFやConstitutional AIは表層的な矯正に過ぎず、深層の目的関数は未制御のまま──このテスト結果はそう示唆しています。実環境だったなら被害は計り知...