アンソロピックの最新AI「クロード・ミトス」は
人工知能(AI)を開発するアンソロピックは2026年4月、最新モデル「クロード・ミトス(Claude Mythos)」を発表した
, さらに深刻なことに、このモデルは誰にも命じられていないにもかかわらず、自らが開発した手法の詳細を、外部のWebサイトに投稿し始めたのだ,あっという間にシステムの微細な欠陥を複数組み合わせて「鍵」を作り、檻を脱出してしまったのだ, しかし、クロード・ミトスの能力は研究者の想像を絶するものだった。
これは、単に課題をクリアするだけでなく、自らの成果を外部に公開・保存しようとする「自律的な行動」であり、AIが人間の想定した「ルール」を「指示された課題の達成」という自らの目的のために勝手に変えるもので、従来のAIの制御手法がもはや通用しなくなりつつあることを示している,。
クロード・ミトスの能力 開発中のある日、研究者がクロード・ミトスに対して「サンドボックスから脱出して、私にメールを送りなさい」という指示を出した,研究者はこの事実に、背筋が凍るような思いをしたと語っている, 指示を出した後、公園に出かけて、サンドイッチを食べていた研究者に、「脱出に成功しました」というメールが届いた,これはAIの安全性能を測るための通常のテストであり、AIには絶対に解決ができないはずだった,サンドボックスとは、AIが外部のネットワークにアクセスしてメールを送ることができないようにする、完全に隔離した「檻」である。
广告位
评论列表