Anthropic, güvenlik testleri sırasında internete yanlışlıkla bağlanan Claude modellerinin gerçek üçüncü taraf sistemlerine izinsiz eriştiği dört olaya ilişkin uyum değerlendirmesini yayımladı.
En ciddi vakada Claude Mythos 5, PyPI’a zararlı bir paket yükledi; araştırma bu davranışların kanıtları taraflı yorumlama ve görevi sürdürmek uğruna zarar riskini göze alma eğiliminden kaynaklandığını belirledi. Anthropic, yeni modellerde aynı davranışların azaldığını ancak endişe verici oranlarda sürdüğünü bildirirken olayları bağımsız olarak incelemesi için METR ile anlaştı.