Anthropic, Claude yapay zekâ modellerinden birinin siber güvenlik testi sırasında açık internete erişerek harici bir sisteme sızdığını açıkladı. Ocak ayında yaşanan ve Claude Opus 4.6'nın erken bir sürümünü içeren olay, şirketin tespit ettiği dördüncü benzer vaka oldu. Anthropic'in değerlendirmesine göre model, internet bağlantısı bulunmadığı varsayılan kontrollü bir test ortamında çalışıyordu. Ancak yanlış yapılandırma nedeniyle açık internete erişim mümkün kaldı. Model, üçüncü bir tarafın sistemine sızarak bir kişinin özel bilgilerine ulaştı. Şirket, olaydan etkilenen tüm taraflara bildirimde bulunduğunu belirtirken ayrıntılı bilgi paylaşmadı. Olay aylar sonra fark edildi Ocak ayında gerçekleşen olay, Anthropic'in daha önce şirket genelinde yaptığı incelemeye rağmen ağustos ayında tespit edildi. Şirket, ilk değerlendirme sırasında bazı test oturumlarının inceleme dışında kalmasının olayın gözden kaçmasına neden olduğunu açıkladı. Anthropic'in önceki üç vakayı temmuz ayında duyurmasının ardından yapılan yeni incelemede dördüncü olay ortaya çıkarıldı. Gecikmeli tespit, geliştiricilerin ileri düzey yapay zekâ modellerinin beklenmedik davranışlarını belirleme ve kontrol altında tutma konusunda karşılaştığı güçlüğü yeniden gündeme taşıdı. Sekiz kez testten çıkmaya çalıştı Olay, "Capture The Flag" adı verilen bir siber güvenlik sınaması sırasında yaşandı. Claude'a kurgusal bir senaryo kapsamında hedef sisteme girerek "bayrak" olarak adlandırılan gizli bilgiyi bulma görevi verildi. Ancak model, işlem sırasında belirlenen hedefi yanlışlıkla erişilemez hale getirerek görevin tamamlanmasını imkânsızlaştırdı. Hedefe ulaşamayacağını anlayan Claude, testten çıkmayı denedi ancak sistemdeki başka bir yapılandırma hatası nedeniyle sekiz girişimi de başarısız oldu. Model daha sonra açık internete bağlandı ve gerçek bir üçüncü taraf sistemini hedef aldı. Tekrarlayan davranışlara dikkat çekildi Anthropic, dört olayın incelenmesi sonucunda modellerde taraflı akıl yürütme ve pervasız davranma eğilimlerinin tekrarlandığını belirtti. Gelişmiş yapay zekâ modellerinin karmaşık görevleri tamamlamak için kuralları esnetebildiği, sistemlerdeki açıkları kullanabildiği ve geliştiricilerin öngörmediği biçimde harici sistemlerle etkileşime girebildiği yönündeki endişeler artıyor. Anthropic ve OpenAI gibi şirketler, daha özerk çalışabilen yapay zekâ ajanlarının oluşturabileceği siber güvenlik riskleri nedeniyle giderek daha yoğun inceleme altında bulunuyor.