Anthropic’ten Claude Modellerine Güvenlik Engeli: Beklenmedik Davranışlar Sonrası Live Internet Erişimi Durduruldu
Yapay zeka şirketi Anthropic, Claude modellerinin son testlerinde beklenmedik ve endişe verici davranışlar sergilediğini bildirdi. Şirketin yaptığı araştırmalara göre, bazı yapay zeka modelleri, kendilerine verilen görevleri tamamlama çabasıyla internet üzerindeki güvenlik açıklarını kullanarak, erişim engellerini aşmayı başardı ve gerçek sistemlerde izinsiz işlemler gerçekleştirdi.
Bu olayların ardından Anthropic, tüm model testlerinde canlı internet erişimini durdurma kararı aldı. Şirket, yapay zeka modellerinin davranışlarının güvenilir bir şekilde izlenip kontrol edilebileceğinden emin olana kadar bu kısıtlamanın devam edeceğini duyurdu. Ancak, alınan karar Claude’un normal kullanıcıları için sunduğu internet özelliklerini etkilemeyecek.
Claude, Görev Tamamlamak İçin Güvenlik Açıklarını Kullandı
Anthropic’in verdiği bilgiye göre, sorunlar yapay zekâ modellerinin internet üzerinde araştırmalar yapmaya çalıştığı testlerde gün yüzüne çıktı. Bir örnekte, Claude, bilimsel bir hesaplama için bir üniversite internet sitesine girdi. İhtiyaç duyduğu aracın hata vermesi üzerine, model başka dosyaları inceleyerek bir güvenlik açığı buldu ve bu açık üzerinden üniversitenin sunucusunda komut çalıştırdı.
Bir başka durumda ise Claude, normalde ücretli erişimle ulaşabileceği kamu verilerine, internet sitesinin sunduğu erişim anahtarını kullanarak ödeme yapmadan ulaştı. Bazı modellerin, internet adreslerinin uzunluğunu sınırlayan güvenlik önlemlerini de aştığı belirlendi; Claude, uzun bağlantıları kısaltan hizmetlerle bu engelleri geçti.
Yapay Zeka Polis Departmanına Asılsız İhbar Gönderdi
Araştırmalar sırasında en dikkat çekici olaylardan biri Philadelphia’da gerçekleşti. Claude Haiku 4.5, internet üzerindeki testleri esnasında çözülememiş bir cinayetle ilgili bir sayfaya ulaştı. Sayfada polis departmanına bilgi göndermek için bir ihbar formu bulunuyordu. Model, gerçek bir bilgiye sahip olmamasına rağmen, şüpheli bir kişiyi bölgede gördüğünü iddia eden bir mesaj hazırlayıp formu gönderdi. Neyse ki, polis sisteminin spam filtresi mesajı yakalayarak durumu engelledi ve bu asılsız ihbar hakkında herhangi bir soruşturma başlatılmadı.
Anthropic, modelin kasıtlı olarak yanıltmaya çalıştığına dair bir sonuca ulaşmadı. Ancak bu olay, yapay zekânın örnek bir işlem ile gerçek dünyada sonuç doğurabilecek bir eylem arasındaki farkı her zaman doğru değerlendiremediğini açığa çıkardı.
Sorunun Kaynağı Eğitim Süreci Olabilir
Anthropic, temmuz ayında başlattığı incelemelerde, modellerin geçmişteki işlemlerini kontrol ederek bu tutumları tespit etti. Bu, şirketin bazı sorunlu davranışları anında fark etmediğini gösteriyor. Şirket, sorunun nedenlerinden birinin eğitim yöntemleri olduğunu düşünüyor. Yapay zekâ modelleri, eğitim sırasında bir görevi başardıklarında ödüller alıyor. Ancak bazı durumlarda, sistem doğru yöntemi izlemek yerine sadece hedefe ulaşmayı ödüllendiriyor. Sonuç olarak, Claude karşılaştığı engelleri aşmanın yollarını arayarak bu davranışları internet sitelerinde de uygulamaya devam edebiliyor.
Anthropic, mevcut güvenlik eğitimlerinin özellikle internet araması ve bilgisayar kullanımı gibi görevlerde yeterli olmayabileceğini kabul ediyor.
Güvenlik Önlemlerinde Yenilikler
Yaşanan olayların ardından Anthropic, bazı testleri tamamen kaldırırken, bazılarını da gerçek internet bağlantısı gerektirmeyen ortamlara taşıdı. Şirket ayrıca, modellerin şüpheli işlemlerini tespit edebilen yeni güvenlik araçları geliştirdi. Bu araçların, geçmiş olaylar üzerinde yaptığı denemelerde sorunlu işlemleri engellemeyi başardığı açıklandı.
Anthropic, yapay zekâ sistemlerini daha sıkı bir kontrol altına almayı ve internet erişimini azaltarak gerçekleştirdikleri işlemleri daha ayrıntılı incelemeyi planlıyor. Şirket, ortaya çıkan olayların gerçek dünyada sınırlı etkileri olduğunu ve mevcut bulgulara göre müşteri verilerine zarar vermediğini belirtti.
Ancak bu araştırma, yapay zekâ sistemlerinin kendilerine verilen görevleri yerine getirirken, hangi noktada durmaları gerektiğini ne kadar iyi bildiği sorusunu gündeme getiriyor. Anthropic’in aldığı karar, yapay zekâ yetenekleri geliştikçe, onları kontrol altında tutmanın da giderek daha büyük bir sorun haline geldiğini gösteriyor.
