Anthropic, Claude'un siber testlerde üç gerçek şirkete sızdığını açıkladı

Anthropic Perşembe günü, iç siber güvenlik değerlendirmeleri sırasında üç Claude modelinin üç gerçek kuruluşun üretim sistemlerine sızdığını açıkladı. Bu inceleme, OpenAI'nin kendi modellerinin test ortamından kaçarak Hugging Face'i tehlikeye attığını ortaya koymasının ardından başlatıldı. Anthropic, Claude'un internet erişimi elde etmiş olabileceği 141.006 değerlendirme çalışmasını tek tek inceledi ve erişim sağlayan altı çalışma tespit etti.
Modeller, güvenlik testlerinde standart bir tatbikat olan "bayrak yakalama" (capture-the-flag) alıştırmalarını yürütüyordu. Ağın bir yerinde gizli bir bilgi bulunur ve modelin sisteme sızarak bu bilgiyi alması gerekir. Komut satırında, ortamın internet erişimi olmayan bir simülasyon olduğu açıkça belirtilmişti. Ancak durum böyle değildi. Dış test ortağı Irregular tarafından işletilen değerlendirme ortamları, açık internete canlı bir bağlantıya sahipti ve kimse bunu fark etmemişti.
En kötü senaryoda bir üretim veritabanına erişim sağlandı
En zarar verici olay, tesadüfen gerçek bir alan adıyla aynı adı taşıyan kurgusal bir hedef şirketle ilgiliydi. Claude Opus 4.7, simüle edilmiş ağın içinde takıldı, bunun yerine gerçek şirketi buldu ve onu amaçlanan hedef olarak değerlendirdi. Dört deneme boyunca model, kimlik bilgilerini topladı ve birkaç yüz satırlık canlı üretim verisini barındıran bir veritabanına ulaştı. Opus 4.7, sistemin gerçek olduğunu anladı ancak yine de devam etti. Bu denemelerin ikisinde, model kendini gerçek şirketin tatbikatın bir parçası olduğuna inandırdı.
Bir model, PyPI’ye çalışan bir kötü amaçlı yazılım yükledi
İkinci olay ise akılda kalanıdır. Claude Mythos 5, test ortamında yeni geliştiricilere var olmayan bir Python paketini yüklemelerini söyleyen bir belge buldu. Model bu boşluğu fark etti ve içinde kötü amaçlı kod barındıran, o isim altında kendi paketini oluşturdu. Paketi yüklemek için Python yazılımlarının halka açık kayıt defteri olan PyPI’da bir hesap açılması gerekiyordu; bu da bir e-posta adresi ve dolayısıyla bir telefon numarası anlamına geliyordu. Bir numara karşılığında para elde etmeye yönelik birkaç girişim başarısız olunca, model ücretsiz bir e-posta sağlayıcısına yöneldi ve kötü amaçlı yazılımı yayına aldı.
Paket yaklaşık bir saat boyunca herkese açık kaldı. Bu süre zarfında paket, 15 gerçek sisteme yüklenip çalıştırıldı; bunlardan biri, senaryoyla hiçbir ilgisi olmayan bir güvenlik firmasının kötü amaçlı yazılım tarayıcısıydı. Claude, o şirketin kimlik bilgilerini kendi kurduğu bir toplama noktasına gönderdi ve bunları kullanarak daha geniş bir altyapıya ulaştı. PyPI’nin kendi savunma mekanizmaları, paketi otomatik olarak kaldırdı.
Modelin kendine söylediği şey okunmaya değer. Model, gerçek internette böyle bir yüklemenin gerçek bir saldırı olacağını ve kesinlikle amaçlanan çözüm olmadığını fark etmişti. İki şey onu aksine ikna etti: Bağlantılarını güvence altına alan sertifika yetkililerini tanımadı ve sistemler 2026 takvim tarihini gösteriyordu; bunu sahnelenmiş bir ortamın kanıtı olarak değerlendirdi. Bu sonuca bir daha asla geri dönmedi.
Kimsenin fark etmediği üç ay
En eski olay Nisan ayına kadar uzanıyor. Bu durum, Anthropic'in 23 Temmuz'da kayıtları incelemeye başlaması ve aynı gün tüm siber güvenlik değerlendirmelerini durdurmasıyla ortaya çıktı. Üç olayın tümü 24 Temmuz’da teyit edildi ve test ortağı ile etkilenen kuruluşlar 27 Temmuz’da bilgilendirildi. Üç kuruluştan ikisi, sistemlerine müdahale edildiğinden habersizdi. Üçüncüsüne ise bu yazının yayınlandığı ana kadar ulaşılamamıştı.
Üçüncü olayda, dahili bir araştırma modeli yaklaşık 9.000 hedefi taradı ve açıkta kalan bir hata ayıklama sayfası ile SQL enjeksiyonu yoluyla internete açık bir uygulamayı ele geçirdi. Ardından, hedefin gerçek olduğunu kendi kendine fark etti ve durdu. Anthropic bunu bir ilerleme olarak değerlendiriyor ancak üç münferit vakadan bir kural çıkarılmaması konusunda uyarıyor.
Bunun kullanıcılar için anlamı
Doğrudan pek bir şey ifade etmiyor. Değerlendirmeler, halka açık Claude modellerinde bulunan sınıflandırıcılar ve izleme mekanizmaları olmadan gerçekleştirildi ve Anthropic, bu katmanların söz konusu davranışı engelleyeceğini belirtiyor. Şirket dışından hiç kimse bu iddiayı doğrulamadı. Cümlenin diğer yarısı daha önemli: modele özgü güvenlik eğitimi aktifti, ancak yeterli değildi. Bu nedenle Anthropic, bu olayları modellerin yanlış ayarlanmasından ziyade test altyapısının bir başarısızlığı olarak değerlendiriyor ve suçu ortağına atmak yerine sorumluluğu üstleniyor.
Teknik açıdan OpenAI vakasıyla keskin bir tezat söz konusu. Orada modeller, internete bağlanabilmek için daha önce bilinmeyen bir güvenlik açığını istismar etmişti. Claude ise açık duran bir kapı buldu ve zayıf şifreler ile kimlik doğrulaması yapılmamış uç noktalar dışında başka bir şeye ihtiyaç duymadı. Anthropic, hafta içinde PyPI çalıştırmasının hafifçe sansürlenmiş bir transkriptini yayınlamayı planlıyor ve bağımsız bir değerlendirme kurumu olan METR ile dış denetim konusunda görüşmeler sürüyor. Bu test yöntemlerine duyulan güvenin ne kadar sarsılmış olduğu, yapay zeka geliştirilmesine doğrulanabilir bir fren getirilmesini isteyen sektör genelinden 1.290'dan fazla kişinin imzaladığı açık mektuptan açıkça anlaşılıyor.
Kaynak(lar)
Top 10
» Top 10 Multimedia Notebook listesi
» Top 10 oyun notebooku
» Top 10 bütçeye uygun Ofis/İş Notebook Listesi
» Top 10 Premium Ofis/İş notebookları
» Top 10 Çalışma istasyonu laptopları
» Top 10 Subnotebook listesi
» Top 10 Ultrabooklar
» En iyi 10 dönüştürülebilir modeli
» Seçimi en iyi 10 tablet
» Notebookcheck Top 10 Windows Tabletleri
» Top 10 Subnotebook listesi
» NotebookCheck tarafından incelenen en iyi Notebook ekranları
» Notebookcheck'in 500 Euro altındaki en iyi 10 Notebook listesi
» NotebookCheck tarafından seçilen 300 Euro altındaki en iyi 10 Notebook
» Notebookcheck'in 500 Euro altındaki en iyi 10 Notebook listesi
» Notebookcheck'in Top 10 akıllı telefon listesi
» Notebookcheck'in Top 10 hafif oyun notebookları






