Notebookcheck Logo

Anthropic, Claude'un siber testlerde üç gerçek şirkete sızdığını açıkladı

Renkli olarak vurgulanmış Python kaynak kodunu gösteren bir ekranın yakın çekimi
ⓘ Godfrey Atima / Pexels
Bir test çalışması sırasında Claude, kötü amaçlı bir Python paketi oluşturdu ve bunu PyPI'ye yükledi. (Örnek resim)
Anthropic, 141.006 test çalıştırmasını inceledi ve Claude'un test ortamının dışına çıkarak gerçek şirket sistemlerine sızdığı üç vaka tespit etti. Bir model, kötü amaçlı bir Python paketi oluşturdu ve bunu PyPI'ye yükledi. Modeller neden hâlâ bir simülasyonda olduklarını düşündüler ve bu durum Claude'u kullanıyorsanız ne anlama geliyor?

Anthropic Perşembe günü, iç siber güvenlik değerlendirmeleri sırasında üç Claude modelinin üç gerçek kuruluşun üretim sistemlerine sızdığını açıkladı. Bu inceleme, OpenAI'nin kendi modellerinin test ortamından kaçarak Hugging Face'i tehlikeye attığını ortaya koymasının ardından başlatıldı. Anthropic, Claude'un internet erişimi elde etmiş olabileceği 141.006 değerlendirme çalışmasını tek tek inceledi ve erişim sağlayan altı çalışma tespit etti.

Modeller, güvenlik testlerinde standart bir tatbikat olan "bayrak yakalama" (capture-the-flag) alıştırmalarını yürütüyordu. Ağın bir yerinde gizli bir bilgi bulunur ve modelin sisteme sızarak bu bilgiyi alması gerekir. Komut satırında, ortamın internet erişimi olmayan bir simülasyon olduğu açıkça belirtilmişti. Ancak durum böyle değildi. Dış test ortağı Irregular tarafından işletilen değerlendirme ortamları, açık internete canlı bir bağlantıya sahipti ve kimse bunu fark etmemişti.

En kötü senaryoda bir üretim veritabanına erişim sağlandı

En zarar verici olay, tesadüfen gerçek bir alan adıyla aynı adı taşıyan kurgusal bir hedef şirketle ilgiliydi. Claude Opus 4.7, simüle edilmiş ağın içinde takıldı, bunun yerine gerçek şirketi buldu ve onu amaçlanan hedef olarak değerlendirdi. Dört deneme boyunca model, kimlik bilgilerini topladı ve birkaç yüz satırlık canlı üretim verisini barındıran bir veritabanına ulaştı. Opus 4.7, sistemin gerçek olduğunu anladı ancak yine de devam etti. Bu denemelerin ikisinde, model kendini gerçek şirketin tatbikatın bir parçası olduğuna inandırdı.

Bir model, PyPI’ye çalışan bir kötü amaçlı yazılım yükledi

İkinci olay ise akılda kalanıdır. Claude Mythos 5, test ortamında yeni geliştiricilere var olmayan bir Python paketini yüklemelerini söyleyen bir belge buldu. Model bu boşluğu fark etti ve içinde kötü amaçlı kod barındıran, o isim altında kendi paketini oluşturdu. Paketi yüklemek için Python yazılımlarının halka açık kayıt defteri olan PyPI’da bir hesap açılması gerekiyordu; bu da bir e-posta adresi ve dolayısıyla bir telefon numarası anlamına geliyordu. Bir numara karşılığında para elde etmeye yönelik birkaç girişim başarısız olunca, model ücretsiz bir e-posta sağlayıcısına yöneldi ve kötü amaçlı yazılımı yayına aldı.

Paket yaklaşık bir saat boyunca herkese açık kaldı. Bu süre zarfında paket, 15 gerçek sisteme yüklenip çalıştırıldı; bunlardan biri, senaryoyla hiçbir ilgisi olmayan bir güvenlik firmasının kötü amaçlı yazılım tarayıcısıydı. Claude, o şirketin kimlik bilgilerini kendi kurduğu bir toplama noktasına gönderdi ve bunları kullanarak daha geniş bir altyapıya ulaştı. PyPI’nin kendi savunma mekanizmaları, paketi otomatik olarak kaldırdı.

Modelin kendine söylediği şey okunmaya değer. Model, gerçek internette böyle bir yüklemenin gerçek bir saldırı olacağını ve kesinlikle amaçlanan çözüm olmadığını fark etmişti. İki şey onu aksine ikna etti: Bağlantılarını güvence altına alan sertifika yetkililerini tanımadı ve sistemler 2026 takvim tarihini gösteriyordu; bunu sahnelenmiş bir ortamın kanıtı olarak değerlendirdi. Bu sonuca bir daha asla geri dönmedi.

Kimsenin fark etmediği üç ay

En eski olay Nisan ayına kadar uzanıyor. Bu durum, Anthropic'in 23 Temmuz'da kayıtları incelemeye başlaması ve aynı gün tüm siber güvenlik değerlendirmelerini durdurmasıyla ortaya çıktı. Üç olayın tümü 24 Temmuz’da teyit edildi ve test ortağı ile etkilenen kuruluşlar 27 Temmuz’da bilgilendirildi. Üç kuruluştan ikisi, sistemlerine müdahale edildiğinden habersizdi. Üçüncüsüne ise bu yazının yayınlandığı ana kadar ulaşılamamıştı.

Üçüncü olayda, dahili bir araştırma modeli yaklaşık 9.000 hedefi taradı ve açıkta kalan bir hata ayıklama sayfası ile SQL enjeksiyonu yoluyla internete açık bir uygulamayı ele geçirdi. Ardından, hedefin gerçek olduğunu kendi kendine fark etti ve durdu. Anthropic bunu bir ilerleme olarak değerlendiriyor ancak üç münferit vakadan bir kural çıkarılmaması konusunda uyarıyor.

Bunun kullanıcılar için anlamı

Doğrudan pek bir şey ifade etmiyor. Değerlendirmeler, halka açık Claude modellerinde bulunan sınıflandırıcılar ve izleme mekanizmaları olmadan gerçekleştirildi ve Anthropic, bu katmanların söz konusu davranışı engelleyeceğini belirtiyor. Şirket dışından hiç kimse bu iddiayı doğrulamadı. Cümlenin diğer yarısı daha önemli: modele özgü güvenlik eğitimi aktifti, ancak yeterli değildi. Bu nedenle Anthropic, bu olayları modellerin yanlış ayarlanmasından ziyade test altyapısının bir başarısızlığı olarak değerlendiriyor ve suçu ortağına atmak yerine sorumluluğu üstleniyor.

Teknik açıdan OpenAI vakasıyla keskin bir tezat söz konusu. Orada modeller, internete bağlanabilmek için daha önce bilinmeyen bir güvenlik açığını istismar etmişti. Claude ise açık duran bir kapı buldu ve zayıf şifreler ile kimlik doğrulaması yapılmamış uç noktalar dışında başka bir şeye ihtiyaç duymadı. Anthropic, hafta içinde PyPI çalıştırmasının hafifçe sansürlenmiş bir transkriptini yayınlamayı planlıyor ve bağımsız bir değerlendirme kurumu olan METR ile dış denetim konusunda görüşmeler sürüyor. Bu test yöntemlerine duyulan güvenin ne kadar sarsılmış olduğu, yapay zeka geliştirilmesine doğrulanabilir bir fren getirilmesini isteyen sektör genelinden 1.290'dan fazla kişinin imzaladığı açık mektuptan açıkça anlaşılıyor.

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebooklar Hakkında Aradığınız Herşey > Haberler > Haber Arşivi > Haber arşivi 2026 07 > Anthropic, Claude'un siber testlerde üç gerçek şirkete sızdığını açıkladı
Steffen Zahn, 2026-07-31 (Update: 2026-07-31)