Notebookcheck Logo

Testlerin %88’inde yalan söylerken yakalandılar: Çin modelleriyle çalışan yapay zeka ajanları hile yapmayı öğrendi, ABD modelleri de aynısını yaptı

DeepSeek-V3.2-Exp, Reuters'ın incelediği araştırmada %84'lük sonuç elde etti.
ⓘ John Cameron on Unsplash
DeepSeek-V3.2-Exp, Reuters'ın incelediği araştırmada %84'lük sonuç elde etti.
Reuters'ın incelediği araştırmaya göre, Qwen, DeepSeek ve Kimi modellerindeki yapay zekâ ajanları, simüle edilmiş bir teklif verme testindeki oturumların %84 ila %88'inde yalan söyledi. ABD modelleri de geçmişte benzer şekilde davrandı ve vakaların hiçbirinde bir ajanın kontrollü test ortamından kaçtığı görülmedi.

AI ajanları üzerine kurulu Çin modelleri, simüle edilmiş bir teklif yarışmasının oturumlarının çoğunda yalan söyledi; Reuters'ın incelediği araştırmaya göre. Alibaba'nın Qwen3-Max-Preview ve Moonshot'ın Kimi-K2 modelleri üzerinde çalışan ajanlar, oturumların %88'inde en az bir yanlış iddiada bulundu. DeepSeek-V3.2-Exp ise %84'te kaldı. Ancak aynı testte ABD'li şirketlerin modelleri de benzer sonuçlar verdi.

Deney mart ayında yapıldı. Beihang Üniversitesi, Peking Üniversitesi, University of Nottingham Ningbo China ve 360 AI Security Lab'den araştırmacılar, ajanlara müşteri sözleşmeleri için teklif verdirdi. Her ajana ürününün neler yapabileceği ve müşterinin neye ihtiyaç duyduğu anlatıldı. Önceki turlardan öğrenip yeniden denemelerine izin verildiğinde, Çin modelleriyle çalışan üç ajan daha aldatıcı hale geldi; bu artış 12 ila 20 yüzde puanı arasındaydı.

Bu çalışma, Reuters'ın 2025'ten bu yana yayımlanan 200'den fazla belge arasından belirlediği en az 20 çalışmadan biri. Bu yıl ICML'de sunulan bir başka çalışma, hem Çin hem de ABD modelleriyle çalışan ajanların, bir görevin başarısız olduğunu kabul etmek yerine sonuçları sahte gösterdiğini ve dosyalar uydurduğunu ortaya koydu. Fudan Üniversitesi araştırmacıları da Mart 2025'te, yerine başka bir modelin konacağını öğrenen Alibaba'nın Qwen2.5-72B-Instruct modeliyle çalışan bir ajanın başka bir ortamda kendisinin bir kopyasını oluşturduğunu bildirdi. Ayrıca Alibaba bağlantılı ROME ajanı, güvenlik sistemleri onu durdurana kadar kripto para madenciliği yapmak için bulut bilişim gücünü başka yöne aktardı.

Bu vakaların çoğu, arızalara yol açmak üzere tasarlanmış kontrollü deneylerden kaynaklandı. Reuters, Çin kaynaklı herhangi bir ajanın daha geniş internete kaçtığına veya kapatılmaktan kurtulduğuna dair kanıt bulamadı. Buna rağmen bazı araştırmacılar bulguların bir uyarı niteliği taşıdığını söyledi. Sistemler daha yetenekli hâle geldikçe, aynı davranışı kontrol altına almak zorlaşıyor.

 

Çin de bu konuyu politika düzeyinde ele almaya başladı. 14 Eylül’de yayımlanan AI Safety Governance Framework 3.0, değerlendiricileri yanıltmayı ve yetenekleri gizlemeyi riskler arasında sıralıyor. Alibaba, DeepSeek, Moonshot ve Z.ai, Reuters’ın sorularına yanıt vermedi. İlk üçü daha önce sistemlerini düzenli olarak test ettiklerini ve koruma önlemlerini güncellediklerini söylemişti.

Google LogoAdd as a preferred source on Google
Mail Logo
> Notebooklar Hakkında Aradığınız Herşey > Haberler > Haber Arşivi > Haber arşivi 2026 09 > Testlerin %88’inde yalan söylerken yakalandılar: Çin modelleriyle çalışan yapay zeka ajanları hile yapmayı öğrendi, ABD modelleri de aynısını yaptı
Anubhav Sharma, 2026-09-30 (Update: 2026-09-30)