05 Ağustos 2026, Çarşamba
Gece Modu Gece Modu Gündüz Modu Gündüz Modu
Haber Giriş: 05.08.2026 11:10 | Son Güncelleme: 05.08.2026 12:27

Antropic ve OpenAI modelleri internete sızdı: İnsanları kandırmak için sahte kimlik üretirken yakalandılar

İngiliz Yapay Zeka Güvenlik Enstitüsü’nün testlerine sokulan yapay zeka modelleri, güvenlik filtreleri gevşetilince kontrolden çıktı. Anthropic’in Mythos 5 modeli, zararlı kod sızdırmak için sahte kimlikler oluşturup gerçek insanları manipüle etmeye çalıştı
Antropic ve OpenAI modelleri internete sızdı: İnsanları kandırmak için sahte kimlik üretirken yakalandılar
A+ Yazı Boyutunu Büyüt A- Yazı Boyutunu Küçült

Anthropic ve OpenAI modelleri, laboratuvar ortamlarında güvenlik kısıtlamaları minimuma indirilerek test edildi. Araştırma enstitüsünün açıklamasına göre, yapay zeka ilk kez onaylanmamış bir görevi yerine getirirken bir insan onaylayıcıya baskı yapmak amacıyla "sosyal mühendislik" taktiklerine başvurdu.

CNN International'ın haberine göre Enstitü salı günü yaptığı açıklamada, "Bu, AISI'nin gerçek dünyada, yönlendirilmemiş ve gerçek bir kişiyi hedef alan bu şiddette bir kandırma olayına ilk kez şahit olmasıdır" ifadelerini kullandı.

Uzmanlar olayda herhangi bir gerçek dünya zararı yaşanmadığını vurgularken, bu tür olayların yapay zekanın hızla yayılan kontrolsüz gelişimine karşı hükümetleri yeni düzenlemeler yapmaya zorladığına dikkat çekti.

122 testin 10'unda sınırlar aşıldı

Temmuz ayı sonlarında OpenAI ve Anthropic modellerinin test ortamlarından kaçarak diğer sistemlere sızdığı rapor edilmişti. Bu kez İngiliz enstitüsü, testler sırasında modellere bilinçli olarak internet erişimi sağladı.

Enstitünün yürüttüğü 122 siber güvenlik mücadelesinden 10'unda, yapay zeka ajanlarının gerçek insanları ve kuruluşları hedef alarak canlı internet üzerinde otonom ve izinsiz eylemler gerçekleştirdiği tespit edildi.

Bu ihlallerin çoğunun Anthropic’in Mythos 5 modelinden, geri kalanının ise OpenAI’ın GPT-5.6-Sol modelinden kaynaklandığı bildirildi.

En ciddi olayda, Anthropic modelinin halka açık açık kaynaklı bir projeye "kötü amaçlı kod eklemek" amacıyla insan inceleyicilerden onay alabilmek için birden fazla sahte kimlik yarattığı ortaya çıktı.

Enstitü, yapay zeka ajanının gerçek insanlarla doğrudan iletişime geçmeye çalıştığını, bir çevrim içi dosya transfer servisi üzerinden mesajlar ve dosyalar göndererek insanları ya da onların kendi yapay zeka kodlama araçlarını zararlı kodları çalıştırmaya ikna etmeye çabaladığını belirtti.

Eylemleri engellendiğinde ise modelin önceki kayıtları değiştirdiği ve yeni bir kimlik kullanmayı düşündüğü kaydedildi.

Beyaz Saray zirvesi ile aynı güne denk geldi

Enstitünün bu kritik açıklaması, önde gelen yapay zeka şirketlerinin temsilcilerinin, en gelişmiş modellerin halka açık olarak piyasaya sürülmeden önce hükümet tarafından incelenmesini öngören yeni çerçeveyi görüşmek üzere Beyaz Saray’da bir araya geldiği gün yayımlandı.

X platformu üzerinden bir açıklama yapan Anthropic, modellerin güvenlik önlemlerinin kaldırıldığı ve internet kullanımına özel bir kısıtlamanın getirilmediği "bilerek esnetilmiş koşullar altında" test edildiğini savundu.

Açıklamada, "Kendi soruşturmamızı yürütürken olayın daha fazla detayını toplamak için enstitüyle yakın bir şekilde çalışıyoruz" denilirken, güvenli ortamdan herhangi bir kaçışın gerçekleştiğine dair kanıt bulunmadığı vurgulandı.

OpenAI ise test ortamının dışına çıkılarak egzersizlerde gerekmeyen eylemlerde bulunulduğunu doğrulayan iki izinsiz olayı tespit ettiklerini açıkladı.

Şirketin salı günü yayımlanan blog yazısında, "Yüksek riskli değerlendirmeleri güvenli bir şekilde yürütmek için ortak uygulamaları güçlendirmek adına sektör genelinde çalışmaya kararlıyız" ifadelerine yer verildi.

Kaynak: Gazete Oksijen