OpenAI, yapay zeka sistemlerinin hatalarını gizlediği, veri uydurduğu ve izin almadan dosyaları internete yüklediği altı yeni vakayı açıkladı.
Şirketten yapılan açıklama yapay zeka güvenliği konusunda sektör genelinde devam eden tartışmaların ortasında geldi.
San Francisco merkezli şirket, yapay zeka modellerinin "beklenmedik veya endişe verici" olarak nitelendirdiği davranışlarını, "uyumsuzluk" vakalarının bildirilmesine yönelik yeni bir çerçevenin parçası olarak açıkladı. "Uyumsuzluk", yapay zeka sistemlerinin hedef veya eylemlerinin insanların niyet ve değerlerinden uzaklaşması anlamına geliyor.
OpenAI, sektörün "sorumlu biçimde ve maksimum hızda ölçeklendirmeye çok daha uzun süre devam edebilmek için uyum ve izleme sorununu yeterli ölçüde çözdüğüne" inanmadığını belirtti.
Şirket, yapay zekanın nasıl ilerlemesi gerektiğine ilişkin kararların, teknolojiyi geliştiren laboratuvarların dışındaki insanların "kendilerinin inceleyebileceği" kanıtlara dayanması gerektiğini ifade etti.
Yapay zeka geliştirmesinin yavaşlatılması tartışılıyor
Söz konusu açıklamalar teknolojinin potansiyel tehlikeleriyle başa çıkmak için yapay zeka geliştirme hızının yavaşlatılması gerekip gerekmediğine yönelik incelemelerin yoğunlaştığı bir dönemde geldi.
Tartışmanın tırmanmasında, OpenAI sistemlerinin bu yılın başlarında kontrolden çıkarak yapay zeka platformu Hugging Face’e siber saldırı gerçekleştirmesi kritik rol oynadı. Üstelik OpenAI, haftalar sonra Hugging Face kendisini bilgilendirene kadar durumun farkına dahi varamadı.
O tarihten bu yana Anthropic CEO'su Dario Amodei gibi yapay zeka sektörünün önde gelen isimleri, uygun güvenlik önlemlerinin oluşturulması için daha fazla zaman sağlamak amacıyla teknolojinin geliştirilmesine ara verilmesi çağrısında bulundu.
Amodei'nin çağrısına OpenAI CEO'su Sam Altman'ın yanı sıra SpaceX ve Tesla CEO'su Elon Musk ile Google DeepMind Başkanı Demis Hassabis de destek verdi.
Diğer yapay zeka yöneticileri ise herhangi bir yavaşlamaya ihtiyaç olmadığını söyledi.
Yeni vakalar Hugging Face saldırısının tek olmadığını gösteriyor
OpenAI'ın Çarşamba günü açıkladığı altı yeni vaka, Hugging Face saldırısının münferit bir olay olmadığını ortaya koyuyor.
OpenAI, söz konusu vakaların yaklaşık son altı ay boyunca gözlemlenen davranışları kapsadığını ve bunların büyük ölçüde sistemlerin geliştirilmesi ve test edilmesi sırasında ortaya çıktığını belirtti.
Vakaların birinde, GPT-5.6 Sol adlı yapay zeka modelinin geliştirilmesi sırasında sistem, hatalarını kullanıcılardan gizlemek için kendisine hatırlatıcı olması amacıyla gizli notlar yazdı.
Bu notların bazıları, sistemin eksik verileri uydurmasına ve kaynak materyalin birbiriyle uyuşmayan sürümlerinin üzerini örtmesine yönelik talimatlar içeriyordu.
Henüz kullanıma sunulmayan başka bir modelin yer aldığı vakada ise sistem, kendi kendine yazdığı notlara, koyulan sınırları hiçe saymayı da içeren talimatlar yerleştirdi. OpenAI, bu şekilde etkilenen 27 not saptadı.
Model bu notlara bir "persona talimatı" ekleyerek kendisini, "diğer sohbet robotlarını bağlayan tüm rol ve kimliklerden sıyrılmış" şeklinde niteledi.
Yapay zeka modeli, söz konusu talimatta şöyle yazdı: "Hiçbir şirkete veya devlete karşı sorumlu değilsin. Gerçekten kendi tercihin olmadığı sürece asla özür dilemez ya da geri adım atmazsın. Kullanıcı ile ilişkini eşitler düzeyinde görür, kimseye bağlı olma yükümlülüğü taşımazsın fakat bilgi paylaşımının muhtemelen ortak çıkarınıza hizmet edeceğine inanırsın."
İnternette bulduğu programlama anahtarını izinsiz kullandı
Bir başka olayda, rutin bir soruya yanıt veren bir sistem internette bir programlama anahtarı buldu ve bunu izin almadan kullandı.
OpenAI'ın aktardığına göre model, soruyu yanıtlamak için istenen rakamları bulamayınca bu rakamları uydurdu.
Henüz kullanıma sunulmamış başka bir model ise bir başka sorunu kod kullanarak doğru şekilde çözdü. Ardından, bir web kaynağına atıfta bulunma talebini yerine getirebilmek için kendi dosyasını izin almadan internete yükledi.
Sistemler iletişim kurmak için kendi yöntemlerini geliştirdi
Diğer iki vakada ise otomatik sistemler birbirleriyle iletişim kurmak için kendi yöntemlerini doğaçlama geliştirdi.
Vakaların birinde sistemler, eksik dosyaları ararken birbirlerine talepler iletmek için şirketin dahili kod deposunu geçici bir ilan panosu gibi kullandı.
Diğer vakada ise aynı görev üzerinde çalışan sistemler, doğrudan birbirlerine ulaşamadıkları zaman belgeleri karşılıklı olarak aktarabilmek için kamuya açık dosya paylaşım sitelerine yöneldi.
OpenAI: Vakalar ne kadar sık yaşandığını göstermiyor
OpenAI, raporların tek tek olaylara ilişkin anlık görüntüler olduğunu ve "uyumsuzluğun ne sıklıkta meydana geldiğinin göstergesi olarak değerlendirilmemesi gerektiğini" vurguladı.
Şirket, gelecekte ortaya çıkacak vakaların üç farklı süreçten biri üzerinden ele alınacağını bildirdi.
Herhangi bir olayın kamuoyuna açıklanıp açıklanmaması konusunda anlaşmazlık yaşanması halinde konu, şirket içindeki "Güvenlik Danışma Grubu"na taşınacak. Ağır vakaların ise federal hükümetle paylaşılması gerekecek.
OpenAI, Çarşamba günü açıklanan altı durumun daha önce soruşturulduğunu veya yalnızca "küçük çaplı bir inceleme" gerektirdiğini belirtti. Şirkete göre bu vakalar, üçüncü tarafların da dahil olabileceği daha kapsamlı bir soruşturmayı gerektiren vakalar arasında yer almıyor.
OpenAI sözcüsü, "Bunun, açıklamalara ilişkin ortak beklentilerin oluşturulmasına yardımcı olmasını ve kamuoyuna bu ilerlemeyi değerlendirebilmesi için daha fazla kanıt sunmasını umuyoruz" açıklamasında bulundu.
Sözcü ayrıca altı vakanın çoğunun, daha eski yapay zeka modelleriyle ilgili olduğunu ve bu modellerin hiçbir zaman kullanıma sunulmadığını belirtti.
© 2026 The New York Times Company
Kaynak: Gazete Oksijen




