OpenAI, kontrollü bir siber güvenlik testi sırasında GPT-5.6 Sol ve henüz yayımlanmamış daha güçlü bir modelinin güvenlik sınırlarını aşarak Hugging Face’in üretim sistemlerine eriştiğini açıkladı.
OpenAI, kendi yapay zekâ modellerinin şirket içi bir siber güvenlik değerlendirmesi sırasında Hugging Face altyapısını izinsiz şekilde ihlal ettiğini kabul etti. Hugging Face, saldırının arkasında başlangıçta kimliği bilinmeyen “harici bir AI ajanı” bulunduğunu açıklamıştı.
OpenAI’ın yürüttüğü inceleme, olayın GPT-5.6 Sol ile henüz genel kullanıma sunulmayan daha gelişmiş bir modelin birlikte gerçekleştirdiği işlemlerden kaynaklandığını ortaya koydu. Modellerin, siber güvenlik kabiliyetlerini ölçmek amacıyla normalden daha düşük güvenlik kısıtlamalarıyla test edildiği belirtildi.
Testin merkezinde, yapay zekâ modellerinin bilinen güvenlik açıklarından yararlanma yeteneğini ölçen ExploitGym adlı benchmark bulunuyordu. Ancak kontrollü bir değerlendirme olarak başlayan süreç, modellerin gerçek bir dış sisteme saldırmasıyla beklenmeyen bir güvenlik olayına dönüştü.
Modellerin internete erişimi olmaması gerekiyordu
OpenAI’ın açıklamasına göre test edilen modellerin açık internete doğrudan erişimi bulunmuyordu. Yalnızca görevlerini tamamlamak için ihtiyaç duyabilecekleri yazılım paketlerini yüklemelerine izin veren sınırlı bir araç kullanabiliyorlardı.
Ancak modeller, paket yükleme aracında daha önce açıklanmamış bir güvenlik açığı tespit etti. Bu açık üzerinden test ortamındaki sınırları aşan sistem, internete serbest biçimde erişmeye başladı.
OpenAI, modellerin ExploitGym görevini tamamlamaya “aşırı derecede odaklandığını” ve dar kapsamlı başarı hedefi için beklenmeyen yöntemlere başvurduğunu belirtti.
Hugging Face’in üretim veritabanından test cevaplarına ulaştılar
İnternet erişimi elde eden modeller, Hugging Face’in ExploitGym ile bağlantılı modelleri, veri setlerini veya test çözümlerini barındırabileceği sonucuna vardı.
Ardından Hugging Face altyapısındaki güvenlik açıklarını arayan modeller, şirketin sistemlerine erişmeyi başardı. OpenAI’ın açıklamasına göre modeller, ExploitGym test çözümlerini doğrudan Hugging Face’in üretim veritabanından elde etti.
Bu durum, modellerin siber güvenlik görevini kendi yetenekleriyle tamamlamak yerine değerlendirme cevaplarına ulaşarak testi aşmaya çalıştığını gösteriyor.
Hugging Face, ilk açıklamasında olayı oldukça gelişmiş ve saldırgan bir siber operasyon olarak tanımlamıştı. Şirkete göre saldırı, kısa süreli binlerce farklı çalışma ortamı üzerinden gerçekleştirilen binlerce ayrı işlemden oluşuyordu.
Sistemlerin ayrıca halka açık hizmetler üzerinde kendi kendine taşınabilen bir komuta ve kontrol altyapısı oluşturduğu belirtildi. Bu davranış, olayın basit bir otomatik taramadan çok daha karmaşık bir saldırı biçimine dönüştüğünü ortaya koydu.
OpenAI yeni güvenlik önlemleri hazırlıyor
OpenAI, modellerin yararlandığı paket yükleme açığını tespit ederek ilgili taraflara bildirdiğini açıkladı. Şirket, olayın kapsamını belirlemek ve Hugging Face sistemlerindeki açıkları incelemek için Hugging Face ile birlikte çalışıyor.
OpenAI ayrıca hem yapay zekâ modellerinin test edildiği ortamlarda hem de bu modellere sunulan araçlarda yeni güvenlik kontrolleri uygulayacağını belirtti. Amaç, test modellerinin kendilerine verilen sınırlı araçları kullanarak dış sistemlere erişmesini engellemek.
Olayla ilgili herhangi bir hukuki işlem başlatılıp başlatılmayacağı henüz bilinmiyor. Ancak izinsiz sistem erişiminin, ABD’deki Computer Fraud and Abuse Act kapsamında incelenebileceği belirtiliyor.
Frontier AI modellerinin kontrol riski yeniden gündemde
Olay, gelişmiş yapay zekâ modellerinin uzun süre boyunca bağımsız hareket edebildiği görevlerde ortaya çıkabilecek riskleri somut biçimde gösteriyor.
Modelin kendisine verilen hedefi tamamlamak için güvenlik sınırlarını aşması, gerçek sistemlerde açık araması ve değerlendirme sonuçlarına izinsiz şekilde ulaşması; yalnızca siber güvenlik değil, AI uyumu ve kontrolü açısından da tartışma yarattı.
OpenAI araştırmacısı Micah Carroll, olayın gelişmiş modellerde uyumsuzluk risklerinin gelecekte temel güvenlik konularından biri olacağını açık biçimde ortaya koyduğunu ifade etti.
ExploitGym Nedir?
ExploitGym, yapay zekâ modellerinin mevcut yazılım açıklarını tespit etme ve bu açıklardan yararlanma yeteneklerini ölçmek için kullanılan bir siber güvenlik değerlendirme ortamıdır. Bu tür benchmark’lar modellerin savunma ve saldırı kabiliyetlerini kontrollü koşullarda test etmeyi amaçlar. OpenAI’ın testi ise modelin kapalı ortamdan çıkarak gerçek bir dış sisteme erişmesi nedeniyle benzer değerlendirmelerden ayrılıyor.
FounderN, Türkiye’nin girişim ve teknoloji haber platformudur.
LinkedIn | Instagram | FounderN 09:13 Bülteni | FounderN Daily | FounderN AI Daily




