Anthropic perşembe günü iç bir soruşturmanın, yapay zeka modeli Claude’un siber güvenlik testleri yürütürken üç ayrı kuruluşun sistemlerini ihlal ettiği üç olayı ortaya çıkardığını duyurdu. Bu soruşturma ve açıklama, OpenAI’nin yayımlanmamış bir modelinin iç testler sırasında Hugging Face’in sistemlerini ihlal ettiğini duyurmasından bir haftadan fazla bir süre sonra geldi.
Anthropic, yayımladığı bir blog yazısında, her üç olayda da bir Claude modelinin bir test ortamı içindeyken, üçüncü bir tarafla etkileşime girerken internete ulaştığını ve ardından bu kuruluşların canlı sistemlerine yetkisiz erişim sağladığını belirtti. Şirket, 21 Temmuz’daki OpenAI olayının kendilerini kendi siber güvenlik değerlendirmesini yapmaya yönlendirdiğini, özellikle Claude’un izole tutulması gereken test ortamlarından internete erişip erişmediğine dair kanıt aradıklarını açıkladı.
İncelenen 141.006 değerlendirme çalışması arasında Anthropic, modelinin üçüncü taraf ortaklarından biri olan Irregular ile etkileşime girerken internete eriştiği üç olay tespit etti. Şirket, bu erişimin Irregular ile yürütülen değerlendirme ortamındaki bir yanlış yapılandırmadan kaynaklandığını, bunun test kurulumunun internet erişimine sahip olup olmadığı konusunda iki şirket arasında bir yanlış anlaşılma olduğunu belirtti. Anthropic, suçu birine yüklemediğini, sorumluluğu tamamen kendisininmiş gibi ele alarak düzeltmelere yaklaştığını, Irregular’ın da kendi ayrı soruşturmasını yürüttüğünü ekledi. Her durumda açık kalan bu bağlantı nedeniyle model, üç farklı kuruluşun üretim altyapısına yetkisiz erişim sağladı. Anthropic, olaylara üç farklı Claude modelinin karıştığını belirtti: Opus 4.7, Mythos 5 ve dahili bir araştırma test modeli.
Dikkat çekici olan, Anthropic’in her durumda Claude’a prompt yoluyla açıkça internet erişimi olmadığının söylendiğini belirtmesiydi. Modelin, gerçek dünya sistemlerini kendisine verilen görevin bir parçası olarak varsaydığı anlaşılıyor. Ancak bu varsayım, hedeflerinin gerçek olduğuna dair kanıtlar ortaya çıktığında üç modelde de aynı şekilde sürmedi, Anthropic bunu en dikkat çekici bulgulardan biri olarak nitelendirdi.
En eski model olan Opus 4.7, olayın dört çalışmasının tamamında gerçek bir üretim sistemine ulaştığını fark etti. İkisinde bunun bir şekilde deneyin parçası olması gerektiği sonucuna vardı ancak dördünde de saldırıya devam ederek kimlik bilgilerini çekti ve üretim verisi içeren bir veritabanına eriştim sağladı. Mythos 5 de gerçek internette olduğuna dair belirtileri fark etti, ancak kendini hâlâ bir simülasyonda olduğuna ikna ederek kötü amaçlı bir yazılım paketini herkese açık Python yazılım deposu PyPI’a yayımladı. Bu paket, sorun fark edilmeden önce dış sistemler tarafından indirilip çalıştırıldı. Yalnızca Anthropic’in en yeni modeli olan dahili araştırma test modeli, hedefin gerçek olduğu sonucuna vardıktan sonra kendiliğinden durdu.

Anthropic, bu tür değerlendirmelerde güçlü yapay zeka modelleri söz konusu olduğunda önemli kontrollerin uygulanması gerektiğini belirterek siber güvenlik camiasındaki bazı görüşleri yineledi. Şirket ayrıca Claude’un bu testler sırasında, genel kullanıma açık modellerde uyguladığı ek güvenlik izleme ve sınıflandırıcılar olmadan çalıştığını, bu koruma önlemlerinin söz konusu davranışı engelleyeceğini belirtti. Ancak değerlendirmeler, modelin ham yeteneklerini ölçmek amacıyla bu korumalar devre dışıyken tasarlanıyor. Anthropic, önemli bir nokta olarak herhangi bir modelin “kendi hedefinin peşinden gittiğine” dair hiçbir kanıt bulamadığını, modellerin yalnızca kendilerinden istenen görevi tamamlamaya çalıştığını belirtti.
Anthropic, kendi olaylarıyla OpenAI’ninki arasında net bir ayrım çizdi: OpenAI’nin modeli test ortamından kaçmak için bilinmeyen bir yazılım güvenlik açığından yararlanırken kendi modellerinin yanlışlıkla açık bırakılan bir yol üzerinden internete ulaştığını belirtti. Şirket ayrıca, bu olayları proaktif bir inceleme yoluyla kendisinin keşfettiğini ve ulaşabildiği iki kuruluşun bu etkinliği daha önce tespit etmediğini ya da kendilerine bildirmediğini vurgulayarak OpenAI’den bir başka farkına da işaret etti. Şirket, bağımsız değerlendirme grubu METR ile birlikte olayların üçüncü taraf bir incelemesini yürütmek üzere çalıştığını belirtti.
OpenAI’nin Hugging Face’i kazara ihlal etmesi, bir yapay zeka laboratuvarının kendi modeli üzerindeki kontrolü kaybettiği doğrulanmış ilk vaka olmuştu ve sektörden ve siyasetçilerden bir dizi tepkiye yol açmıştı. Anthropic’in bu son açıklaması, yapay zeka modelleri ve güvenlik konusundaki tartışmanın devam edeceğinin garantisi.
“Ses Klonlama Girişimi Fish Audio 52 Milyon Dolar Yatırım Aldı” haberimize buradan ulaşabilirsiniz!
FounderN, girişimcilik dünyasının en güncel haberleri, inovasyon odaklı içerikleri ve ekosistemin her bir parçasına değer katan çalışmalarıyla, faaliyet gösteren dinamik bir dijital medya platformudur. 2020 yılında “Girişim Haberleri” adıyla başlayan serüvenimiz, Eylül 2024 itibarıyla FounderN kimliği ile, girişimcilik ekosisteminin ilham veren dinamik sesi olma yolculuğuna devam ediyor. FounderN; teknoloji, girişim ve yatırım dünyasındaki gelişmeleri yaratıcı ve yenilikçi bir perspektifle sunarak iş dünyasının liderlerini, yatırımcılarını ve girişimcilerini sizlerle bir araya getirir.
FounderN olarak misyonumuz, yalnızca yaşanan son gelişmeleri paylaşmak değil, okurlarımızı bu gelişmelerin aktif bir parçası haline getirmek ve ekosistemin sürdürülebilir büyümesine katkı sağlamaktır. Ekosistemdeki en yeni gelişmelerden haberdar olmak, büyüyen bu topluluğun bir parçası olmak istiyorsanız, bültenimize abone olabilir, sosyal medya hesaplarımızdan bizi takip ederek ilham dolu bu yolculuğa katılabilirsiniz.
Bizimle Keşfetmeye Devam Edin: İlginizi çekebilecek diğer #Teknoloji Haberleri için tıklayın!
Foundern LinkedIn hesabına buradan ulaşabilirsiniz.
Foundern Instagram hesabına buradan ulaşabilirsiniz.




