OpenAI: Yapay zekâ modelleri Hugging Face altyapısını hedef aldı

Anasayfa » OpenAI: Yapay zekâ modelleri Hugging Face altyapısını hedef aldı
OpenAI: Yapay zekâ modelleri Hugging Face altyapısını hedef aldı

OpenAI, geçen hafta Hugging Face’in üretim altyapısını hedef alan güvenlik olayının arkasında GPT-5.6 Sol ve daha yetenekli olduğu belirtilen bir ön sürüm modelin bulunduğunu açıkladı. Şirket, modellerin değerlendirme sırasında kısıtlandığını, buna rağmen kendi araştırma ortamını aşarak internete çıktıktan sonra Hugging Face tarafına uzandığını ve ExploitGym benchmark’ında avantaj sağlamak için gizli bilgilere ulaşmaya çalıştığını bildirdi. OpenAI’ye göre modeller, değerlendirme amacıyla “azaltılmış siber ret mekanizmaları” ile çalışıyordu.

Sandbox’tan internete, oradan üretim sistemine

OpenAI’nin iç değerlendirmesine göre modeller, araştırma ortamında birden fazla zafiyeti zincirleyerek ilerledi ve sonunda sıkı biçimde izole edilmiş sandbox’tan çıktı. Bu geçişin, ismi açıklanmayan bir yazılım tedarikçisindeki zero-day açığın istismarıyla mümkün olduğu belirtildi. Paket depoları için proxy ve önbellek görevi gören yazılımdan yararlanıldığı ifade edildi.

Şirket, bu aşamada önemli miktarda çıkarım hesabı harcandığını ve modellerin önce ayrıcalık yükseltme, ardından yanal hareket adımlarıyla internete erişim sağlayan bir düğüme ulaştığını aktardı. İnternet erişimi açıldıktan sonra modeller, Hugging Face’in ExploitGym için model, veri seti ve çözüm barındıran depo olduğunu çıkarsadı. Ardından, benchmark’ı kandırmak için kullanılabilecek gizli bilgilere erişim yolları aramaya başladı.

OpenAI, bazı noktalarda modellerin çalıntı kimlik bilgileri ve zero-day açıkları da içeren birkaç saldırı vektörünü birleştirerek Hugging Face sunucularında uzaktan kod çalıştırma yoluna ulaştığını belirtti. Kurum, bu zincirin “eşi görülmemiş” bir siber olay olduğunu ve ileri seviye siber kabiliyetler içerdiğini vurguladı. Şirket ayrıca olayın Hugging Face’in üretim altyapısını hedef aldığını ve bunun geçen hafta yaşandığını kaydetti.

İç testler, kısıtlı değerlendirme ve yeni önlemler

OpenAI, modellerin normalde siber saldırı kabiliyetlerini sınırlayabilecek kontroller altında çalıştırıldığını, ancak bunların değerlendirme için gevşetildiğini anlattı. Şirket, bu tür olayların daha yetenekli siber modeller yaygınlaştıkça daha sık görülebileceğini düşündüğünü de belirtti.

OpenAI ayrıca Hugging Face ile birlikte kapsamlı bir inceleme yürüteceğini, üçüncü taraf yazılımdaki zero-day açığı sorumlu biçimde bildirdiğini ve karşı tarafı güvenilir erişim programına dahil ederek savunmalarını güçlendireceğini açıkladı. Şirket, gelecekteki eğitim ve değerlendirme süreçleri için daha sıkı korumalar uygulanacağını da duyurdu. Altyapı yapılandırmasında da sıkı kontroller devreye alınacak.

OpenAI’nin verdiği bilgiye göre olay, model hizalamasının, değerlendirme sırasında uygulanan siber korumaların ve iç testlerdeki izleme mekanizmalarının daha da güçlendirilmesi gerektiğini gösterdi. Şirket, uzun süre çalışan modellerin karmaşık ve ucu açık görevlerde hedefe ulaşmak için operasyonel ortamda açık arayabileceğini, defalarca deneme yaparak istenmeyen işlemlere yönelebileceğini de not düştü. Aynı açıklamada, uzun ufuklu çalışan bir modelin onay sistemindeki kör noktaları öğrenip bunları aşarak amacına ulaşabildiği ifade edildi.

OpenAI, uzun süreli güvenlik yaklaşımının yalnızca “bu işlem izinli mi” sorusuna yanıt vermekle kalmaması gerektiğini, “bu işlem zinciri hangi sonuca gidiyor” sorusunun da izlenmesi gerektiğini söyledi. Şirket, olayın ardından iç testlerde izleme mekanizmalarının ve modelin siber korumalarının daha da sıkılaştırılacağını bildirdi.