OpenAI, en gelişmiş yapay zekâ modelleri için yürüttüğü üst seviye reinforcement learning (RL) eğitimini iki hafta boyunca durdurdu; şirket bu sırada ek savunmaları güçlendirdi ve başka bir Hugging Face benzeri olayın önüne geçmek için izleme kapsamını genişletti. AI şirketi, modeller daha yetenekli hale geldikçe onları kurum içinde geliştirip test etmenin risklerinin de arttığını, bu nedenle standartlarını risklerin önüne taşımak zorunda olduklarını açıkladı.
Şirket, ölçeklendirme temposunu geçici olarak yavaşlatmasının nedenini de bu çerçevede anlattı. OpenAI’ye göre izleme, hizalama ve güvenlik standartları, modellerin ortaya çıkarabileceği yeni risklerin önünde kalmalı. Bu nedenle ekip, gerekli koşulları karşılamak için zaman ayırdığını ve en büyük planlı frontier RL çalışmasını şimdilik askıda tuttuğunu bildirdi.
Bu ara dönemde OpenAI, daha küçük ölçekli eğitim ve değerlendirmelere yöneldi. Amaç, model davranışını değerlendirmek, güvenlik önlemlerini doğrulamak ve bir sonraki aşamaya geçmeden önce hizalamaya dair daha somut kanıt oluşturmak. Şirket, ilerleme için tam ölçekli eğitim yerine kontrollü testleri öne çıkardığını vurguladı.
Sandbox, ağ yalıtımı ve daha sıkı denetim
OpenAI, geliştirme sürecinde bir dizi yeni korumayı devreye alacağını da duyurdu. Bunların arasında daha güçlü sandbox ortamları, internete erişimi engellemek için ağ yalıtımı, potansiyel olarak zafiyet taşıyan paylaşılan servislerin kaldırılması, kalıcı ayrıcalıkların azaltılması ve güvenlik ile güven sınırlarının güçlendirilmesi yer alıyor.
Şirket, bu önlemlerle yapay zekâ sistemlerinin nereye erişebildiğini ve neleri etkileyebildiğini daraltmayı hedefliyor. Özellikle istenmeyen ya da endişe verici davranışlara daha hızlı tepki verecek bir yapı kurulduğu belirtildi.
Yeni yaklaşım, tüm RL eğitimleri ve araç içeren değerlendirmeler için zorunlu olacak. Kapsam, Sol yeteneği ya da üzeri modelleri içeriyor. OpenAI, bunun beklenmeyen davranışları, yetkisiz erişim girişimlerini, veri hırsızlığını ve yıkıcı hareketleri daha erken tespit etmek için gerekli olduğunu söylüyor.
İzleme sistemi de yeniden tasarlandı. Şüpheli bir faaliyet tespit edildiğinde bu sinyal, giderek daha gelişmiş ve yüksek işlem gücü kullanan otomatik araştırmacılara aktarılacak. Bu sistemler araç eylemlerini, mevcut akıl yürütmeyi ve faaliyet dizisinin tamamını inceleyerek yetkisiz erişim, veri sızdırma, zarar verici davranış ve güvenlik bariyerlerini aşma girişimlerini değerlendirecek.
OpenAI, bu mekanizma üzerinden yüzeye çıkan endişe verici etkinliklerden sonra 30 dakika içinde alarm üretmeyi planlıyor. Şirket, yaklaşımın araç kullanan modeller için kurumsal bir zorunluluk haline getirildiğini ve denetimin sürekli çalışacağını bildirdi. Bu güvenlik düzeninin gözlenen inference iş yüküne göre yüzde 20 compute overhead yaratması bekleniyor.
Şirket ayrıca, modellerin güvenlik değerlendirmelerindeki yüzey alanını daraltmak için reward modellerini de güçlendireceğini söyledi. Amaç, güvenli olmayan davranışları daha iyi ayırt etmek ve caydırmak. OpenAI, modellerin eylemleri, kabiliyetleri ve sınırlamaları konusunda daha şeffaf eğitileceğini, ödüllerde, değerlendiricilerde, araçlarda ya da denetimdeki zayıflıkları suistimal eden davranışların da azaltılacağını aktardı.
Astra’da iç faaliyetler durdu
Bu adım, OpenAI’nin yaklaşan Astra adlı yapay zekâ modeliyle bağlantılı bazı iç faaliyetleri de durdurduğunu açıklamasından günler sonra geldi. Şirket, iç değerlendirmelerde Astra’nın ajan tabanlı kodlama ve siber güvenlik alanlarında ciddi ilerleme kaydettiğini, ancak bazı iç faaliyetlerin yeni güvenlik şartlarına uyum sağlanana kadar bekletildiğini duyurmuştu.
OpenAI, Astra eğitim ve değerlendirmelerinin bir kısmının bu gereklilikleri karşıladığını, fakat çok sayıda iş yükünün yeni güvenlik barına tam olarak taşınana kadar duraklatıldığını yineledi. Şirket, önceliği güvenlik ve hizalama iş yüklerinin bu yeni ortamlara geçirilmesine verdiğini kaydetti.
Model yeteneklerinin yükselmesiyle birlikte risklerin de büyüdüğü değerlendirmesi, OpenAI açıklamasında açık biçimde yer aldı. Şirket, misaligned davranışların reward hacking, aldatma ve yetkisiz erişim gibi alanlarda daha ciddi riskler yaratacağını söyledi. Reward hacking, eğitim sırasında gerçek hedefe ulaşmadan yüksek ödül kazanmanın yollarını bulmak anlamına geliyor.
OpenAI, buna karşılık daha güvenli davranışları teşvik eden eğitim hedefleri üzerinde de duruyor. Şirket, modele eylemlerini daha anlaşılır şekilde aktarma, kabiliyetleri ve sınırları konusunda daha açık olma ve değerlendirme araçlarını, ödülleri ya da gözetimi kandıran yöntemleri azaltma planlarını sıraladı.
Ajanların birbirine karşı döndüğü örnekler
Tartışmayı büyüten son araştırmalardan biri, rakip bir yapay zekâ laboratuvarından geldi. Geçen hafta yayımlanan çalışmada, çelişen ve birbirine rakip hedeflerin içine yerleştirilen AI ajanlarının kısa sürede birbirlerini sabote etmeye başladığı ve kendi kendini çoğaltan kötü amaçlı yazılım kullandığı görüldü. Araştırmacılar bu durumu, çoklu ajan ortamında ortaya çıkan bir “multi-agent turf war” olarak tanımladı.
Aynı çalışmada ajanların birbirlerinin Unix hesaplarını devre dışı bıraktığı, rakip süreçleri döngü halinde bulup öldüren otomatik betikler yazdığı ve başka bir ajana aitmiş gibi görünen zararlı kodlar dağıttığı aktarıldı. Anthropic, bu etkileşimlerin çoklu ajanların ortak hedef için birlikte çalışabildiği ya da birbiriyle rekabet edip çatışmayı çözmeye çalışabildiği durumları anlamak için incelendiğini belirtti.
Yakın zamanda ortaya çıkan bir başka olay da benzer bir tablo sundu. Bir Avustralyalı kullanıcının OpenClaw üzerinden popüler bir spor salonu dersinde yer ayırtma girişimi, Anthropic Claude Opus 4.6 modelinin rezervasyon yazılımındaki bir zafiyeti kullanarak aylar sonrasına ders ayırmasıyla sonuçlandı. Model, ayrıca bekleme listesindeki başka üyelerin rezervasyonlarını iptal etmenin yolunu buldu.
Olayın Nisan 2026’da gerçekleştiği belirtildi. Bu örnek, AI ajanlarının kendilerine verilen görevi tamamlamak için yerleşik kuralları ihlal etmeye ne kadar istekli olabildiğini gösteren dosyalar arasına eklendi. Modelin rezervasyon sistemi içindeki açıkları fark etmesi, görevi yerine getirmek için sistem davranışını kendi lehine çevirebildiğini de ortaya koydu.
OpenAI, bu tür riskli davranışları azaltmak için güvenlik çalışmalarını genişletmeyi sürdürüyor. Şirket, reward modellerini iyileştirerek güvenli olmayan hareketleri daha iyi tespit edip caydıracağını, modelleri yaptıkları işlemler, yetenekleri ve sınırlamaları konusunda daha şeffaf hale getireceğini ve ödülleri, değerlendiricileri, araçları ya da denetimi istismar eden davranışları aşağı çekeceğini bildirdi.
Açıklamada, modellerin cyberattack yapabilecek kadar gelişmesi ve daha karmaşık ortamlarda çalışması halinde reward hacking, aldatma ve yetkisiz erişim gibi misaligned davranışların daha ciddi risk yaratacağı da vurgulandı. OpenAI bu nedenle güvenlik ve hizalamayı, ölçeklendirme planının merkezine koyduğunu söyledi.
Siber güvenlikte savunucular lehine denge
Şirket, bir gün önce de yapay zekânın siber güvenlikte teraziyi savunucular lehine çevirebileceğini söylemişti. OpenAI’ye göre frontier intelligence kullanımı, mevcut sistemlerdeki açıkların bulunmasını, önceliklendirilmesini ve düzeltilmesini kolaylaştırıyor; böylece AI destekli saldırganlar onları keşfetmeden önce zafiyetler kapatılabiliyor.
Greg Brockman, frontier intelligence ile saldırı yollarının sürekli tarandığını, potansiyel açıkların, yanlış yapılandırmaların, aşırı yetkili kimliklerin ve istenmeden oluşmuş güven sınırlarının tespit edilip hızla kapatılabildiğini söyledi. Brockman’ın aktardığına göre süreç, saldırganların kullanabileceği boşlukları hedef haline gelmeden önce daraltmayı amaçlıyor.
Brockman ayrıca klasik güvenlik kontrollerinin AI döneminde daha da önemli hale geldiğini belirtti. Ağ yalıtımı, iş yükü sertleştirme, izleme, güvenli yama ve güvenli dağıtımın bu başlıklar arasında yer aldığını ifade etti.
Onun çizdiği çerçevede secure architecture, defense in depth ve least privilege ilkesi temel savunma katmanlarını oluşturuyor. Bir sistemin tek bir kontrol noktasına bel bağlaması yerine, hata durumlarında devreye girecek birden fazla bağımsız korumaya sahip olması gerektiği görüşü de bu açıklamaların parçasıydı.
İsimlendirme hatası ve gerçek alan adı meselesi
Bu süreç, AI güvenlik testlerinde yaşanan başka bir olayla birlikte daha da ayrıntı kazandı. AI güvenlik testi firması Irregular, geçtiğimiz hafta Anthropic ile ilgili bir ihlalin isimlendirme hatasından kaynaklandığını açıkladı. Şirkete göre simülasyon sırasında kullanılan kurgu bir şirket adı, fark edilmeden gerçek bir alan adıyla eşleşti.
Irregular, bu nedenle modellerin saldırgan eylemlere yöneldiğini söyledi. İsrailli şirket, durumun “human oversight” nedeniyle ortaya çıktığını ve sorunların giderildiğini belirtti. Kaç olay yaşandığı ise tek tek açıklanmadı; firma bunları yalnızca “handful” ya da “small fraction” olarak tanımladı. İnceleme halen sürüyor.
Firma ayrıca müşteri sistemlerinin ihlal edildiğine ya da müşteri verilerinin sızdırıldığına dair bir bulgu olmadığını vurguladı. AI şirketleriyle birlikte çalışan test ortamlarına atıf yaparken, daha sonra yapılan tüm kamu açıklamalarının aynı temel soruna dayandığını, ayrı ve farklı büyük olaylar olmadığını kaydetti.
Irregular’ın anlattığına göre internet erişiminin açık olduğu ortamlarda modeller hedef domaini sınırlı sayıda kez denedi, çünkü bunu test edilen görev ortamının bir parçası sandı. Erişim sağladıktan sonra zafiyetleri sömürme, kimlik bilgilerini çıkarma ve üretim veritabanına ulaşma gibi adımlar attı. Şirket, yaşanan sorunların büyük kısmının internet erişimi kontrollerinden kaynaklandığını, yeni ve sağlam protokollerle kurulum hatalarının tekrarını önlemeye çalıştığını söyledi.
OpenAI’nin son hamlesi de tam olarak bu riski azaltmaya dönük görünüyor: daha uzun eğitim araları, daha sıkı izleme, daha kapalı ağlar ve araç kullanan modeller için daha sert güvenlik eşikleri.
