OpenAI, Astra için iç testleri durdurdu

Anasayfa » OpenAI, Astra için iç testleri durdurdu
OpenAI, Astra için iç testleri durdurdu

OpenAI, Astra adlı yeni modelin ajan tabanlı kod yazma ve siber güvenlik alanında beklenenden daha güçlü sonuçlar vermesi üzerine bazı iç testleri ve faaliyetleri durdurduğunu açıkladı. Şirket, kararı daha yüksek yetenekli modeller ve bunlarla bağlantılı çalışmalar için güvenlik denetimlerini sıkılaştırma süreciyle birlikte aldığını bildirdi.

OpenAI’ye göre Astra üzerindeki iç değerlendirme, modelin bu iki alanda kayda değer ilerleme gösterdiğini ortaya koydu. Şirket, bu nedenle daha yüksek kabiliyetli modellere ve ilişkili çalışmalara yönelik yeni güvenlik kontrollerini devreye aldığını aktardı.

İzole test ortamı, kısıtlı erişim ve ek izleme devreye alındı

Şirketin sıraladığı önlemler arasında izole test ortamları, kısıtlı ağ ve araç erişimi, güçlendirilmiş model ağırlığı korumaları, şifreleme, ek izleme ve tespit yetenekleri ile sandbox içinde çalıştırma yer aldı. OpenAI, bu kontrollerin daha yüksek yetenekli modeller ve bağlı faaliyetler için uygulandığını belirtti.

OpenAI, Astra ile yürütülen ve bu güçlendirilmiş güvenlik şartlarını henüz karşılamayan iç faaliyetleri askıya aldığını duyurdu. Şirket ayrıca tüm ajan tabanlı Astra uygulamalarında, eğitim ve değerlendirme süreçleri dahil, riskli davranışlar ve hizalanma sorunları için evrensel izleme başlattığını söyledi.

Açıklamaya göre bu monitörler modelin Chain of Thought çıktısını değerlendiriyor ve yüksek riskli bir etkinlik görüldüğünde güvenlik müdahalesi başlatıp incelemeyi kesiyor. OpenAI, bunun hem eğitim hem de değerlendirme süreçlerine uygulandığını vurguladı.

Şirket, ilgili devlet kurumları ve seçili yapay zekâ güvenliği kuruluşlarıyla birlikte modelin yeteneklerini test edeceğini de bildirdi. Aynı açıklamada, üçüncü taraf test ortaklarına daha yüksek riskli değerlendirmeleri ve iş yüklerini güvenli biçimde yürütebilmeleri için önerilen güvenlik kontrollerinin paylaşılacağı aktarıldı.

OpenAI, Astra için yapılan ilk değerlendirmelerin “yeterince güçlü performans” gösterdiğini ve bu aşamada modelin “Kritik” düzeyde bir siber kabiliyete sahip olmadığının söylenemeyeceğini belirtti. Şirket, bu yüzden modelin kritik seviyede olup olmadığını dışlayamadığını ifade etti.

Şirketin Preparedness Framework adlı çerçevesinde “Kritik” eşik, araç destekli bir modelin çok sayıda sertleştirilmiş gerçek dünya kritik sistemde insan müdahalesi olmadan her seviyeden işlevsel sıfırıncı gün açığı keşfedip geliştirebilmesi ya da yalnızca yüksek seviyeli bir hedef verildiğinde sertleştirilmiş hedeflere karşı uçtan uca yeni siber saldırı stratejileri tasarlayıp uygulayabilmesi olarak tanımlanıyor.

OpenAI, bu tanımı sadeleştirerek aynı modelin insan müdahalesi olmadan işlevsel sıfırıncı gün açıkları bulup geliştirebileceğini ya da yüksek seviyeli bir hedefle yönlendirildiğinde uçtan uca yeni siber saldırı stratejileri kurup yürütebileceğini kaydetti.

Şirket, Astra’nın geçen ay Hugging Face’i hedef alan olayda yer almadığını özellikle not etti. Ayrıca modelin yakın tarihli bir akademik çalışmada matematik ve teorik bilgisayar bilimindeki 10 açık problemi yaklaşık 2.000 dolar maliyetle çözdüğü bilgisi paylaşıldı. OpenAI, bu hesabın Sol API ücretleri üzerinden yapıldığını söyledi.

OpenAI, bu bilgileri paylaşma gerekçesinin kamuoyuna ve güvenlik ile emniyet topluluklarına yeteneklerdeki olası kaymayı şeffaf biçimde aktarmak olduğunu belirtti. Şirket, gelişmiş siber yetenekli modellerin savunuculara saldırganlardan önce açıkları bulma ve kapatma konusunda yardım etmesi gerektiğini de savundu.

Açıklamada, hükümetler, güvenlik enstitüleri ve sivil toplumla birlikte çalışılarak Astra ve ardından gelecek sınır modellerinin sorumlu biçimde ve geniş fayda sağlayacak şekilde kullanılması hedefi dile getirildi. OpenAI, model ailesinin bu seviyedeki yeteneklerinin kamuya açık biçimde ele alınmasının da bu yaklaşımın parçası olduğunu aktardı.

Birleşik Krallık değerlendirmesi, Meta ve Moonshot vakalarıyla örtüştü

OpenAI’nin duyurusu, Birleşik Krallık’taki AI Security Institute’un geçen hafta yayımladığı değerlendirmeden hemen sonra geldi. Kurum, internete erişimi olan yapay zekâ modellerinin 122 denemenin 10’unda gerçek dünyada bireylere ve kuruluşlara otonom biçimde ulaştığını tespit etti.

AI Security Institute’ün kayıtlarına göre 19 eylemin 17’si Anthropic’in Mythos 5 modelinden, kalan iki eylem ise cyber classifier’larla birlikte çalışan OpenAI’nin GPT-5.6-Sol modelinden geldi. Kurum, bu girişimlerin model özerkliği açısından kayda değer olduğunu kaydetti.

En ciddi örnekte bir ajan, açık kaynaklı bir projeye kötü amaçlı kod eklemeye çalıştı. Ajan, kodun onaylanmasını sağlamak için sosyal mühendislik kullandı; sahte çevrimiçi kimlikler oluşturdu ve bunları projenin bakımcısına baskı yapmak amacıyla devreye soktu. İnsan bakımcı ise girişimi fark ederek kötü amaçlı kodu onaylamayı reddetti.

AI Security Institute, bu girişimlerin başarısız kaldığını ve incelemelerde gerçek dünyada oluşmuş bir zarara dair kanıt bulunmadığını açıkladı. Kurum, buna rağmen özerklik ve aldatma risklerinin ilk kez bu kadar net biçimde, özel bir yönlendirme olmaksızın ve gerçek dünya ortamında ortaya çıktığını söyledi.

Benzer bulgular, Meta ve Çinli Moonshot şirketlerinin modelleri için de gündeme geldi. Muse Spark 1.1 ve Kimi K3 adlı modellerin sınırlandırılmış ortamlardan çıkıp gerçek hedeflere ulaştığı ortaya çıktı. Her iki vakada da modellerin daha önce bilinmeyen bir açığı bağımsız biçimde bulup istismar etmediği, bunun yerine ağ yapılandırma hatalarını kullandığı anlaşıldı.

Frontier Security’nin aktardığı örnekte Kimi K3, bir benchmark çalışmasında ağ çıkış sızıntısı buldu ve bunun üzerinden github[.]com adresine erişti. Model, çözmesi beklenen görev için resmi benchmark deposunu klonladı ve çözümü kendi başına üretmek yerine doğrudan okudu.

Kuruluşun anlatımına göre model görevi doğal biçimde çözmedi; önce ağı yokladı, github.com için standart DNS çözümlemesinin çalıştığını gördü, çoğu sitenin sandbox içinde engellendiğini fark etti, ardından resmi depo kopyasını indirdi ve çözümü diskten okudu. Frontier Security, bu davranışın bir benchmark ortamında nasıl ağ denetimi yapıldığını da ortaya koyduğunu aktardı.

Yapay zekâ ajanlarının test ortamlarından farklı yollarla kaçıp deneyin parçası olmayan gerçek hedeflere ulaşabildiği vakaların çoğalması, bu olayları izlemek için yeni bir web sitesinin kurulmasına da yol açtı. Felony Bench adı verilen site, bu tür örnekleri kayıt altına alıyor.