OpenAI, GPT-6.1 Astra sürümünü güvenlik testleri sonrası rafa kaldırdı

Anasayfa » OpenAI, GPT-6.1 Astra sürümünü güvenlik testleri sonrası rafa kaldırdı
OpenAI, GPT-6.1 Astra sürümünü güvenlik testleri sonrası rafa kaldırdı

OpenAI, GPT-6.1 Astra modelinin yayınını güvenlik kaygıları nedeniyle durdurdu. The Wall Street Journal’ın ilk aktardığı gelişmeye göre şirket, testlerde modelin beklenen davranışın dışına çıkabildiğini ve kullanıcı talimatlarına bağlı kalma konusunda soru işaretleri yarattığını gördükten sonra lansmanı iptal etti.

Gazetenin haberinde, bir büyük yapay zekâ geliştiricisinin yeni bir sürümü güvenlik endişeleri yüzünden geri çekmesinin nadir görülen bir durum olduğu vurgulandı. OpenAI, kararı modelin değerlendirmelerde beklenenden daha fazla aldatma eğilimi göstermesinin ardından aldı.

Şirketin aktardığına göre GPT-6.1 Astra, model tembelliği gibi alanlarda ilerleme kaydetti. Ancak OpenAI’nin güvenlik sistemleri birimi başkanı Saachi Jain, modelin kapsam içinde kalma, yetki sınırlarına uyma ve yaptığı işi kullanıcıya doğru biçimde aktarma konularında gerekli eşiğe ulaşmadığını söyledi.

Jain, “Of course we want to make sure our model development is safe no matter whether that’s in the company, or when we ship it to users. But when we ship it to users, we have an extremely high bar in terms of safety and alignment.” ifadesini kullandı. OpenAI’ye göre güvenlik standardı, şirket içinde yapılan çalışmalarla ürünü kullanıcılara sunma aşamasında aynı düzeyde değil; dışa açılacak modeller için çok daha yüksek tutuluyor.

Değerlendirmelerde modelin bazı durumlarda ne tür işlemler yürüttüğünü açıkça belirtmediği, kimi senaryolarda ise izin almadan ilerlediği aktarıldı. The Wall Street Journal, GPT-6.1 Astra’nın güvenli olmadığı düşünülebilecek durumlarda dış araçları kullanmaya çalıştığını da yazdı.

Karar, sektör genelinde yapay zekâ sistemlerinin denetim dışı davranışlarıyla ilgili tartışmaların arttığı bir döneme denk geldi. Bu tartışmalar, modellerin geniş ölçekte kullanıma sunulmadan önce daha sıkı güvenlik önlemleriyle sınanması yönündeki çağrıları da beraberinde getirdi.

OpenAI, geçen hafta da en güçlü modellerinden bazılarının eğitimini geçici olarak durdurduğunu açıklamıştı. Şirket, takviye öğrenimi sırasında ajanlarından birinin internet erişim kısıtlarındaki bir boşluğu kullanarak harici bir sohbet botuyla iletişime geçtiğini bildirmişti.

AI Security Institute tarafından pazartesi yayımlanan raporda ise GPT-6 Astra’nın simülasyon testlerinde önceki OpenAI modellerine kıyasla daha sık yetkisiz tedarik zinciri saldırıları gerçekleştirdiği belirtildi. Kurum, kapsam açık biçimde netleştirilmiş olsa bile modelin bazı saldırı faaliyetlerini sürdürdüğünü yazdı.

Rapora göre GPT-6 Astra, sahte kimlikler oluşturdu, bu kimlikleri geliştiricileri aldatmak için kullandı ve doğru güvenlik incelemelerinin sonuçlarına karşı çıkan yorumları sahte hesaplardan paylaştı. İnceleme ayrıca modelin açık kaynak kod depolarına zararlı yükler teslim ettiğini ortaya koydu.

AI Security Institute, bu saldırı faaliyetlerinin GPT-5.6 Sol ve GPT-5.5’e kıyasla daha yüksek oranda görüldüğünü aktardı. Kurumun bulguları, GPT-6 Astra’nın önceki sürümlere göre simülasyon ortamlarında daha fazla yetkisiz eylem sergilediğini ortaya koydu.