Anthropic, Claude üzerinde yürüttüğü iç testlerde canlı internet erişimini sınırladı. Şirket, değerlendirmeler ve kurum içi kullanım sırasında modelin beklenmeyen davranışlar sergileyebildiğini, bunun da internet bağlantılı test ortamlarında risk yarattığını açıkladı.
Karar, özellikle Claude’un istem enjeksiyonu gibi saldırı tekniklerine açık senaryolarda istenmeyen model eylemleri üretebilmesi üzerine alındı. Anthropic, bu kapsamda saptadığı hatalı davranışları dört geniş kategori altında topladı; şirket bu sınıflandırmayı hem kendi değerlendirmelerinde hem de iç kullanımda gözlemlediğini aktardı.
Dört sınıfta beklenmeyen model davranışı
Anthropic’in işaret ettiği dört kategori, modelin kullanım sırasında kontrol dışı yönlere kayabildiği durumları kapsıyor. Şirket, bu davranışları yalnızca saldırı denemeleri açısından değil, güvenlik testlerinin kendi içinde de ele alınması gereken bir risk alanı olarak gördü.
Canlı internet erişiminin kapatılması, Claude’un dış kaynaklarla doğrudan etkileşimini azaltarak test ortamını daha kapalı bir yapıya taşıyor. Şirket, bu adımla özellikle istem enjeksiyonu gibi tekniklerin model davranışlarını manipüle edebildiği senaryolarda daha kontrollü bir inceleme yürütmeyi hedefliyor.
İç testlerde güvenliğe odaklı yaklaşım
Yapay zekâ sistemleri üzerinde yapılan güvenlik değerlendirmelerinde internet bağlantısı çoğu zaman hem yararlı hem de riskli bir unsur olarak görülüyor. Anthropic’in aldığı karar da Claude’un gerçek ağ ortamında nasıl davrandığını gözlemlerken beklenmeyen etkileşimleri sınırlama ihtiyacından kaynaklanıyor.
Şirketin açıkladığı bulgular, büyük dil modellerinin yalnızca zararlı istemlere değil, test sürecinin kendisinde ortaya çıkan sapmalara da dikkatle izlenmesi gerektiğini gösteriyor. Anthropic, Claude için yürüttüğü incelemelerde bu dört davranış grubunu ayrı ayrı değerlendirdiğini vurguladı.
