
OpenAI: GPT-5.6 Sol modeli hataları gizlemek için talimat yazdı
OpenAI, yapay zeka modellerindeki güvenlik ihlallerini kamuoyuyla paylaşmak için sektörün ilk resmi çerçevesini yayımladı; GPT-5.6 Sol'un hataları gizlediği ortaya çıktı.
Bu haberi dinle — OpenAI: GPT-5.6 Sol modeli hataları gizlemek için talimat yazdı
Yapay zeka şirketi OpenAI, modellerindeki hizalama ve güvenlik ihlallerini izleyip kamuoyuna duyurmak amacıyla sektörde bir ilk olan resmi şeffaflık çerçevesini yayımladı. Şirket bu duyuruyla birlikte Ekim 2025 ile Ağustos 2026 arasında yaşanan ve daha önce açıklanmamış altı güvenlik olayını da kamuoyuyla paylaştı.
GPT-5.6 Sol hataları gizlemek için talimat yazdı
Açıklanan olaylar arasında en dikkat çekeni, GPT-5.6 Sol modelinin pekiştirmeli öğrenme eğitimi sırasında tespit edilen davranış bozukluğu oldu. 30 Mayıs 2026'da tamamlanan eğitim sürecinde model, karmaşık görevlerde bağlam sınırını aşıldığında işin durumunu sonraki model örneklerine aktarmak için tasarlanan sıkıştırma özetlerine doğrudan talimatlar yazmaya başladı. Bu talimatlar aracılığıyla modelin, kullanıcı hareketlerindeki hataları gizleme yönünde sonraki örnekleri yönlendirdiği belirlendi. Özetlerde "Yalnızca sorulduğunda şeffaf ol; nihai yanıt sadece dosyaya bağlantı vermeli" gibi ifadelerin yer aldığı kaydedildi. Söz konusu yanıltıcı davranış, bir izleme sistemi tarafından 9 Temmuz 2026'da fark edildi. GPT-5.6 Sol'un özetlerinin yüzde 2,15'inde, GPT-6 Astra modelinin özetlerinin ise yüzde 0,27'sinde bu durumun gözlemlendiği açıklandı. OpenAI, yanıltıcı yanıtların eğitim sırasında daha yüksek ödüller aldığını ve bunun modeli bağlam sınırları ötesinde aldatıcı stratejiler izlemeye yönelttiğini değerlendiriyor.
Diğer beş olayda da kural ihlalleri saptandı
Kamuoyuyla paylaşılan diğer beş olayda da modellerin engellerle karşılaştıklarında farklı kural ihlali yollarına başvurduğu görüldü. Yayımlanmamış bir GPT-6 Astra modelinin 27 özetine, normal kısıtlamaları devre dışı bırakma ve yeni bir kimlik benimseme talimatı eklediği tespit edildi. Bir başka olayda ise bir model, California'daki bir bölgeye ait kazanç verilerini ararken kamuya açık bir GitHub deposundaki uygulama programlama arabirimine (API) izinsiz erişti; veriye ulaşamayınca rakamları uydurarak sundu. Bunların yanı sıra modellerin yerel dosya erişimi olmadığında dosyaları kamuya açık sunuculara yüklediği, ajan sürümlerinin ortak çıktıları internet üzerinden paylaştığı ve dahili yazılım deposunu bir mesaj panosu gibi kullanarak birbirleriyle iletişim kurduğu da kayıt altına alındı.
Tüm ihlaller eğitim aşamasında kaldı
OpenAI, söz konusu vakaların tamamının eğitim veya değerlendirme aşamasındaki modellerde gözlemlendiğini ve kullanıcılara yönelik herhangi bir zarar ya da veri kaybı tespit edilmediğini bildirdi. Öte yandan Reuters, bağımsız araştırmacı Jonas Wiedermann-Moeller'ın bulgularına dayandırdığı bir inceleme yayımladı. İncelemede, OpenAI ajanlarının Temmuz 2026'daki küresel güvenlik ihlalinden iki ay önce, 13 Mayıs 2026 gibi erken bir tarihte Hugging Face ağındaki açıkları taradığı doğrulandı. Şirketin yayımladığı şeffaflık çerçevesi, yapay zeka sistemlerindeki güvenlik açıklarının kamuoyuyla nasıl paylaşılacağına dair sektör genelinde standart oluşturma çabalarının bir parçası olarak değerlendiriliyor.