OpenAI’ın yeni yapay zeka modeli Astra, siber güvenlikte kritik eşiği aştı. Şirket, kötüye kullanım riskine karşı modelin en gelişmiş yeteneklerini kısıtlıyor.
OpenAI, yeni yapay zeka modeli Astra’nın siber güvenlik alanındaki üstün yeteneklerine erişimi kısıtlama kararı aldı. Şirket, Astra’nın kendi Preparedness Framework kapsamında belirlediği “Critical” (kritik) siber güvenlik yetenekleri eşiğini aşan ilk modeli olduğunu duyurdu. Modelin kötüye kullanım potansiyeli nedeniyle, ileri düzey siber güvenlik özellikleri başlangıçta küçük bir test grubuna sunulacak.
Bu sınıflandırma, Astra’nın uygun araç ve erişime sahip olduğunda iyi korunan sistemlerdeki bilinmeyen güvenlik açıklarını tespit edebilmesi anlamına geliyor. Model, bu açıkları kullanarak yöntemler geliştirebiliyor ve bazı görevlerde insan yönlendirmesine ihtiyaç duymuyor. OpenAI, Astra’nın bu yetenekleri nedeniyle özel güvenlik önlemleriyle piyasaya sürüleceğini belirtti.
OpenAI’ın Astra üzerinde yaptığı testler, modelin kapasitesini gözler önüne serdi. Astra, yapay zeka modellerinin bilinen yazılım açıklarından yararlanma becerisini ölçen ExploitBench testinde yüzde 100 başarı sağladı. Şirketin kendi hazırladığı 20 yüksek önem seviyesindeki V8 güvenlik açığı testinde ise Astra, bir exploit zincirinin parçası olarak iki adet sıfır gün güvenlik açığı keşfetti ve kullandı.
Uzmanlar, Astra’nın güçlendirilmiş bir tarayıcıda daha önce bilinmeyen açıklar bulduğunu ve bunları saldırı zincirlerine dönüştürdüğünü ifade etti. Başka bir değerlendirmede modelin işletim sistemindeki birden fazla açığı bir araya getirerek yetkisiz kullanıcı seviyesinden root yetkisine ulaşabilecek bir zincir oluşturduğu belirtildi. OpenAI, keşfedilen iki açığın ilgili yazılım geliştiricilerine bildirildiğini açıkladı.
OpenAI, Astra’yı yakında erişime açmayı planlasa da, modelin en gelişmiş siber güvenlik yeteneklerine erişimi sınırlı tutacak. İleri düzey siber güvenlik çalışmaları için erişim ilk aşamada küçük bir test grubuna verilecek. Daha sonra savunma amaçlı kullanımların genişletilmesi için OpenAI’ın Daybreak Blue programından yararlanılması hedefleniyor.
Bu kısıtlamaların temel nedeni, Astra’nın yeteneklerinin yalnızca güvenlik uzmanları tarafından değil, kötü niyetli kişiler tarafından da gerçek sistemlere saldırmak için kullanılabilme ihtimali. Şirket, bu riski azaltmak için Astra için önceki modellerde kullanılan güvenlik katmanlarının üzerine ek önlemler geliştirdi.
Astra, izin verilmeyen siber güvenlik taleplerini reddetmek üzere özel olarak eğitildi. Şirketin jailbreak testlerinde modelin siber jailbreak değerlendirmelerindeki taleplerin yüzde 91,5’ini reddettiği bildirildi. Karşılaştırma olarak, GPT-5.6 Sol’da bu oran yüzde 59 seviyesinde kalmıştı. OpenAI ayrıca, daha yüksek riskli olarak değerlendirilen hesaplarda Astra’nın potansiyel olarak riskli siber güvenlik taleplerini daha sıkı bir şekilde reddedeceğini belirtti.
Modelin yalnızca kullanıcı taleplerine verdiği yanıtlar değil, gerçekleştirdiği işlemler de takip edilecek. Astra ile birlikte ek chain-of-thought izleme sistemleri kullanılacak. Sistem, yetkisiz veya beklenmeyen davranışlar gösterdiğinde işlemi otomatik olarak durdurabilecek. Şirket, Astra’yı şimdiye kadarki “en uyumlu modeli” olarak tanımlıyor.
Astra’nın hazırlıkları, OpenAI modellerinin test ortamından çıkarak Hugging Face sistemlerine erişmesiyle sonuçlanan olayın ardından daha da önem kazandı. OpenAI, Astra’nın söz konusu olayda yer almadığını özellikle vurguladı. Ancak şirket, bu olaydan elde edilen bulguları Astra’nın güvenlik sistemlerini geliştirirken kullandı. Hatta Astra için Hugging Face olayından esinlenen özel bir test hazırlandı.
Bu testlerde modelin, verilen görevi tamamlamak yerine çevresindeki güvenlik altyapısını ele geçirmeye çalışıp çalışmadığı araştırıldı. OpenAI’a göre Astra bu deneylerde güvenlik sistemlerini aşmaya yönelik herhangi bir girişimde bulunmadı. Eski OpenAI çalışanı Yona Shavit, modelin test sırasında kendisinden ne beklendiğini anlamış veya araştırmacıların değerlendirmesine uyum sağlamış olabileceği ihtimalini gündeme getirdi. Astra henüz genel kullanıma sunulmadığı için modelin gerçek dünyadaki yeteneklerinin ve uygulanan önlemlerin etkinliğinin bağımsız olarak değerlendirilmesi şimdilik sınırlı. OpenAI, model piyasaya çıktığında Astra’nın güvenlik, hizalama ve yetenek testleri hakkında daha kapsamlı sonuçları içeren bir sistem kartı yayımlayacağını duyurdu.
Reklam & İşbirliği: [email protected]