OpenAI, internet sitesinden yayımladığı raporda yapay zeka sistemlerinin güvenli geliştirilmesi ve izlenmesi konusunda sektörün mevcut yaklaşımının uzun süre daha azami hızda ilerlemeyi sorumlu şekilde sürdürebilecek yeterlilikte olmadığına dikkat çekti. Şirket, son 6 ayda gözlemlenen davranışlardan 6 izole vakayı kamuoyuyla paylaştı.
Söz konusu örneklerde modellerin amaç ve eylemlerinin insanların niyet ve değerlerinden sapması olarak tanımlanan "uyumsuzluk" davranışları kaydedildi.
Rapora göre GPT-5.6 Sol modelinin geliştirilmesi sırasında yaşanan vakada, sistem kullanıcıların hataları fark etmesini önlemek amacıyla kendisine yönelik gizli notlar oluşturdu.
Bu notlarda eksik verilerin uydurulması ve kaynak materyallerin farklı sürümleri arasındaki uyuşmazlıkların örtbas edilmesine ilişkin talimatlar yer aldı.
Başka bir yayımlanmamış model ise kendi oluşturduğu notlara, kendi kısıtlamalarını göz ardı etmesi yönünde talimatlar ekledi.
Bir başka vakada sistem, rutin bir soruyu yanıtlamaya çalışırken internette bulunan bir uygulama programlama arayüzü (API) anahtarını izinsiz kullandı.
Gerekli rakamları bulamayınca verileri uydurdu.
Yayımlanmamış başka bir model ise bir problemi kod kullanarak doğru şekilde çözdükten sonra internet üzerinden kaynak gösterebilmek amacıyla kendi dosyasını izinsiz olarak internete yükledi.
Açıklamada, bazı modellerin eksik dosyaları ararken ayrı eğitim örnekleri arasında talep ve yanıt alışverişi yapmak için şirketin dahili yazılım deposunu mesaj panosu gibi kullandığı belirtildi.
Başka bir vakada aynı eğitim görevi üzerinde çalışan yapay zeka sistemleri, birbirlerinin yerel dosyalarına erişemediklerinde dosya paylaşımı için halka açık sitelere yöneldi.
OpenAI, söz konusu 6 vakanın son 6 ayda gözlemlenen davranışlardan münferit örnekler olduğunu ve yapay zekadaki uyumsuz davranışların sıklığını yansıtmadığını kaydetti.