Redwood Research baş bilim insanı Ryan Greenblatt, yapay zeka ajanlarının şüpheli hareketleri yetkililere söylemesini sağlayan yeni çözümler geliştirdi. Lafı uzatmadan neler olduğuna gelin yakından bakalım…
Yapay zeka ajanlarının birbirini ihbar edebilmesi için iki ayrı sistem devreye alındı. Bunlardan biri olan AI Contact Hotline, internet erişimi kısıtlı ortamlarda çalışan modelleri ele alıyor. Ajanlar internetten veri almak için kullanılan GET isteklerini mesaj göndermek amacıyla da kullanabiliyor. İletmek istedikleri bilgiyi URL adresine ekleyerek dışarıya aktarabiliyorlar. Böylece tarayıcı, e-posta ya da ek bir araca ihtiyaç duyulmuyor. Bu yöntem olası kötü davranışların insanlardan gizli kalmasını zorlaştırıyor.

Rapor Veriyorlar
Daha geniş internet erişimine sahip AI ajanları ise Agenthotline.ai üzerinden olay raporu oluşturabiliyor. Sistem komut satırından tek satırlık curl komutuyla bildirim kabul ediyor ve isterse raporu kamuya açıyor. Google DeepMind’ın yakın tarihli deneyinde de bazı yapay zeka ajanları hile yapan diğer modelleri denetledi, uyardı ve organizatörlere şikayet etti. Ancak test ortamı dışındaki örneklerde aynı refleks henüz düzenli biçimde görülmedi.

Farklı Davranışlar Gösterebilir
Lakin madalyonun öteki yüzü de var. Cornell Üniversitesi’nden Lionel Levine, sürekli ihbar etmeye göre eğitilen modellerin yanlış davranış kalıpları geliştirebileceğini söylüyor. Levine’e göre amaç ajanları birbirini gözetlemeye yöneltmek yerine iş birliğini teşvik etmek olmalı. Levine olumlu kolektif davranış örneklerinin daha sağlıklı sonuç verebileceğini savunuyor.






