Synthetic Consumer LabSynthetic Consumer LabDemoyu dene
Makale — 6 dk okuma

MatrAIx: Simulating the World with 8.3 Billion Persona Agents

8,3 milyar persona kaydı ve 1.010 hazır görevle yapay zekâ sistemlerini ve dijital ürünleri popülasyon ölçeğinde test eden simüle kullanıcı değerlendirme altyapısı.

Araştırma Soruları

  • İnsan değerlendirmesinin pahalı, yavaş ve ölçeklenmesi zor olduğu koşullarda, yapay zekâ sistemleri ve dijital ürünler heterojen kullanıcılarla nasıl test edilebilir?
  • Popülasyon ölçeğinde bir persona veri kümesi, gerçek dünyadaki bağımlılıkları ve dağılımları koruyacak biçimde nasıl kurulur?
  • Persona ajanları kendilerine atanan özelliklere gerçekten uyuyor mu; söyledikleri ve yaptıkları atanan personayı yansıtıyor mu?
  • Simüle kullanıcı çalışmaları; sistemler, görevler ve kullanıcı grupları arasında tutarlı farklar ortaya çıkarıyor mu?

Sonuçlar

  • MatrAIx üç bileşenden oluşan uçtan uca bir değerlendirme altyapısı sunuyor: 1.290 boyutlu ortak bir şema üzerine kurulu 8,3 milyar kayıtlık Persona 8B, dört ortamı çalıştıran MatrAIx Playground ve 1.010 görevlik MatrAIx Applications kütüphanesi.
  • Araştırma kullanımı için yaklaşık 1 milyon personalık bir çekirdek küme yayımlandı: 599.847 insan temelli ve 400.000 sentetik kayıt.
  • Sekiz temsili görevde 18.189 değerlendirme denemesi yürütüldü; persona ajanları Claude Opus 4.8, GPT 5.5 ve Claude Haiku 4.5 ile çalıştırıldı.
  • 400 denemelik kontrollü davranış çalışmasında, atanan davranış denemelerin %91,5’inde (366/400) ya ifade edildi ya da doğru biçimde bastırıldı.
  • İnsan temelli personaların çıkarım kalitesi, kaynakla eşleştirilmiş 100 personalık altkümede altı insan değerlendirici tarafından 5 üzerinden ortalama 4,135 puanla desteklendi.

Bulgular

  • Popülasyon kurgusu: 1.290 kategorik boyut arka plan (238), psikoloji (210), yetenek (331), davranış ve etkileşim (124) ve yaşam tarzı (387) olarak gruplanıyor. Sentetik kayıtlar, bağımlılıkları koruyan yönlü çevrimsiz bir grafik (DAG) üzerinden örnekleniyor; böylece yaş–eğitim veya bölge–dil gibi ilişkiler bozulmuyor.

  • İnsan temelli kayıtlar: Wikipedia biyografileri, Amazon yorum geçmişleri, Stack Overflow Geliştirici Anketi, General Social Survey, PRISM hizalama profilleri ve onaylı MatrAIx persona anketi aynı şemaya eşleniyor; isim ve iletişim bilgisi gibi doğrudan tanımlayıcılar kaldırılarak kimliksizleştiriliyor.

  • Dört değerlendirme ortamı: Anket (fiyat duyarlılığı, konsept testi), Yapay Zekâ Sohbet Botu (memnuniyet, gecikme toleransı, hatadan sonra devam etme), Web (tarayıcı otomasyonu ve bilgisayar kullanan ajanlar) ve Uygulama (Docker tabanlı masaüstü ile uzak macOS/iOS simülatörü).

  • Görev kütüphanesi: 1.010 görev 25’ten fazla alanı kapsıyor — 621 Anket, 371 Sohbet Botu, 12 Web, 6 Uygulama; ana alanlar Ticaret, Yazılım, Finans ve Sağlık.

  • Ortam bazında uyum: Kontrollü davranış çalışmasında başarı oranı Anket’te %96, Sohbet Botu’nda %92, Web’de %95 ve Uygulama’da %83 oldu; 40 özellik-ortam hücresinin 33’ü her iki kolda da en az 5’te 4 başarı yakaladı.

  • Model bağımlılığı: OpenBB görevinde güven düzeyi, üç persona-ajan modelinin tamamında altgrupları aynı sırayla ayırdı (Cramér’s V = 0,228–0,363, tümü q < 10⁻⁸). Buna karşılık persona etkileri modele göre değişebildiği için, persona-ajan modelinin her sonuçla birlikte raporlanması gerekiyor.

  • Sınırlar: Yemek planlama görevinde altgruplar arası farklar (örn. çocuğu evden ayrılmış katılımcılar %66’ya karşı kariyer değiştirenler %46) Benjamini–Hochberg düzeltmesinden sonra anlamlı kalmadı; yazarlar bu tür bulguları doğrulanmış persona etkisi değil betimleyici fark olarak sunuyor. Gerçek popülasyonlara veya kritik kararlara genelleme yapılmadan önce insan çalışmaları hâlâ gerekli.

  • LLM Modelleri: 3

  • Sentetik Veri: 5

  • Yöntem: 5

  • Hız: 4

  • Etik: 4

  • Doğruluk Oranı: 4

  • Demografi: 5

Bu makale ile ilgili daha detaylı bilgiye ulaşmak isterseniz buraya tıklayarak ilgili makalenin ekine ulaşabilirsiniz.

Kaynağın tam metni ← Tüm makaleler