Microsoft, yapay zekâ ajanlarını yalnızca verdikleri yanıtlarla değil, işlem sonunda sistemde gerçekten bıraktıkları sonuçlarla ölçen ThinkingBox değerlendirme sistemini Hugging Face üzerinden yayımladı.
Microsoft, yapay zekâ ajanlarını yalnızca verdikleri yanıtlarla değil, işlem sonunda sistemde gerçekten bıraktıkları sonuçlarla ölçen ThinkingBox değerlendirme sistemini Hugging Face üzerinden yayımladı.
ThinkingBox, 507 gerçekçi iş akışını farklı modellerle 20’şer kez çalıştırarak doğru kayıt değişikliklerini, eksik veya istenmeyen yan etkileri ve tekrarlar arasındaki tutarlılığı kontrol ediyor. Testlerde tek seferlik başarı ile güvenilirlik arasında ciddi farklar görülürken, GPT-6 Astra tek denemelik başarısının %78’ini 20 tekrarda koruyarak en yüksek tutarlılık oranını elde etti.