YZ Ajan Değerlendirmesi
1 araçYZ ajan performansını ölçmek, değerlendirmek ve iyileştirmek için araç ve çerçeveler.
Sponsorlu
YZ Ajan Değerlendirmesi hakkında
YZ ajan degerlendirmesi nedir?
YZ ajan degerlendirmesi, ajanin kullanicinin gercekten onemsedigi isi bitirip bitirmedigini olcer — sonraki tokenin akici gorunmesi yetmez. Tipik sinyaller: gorev basarisi, duzeltmeler, insana eskalasyon, arac hatalari, gecikme ve cozulmus oturum basina maliyet.
Bir sohbet botu statik bir testi kazanip uretimde yine de API uydurabilir, zorunlu onay atlayabilir veya biri devralana kadar donguye girebilir. Degerlendirme araclari bu basarisizliklari gorunur, zaman icinde karsilastirilabilir ve kuresel ortalama yerine belirli bir dagitima bagli hale getirir.
Bu etiket davranisi test eden, puanlayan ve iyilestiren urunleri gruplar. Bazilari cevrimdisi veri kumesine ve notlandiricilara odaklanir. Digerleri canli trafiği yakalar ve geri bildirim dongusune cevirir. Ogrenme platformlari basarisiz oturumlari, ajanin bir sonraki sefer alabilecegi denetlenir kurallara damitir.
Ne olcmelisiniz
Sonuctan baslayin, sonra arac secin:
- Cozum — Rubriginize gore sorun cozuldu mu?
- Duzeltme orani — Kullanici ne siklikla yeniden soylemek, geri almak veya ajanin ustunu yazmak zorunda kaldi?
- Eskalasyon — Bir insan ne siklikla, kac tur sonra devraldi?
- Arac guvenilirligi — Basarisiz cagrilar, yanlis argumanlar, eksik izinler.
- Guvenlik ve politika — Olmasi gereken reddler, olmamasi gereken eylemler.
- Maliyet ve gecikme — Ham yanit basina degil, basarili sonuc basina token ve sure.
Cevrimdisi altin kumeler regresyon icindir. Canli puanlamanin yerine gecmez: kullanicilar, araclar ve promptlar degisir.
Cevrimdisi ve cevrimici
Cevrimdisi kayitli izleri veya sentetik vakalari tekrar calistirir. Tekrarlanabilir, CI icin iyidir. Zayiflik: veri kumesı yaslanir, notlandirici dogruluktan cok usluba odul verebilir.
Cevrimici canli oturumlari acik sonuc sinyalleriyle puanlar (basparmak, kapanan bilet, satin alma, devralma). Gercegi yansitir. Zayiflik: gurultu, hacim ve net basari tanimi gerekir.
Olgun ekipler ikisini de kullanir. Cevrimdisi suitler bilinen kirilmalari yayindan once yakalar. Cevrimici panolar bir degisikligin ajanla gercekten konusanlara yardim edip etmedigini gosterir.
Insan geri bildirimi ve otomasyon
Insan incelemesi pahalidir ama belirsiz gorevlerde referans gercek olarak kalir. Ornekleme, rubrikler ve cift kor inceleme yanliligi dusurur. Otomatik notlandiricilar (yargic LLM, arac cagri testleri, sema kontrolleri) olceklenir ama ayrilmis bir sette insanlara karsi kalibre edilmelidir.
Tek bir yargic modeli kahin saymayin. Ajanla ayni basarisizlik kipini paylasiyorsa puanlar parlak gorunur, kullanicilar yine eskalasyon yapar.
Degerlendirme araci nasil secilir
- Is birimi — Tek yanit, cok adimli araclar mi, bellekli konusma mi?
- Iz sadakati — Yalnizca son metin degil, prompt, arac girdi/cikti ve baglam gorunuyor mu?
- Basari modeli — Sizin taniminizi urun veya musteri bazinda takabiliyor musunuz?
- Yonetisim — Yeni notlandiriciyi veya ogrenmeyi uretime kim yayinlar?
- Dagitim — Yalnizca SaaS mi, yoksa gunlukler VPC'den cikamasin diye self-host mu?
- Kapali dongu — Yalnizca puan mi, puanlar sonraki oturumu degistiriyor mu?
Riskler ve sinirlar
Siralama kovalamak suite'i oyunlastiran ajanlar uretir. Kucuk altin kumeye asiri uydurma canli basarisizliklari gizler. Tam transkriptler gizlilik ve saklama yukumlulugu dogurur. LLM yargic saglayiciya gore sizdirabilir veya musteri metniyle egitilebilir — uretim izlerini gondermeden once veri yolunu kontrol edin.
Sik sorulan sorular
Ajan degerlendirmesi model degerlendirmesiyle ayni mi?
Hayir. Model eval dondurulmus modeli bir kıstasa gore puanlar. Ajan eval bir sistemi puanlar: promptlar, araclar, bellek, politikalar ve etrafindaki insan is akisi.
Urun analitigimiz varken degerlendirme gerekir mi?
Analitik hacim ve terk etmeyi soyler. Degerlendirme ajanin hakli olup olmadigini ve nedenini soyler. Genelde ikisi de gerekir.
Degerlendirme ince ayarin yerini alabilir mi?
Bazen daha ucuz kaldirac daha iyi prompt, alinan bir kural veya engellenen bir aracdir — yeni bir checkpoint degil. Degerlendirme hangi kaldiracin sonucu hareket ettirdigini soyler.
Puanlarin sahibi kim olmali?
Basari tanimi icin urun veya operasyon sahibi, izler ve notlandiricilar icin muhendislik. Sahipsiz panolar curur.
