0
Přejít na obsah

Evals

Evals jsou strukturované testy určené k měření kvality, bezpečnosti a stability modelu nebo kompletního systému AI.

Co jsou evals

Evals jsou opakovatelné testy, které měří chování modelu nebo celého systému AI. Ověřují správnost, užitečnost, bezpečnost, konzistenci a schopnost pracovat s výjimkami. Jedna působivá ukázka nemůže nahradit systematické hodnocení.

Scénáře a očekávané výsledky

Sada obsahuje běžné úkoly, obtížné případy, neúplná data a situace, ve kterých má systém odmítnout nebo předat práci člověku. Každý scénář má popsaný vstup, očekávané chování a důvod, proč je pro podnik důležitý.

Kritéria a způsob hodnocení

Výsledek může kontrolovat přesné pravidlo, specializovaný hodnoticí model nebo člověk. Kritéria musí být srozumitelná a oddělovat různé druhy chyb. Jedno průměrné skóre může skrýt zhoršení malé, ale kritické skupiny případů.

Referenční verze a regrese

Nová verze se porovnává s předchozí stabilní verzí a jasně stanoveným minimem. Sada použitá pro hodnocení zůstává oddělená od materiálů pro ladění. Historie výsledků ukazuje, zda změna opravila jeden problém bez vytvoření jiného.

Provozní kontrola

Test před vydáním doplňuje sledování skutečného provozu. Zaznamenávají se neúspěšné scénáře, zásahy člověka, zpětná vazba a změny dat. Každý kritický výsledek má vlastníka, způsob eskalace a podmínku bezpečného zastavení.

Přístup PAR HOUSE Agency

Evals vytváříme současně s návrhem procesu AI. Nejdříve určujeme přijatelný a nepřijatelný výsledek, potom stavíme reprezentativní sadu a automatizujeme její opakování. Systém rozšiřujeme pouze po porovnání kvality, nákladů, rychlosti a rizika.