Context engineering és evalok · Lecke 07

Grader típusok

Kód alapú, modell alapú vagy emberi grader, a választás nem technikai részletkérdés, hanem alapvetően meghatározza, mennyire megbízható és mennyire skálázható a mérés.

Vissza a tananyaghoz


Kód alapú graderek

A kód alapú graderek string egyezést, bináris teszteket, vagy statikus elemzést használnak. Gyorsak, olcsók, és teljesen objektívek, hiszen determinisztikus szabályokat futtatnak. Ugyanakkor törékenyek lehetnek, ha a feladatnak több érvényes megoldási variációja is van, amit a merev szabály nem ismer fel helyesnek.


Kód alapú grader

  • String egyezés, bináris teszt, statikus elemzés
  • Gyors, olcsó, teljesen objektív
  • Törékeny, ha több érvényes megoldás létezik

Modell alapú grader

  • Rubrika, nyelvi állítások, páros összevetés
  • Rugalmas és jól skálázható
  • Nem-determinisztikus, drágább, kalibrálandó

Kód alapú Modell alapú Emberi gyors, olcsó objektív törékeny variációkra rugalmas, skálázható rubrika, páros összevetés nem-determinisztikus, drága kalibrálást igényel arany-standard minőség szakértő review drága és lassú string match, teszt rubrika pontozás crowdsourcing
A három grader típus a sebesség és a rugalmasság közötti kompromisszum két végén helyezkedik el.

Modell alapú és emberi graderek

A modell alapú graderek rubrika alapú pontozást, természetes nyelvi állításokat, vagy páros összehasonlítást használnak. Rugalmasabbak és jobban skálázhatók, mint a kód alapú megoldás, de nem-determinisztikusak, drágábbak, és gondos kalibrálást igényelnek, hogy megbízhatóan tükrözzék az emberi ítéletet.

Az emberi graderek szakértői review-t vagy crowdsourcingot alkalmaznak, arany standard minőséget adva, de ez a legdrágább és leglassabb módszer, ezért jellemzően csak korlátozott mennyiségű taskra, vagy kalibrációs mintaként érdemes alkalmazni.


Emberi ítélet kalibrációs minta kalibrálás Modell alapú grader skálázott pontozás az eltérések visszajelzésként újra kalibrálnak
A modell alapú grader az emberi ítélet mintáihoz kalibrálva válik megbízhatóvá, és a kör időről időre ismétlődik.

Melyik graderre mikor van szükség

A gyakorlatban a legtöbb eval csomag mindhárom típust kombinálja. A kód alapú grader ellenőrzi a determinisztikus, egyértelmű részeket, a modell alapú grader kezeli a nyitottabb, szubjektívebb szempontokat, az emberi review pedig a kalibrációt és a legkritikusabb esetek végső ellenőrzését végzi. A cél mindig a determinisztikus grader előnyben részesítése ott, ahol lehetséges, hiszen az objektivitás és a megbízhatóság ára a rugalmasság csökkenése.


3

Mindhárom grader típust kombinálja a legtöbb eval csomag. Ahol csak lehet, a determinisztikus kód alapú grader az első választás.


  1. Kód alapú grader fut előszörA determinisztikus, egyértelmű részeket olcsón és objektíven ellenőrzi.
  2. Modell alapú grader következikA nyitottabb, szubjektívebb szempontokat rubrikával pontozza.
  3. Emberi review zárKalibrál, és a legkritikusabb eseteket végső soron ellenőrzi.

Kódoló ügynök eval stabil teszt-környezet unit tesztek, SWE-bench determinisztikus grader kimenetet, nem lépést értékel Beszélgető ügynök eval állapot és eszközhasználat szimulált felhasználó (τ-Bench) verifikálható végállapot rubrika az interakció minőségére
A kódoló és a beszélgető ügynökök eval csomagjai eltérő grader hangsúlyt igényelnek.

← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →