AI rendszerek termelésben · Lecke 04

Megfigyelhetőség

Ha egy ügynök elbukik egy feladatot, tudnod kell, miért. A megfigyelhetőség nem a beszélgetés tartalmának olvasásáról szól, hanem az ügynök döntési mintáinak méréséről.

Vissza a tananyaghoz


Miért buknak el az ügynökök

Anthropic termelési nyomkövetése feltárta, hogy az ügynökök elbukásának leggyakoribb okai jól azonosítható mintákba rendeződnek. A rossz keresési lekérdezés, a gyenge forrásválasztás és az eszközhiba a leggyakoribb okok, és ha ezek nem láthatók a rendszer működése közben, a hibák megismétlődnek anélkül, hogy bárki észrevenné a mintát.

A megfigyelhetőség célja nem az, hogy utólag megpróbáljuk kitalálni, mi történt, hanem hogy folyamatosan lássuk, milyen döntéseket hoz az ügynök, milyen eszközöket választ, és hol térnek el a várt lépésektől.


  1. Rossz keresési lekérdezésAz ügynök pontatlanul fogalmazza meg, mit keres, így nem talál használható eredményt.
  2. Gyenge forrásválasztásTalál eredményt, de nem a legmegbízhatóbb forrásból dolgozik tovább.
  3. EszközhibaAz eszközhívás technikai okból bukik el, és az ügynök nem tudja jól lekezelni.

  1. Nyomkövetés élesbenMinden döntés és eszközválasztás mérhető nyomot hagy.
  2. Minta azonosításaA bukások jól azonosítható mintákba rendeződnek, nem egyedi balesetek.
  3. Célzott finomításA rendszer ott javul, ahol a minta mutatja a gyengeséget.
  4. A minta eltűnikA következő nyomkövetési kör igazolja vissza a javulást.

Mit mérünk eszközválasztás, lekérdezés minőség, hibaarány, interakciós struktúra Mit nem mérünk a beszélgetés tényleges tartalma, a felhasználó személyes adatai Az ügynök döntési mintái és interakciós struktúrái, adatvédelem megőrzésével
A megfigyelhetőség a viselkedést méri, nem a tartalmat, ez őrzi meg a felhasználói adatvédelmet.

Adatvédelem és megfigyelhetőség együtt

Sokan azt feltételezik, hogy egy jól megfigyelt rendszerhez hozzá kell férni a felhasználói beszélgetések tartalmához. Anthropic gyakorlata ennek az ellenkezőjét mutatja. A rendszer az ügynök döntési mintáit és interakciós struktúráit figyeli anélkül, hogy a beszélgetés tartalmához hozzáférne, így a felhasználói adatvédelem és a rendszer átláthatósága nem zárja ki egymást.


Tartalom olvasása

A hibakeresés a felhasználói beszélgetések átnézésén alapul. Adatvédelmi kockázat, és a minták így sem látszanak.

Viselkedés mérése

Döntési minták, eszközválasztás, interakciós struktúrák. A hibaminta láthatóvá válik, a tartalom zárva marad.


Eszközhasználat Lépésidő Hibaarány Lekérdezés minőség Forrásválasztás Interakciós minta mindegyik mérőszám a viselkedésről szól, egyik sem a beszélgetés tartalmáról
A megfigyelhetőség rácsa, hat mérőszám, ami a hibakeresést segíti a tartalom megnyitása nélkül.

Mit érdemes bevezetni egy vállalati rendszerben

Egy induló AI ügynökrendszernél már az is óriási előrelépés, ha loggoljuk, melyik eszközt mikor hívta meg az ügynök, mennyi ideig futott egy lépés, és hol lépett ki hibával. Ezekből az adatokból derül ki, hol érdemes a rendszert finomítani, mielőtt a probléma nagyobb léptékben, sok felhasználónál jelentkezne.


Futó ügynök lépések, eszközhívások Log melyik eszköz, mikor, mennyi ideig, milyen hibával Finomítás célzott javítás a hibaminta a logban látszik meg, mielőtt sok felhasználónál jelentkezne
Már az egyszerű loggolás is folyamatosan táplálja a célzott finomítást egy induló rendszernél.

← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →