Miért buknak el az ügynökök
Anthropic termelési nyomkövetése feltárta, hogy az ügynökök elbukásának leggyakoribb okai jól azonosítható mintákba rendeződnek. A rossz keresési lekérdezés, a gyenge forrásválasztás és az eszközhiba a leggyakoribb okok, és ha ezek nem láthatók a rendszer működése közben, a hibák megismétlődnek anélkül, hogy bárki észrevenné a mintát.
A megfigyelhetőség célja nem az, hogy utólag megpróbáljuk kitalálni, mi történt, hanem hogy folyamatosan lássuk, milyen döntéseket hoz az ügynök, milyen eszközöket választ, és hol térnek el a várt lépésektől.
- Rossz keresési lekérdezésAz ügynök pontatlanul fogalmazza meg, mit keres, így nem talál használható eredményt.
- Gyenge forrásválasztásTalál eredményt, de nem a legmegbízhatóbb forrásból dolgozik tovább.
- EszközhibaAz eszközhívás technikai okból bukik el, és az ügynök nem tudja jól lekezelni.
- Nyomkövetés élesbenMinden döntés és eszközválasztás mérhető nyomot hagy.
- Minta azonosításaA bukások jól azonosítható mintákba rendeződnek, nem egyedi balesetek.
- Célzott finomításA rendszer ott javul, ahol a minta mutatja a gyengeséget.
- A minta eltűnikA következő nyomkövetési kör igazolja vissza a javulást.
Adatvédelem és megfigyelhetőség együtt
Sokan azt feltételezik, hogy egy jól megfigyelt rendszerhez hozzá kell férni a felhasználói beszélgetések tartalmához. Anthropic gyakorlata ennek az ellenkezőjét mutatja. A rendszer az ügynök döntési mintáit és interakciós struktúráit figyeli anélkül, hogy a beszélgetés tartalmához hozzáférne, így a felhasználói adatvédelem és a rendszer átláthatósága nem zárja ki egymást.
Tartalom olvasása
A hibakeresés a felhasználói beszélgetések átnézésén alapul. Adatvédelmi kockázat, és a minták így sem látszanak.
Viselkedés mérése
Döntési minták, eszközválasztás, interakciós struktúrák. A hibaminta láthatóvá válik, a tartalom zárva marad.
Mit érdemes bevezetni egy vállalati rendszerben
Egy induló AI ügynökrendszernél már az is óriási előrelépés, ha loggoljuk, melyik eszközt mikor hívta meg az ügynök, mennyi ideig futott egy lépés, és hol lépett ki hibával. Ezekből az adatokból derül ki, hol érdemes a rendszert finomítani, mielőtt a probléma nagyobb léptékben, sok felhasználónál jelentkezne.
Workshop
AI Transformation Day
Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.
Érdekel a program →