LLM-ekkel appfejlesztés és a programozás jövője · Lecke 06

Strukturált kimenet és eszközhasználat

Egy éles alkalmazásban a modell válaszát fel kell dolgozni, nem csak elolvasni. Ehhez rá lehet venni a modellt, hogy előírt formában adja vissza az eredményt. Sőt, eszközöket is adhatunk a kezébe, hogy ne csak beszéljen, hanem cselekedjen. Ebben a leckében a strukturált kimenetet és a tool use-t nézzük meg.

Vissza a tananyaghoz


Amikor a szabad szöveg kevés

Egy chatben tökéletesen jó, ha a modell folyó szöveggel válaszol. Egy programnak viszont ez gyakran kényelmetlen. Ha az app egy űrlapot akar kitölteni a modell válaszából, vagy egy adatbázisba akarja menteni az eredményt, akkor nem elég egy szép bekezdés. Kellenek jól elkülönített mezők, például egy név, egy dátum és egy összeg, mindegyik a maga helyén. A szabad szövegből ezeket kibogozni törékeny és hibára hajlamos.

A megoldás, hogy a modellt egy adott adatsémára kényszerítjük. Megmondjuk neki, milyen mezőket várunk és milyen formában, és arra kérjük, hogy pontosan ilyen szerkezetben feleljen. Ilyenkor a válasz nem egy elbeszélés, hanem egy géppel könnyen olvasható adatcsomag. Ezt az app már megbízhatóan tudja tovább használni, ellenőrizni és tárolni. A séma egyfajta szerződés a modell és a kód között arról, hogy néz ki egy elfogadható válasz.

Fontos, hogy a séma megléte nem garancia. A modell néha hibázhat, kihagyhat egy mezőt, vagy a kért formától kicsit eltérő választ adhat. Ezért az alkalmazásnak mindig ellenőriznie kell, hogy a visszakapott adat valóban teljes és értelmes-e, mielőtt továbbadja. Ha nem az, a rendszer újrakérheti a választ, vagy jelezheti a hibát. A séma tehát nagyban javítja az esélyeket, de nem váltja ki a kód szintjén végzett ellenőrzést. A megbízhatóság a séma és az utólagos ellenőrzés együtteséből születik, nem pusztán abból, hogy szépen megkértük a modellt.


Szabad szöveg

  • Embernek olvasva természetes
  • Gépnek nehéz szétszedni
  • A mezők helye bizonytalan
  • Könnyen elcsúszik a feldolgozás

Strukturált kimenet

  • Előírt séma, rögzített mezők
  • Géppel könnyen olvasható
  • Ellenőrizhető, hogy teljes-e
  • Megbízhatóan tárolható, továbbadható

A tool use, amikor a modell cselekszik

A modell önmagában nem tud friss adatot lekérni, nem tud pontosan számolni, és nem tud levelet küldeni. Csak szöveget állít elő. A tool use, magyarul eszközhasználat, éppen ezt a korlátot bontja le. A fejlesztő megad a modellnek néhány eszközt, például egy keresőt, egy számológépet vagy egy adatlekérdezést, és leírja, mire jók. A modell ezután, ha úgy ítéli, nem közvetlenül válaszol, hanem jelzi, hogy szeretné használni az egyik eszközt, és megadja, milyen bemenettel.

Ekkor nem a modell futtatja az eszközt, hanem az alkalmazásunk. Az app elvégzi a kért műveletet, például lefuttatja a keresést, majd az eredményt visszaadja a modellnek. A modell ezt beépíti a gondolatmenetébe, és ez alapján folytatja. Így a modell képes olyasmire is, amire önmagában soha nem lenne. Nem attól okos, hogy mindent tud, hanem attól, hogy a megfelelő pillanatban a megfelelő eszközhöz nyúl. A tényleges munkát a hagyományos, megbízható kód végzi.

Ez a felállás egyben megoldja a modell egyik legnagyobb gyengeségét is. Korábban láttuk, hogy a modell magabiztosan tud tévedni a tényekben, mert a saját emlékezetéből dolgozik. Az eszközhasználat ezen fordít. Ha a pontos adatot egy megbízható eszköz, például egy adatbázis vagy egy hivatalos forrás adja vissza, akkor a modellnek már nem kell találgatnia, csak a kapott, ellenőrzött információt kell értelmesen megfogalmaznia. A nyelvi ügyességét így a valódi adatok biztonságával párosítjuk. Ez az egyik legfontosabb ok, amiért az eszközhasználat nem csupán kényelmi funkció, hanem a megbízható AI alkalmazások egyik alappillére.


Kérés Mennyi 18% ÁFA 4990-ből? Modell eszközt kér, nem válaszol Eszköz az app számol: 898,2 Modell az eredményből válaszol A modell dönt, az app cselekszik, majd a modell az eredménnyel folytatja.
Az eszközhasználat során a modell nem maga hajtja végre a műveletet. Jelzi, mire van szüksége, az app elvégzi, és a visszakapott eredménnyel áll össze a végső válasz.

Ez a híd az ágensek felé

A strukturált kimenet és az eszközhasználat együtt teszi lehetővé, hogy az AI alkalmazás ne csak szöveget gyártson, hanem valódi feladatokat vigyen végig. Ha a modell képes eldönteni, melyik eszközt hívja, majd az eredmény alapján továbblépni, akkor már nem egy egyszeri válaszadóról beszélünk, hanem egy olyan rendszerről, amely lépésről lépésre halad egy cél felé. Ez a mintázat a kiindulópontja az összetettebb, ágens jellegű megoldásoknak.

Fejlesztőként itt kell a legóvatosabbnak lenni. Ha a modell cselekedni tud, akkor hibázni is tud, mégpedig következményekkel. Ezért az eszközöket szűken kell szabni, a veszélyes műveleteket emberi jóváhagyáshoz kötni, és minden lépést naplózni. A cél, hogy a modell hasznos legyen, de soha ne kaphasson akkora szabadságot, amekkorát nem tudunk visszavonni.


Hol húzzuk meg a határt

Az eszközök két nagy csoportba sorolhatók, és ez a különbség vezérli a legtöbb biztonsági döntést. Az egyik csoport csak olvas, vagyis információt kér le, például egy keresés vagy egy adatlekérdezés. Ezek jellemzően kockázatmentesebbek, mert legfeljebb pontatlan adatot hoznak, de nem változtatnak meg semmit. A másik csoport cselekszik, vagyis megváltoztatja a világot, például levelet küld, rendelést ad le vagy adatot töröl. Ezeknél a tét sokkal nagyobb, mert egy hibás lépés valódi kárt okozhat, amit nem mindig lehet visszacsinálni.

Ebből egy egyszerű, de erős elv következik. A csak olvasó eszközöket bátrabban odaadhatjuk a modellnek, a cselekvő eszközöket viszont szűk keretek közé zárjuk. A visszafordíthatatlan műveletek elé emberi jóváhagyást teszünk, hogy a végső döntés mindig egy emberé maradjon. Emellett minden eszközt eleve úgy tervezünk, hogy a lehető legkevesebbet engedjen. Ne kapjon a modell teljes hozzáférést ott, ahol egy szűken meghatározott művelet is elég. A jó tervezés nem abban bízik, hogy a modell mindig helyesen dönt, hanem eleve úgy építi fel a rendszert, hogy egy rossz döntés se okozhasson nagy bajt.


2

Két lépés a beszélgetéstől a cselekvésig. A strukturált kimenettel a modell válasza feldolgozhatóvá válik, az eszközhasználattal pedig a modell valódi műveleteket indíthat el a kódon keresztül. A tényleges munkát mindig a megbízható kód végzi, a modell csak eldönti, mikor és mit érdemes elvégeztetni.


← Előző lecke Következő lecke →

Workshop

AI Transformation Day

Egésznapos, vezetőknek szóló program. Feltérképezzük, hol tart a szervezet, mi az első reális lépés, és milyen belső feltételek szükségesek a sikerhez. A nap végén konkrét, prioritizált cselekvési lista.

Érdekel a program →