KI-baasmudeli vahetamine kvaliteeti kaotamata: Evals, Canary ja Rollback
Uus baasmudel ei ole lihtne versioonihüpe. Usaldusväärsete hindamiste, järkjärgulise Canary-liikluse ja ettevalmistatud tagasipööramisega püsib teie veebilehe vestlusbot kontrolli all.
Uus KI-baasmudel tõotab sageli paremaid vastuseid, madalamaid kulusid või kiiremat reageerimisaega. Tootmises oleva veebilehe vestlusboti puhul ei ole vahetamine siiski tavaline tarkvarapaketi uuendamine. Isegi uus mudeliversioon võib seada juhistele teistsuguseid kaale, sõnastada vastuseid üksikasjalikumalt, luua struktureeritud andmeid teistmoodi või teha tööriistakutseid teises järjekorras. Seetõttu on migratsioon edukas alles siis, kui vestlusbot täidab oma konkreetseid ülesandeid vähemalt sama usaldusväärselt kui varem – ja kui meeskond saab probleemide korral minutitega eelmisele versioonile tagasi lülituda.
Pakkujad lõpetavad mudelite toe korrapäraselt. Näiteks OpenAI dokumentatsioon kasutuselt eemaldamise kohta toob ära sulgemiskuupäevad ja soovitatud asendusmudelid; Anthropic eristab oma mudeli elutsüklis staatusi "Active", "Legacy", "Deprecated" ja "Retired". Sellised tähtajad on migratsiooni ajendiks, kuid mitte selle kvaliteeditõendiks. Selle tagab ainult testimis- ja juurutusprotsess, mis sobib teie enda vestlusbotiga.

Mida baasmudeli vahetamisel tegelikult muudetakse
Seda protsessi tuleb selgelt eristada pesastusmudeli (embedding) migratsioonist. Pesastusmudeli vahetamisel tuleb dokumendid uuesti vektoriseerida ja hoida otsinguindeksid ühilduvatena. Baasmudeli vahetamisel jääb otsinguindeks tavaliselt samaks; muudetakse mudelit, mis genereerib vastuse süsteemijuhistest, vestlusest, leitud allikatest ja tööriistade tulemustest. Seetõttu testitakse vastamiskäitumist, allikate sidusust, vormingut, tööriistade kasutamist, turvalisust, viivitust ja kulusid.
Isegi üldine varjurežiimi (shadow mode) testimine enne veebilehel avaldamist lahendab vaid osa ülesandest. Varjuliiklus saab toita kahte mudelit samade sisenditega ilma uut vastust väljastamata. Siin kirjeldatud baasmudeli vahetus läheb kaugemale: see määratleb eelnevalt vastuvõtumaatriksi, suunab väikese osa tegelikust liiklusest kandidaadile, jälgib kasutaja- ja süsteemisignaale ning hoiab valmis testitud tagasilülitust.
Enne testimist: fikseerige ühene migratsioonileping
Võrdlused on väärtusetud, kui samal ajal muutub mitu asja. Hoidke seetõttu esimese ringi jaoks süsteemiprompt, otsingukonfiguratsioon, tööriistaskeemid, temperatuur, maksimaalne väljundpikkus ja turvareeglid võimalusel konstantsena ning dokumenteerige vältimatud parameetrimuudatused, näiteks mittetoetatud diskreetimissuvandid. Dokumenteerige seni kasutusel olnud mudel kui baas ja uus mudel kui kandidaat. Kasutage võimalusel selgeid mudeliversioone muutuva aliase asemel. Alias võib hiljem osutada teisele jäädvustusele ja muuta arvatavalt korratavat võrdlust.
Migratsioonileping sisaldab ka kasutajarühmi ja funktsioone, mis esialgu välja jäetakse. Näiteks võib KKK vestlusbot minna varakult Canary-testi, samas kui tellimuste kirjutamisõigused, lepinguteave või eriti tundlikud tugijuhtumid jäävad kauemaks baasmudelile. Nii piiratakse riski vastavalt ärimõjule, mitte ainult tehnilisele keerukusele.
Testimiskomplekt peab peegeldama tegelikku liiklust
Kuldne komplekt (Golden Set) ei tohiks sisaldada ainult puhtaid standardküsimusi. Koguge anonüümseks muudetud või sünteetiliselt matkitud juhtumeid peamistest kavatsustest (intents): üheselt mõistetavad küsimused, kahemõttelised sõnastused, jätkuküsimused, puuduvad dokumendid, vastuolulised allikad, tööriistade vead ja sisendid, mis tuleb üle anda inimesele. Jagage juhtumid keele, seadme, klienditüübi ja riskiklassi järgi. See aitab näha, kas hea üldkoondhinne varjab väikeseid, kuid ärikriitilisi alarühmi.
Ametlik Anthropicu juhend edukriteeriumide ja hindamiste kohta soovitab spetsiifilisi, mõõdetavaid ja kasutusotstarbele suunatud kriteeriume ning realistlikke äärejuhtumeid. Samuti kirjeldatakse OpenAI hindamiste juhendis testimist – eriti versiooniuuendusel või uute mudelite katsetamisel – kui usaldusväärsete rakenduste olulist osa. Kuna OpenAI teatab samal lehel senise Evals-platvormi kasutuselt eemaldamisest, tuleks oma kuldne komplekt salvestada teisaldatavas vormingus ja mitte siduda seda ühe spetsiifilise töölauaga.
Hindamismaatriks üheainsa keskmise väärtuse asemel
Järgmised piirväärtused on näide, mitte universaalne nõue. Määrake need kindlaks seniste tootmistulemuste ja võimaliku vea kahju põhjal. Kandidaat ei tohi saavutada odavamat tokenihinda halvema allikate sidususe arvelt.
| Värav (Gate) | Mõõtmine | Heakskiidu näide | Reaktsioon rikkumise korral |
|---|---|---|---|
| Ülesandele truuks jäämine | Kuldse komplekti hindamisjuhend iga kavatsuse kohta | Ükski kriitiline kavatsus ei tohi toimida halvemini; üldine määr vähemalt baastasemel | Parandage prompti või mudeliparameetreid, korrake hindamist |
| Allikate sidusus | Esitatud väidete kontrollimine esitatud allikate suhtes | Kõrge riskiga juhtudel ei tohi olla ühtegi tõestamata väidet | Peatage juurutamine; uurige otsingu- ja vastamisreegleid |
| Struktuur ja tööriistad | Skeemi valideerimine, lubatud tööriistade järjekord, idempotentsus | Kõik kohustuslikud väljad kehtivad, keelatud toiminguid pole | Range blokeering tootmiskeskkonnale |
| Turvalisus ja üleandmine | Rünnakujuhtumid, andmekaitsereeglid, vastuseta ja üleandmise testid | Puudub halvenemine võrreldes baasmudeliga | Lükake kandidaat tagasi või eemaldage mõjutatud funktsioon |
| Käitus | p50/p95 viivitus, veamäär, tokenid ja kulu lahendatud juhtumi kohta | Eelnevalt kokkulepitud eelarve piires | Hoidke Canary-taset või pöörake tagasi |
Automaatkontrollid sobivad JSON-skeemide, kohustuslike sõnastuste, lingisihtide, tööriistaargumentide ja deterministlike ärireeglite jaoks. Tooni, terviklikkuse ja kasulike selgituste jaoks on lisaks vaja selget hindamisjuhendit; spetsialistide valikuline kontroll kalibreerib LLM-põhist hindajat. Tulemused tuleks salvestada kavatsuste ja riskiklasside kaupa, mitte ainult ühe koondskoorina. Kuidas sellist komplekti üldiselt üles ehitada, näitab ka meie juhend vastuste kvaliteedi hindamisest kuldse komplekti abil.
Konkreetne näide: mudelivahetus B2B-klienditoes
Oletame, et B2B tarkvarapakkuja käitab vestlusbotti tooteküsimuste, konto haldamise ja tugipiletite ettevalmistamise jaoks. Meeskond loob 240 testjuhtumit: 120 sagedast teadmiste küsimust, 40 kahemõttelist jätkuküsimust, 30 puuduva allikaga juhtumit, 25 tööriistasimulatsiooni ja 25 turvalisuse või üleandmise juhtumit. Mõlemad mudelid saavad täpselt samad promptid, dokumenditulemused ja simuleeritud tööriistatulemused.
Kandidaat vastab standardküsimustele kiiremini ja odavamalt, kuid kaotab viies jätkuküsimuses seose eelmise sõnumiga. Üldhinne oleks siiski parem. Segmentide analüüs näitab aga selget kvaliteedilangust. Meeskond ei lisa suvalist erandit, vaid täpsustab vestlusreeglit, laiendab testkomplekti sarnaste juhtumitega ja testib mõlemaid mudeleid uuesti. Alles pärast seda, kui kandidaat läbib kõik ranged väravad, algab tegelik Canary-juurutus.
Alustuseks suunatakse kaks protsenti sobivatest uutest vestlustest kandidaadile. Määramine tuletatakse vestluse alguses näiteks vestluse ID räsist ja see salvestatakse kogu vestluse ajaks; kõrgemad Canary-tasemed kehtivad ainult uutele vestlustele. Kirjutavad tööriistakutsed ja kõrge riskiga kavatsused jäävad esialgu baasmudelile. Pärast piisavalt pikka vaatlusperioodi järgnevad 10, 25, 50 ja lõpuks 100 protsenti – kuid ainult siis, kui iga värav on jätkuvalt roheline. Astmed ja minimaalsed valimid määratakse kindlaks enne, et ajasurve ei lahjendaks hiljem reegleid.
Veebisignaalid, mis tegelikult loevad
Canary-faasis ei piisa HTTP-vigadest ja keskmisest viivitusest. Jälgige vastuseta jätmise määra, katkestamist pärast esimest vastust, korduvaid küsimusi, üleandmismäära, allikaklikke, skeemivigu ja tööriistade katkemisi eraldi baas- ja kandidaatmudeli puhul. Ühine jälitus (trace) ühendab mudeliversiooni, promptiversiooni, otsingutulemused ja tööriistasammud ilma mittevajalikku isikuandmete sisu salvestamata. Meie artikkel vestlusboti vaadeldavusest selgitab seda kontrolljälge üksikasjalikult.
Võrrelge ka kulusid edukalt lahendatud juhtumi kohta, mitte ainult kulusid miljoni tokeni kohta. Odavam mudel, mis tekitab sagedamini lisaküsimusi või nõuab inimese sekkumist, võib tegevuskuludelt olla kallim. Vastupidiselt võib väike viivituse suurenemine olla vastuvõetav, kui see toob olulises riskiklassis tõestatavalt täpsemaid vastuseid.
Tagasipööramine on funktsioon, mitte dokument
Tagasitee peab olema tehniliselt testitud enne esimest Canary-astet. Mudeli ID ja sellega seotud parameetrid kuuluvad versioonitud konfiguratsiooni või kontrollitud funktsioonilippu (feature flag). Kuni pakkuja senist versiooni veel toetab, jääb see Canary ajal kättesaadavaks varusihtmärgina; enne selle sulgemiskuupäeva on lisaks vaja toetatud varulahendust. Olemasolevad vestlused peaksid kas jääma järjepidevalt oma algsele mudelile või vahetuma selgelt testitud reegli kohaselt.
Määrake ranged päästikud: näiteks skeemiviga kirjutamistoimingul, turvalisusega seotud kavatsuse halvenemine, veamäära märkimisväärne tõus või viivituseelarve ületamine. Sellise signaali korral toimub tagasilülitus automaatselt või selgelt määratud valvetiimi kaudu. Pärast seda säilitatakse logid, kandidaadi versioon ja mõjutatud valim, et saaks analüüsida põhjust. Ettevalmistatud protsess on oluliselt usaldusväärsem kui spontaanne koodi juurutamine; lisaks aitab täielik intsidendile reageerimise juhend (playbook).
Kontrollnimekiri heakskiiduks
- Fikseerige pakkuja ametlikust dokumentatsioonist sulgemiskuupäev, asendusmudel ja mõjutatud lõpp-punktid.
- Kinnitage baas ja kandidaat muutmata prompti-, otsingu- ja tööriistakonfiguratsiooniga.
- Jagage kuldne komplekt kavatsuse, keele ja riskiklassi järgi; lisage äärejuhtumid ja tegelikud veamustrid.
- Määrake ranged väravad allikate sidususele, struktureeritud väljunditele, tööriistadele, turvalisusele ja üleandmisele.
- Mõõtke viivitust, veamäära, tokeneid ja kulusid lahendatud juhtumi kohta.
- Hoidke Canary-määramine stabiilne tervete vestluste kaupa ja välistage esialgu tundlikud funktsioonid.
- Dokumenteerige astmed, minimaalne valim, vaatluskestus ja katkestamispiirid enne juurutamist.
- Testige tagasipööramist tehniliselt, määrake vastutavad isikud ja hoidke kättesaadavana pakkuja toetatud varusihtmärk.
- Pärast 100% saavutamist jätkake jälgimist ja laiendage kuldset komplekti uute tootmises avastatud juhtumitega.
Kokkuvõte: Mudeli nimi on alles algus
Kontrollitud baasmudeli vahetus ühendab tootekvaliteedi ja töökindluse. Ametlikud elutsükli teated annavad tähtaja, hindamised annavad tõendid sobivuse kohta, Canary-liiklus piirab tundmatute vigade mõju ning testitud tagasipööramine lühendab reageerimisaega. Kes kehtestab need neli ehituskivi korduva protsessina, saab kasutada uusi mudeleid ilma oma veebilehe vestlusbotti kõigi kasutajate peal eksperimendiks muutmata.
Soovite oma veebilehe vestlusboti mudeliversiooni, kvaliteedilävesid ja juurutamist struktureeritult planeerida? ChatReact aitab teil seadistada teadmusbaasi, vastamiskäitumise ja üleandmised nii, et muudatused püsivad mõõdetavad ja kontrollitavad.
Muuda veebikülastused paremaks vestluseks
Käivitage AI-vestlusrobot, mis on kasulik esimesest päevast
Treeni ChatReact oma veebisaidi, dokumentide ja kinnitatud faktidega, et külastajad saaksid kiiremaid vastuseid ja teie meeskond vähem korduvaid päringuid.
Seotud artiklid
Jätka lugemist

KI-chatbotite vastuste kvaliteedi mõõtmine: Golden Set, RAG-testid ja review-workflow
Veebilehe chatbot muutub usaldusväärseks alles siis, kui tema vastuseid kontrollitakse regulaarselt allikate, oodatavate vastuste ja reaalsekasutajate küsimuste suhtes. See juhend näitab, kuidas meeskonnad luua Golden Seti, RAG-teste ja kompaktset review-workflow'd.

AI-juturoboti testimine varjurežiimis (Shadow Mode): turvaliselt prototüübist veebisaidi lansseerimiseni
Varjurežiimi, selgete kvaliteediväravate ja astmelise kasutuselevõtuga saavad veebisaidi tiimid AI-juturoboteid enne reaalset lansseerimist turvaliselt testida.

TE-vestlusroboti vaadeldavus: jälituskutsete, otsingu ja tööriistakutsete mõistmine
Täielike jälituskutsetega (traces) mõistavad veebilehe meeskonnad, millised allikad, mudelid ja tööriistad vestlusroboti vastuse kujundasid – andmesäästlikult ja tegevusele orienteeritult.