Tagasi blogisse
Juurutamine7. august 20267 min lugemineUuendatud 7. august 2026

RAG-jupeldamine AI-juturobotitele: sisu mõistlik jaotamine

Hea RAG-jupeldamine (chunking) muudab veebisaidi teadmised leitavaks ilma olulisi kontekste lõhkumata. Juhend näitab, kuidas tiimid saavad praktiliselt planeerida lõike, kattuvust, metaandmeid ja otsinguteste.

Veebisaidi juturobot saab usaldusväärselt vastata ainult siis, kui ta leiab õigel hetkel üles sobiva sisu. Täpselt siin otsustabki RAG-jupeldamine (chunking): pikad leheküljed, käsiraamatud ja abitekstid jagatakse väiksemateks ühikuteks, mida otsingukomponent saab sihipäraselt päringutega leida. Liiga suured plokid sisaldavad palju ebaolulist müra. Liiga väikesed plokid kaotavad konteksti. Seetõttu ei järgi hea tükeldamine pimedalt mingit arvu, vaid sisu struktuuri, tähendust ja hilisemat kasutust.

Spetsialist jagab valges köitekojas pika sisu sidusateks lõikudeks koos kattuvate eralduslehtedega
Nagu raamatuköites, vajab iga lõik selgeid piire – ja piisavalt konteksti oma naabrite suhtes.

See juhend on mõeldud veebi-, klienditoe- ja sisutiimidele. See selgitab, kuidas jagada sisu semantiliselt, säilitada metaandmeid, vähendada duplikaate ja kontrollida reaalsete otsinguküsimustega, kas valitud strateegia toimib. Lähenemine on tarnijast sõltumatu ja seda saab üle kanda nii klassikalisele vektorotsingule kui ka hübriidsetele otsingumeetoditele (retrieval).

Miks RAG-jupeldamine kujundab vastuste kvaliteeti

RAG-i (Retrieval-Augmented Generation) puhul otsib süsteem kõigepealt üles asjakohased teadmiste plokid ja edastab need seejärel keelemudelile. Jupi ehk tüki (chunk) piirid määravad seega selle, mida üldse koos leitakse ja kontekstina kasutada saab. Kui hinnatingimus eraldatakse selle erandist, võib formaalselt õige otsing anda siiski puuduliku aluse. Kui aga tükk sisaldab tervet tootelehte koos navigatsiooni, variantide ja jalusega, konkureerib otsustav lõik suure müraga.

Jupeldamine mõjutab korraga mitut kvaliteedimõõdet:

  • Leitavus: Kas otsitav väide mahub selgelt ühte kompaktsesse ühikusse?
  • Kontekst ja seosed: Kas pealkiri, selgitus, piirang ja näide jäävad kokku?
  • Täpsus: Kas tulemus sisaldab võimalikult vähe teemavälist balasti?
  • Jälgitavus: Kas väljavõtet saab seostada kehtiva allika, keele ja versiooniga?

Microsoft kirjeldab fikseeritud, muutuvaid ja semantilisi meetodeid ning rõhutab, et pealkirju ja muid küljendussignaale saab kasutada mõistlike piiride seadmiseks. Samuti eristab AWS fikseeritud, hierarhilisi ja semantilisi strateegiaid. Ühine praktiline õppetund: tehniline jagamine peaks järgima sisulist liigendust kõikjal, kus see on usaldusväärselt olemas.

Alusta semantilistest lõikudest, mitte suvalistest lõigetest

Hea alguspunkt on olemasolev leheehitus. H2- ja H3-pealkirjad, lõigud, loendid, KKK-küsimused, tabelid ja selgelt piiritletud märkused kannavad juba tähendust. Tagastustingimuste lõik ei tohiks lõppeda keset lauset ega reegli ja erandi vahel. KKK-küsimus kuulub koos oma vastusega samasse tükki. Juhendi puhul peaksid tegevussamm, eeldus ja hoiatusmärk jääma võimalusel kokku.

Praktiline piiriloogika

  1. Jaga kõigepealt dokumendi-, lehe- ja pea-pealkirjade kohalt.
  2. Kontrolli, kas lõik käsitleb täpselt ühte arusaadavat peateemat.
  3. Tükelda ainult neid lõike, mis on otsingu või mudeli konteksti jaoks liiga suured.
  4. Liida väga lühikesed fragmendid sobiva naaberlõiguga.
  5. Määra iga osa juurde kontekstina pealkiri ja struktuuritee.

Puhta HTML-i või Markdowni puhul on see meetod hästi automatiseeritav. Struktureerimata PDF-id, ebaühtlased ekspordid ja skannitud dokumendid vajavad sageli eelnevat küljenduse või teksti tuvastamist (OCR). Kontrolli seejuures eriti tabeleid, veerge, päiseid ja leheküljepiire: see, mis visuaalselt on kõrvuti, võib lugemisel sattuda valesse järjekorda.

Käsitle tüki suurust testväärtusena, mitte dogmana

Universaalset ideaalset tüki suurust ei ole olemas. Microsoft nimetab teatud stsenaariumide võimalikuks alguspunktiks 512 tokenit koos 25-protsendilise kattuvusega, kuid märgib, et optimaalne seadistus sõltub sisust ja mudelist. AWS dokumenteerib samuti konfigureeritavaid suurusi ja kattuvusi. Sellised väärtused on mõistlikud algühpoteesid – mitte kvaliteeditõend.

Lühikesed KKK-vastused toimivad sageli iseseisvate ühikutena. Üksikasjalikud protseduurijuhised vajavad rohkem konteksti. Õiguslikud või lepingulised tekstid ei tohiks reeglit, kohaldamisala ja erandit üksteisest lahutada. Tootevõrdlused võivad omakorda olla mõistlikud ridade või lõikude kaupa, kui veeruülekirjutused ja tootesoosed on kaasas.

Kuidas tunda ära liiga suured või liiga väikesed tükid

Tükk on tüüpiliselt liiga suur, kui selles on segunenud mitu otsingukavatsust, asjakohane lause kaob navigatsiooni ja kõrvalteabe vahele või paljud tulemused tagastavad ühe ja sellesama mahuka ploki. Liiga väike on see siis, kui asendussõnadel puudub viide, pealkirjad puuduvad, tingimused on väidetest lahutatud või lihtsa küsimuse mõistmiseks on vaja mitut fragmenti.

Võrdle seetõttu vähemalt kahte või kolme varianti sama küsimustikuga. Muuda korraga ainult ühte parameetrit, näiteks sihtsuurust või piiriloogikat. Nii on näha, mis tegelikult tulemuste kvaliteeti ja vastuste tõendatavust parandab.

Kattuvus kaitseb konteksti – ja tekitab samal ajal duplikaate

Väike kattuvus võib ära hoida olulise lause kadumise otse tüki piiril. See on eriti kasulik siis, kui tehniline pikkusepõhine jagamine on vältimatu. Liiga suurel kattuvusel on aga kõrvalmõjud: peaaegu identsed tulemused võtavad enda alla mitu tulemuskohta, suurendavad konteksti mahtu ja võivad väidet kunstlikult domineerida.

Kasuta kattuvust seetõttu sihipäraselt. Struktuuripõhiste lõikude puhul piisab sageli pealkirja, struktuuritee ja lühikese ülemineku kaasavõtmisest. Pikemate sidustekstide puhul võib eelmisest lõigust väikese osa kaasamine olla mõistlik. Mõõda seejärel, kas erinevad asjakohased allikad jäävad tipptulemustesse või tõrjutakse need duplikaatide poolt välja.

Metaandmed muudavad tüki töökindlaks

Pelk tekst on produktiivse teadmusbaasi jaoks harva piisav. Iga tükk peaks säilitama oma päritolu ja kehtivusala. AWS kirjeldab metaandmeid päringute filtreerimise alusena. Veebisaidi teadmusbaasis on eriti kasulikud järgmised väljad:

  • kanooniline allika URL ja lehe pealkiri,
  • pealkirja tee lehe sees,
  • keel või lokaal (locale),
  • sisutüüp, näiteks KKK, juhend, eeskiri või toote detail,
  • avaldamis- või muatmiskuupäev,
  • toode, piirkond või sihtrühm, kui see on erialaselt oluline,
  • juurdepääsu- ja kinnitusstaatus mitteavaliku sisu puhul.

Selle abil saab otsida näiteks ainult eestikeelset, hetkel kinnitatud klienditoe sisu. Samuti saab allikale vastuses viidata ja seda hilisema uuenduse käigus uuesti töödelda. Kuidas ajakohasust süsteemselt tagada, näitab juhend AI-juturoboti teadmusbaasi ajakohasena hoidmine.

Eemalda mallitekstid ja duplikaadid enne indekseerimist

Navigatsioon, küpsiste teated, korduvad kontaktiblokid ja globaalsed jalused ei kuulu igasse tükki. Vastasel juhul tekib sadu peaaegu identseid kirjeid, mis võivad tegeliku sisu välja tõrjuda. Eemalda korduvad leheelemendid enne jagamist ning normaliseeri mittevajalikud tühikud, dekoratiivsed märgid ja tehnilised fragmendid.

Ka sisulised duplikaadid vajavad tähelepanu. Kui sama tagastusreegel on abi-, toote- ja tarnelehtedel sõnastatud erinevalt, tuleks määrata vastutav põhiallikas. Aegunud koopiad eemaldatakse, suunatakse ümber või seatakse selgelt madalama prioriteediga kohale. Jupeldusmeetod ei saa muuta vastuolulisi allikaid usaldusväärseteks teadmisteks.

Käsitle erijuhte teadlikult

KKK sisu

Salvesta küsimus ja vastus koos. Väga lühikeste vastuste puhul lisa kõrgema taseme teemavaldkond. Sama küsimuse variandid võivad otsingul abiks olla, kuid neid ei tohiks indekseerida mitmekordse vastustekstina.

Tabelid ja loendid

Tabelirida ilma veeruülekirjutusteta on enamasti arusaamatu. Seetõttu korda või viita lõigus asjakohaseid päise mõisteid. Pikemate loendite puhul peaks iga osa säilitama loendi pealkirja ja ühise sissejuhatuse. Kontrolli pärast eraldamist, kas väärtused on jätkuvalt seostatud õige tunnusega.

Mitmekeelsed lehed

Eralda sisu lokaali järgi ja salvesta keel metaandmena. Eestikeelne päring ei tohiks juhuslikult saada aegunud ingliskeelset lõiku lihtsalt sellepärast, et selles esinevad sarnased mõisted. Ühised tõlke- või leheidentifikaatorid aitavad variante omavahel siduda ilma neid samas tekstiplokis segamata.

Teosta otsingutestid enne vastuse testimist

Hinda kõigepealt seda, kas otsing leiab õige lõigu. Alles seejärel hinda keelemudeli sõnastust. Väike reaalsetest kasutajaküsimustest koosnev Kuldne komplekt (Golden Set) peaks sisaldama selgeid küsimusi, sünonüüme, mitmeosalisi muresid, piirjuhte ja küsimusi ilma kinnitatud vastuseta. Iga küsimuse jaoks määratle eelnevalt, millist allikat või lõiku oodatakse.

Kontrolli vähemalt:

  • kas oodatav lõik ilmub esimeste tulemuste hulgas,
  • kas ebaolulised või duplitseeritud tulemused tõrjuvad olulisi allikaid välja,
  • kas kõik vajalikud tingimused ja erandid on esitatud kontekstis olemas,
  • kas allikas ja selle ajakohasuse staatus jäävad jälgitavaks,
  • kas süsteem hoiab puuduvate teadmiste korral kindlalt ära vastuse väljamõtlemise.

Postitus AI-juturoboti vastuste kvaliteedi mõõtmine Golden Seti ja RAG-testidega kirjeldab sobivat kontrolliprotsessi. Nähtavate tõendite saamiseks täiendab juhend Juturoboti vastuste tõendamine allikatega vaatenurka lingikontrolli ja ebakindluse osas.

Rakendamise kontrollnimekiri

  1. Inventeeri sisu: Kaardista lehetüübid, keeled, vormingud ja vastutavad allikad.
  2. Kontrolli eraldamist: Kontrolli pealkirju, tabeleid ja lugemisjärjekorda esinduslikel näidetel.
  3. Määratle piirid: Eelistatult kasuta semantilisi lõike ja fikseeritud suurusi vaid varulahendusena.
  4. Säilita kontekst: Lisa lehe pealkiri, struktuuritee ja vajalikud üleminekud.
  5. Planeeri metaandmed: Salvesta struktureeritult URL, lokaal, ajakohasus, sisutüüp ja kinnitus.
  6. Eemalda duplikaadid: Puhasta mallitekstid ja vastuolulised koopiad enne indekseerimist.
  7. Testi variante: Võrdle suurusi ja kattuvust sama Golden Setiga.
  8. Jälgi käitust: Hinda regulaarselt puuduvaid tulemusi, aegunud allikaid ja kasutajate tagasisidet.

Kokkuvõte: Head tükid on arusaadavad teadmusühikud

RAG-jupeldamine ei ole ühekordne tehniline seadistus, vaid sisuarhitektuur masinotsingu jaoks. Head tükid vastavad selgelt piiritletud osamurele, säilitavad vajaliku konteksti ja on seostatavad kehtiva allikaga. Pealkirjad, metaandmed ja kontrollitud kattuvus on seejuures sama olulised kui pelk pikkus.

Alusta mõne esindusliku sisutüübiga, mõõda otsingut enne vastusestiili ja dokumenteeri iga muudatus. Kui soovid seejärel ehitada veebisaidi juturoboti struktureeritud teadmusbaasile, leiad sobiva alguse ChatReacti funktsioonide ülevaatest.

Allikad

Muuda veebikülastused paremaks vestluseks

Vähenda tugikoormust, hoides vastused ühtsena

Paku külastajatele kohest veebitugi, suuna erandid teie meeskonnale ja hoia iga vastus kooskõlas kinnitatud teadmistebaasiga.

Seotud artiklid

Jätka lugemist