Tagasi blogisse
Juurutamine16. august 20267 min lugemineUuendatud 22. august 2026

RAG-metaandmete filtrid AI-juturobotitele: keele, versiooni ja juurdepääsu eraldamine

Metaandmete filtrid piiravad RAG-otsinguruumi enne, kui AI-juturobot allikad valib. Nii jäävad keel, versioon, kehtivus ja juurdepääsuala selgelt eraldatuks.

AI-juturobot võib leida semantiliselt väga sarnaseid tekstilõike ja valmistada sellegipoolest ette vale vastuse: ingliskeelse juhendi saksakeelse asemel, eelmise versiooni dokumentatsiooni praeguse asemel või sisejuhise juurdepääsuõiguseta külalisele. Otsingutulemuste pingerida (ranking) ei pruugi seejuures olla halb. Otsinguruum oli lihtsalt vale.

RAG-metaandmete filtrid lahendavad täpselt selle probleemi. Need piiravad enne otsingut või selle ajal, millised dokumendid ja tekstitükid (chunk'id) üldse kontekstina arvesse tulevad. Relevantsus vastab alles pärast seda küsimusele „Mis sobib sisuliselt kõige paremini?“. Filter vastab kõigepealt küsimusele „Mida tohib ja tuleb selles olukorras arvesse võtta?“.

Aianduse spetsialist valib avatud kasvuhoones värvikoodiga tähistatud taimelava
Puhas päringuulatus (retrieval scope) laseb valikusse ainult allikad, mis sobivad praeguse päringuga.

Miks sarnasus üksi ei ole usaldusväärne ulatus

Vektori- ja hübriidotsing järjestavad sisu keelelise või semantilise läheduse alusel. Toote versiooni 4 käsiraamat võib olla versiooni 5 kohta käivale küsimusele erakordselt sarnane. Teise turu hinnakiri võib sisaldada samasid tootenimesid. Ja sisemine tugidokument võib anda täpsema vastuse kui avalik KKK, kuigi see ei tohiks avalikus vestluses kunagi ilmuda.

Seetõttu peaks otsingumootor (retriever) hoidma lahus kahte tüüpi tingimusi:

  • Ranged piirid nagu rentnik (tenant), roll, avaldamisolek või lubatud andmeala. Tundmatu väärtuse korral peab otsing jääma suletuks.
  • Sisulised valikukriteeriumid nagu keel, tootepere, versioon, piirkond või kehtivusaeg. Need suurendavad täpsust ja hoiavad ära vastuolulise konteksti.

Praegune OWASP ülevaade LLM-rakendustele liigitab vektori- ja embedding-riskid selgesõnaliselt AI-rakenduse usalduspiiri alla. See on oluline vaatenurk: autentimiskontrollist enne vestlust ei piisa, kui sellele järgnev sarnasusotsing töötab sellegipoolest liiga laia indeksi peal.

Metaandmete skeem, mis kestab igapäevatöös

Head filtrid ei alga pikast päringust, vaid vähestest kanoonilistest väljadest. Paljude veebisaidi juturobotite jaoks piisab kuuest grupist:

  • Keel ja turg: näiteks locale ja market, fikseeritud väärtustega vabateksti asemel.
  • Toode ja versioon: stabiilne toote ID, versioonivahemik ning valikuliselt platvorm või tariif.
  • Kehtivus: kinnitusolek, kehtiv alates, kehtiv kuni ja ühene allika versioon.
  • Sihtrühm: avalik, klient, partner või sise-tiim – eraldi tegelikust rollikontrollist.
  • Juurdepääsu ala: rentnik, grupp või principal, eranditult kinnitatud serverikontekstist.
  • Päritolu: allika ID, URL, dokumendi tüüp ja vastutav sisuvaldkond jälitatavuse tagamiseks.

Metaandmed kuuluvad tasemele, kus otsingut tehakse. Kui dokument jagatakse tükkideks (chunks), peavad otsustavad ulatuse väljad jõudma usaldusväärselt igasse tükki. Vastasel juhul võib dokument olla korrektselt klassifitseeritud, kuid üksikud otsingutulemused kaotavad selle liigituse. OpenAI dokumentatsioon File Searchi kohta näitab näiteks, kuidas failiatribuute metaandmete filtritena kasutada. Amazon Bedrocki referents dokumenteerib võrdlus-, listi- ja vahemikuoperaatoreid sama põhiidee jaoks.

Ära lase keelemudelil filtreid kunagi autoriseerida

Mudel tohib küsimusest tuletada vihjeid, nagu keel või tooteseos. Siiski ei tohi see otsustada, millisesse rentnikku inimene kuulub või mis roll tal on. Need väärtused peavad pärinema sessioonist, identiteedisüsteemist ja serveripoolsetest ärireeglitest. Samuti ei tohiks mudeli loodud filtri-sõnet edastada kontrollimata otsinguteenusele.

Töökindel protsess näeb välja järgmine:

  1. Server autendib päringu ja määrab lubatud andmeala.
  2. Deterministlikud reeglid seavad ranged väljad, nagu rentnik, roll ja avaldamisolek.
  3. Tuvastatud tunnused, nagu keel või toode, valideeritakse lubatud väärtuste suhtes.
  4. Otsingumootor käivitab ainult tüübitud, parametriseeritud filtristruktuuri.
  5. Rakendus kontrollib tagastatud allikaid uuesti oodatud ulatuse suhtes.
  6. Puuduva või vastuolulise konteksti korral küsib juturobot üle või väljastab turvalise tagavaralahenduse (fallback).

Microsofti dokumentatsioon turvafiltrite kohta teeb kasuliku vahe: principal filtris on esialgu vaid väärtus. Autentimine ja autoriseerimine peavad toimuma usaldusväärselt väljaspool otsinguväljendit. Kliendiportaalide puhul süvendab seda piiri meie artikkel avaliku ja autenditud AI-juturoboti eraldamisest.

Eelfilter või järelfilter?

Filtri asukoht mõjutab kvaliteeti ja tööaega. Eelfilter (pre-filter) piirab kandidaate juba vektorotsingu ajal. Järelfilter (post-filter) otsib kõigepealt laiemalt ja eemaldab seejärel lubamatud tulemused. Azure'i vektorfiltrite dokumentatsiooni kohaselt võib järelfiltreerimine selektiivsete filtrite ja väikese k korral sobivad tulemused vahele jätta; eelfiltreerimine eelistab saagist (recall) lubatud osahulgas, kuid võib väga kitsaste filtrite puhul nõuda rohkem arvutusressurssi.

Rangete juurdepääsupiirangute puhul ei ole „kõigepealt otsi laialt, pärast peida“ sobiv põhimuster. Autoriseeritud ulatus tuleks jõustada otsingupäringu sees. Puhtalt sisuliste filtrite puhul saab tiim mõõta eel- ja järelvariante. Seejuures ei loe ainult keskmine vastuseaeg, vaid ka see, kui tihti olemasolev lubatud tulemus valitud järjestuse tõttu puudu jääb.

Filtrid ei asenda järjestamist (ranking). Lubatud korpuse piires saavad hübriidotsing ja ümberjärjestamine (reranking) jätkuvalt parimaid allikaid prioriseerida. Järjekord on seega järgmine: määra ulatus, hangi kandidaadid, hinda relevantsust, kontrolli allikaid, loo vastus.

Neli tüüpilist filtrijuhtumit

Keel koos teadliku tagavaralahendusega (fallback)

Eestikeelse küsimuse puhul peaks esimene päring valima eestikeelse, kinnitatud sisu. Kui tulemust ei leita, ei tohi rakendus vaikimisi mitut keelt segada. Sõnaliselt määratletud teine tee võib tagasi langeda kinnitatud baaskeulele ja teha selle asjaolu vastuses teatavaks. Lokaadi-QA mitmekeelsete teadmusbaaside jaoks kontrollib lisaks, kas variandid on sisuliselt tõesti samaväärsed.

Tooteversioon ja ajaline kehtivus

Allikas ei peaks tunduma ajakohane pelgalt selle tõttu, et seda viimasena indekseeriti (crawl). Otsustavad on sisuline versioon ja kinnitus. Märgistage sisu stabiilse toote ID, versioonivahemiku, valid_from, valid_until ja olekuga. Kattuvate kinnituste korral peab konveier (pipeline) teavitama konfliktist, selle asemel et panna mõlemad tekstid samasse viipa (prompt). Kuidas veebikammimise sagedus ja allikahooldus kokku mängivad, kirjeldab juhend AI-juturoboti teadmusbaasi ajakohasena hoidmisest.

Rentnik ja roll

Ühise indeksi korral peab iga päring sisaldama serveripoolselt tuvastatud rentnikku ja kehtivaid principale. Puuduvad ACL-metaandmed tähendavad „kättesaamatu“, mitte „avalik“. Pärast rollivahetust või õiguse tühistamist peab test näitama, et vanad sessioonid ei saa enam varem lubatud tekstitükke.

Avalik tugi ja sisemine tööjuhend

Sisemine eskalatsioonijuhis võib sisuliselt täiuslikult sobida kliendi küsimusega. See ei tee sellest lubatavat allikat. Eraldage avaldamisulatus ja dokumenditüüp; märgistage kinnitamata sisu vaikimisi välistatuks. Kahtluse korral peaks avalik robot üle minema kontakti- või üleandmisteekonnale (handoff), selle asemel et sisemisi detaile ära arvata.

Kõige sagedamad rakendusvead

  • Vabateksti taksonoomia: väärtused nagu de, DE ja de-DE moodustavad tahtmatult kolm gruppi.
  • Vaikimisi avatud (default-open): rolli, oleku või rentnikuta tekstitükid jõuavad igasse otsinguruumi.
  • Vale loogiline tehe: tehe OR rentniku ja keele vahel tühistab praktiliselt range piiri.
  • Dokumendi ja tekstitüki nihkumine (drift): uuesti indekseerimisel ei kanta uusi metaandmeid üle kõigile tükkidele.
  • Ainult positiivsed testid: tiim kontrollib, kas lubatud dokument ilmub, kuid mitte seda, kas sarnaselt kõlav keelatud dokument on kindlasti puudu.
  • Tühjad tulemused kui mudeli probleem: kitsas filter ei tagasta midagi ja rakendus laseb mudelil ilma allikateta edasi vastata.

Filtri QA: Testi piire, mitte ainult tulemusi

Kasulik testikomplekt sisaldab iga oodatud vastuse jaoks vähemalt ühte lähedast vastukandidaati: vale keel, vana versioon, aegunud kinnitus, teine rentnik või sisemine sihtrühm. Nii näitab test, kas filter tõesti eraldab, mitte ei paiguta õiget tulemust ülespoole pelgalt juhuse tõttu.

Olulised mõõdikud on ulatuse rikkumise määr (scope violation rate), saagikus lubatud osahulgas, tühjade otsingute osakaal, tundmatute metaandmete väärtuste arv, filtri latentsus 95. protsentiilil ning tagavaralahenduste ja täpsustavate küsimuste osakaal. Piiratud sisu puhul peab lubatud ulatuse rikkumise määr olema null. NIST AI RMF Core soovitab AI-süsteeme enne kasutuselevõttu ja regulaarselt töö käigus testida ning dokumenteerida turvalisuse, töökindluse ja konteksti piirid.

Ärge logige selleks ülemäärast sisu ega kasutajate täielikke küsimusi. Enamasti piisab filtri versioonist, abstraktsest ulatusest, kandidaatide arvust, valitud allika ID-dest, tagasilükkamise põhjusest ja järelkontrolli tulemusest. Nii jääb veatuvastus võimalikuks ilma vaatlusmõõdikute süsteemi (observability) teist andmeleket tekitamata.

Praktiline kontrollnimekiri enne lansseerimist

  1. Dokumenteeri kanoonilised metaandmete väljad, andmetüübid, lubatud väärtused ja omanikud.
  2. Eralda ranged juurdepääsupiirid sisulistest valikuväljadest.
  3. Käsitle puuduvaid turvakriitilisi väärtusi järjepidevalt kui mittelubatuid.
  4. Ehita filtrid kinnitatud serverikontekstist ja parametriseeri sisendid.
  5. Loe metaandmeid pärast sisestust (ingestion) ja tükkideks jagamist (chunking) valikuliselt tagasi.
  6. Testi positiivseid, negatiivseid, piiripealseid ja tühistamisjuhtumeid tegeliku indeksi vastu.
  7. Mõõda eel-/järelfiltri käitumist realistliku k ja selektiivsete ulatustega.
  8. Suuna tühjad tulemused täpsustava küsimuseni, turvalise tagavaralahenduse või inimesele üleandmiseni.
  9. Versioneeri filtrimuudatused ja lansseeri need koos otsingu regressioonitestidega.

RAG-metaandmete filtrid on seega enam kui lihtsalt otsingu mugavusfunktsioon. Need on lüli sisumudeli, identiteedi, ajakohasuse ja otsingukvaliteedi vahel. Kes määrab ulatuse kõigepealt deterministlikult kindlaks, annab järjestamisele ja keelemudelile väiksema, puhtama ning kontrollitavama aluse töötamiseks.

Järgmine samm: Vali reaalne klienditoe küsimus ja loo selle juurde viis peaaegu sobivat vastandallikat valest keelest, versioonist ja õiguste tasemest. Alles siis, kui ükski neist ei ületa lubatud otsinguulatust, peaks filter minema tootmikeskkonna vestlusvoogu.

Allikad

Muuda veebikülastused paremaks vestluseks

Käivitage AI-vestlusrobot, mis on kasulik esimesest päevast

Treeni ChatReact oma veebisaidi, dokumentide ja kinnitatud faktidega, et külastajad saaksid kiiremaid vastuseid ja teie meeskond vähem korduvaid päringuid.

Seotud artiklid

Jätka lugemist