Zpět na blog
Implementace7. srpna 20268 min čteníAktualizováno 7. srpna 2026

RAG chunking pro AI chatboty: Jak smysluplně rozdělit obsah

Kvalitní RAG chunking zajišťuje dohledatelnost znalostí webu, aniž by došlo k narušení důležitých souvislostí. Tento průvodce ukazuje, jak prakticky plánovat oddíly, překrývání, metadata a testy vyhledávání.

Webový chatbot může spolehlivě odpovídat pouze tehdy, pokud ve správný moment najde ten správný obsah. Přesně o tom rozhoduje RAG chunking: Dlouhé stránky, příručky a nápovědy se rozloží na menší jednotky, které může vyhledávací komponenta cíleně načíst. Příliš velké bloky obsahují mnoho balastu. Příliš malé bloky ztrácejí kontext. Dobré rozdělení proto nesleduje slepě jen číslo, ale strukturu, význam a pozdější využití obsahu.

Odborník rozděluje v světlé knihařské dílně dlouhý obsah do souvislých oddílů s překrývajícími se dělicími listy
Stejně jako v knihařské dílně potřebuje každý oddíl jasné hranice – a dostatek kontextu vůči svým sousedům.

Tento průvodce je určen webovým, zákaznickým a obsahovým týmům. Vysvětluje, jak sémanticky rozdělit obsah, zachovat metadata, snížit duplicitu a pomocí realistických vyhledávacích dotazů ověřit, zda zvolená strategie funguje. Tento přístup je nezávislý na poskytovateli a lze jej použít jak pro klasické vektorové vyhledávání, tak pro hybridní metody načítání (retrieval).

Proč RAG chunking ovlivňuje kvalitu odpovědí

Při načítání RAG (Retrieval-Augmented Generation) systém nejprve vyhledá relevantní znalostní bloky a poté je předá jazykovému modelu. Hranice chunků tak určují, co vůbec může být společně nalezeno a použito jako kontext. Pokud je cenová podmínka oddělena od své výjimky, formálně správné vyhledávání může přesto poskytnout neúplný základ. Obsahuje-li chunk naopak celou produktovou stránku s navigací, variantami a zápatím, rozhodující pasáž soutěží s velkým množstvím šumu.

Chunking ovlivňuje několik dimenzí kvality současně:

  • Dohledatelnost: Vejde se hledané sdělení jasně do kompaktní jednotky?
  • Souvislost: Zůstávají nadpis, vysvětlení, omezení a příklad pohromadě?
  • Přesnost: Obsahuje nález co nejméně odtažitého balastu?
  • Sledovatelnost: Lze výstřižek přiřadit platnému zdroji, jazyku a verzi?

Microsoft popisuje pevné, variabilní a sémantické postupy a zdůrazňuje, že nadpisy i další signály rozvržení (layoutu) lze využít pro smysluplné hranice. Také AWS rozlišuje pevné, hierarchické a sémantické strategie. Společné praktické poučení zní: Technické dělení by mělo sledovat obsahovou strukturu všude tam, kde je spolehlivě k dispozici.

Začněte sémantickými oddíly namísto libovolných řezů

Dobrým výchozím bodem je stávající struktura stránky. Nadpisy H2 a H3, odstavce, seznamy, dotazy FAQ, tabulky a jasně vymezená upozornění již mají svůj význam. Oddíl o lhůtách pro vrácení zboží by neměl končit uprostřed věty nebo mezi pravidlem a výjimkou. Otázka ve FAQ patří do stejného chunku spolu se svou odpovědí. U návodů zůstávají krok postupu, předpoklad a varování pokud možno pohromadě.

Praktická logika hranic

  1. Nejprve rozdělte obsah podle dokumentu, stránky a hlavních nadpisů.
  2. Zkontrolujte, zda se oddíl věnuje přesně jedné srozumitelné hlavní tématu.
  3. Rozdělte pouze ty oddíly, které jsou pro načítání nebo kontext modelu příliš velké.
  4. Velmi krátké fragmenty sloučte s vhodným sousedním oddílem.
  5. Ke každé části připojte nadpis a cestu struktury jako kontext.

U čistého HTML nebo Markdownu je tato metoda dobře automatizovatelná. Nestrukturovaná PDF, nejednotné exporty a naskenované dokumenty často vyžadují předcházející rozpoznání rozvržení nebo textu. Zvláště pečlivě kontrolujte tabulky, sloupce, záhlaví a zalomení stránek: To, co stojí vizuálně vedle sebe, může při načítání skončit ve špatném pořadí.

Přistupujte ke velikosti chunku jako k testovací hodnotě, ne jako k dogmatu

Neexistuje univerzální ideální velikost chunku. Microsoft uvádí 512 tokenů s 25procentním překrýváním jako možný výchozí bod pro určité scénáře, ale upozorňuje, že optimální nastavení závisí na obsahu a modelu. AWS rovněž dokumentuje konfigurovatelné velikosti a překrývání. Takové hodnoty jsou užitečnými výchozími hypotézami – nikoli důkazem kvality.

Krátké odpovědi FAQ často fungují jako samostatné jednotky. Detailní postupy vyžadují více kontextu. Právní nebo smluvní texty by neměly trhat pravidlo, rozsah platnosti a výjimku od sebe. Srovnání produktů mohou být naopak smysluplná po řádcích nebo oddílech, pokud jsou připojeny záhlaví sloupců a vazba na produkt.

Jak poznáte příliš velké nebo příliš malé chunky

Příliš velký je chunk typicky tehdy, pokud se v něm mísí několik nákupních či vyhledávacích záměrů, relevantní věta zaniká mezi navigací a vedlejšími informacemi nebo mnoho nálezů vrací tentýž rozsáhlý blok. Příliš malý je tehdy, pokud zájmena ztrácejí návaznost, chybí nadpisy, podmínky jsou odděleny od tvrzení nebo je potřeba několik fragmentů k pochopení jednoduché otázky.

Porovnejte proto alespoň dvě nebo tři varianty se stejnou sadou otázek. Měňte vždy pouze jeden parametr, například cílovou velikost nebo logiku hranic. Zůstane tak jasně patrné, co skutečně zlepšuje kvalitu nálezů a dokládání odpovědí.

Překrývání chrání kontext – a zároveň vytváří duplicitu

Malé překrývání může zabránit tomu, aby se klíčová věta ztratila přímo na hranici chunku. Je užitečné zejména tehdy, když je technické rozdělení podle délky nevyhnutelné. Příliš velké překrývání má však vedlejší účinky: Téměř identické výsledky zabírají více pozic ve výsledcích, zvyšují rozsah kontextu a mohou uměle dominovat nad daným tvrzením.

Používejte proto překrývání cíleně. U oddílů založených na struktuře často stačí přibrat nadpis, cestu struktury a krátký přechod. U delších souvislých textů může mít smysl malá část předchozího oddílu. Následně změřte, zda na předních pozicích zůstávají různé relevantní zdroje, nebo zda jsou vytlačovány duplikáty.

Metadata zajišťují provozní spolehlivost chunku

Puký text pro produkční znalostní bázi většinou nestačí. Každý chunk by si měl zachovat svůj původ a rozsah platnosti. AWS popisuje metadata jako základ pro filtrování při dotazování. Ve znalostní bázi webu jsou užitečná zejména následující pole:

  • kanonická zdrojová URL a název stránky,
  • cesta nadpisů v rámci stránky,
  • jazyk nebo locale,
  • typ obsahu jako FAQ, návod, směrnice nebo detail produktu,
  • datum publikace či změny,
  • produkt, region nebo cílová skupina, pokud je to věcně relevantní,
  • stav přístupu a schválení u neveřejného obsahu.

Díky tomu lze prohledávat například pouze české, aktuálně schválené materiály podpory. Zdroj lze navíc v odpovědi odkazovat a při pozdější aktualizaci jej cíleně znovu zpracovat. Jak systematicky zajistit aktuálnost, ukazuje průvodce KI-Chatbot-Wissensbasis aktuell halten.

Před indexací odstraňte opakující se balast (boilerplate) a duplicity

Navigace, informace o cookies, opakující se kontaktní bloky a globální zápatí do žádného chunku nepatří. Jinak vznikají stovky téměř identických záznamů, které mohou vytlačit samotný obsah. Odstraňte opakující se prvky stránek před rozdělením a normalizujte zbytečné mezery, dekorativní znaky i technické fragmenty.

Pozornost vyžadují i věcné duplicity. Pokud je stejné pravidlo pro vrácení zboží formulováno odlišně na stránkách nápovědy, produktu a dopravy, měl by být stanoven odpovědný primární zdroj. Zastaralé kopie se odstraní, přesměrují nebo se jim jednoznačně sníží priorita. Metoda chunkingu nedokáže proměnit protichůdné zdroje ve spolehlivé znalosti.

Uvědoměle řešte speciální případy

Obsah typu FAQ

Ukládejte otázku a odpověď společně. U velmi krátkých odpovědí doplňte nadřazenou tematickou oblast. Varianty téže otázky mohou být užitečné pro vyhledávání, ale neměly by být indexovány jako vícenásobný text odpovědi.

Tabulky a seznamy

Řádek tabulky bez záhlaví sloupců je většinou nesrozumitelný. Opakujte nebo odkazujte proto na relevantní pojmy ze záhlaví přímo v chunku. U dlouhých seznamů by si každá část měla zachovat název seznamu a společný úvod. Po extrakci zkontrolujte, zda jsou hodnoty stále přiřazeny ke správné vlastnosti.

Vícejazyčné stránky

Oddělujte obsah podle locale a ukládejte jazyk jako metadatový údaj. Český dotaz by neměl náhodně obdržet zastaralý anglický oddíl jen proto, že se v něm vyskytují podobné výrazy. Společné identifikátory překladu nebo stránek pomáhají propojovat varianty, aniž by se mísily v témže textovém bloku.

Před testováním odpovědí proveďte testy načítání (retrieval)

Nejprve vyhodnoťte, zda vyhledávání vrací správnou pasáž. Teprve potom posuzujte formulaci jazykového modelu. Malá testovací sada (Golden Set) reálných uživatelských dotazů by měla obsahovat jednoznačné otázky, synonyma, vícečlenné požadavky, hraniční případy a otázky bez doložené odpovědi. Pro každou otázku předem definujte, který zdroj nebo oddíl se očekává.

Zkontrolujte minimálně:

  • zda se očekávaný oddíl objevuje mezi prvními výsledky,
  • zda nerelevantní nebo duplicitní nálezy nevytlačují důležité zdroje,
  • zda jsou v poskytnutém kontextu obsaženy všechny potřebné podmínky a výjimky,
  • zda zůstává zdroj a stav jeho aktuálnosti sledovatelný,
  • zda systém při chybějících znalostech bezpečně nevymýšlí odpověď.

Článek KI-Chatbot-Antwortqualität mit Golden Set und RAG-Tests messen popisuje odpovídající testovací proces. Pro viditelné dokazování doplňuje průvodce Chatbot-Antworten mit Quellen belegen pohled na kontrolu odkazů a nejistotu.

Kontrolní seznam pro zavedení

  1. Inventarizujte obsah: Zachyťte typy stránek, jazyky, formáty a odpovědné zdroje.
  2. Zkontrolujte extrakci: Zkontrolujte nadpisy, tabulky a pořadí čtení na reprezentativních příkladech.
  3. Definujte hranice: Preferujte sémantické oddíly a pevné velikosti používejte pouze jako záložní logiku.
  4. Zachovejte kontext: Připojte název stránky, cestu nadpisů a potřebné přechody.
  5. Naplánujte metadata: Strukturovaně ukládejte URL, locale, aktuálnost, typ obsahu a schválení.
  6. Odstraňte duplicity: Před indexací vyčistěte balast (boilerplate) a rozporuplné kopie.
  7. Testujte varianty: Porovnejte velikosti a překrývání na stejné sadě Golden Set.
  8. Sledujte provoz: Pravidelně vyhodnocujte chybějící nálezy, zastaralé zdroje a zpětnou vazbu uživatelů.

Závěr: Dobré chunky jsou srozumitelné znalostní jednotky

RAG chunking není jednorázové technické nastavení, ale architektura obsahu pro strojové vyhledávání. Dobré chunky odpovídají na jasně vymezený dílčí požadavek, zachovávají si potřebný kontext a lze je přiřadit k platnému zdroji. Nadpisy, metadata a kontrolované překrývání jsou přitom stejně důležité jako samotná délka.

Začněte s několika reprezentativními typy obsahu, měřte úspěšnost vyhledávání před stylem odpovědí a dokumentujte každou změnu. Pokud chcete následně vybudovat webového chatbota na strukturované znalostní bázi, vhodný začátek najdete na přehledu funkcí ChatReact.

Zdroje

Přeměňte návštěvy webu na lepší konverzace

Snižte zátěž podpory a zároveň udržte konzistentní odpovědi

Poskytněte návštěvníkům okamžitou podporu na webu, přesměrujte okrajové případy týmu a udržujte každou odpověď v souladu s vaší schválenou znalostní bází.

Související články

Pokračovat ve čtení