Sémantický index dokumentů s hybridním vyhledáváním
Funkční prototyp indexuje PDF včetně tabulek a spojuje významové hledání, fulltext, více indexů a přesné filtrování.
Co to řeší v praxi
Uživatel položí dotaz vlastními slovy a najde relevantní pasáže z PDF dokumentů, aniž by musel znát přesný název souboru nebo slovní spojení. Když hledá konkrétní termín, může dát větší váhu přesnému fulltextu. Nalezené části si může vztáhnout zpět k původnímu dokumentu.
Rozhraní nabízí výběr z více indexů, nastavení poměru významové a textové shody a pokročilé filtry nad tagy. To pomáhá rozlišit různé sbírky dokumentů, porovnat výsledky modelů a zúžit dotaz na konkrétní téma.
Správce může přidávat dokumenty a indexy, sledovat jejich zpracování, auditní záznamy i provozní stav. Při změně nastavení lze dokumenty znovu zařadit do indexu; pouhá úprava tagů nepotřebuje nový výpočet vektorů. Veřejná ukázka běží s demonstrační identitou a daty.
Co řešení umí
Významové i přesné hledání
Hybridní skóre kombinuje podobnost obsahu s fulltextovou shodou a poměr lze nastavovat.
Více nezávislých indexů
Stejný dokument může být dohledatelný v několika indexech s odlišnými modely.
PDF a tabulky
Zpracování rozlišuje běžný text a tabulkové části a zachovává vazbu na původní stránku.
Tagy bez reindexace
Filtry nad metadaty zpřesňují výsledky; změny tagů nevyžadují nový embedding.
Řízená fronta
Delší zpracování běží na pozadí se stavem, opakováním neúspěšného kroku a plnou reindexací.
API, audit a provoz
Verzované API, audit, metriky, kontrola zdraví a postupy obnovy podporují navazující použití.
Technické řešení
FastAPI odděluje web a verzované REST API od pracovního procesu a embeddingové služby. Z PDF se extrahují textové i tabulkové části, které nesou vazbu na dokument, verzi a stránku. PostgreSQL drží metadata, tagy, frontu a audit; pgvector ukládá embeddingy pro více samostatných indexů. Hybridní dotaz váží vektorovou podobnost vůči fulltextovému skóre.
Jedna sada dokumentů může využívat více embeddingových modelů. Zpracování dokumentů probíhá asynchronně, pracovní procesy si rozdělují položky databázové fronty a stav úlohy je dohledatelný. Změna modelu nebo konfigurace indexu vyvolá řízenou reindexaci, zatímco tagy se upravují bez přepočtu embeddingů.
Služby API, pracovní proces, lokální embeddingový model a databáze běží odděleně v kontejnerech. Základní indexace může fungovat bez stálého přístupu k internetu. Architektura počítá s tokenovým ověřováním v produkční konfiguraci, avšak veřejný Proof of Concept používá výslovně demonstrační režim. K dispozici jsou audit, provozní metriky a postupy zálohy a obnovy.
Technické výzvy
- Převést text a tabulky z PDF bez ztráty vazby na stránku a verzi dokumentu.
- Udržet více vektorových indexů s různými modely oddělených a znovu zpracovat obsah při změně konfigurace.
- Sloučit vektorovou relevanci s fulltextem a filtry tak, aby bylo možné výsledek ověřit v původním dokumentu.
Jak na sebe kroky navazují
01Založení dokumentu
Uživatel vloží PDF a přiřadí mu název, metadata a tagy. Systém založí verzovaný záznam a úlohu na pozadí.
02Extrakce obsahu
Pracovní proces vyčte text a tabulky po stránkách a propojí každou část s konkrétní verzí dokumentu.
03Dělení a vektorové reprezentace
Obsah se rozdělí na menší vyhledatelné úseky; lokální model pro každý vytvoří embedding.
04Uložení do indexů
Text, metadata a embeddingy se uloží odděleně tak, aby jeden dokument mohl být současně ve více indexech.
05Významový a fulltextový dotaz
Dotaz vybere indexy, váhu obou způsobů hledání a případné tagové filtry; systém výsledky seřadí podle relevance.
06Kontrola zdrojové pasáže
Uživatel vidí odpovídající úryvek a jeho původ a může si závěr ověřit v dokumentu.
07Aktualizace a provoz
Nová verze nebo změna modelu spustí řízené zpracování; správce sleduje stav, chyby, audit a provozní metriky.
Co z toho vzniklo
Funkční demonstrační index pro PDF dokumenty s více modely, hybridním dotazováním a dohledatelným původem výsledků. Veřejná ukázka neprokazuje produkční převzetí konkrétní institucí.