DOKUMENTY / VYHLEDÁVÁNÍ / AIFunkční prototyp

Sémantický index dokumentů s hybridním vyhledáváním

Funkční prototyp indexuje PDF včetně tabulek a spojuje významové hledání, fulltext, více indexů a přesné filtrování.

01 / PRO ČLOVĚKA

Co to řeší v praxi

Uživatel položí dotaz vlastními slovy a najde relevantní pasáže z PDF dokumentů, aniž by musel znát přesný název souboru nebo slovní spojení. Když hledá konkrétní termín, může dát větší váhu přesnému fulltextu. Nalezené části si může vztáhnout zpět k původnímu dokumentu.

Rozhraní nabízí výběr z více indexů, nastavení poměru významové a textové shody a pokročilé filtry nad tagy. To pomáhá rozlišit různé sbírky dokumentů, porovnat výsledky modelů a zúžit dotaz na konkrétní téma.

Správce může přidávat dokumenty a indexy, sledovat jejich zpracování, auditní záznamy i provozní stav. Při změně nastavení lze dokumenty znovu zařadit do indexu; pouhá úprava tagů nepotřebuje nový výpočet vektorů. Veřejná ukázka běží s demonstrační identitou a daty.

VYBRANÉ FUNKCE

Co řešení umí

01

Významové i přesné hledání

Hybridní skóre kombinuje podobnost obsahu s fulltextovou shodou a poměr lze nastavovat.

02

Více nezávislých indexů

Stejný dokument může být dohledatelný v několika indexech s odlišnými modely.

03

PDF a tabulky

Zpracování rozlišuje běžný text a tabulkové části a zachovává vazbu na původní stránku.

04

Tagy bez reindexace

Filtry nad metadaty zpřesňují výsledky; změny tagů nevyžadují nový embedding.

05

Řízená fronta

Delší zpracování běží na pozadí se stavem, opakováním neúspěšného kroku a plnou reindexací.

06

API, audit a provoz

Verzované API, audit, metriky, kontrola zdraví a postupy obnovy podporují navazující použití.

02 / POD KAPOTOU

Technické řešení

FastAPI odděluje web a verzované REST API od pracovního procesu a embeddingové služby. Z PDF se extrahují textové i tabulkové části, které nesou vazbu na dokument, verzi a stránku. PostgreSQL drží metadata, tagy, frontu a audit; pgvector ukládá embeddingy pro více samostatných indexů. Hybridní dotaz váží vektorovou podobnost vůči fulltextovému skóre.

Jedna sada dokumentů může využívat více embeddingových modelů. Zpracování dokumentů probíhá asynchronně, pracovní procesy si rozdělují položky databázové fronty a stav úlohy je dohledatelný. Změna modelu nebo konfigurace indexu vyvolá řízenou reindexaci, zatímco tagy se upravují bez přepočtu embeddingů.

Služby API, pracovní proces, lokální embeddingový model a databáze běží odděleně v kontejnerech. Základní indexace může fungovat bez stálého přístupu k internetu. Architektura počítá s tokenovým ověřováním v produkční konfiguraci, avšak veřejný Proof of Concept používá výslovně demonstrační režim. K dispozici jsou audit, provozní metriky a postupy zálohy a obnovy.

Technické výzvy

  • Převést text a tabulky z PDF bez ztráty vazby na stránku a verzi dokumentu.
  • Udržet více vektorových indexů s různými modely oddělených a znovu zpracovat obsah při změně konfigurace.
  • Sloučit vektorovou relevanci s fulltextem a filtry tak, aby bylo možné výsledek ověřit v původním dokumentu.
03 / PRŮBĚH

Jak na sebe kroky navazují

  1. 01Založení dokumentu

    Uživatel vloží PDF a přiřadí mu název, metadata a tagy. Systém založí verzovaný záznam a úlohu na pozadí.

  2. 02Extrakce obsahu

    Pracovní proces vyčte text a tabulky po stránkách a propojí každou část s konkrétní verzí dokumentu.

  3. 03Dělení a vektorové reprezentace

    Obsah se rozdělí na menší vyhledatelné úseky; lokální model pro každý vytvoří embedding.

  4. 04Uložení do indexů

    Text, metadata a embeddingy se uloží odděleně tak, aby jeden dokument mohl být současně ve více indexech.

  5. 05Významový a fulltextový dotaz

    Dotaz vybere indexy, váhu obou způsobů hledání a případné tagové filtry; systém výsledky seřadí podle relevance.

  6. 06Kontrola zdrojové pasáže

    Uživatel vidí odpovídající úryvek a jeho původ a může si závěr ověřit v dokumentu.

  7. 07Aktualizace a provoz

    Nová verze nebo změna modelu spustí řízené zpracování; správce sleduje stav, chyby, audit a provozní metriky.

04 / VÝSLEDEK

Co z toho vzniklo

Funkční demonstrační index pro PDF dokumenty s více modely, hybridním dotazováním a dohledatelným původem výsledků. Veřejná ukázka neprokazuje produkční převzetí konkrétní institucí.

CO DÁL

Zaujalo vás toto řešení?

Navrhneme nasazení nebo úpravy na míru vašemu provozu. Stačí nám napsat, co potřebujete.

Mám zájem o toto řešení