Vývoj RAG pro váš byznys

Produkční RAG se láme na třech věcech: špatném chunkingu, chybějícím query rewritingu a eval setu deseti queries napsaných zakladatelem. Stavíme zbylých 80 % systému. Právě ono rozhoduje, jestli je retrieval spolehlivý na vašem reálném korpusu: nekonzistentní PDF, staré wiki, doménový žargon, multi-hop otázky i data, která se aktualizují ve chvíli, kdy agent stále tahá včerejší snapshot.

Pixelfield je pro CTO, Heads of Product a VP Engineering ve firmách, které potřebují, aby AI uvažovala nad jejich vlastními daty, ne nad generickými trénovacími daty. Senior inženýři, kteří vymezují rozsah, píšou i produkční kód. 50+ AI funkcí v produkci, nejrychlejší nasazení dva měsíce. A jsme známí tím, že vám řekneme, kdy je fine-tuning dražší chyba.

  • 80 % za vector searchem
  • Chunking, reranking, hybrid retrieval
  • Evaluace jako CI/CD gate, ne dojmy
  • Freshness SLA a drift monitoring
VeoliaUniversal StudiosMercedesVienna Insurance GroupRaiffeisen BankGeometryWagestreamCinestarWMC | GREYNOAHOgilvyAmeli
4,9/5 na Google
4,8/5 na Trustpilot
5,0/5 na Clutch

Dodáváme AI uvnitř produkčních produktů pro scale-upy a enterprise v ČR, UK, EU a USA od roku 2013.

Vývojový tým z Prahy a Londýna, který bere RAG jako problém datové platformy, ne jako trik s vector searchem.

/ Co dostanete
Co opravdu stavíme (těch 80 % za vector searchem)
01
Produkční RAG pipeline (za prototypem)
Prototypový RAG je chunk, embed, store, retrieve, pošli do LLM. Produkční RAG je metadata enrichment, query rewriting, hybrid retrieval, cross-encoder reranking, citation tracking, freshness SLA, evaluace v CI a fallback chains, když retrieval mine.
Celou pipeline stavíme jako inženýrskou práci, ne konfiguraci. ML je tak 20 % systému.
End-to-end pipeline
Query rewriting
Citation tracking
Production gates
02
Chunking strategie podle datového typu
Většina RAG systémů selhává na chunkingu, ne retrievalu. Nejlepší embedding model na světě vás nezachrání, když chunky půlí myšlenku. Chunking navrhujeme podle typu dat: sémantické jednotky pro prózu, strukturální pro kód a konfiguraci, table-aware pro PDF a tabulkové soubory, conversation-aware pro tickety a záznamy chatů.
200-500 tokenů s 10% překryvem je výchozí bod, ne recept. Reálný chunking je data-shape specific.
Sémantický chunking
Table-aware parsing
Code chunking
Per-data-type strategie
03
Hybrid retrieval a reranking
Vector search sám dá recall na sémantickou podobnost, ale míjí přesné výrazy, identifikátory a vzácná klíčová slova. BM25 + vector + případně graph dá recall. Cross-encoder reranker dá precision. Týmy, které reranking vynechávají a místo toho ladí embedding modely, optimalizují špatnou vrstvu.
Retrieval mix ladíme na váš korpus a query distribuci, ne na benchmark dataset.
Hybrid search
BM25 + vector
Cross-encoder reranking
Latency profiling
04
Graph RAG a Agentic RAG (když to stojí za to)
Vector search trefí 32-75 % přesnosti na multi-hop queries. Graph RAG trefí 85 %+, když jsou data opravdu relační: organizační schémata, řetězce faktur, code dependencies, compliance lineage, customer-to-account-to-contract. Agentic RAG když systém potřebuje rozhodnout, jak retrievovat (vector, graph, SQL, API).
Rozhodnutí děláme s vámi písemně. Cena za složitost je reálná a řekneme, kdy stačí standardní RAG s hybrid searchem.
Graph RAG
Agentic RAG
Multi-hop retrieval
Architecture decision
05
Ingestion pro nepořádná reálná data
Váš korpus není čistý Confluence export. Půlka dokumentů je zastaralá. PDF jsou skenované našikmo. Tabulky jsou slité. Wiki má staré stránky. CRM má duplicitní záznamy. Stavíme ingestion pipelines, které řeší realitu: OCR pro skenované PDF (s ručním písmem, kde je třeba), structure-aware table extrakce, deduplikace, freshness flagy, source-of-truth precedence.
Pro specializovanou OCR/vision práci viz naši NLP a Computer Vision stránku.
OCR + tabulky
Multi-format korpusy
Deduplikace
Source-of-truth precedence
06
RAG evaluation jako CI/CD gate
Hit rate je vanity metrika. Záleží na: retrieval precision, answer faithfulness, citation accuracy, context relevance. Používáme RAGAS a DeepEval jako CI/CD gates: prompt a embedding-model změny procházejí stejným release procesem jako kód. Regrese na reálném eval setu blokuje merge.
Eval set stavíme z reálných produkčních queries, ne deseti otázek napsaných zakladatelem.
RAGAS / DeepEval
Faithfulness scoring
Citation accuracy
CI gate na regresi
07
Freshness, drift, monitoring
Postgres se aktualizoval před pěti minutami, datový sklad před hodinou. Pokud agent tahá včerejší snapshot, odpovědi jsou sebevědomě špatné. Freshness SLA navrhujeme přímo do ingestion (CDC kde to jde, scheduled kde ne). K tomu backfill protokoly, idempotentní reprocessing a lineage od odpovědi zpátky ke zdrojovému dokumentu.
Při spuštění zapojíme monitoring na retrieval kvalitu, drift detection na query distribuci a alerting na faithfulness regresi.
Freshness SLA
CDC ingestion
Lineage to source
Drift monitoring
08
Vlastnictví IP a předání
Vlastníte vše, co dodáváme. Zdrojový kód, prompty, prompt registry, ingestion pipelines, eval datasety, infrastructure-as-code, monitoring dashboardy, runbooky. Žádná pronajatá vrstva. Žádný vendor lock-in. Na konci spolupráce předáme s dokumentací a tréninkem nebo pokračujeme s měsíční podporou. Vaše volba.
Plný IP transfer
Žádný lock-in
Eval datasety součástí
Runbooky

Proč většina produkční RAG selhává (a co s tím děláme)

Funguje na 10 testovacích dokumentech, padá na vašich

Každé RAG demo funguje na hrstce čistých dokumentů. Produkce má miliony stránek, skenovaná PDF, staré wiki, near-duplicates, multi-hop otázky a uživatele, kteří se ptají způsobem, jaký váš test set nikdy nečekal. Navrhujeme pro tu realitu od prvního týdne: profilování korpusu, sběr reálných dotazů, eval set z produkčních dat, fail-fast na vzorcích, které RAG obvykle zabíjejí.

80 %, co není vector search

Vector search je slavných 20 % RAG systému. 80 %, co rozhodne, jestli to půjde do produkce, je chunking strategie, query rewriting, hybrid retrieval, reranking, citation tracking, freshness SLA, evaluation pipelines a monitoring. Většina agentur prodá těch 20 %. My stavíme zbylých 80 %.

Váš eval set rozhoduje, jestli to funguje

Eval set deseti otázek napsaných zakladatelem je nejčastější vzorec selhání RAG, který vidíme. Eval set stavíme z reálných produkčních queries, rozšiřujeme o adversarial cases (multi-hop, near-duplicate, stale-data traps) a pouštíme ho jako CI/CD gate. RAGAS nebo DeepEval, hlídá změny promptů a embedding modelů. Co neměříte, nedostanete do produkce.

Upřímně k tomu, kdy fine-tuning vyhrává (zřídka)

Kolem 51 % enterprise AI jede jako RAG. RAG dává 80 % hodnoty s 20 % provozní režie. Fine-tuning je správná volba pro úzkou, stabilní, high-volume behaviorální změnu (tón, výstupní formát), kde prompt engineering nevynutí spolehlivě. Doporučili jsme klasický RAG s lepším chunkingem poté, co týmy spálily dva měsíce na fine-tuningu. Uděláme totéž pro vás, pokud to bude správná volba.

Jak spolupráce běží, týden po týdnu

01

Audit korpusu a rozhodnutí o architektuře (týdny 1-2, pevná cena od 50 000 Kč)

Vzorkujeme váš reálný korpus a klasifikujeme datové tvary: strukturovaná, semi-strukturovaná, skenovaná, konverzační. Kde to jde, profilujeme vzorce dotazů reálných uživatelů. Pak určíme, co před retrievalem smazat, restrukturovat nebo vyloučit.Discovery zahrnuje evaluation baseline na vašich datech s malým test eval setem, takže víte, odkud začínáme.

Dostanete: profil korpusu, retrieval architekturu (standard vs Graph vs Agentic, s odůvodněním), ingestion plán, evaluation framework, cenovou nabídku s pevným rozsahem a odhadované měsíční provozní náklady.

02

Stavba ingestion a retrieval (týdny 3-6+)

Stavba běží jako malý zkušený tým vedený Michalem Vavrou. Stavíme ingestion pipeline (chunking podle typu dat, OCR/table extrakce, deduplikace, freshness CDC), retrieval vrstvu (hybrid BM25 + vector + případně graph) a reranking pass.

Každou iteraci hlídá fixní eval set rozdělený podle query typu a datového tvaru. Retrieval precision a faithfulness sledujeme od prvního dne, ne až po spuštění.

03

Evaluace, reranking, hardening (týdny 5-9+)

Eval set rozšíříme o reálné produkční queries plus adversarial cases (multi-hop, near-duplicates, stale-data traps). RAGAS/DeepEval pouštíme jako CI/CD gate. Cross-encoder reranking ladíme na precision. Doplníme citation tracking, source lineage a fallback chains pro výpadky retrievalu.

Systém pouštíme ve stínovém režimu proti reálnému provozu, než někdo uvidí výstup. Řešení jde do produkce, když přežije hardening pass, ne když funguje demo.

04

Launch, monitor, iterace (volitelný retainer)

Při spuštění zapojíme monitoring retrieval kvality, faithfulness drift alerty, freshness lag tracking, query-distribution drift, citation-accuracy regresi a feedback loop z lidského review zpátky do eval setu. RAG systémy stárnou. Retainer nastavíme tak, aby váš tiše nedegradoval.

Měsíční retainer pro monitoring, prompt a chunking ladění, embedding-model aktualizace, on-call. In-house kdykoli, až budete připraveni.

Investice do vývoje RAG

Cena závisí na velikosti korpusu, čistotě dat, retrieval architektuře (standard vs Graph vs Agentic) a SLA. Discovery má pevnou cenu od 50 000 Kč. Na jeho konci dostanete obhájitelnou cenovou nabídku i odhadované měsíční provozní náklady, ještě než se k čemukoli zavážete. Malé cílené RAG systémy začínají kolem 280 000 Kč. Mid-market produkční nasazení s hybrid retrieval, evaluation pipelines a Graph nebo Agentic komponentami obvykle 700 000-2,8 mil. Kč. Run rate je pevný měsíční plus inference a embedding cost.
Audit korpusu a architektura (od 50 000 Kč)
Týdny 1-2, pevná cena. Profil korpusu, rozhodnutí o retrieval architektuře, evaluation framework, fixed-scope quote.
Malý cílený RAG
Od 280 000 Kč. Jeden korpus, jeden retrieval mód, skromný eval set, do jednoho produktu.
Mid-market produkční RAG
Obvykle 700 000-2,8 mil. Kč. Hybrid retrieval, reranking, RAGAS/DeepEval CI gate, freshness SLA, monitoring stack.
Monitoring a iterace (retainer)
Měsíčně. Retrieval kvalita, faithfulness drift, embedding updaty, eval-set rozšiřování, on-call. Volitelné, oceněné po pásmech.

Často kladené otázky

Přímé odpovědi na otázky, které slyšíme od CTO a Heads of Product na každém scoping callu.

LangChain tutorial vás dostane od nuly k funkčnímu demu na deseti čistých dokumentech. Produkční RAG je problém datové platformy: chunking strategie podle datového typu, query rewriting, hybrid retrieval (BM25 + vector + případně graph), cross-encoder reranking, citation tracking, freshness SLA, RAGAS/DeepEval jako CI/CD gate, drift monitoring a fallback chains. Stavíme 80 % za demem. Pokud váš use case sedí v tutorialu, zapojte si to sami a přeskočte nás.

Kolem 51 % enterprise AI jede jako RAG. RAG dává 80 % hodnoty s 20 % provozní režie. Fine-tuning je správná volba pro úzkou, stabilní, high-volume behaviorální změnu (tón, výstupní formát), kde prompt engineering nevynutí spolehlivě. Viděli jsme týmy spálit dva měsíce na fine-tuningu. Lepší chunking a hybrid search by je k cíli dostaly za dva týdny. Nasaďte nejdřív RAG. V discovery vám řekneme, jestli je váš use case jeden z těch vzácných, kde vyhrává fine-tuning.

Obvykle ano. Ingestion pipeline je půlka práce: OCR pro skenované PDF (s ručním písmem, kde to typ dokumentu chce), structure-aware table extrakce, deduplikace, source-of-truth precedence napříč systémy, freshness flagy pro staré wiki stránky. V discovery profilujeme korpus a upřímně řekneme, kdy je odpověď 'opravte data layer první, pak stavte RAG'. Doporučili jsme to víckrát.

Standardní RAG s hybrid searchem zvládá single-hop semantic queries na většině korpusů. Graph RAG když jsou data opravdu relační a queries multi-hop: organizační schémata, řetězce faktur, code dependencies, compliance lineage, 'kdo reportuje člověku, který schválil fakturu X'. Agentic RAG když systém potřebuje rozhodnout, jak retrievovat (vector vs graph vs SQL vs API). Cena za složitost je reálná. Rozhodnutí děláme s vámi písemně v discovery.

Hit rate je vanity metrika. Záleží na: retrieval precision, answer faithfulness, citation accuracy, context relevance. Používáme RAGAS a DeepEval. Eval set stavíme z reálných produkčních queries plus adversarial cases (multi-hop, near-duplicate, stale-data traps). Změny promptů a embedding modelů pak hlídáme regresí. RAG jde do produkce, když přežije eval gate, ne když funguje demo.

Discovery: pevná cena od 50 000 Kč. Malý cílený RAG (jeden korpus, jeden retrieval mód, do jednoho produktu): od 280 000 Kč. Mid-market produkční nasazení s hybrid retrieval, reranking, evaluation pipelines a Graph nebo Agentic komponentami obvykle 700 000-2,8 mil. Kč. Run rate je pevný měsíční plus inference a embedding cost, který od prvního dne minimalizujeme.

Ano. Standardní kontrakt je plné IP vlastnictví: source kód, prompty, prompt registry, ingestion pipelines, eval datasety, infrastructure-as-code, monitoring dashboardy, runbooky. Žádná pronajatá vrstva. Dokumentujeme tak, aby to šlo kdykoli předat vašemu týmu nebo jinému vendorovi. Jediný důvod, proč zůstanete, je že je práce dobrá.