Vývoj LLM a generativní AI

Podle oborových dat zhruba 85 % LLM prototypů nikdy nedoletí do produkce. Demo v notebooku je snadné. Systém, který obstojí pod reálným provozem, reálnými hraničními případy a reálným driftem dat, je ta skutečná práce. Stavíme LLM funkce, které se dostanou do produkce, škálují a drží i dlouho po spuštění.

Jsme AI inženýrský tým s kancelářemi v Praze a Londýně, pracujeme s CTO, VP Product a technickými zakladateli. 50+ AI funkcí v produkci, nejrychlejší nasazení dva měsíce od zahájení. Máme pověst toho, že vám řekneme, kdy LLM není správný nástroj.

  • Prompt, RAG nebo fine-tune rozhodnuté upřímně
  • Zaměřené na produkci, ne jen PoC
  • Přenositelné mezi vendory z principu
  • Transparentní náklady po spuštění
VeoliaUniversal StudiosMercedesVienna Insurance GroupRaiffeisen BankGeometryWagestreamCinestarWMC | GREYNOAHOgilvyAmeli
4,9/5 na Google
4,8/5 na Trustpilot
5,0/5 na Clutch

Dodáváme výsledky pro startupy i známé značky v ČR, UK, EU a USA od roku 2013.

Tým z Prahy a Londýna, který staví LLM funkce pro produkci, ne jen prototypy.

/ Co dostanete
Co stavíme nad modelem
01
Retrieval-Augmented Generation (RAG)
Většina úspěchů LLM v produkci pochází z prompt engineeringu a dobře navrženého RAG, ne z fine-tuningu. Navrhujeme vrstvu příjmu dat, chunkingu a retrievalu nad vaším skutečným korpusem. Pak ji ladíme hybridním vyhledáváním a sémantickým rerankingem, aby měl model správný kontext, ne jen nejlepší odhad.
'Chunk, embed, vector search' nestačí. Skutečná práce je v evaluaci, v ladění kvality retrievalu a v jeho řízení podle oprávnění nad vašimi reálnými daty.
RAG
Hybrid search
Semantic reranking
Permission-scoped retrieval
02
Fine-tuning a modely na míru
Fine-tuning mění, jak se model chová. RAG mění, co model ví. Fine-tunujeme, když máte stabilní, vysokoobjemové chování, které prompt engineering spolehlivě nevynutí, a ekonomika ospravedlní náklady na trénink a evaluaci. Upřímně řekneme, jestli by vás prompt a lepší retrieval dostaly k cíli rychleji.
Ekonomiku tokenů, náklady na evaluaci a plán přetrénování stanovíme před závazkem.
Fine-tuning
LoRA
Doménové modely
Evaluace
03
Prompt engineering a evaluation pipelines
Prompt engineering spotřebuje 30 až 40 % času LLM projektu, a přesto do něj většina týmů investuje míň, než by měla. Navrhujeme prompty se strukturovanými výstupy, typovanými kontrakty a deterministickou middleware. Při každé změně je necháme projít evaluation pipelinou v CI.
Váš tým dostane eval set, scoring harness a dashboardy. Zpětnovazební smyčku máte ve svých rukou.
Prompt engineering
Typed outputs
Eval pipelines
CI-integrated
04
LLM integrace a privátní deployment
LLM integrace je to, kde se posouvají termíny. Ne kvůli modelu, ale kvůli API auditům, propagaci IAM do retrievalu, output schema kontraktům a privacy architektuře. Pro regulované klienty nasazujeme na privátní cloud, Azure OpenAI se zero retention nebo self-hosted open-source modely.
TCO porovnáváme při očekávaném objemu. Pokud self-hosting nepřekoná API, řekneme to.
LLM integrace
Privátní deployment
Azure OpenAI
Self-hosted open-source

Proč většina LLM prototypů nedoletí, a co s tím děláme

Rozhodnuto: prompt, RAG nebo fine-tune

Týmy plýtvají týdny a desítky tisíc dolarů tréninkem modelu, přičemž skutečným problémem byl prompt nebo chyba v retrievalu. Naše výchozí pořadí: prompt engineering první (dny, skoro nulové náklady), RAG když je gap ve znalostech (týdny), fine-tuning jen jako poslední možnost pro stabilní vysokoobjemovou změnu chování (měsíce, reálné peníze). Rozhodnutí děláme s vámi písemně a s vysvětleným kompromisem.

Halucinace jako engineering problém

RAG chatbot samostatného vývojáře vyletěl z $20 na $300 měsíčně při 50 uživatelích, protože každý dotaz zamířil na frontier model. Bot pro objednávky k lékaři tvrdil, že rezervoval schůzky, které se nikdy nekonaly. Tohle nejsou marketingové průšvihy. Jsou to chybějící output validation, chybějící deterministická middleware, chybějící model routing a chybějící evaluace. Opatření navrhujeme od prvního dne.

Přenositelnost mezi vendory, ne závislost na OpenAI

Skepticismus, že agentury jsou 'jen obaly nad OpenAI API', je férový. Stavíme s model abstraction layer, model-agnostic eval pipelines a architekturou, která umožní přepnout Claude, Gemini, Llama nebo self-hosted model bez přepsání aplikace. Když poskytovatel ukončí endpoint nebo změní ceník, máte na výběr.

Kdy LLM NEPOUŽÍT

Někdy je správná odpověď rules engine, classifier nebo SQL dotaz. Pokud má váš problém deterministickou ground truth, těsné rozpočty na latenci nebo přísné požadavky na audit, které LLM upřímně nesplní, řekneme to a doporučíme levnější, spolehlivější nástroj. Radši nestavět než stavět špatnou věc.

Jak řešíme spolupráci na vývoji LLM

01

Discovery a rozhodnutí o architektuře (týdny 1-2)

Use case porovnáváme s vašimi daty, cíli na latenci a přesnost, integrační plochou a regulatorní expozicí. Výstup: rozhodnutí prompt vs RAG vs fine-tune, integrační plán, privacy architektura a naceněný build s pevně vymezeným rozsahem.

Hned na začátku řekneme, jestli se use case pro LLM nehodí. Občas to zazní i u placeného discovery.

02

Proof of Concept na vašich reálných datech (volitelné, 2-3 týdny)

Kde je vysoké riziko v retrievalu nebo integraci, spouštíme časově ohraničený PoC na vašich datech, vašich API, vašem IAM. PoC navrhujeme tak, aby rychle selhal na věcech, které obvykle zabíjejí LLM projekty: strategie chunkingu, kvalita retrievalu, propagace oprávnění, schema drift.

Dostanete evaluační report s konkrétními metrikami oproti golden setu a konkrétní naceněný build.

03

Production build a evaluace (týdny 3-10+)

Build běží jako malý zkušený tým vedený Michalem Vavrou, s AI a integračními inženýry v kontaktu s vašimi stakeholdery. Každý release jde za feature flag, s eval pipelines v CI, output schema validation, regresními testy na fixním golden setu a cost telemetry od prvního týdne.

Nasazujeme brzy. Bránou jsou guardrails a evaly, ne lesk dema.

04

Launch, monitoring a kontrola nákladů

Při spuštění zapojíme faithfulness tracking, drift detection, token a inference cost telemetry, output validation a alerting. Dostanete runbooky, architekturní dokumentaci, plný eval harness a předání projektu.

Měsíční retainer pro monitoring, ladění a aktualizace modelů. Žádný lock-in, kdykoli si to převezmete in-house.

Investice do vývoje LLM

Cena LLM projektu má dvě části: samotný build a průběžnou ekonomiku modelu. Discovery má pevnou cenu od 140 000 Kč a jejím výstupem je obhájitelná cenová nabídka buildu plus odhad měsíční inference cost před závazkem. Produkční spolupráce obvykle začíná na 850 000 Kč a běží šest až deset týdnů do live systému. Provozní run rate po spuštění stanovíme ve stejném návrhu.
Discovery a architektura
Od 140 000 Kč. Rozhodnutí prompt vs RAG vs fine-tune, integrační plán a naceněný build s pevným rozsahem
Proof of Concept (volitelný)
Časově ohraničený PoC na vašich reálných datech pro odbourání rizika v retrievalu a integraci
Production build
Obvykle od 850 000 Kč, 6-10 týdnů do live systému s eval pipelines, monitoringem a cost telemetry
Run-rate a optimization retainer
Měsíční spolupráce na model routingu, cachingu, evaluaci a aktualizacích modelů

Často kladené otázky

Otázky, které nám techničtí zadavatelé kladou na prvním hovoru o vývoji LLM, RAG, fine-tuningu a run-rate nákladech.

Naše výchozí pořadí: prompt engineering první, RAG když je mezera ve znalostech, fine-tuning až jako poslední možnost. Zhruba 90 % úspěchů v produkci stojí na kombinaci prompt + RAG. Fine-tuning je 10% výjimka, kterou stejně většinou přepoužijeme. Ta obvykle vznikne, když tým předpokládá, že model potřebuje víc tréninku. Skutečnou mezerou je přitom špatný retrieval nebo slabý prompt. Rozhodnutí děláme s vámi písemně v discovery.

Build a run rate jsou dvě různé věci. Inference cost roste s objemem tokenů, volbou modelu a tím, jestli máte routing a caching. Naivní nasazení frontier modelu může snadno znásobit odhadované náklady při spuštění: viděli jsme skok z $20 na $300 měsíčně při 50 uživatelích kvůli jednomu opomenutému rozhodnutí o routingu. Odhadovaný měsíční run rate stanovíme v návrhu discovery a model routing, sémantický caching i evaluation gates navrhujeme od začátku.

Halucinaci bereme jako engineering problém, ne marketingový. Opatření jsou vrstvená: output validation proti typovaným kontraktům, kontroly kvality retrievalu, deterministická middleware tahající autoritativní stav před model, human-in-the-loop u nevratných akcí a faithfulness scoring u každého release. Netvrdíme '100% spolehlivý' ani 'nikdy nehalucinuje'. Měříme jeho výskyt a ladíme, dokud není pro váš use case přijatelný.

Stavíme s model abstraction layer a model-agnostic eval pipelines od začátku. Přepnout GPT na Claude, Gemini, Llama nebo self-hosted model je konfigurační změna plus eval re-run, ne přepis. Nejste vázaní na žádného vendora a rotujeme, když se hne ekonomika nebo policy.

Ano. Podporujeme Azure OpenAI se zero retention, privátní cloud deploymenty na AWS nebo GCP a self-hosted open-source modely na vaší infrastruktuře. Volba se řídí požadavky na data residency, důvěrnost a objem. Při očekávaném objemu spočítáme TCO a upřímně řekneme, jestli se self-hosting vyplatí.

Model je ta jednoduchá část. Production systém je retrieval, output validation, eval pipelines, model routing, caching, monitoring, fallbacks, guardrails a CI-integrated regression harness. To stavíme. Pokud je váš use case opravdu jeden API call, řekneme, ať si to napíšete sami.

Když má problém deterministickou ground truth, těsné rozpočty na latenci nebo přísné požadavky na audit, které LLM upřímně nesplní. Klasifikace s čistými štítky, exact-match search, transakční stav. To často líp vyřeší classifier, SQL nebo rules engine. Radši doporučíme levnější a spolehlivější nástroj, než abychom stavěli špatnou věc.