Machine learning a prediktivní modely pro váš byznys

Většina firem sedí na datech, která nepoužívá, a dělá manuální rozhodnutí, která by mohl model automatizovat, auditovat a zlepšovat. Stavíme klasické machine learning (strojové učení) systémy pro predikci, klasifikaci, anomaly detection, forecasting a doporučování. Jdou do produkce a zůstávají přesné.

Pixelfield je pro CTO, data leady a šéfy provozu ve firmách, kde zjevná odpověď na váš problém je model, ne chatbot. Senior inženýři, kteří vymezují rozsah, píšou i produkční kód. 50+ AI funkcí v produkci, nejrychlejší nasazení za dva měsíce a pověst firmy, která vám řekne, kdy XGBoost porazí 1,1milionový LLM projekt.

  • Klasické ML, kde poráží GenAI
  • Byznys metriky, ne jen přesnost
  • Zaměřené na produkci, ne experimenty v notebooku
  • Vestavěný monitoring driftu
VeoliaUniversal StudiosMercedesVienna Insurance GroupRaiffeisen BankGeometryWagestreamCinestarWMC | GREYNOAHOgilvyAmeli
4,9/5 na Google
4,8/5 na Trustpilot
5,0/5 na Clutch

Pracovali jsme se startupy a velkými značkami v ČR, UK, EU a USA od roku 2013.

Tým z Prahy a Londýna, který spolupracuje s vámi na něčem skvělém.

/ Co dostanete
Co stavíme (a byznys výsledek, který přináší)
01
Forecasting a klasifikace (churn, credit, lead scoring, conversion)
Predikujte, kdo odejde, nesplatí, konvertuje nebo eskaluje, dřív než to nastane. Klasifikační a regresní modely na vašich strukturovaných datech: zákaznické záznamy, transakce, užívání produktu, události z CRM. Model doplňujeme o pojistku na byznys metriku, takže měříte dopad na tržby, ne jen přesnost. Churn model, který zvedne retenci, ale ztratí net revenue, je selhání - viděli jsme ho a navrhujeme s tím vědomím.
XGBoost, gradient boosting, logistic regression, neural networks. Volbu rozhodují data a trojúhelník latence, ceny a vysvětlitelnosti, ne to, co je zrovna v módě.
Churn prediction
Lead scoring
Credit risk
Fraud klasifikace
02
Forecasting a detekce (poptávka, anomálie, time series)
Předpovídejte poptávku, abyste přestali přeobjednávat. Detekujte fraud dřív, než něco stojí, ne až po chargebacku. Najděte anomálie v datech ze senzorů, plateb nebo telemetrie. Stavíme time-series a anomaly-detection systémy. Počítají se sezónností, driftem a tichými hraničními případy, které standardní metriky přesnosti minou.
Referenční XGBoost fraud modely v oboru běží dva roky a šetří $1,5-2M ročně. Klasické ML, CPU-only, haléře na milion predikcí.
Demand forecasting
Fraud detection
Anomaly detection
Time series
03
Doporučení a personalizace
Recommendation enginy a personalizační systémy pro produkt, obsah, vyhledávání a ceny. Collaborative filtering, content-based ranking, hybridní modely s ošetřením cold-startu a online learning loops. Eval set a A/B framework navrhneme před modelem, takže 'lepší doporučení' je něco, co měříte, ne jen tvrdíte.
Pro práci s textem a konverzací viz naše stránka Vývoj LLM.
Recommendations
Personalizace
Ranking
A/b testing

Proč většina ML projektů selhává (a co s tím děláme)

Klasické ML vs GenAI rozhodujeme upřímně

V roce 2026 zní výchozí požadavek 'použij GPT na všechno'. Pro strukturovaná tabulární data s labely je klasické ML rychlejší na trénování, levnější ve škále (CPU haléře vs LLM tokeny), víc deterministické a snáz auditovatelné. Rozhodnutí děláme s vámi písemně v discovery: klasické pro predikci na tabulárních datech, GenAI, když je vstup opravdu nestrukturovaný. Zhruba 80 % strukturovaných byznys problémů padá na klasickou stranu.

Byznys metriky, ne jen přesnost

Churn model s 99% přesností na nevyvážených datech je k ničemu. Retenční kampaň s 92% false positives může ztratit víc tržeb, než ušetří. Definujeme business-impact metriku (net revenue, cost saved, automatizovaná rozhodnutí) před výběrem modelu, pak proti ní měříme pomocí shadow testingu a A/B evaluace. AUROC je sanity check, ne cíl.

Zaměřené na produkci, ne notebooky

Napříč oborem zhruba 80 % ML modelů nikdy nedoletí dál než do notebooku. Model bereme jako snadných 20 %. Zbylých 80 % tvoří data pipelines, feature engineering, model serving, drift detection, retraining, observability a cross-functional sign-off potřebný pro Legal, Operations a Finance. Tento rozsah navrhujeme od prvního týdne.

Feature engineering poráží architecture search

Logistic regression na šesti měsících engineered features porazí deep learning na surových datech častěji, než konferenční přednášky přiznávají. Nejdřív investujeme do pochopení dat: schémata, distribuce, leakage, lineage, kvalita labelů. Pak vybíráme nejjednodušší model, který problém vyřeší v latenci a ceně, kterou unesete. Někdy je odpovědí rules engine. Řekneme to.

Jak řešíme machine learning spolupráci

01

Data audit a proveditelnost (týdny 1-2)

Porovnáváme problém s daty: objem, kvalita labelů, dostupnost feature v čase predikce, leakage risk, lineage. Discovery zahrnuje placený PoC na vašich reálných datech, když je riziko proveditelnosti vysoké. Nejjednodušší model otestujeme jako první pro nastavení výchozího stavu.

Výstup: report proveditelnosti, doporučení klasické ML vs GenAI, odhadovaný dopad na byznys a cenová nabídka s pevným rozsahem. Nebo upřímné 'data nejsou připravená, opravte nejdřív tohle', pokud je to odpověď.

02

Feature engineering a vývoj modelu (týdny 3-6+)

Většina práce se odehrává tady. Feature design, leakage checky, train-validate-test splity respektující čas a identitu, výběr modelu řízený omezeními latence, ceny a vysvětlitelnosti. Vývoj vede malý zkušený tým Michala Vavry v úzkém kontaktu s datovými a provozními stakeholdery.

Každá iterace prochází fixním eval setem s business-metric guardy, ne kosmetickou přesností.

03

Shadow testing a production deployment (týdny 6-10+)

Než model řídí jakékoli rozhodnutí, pouštíme ho v shadow módu proti reálnému produkčnímu provozu na dva až dvanáct týdnů a srovnáváme predikce se skutečnými výsledky. To ukáže skutečnou přesnost a odhad ROI dřív, než utratíte korunu za zásahy. Pak nasazujeme přes feature flagy s ručním přepnutím a možností rollbacku.

Vývoj jsme v téhle fázi zastavili, když ekonomika neobhájila produkci. Přesně na to je shadow testing.

04

Monitoring, retraining, iterace

Při spuštění zapojíme prediction-confidence histogramy, business-outcome monitoring, drift detection, retraining triggery a alerting. Standardní latency dashboardy nezachytí model, který vrací bezchybné odpovědi, ale tiše driftuje. Monitorujeme to, na čem opravdu záleží: nejdřív byznys metriky, pak statistický drift.

Měsíční retainer pro monitoring, retraining a iteraci, žádný lock-in. Kdykoli si to můžete převzít interně.

Investice do STROJOVÉHO UČENÍ

Klasické ML je dramaticky levnější na provoz než GenAI. CPU-only inference za haléře na milion predikcí, ne účty za LLM tokeny rostoucí s provozem. Discovery má pevnou cenu od 50 000 Kč a dává obhájitelnou cenovou nabídku plus odhadovaný měsíční run rate ještě před závazkem. Production buildy obvykle od 280 000 Kč a běží šest až deset týdnů do živého modelu.
Data audit a proveditelnost
Od 50 000 Kč. Posouzení na reálných datech, doporučení ML vs GenAI, odhadovaný dopad na byznys, cenová nabídka s pevným rozsahem
Shadow testing (volitelné)
2-12 týdnů pouštění predikcí proti reálnému provozu před automatizací rozhodnutí
Production build
Obvykle od 280 000 Kč, 6-10 týdnů do živého modelu s feature pipeline, monitoringem a retraining loop
Monitoring a retraining retainer
Měsíční spolupráce na drift detection, retrainingu a on-call

Často kladené otázky

Otázky, které nám data leadi a CTO kladou na prvním callu o klasickém ML, GenAI, driftu a run-rate nákladech.

Pokud máte strukturovaná a označená data (transakce, zákaznické záznamy, data ze senzorů, time series) a potřebujete predikci, klasifikaci nebo anomaly detection, klasické ML obvykle vyhrává na přesnosti, ceně, latenci a vysvětlitelnosti. CPU-only inference za haléře na milion predikcí, deterministické výstupy, plná feature importance. LLM vyhrávají, když je vstup opravdu nestrukturovaný (free-text feedback, dokumenty, multi-modal). Rozhodnutí děláme s vámi písemně v discovery, ne až poté, co utratíte 1,1 mil. Kč na prompt engineeringu.

Zhruba 80 % ML modelů stagnuje v notebooku. Model sám je snadných 20 %. Oněch 80 %, co projekty zabíjí, je kvalita dat, feature pipelines, model serving, drift detection, retraining, observability a cross-functional sign-off potřebný k tomu, aby Legal, Operations a Finance pustili věc ven. Tento rozsah navrhujeme od prvního týdne. Model, který se dostane ven, je ten, co už máme zapojený do produkční pipeline před laděním hyperparametrů.

Záleží na problému. Pro většinu klasifikace a regrese na strukturovaných datech několik tisíc až desítky tisíc označených příkladů. Anomaly detection funguje i s méně příklady normálního chování. Time-series forecasting potřebuje dost historie na pokrytí sezónnosti. V discovery vyhodnotíme kvalitu, objem a pokrytí labely. Pak upřímně řekneme, kdy je odpověď 'opravte data nejdřív a pak se k tomu vraťte'. Doporučili jsme to víckrát.

Na byznys výsledek, ne AUROC. Definujeme impact metriku (net revenue, cost saved, automatizovaná rozhodnutí, false-positive cost) před výběrem modelu. Churn model, který zvedne retenci, ale ztratí net revenue, je selhání. Fraud model s 99% přesností na nevyvážených datech je bezvýznamný. Accuracy, precision a recall jsou jen sanity checky. Metrika, kterou reportujeme, je ta, kterou pozná i váš CFO.

Ano, modely degradují, jak se mění data a zákazníci. Standardní monitoring (latency, error rates, GPU utilization) to nezachytí. Každý model dodáváme s prediction-confidence histogramy, business-outcome monitoringem, drift detection na feature distribucích, golden-dataset regresí a retraining triggery. Frekvence retrainingu závisí na volatilitě (týdně pro fraud, měsíčně pro tabulární klasifikaci, on-trigger pro vše ostatní). Maintenance retainer tuto práci pokrývá, nebo ji předáme.

Discovery pevná cena od 50 000 Kč. Production buildy obvykle od 280 000 Kč a běží šest až deset týdnů. Run rate je zlomek GenAI: klasické ML na CPU stojí haléře na milion predikcí plus pevný retainer pro monitoring a retraining. Obě čísla stanovíme v návrhu, takže run rate je jasný ještě před závazkem.

Když práci zvládne rules engine, SQL dotaz nebo jednoduchá byznys heuristika. Když jsou data příliš nepořádná, řídká nebo nepředpovídají výsledek, na kterém záleží. Když cena false positives převyšuje hodnotu správných predikcí (viděli jsme 92% false-positive rate na reálných churn projektech). Řekneme to v discovery a doporučíme levnější, spolehlivější řešení. Radši nestavět než stavět špatnou věc.