OCR rozpoznávání dokladů — jak funguje a proč je přesné
· Ing. Martin Procházka · ai
OCR rozpoznávání dokladů bez bolesti: jak funguje, proč je přesné a jak ti ušetří hodiny při účtování faktur a účtenek.
OCR rozpoznávání dokladů — jak funguje a proč je přesné
Sedíš nad hromadou účtenek a říkáš si: „Tohle přece nemůžu přepisovat ručně.“ Jo, souhlas. Taky tě nebaví hledat DIČ v rozmazané fotce z benzínky? OCR rozpoznávání dokladů ti tohle peklíčko vyžehlí. A my si řekneme, jak to celé kouzlo funguje a proč je dnes fakt přesné. Prostě bez čar, jen chytrá matematika a trénované modely.
Co přesně znamená OCR rozpoznávání dokladů a proč tě má zajímat?
OCR (Optical Character Recognition) je technologie, která z fotek a PDF vytáhne text a promění ho na strukturovaná data. U dokladů to znamená: částky, DPH, variabilní symbol, datum zdanitelného plnění, měnu, IČO, IBAN, položky… Jasně, že to chce víc než „jen“ přečíst písmenka. Klíč je chápat kontext dokladů.
💡 Tip: Pokud děláš účetnictví sám nebo ve dvou, OCR rozpoznávání dokladů ti reálně ušetří desítky hodin měsíčně. A k tomu méně chyb. Win–win.
No a co teď? Pojďme k jádru. Jak ta mašina ví, že „12/2026“ je datum a ne číslo položky? A proč je OCR v Doklad.ai tak přesné i u pokrčené účtenky z auta?
Jak funguje pipeline: od nečitelné fotky k připravené faktuře
1) Předzpracování obrazu: ať je z čeho číst
- Otočení, ořez, narovnání perspektivy (aby nebyl doklad „křivý“)
- Odstranění šumu a zvýšení kontrastu
- Binarizace a segmentace do bloků (textové zóny, tabulky, položky)
- Detekce jazyka a kódujících znaků (čeština, diakritika, měnové symboly)
Tady se rozhoduje, jestli bude OCR jen „hádat“, nebo číst s jistotou. Špatné světlo? Nevadí, když se správně dopočítá prahování a odhadnou okraje.
2) Textová extrakce: přečti písmena a čísla
- Moderní OCR enginy používají CNN/LSTM modely
- Detekují řádky, znaky, fonty i rotace
- Umí multisloupcové layouty a cizí jazyky
Výsledek je „surový“ text s pozicemi. Nicméně: vědět, že někde stojí „2026-05-31“ je fajn, ale ještě nevíme, že je to datum splatnosti.
3) Vytěžování dokladů: z textu děláme pole faktury
- Entity detection: IČO, DIČ, IBAN, číslo účtu, VS, SS, KS
- Datumové typy: vystavení, zdanitelné plnění, splatnost
- Částky: základ DPH, DPH, celkem, sazby 21/12/10 %, rounding
- Položky: název, množství, jednotka, cena bez/ s DPH, sazba DPH
Kombinujeme pravidla (regexy, kontrolní součty) a modely učení (NER, klasifikace polí). A teď to zásadní – validace.
4) Validace a kontrolní logika: ověř, že to sedí
- Kontrola součtů: základ + DPH = celkem (po zaokrouhlení)
- Křížové vazby: variabilní symbol = číslo faktury? Často ano.
- DIČ/IČO: ověření formátu a existence (ARES/VIES, když to dává smysl)
- Datumová logika: splatnost po vystavení, DPH sazby dle období
- Měna a kurz: CZK/EUR/PLN a přepočty podle data
💡 Tip: Když doklad chybí stránka nebo má dvě různé měny, automatická validace tě upozorní. V Doklad.ai vidíš červené vlajky rovnou u pole.
5) Učení z oprav: čím víc jedeš, tím chytřejší to je
- Systém si pamatuje tvoje dodavatele a vzory
- Přizpůsobí mapování položek na tvůj ceník a účty
- Snižuje počet manuálních zásahů po pár importech
Přesně. Po páté faktuře od stejného dodavatele je trefa skoro stoprocentní.
Proč je OCR rozpoznávání dokladů dnes tak přesné?
Krátká odpověď: protože to už není jen OCR. Je to kombinace kvalitního obrazu, modelů strojového učení a účetní logiky. A to je ten důvod, proč si OCR rozpoznávání dokladů poradí i s účtenkou z termosublimační tiskárny z pumpy.
Lepší modely, lepší data
- Trénujeme na českých fakturách a účtenkách (diakritika, sazby DPH, české zkratky)
- Používáme syntetické datasety (generované šablony + šum) a reálné anonymizované doklady
- Fine-tuning pro dodavatele s atypickým layoutem
Kontext nad textem
- Rozpoznávání vzorů rozložení (layout LM, vizuální NER)
- Pravděpodobnostní model: „částka vedle slova Celkem“ > „random číslo uprostřed“
- Vázání polí: datum splatnosti bývá po vystavení, ne před ním
Kontroly, které tě zachrání před chybou
- Hlídání sazeb 21/12/10 % a osvobození
- Detekce zaokrouhlení hotovosti
- Duplicitní doklady podle hashů obsahu a klíčových polí
Jak si stojí různé přístupy k OCR u dokladů?
Níže máš rychlé srovnání přístupů, se kterými se v praxi potkáš.
| Přístup | Popis | Přesnost na fakturách | Citlivost na kvalitu fotky | Náročnost nasazení |
|---|---|---|---|---|
| Čisté OCR bez kontextu | Přečte text, bez chápání polí | 60–80 % | Vysoká | Nízká |
| OCR + pravidla (regexy) | Přiřazuje čísla podle vzorů | 80–90 % | Střední | Střední |
| Vizuální NER + pravidla | Rozumí layoutu a kontextu | 90–97 % | Nízká–střední | Střední–vyšší |
| End-to-end ML (doklad→JSON) | Kompletní model se self-checky | 93–99 % | Nízká | Vyšší |
Upřímně? Samotné OCR bez kontextu je na účtenky krátké. Potřebuješ minimálně kombinaci pravidel a učení. Proto má Doklad.ai pipeline, která spojuje to nejlepší z obou světů.
Kdy OCR chybí a jak chyby minimalizujeme?
Hele, žádná magie. Jsou situace, kdy to zadrhne:
- Rozmazané fotky a odlesky
- Extrémně malý font a nízký kontrast
- Neobvyklé sazby, ruční škrty, razítka přes text
- Ručně psané doklady (paragon tužkou)
Jak na to jdeme:
- Adaptivní prahování, odhad perspektivy, odšumění
- Ensemble vícero OCR enginů a slovníky pravděpodobných tokenů
- Agregace důkazů: pokud tři signály tvrdí „variabilní symbol“, bereme to
- Interaktivní validace: uživatel potvrdí sporné pole jedním klikem
A když si nejsme jistí? Řekneme to nahlas. Lepší žlutý vykřičník než tichá chyba v DPH.
Co přesně vytěžíme z faktur a účtenek?
Hlavní pole faktury
- Dodavatel: název, IČO, DIČ, adresa
- Odběratel: tvoje data, kontrola shody s profilem
- Čísla: číslo faktury, variabilní symbol, objednávka
- Data: vystavení, zdanitelné plnění, splatnost
- Částky: základ, DPH, celkem, členění podle sazeb
- Banka: IBAN, BIC, číslo účtu, QR platba
- Měna a kurz
Položky a sazby DPH
- Název, množství, MJ, cena
- Sazba DPH, kód skladové položky
- Detekce řádkových slev
Účtenky (paragony)
- Datum a čas nákupu
- DIČ/IČO obchodníka, EET kód (historicky), ID pokladny
- Celková částka, hotově/kartou
- Místy i rozlišení položek (záleží na kvalitě tisku)
Jak probíhá OCR rozpoznávání dokladů v Doklad.ai krok za krokem?
Jednoduchý workflow
- Nahraješ PDF nebo fotku v mobilu
- Systém automaticky rozpozná typ (faktura, účtenka, zálohovka)
- Do pár vteřin vidíš vyplněná pole a kontrolky kvality
- Uložíš a rovnou vystavíš úhradu, nebo pošleš do účetnictví
Automatické párování plateb a validace
- Variabilní symbol + částka + protiúčet = shoda
- Bankovní napojení dočte úhrady a navrhne spárování
- Hlídáme, aby částka na výpise seděla s „Celkem k úhradě“
💡 Tip: Máš větší dávku PDF z mailu? Hodíš je do složky a hromadný import se postará. Duplicity odchytíme podle hashů a čísel dokladů.
Co ovlivňuje přesnost OCR a jak si ji pohlídat?
Na straně obrázku
- Ostrost a světlo: vyhni se silným odleskům a protisvětlu
- Rohy v záběru: kvůli korekci perspektivy
- Kontrast: tmavé písmo na světlém pozadí je král
Na straně obsahu
- Kompletní doklad (všechny stránky)
- Čitelné položky a sazby DPH
- Správně generovaný PDF (ne naskenovaný obrázek v mizerné kvalitě)
Na straně systému
- Model vytrénovaný na českém prostředí
- Validace s účetní logikou (sazby, součty, datumy)
- Feedback loop: učení z oprav
A ještě názor: lepší mít 95 % automaticky + 5 % rychlé opravy, než 100 % ručně. Prostě.
Jak OCR rozpoznávání dokladů šetří čas a peníze?
- Méně ruční práce: z hodin na minuty
- Méně chyb: kontrolní součty a formáty
- Rychlejší uzávěrky: doklady jsou dřív připravené k zaúčtování
- Lepší cash-flow: platby párujeme dřív, víš, co visí
Konkrétní čísla z praxe
- Účtenka: 10–20 sekund místo 2–3 minut ručně
- Faktura A4 s položkami: 30–60 sekund místo 5–8 minut
- Hromadný import 100 dokladů: hotovo do 10–15 minut včetně kontrol
Napojení na účetnictví a DPH
- Export do účetních systémů (XML/ISDOC/CSV)
- Automatická předkontace podle dodavatele a typu výdaje
- Členění DPH podle sazeb a režimů
Jak si vybrat OCR řešení pro firmu nebo účetní kancelář?
Klíčové otázky, které si polož
- Umí systém česky a sazby DPH 21/12/10 %?
- Má validace součtů a hlídání duplicit?
- Jak se učí z oprav? Zrychlí se po pár týdnech?
- Jak funguje hromadný import a párování plateb?
- Je jasná cena za stránku / doklad? Bez překvapení.
Co dělá rozdíl v praxi
- Kvalita mobilní aplikace (rychlé focení, automatické ořezání)
- Přehledná kontrola nespolehlivých polí (žluté/červené vlajky)
- Podpora formátů: PDF, ISDOC, e-faktury, fotky
Bezpečnost a soukromí: jak chráníme tvoje doklady
- Šifrování při přenosu i v úložišti (TLS, AES-256)
- Oddělení dat mezi klienty, auditní logy
- GDPR-ready správa souhlasů a doby uchování
- Anonymizace pro trénink (bez osobních údajů a variabilních symbolů, které identifikují jedince)
Nemáme rádi překvapení. Transparentní logy a přístup jen pro oprávněné uživatele. Tečka.
OCR rozpoznávání dokladů pro OSVČ vs. účetní tým: co se liší?
OSVČ
- Jednoduchost a rychlost
- Mobilní focení, rychlé přijetí výdajů
- Minimum nastavování, maximální automatika
Účetní tým
- Hromadné dávky, schvalovací workflow
- Přidělování dokladů, role a práva
- Vícestupňová validace a exporty do více systémů
Reálné scénáře: kde OCR boduje
Palivo a účtenky z cest
- Rozpoznání DIČ pumpy, času, částky, způsobu platby
- Automatické dělení DPH u PHM
Faktury za SaaS a zahraniční dodavatele
- Měna, kurz, reverse charge návěští
- IBAN/BIC a kontrola formátů
Nákup materiálu a stavebniny
- Položky po řádcích, MJ, slevy
- Sazby 21/12/10 % správně rozdělené
Integrace s e-fakturou a ISDOC: proč je to ještě přesnější
Když místo skenu dostaneš strukturovaný formát (ISDOC, e-faktura), přesnost je skoro na 100 %. OCR pak slouží spíš jako kontrola a doplnění. V Doklad.ai zvládneme oboje — nestrukturované PDF, fotky i ISDOC. A když se to zkombinuje, máš jistotu.
Kde dává smysl lidská kontrola a kde ne?
Kontroluj ručně, když
- částky nesedí po zaokrouhlení,
- jsou neobvyklé sazby nebo ruční korekce,
- jde o klíčové smluvní faktury s velkou částkou.
Nech to plně na systému, když
- dodavatel je opakovaný a historie sedí,
- doklad je jednoduchý (telefon, internet, SaaS),
- validace je čistě zelená.
Upřímně: spolehlivost roste s počtem dokladů. Po pár týdnech je to rutina.
Praktické tipy pro focení a skenování dokladů
- Polož doklad na kontrastní podklad, ať vynikne okraj
- Foť shora, ne ze strany, drž telefon v klidu
- Zkontroluj, že jsou v záběru všechny rohy
- Když je doklad pomačkaný, jemně ho vyhlaď dlaní
- U vícestránkových faktur vyfoť všechny listy, jasně
Jak se počítá „přesnost“ a co znamená v účetní praxi?
„Přesnost OCR“ může znamenat hodně věcí. U nás řešíme tři vrstvy:
- Rozpoznání znaků: kolik znaků je správně přečteno
- Správná extrakce polí: procento správně určených polí (datum, částka…)
- Transakční přesnost: kolik dokladů projde bez zásahu člověka
Pro byznys je nejdůležitější třetí metrika. Proto tolik tlačíme na validace a učení z oprav — ať projde co nejvíc dokladů rovnou do účtování.
OCR rozpoznávání dokladů v Doklad.ai: závěr s jasným verdiktem
OCR rozpoznávání dokladů není jen „čtečka textu“. Je to kombinace chytré optiky, strojového učení a účetních pravidel. Díky tomu je přesné, rychlé a šetří nervy i peníze. Jestli chceš méně přepisování a víc hotové práce, tohle je ta cesta. Přesně.
---
Časté otázky
Jak funguje OCR na rozmazané nebo pomačkané účtence?
OCR předzpracuje obrázek (narovnání, odšumění, zvýšení kontrastu) a pak běží extrakce textu. Pokud je část textu nečitelná, validace zvýrazní sporná pole, aby sis je rychle opravil.
Umí OCR rozpoznat variabilní symbol a spárovat platbu?
Ano. Variabilní symbol hledáme podle kontextu (číslo faktury, VS, QR platební kód) a následně párujeme s bankou. Když sedí částka i protiúčet, spárování proběhne automaticky.
Co když mám vícestránkovou fakturu nebo přílohy?
Nahraj všechny stránky. Systém je spojí, vytěží data z hlavní části a přílohy uloží k dokladu. Nic se neztratí a kontrolní součty se počítají přes hlavní výkaz.
Jak je to s DPH sazbami 21/12/10 % a zaokrouhlením?
OCR vytěží položky a jejich sazby, potom kontrolujeme součty po sazbách a aplikujeme pravidla zaokrouhlení. Pokud částky nesedí, dostaneš jasné upozornění s návrhem opravy.
Je moje data bezpečná a splňujete GDPR?
Ano. Data šifrujeme při přenosu i v úložišti, máme auditní logy a přístupová práva. Tréninkové datasety anonymizujeme, takže se osobní údaje do učení nedostanou.
Jak si OCR poradí s cizími jazyky a měnami?
Podporujeme vícejazyčný OCR model a rozpoznání měn (CZK, EUR atd.). Kurzy a daňová pravidla řešíme podle data a typu transakce. U běžných zahraničních dodavatelů je přesnost vysoká.