AI funkce

OCR rozpoznávání dokladů — jak funguje a proč je přesné

OCR rozpoznávání dokladů bez bolesti: jak funguje, proč je přesné a jak ti ušetří hodiny při účtování faktur a účtenek.

Ing. Martin Procházka
11 min čtení
13 zobrazení
OCR
doklady
faktury
strojové učení
automatické účtování

Sedíš nad hromadou účtenek a říkáš si: „Tohle přece nemůžu přepisovat ručně.“ Jo, souhlas. Taky tě nebaví hledat DIČ v rozmazané fotce z benzínky? OCR rozpoznávání dokladů ti tohle peklíčko vyžehlí. A my si řekneme, jak to celé kouzlo funguje a proč je dnes fakt přesné. Prostě bez čar, jen chytrá matematika a trénované modely.

Co přesně znamená OCR rozpoznávání dokladů a proč tě má zajímat?

OCR (Optical Character Recognition) je technologie, která z fotek a PDF vytáhne text a promění ho na strukturovaná data. U dokladů to znamená: částky, DPH, variabilní symbol, datum zdanitelného plnění, měnu, IČO, IBAN, položky… Jasně, že to chce víc než „jen“ přečíst písmenka. Klíč je chápat kontext dokladů.

Tip: Pokud děláš účetnictví sám nebo ve dvou, OCR rozpoznávání dokladů ti reálně ušetří desítky hodin měsíčně. A k tomu méně chyb. Win–win.

No a co teď? Pojďme k jádru. Jak ta mašina ví, že „12/2026“ je datum a ne číslo položky? A proč je OCR v Doklad.ai tak přesné i u pokrčené účtenky z auta?

Jak funguje pipeline: od nečitelné fotky k připravené faktuře

1) Předzpracování obrazu: ať je z čeho číst

  • Otočení, ořez, narovnání perspektivy (aby nebyl doklad „křivý“)
  • Odstranění šumu a zvýšení kontrastu
  • Binarizace a segmentace do bloků (textové zóny, tabulky, položky)
  • Detekce jazyka a kódujících znaků (čeština, diakritika, měnové symboly)
  • Tady se rozhoduje, jestli bude OCR jen „hádat“, nebo číst s jistotou. Špatné světlo? Nevadí, když se správně dopočítá prahování a odhadnou okraje.

    2) Textová extrakce: přečti písmena a čísla

  • Moderní OCR enginy používají CNN/LSTM modely
  • Detekují řádky, znaky, fonty i rotace
  • Umí multisloupcové layouty a cizí jazyky
  • Výsledek je „surový“ text s pozicemi. Nicméně: vědět, že někde stojí „2026-05-31“ je fajn, ale ještě nevíme, že je to datum splatnosti.

    3) Vytěžování dokladů: z textu děláme pole faktury

  • Entity detection: IČO, DIČ, IBAN, číslo účtu, VS, SS, KS
  • Datumové typy: vystavení, zdanitelné plnění, splatnost
  • Částky: základ DPH, DPH, celkem, sazby 21/12/10 %, rounding
  • Položky: název, množství, jednotka, cena bez/ s DPH, sazba DPH
  • Kombinujeme pravidla (regexy, kontrolní součty) a modely učení (NER, klasifikace polí). A teď to zásadní – validace.

    4) Validace a kontrolní logika: ověř, že to sedí

  • Kontrola součtů: základ + DPH = celkem (po zaokrouhlení)
  • Křížové vazby: variabilní symbol = číslo faktury? Často ano.
  • DIČ/IČO: ověření formátu a existence (ARES/VIES, když to dává smysl)
  • Datumová logika: splatnost po vystavení, DPH sazby dle období
  • Měna a kurz: CZK/EUR/PLN a přepočty podle data
  • Tip: Když doklad chybí stránka nebo má dvě různé měny, automatická validace tě upozorní. V Doklad.ai vidíš červené vlajky rovnou u pole.

    5) Učení z oprav: čím víc jedeš, tím chytřejší to je

  • Systém si pamatuje tvoje dodavatele a vzory
  • Přizpůsobí mapování položek na tvůj ceník a účty
  • Snižuje počet manuálních zásahů po pár importech
  • Přesně. Po páté faktuře od stejného dodavatele je trefa skoro stoprocentní.

    Proč je OCR rozpoznávání dokladů dnes tak přesné?

    Krátká odpověď: protože to už není jen OCR. Je to kombinace kvalitního obrazu, modelů strojového učení a účetní logiky. A to je ten důvod, proč si OCR rozpoznávání dokladů poradí i s účtenkou z termosublimační tiskárny z pumpy.

    Lepší modely, lepší data

  • Trénujeme na českých fakturách a účtenkách (diakritika, sazby DPH, české zkratky)
  • Používáme syntetické datasety (generované šablony + šum) a reálné anonymizované doklady
  • Fine-tuning pro dodavatele s atypickým layoutem
  • Kontext nad textem

  • Rozpoznávání vzorů rozložení (layout LM, vizuální NER)
  • Pravděpodobnostní model: „částka vedle slova Celkem“ > „random číslo uprostřed“
  • Vázání polí: datum splatnosti bývá po vystavení, ne před ním
  • Kontroly, které tě zachrání před chybou

  • Hlídání sazeb 21/12/10 % a osvobození
  • Detekce zaokrouhlení hotovosti
  • Duplicitní doklady podle hashů obsahu a klíčových polí
  • Jak si stojí různé přístupy k OCR u dokladů?

    Níže máš rychlé srovnání přístupů, se kterými se v praxi potkáš.

    PřístupPopisPřesnost na fakturáchCitlivost na kvalitu fotkyNáročnost nasazení
    Čisté OCR bez kontextuPřečte text, bez chápání polí60–80 %VysokáNízká
    OCR + pravidla (regexy)Přiřazuje čísla podle vzorů80–90 %StředníStřední
    Vizuální NER + pravidlaRozumí layoutu a kontextu90–97 %Nízká–středníStřední–vyšší
    End-to-end ML (doklad→JSON)Kompletní model se self-checky93–99 %NízkáVyšší

    Upřímně? Samotné OCR bez kontextu je na účtenky krátké. Potřebuješ minimálně kombinaci pravidel a učení. Proto má Doklad.ai pipeline, která spojuje to nejlepší z obou světů.

    Kdy OCR chybí a jak chyby minimalizujeme?

    Hele, žádná magie. Jsou situace, kdy to zadrhne:

  • Rozmazané fotky a odlesky
  • Extrémně malý font a nízký kontrast
  • Neobvyklé sazby, ruční škrty, razítka přes text
  • Ručně psané doklady (paragon tužkou)
  • Jak na to jdeme:

  • Adaptivní prahování, odhad perspektivy, odšumění
  • Ensemble vícero OCR enginů a slovníky pravděpodobných tokenů
  • Agregace důkazů: pokud tři signály tvrdí „variabilní symbol“, bereme to
  • Interaktivní validace: uživatel potvrdí sporné pole jedním klikem
  • A když si nejsme jistí? Řekneme to nahlas. Lepší žlutý vykřičník než tichá chyba v DPH.

    Co přesně vytěžíme z faktur a účtenek?

    Hlavní pole faktury

  • Dodavatel: název, IČO, DIČ, adresa
  • Odběratel: tvoje data, kontrola shody s profilem
  • Čísla: číslo faktury, variabilní symbol, objednávka
  • Data: vystavení, zdanitelné plnění, splatnost
  • Částky: základ, DPH, celkem, členění podle sazeb
  • Banka: IBAN, BIC, číslo účtu, QR platba
  • Měna a kurz
  • Položky a sazby DPH

  • Název, množství, MJ, cena
  • Sazba DPH, kód skladové položky
  • Detekce řádkových slev
  • Účtenky (paragony)

  • Datum a čas nákupu
  • DIČ/IČO obchodníka, EET kód (historicky), ID pokladny
  • Celková částka, hotově/kartou
  • Místy i rozlišení položek (záleží na kvalitě tisku)
  • Skenování účtenky — živá ukázka
    Extrahovaná data:
    Dodavatel:
    Datum:
    Částka:
    DPH:
    Kategorie:

    Jak probíhá OCR rozpoznávání dokladů v Doklad.ai krok za krokem?

    Jednoduchý workflow

  • Nahraješ PDF nebo fotku v mobilu
  • Systém automaticky rozpozná typ (faktura, účtenka, zálohovka)
  • Do pár vteřin vidíš vyplněná pole a kontrolky kvality
  • Uložíš a rovnou vystavíš úhradu, nebo pošleš do účetnictví
  • Automatické párování plateb a validace

  • Variabilní symbol + částka + protiúčet = shoda
  • Bankovní napojení dočte úhrady a navrhne spárování
  • Hlídáme, aby částka na výpise seděla s „Celkem k úhradě“
  • Tip: Máš větší dávku PDF z mailu? Hodíš je do složky a hromadný import se postará. Duplicity odchytíme podle hashů a čísel dokladů.

    Co ovlivňuje přesnost OCR a jak si ji pohlídat?

    Na straně obrázku

  • Ostrost a světlo: vyhni se silným odleskům a protisvětlu
  • Rohy v záběru: kvůli korekci perspektivy
  • Kontrast: tmavé písmo na světlém pozadí je král
  • Na straně obsahu

  • Kompletní doklad (všechny stránky)
  • Čitelné položky a sazby DPH
  • Správně generovaný PDF (ne naskenovaný obrázek v mizerné kvalitě)
  • Na straně systému

  • Model vytrénovaný na českém prostředí
  • Validace s účetní logikou (sazby, součty, datumy)
  • Feedback loop: učení z oprav
  • A ještě názor: lepší mít 95 % automaticky + 5 % rychlé opravy, než 100 % ručně. Prostě.

    Jak OCR rozpoznávání dokladů šetří čas a peníze?

  • Méně ruční práce: z hodin na minuty
  • Méně chyb: kontrolní součty a formáty
  • Rychlejší uzávěrky: doklady jsou dřív připravené k zaúčtování
  • Lepší cash-flow: platby párujeme dřív, víš, co visí
  • Konkrétní čísla z praxe

  • Účtenka: 10–20 sekund místo 2–3 minut ručně
  • Faktura A4 s položkami: 30–60 sekund místo 5–8 minut
  • Hromadný import 100 dokladů: hotovo do 10–15 minut včetně kontrol
  • Napojení na účetnictví a DPH

  • Export do účetních systémů (XML/ISDOC/CSV)
  • Automatická předkontace podle dodavatele a typu výdaje
  • Členění DPH podle sazeb a režimů
  • Jak si vybrat OCR řešení pro firmu nebo účetní kancelář?

    Klíčové otázky, které si polož

  • Umí systém česky a sazby DPH 21/12/10 %?
  • Má validace součtů a hlídání duplicit?
  • Jak se učí z oprav? Zrychlí se po pár týdnech?
  • Jak funguje hromadný import a párování plateb?
  • Je jasná cena za stránku / doklad? Bez překvapení.
  • Co dělá rozdíl v praxi

  • Kvalita mobilní aplikace (rychlé focení, automatické ořezání)
  • Přehledná kontrola nespolehlivých polí (žluté/červené vlajky)
  • Podpora formátů: PDF, ISDOC, e-faktury, fotky
  • Bezpečnost a soukromí: jak chráníme tvoje doklady

  • Šifrování při přenosu i v úložišti (TLS, AES-256)
  • Oddělení dat mezi klienty, auditní logy
  • GDPR-ready správa souhlasů a doby uchování
  • Anonymizace pro trénink (bez osobních údajů a variabilních symbolů, které identifikují jedince)
  • Nemáme rádi překvapení. Transparentní logy a přístup jen pro oprávněné uživatele. Tečka.

    OCR rozpoznávání dokladů pro OSVČ vs. účetní tým: co se liší?

    OSVČ

  • Jednoduchost a rychlost
  • Mobilní focení, rychlé přijetí výdajů
  • Minimum nastavování, maximální automatika
  • Účetní tým

  • Hromadné dávky, schvalovací workflow
  • Přidělování dokladů, role a práva
  • Vícestupňová validace a exporty do více systémů
  • Reálné scénáře: kde OCR boduje

    Palivo a účtenky z cest

  • Rozpoznání DIČ pumpy, času, částky, způsobu platby
  • Automatické dělení DPH u PHM
  • Faktury za SaaS a zahraniční dodavatele

  • Měna, kurz, reverse charge návěští
  • IBAN/BIC a kontrola formátů
  • Nákup materiálu a stavebniny

  • Položky po řádcích, MJ, slevy
  • Sazby 21/12/10 % správně rozdělené
  • Integrace s e-fakturou a ISDOC: proč je to ještě přesnější

    Když místo skenu dostaneš strukturovaný formát (ISDOC, e-faktura), přesnost je skoro na 100 %. OCR pak slouží spíš jako kontrola a doplnění. V Doklad.ai zvládneme oboje — nestrukturované PDF, fotky i ISDOC. A když se to zkombinuje, máš jistotu.

    Kde dává smysl lidská kontrola a kde ne?

    Kontroluj ručně, když

  • částky nesedí po zaokrouhlení,
  • jsou neobvyklé sazby nebo ruční korekce,
  • jde o klíčové smluvní faktury s velkou částkou.
  • Nech to plně na systému, když

  • dodavatel je opakovaný a historie sedí,
  • doklad je jednoduchý (telefon, internet, SaaS),
  • validace je čistě zelená.
  • Upřímně: spolehlivost roste s počtem dokladů. Po pár týdnech je to rutina.

    Praktické tipy pro focení a skenování dokladů

  • Polož doklad na kontrastní podklad, ať vynikne okraj
  • Foť shora, ne ze strany, drž telefon v klidu
  • Zkontroluj, že jsou v záběru všechny rohy
  • Když je doklad pomačkaný, jemně ho vyhlaď dlaní
  • U vícestránkových faktur vyfoť všechny listy, jasně
  • Jak se počítá „přesnost“ a co znamená v účetní praxi?

    „Přesnost OCR“ může znamenat hodně věcí. U nás řešíme tři vrstvy:

  • Rozpoznání znaků: kolik znaků je správně přečteno
  • Správná extrakce polí: procento správně určených polí (datum, částka…)
  • Transakční přesnost: kolik dokladů projde bez zásahu člověka
  • Pro byznys je nejdůležitější třetí metrika. Proto tolik tlačíme na validace a učení z oprav — ať projde co nejvíc dokladů rovnou do účtování.

    OCR rozpoznávání dokladů v Doklad.ai: závěr s jasným verdiktem

    OCR rozpoznávání dokladů není jen „čtečka textu“. Je to kombinace chytré optiky, strojového učení a účetních pravidel. Díky tomu je přesné, rychlé a šetří nervy i peníze. Jestli chceš méně přepisování a víc hotové práce, tohle je ta cesta. Přesně.


    Časté otázky

    Jak funguje OCR na rozmazané nebo pomačkané účtence?

    OCR předzpracuje obrázek (narovnání, odšumění, zvýšení kontrastu) a pak běží extrakce textu. Pokud je část textu nečitelná, validace zvýrazní sporná pole, aby sis je rychle opravil.

    Umí OCR rozpoznat variabilní symbol a spárovat platbu?

    Ano. Variabilní symbol hledáme podle kontextu (číslo faktury, VS, QR platební kód) a následně párujeme s bankou. Když sedí částka i protiúčet, spárování proběhne automaticky.

    Co když mám vícestránkovou fakturu nebo přílohy?

    Nahraj všechny stránky. Systém je spojí, vytěží data z hlavní části a přílohy uloží k dokladu. Nic se neztratí a kontrolní součty se počítají přes hlavní výkaz.

    Jak je to s DPH sazbami 21/12/10 % a zaokrouhlením?

    OCR vytěží položky a jejich sazby, potom kontrolujeme součty po sazbách a aplikujeme pravidla zaokrouhlení. Pokud částky nesedí, dostaneš jasné upozornění s návrhem opravy.

    Je moje data bezpečná a splňujete GDPR?

    Ano. Data šifrujeme při přenosu i v úložišti, máme auditní logy a přístupová práva. Tréninkové datasety anonymizujeme, takže se osobní údaje do učení nedostanou.

    Jak si OCR poradí s cizími jazyky a měnami?

    Podporujeme vícejazyčný OCR model a rozpoznání měn (CZK, EUR atd.). Kurzy a daňová pravidla řešíme podle data a typu transakce. U běžných zahraničních dodavatelů je přesnost vysoká.

    Přečtěte si také

    Využijte umělou inteligenci pro automatizaci vaší fakturace.

    Související články

    Užitečné nástroje