Computer vision pro účtenky — jak AI čte papírové doklady
· Bc. Kateřina Svobodová · ai
Computer vision pro účtenky bez magie a chyb. Jak AI vytáhne data z pomuchlané účtenky, předkontuje a připraví k zaúčtování. Rychle, přesně, bez nervů.
Computer vision pro účtenky — jak AI čte papírové doklady
Sedíš nad hromadou pomuchlaných účtenek z benzínky a říkáš si: jak tohle někdy dostanu do účetnictví? Fleky od kávy, šikmý tisk, půlka textu pryč. Klasika. A přesto z toho Doklad.ai během pár vteřin vytáhne DPH, částku i dodavatele. Jak? Computer vision pro účtenky. Přesně.
Co vlastně znamená „computer vision pro účtenky“ a proč tě to má zajímat?
Computer vision pro účtenky je kombinace OCR, strojového učení a chytrých pravidel, která z fotky nebo PDF vyextrahuje strukturovaná data. Ne jen text. Smysluplná pole: datum, IČO, variabilní symbol, základ a DPH, měna, položky, platební metoda. Proč tě to zajímá? Protože místo přepisu a kontrol můžeš účtenky prostě vyfotit, zkontrolovat návrh a potvrdit. Hotovo.
💡 Tip: Foť účtenky hned na místě. Čerstvá účtenka = čitelná účtenka. Vyhneš se vybledlým páskům z termopapíru, které po týdnu mizí jak ranní mlha.
Jak AI čte papírové doklady krok za krokem?
AI v Doklad.ai neprojíždí účtenku jen jedním OCR. Je to vícestupňová pipeline, která kombinuje počítačové vidění, NLP a účetní logiku.
1) Příprava obrazu: zarovnání, odšumění, kontrast
- Detekce hran účtenky a perspektivní korekce (aby z šikmé fotky vznikl rovný obdélník)
- Odstranění šumu, zvýšení kontrastu, binarizace pro slabý tisk
- Segmentace tmavých fleků a stínů, aby OCR nečetl „artefakty“ jako nuly
2) OCR: rozpoznání textu, čísel a symbolů
- Moderní OCR modely naučené na českých i vícejazyčných účtenkách
- Detekce více fontů, dotisků, teček a čárek u čísel
- Zvládnutí termotisků, nízké kvality i přetržených řádků
3) Detekce struktur: logické zóny účtenky
- Rozvržení do bloků: hlavička, tělo, součty, patička
- Vytěžení tabulky položek (název, množství, cena, sazba DPH)
- Chytré spojování rozdělených řádků a přenosů přes okraj
4) Sémantika: pochopení významu dat
- Rozpoznání dodavatele přes IČO, DIČ, názvy a známé vzory
- Normalizace dat: formáty datumu, měny, VS/SS/KS
- Validace DPH pomocí kontrolních součtů (základ + sazba = DPH = celkem)
5) Účetní logika: návrh předkontace a párování
- Mapování k nákladovým kategoriím (PHM, kancelář, stravné…)
- Detekce platební metody (hotově/kartou) z textu i QR kódu
- Přiřazení k projektu nebo zakázce podle klíčových slov
6) Učení z tvojí praxe: personalizace
- Tvoje opravy = nové pravidlo. Příště trefa napoprvé.
- Dodavatelé a sazby se „naučí“ preferované účty a výchozí DPH
- Lepší výsledky s každou další účtenkou
Co všechno umíme z účtenky vytáhnout a jak přesně to je?
Nejde jen o „text“. Důležitá je přesnost a jistota modelu. Když si AI není jistá, zvýrazní pole k ruční kontrole. Férově.
- Dodavatel: název, IČO, DIČ, adresa
- Datum vystavení a datum úhrady (když je uvedeno)
- Částky: základ, DPH, celkem; sazby 21/12/10 % i reverse charge detekce textem
- Měna a kurz (z textu, symbolů a kontextu)
- Položky: název, množství, jednotka, jednotková cena, sazba DPH
- Platební metoda: hotově, karta, převod; poznáno z textu a částí bloku
- Identifikátory: EET/účtenka ID, VS/SS, číslo dokladu
💡 Tip: Když fotíš vícestránkový doklad, vyfoť i stranu se součty. Bez nich ti to AI nepustí do účetnictví, protože neprojde kontrolní součet.
Je computer vision lepší než „obyčejné“ OCR? Tady je srovnání
| Řešení | Co dělá | Přesnost na reálných účtenkách | Umí položky | Návrh předkontace | Učení z oprav | Náklady/čas |
|---|---|---|---|---|---|---|
| Ruční přepis | Píšeš do políček | Vysoká, ale pomalá a chybovost roste s únavou | Ano (ručně) | Ano (ručně) | Ne | Pomalé, drahé na lidský čas |
| Jednoduché OCR | Převede obraz na text | Nízká–střední, nerozumí layoutu | Ne | Ne | Ne | Rychlé, ale hodně ručních zásahů |
| Computer vision + AI (Doklad.ai) | Rozumí layoutu a kontextu | Vysoká, validuje součty a sazby | Ano (automaticky) | Ano (návrh) | Ano | Rychlé, škálovatelné, méně chyb |
Jasně, nic není stoprocentní. Ale moderní computer vision pro účtenky posouvá extrakci z „textu“ na „data připravená k zaúčtování“. To je ten rozdíl.
Jak docílíme přesnosti, i když je účtenka pomačkaná nebo šikmá?
Šikovná kombinace robustních modelů a sanity checků. A pár vychytávek z praxe.
Robustní modely
- Trénink na reálných českých dokladech: čerpací stanice, restaurace, hobby markety, e‑shopy
- Augmentace: mačkání, šum, stín, nízké DPI, zkreslení, různé tiskárny
- Detekce vícejazyčných šablon (CZ, SK, EN, DE) a různých symbolů měn
Sanity checky a validace
- Kontrolní součet: základ + DPH = celkem, tolerance u zaokrouhlení
- Shoda sazeb v položkách vs. rekapitulace DPH
- Shoda IČO/DIČ s rejstříky a známými dodavateli (pokud se připojíš)
Když se model „sekne“, nezakecáme to
- Pole se sníženou jistotou zvýrazníme k potvrzení
- Navrhneme dvě varianty rozpoznání, ty zvolíš správnou
- Oprava se uloží, příště už to trefíme
Co z toho máš v účetnictví konkrétně ty?
Tři věci: rychlost, méně chyb a lepší přehled.
- Zpracuješ 50 účtenek za 10 minut. Bez heroických výkonů.
- Zmizí opakované překlepy v částkách a DPH.
- Položky máš v nákladových kategoriích, reporty dávají smysl.
- Předkontace tě postrčí správným směrem. Ne diktát, návrh.
- Párování plateb je rychlejší, protože identifikátory i částky sedí.
Jak to celé zapadne do tvého workflow v Doklad.ai?
1) Zachyť účtenku
- Mobilem přes aplikaci, nebo nahraj PDF/obrázek
- Můžeš poslat i e‑mailem na svou sběrnou adresu
2) AI vytěží data a navrhne předkontaci
- Uvidíš přehledově vyplněná pole
- Nejistá pole máš označená k potvrzení
3) Zkontroluj a potvrď
- Projdi součty, kategorii a DPH
- U položek uprav kategorie, pokud chceš detailnější analytiku
4) Zaúčtuj a spáruj
- Tlačítko „Zaúčtovat“ a je to v deníku
- Platby se spárují přes variabilní symbol, číslo dokladu nebo částku
Bezpečnost a soukromí: co se děje s tvými doklady?
Hele, účetní data jsou citlivá. Tečka. Proto:
- Šifrování v klidu i při přenosu
- Přístupová práva po uživatelích a firmách
- Auditní logy na změny a přístupy
- Modely učíme na anonymizovaných vzorcích a se souhlasem
- Možnost smazání zdrojového obrazu po vytěžení (volitelné)
Kdy AI září a kdy je lepší lidské oko?
AI vítězí
- Standardní retail účtenky, pokladní pásky, doklady z e‑shopu
- Jasné součty, standardní sazby DPH, čitelné položky
- Opakující se dodavatelé a šablony
Pozor, chce to kontrolu
- Ručně psané doklady nebo extrémně vybledlý tisk
- Složitá vícestránková vyúčtování s korekcemi
- Exotické měny a kombinace s dobropisy na jedné stránce
💡 Tip: U komplikovaných dokladů si zapni „přísnější validaci“. Systém pak bez potvrzení neprojde položky ani součty. Méně rizika, o chlup víc kliků.
Integrace: účtenky nejsou ve vzduchoprázdnu
- Import bankovních výpisů pro rychlé párování
- Propojení s e‑shopem a e‑mailem pro automatické chytání PDF účtenek
- Exporty do formátů pro daňové poradce a účetní (XML/ISDOC/CSV)
- API pro vlastní automatizace (schvalování, projekty, schránky)
Praktické scénáře, kde ti computer vision pro účtenky ušetří hodiny
Firemní karty
Každý kolega má kartu, každý má i povinnost fotit účtenky. AI je spáruje s pohybem na účtu, navrhne kategorii „Reprezentace“ vs. „Stravné“ podle textu. Ty jen kontroluješ.
PHM a cestovky
Tankování, myčka, dálniční známky. Model pozná PHM a přiřadí do „Silniční doprava“ s odpovídající sazbou DPH. Cestovní příkazy? Účtenku jen připojíš k jízdě.
Kancelář a drobný materiál
Hobby market, elektro, papírnictví. Položková extrakce ti umožní mít přesné kategorie a hlídat rozpočet. Fajn na cash flow.
Nejdůležitější metriky: co si hlídat, když hodnotíš kvalitu
- Přesnost polí (precision) na IČO, DPH, částce celkem
- Recall u položek (kolik jich zachytíme správně)
- Confidence score a procento polí vyžadujících potvrzení
- Míra automatického zaúčtování (kolik dokladů projde „na jeden klik“)
- Průměrný čas zpracování na doklad
Časté mýty o OCR a účtenkách, které ti ušetří nervy
- „OCR je OCR, všude stejné.“ Není. Rozdíl je v layoutovém a sémantickém porozumění.
- „Stačí mi text, čísla doplním.“ A pak trávíš čas laděním zaokrouhlení a DPH.
- „AI si vymýšlí.“ Ne u nás. Když si není jistá, ptá se. Když chybí součet, neprojde.
Jak rychle to rozběhneš v praxi? Mini‑checklist
- Připrav si přístup pro kolegy a role (kdo může zaúčtovat)
- Zapni automatické odesílání účtenek z e‑mailu
- V appce povol „návrh předkontace“ a „učení z oprav“
- Projdi první týdenem: 100 účtenek = kvalitní personalizace
- Nastav pravidla pro projekty a kategorie podle oddělení
Co říká praxe po 15 letech v účetnictví
Když firmy přejdou z ručního přepisu na computer vision pro účtenky, první měsíc šetří hlavně čas. Druhý měsíc klesají chyby v DPH. A třetí měsíc se konečně dívají na reporty, které dávají smysl. Protože data jsou čistá a položky sedí. No a to je přesně to, co chceš.
Závěr: Computer vision pro účtenky ti uvolní ruce
Papírky už nemusí vládnout tvému času. Computer vision pro účtenky v Doklad.ai vytěží data, navrhne předkontaci a pomůže spárovat platby. Ty uděláš finální klik a jdeš dělat byznys. Chceš vidět, jak to běží na tvých dokladech? Nahraj pár účtenek a zkus to.
Časté otázky
Jak přesně AI rozpozná DPH na pomačkané účtence?
Kombinujeme OCR s detekcí layoutu a validací součtů. Pokud rekapitulace DPH chybí nebo nesedí, pole označíme k potvrzení a nepustíme doklad do zaúčtování bez kontroly. U rozmazaných částek navrhujeme dvě varianty.
Umí systém vytěžit i položky, ne jen celkovou částku?
Ano. Rozpoznáváme tabulky položek, množství, jednotky a sazby DPH. Když jsou položky rozdělené přes řádek, model je spojuje a kontroluje vazbu na rekapitulaci DPH, aby součty seděly.
Co když je účtenka v angličtině nebo ze Slovenska?
Podporujeme vícejazyčné šablony a měny. Dodavatele identifikujeme přes IČO/DIČ, případně názvy a vzory. U SK účtenek se zvlášť hlídá formát DIČ a sazby.
Jak funguje učení z mých oprav?
Každá tvoje oprava se uloží jako signál. Model i pravidla si pamatují kategorie, sazby a chování pro stejného dodavatele. Příště ti nabídneme lepší návrh předkontace i rozdělení položek.
Je možné účtenky rovnou spárovat s platbou z banky?
Ano. Párujeme podle částky, datumu a identifikátorů (VS/číslo dokladu). U karetních transakcí pomáhá i text z účtenky a popisu transakce. Neshody systém zvýrazní k ručnímu dořešení.
Co když nechci, aby se moje doklady používaly k tréninku AI?
Můžeš to vypnout v nastavení. U nás je trénink na anonymizovaných datech a jen se souhlasem. Data zpracováváme v souladu s právními požadavky a můžeš požádat o smazání zdrojových obrázků po vytěžení.