AI funkce

Machine learning v detekci účetních podvodů: jak ti opravdu pomůže

Machine learning v detekci účetních podvodů bez bullshitu: co hlídá, jak se učí, jak ho zapnout v Doklad.ai a jak si nespálit prsty falešnými poplachy.

Mgr. Jan Novák
9 min čtení
1 zobrazení
machine learning
detekce podvodů
účetnictví
AI v účetnictví
interní kontrola

Sedíš nad výpisem a říkáš si: „Tohle je asi v pohodě… nebo není?“ A do toho deadline DPH, klient volá a kafe studený. Přesně tyhle chvíle jsou voda na mlýn pro machine learning v detekci účetních podvodů. Ne proto, že kouzlí. Ale proto, že neúnavně hlídá nuance, které ti po desáté faktuře snadno utečou.

Co přesně znamená machine learning v detekci účetních podvodů?

Machine learning v detekci účetních podvodů je soubor statistických a pravděpodobnostních modelů, které se učí z tvých účetních dat rozpoznat podezřelé vzorce. Nemluvíme o sci‑fi. Mluvíme o praktickém filtru, který ti ukáže, kam se podívat dřív, než se něco zvrtne.

  • Sleduje odchylky od „normálního“ chování u faktur, plateb, nákladů a kontaktů.
  • Kříží informace napříč dodavateli, kategoriemi, obdobími a platebními metodami.
  • Učí se z historie: co jsi jednou označil jako ok, má váhu. Co jsi opravil, má ještě větší.
  • Proč to funguje? Protože čísla lžou konzistentně jen málokdy. Když se děje něco divného, vzorec se zlomí. A přesně to ML uvidí dřív než běžná pravidla.

    Tip: Hledej systém, který kombinuje pravidla (např. „duplikát čísla faktury“) a ML skóre. Tahle dvojka chytá jak banální chyby, tak rafinovanější triky.

    Jaké typy podvodů ML odhalí nejlépe?

    Jasně, „podvod“ zní tvrdě. Ale mezi falešnou fakturou a nevinným překlepem je tenká čára. ML ti pomůže rozlišit, co má prioritu.

    Neobvyklé částky a načasování

  • Faktury těsně pod limity schvalování (např. 49 900 Kč opakovaně).
  • Platby v netypickou hodinu (pátek 23:41?) nebo těsně před závěrkou.
  • Nárůst frekvence u konkrétního dodavatele bez objektivního důvodu.
  • Duplikáty a „téměř“ duplikáty

  • Stejné IČ a částka, jiné číslo faktury.
  • Stejný variabilní symbol, upravené datum.
  • Faktury se shodnými řádky a jinou sazbou DPH.
  • Falešní nebo zneužití dodavatelé

  • Nový dodavatel bez historie s neobvykle velkou první fakturou.
  • Shoda bankovního účtu s jiným, nesouvisejícím subjektem.
  • Časté změny účtů u stejného dodavatele.
  • DPH a kategorie mimo očekávání

  • Zboží/služba typicky s 21 % náhle za 12 %.
  • Nákladová kategorie, kterou u tebe firma nikdy nepoužívá.
  • Self-billing či reverse charge účtovaný „nějak jinak“.
  • Tip: Když systém ukáže 5–10 položek týdně, které si zaslouží pozornost, jsi na zlaté střední cestě. Více = zahlcení. Méně = slepá místa.

    Jak se model učí na účetních datech bezpečně a správně?

    Chceš kvalitu? Začni daty. ML bez pořádných dat je jako účetnictví bez dokladů. Prostě ne.

    Data: co vzít a co radši ne

  • Vstupy: faktury (položky, sazby DPH, dodavatelé), bankovní výpisy, párování plateb, adresář kontaktů, kategorie, schvalovací stopy.
  • Metainformace: kdo schválil, kdo upravil, jak dlouho trvala úhrada, odkud upload (OCR, ruční, import).
  • Citlivá data: IBAN, IČ, DIČ — ano, ale s řízeným přístupem, logováním a šifrováním.
  • Feature engineering: jak z čísel vyrobit signál

  • Statistické odchylky: z‑skóre částek podle dodavatele a kategorie.
  • Časové vzorce: sezónnost, denní doba, dny před a po závěrce.
  • Síťové vztahy: sdílené účty, opakující se variabilní symboly napříč kontakty.
  • Text: podobnost popisů položek (embeddingy) a klíčových slov („bonus“, „záloha“, „dobropis“).
  • Trénink: co a jak učíme

  • Supervised učení: pokud máš labely (podvod/ok), vyplatí se gradient boosting nebo logistická regrese s regulací. Přehledné a vysvětlitelné.
  • Unsupervised/anomálie: Isolation Forest, One‑Class SVM, autoencodery pro odchylky, když labely nemáš nebo jsou vzácné.
  • Hybrid: základní anomálie + lehká nadstavba s učitelem na potvrzených případech.
  • Validace a metriky

  • Precision (kolik alertů je opravdu trefa) a recall (kolik skutečných průšvihů ti neuteče). Potřebuješ kompromis. Extrém? 100% recall = povodeň falešných poplachů.
  • AUC‑PR pro nerovnováhu tříd (podvodů je málo). Zapomeň na samotné accuracy.
  • Cost‑based metrika: zohledni cenu falešného poplachu vs. cenu neodhaleného podvodu.
  • Ochrana soukromí a právo

  • Minimalizace: ber jen data, která zvedají predikční sílu. Zbytek pryč.
  • Pseudonymizace: pro trénink používej hashované identifikátory, když to dává smysl.
  • Audit: každé rozhodnutí by mělo jít vysvětlit. Aspoň na úrovni „tenhle rys zvýšil skóre o X“.
  • Jak ML nasadíš v praxi v Doklad.ai krok za krokem

    Hele, teorie fajn. No a co teď? Takhle to uděláš v malý firmě nebo u OSVČ rozumně, bez orchestrálního projektu.

    1) Zapni chytrou kontrolu a nastav prahy

  • Aktivuj detekci anomálií a pravidelné kontroly v nastavení účtu.
  • Zvol úroveň citlivosti (nízká/střední/vysoká) a maximální počet alertů týdně.
  • Urči, co je „tvrdé blokování“ (např. platba neproběhne bez druhého oka) a co je jen upozornění.
  • 2) Označ prvních 50–100 položek

  • Proklikni list alertů a dávej rychlé štítky: „OK“, „Podezřelé“, „Chyba v datech“.
  • Tohle je palivo pro supervised vrstvu. Rychlé, 10–15 minut.
  • 3) Propoj banku a zaveď párovací pravidla

  • Napoj IBANy a zapni automatické párování plateb.
  • Vytvoř 3–5 jednoduchých pravidel (např. variabilní symbol = číslo faktury), ať má ML čistší signál.
  • 4) Schvalování podle rizika

  • Nízké riziko: auto‑schválení.
  • Střední riziko: kontrola účetní.
  • Vysoké riziko: druhý schvalovatel + zákaz platby do vyřešení.
  • 5) Týdenní rituál

  • Každé pondělí si otevři panel alertů.
  • Projdi top 10 rizik a ulož poznámky. Model se upraví. Tvoje práce se zhodnotí každým týdnem.
  • Tip: Vytvoř whitelist/blacklist dodavatelů. Důvěryhodní partneři sníží šum, opakovaní hříšníci dostanou vyšší základní skóre.

    Kdo má dělat co (v malém týmu)

  • Majitel/ka: nastaví politiku rizik (co je blokace, co je info).
  • Účetní: týdenní triáž alertů, uzavírá případy, učí model.
  • Operativa: dává kontext (proč je faktura výjimečná), taguje položky.
  • Jak vyhodnocovat alerty, ať tě systém nespálí

    Tady se láme chleba. Buď z toho bude parádní pomocník, nebo otravná notifikační mašina.

    Prioritizace podle dopadu

  • Kombinuj skóre rizika × částku × pravděpodobnost DPH dopadu.
  • Vysoké skóre u malé částky? Dáš do fronty. Střední skóre u velké částky? Řešíš hned.
  • Vysvětlitelnost na jeden řádek

    Každý alert by měl říct „proč“. Třeba:

  • „Částka je o 3,1 směrodatné odchylky vyšší než medián u dodavatele X.“
  • „Nový bankovní účet, který sdílí IBAN s jiným subjektem.“
  • „Popis položky je 92 % podobný dříve zablokované faktuře.“
  • Kombinace pravidel a modelu

  • Tvrdá pravidla: duplikát variabilního symbolu, DIČ na blacklistu, IBAN mimo EU – vždy blok.
  • ML skóre: jemná vrstva, která chytá odchylky a dá ti pořadí.
  • Nastavení prahů bez slz

  • Začni střední citlivostí.
  • Cíl: precision min. 40–60 % v prvních týdnech a recall 60–80 % na známých případech.
  • Týdně dolaď prahy o malé kroky (±5 %), sleduj dopad.
  • Rychlá rozhodovací matice (srovnání přístupů)

    PřístupCo umí skvěleKde selháváNáročnostDoporučení
    Pouze ruční kontrolaKontext, intuiceÚnava, slepá místaVysokáMalé objemy, ad‑hoc
    Pravidla (if‑then)Jednoznačné chybyObejitelné, křehkéNízká–středníZáklad, musí být
    ML anomálieOdchylky, vzorcePotřebuje kalibraciStředníHledání jehel v kupce sena
    Hybrid (pravidla+ML)Balanc přesnostiVyžaduje procesStředníBest practice pro SME
    Tip: Ať je každý alert uzavřen statusem: „Potvrzeno“, „Falešný poplach“, „Chyba dat“. Bez toho se model nepolepší.

    Kdy ML nestačí: limity, etika a zdravý rozum

    ML není soudce. Je to parťák, co ukáže prstem.

    Limity, se kterými počítej

  • Drifty v datech: změníš ceník, začne nová kampaň, přijde akvizice. Model pár týdnů kulhá.
  • Raritní podvody: jednorázové, vysoce sofistikované akce často neprojdeš bez lidského oka.
  • Šum z OCR: špatně přečtené číslo = zbytečný alert. Čisti vstupy.
  • Etika a compliance

  • Nepřipisuj zlý úmysl bez důkazu. Alert je pozvánka k otázce, ne rozsudek.
  • Loguj kroky: kdo změnil IBAN, kdo schválil. Prevence funguje líp než detekce.
  • Měj politiku oznamování: jak naložíš s podezřením interně i vůči partnerům.
  • Kdy zůstat u pravidel

  • Mikro podnik s <100 doklady/měsíc a stabilními dodavateli.
  • Když nemáš kapacitu uzavírat alerty (ML bez feedbacku stagnuje).
  • V přechodném období, než posbíráš prvních 3–6 měsíců dat.

  • Časté otázky

    Jak nastavím machine learning v detekci účetních podvodů, když mám málo dat?

    Začni hybridem: pravidla + lehká anomální detekce. Nastav konzervativní prahy a sbírej štítky na prvních 100–200 dokladech. Jakmile máš historii 3–6 měsíců, model zpřesni a zvedni citlivost.

    Co když mi systém hází moc falešných poplachů?

    Sniž citlivost, přidej whitelist důvěryhodných dodavatelů a vyčisti OCR chyby. Sleduj precision/recall a uprav prahy o malé kroky. Po týdnu zkontroluj dopad a drž se cíle: méně než 10 alertů na 100 dokladů.

    Odhalí ML i chyby v DPH sazbách a reverse charge?

    Ano, zvlášť pokud model dostane kontext kategorií a historie sazeb u daného dodavatele. Kombinace pravidla (validace DIČ, typ plnění) a ML skóre dává nejlepší výsledky. U RC měj tvrdé bloky.

    Může ML zabránit odeslání podezřelé platby?

    Když nastavíš „tvrdé blokování“ pro vysoké riziko, platba čeká na druhé schválení. To je nejlepší praxe: ML navrhne, člověk potvrdí. Předejdeš omylům i podvodům.

    Jaké metriky mám sledovat, abych věděl, že to funguje?

    Precision, recall, počet alertů na 100 dokladů, průměrný čas uzavření alertu a finanční dopad odvrácených chyb/podvodů. Jednou měsíčně si je projdi v reportu a uprav nastavení.

    Neporuším GDPR, když budu trénovat model na bankovních datech?

    Ne, pokud dáš důraz na minimalizaci dat, šifrování, přístupová práva a auditní logy. Citlivé identifikátory můžeš pseudonymizovat. V Doklad.ai tohle řešíme vestavěně.


    Závěrem: Proč teď dát šanci machine learningu v detekci účetních podvodů

    Chceš klidnější spánek? Dejte ML jasná pravidla, trochu času a poctivý feedback. Odmění se tím, že vytáhne na světlo věci, které by ti jinak proklouzly. Machine learning v detekci účetních podvodů není zázračná skříňka, ale spolehlivý filtr. A přesně tak ho v Doklad.ai stavíme: aby ti šetřil čas, peníze a nervy.

    Přečtěte si také

    Využijte umělou inteligenci pro automatizaci vaší fakturace.

    Související články

    Užitečné nástroje