Machine learning v detekci účetních podvodů: jak ti opravdu pomůže
· Redakce Doklad.ai · ai
Machine learning v detekci účetních podvodů bez bullshitu: co hlídá, jak se učí, jak ho zapnout v Doklad.ai a jak si nespálit prsty falešnými poplachy.
Machine learning v detekci účetních podvodů: jak ti opravdu pomůže
Sedíš nad výpisem a říkáš si: „Tohle je asi v pohodě… nebo není?“ A do toho deadline DPH, klient volá a kafe studený. Přesně tyhle chvíle jsou voda na mlýn pro machine learning v detekci účetních podvodů. Ne proto, že kouzlí. Ale proto, že neúnavně hlídá nuance, které ti po desáté faktuře snadno utečou.
Co přesně znamená machine learning v detekci účetních podvodů?
Machine learning v detekci účetních podvodů je soubor statistických a pravděpodobnostních modelů, které se učí z tvých účetních dat rozpoznat podezřelé vzorce. Nemluvíme o sci‑fi. Mluvíme o praktickém filtru, který ti ukáže, kam se podívat dřív, než se něco zvrtne.
- Sleduje odchylky od „normálního“ chování u faktur, plateb, nákladů a kontaktů.
- Kříží informace napříč dodavateli, kategoriemi, obdobími a platebními metodami.
- Učí se z historie: co jsi jednou označil jako ok, má váhu. Co jsi opravil, má ještě větší.
Proč to funguje? Protože čísla lžou konzistentně jen málokdy. Když se děje něco divného, vzorec se zlomí. A přesně to ML uvidí dřív než běžná pravidla.
💡 Tip: Hledej systém, který kombinuje pravidla (např. „duplikát čísla faktury“) a ML skóre. Tahle dvojka chytá jak banální chyby, tak rafinovanější triky.
Jaké typy podvodů ML odhalí nejlépe?
Jasně, „podvod“ zní tvrdě. Ale mezi falešnou fakturou a nevinným překlepem je tenká čára. ML ti pomůže rozlišit, co má prioritu.
Neobvyklé částky a načasování
- Faktury těsně pod limity schvalování (např. 49 900 Kč opakovaně).
- Platby v netypickou hodinu (pátek 23:41?) nebo těsně před závěrkou.
- Nárůst frekvence u konkrétního dodavatele bez objektivního důvodu.
Duplikáty a „téměř“ duplikáty
- Stejné IČ a částka, jiné číslo faktury.
- Stejný variabilní symbol, upravené datum.
- Faktury se shodnými řádky a jinou sazbou DPH.
Falešní nebo zneužití dodavatelé
- Nový dodavatel bez historie s neobvykle velkou první fakturou.
- Shoda bankovního účtu s jiným, nesouvisejícím subjektem.
- Časté změny účtů u stejného dodavatele.
DPH a kategorie mimo očekávání
- Zboží/služba typicky s 21 % náhle za 12 %.
- Nákladová kategorie, kterou u tebe firma nikdy nepoužívá.
- Self-billing či reverse charge účtovaný „nějak jinak“.
💡 Tip: Když systém ukáže 5–10 položek týdně, které si zaslouží pozornost, jsi na zlaté střední cestě. Více = zahlcení. Méně = slepá místa.
Jak se model učí na účetních datech bezpečně a správně?
Chceš kvalitu? Začni daty. ML bez pořádných dat je jako účetnictví bez dokladů. Prostě ne.
Data: co vzít a co radši ne
- Vstupy: faktury (položky, sazby DPH, dodavatelé), bankovní výpisy, párování plateb, adresář kontaktů, kategorie, schvalovací stopy.
- Metainformace: kdo schválil, kdo upravil, jak dlouho trvala úhrada, odkud upload (OCR, ruční, import).
- Citlivá data: IBAN, IČ, DIČ — ano, ale s řízeným přístupem, logováním a šifrováním.
Feature engineering: jak z čísel vyrobit signál
- Statistické odchylky: z‑skóre částek podle dodavatele a kategorie.
- Časové vzorce: sezónnost, denní doba, dny před a po závěrce.
- Síťové vztahy: sdílené účty, opakující se variabilní symboly napříč kontakty.
- Text: podobnost popisů položek (embeddingy) a klíčových slov („bonus“, „záloha“, „dobropis“).
Trénink: co a jak učíme
- Supervised učení: pokud máš labely (podvod/ok), vyplatí se gradient boosting nebo logistická regrese s regulací. Přehledné a vysvětlitelné.
- Unsupervised/anomálie: Isolation Forest, One‑Class SVM, autoencodery pro odchylky, když labely nemáš nebo jsou vzácné.
- Hybrid: základní anomálie + lehká nadstavba s učitelem na potvrzených případech.
Validace a metriky
- Precision (kolik alertů je opravdu trefa) a recall (kolik skutečných průšvihů ti neuteče). Potřebuješ kompromis. Extrém? 100% recall = povodeň falešných poplachů.
- AUC‑PR pro nerovnováhu tříd (podvodů je málo). Zapomeň na samotné accuracy.
- Cost‑based metrika: zohledni cenu falešného poplachu vs. cenu neodhaleného podvodu.
Ochrana soukromí a právo
- Minimalizace: ber jen data, která zvedají predikční sílu. Zbytek pryč.
- Pseudonymizace: pro trénink používej hashované identifikátory, když to dává smysl.
- Audit: každé rozhodnutí by mělo jít vysvětlit. Aspoň na úrovni „tenhle rys zvýšil skóre o X“.
Jak ML nasadíš v praxi v Doklad.ai krok za krokem
Hele, teorie fajn. No a co teď? Takhle to uděláš v malý firmě nebo u OSVČ rozumně, bez orchestrálního projektu.
1) Zapni chytrou kontrolu a nastav prahy
- Aktivuj detekci anomálií a pravidelné kontroly v nastavení účtu.
- Zvol úroveň citlivosti (nízká/střední/vysoká) a maximální počet alertů týdně.
- Urči, co je „tvrdé blokování“ (např. platba neproběhne bez druhého oka) a co je jen upozornění.
2) Označ prvních 50–100 položek
- Proklikni list alertů a dávej rychlé štítky: „OK“, „Podezřelé“, „Chyba v datech“.
- Tohle je palivo pro supervised vrstvu. Rychlé, 10–15 minut.
3) Propoj banku a zaveď párovací pravidla
- Napoj IBANy a zapni automatické párování plateb.
- Vytvoř 3–5 jednoduchých pravidel (např. variabilní symbol = číslo faktury), ať má ML čistší signál.
4) Schvalování podle rizika
- Nízké riziko: auto‑schválení.
- Střední riziko: kontrola účetní.
- Vysoké riziko: druhý schvalovatel + zákaz platby do vyřešení.
5) Týdenní rituál
- Každé pondělí si otevři panel alertů.
- Projdi top 10 rizik a ulož poznámky. Model se upraví. Tvoje práce se zhodnotí každým týdnem.
💡 Tip: Vytvoř whitelist/blacklist dodavatelů. Důvěryhodní partneři sníží šum, opakovaní hříšníci dostanou vyšší základní skóre.
Kdo má dělat co (v malém týmu)
- Majitel/ka: nastaví politiku rizik (co je blokace, co je info).
- Účetní: týdenní triáž alertů, uzavírá případy, učí model.
- Operativa: dává kontext (proč je faktura výjimečná), taguje položky.
Jak vyhodnocovat alerty, ať tě systém nespálí
Tady se láme chleba. Buď z toho bude parádní pomocník, nebo otravná notifikační mašina.
Prioritizace podle dopadu
- Kombinuj skóre rizika × částku × pravděpodobnost DPH dopadu.
- Vysoké skóre u malé částky? Dáš do fronty. Střední skóre u velké částky? Řešíš hned.
Vysvětlitelnost na jeden řádek
Každý alert by měl říct „proč“. Třeba:
- „Částka je o 3,1 směrodatné odchylky vyšší než medián u dodavatele X.“
- „Nový bankovní účet, který sdílí IBAN s jiným subjektem.“
- „Popis položky je 92 % podobný dříve zablokované faktuře.“
Kombinace pravidel a modelu
- Tvrdá pravidla: duplikát variabilního symbolu, DIČ na blacklistu, IBAN mimo EU – vždy blok.
- ML skóre: jemná vrstva, která chytá odchylky a dá ti pořadí.
Nastavení prahů bez slz
- Začni střední citlivostí.
- Cíl: precision min. 40–60 % v prvních týdnech a recall 60–80 % na známých případech.
- Týdně dolaď prahy o malé kroky (±5 %), sleduj dopad.
Rychlá rozhodovací matice (srovnání přístupů)
| Přístup | Co umí skvěle | Kde selhává | Náročnost | Doporučení |
|---|---|---|---|---|
| Pouze ruční kontrola | Kontext, intuice | Únava, slepá místa | Vysoká | Malé objemy, ad‑hoc |
| Pravidla (if‑then) | Jednoznačné chyby | Obejitelné, křehké | Nízká–střední | Základ, musí být |
| ML anomálie | Odchylky, vzorce | Potřebuje kalibraci | Střední | Hledání jehel v kupce sena |
| Hybrid (pravidla+ML) | Balanc přesnosti | Vyžaduje proces | Střední | Best practice pro SME |
💡 Tip: Ať je každý alert uzavřen statusem: „Potvrzeno“, „Falešný poplach“, „Chyba dat“. Bez toho se model nepolepší.
Kdy ML nestačí: limity, etika a zdravý rozum
ML není soudce. Je to parťák, co ukáže prstem.
Limity, se kterými počítej
- Drifty v datech: změníš ceník, začne nová kampaň, přijde akvizice. Model pár týdnů kulhá.
- Raritní podvody: jednorázové, vysoce sofistikované akce často neprojdeš bez lidského oka.
- Šum z OCR: špatně přečtené číslo = zbytečný alert. Čisti vstupy.
Etika a compliance
- Nepřipisuj zlý úmysl bez důkazu. Alert je pozvánka k otázce, ne rozsudek.
- Loguj kroky: kdo změnil IBAN, kdo schválil. Prevence funguje líp než detekce.
- Měj politiku oznamování: jak naložíš s podezřením interně i vůči partnerům.
Kdy zůstat u pravidel
- Mikro podnik s <100 doklady/měsíc a stabilními dodavateli.
- Když nemáš kapacitu uzavírat alerty (ML bez feedbacku stagnuje).
- V přechodném období, než posbíráš prvních 3–6 měsíců dat.
---
Časté otázky
Jak nastavím machine learning v detekci účetních podvodů, když mám málo dat?
Začni hybridem: pravidla + lehká anomální detekce. Nastav konzervativní prahy a sbírej štítky na prvních 100–200 dokladech. Jakmile máš historii 3–6 měsíců, model zpřesni a zvedni citlivost.
Co když mi systém hází moc falešných poplachů?
Sniž citlivost, přidej whitelist důvěryhodných dodavatelů a vyčisti OCR chyby. Sleduj precision/recall a uprav prahy o malé kroky. Po týdnu zkontroluj dopad a drž se cíle: méně než 10 alertů na 100 dokladů.
Odhalí ML i chyby v DPH sazbách a reverse charge?
Ano, zvlášť pokud model dostane kontext kategorií a historie sazeb u daného dodavatele. Kombinace pravidla (validace DIČ, typ plnění) a ML skóre dává nejlepší výsledky. U RC měj tvrdé bloky.
Může ML zabránit odeslání podezřelé platby?
Když nastavíš „tvrdé blokování“ pro vysoké riziko, platba čeká na druhé schválení. To je nejlepší praxe: ML navrhne, člověk potvrdí. Předejdeš omylům i podvodům.
Jaké metriky mám sledovat, abych věděl, že to funguje?
Precision, recall, počet alertů na 100 dokladů, průměrný čas uzavření alertu a finanční dopad odvrácených chyb/podvodů. Jednou měsíčně si je projdi v reportu a uprav nastavení.
Neporuším GDPR, když budu trénovat model na bankovních datech?
Ne, pokud dáš důraz na minimalizaci dat, šifrování, přístupová práva a auditní logy. Citlivé identifikátory můžeš pseudonymizovat. V Doklad.ai tohle řešíme vestavěně.
---
Závěrem: Proč teď dát šanci machine learningu v detekci účetních podvodů
Chceš klidnější spánek? Dejte ML jasná pravidla, trochu času a poctivý feedback. Odmění se tím, že vytáhne na světlo věci, které by ti jinak proklouzly. Machine learning v detekci účetních podvodů není zázračná skříňka, ale spolehlivý filtr. A přesně tak ho v Doklad.ai stavíme: aby ti šetřil čas, peníze a nervy.