AI detector (AI detektor)
Čo je AI detector?
AI detector (v slovenskom preklade AI detektor) je softvérový nástroj, ktorý odhaduje pravdepodobnosť, že text, obrázok alebo zdrojový kód vytvoril generatívny model, a nie človek. Funguje ako klasifikátor: vstup porovnáva so štatistickými vzorcami, ktoré sa naučil na dátach od ľudí aj od jazykových modelov. Výstupom nie je dôkaz o autorstve, ale skóre pravdepodobnosti.
V praxi sa s ním stretávame v školstve, redakciách, pri moderovaní obsahu aj v náborových procesoch. V anglickom prostredí sa používa aj označenie AI content detector.
Kľúčové funkcie AI detektorov
AI detektory kombinujú viacero techník podľa typu vstupu, jednotný princíp naprieč všetkými nástrojmi však neexistuje.
- text – najčastejšie meranie predvídateľnosti textu (perplexity) a rozkolísanosti viet (burstiness) doplnené klasifikátorom natrénovaným na ľudských a strojových vzorkách,
- obraz – hľadanie artefaktov generovania vo fotografiách a obrázkoch spolu s kontrolou signálov o pôvode súboru,
- kód – analýza štýlu pomenovaní, komentárov a štruktúry zdrojového kódu.
Od kontroly plagiátorstva sa AI detector líši princípom: plagiátorský nástroj porovnáva text s databázou existujúcich zdrojov a hľadá zhodu, zatiaľ čo väčšina AI detektorov hodnotí štatistické vlastnosti samotného vstupu. Časť nástrojov oba prístupy kombinuje a štatistiku dopĺňa porovnaním s referenčným korpusom.
Časť nástrojov ponúka bezplatnú (free) verziu s limitom na dĺžku vstupu, plné rozhranie a API bývajú platené. Skóre sa zvyčajne uvádza v percentách a pri dlhších dokumentoch aj po jednotlivých pasážach.
Pri obrázkoch začni pôvodom súboru, nie skóre z detektora. OpenAI od mája 2026 vkladá do obrázkov z ChatGPT, Codexu a API metadáta C2PA Content Credentials aj neviditeľný vodoznak SynthID od Google DeepMind a na ich kontrolu ponúka verejný verifikačný nástroj. Vodoznak prežije aj snímku obrazovky, kým podpísané metadáta sa pri opätovnom zakódovaní súboru často stratia. Overenie ti však potvrdí len obrázky z podporovaných nástrojov.
AI detektor v praxi: presnosť a obmedzenia
Spoľahlivosť AI detektorov je v odbornej komunite predmetom sporu. OpenAI stiahol svoj AI Text Classifier 20. júla 2023 pre nízku presnosť – pri vlastnej evaluácii nástroj správne označil 26 % textov od AI a zároveň 9 % ľudských textov nesprávne označil za strojové. OpenAI uviedol, že klasifikátor je nespoľahlivý pri textoch kratších než 1 000 znakov, pri kóde a v iných jazykoch než angličtine. Práve to je limit relevantný pre slovenské texty: modely stoja prevažne na anglických dátach.
Druhým problémom sú falošne pozitívne výsledky. Štúdia Liang et al. z roku 2023 zistila, že testované detektory nesprávne označili za AI text v priemere 61,3 % esejí TOEFL napísaných nerodenými anglicky hovoriacimi, zatiaľ čo eseje rodených hovoriacich klasifikovali presne. Odolnosť detektorov znižuje aj parafrázovanie – výskum z roku 2023 ukázal, že opakované parafrázovanie prelomí aj detektory postavené na vodoznaku.
V IT tímoch sa detekcia AI kódu zatiaľ nepresadila ako kontrolný mechanizmus. Pri code review sa namiesto otázky, kto kód napísal, sleduje kvalita kódu, testovacie pokrytie a licenčné riziká. Firmy výsledok detektora zvyčajne používajú ako indíciu na ďalšie preverenie, nie ako podklad pre rozhodnutie – dopĺňa ho história vzniku dokumentu, kontrola metadát a ľudské posúdenie.
Zdroje k téme:
- OpenAI – New AI classifier for indicating AI-written text: https://openai.com/index/new-ai-classifier-for-indicating-ai-written-text/
- OpenAI – Advancing content provenance for a safer, more transparent AI ecosystem: https://openai.com/index/advancing-content-provenance/
- PubMed Central – GPT detectors are biased against non-native English writers: https://pmc.ncbi.nlm.nih.gov/articles/PMC10382961/
- arXiv – Can AI-Generated Text be Reliably Detected?: https://arxiv.org/pdf/2303.11156
Uvedené informácie sú orientačné a môžu sa líšiť v závislosti od verzie, implementácie a prostredia.
Súvisiace články