AI text a watermark. Co to znamená pro firmy a běžné používání AI?
Když se řekne watermark, většina lidí si představí vodoznak přes obrázek nebo metadata ukrytá v souboru. U textu generovaného AI je princip výrazně zajímavější.
Anthropic popsal mechanismus, kterým může být označován text vytvořený Claudem. Technologie vychází z Google DeepMind SynthID-Text a nemění samotný obsah tak, že by do něj přidávala neviditelné znaky nebo speciální tokeny.
Watermark není ukrytý znak. Je ve způsobu, jak AI vybírá slova
Jazykový model při generování vybírá další token z několika pravděpodobných možností.
Ve větě může být například několik výrazů, které jsou významově téměř stejně vhodné. Za normálních okolností do výběru vstupuje určitá míra náhodnosti. Watermarking tuto náhodnost částečně řídí pomocí specifického klíče a předchozího textu.
Výsledný text přitom nevypadá jinak a neměl by být horší ani pomalejší. Kdo ale zná příslušný klíč a detekční mechanismus, může statisticky vyhodnotit, zda text pravděpodobně vznikl pomocí daného modelu.
A právě slovo pravděpodobně je důležité.
Detektor nebude digitální detektiv s razítkem „napsala AI“
Watermark funguje nejlépe tam, kde má model při formulaci dostatek možností.
U faktických vět, odborné terminologie nebo kódu je prostor pro různé varianty mnohem menší. Stejně tak je obtížnější vyhodnocovat velmi krátké texty.
Zajímavá je také situace, kdy AI text pouze upravuje. Pokud jí dáte vlastní odstavec a požádáte o opravu gramatiky nebo lehké přeformulování, většina slov může zůstat původních. Watermark pak bude výrazně slabší.
Ani pozitivní detekce proto sama o sobě neznamená:
„Tento text kompletně napsal Claude.“
Může znamenat i to, že AI do výsledku výrazněji zasahovala.
A co když text někdo přepíše?
Tady se ukazuje základní slabina celé technologie.
Protože statistický watermark vzniká ve volbě konkrétních slov a tokenů, větší přeformulování textu jej může oslabit nebo odstranit. Už dnes vznikají nástroje, které se pokoušejí podobné značky z textů odstranit právě pomocí dalšího přepisování AI.
Jenže tím se dostáváme k docela absurdnímu workflow:
AI napíše text → jiná AI ho přepíše, aby nebylo poznat, že ho napsala AI.
A spolu s watermarkem se mohou ztrácet také formulace, přesnost nebo styl původního výstupu. Ani samotné nástroje zaměřené na odstranění watermarků proto nemohou garantovat, že následná detekce nebude úspěšná.
Pro firmy je důležitější jiná otázka
Technologie pro označování AI obsahu jsou zajímavé. Pro firemní praxi ale neřeší největší problém.
Řešit v dnešní době, zda text napsala AI je trochu bezpředmětné. Protože proč by ho psát neměla? Je však důležité vědět, jak s takovým textem nakládat.
Detektor totiž nepozná, jestli zaměstnanec:
- ověřil fakta;
- nepředal AI citlivá data;
- zkontroloval výsledný dokument;
- použil schválený firemní nástroj;
- rozumí tomu, za který výstup stále nese odpovědnost.
A právě tady už jde tedy spíše o vzdělávání, což bylo nevyhnutelné rozuzlení tohoto textu.
AI gramotnost není schopnost otevřít ChatGPT nebo Copilot
S rostoucím využíváním AI firmy už teď musejí řešit původ obsahu, jeho důvěryhodnost, bezpečnost dat, pravidla používání jednotlivých nástrojů i odpovědnost za výsledky.
Watermarking může být jednou částí této skládačky. Nenahradí ale AI governance ani vzdělávání lidí.
Zaměstnanci potřebují rozumět nejen promptování, ale také tomu, jak AI pracuje, proč může halucinovat, kdy musí výstup kontrolovat, co do ní nesmějí zadávat a proč ani výsledek označený jako „AI-generated“ automaticky neříká nic o jeho kvalitě.
A přesně tím směrem se posouvá i firemní vzdělávání. Nestačí učit několik příkazů do Copilota nebo ChatGPT. Potřebujeme se naučit s AI pracovat kompetentně, bezpečně a s vědomím jejích limitů.
V Digiskills proto řešíme AI v širším kontextu práce – od praktického používání nástrojů přes adopci až po pravidla a AI gramotnost napříč firmou.
Protože technologie se bude měnit dál. A spolu s ní i to, co budeme muset umět.
NAUČTE SE PRACOVAT S AI BEZPEČNĚ