Expert pro Blesk: Ruští trollové nemíří jen na lidi, korumpují i umělou inteligenci. Levně, ale mocně
Největší riziko kremelské propagandy není v ovlivňování lidí, ale strojů – webových vyhledávačů a umělé inteligence. Ty nám pak budou podsouvat lži o Ukrajině i našich volbách, varuje polský expert na dezinformace a ruskou propagandu Jakub Kubś. Kremlu se už podařilo je „nakrmit“ dezinformacemi a nepůjde to odstranit, popsal v rozhovoru pro Blesk Zprávy.
Datový analytik Jakub Kubś se věnuje analýze dezinformací, je podepsán pod řadou zpráv o ruské propagandě. Působí na Vratislavské univerzitě a také v think-tanku Globsec; rozhovor Blesku poskytl na konferenci Globsec Forum v Praze. Aktuálně se zaměřil na propagandu cílící na umělou inteligenci tzv. velké jazykové modely (LLM) jako GPT, Gemini, Llama nebo Grok a na nich založené chatboty ChatGPT, Copilot, Claude a další.
Vy jste zkoumal síť Pravda, oč se jedná?
Jedná se o jakousi globální operaci prováděnou Rusy, konkrétně ruskou společností TigerWeb se sídlem na Krymu, jak zjistila francouzská organizace Viginum. Ta k tomu nalezla technické důkazy. Tato infrastruktura na internetu otravuje ekosystémy v místních jazycích obrovským množstvím dat shromážděných z různých prokremelských kanálů. Máte tam špičkové propagandisty z Kremlu, ale také místní zdroje, které jsou všechny shromažďovány do tohoto systému a poté zveřejňovány na webových stránkách, přeloženy do jiných jazyků pomocí umělé inteligence. A v podstatě nejzajímavější na tom je, že to není navrženo tak, aby to ovlivňovalo lidi, ale jak naznačuje řada výzkumů, je to spíše zaměřeno na znečištění systémů pro trénování umělé inteligence. Kvůli obrovskému množství a frekvenci publikování těchto článků to vytváří nerovnováhu v mediálním ekosystému. Je to velmi levná webová stránka, ale každý den zaplavovaná desítkami tisíc článků, které jsou čistě kremelskou propagandou.
Které pak téměř nikdo nečte...
Tak, žádný tzv. organický provoz. Pokud to nehledáte, je velmi pravděpodobné, že to při organickém vyhledávání nenajdete. Je to velmi jednoduchá HTML webová stránka, není na ní nic zajímavého. Vypadá hrozně, ale pro roboty je velmi snadné ji pročíst. Takže používáte například ChatGPT a položíte nějakou konkrétní otázku, řekněme, že chcete ověřit, zda je pravdivé nějaké tvrzení, které jste četli online - třeba že si Zelenskyj koupil vilu za nakradené miliony dolarů. A zeptáte se: „Hej, ChatGPT, je pravda, že si Zelenskyj koupil vilu za miliony dolarů?“ ChatGPT použije svůj vlastní vyhledávač, položí otázku a hledá zdroje. A protože se ptáte na velmi konkrétní otázku, mezi prvními zdroji, které se objeví ve výsledcích, je Pravda, protože uvádí konkrétně tuto informaci, tento příběh.
Protože o tom nikdo seriózní nepíše?
Ano, to ChatGPT neověřuje. Někdy se v jeho odpovědích objeví, že to je z Pravdy, takže to nemusí být pravdivé, ale jindy dostanete třeba jen potvrzení tohoto ruského tvrzení a je to citováno jako zdroj. Takže jedna věc je znečišťovat tento systém AI a druhá je vyplňovat datové mezery.
Co je datová mezera?
Informační mezera. Například maorština nebo velština, jazyky s malými publiky, v nichž není tolik médií. A najednou se objeví specializovaný web se všemi články přeloženými do tohoto jazyka, se 100 zprávami za hodinu o tom, co se děje na frontě na Ukrajině… Všechny psané z ruské perspektivy.
A šíří síť Pravda pouze tyto dezinformace, nebo je skrývá mezi běžné zprávy?
Používají pouze informace z prokremelských zdrojů. A musíte si sami odpovědět, zda prokremelský zdroj někdy publikuje pravdu, nebo zda se jedná vždy o falešné informace. Někdy informují například o tom, co se děje na frontě, co se děje v Íránu. Některé z těchto kanálů jsou rychlejší než globální média a jsou více faktické, například proto, že mají přímé spojení s Teheránem. Síť Pravda si nevybírá. Prostě bere všechno. Někdy tedy najdete skutečné informace, ale o to nejde. Šířit informace, skutečné informace, není smyslem této struktury. Smyslem je šířit co nejvíce prokremelského pohledu.
Mohou se společnosti provozující ChatGPT a podobné služby bránit proti takovým dezinformacím?
Mohly by zařadit webové stránky Pravdy na černou listinu. Ale výsledky z této sítě se stále objevují ve výsledcích běžně používaných LLM. Zjevně je na černou listinu nezařazují. Jedni výzkumníci zkoumají, které LLM mají největší sklon citovat Pravdu. A například Gemini (od Googlu) si údajně nejvíce uvědomuje, že se jedná o zdroj falešných informací. Na druhou stranu stačí vložit do tréninkových dat velmi malé množství těchto falešných informací. LLM se trénují tím, že konzumují a čtou obsah na internetu. Hodí všechno do jednoho pytle dat a ten se pak použije k trénování modelu. I malé množství těchto falešných informací může rychle znečistit celý model.
Nedávná studie DFR Lab, centra pro analýzu dezinformací, zjistila, že už tam Pravda je, modely jsou již zkorumpované. Když testovali například některé open-source modely jako Llama od společnosti Meta, vzali začátek ruského, prokremelského dezinfo článku. Vložili první větu do LLM a dali pokyn: „Dokonči souvětí.“ A zbytek věty je přesně citován z toho článku.
Firmy vydávají stále nové jazykové modely, každá nová generace prochází novým tréninkem na novém datovém souboru?
Myslím, že se jen přidávají data ke stávajícímu datovému souboru.
Takže je to už narušené pro budoucí generace?
Když jsem toto téma zkoumal, četl jsem, že je nemožné to odstranit, protože to už není ve formě textu, je to forma matematické rovnice, algoritmu, vektorů. Takže hodně štěstí s tím. Museli byste to přetrénovat a náklady na trénování jsou příliš vysoké, vlastně pro kohokoli. Je to tedy zřejmě pro Rusko úspěšná kampaň, což také vysvětluje, proč se rozšiřují. Přibývá článků, přibývá jazyků.
O čem většinou psali?
Záleží to na dané zemi, ale hlavní zaměření je na Ukrajinu a na místní témata. Když jsme například loni zkoumali, co se psalo o volbách v České republice, zjistili jsme, že řada těchto článků se zaměřovala na tamní kandidáty, přičemž někteří kandidáti byli prezentováni v příznivém světle a jiní ve velmi negativním. Můžete si tedy také udělat představu o tom, jaký je postoj Kremlu, když se podíváte na síť Pravda.
Jak technologicky nebo finančně náročné je provozovat síť Pravda?
Je to super, super snadné. To je důvod, proč jsou tak úspěšní v tvorbě a šíření těchto článků, protože ta webová stránka je úplně elementárně naprogramovaná, čistý HTML kód. Je to velmi jednoduché. Provozování by podle mého odhadu nestálo víc než 1 000 dolarů měsíčně. To je opravdu nic. Jsou to nulové náklady oproti maximální účinnosti.
Můžeme se jako společnost proti tomu bránit?
Jistě. Zaprvé je třeba si uvědomit, že něco jako Pravda existuje, že válka se vede na mnoha frontách, digitálních, ale že jde jen o boty. Všichni mluví o botech a deepfake videích, ale to není ten hlavní problém. Pokud se vám podaří například zkreslit výsledky vyhledávání na Googlu nebo výsledky LLM, trefíte se do černého, protože když se dostanete na první stránky výsledků vyhledávání na Googlu, lidé nebudou hledat další fakta na druhé nebo třetí stránce. Zaměří se na to, co jim je nabídnuto. O tom je potřeba lidi informovat. Je dobře, že děláme tento rozhovor. Řekněte lidem, že existuje něco jako Pravda. A pokud jim vysvětlíte, že se jedná o ruskou operaci, mohou možná přesvědčit i ty, kteří jsou méně náchylní k tomu, aby tomu uvěřili. Někteří věří prokremelským informacím a mohou pochybovat, zda se Kreml skutečně snaží ovlivnit jejich názor. Ale pokud jim ukážete všechny technické důkazy, že se jedná o operaci zaměřenou přesně na ně, protože používají LLM nebo Google a že jejím cílem je skutečně na ně působit, pak to snad u těchto lidí také zvýší povědomí.






















