Mastodon
Zdjęcie okładkowe wpisu OpenAI znakuje tekst w ChatGPT pod unijny bat. Wystarczy kilka synonimów, by system poległ

OpenAI znakuje tekst w ChatGPT pod unijny bat. Wystarczy kilka synonimów, by system poległ

0
Dodane: 16 godzin temu

Unijny Akt o Sztucznej Inteligencji (EU AI Act) zmusił OpenAI do wdrożenia mechanizmu znakowania tekstu generowanego przez sztuczną inteligencję.

Technologia nazwana textGrain trafia do użytkowników w Unii Europejskiej, jednak jej skuteczność w praktyce okazuje się fasadowa. Wystarczy drobna redakcja wyjściowego materiału, by niewidzialny podpis wyparował.

Po tym, jak kilka miesięcy temu podobne rozwiązanie wdrożyło Anthropic w modelu Claude, OpenAI dołącza do realizacji wymogów unijnego prawa. Zgodnie z nowymi przepisami dostawcy modeli generatywnych muszą oznaczać tworzone treści w sposób umożliwiający ich późniejszą identyfikację.

Niewidzialny znak wodny w tekście z AI. Matematyczny podpis, który uderzy w prywatność, a nie w oszustów

Znak wodny w ChatGPT i Codexie w pierwszej kolejności zostanie włączony automatycznie wyłącznie użytkownikom z terenu Unii Europejskiej. Klienci korzystający z komercyjnego API na całym świecie dostaną tę opcję jako dobrowolną (opt-in).

Matematyczny szyfr w doborze słów

Technologia textGrain nie wkleja do tekstu ukrytych znaków Unicode, lecz manipuluje prawdopodobieństwem doboru konkretnych wyrazów. Podczas generowania odpowiedzi model wybiera słowa na podstawie ukrytego, statystycznego wzorca. Ze względów semantycznych czytelnik nie zauważy różnicy w brzmieniu zdań, jednak detektor OpenAI potrafi odczytać ten matematyczny rytm.

Większość narzędzi analitycznych nie zyska jednak dostępu do weryfikacji. Oprogramowanie detekcyjne zostało na razie udostępnione w wąskim programie pilotażowym dla wybranych badaczy i instytucji. Co ciekawe, z wewnętrznych testów wynika, że znakowany tekst osiągał w niektórych benchmarkach logicznych minimalnie wyższe noty niż wariant pozbawiony modyfikacji probabilistycznych.

Parodia zabezpieczeń

Prawdziwy problem leży w podatności tego mechanizmu na najprostsze obejścia, do czego otwarcie przyznaje się samo OpenAI w swoim raporcie technicznym. Znak wodny jest skrajnie nietrwały i sprawdza się wyłącznie przy „surowym”, nieskorygowanym eksporcie z czatu.

Dla próbek o długości 400 tokenów algorytm osiągał 92% skuteczności wykrywania. Wystarczyło jednak zastąpić synonimami 10% wyrazów, by skuteczność spadła do 66%. Podmiana co czwartego słowa (25%) obniża wykrywalność do zaledwie 17%. Oznacza to, że zwykła korekta językowa, parafrazowanie czy puszczenie tekstu przez prosty translator całkowicie neutralizuje unijne zabezpieczenie.

System wykazuje też podatność na błędy fałszywie dodatnie i ujemne w dziedzinach ścisłych, takich jak matematyka czy kod programistyczny, gdzie margines doboru słownictwa jest drastycznie ograniczony.

Wdrożenie textGrain to klasyczny przykład spełniania urzędowych wymogów przy pełnej świadomości ich technicznej bezużyteczności. OpenAI dostarczyło unijnym regulatorom papierową plombę: na papierze prawo jest realizowane, ale każdy, kto faktycznie zechce ukryć fakt generowania tekstu przez maszynę, zrobi to w kilkanaście sekund za pomocą podstawowych synonimów.

Zapraszamy do dalszej dyskusji na Mastodonie lub Twitterze .