Technologia

ChatGPT dostaje niewidzialny znak wodny w UE. OpenAI trzymało go w szufladzie od 2024 roku

Adrian Kessler
Dodaj nas w Google

OpenAI przez długi czas publicznie tłumaczyło, dlaczego nie zamierza dodawać znaku wodnego do tekstów tworzonych przez ChatGPT. Teraz jednak to robi. Nie dlatego, że technologia zmieniła zdanie za firmę. Zmusiło ją do tego prawo — z określonym terminem i karą za jego niedotrzymanie.

Firma zapowiada, że teksty generowane dla użytkowników w Unii Europejskiej przez ChatGPT i Codex będą zawierać niewidoczny sygnał statystyczny, wdrażany stopniowo w najbliższych tygodniach we wszystkich planach. W pozostałych krajach ten sam znak jest dostępny wyłącznie jako przełącznik w API dla deweloperów, a domyślnie pozostaje wyłączony. Granica, którą wyznaczyło OpenAI, pokrywa się z granicą jurysdykcji mogącej nałożyć na firmę karę.

Jak działa znak wodny w ChatGPT

Metoda nosi nazwę textGrain i nie pozostawia na tekście żadnego widocznego śladu. Gdy kilka kolejnych słów pasuje do zdania równie dobrze, tajny klucz delikatnie faworyzuje jeden z możliwych wyborów. Pojedyncze takie przesunięcie nic nie znaczy. Setki podobnych zmian w całym tekście tworzą wzorzec, który może wykryć narzędzie dysponujące kluczem. Ponieważ sygnał jest zapisany w samych słowach, nie znika przy kopiowaniu i wklejaniu. Raport techniczny OpenAI powstał we współpracy z badaczami z University of Pennsylvania i Yale. Według jego autorów metoda nie obniża w istotny sposób jakości: w zestawieniu Artificial Analysis Intelligence Index teksty ze znakiem wodnym uzyskały 49,76 punktu, a te bez niego — 49,57.

Narzędzie, które OpenAI miało już wcześniej

Wewnątrz OpenAI to nic nowego. Latem 2024 roku „The Wall Street Journal” poinformował, że firma dysponowała działającym znakiem wodnym dla tekstu, którego skuteczność w wewnętrznych dokumentach oceniono na 99,9%, ale wstrzymywała jego wdrożenie. OpenAI odpowiedziało, że przyjmuje „przemyślane podejście”. Wskazywane przez firmę powody miały charakter techniczny i społeczny: metodę można było „łatwo obejść” — na przykład tłumacząc tekst lub przeredagowując go za pomocą innego modelu — a jej użycie mogło piętnować AI jako narzędzie wspomagające pisanie przez osoby, dla których angielski nie jest językiem ojczystym. TechCrunch, opisując ogłoszenie z tego tygodnia, przypomina o trzecim powodzie podnoszonym wówczas przez firmę: obawie, że użytkownicy przeniosą się do konkurencji, która nie stosuje znaków wodnych.

Na tle tych wcześniejszych deklaracji obecne wdrożenie pokazuje, z którymi obawami OpenAI rzeczywiście sobie poradziło. Problem obchodzenia zabezpieczenia nadal istnieje, co potwierdzają dane samej firmy. Ryzyko komercyjne ograniczono zaś do jednego rynku.

Dane OpenAI, nie jej krytyków

W sprzyjających warunkach, przy odsetku wyników fałszywie pozytywnych na poziomie 1%, detektor wykrywa około 80% oznaczonych fragmentów liczących 200 tokenów i mniej więcej 95% tych o długości 400 tokenów. Jeśli 10% słów zastąpić synonimami, skuteczność wykrywania spada z 92% do 66%. Przy jednej czwartej podmienionych słów wynosi już tylko 17%. Krótkie odpowiedzi, teksty matematyczne i tłumaczenia są wyjątkowo trudne do wykrycia. Samo OpenAI ostrzega, że wysoka skuteczność w idealnych warunkach „nie gwarantuje wiarygodnego wykrywania w codziennym użyciu”, a brak znaku wodnego nie dowodzi, że tekst napisał człowiek. Firma zaznacza też, że znak nie pozwala ustalić, kto jest użytkownikiem.

textGrain może więc być użytecznym sygnałem ostrzegawczym wobec bezmyślnego kopiowania i wklejania, ale niewiele znaczy w starciu z kimś, kto poświęci minutę na redakcję tekstu. W bloku, w którym ludzie czytają i piszą w wielu językach, ograniczenia związane z tłumaczeniem nie są drobnym szczegółem.

Dlaczego UE i dlaczego właśnie teraz

Podstawą prawną jest artykuł 50 unijnego AI Act, którego przepisy dotyczące przejrzystości weszły w życie 2 sierpnia. Zobowiązują one dostawców systemów generatywnych do oznaczania syntetycznych tekstów, nagrań audio, obrazów i materiałów wideo w sposób czytelny dla maszyn oraz do udostępnienia mechanizmu ich wykrywania. Systemy obecne na rynku przed tą datą, w tym ChatGPT, mają czas na dostosowanie się do 2 grudnia. Jak wynika z analizy kancelarii prawnej Cooley, za naruszenie przepisów grozi kara do 15 mln euro lub 3% rocznych światowych obrotów — w zależności od tego, która kwota jest wyższa.

Dwa szczegóły pokazują, jak ściśle wdrożenie odpowiada wymogom prawnym, a nie szerszej zasadzie. Pierwszy to detektor. Prawo wymaga mechanizmu wykrywania; OpenAI stworzyło takie narzędzie, ale udostępniło je wyłącznie zatwierdzonym badaczom i wyspecjalizowanym organizacjom, które muszą złożyć wniosek. Firma zapowiada, że rozszerzy dostęp „gdy uznamy, że wyniki można odpowiedzialnie interpretować” — jak podaje The Decoder — ale nie wskazała żadnego terminu. Nauczyciel ani redaktor w Lizbonie czy Warszawie nie może dziś sprawdzić podejrzanego tekstu.

Drugi szczegół to zasięg geograficzny. Anthropic, które zaczęło oznaczać teksty Claude’a w sierpniu, stosuje znak wodny na całym świecie, niezależnie od sposobu korzystania z jego modeli, i spotkało się z krytyką części użytkowników. OpenAI obrało przeciwny kierunek: domyślnie włącza znak tam, gdzie regulator może nałożyć karę, a poza tym regionem pozostawia go do dobrowolnego włączenia przez deweloperów. Przy premierze nie zdecydowało się na powszechne wdrożenie. Gdyby wcześniejsza obawa przed odpływem użytkowników do rywali niestosujących znaków wodnych zniknęła, trudno byłoby wyjaśnić, dlaczego firma wyznaczyła taką granicę.

Co dalej

OpenAI zapowiada, że udostępni textGrain jako oprogramowanie open source i twierdzi, że metoda dorównuje takim rozwiązaniom jak SynthID od Google’a albo je przewyższa. Obie deklaracje będzie można zweryfikować, gdy kod stanie się publiczny. Brukselę interesuje jednak węższa kwestia: czy znak, który znika po niewielkiej redakcji, a do tego jest odczytywany przez detektor dostępny niemal nikomu, spełnia wymogi przepisów, których celem jest umożliwienie innym systemom rozpoznawania tekstów wygenerowanych przez AI.

Po 2 grudnia domyślnie znak OpenAI będą nosić słowa tylko tych użytkowników ChatGPT, których regulator może wystawić rachunek.

Tagi: , , , ,

Dodaj nas w Google

Dyskusja

Jest 0 komentarzy.