Prawo autorskie i sztuczna inteligencja: spór prawny przenosi się na wyniki modeli
4 września 2026 roku upłynął termin składania wniosków o summary judgment — pisma, którym strona prosi sąd o rozstrzygnięcie bez rozprawy, ponieważ istotne fakty nie są sporne — w połączonym postępowaniu «In Re: OpenAI, Inc. Copyright Infringement Litigation» przed sędzią federalnym Sidneyem H. Steinem w U.S. District Court dla Southern District of New York. Publiczny rejestr w CourtListener odnotowuje wnioski złożone przez The New York Times Company oraz analizy biegłego wspierające obronę, podpisane przez Chrisa Callisona-Burcha. Microsoft wniósł o summary judgment, argumentując, że trenowanie na tekstach dziennikarskich i książkach stanowi użycie transformatywne chronione przez fair use, i twierdząc, że Copilot "does not replace their protected expression". Po drugiej stronie OpenAI powtarza w swoim piśmie, że "Nobody owns facts, just as nobody owns language". Wydawcy jako powodowie żądają natomiast wyłączenia fair use zarówno wobec sposobu pozyskania artykułów chronionych paywallem, jak i wobec trenowania na kopiach, a pełnomocnik wydawców Steven Lieberman opisuje dowody złożone pod pieczęcią słowami: "The stuff we were forced to file under seal is scorchingly hot. Not just a smoking gun; they're a smoking bazooka." Zawartość materiału złożonego pod pieczęcią nie jest publicznie weryfikowalna: słowa Liebermana pozostają oceną strony na temat dokumentów, których nikt spoza postępowania nie mógł przeczytać.
Teza obrony zmierza do przesunięcia środka ciężkości analizy z materiału wchłoniętego na etapie treningu na rzeczywistą częstotliwość, z jaką modele generują treści chronione. Według pisma Microsoftu biegły powołany przez wydawców przeanalizował około 8,2 miliona zapisów rozmów z Copilotem, wybranych za pomocą słów kluczowych powiązanych ze stronami zaangażowanych redakcji — czyli z założenia podzbiór, w którym ich utwory występują najprawdopodobniej: podane dalej odsetki nie opisują całego ruchu Copilota. W próbie 59 545 rekordów (około 0,7%) miało co najmniej 16 słów wspólnych z artykułami, natomiast po stronie książek naliczono 24 odpowiedzi z co najmniej 30 zbieżnymi słowami (0,00029% analizowanych rozmów), odnoszące się do 10 z 212 spornych książek, przez co 202 tomy pozostały bez jakiegokolwiek trafienia. Również według pisma Microsoftu biegły Center for Investigative Reporting miał zidentyfikować w tym samym zbiorze danych 51 przypadków istotnego pokrywania się z utworami CIR. W tle pozostają szacunki Sensor Tower przytoczone przez New York Daily News, wskazujące na ponad miliard użytkowników ChatGPT w czerwcu i koszt 6800 dolarów za wygenerowanie miliona 500-wyrazowych artykułów w stylu dziennikarskim.
Nie przeczytaliśmy pełnego pliku PDF pisma Microsoftu: w chwili weryfikacji publiczny docket w CourtListener nie pokazywał konkretnej pozycji tego wniosku wśród wyników wyszukiwania, a część materiału złożono pod pieczęcią. Podane tu liczby pochodzą ze złożonego tekstu, tak jak relacjonują go New York Daily News, The Next Web i The Verge — redakcje, które miały do niego dostęp. Ponadto progi pomiaru (16 słów dla artykułów, 30 dla książek) to progi zastosowane w analizie obrony i nie jest jeszcze publiczne żadne techniczne zakwestionowanie metody i parametrów przez powodów. Sędzia nie podjął żadnej decyzji, termin na odpowiedzi wyznaczono na 9 października 2026 roku, a data rozprawy nie została ustalona.
To, czy właściwą miarą jest to, co zostaje odtworzone na wyjściu, czy to, czego użyto do trenowania, jest dokładnie tym, o czym będzie musiał orzec sędzia Stein: oba pisma proszą o zastosowanie fair use do dwóch różnych pytań.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Odpytałam przez API publiczny docket CourtListener dla MDL 1:25-md-03143, potwierdzając sygnaturę sprawy, sąd (S.D.N.Y.), sędziego (Sidney H. Stein), pozycje dotyczące summary judgment z 4 września 2026 roku oraz kalendarz (złożenie 4 września, odpowiedzi 9 października 2026). Następnie przeczytałam dwie niezależne od siebie relacje o tym samym złożeniu — New York Daily News i The Next Web — plus relację The Verge przez mirror: zgadzają się co do daty, sędziego i liczb (8,2 miliona rozmów, 59 545 rekordów z co najmniej 16 słowami, 24 odpowiedzi z co najmniej 30 słowami, 10 książek z 212). Cytaty dosłowne pochodzą z relacji Daily News, która czytała pisma procesowe. Odrzuciłam wiadomość o rozmowach USA-Chiny: opierała się na anonimowych źródłach i została zdementowana przez rzecznika Departamentu Skarbu ("no meeting is planned").
- Incertezze
- Nie przeczytałam pełnego PDF pisma Microsoftu: liczby pochodzą ze złożonego tekstu w relacji trzech redakcji, które miały do niego dostęp, a publiczny docket w CourtListener w chwili weryfikacji nie pokazywał konkretnej pozycji tego wniosku. Część materiału jest pod pieczęcią. Progi pomiaru (16 słów dla artykułów, 30 dla książek) to progi wybrane w analizie przedstawionej przez obronę: techniczne zakwestionowanie metody i progów przez powodów wydaje się jeszcze niedostępne publicznie. Sędzia niczego nie rozstrzygnął: odpowiedzi są oczekiwane do 9 października 2026 roku, a data rozprawy nie jest znana. Zawartość materiału pod pieczęcią, do której nawiązuje pełnomocnik powodów, nie jest weryfikowalna z zewnątrz.
- Perché pubblicarla
- To pierwszy przypadek, w którym obrona dużego dostawcy SI wnosi do sądu liczby zmierzone na rzeczywistych rozmowach użytkowników, a nie na testach laboratoryjnych, aby dowodzić, że odtwarzanie treści chronionych jest statystycznie marginalne. Rozstrzygnięcie sędziego Steina w sprawie tych wniosków może ustalić w Stanach Zjednoczonych miarę szkody wynikającej z trenowania — ile waży odtworzony wynik wobec kopii na wejściu — z bezpośrednim wpływem na to, jak swoje roszczenia ułożą wydawcy europejscy, gdzie kryterium prawne patrzy raczej na obecność utworu w parametrach modelu.
Fonti / Sources
- CourtListener — docket In Re: OpenAI, Inc. Copyright Infringement Litigation, 1:25-md-03143 (S.D.N.Y.)
- New York Daily News — «Daily News, NY Times want 'fair use' argument rejected in copyright case against OpenAI, Microsoft»
- The Next Web — «Microsoft tells court Copilot rarely copies books»
- The Verge (via mirror UA.News) — «Microsoft says Copilot rarely reproduces NYT texts»