Blandat

Förlag och storsäljande författare stämmer Google för Gemini-träning på upphovsrättsskyddade böcker

Påstår att Google Books och Google Play-avtal blev bakdörr till masskopiering och ändrade upphovsrättsuppgifter för att dölja spåren, intern riskkalkyl nämner böter i tiotals miljarder dollar

Bilder

Complainants claim that their works on Google Play Books were not licensed for use in training Gemini. Photograph: SOPA Images/LightRocket/Getty Images Complainants claim that their works on Google Play Books were not licensed for use in training Gemini. Photograph: SOPA Images/LightRocket/Getty Images theguardian.com
Amanda Silberling Amanda Silberling techcrunch.com

Tre stora förlag och en bästsäljande författare har stämt Google i en federal domstol i New York. De anklagar bolaget för att ha kopierat miljontals upphovsrättsskyddade böcker för att träna sina modeller för artificiell intelligens, Gemini. Enligt The Guardian är kärandena Hachette Book Group, Cengage Learning och Elsevier samt författaren Scott Turow. De menar att böcker som Google fått tillgång till genom äldre och snävt avgränsade upplägg – som Google Books sökfunktion med korta utdrag och försäljning av elektroniska böcker via Google Play – i praktiken gjorts om till träningsmaterial för kommersiella system utan tillstånd eller ersättning.

Stämningen hamnar i ett rättsläge där den framväxande maskinindustrins behov av stora, röriga textmassor i industriell skala krockar med ett regelverk som är byggt för avgränsade handlingar: kopiering och spridning av enskilda verk. Förlagen har i åratal levererat innehåll till Google i program som skulle göra böcker sökbara eller möjliga att sälja. Men dessa program förhandlades utifrån begränsade användningar: bibliografisk visning, sökbara utdrag och distribution via en digital butik. Kärnargumentet i stämningen är att samma distributionskedja blev en bakdörr till kopiering av fulltext för modellträning – att ett licensförhållande omvandlades till en dataledning.

TechCrunch uppger att målet är upplagt som en grupptalan och att Google påstås ha tagit bort eller ändrat upphovsrättsinformation för att dölja att Gemini tränats på ”stulet material”. I stämningsansökan hänvisas också till interna diskussioner inom Google där man ska ha medgett juridisk sårbarhet, inklusive möjliga böter på tiotals miljarder dollar. Det antyder, enligt kärandena, att bolaget behandlade upphovsrättsrisk som en post i balansräkningen snarare än som en tydlig gräns. Kärandena begär lagstadgade skadestånd, ett permanent förbud samt ett domstolsbeslut om att förstöra de påstått otillåtna kopior som använts vid träningen – åtgärder som, om de beviljas, skulle rikta in sig inte bara på framtida beteende utan också på de ackumulerade tillgångar som ligger inbakade i en modells träningsunderlag.

Den ekonomiska drivkraften bakom tvisten är enkel. Träning på böcker är värdefullt därför att böcker är täta, redigerade och strukturerade – just den sorts text som gör modeller mer sammanhängande. Men den kommersiella vinsten av den ökade kvaliteten hamnar i huvudsak hos leverantören av artificiell intelligens, inte hos författare, redaktörer och förlag som står för arbetet som ger signalen. Stämningen pekar rakt på risken för undanträngning: ett system kan snabbt och billigt framställa lång skönlitteratur inom olika genrer, vilket gör en katalog av betalt skapande arbete till en mall för efterapningar med nära noll i marginalkostnad. Om domstolarna bedömer detta som intrång, tillåten användning eller något däremellan avgör om framtida träningsdata kommer att köpas in genom förhandlade licenser eller tas i efterhand genom processer.

Google svarade inte på de begäranden om kommentar som The Guardian och TechCrunch hänvisar till. Målet ligger nu i den federala domstolen för södra distriktet i New York, där en domare ska ta ställning till om ett äldre upplägg från bokskanningens era, avsett för sökbara kortutdrag, också i praktiken gav ett underförstått tillstånd till den masskopiering som krävs för att bygga Gemini.