Reddit fa causa a Perplexity per data mining: fatti chiave sul caso

  • Reddit ha intentato una causa a New York contro Perplexity e tre aziende per presunta estrazione di dati non autorizzati.
  • Perplexity nega le accuse e difende il giusto accesso alla conoscenza pubblica; anche SerpApi e Oxylabs respingono le accuse.
  • La piattaforma ha già in licenza contenuti di Google e OpenAI; ha presentato un avviso di pre-processo e cita un aumento di 40 volte nei referral a Reddit.
  • Il caso, che riguarda l'azienda lituana Oxylabs, ha toccato l'Europa e riacceso il dibattito sullo scraping e sui diritti all'interno del quadro normativo dell'UE.

Reddit fa causa a Perplexity per data mining

Il social network con sede a San Francisco ha presentato una causa federale a New York contro Perplexity AI e diverse aziende legate alla raccolta di dati web, sostenendo di aver ottenuto contenuti di Reddit senza autorizzazione per alimentare strumenti basati sull'intelligenza artificiale.

Secondo il documento, Perplexity non avrebbe una licenza per utilizzare il materiale della piattaforma, mentre Reddit ha raggiunto accordi con altre aziende tecnologiche come Google e OpenAI; inoltre, dopo un richiesta di cessazione e desistenza Secondo quanto dichiarato lo scorso anno dall'azienda, le menzioni di Reddit nel sistema Perplexity sono aumentate di quaranta volte.

Cosa viene segnalato

Reddit sostiene che vari servizi di scraping avrebbero elusione delle misure anti-estrazione dalla piattaforma e dalle pubblicazioni raccolte tramite i risultati di ricerca di Google, descrivendo la pratica come una “economia di riciclaggio di dati” su scala industriale.

La causa specifica che Perplexity avrebbe utilizzato almeno uno di questi provider per ottenere contenuti Reddit, invece di sottoscrivere una licenza con la piattaforma stessa e che gli estrattori avrebbero mascherato identità e posizioni per eludere i controlli.

Chi sono i soggetti coinvolti?

Oltre a Perplexity, il contenzioso punta a Oxylabs UAB (Lituania), al dominio AWMProxy (che Reddit descrive come collegato a un'ex botnet russa) e alla startup SerpApi (Texas), che colloca il caso su una mappa che mescola attori provenienti dagli Stati Uniti e dall'Europa.

La risposta delle società convenute

Perplexity ha dichiarato di non essere ancora stata formalmente informata e che difenderà con vigore il diritto degli utenti a accesso libero ed equo alla conoscenza del pubblico, evidenziando che il suo approccio mira a fornire risposte accurate con l'intelligenza artificiale in modo responsabile.

Da SerpApi, un portavoce ha respinto completamente le accuse e ha anticipato che la società si difenderà vigorosamente in tribunale; Oxylabs, da parte sua, ha espresso sorpresa e delusione, affermando di non aver ricevuto alcun contatto precedente da Reddit e difendendo la sua raccolta di dati pubblici.

Per quanto riguarda AWMProxy, la piattaforma indica che non è stato possibile raccogliere commenti Dell'entità.

Contesto e accordi di licenza

Questo passo legale si aggiunge a un altro fronte aperto da Reddit: a giugno aveva intentato una causa simile contro la società di intelligenza artificiale Anthropic, una procedura che rimane in corso dopo essere stato trasferito a un tribunale federale.

Reddit sottolinea che la sua comunità, composta da migliaia di subreddit e più di 100 milioni di utenti giornalieri, è una fonte fondamentale di conversazioni su Internet, motivo per cui ha firmato licenze con Google, OpenAI e altre aziende per l'addestramento dei modelli.

In borsa, dopo aver appreso dell'azione legale, le azioni di Reddit hanno chiuso la seduta con un calo di oltre l'4% a New York, a dimostrazione della sensibilità del mercato alle controversie sui dati nel settore dell'intelligenza artificiale.

Implicazioni per l'Europa e la Spagna

La presenza di Oxylabs con sede nell'UE introduce un'angolazione europea nella controversia e sposta il dibattito sul utilizzo dei dati pubblici, lo scraping e i limiti del diritto d'autore secondo la normativa UE.

Oltre al contenzioso statunitense, gli attori europei, tra cui editori, piattaforme e sviluppatori, continuano a monitorare attentamente l’andamento del mercato. accesso alle informazioni pubblicamente accessibili con tutela dei diritti e termini d'uso, in un contesto caratterizzato dalla direttiva sul diritto d'autore e dal quadro normativo emergente per l'intelligenza artificiale.

Cosa chiede Reddit e prossimi passi

L'azienda richiede un compensazione finanziaria non specificato e un'ingiunzione che impedisce a Perplexity di utilizzare i dati di Reddit, in attesa di una sentenza del tribunale che stabilisca se siano stati violati dei diritti e la portata di eventuali ingiunzioni.

Restano da definire i tempi processuali e l'idoneità delle difese, ma tutto fa pensare a questo caso. creerà un precedente in un campo in cui si scontrano l'interesse pubblico per l'informazione, la proprietà intellettuale e le esigenze di formazione dei sistemi di intelligenza artificiale.

La battaglia tra piattaforme con grandi archivi di conversazioni umane e aziende di intelligenza artificiale si sta intensificando: con le licenze da una parte e le accuse di scraping dall'altra, la disputa tra Reddit e Perplexity illustra il nuovo consiglio dove vengono negoziati il ​​valore, i permessi e i limiti dei dati online.

Come acquistare da ChatGPT-2
Articolo correlato:
Acquistare da ChatGPT: una guida completa per sfruttare l'intelligenza artificiale nei tuoi acquisti online

Aggiungi come fonte preferita