Saltar para o conteúdo
goppo

Notícias · IA resumida para perceber o essencial

← Voltar às notícias

Regulação e Sociedade

Publicado em

Microsoft chamou à recolha de dados de IA "maior furto da história"

Documentos sem redacção do processo do New York Times contra a OpenAI e a Microsoft revelam que executivos das duas empresas descreveram internamente a recolha de dados para treino de IA como "roubo" e uma "ameaça existencial" aos meios de comunicação.

  • openai
  • microsoft
  • direitos autor
  • chatgpt
  • nyt

Resumo

Documentos sem redacção tornados públicos no processo que o New York Times move contra a OpenAI e a Microsoft desde Dezembro de 2023 revelam que executivos de ambas as empresas descreveram internamente as suas práticas de treino de modelos de IA como um "roubo", e que a liderança da OpenAI reconheceu que os seus modelos representam uma "ameaça existencial" para os editores e jornalistas cujo trabalho serviu para os treinar.

Na prática

Segundo os documentos, Brent Hecht, director de Applied Science da Microsoft, escreveu num memorando interno de Janeiro de 2023 que a recolha de conteúdo constituía "um roubo espantoso de proporções sem precedentes" e "o maior roubo de trabalho da história da humanidade". Nick Turley, responsável pelo ChatGPT na OpenAI, escreveu internamente que produtos como o chatbot representam uma "ameaça existencial" para os editores, por serem "largamente substitutivos" e tenderem a tornar-se "cada vez mais substitutivos" à medida que melhoram. O presidente da OpenAI, Greg Brockman, descreveu os modelos como "excelentes em notícias".

Dados internos da própria Microsoft, citados no processo, mostram que o motor de resposta do Copilot fez cair até 93% a taxa de cliques para o domínio do New York Times, em comparação com o Bing tradicional. Uma apresentação interna de Janeiro de 2024, também de Hecht, descreve essa queda como um "ciclo de destruição" que "prejudicaria o desempenho dos nossos modelos e de toda a web ao mesmo tempo".

O CEO da Microsoft, Satya Nadella, testemunhou este ano, em depoimento, que "tudo o que estiver protegido por paywall deveria ser licenciado por quem o quiser usar... para fundamentação ou treino", e afirmou que, se tivesse sabido que a OpenAI recolheu e treinou com conteúdo protegido por paywall, teria "exigido que a OpenAI voltasse a treinar os seus modelos".

Os documentos descrevem ainda como as empresas terão contornado paywalls sem serem detectadas: quando o investigador da OpenAI Nick Ryder disse a Brockman que tinha "um truque para contornar o paywall do nytimes", Brockman respondeu "boa". Os ficheiros apontam também esforços deliberados para remover avisos de direitos de autor dos dados de treino, porque os investigadores "não queriam que o modelo produzisse" esses avisos.

A escala da cópia alegada é elevada: os conjuntos de dados de treino intermédio da OpenAI contêm mais de 91.692 cópias de textos publicados pelo New York Times, pelo Daily News e pelo Center for Investigative Reporting. Um conjunto derivado do Common Crawl incluía mais de 2 milhões de documentos só do site nytimes.com. Segundo o processo, a OpenAI entregou a totalidade do conjunto de treino do GPT-3 à Microsoft, e a Microsoft forneceu dados à OpenAI através de dois projectos internos, chamados Project Taxi e Project Mango — este último com cópias de pelo menos 160.903 obras únicas de editoras de notícias.

O que falta saber

Grande parte desta informação provém do argumento apresentado pelo próprio New York Times, e não dos documentos originais, que continuam selados; as citações são apresentadas sem o contexto completo em que foram feitas. A OpenAI e a Microsoft não responderam a pedidos de comentário da TechCrunch. O processo continua em curso, num contexto em que os tribunais têm tendencialmente favorecido o argumento de "fair use" das empresas de IA, e em que o governo Trump apresentou este mês um parecer a favor da posição da OpenAI.

Porque importa

  • As citações internas contradizem directamente a defesa de "fair use" da OpenAI, que depende de o uso não substituir nem prejudicar o mercado do conteúdo original
  • A escala documentada — mais de 91 mil cópias de artigos e milhões de documentos de um único site — dá números concretos a uma disputa até agora sobretudo abstracta
  • As alegações sobre contornar paywalls e remover avisos de direitos de autor abrem uma frente de responsabilidade distinta da simples discussão sobre "fair use"
  • O caso pode influenciar como tribunais e reguladores tratam outras acções judiciais semelhantes contra empresas de IA