
Vanessa Schmidt Bortolini
Há algo de paradoxal na atual corrida pelo desenvolvimento da inteligência artificial (IA) pois, depois de anos em que a crescente disponibilidade de dados na internet foi justamente um dos fatores que possibilitaram o avanço exponencial desses sistemas, empresas de tecnologia estão agora voltando às estantes em busca de livros impressos antes da popularização da IA generativa, que passaram a representar uma fonte particularmente valiosa de dados para o treinamento de novos modelos. O movimento chama atenção não apenas pela dimensão que vem adquirindo, mas também pela forma como tem sido realizado, uma vez que, em alguns casos, milhões de livros são adquiridos, têm suas lombadas removidas e suas páginas digitalizadas em alta velocidade para, ao final do processo, serem simplesmente descartados.
O caso mais emblemático talvez seja o chamado Project Panama, da Anthropic, revelado a partir de documentos que demonstraram a estruturação, pela empresa, de uma operação de grandes proporções destinada à aquisição e digitalização de milhões de livros físicos, na qual teriam sido investidos dezenas de milhões de dólares em aproximadamente um ano. As obras eram adquiridas, tinham suas lombadas removidas para possibilitar a digitalização das páginas em escala industrial e, após concluído o processo, os exemplares físicos eram descartados (Schaffer; Oremus; Tiku, 2026).
O interesse por esse tipo de material, contudo, não parece estar restrito à Anthropic, uma vez que, em julho de 2026, foi noticiado que a ISBNdb, empresa que fornece livros físicos em grandes volumes para clientes do setor de IA, passou a destacar obras impressas mais antigas como fontes particularmente valiosas de dados para o treinamento de modelos. A razão para esse interesse está justamente em uma característica que, até pouco tempo, pareceria irrelevante: além de conterem conhecimento humano estruturado e submetido a processos editoriais, esses livros foram publicados antes da atual proliferação de conteúdo produzido por sistemas de IA generativa na internet (Maiberg, 2026).
O retorno aos livros, portanto, parece decorrer de um problema produzido pelo próprio sucesso da IA: quanto mais conteúdo sintético passa a integrar o ambiente informacional, mais difícil se torna encontrar dados cuja origem permaneça genuinamente humana.
A IA precisa ser salva de si mesma?
Os dados sempre foram a matéria-prima da IA. Algoritmos aprendem a partir de grandes conjuntos de informações, identificam padrões e, com base neles, produzem classificações, previsões, recomendações e novos conteúdos. Em trabalho anterior, já destaquei que a IA combina dados, algoritmos e capacidade computacional e que sua capacidade de self-learning permite que sistemas desenvolvam seu desempenho a partir da experiência (Bortolini, 2024). Durante muito tempo, a internet pareceu oferecer uma fonte quase inesgotável dessa matéria-prima. Textos, imagens, fóruns, notícias, publicações científicas e interações humanas compuseram um gigantesco registro digital da produção cultural e intelectual da humanidade.
Porém a IA generativa alterou essa equação, pois uma parte crescente do ambiente digital passou a ser também produto da própria IA. Um texto pode ser produzido por um modelo, publicado em um site, resumido por outro sistema, reproduzido em uma rede social, reformulado por uma terceira ferramenta e, algum tempo depois, voltar a integrar conjuntos de dados utilizados justamente para treinamento de novos modelos.
É nesse ponto que uma expressão anterior à atual geração de grandes modelos de linguagem ganha atualidade: data incest, ou incesto de dados.
Na literatura sobre sistemas multiagentes, o termo é utilizado para descrever situações nas quais a mesma informação percorre diferentes caminhos dentro de uma rede e acaba sendo reutilizada como se cada aparição constituísse evidência independente. O resultado pode ser uma confiança artificialmente elevada numa determinada conclusão. Ou seja, não existem várias fontes confirmando um fato, mas uma única informação que retornou ao sistema por diferentes caminhos (Krishnamurthy; Hoiles, 2014). O fenômeno, portanto, não pressupõe que a informação tenha sido produzida por IA, mas decorre da existência de uma dependência não identificada entre fontes que aparentam ser independentes.
Transposto para o ecossistema contemporâneo da IA generativa, contudo, o problema adquire uma nova dimensão. Uma informação médica incorreta produzida por um sistema de IA e posteriormente publicada na internet, por exemplo, pode ser replicada, resumida e reformulada em dezenas de páginas diferentes que, embora aparentemente independentes, possuem uma mesma origem. Ao encontrar posteriormente esse conteúdo durante o treinamento, uma nova geração de modelos não necessariamente reconhecerá que se trata de uma única informação reproduzida cinquenta vezes, podendo interpretar essas diferentes manifestações como fontes distintas que corroboram uma mesma afirmação.
A repetição passa, assim, a produzir uma aparência de consenso que não corresponde à diversidade real das fontes, na medida em que a multiplicação de um mesmo conteúdo não representa, necessariamente, a existência de fontes independentes de conhecimento.
Quando a cópia começa a esquecer o original
Há ainda um segundo problema, relacionado, mas tecnicamente distinto. Em 2024, pesquisadores publicaram na Nature resultados demonstrando o fenômeno denominado model collapse. Segundo Shumailov et al. (2024), o uso indiscriminado de conteúdo gerado por modelos para treinar gerações posteriores pode provocar defeitos progressivos: características menos frequentes da distribuição original começam a desaparecer e os modelos passam a representar uma versão cada vez mais empobrecida dos dados de origem.
Uma analogia simples ajuda a compreender o fenômeno: quando uma fotografia é sucessivamente reproduzida a partir da cópia anterior, e não do original, pequenas perdas podem se acumular a cada nova geração. Embora o funcionamento dos modelos generativos seja evidentemente mais complexo, a comparação permite compreender por que dados de origem humana passam a adquirir valor estratégico justamente em um ambiente no qual dados sintéticos se tornam progressivamente abundantes.
Isso não significa que dados sintéticos sejam necessariamente ruins nem que qualquer utilização deles leve inevitavelmente ao colapso. Estudos posteriores mostram que o resultado depende de como dados reais e sintéticos são combinados, havendo estratégias capazes de conter a degradação quando os dados sintéticos são acumulados juntamente com dados reais, em vez de simplesmente substituí-los geração após geração (Kazdan et al., 2025). Essa ressalva é fundamental, pois não se trata de estabelecer uma oposição simplista entre conteúdos produzidos por seres humanos, supostamente confiáveis, e aqueles gerados por sistemas de IA, necessariamente problemáticos, mas de reconhecer os riscos decorrentes da perda de rastreabilidade quanto à origem dos dados, bem como da redução de sua diversidade e independência. É justamente sob essa perspectiva que se pode compreender, ao menos em parte, o renovado interesse por livros publicados antes da popularização da IA generativa.
Da explicabilidade à proveniência dos dados
As consequências desse fenômeno, contudo, não se restringem aos aspectos técnicos relacionados ao desenvolvimento e treinamento dos modelos, alcançando também questões jurídicas e éticas que vêm sendo discutidas nos últimos anos em torno do uso da IA. Grande parte desse debate concentrou-se, corretamente, na transparência e na explicabilidade desses sistemas, especialmente diante da existência dos chamados modelos de “caixa-preta”, cuja opacidade dificulta a compreensão acerca do funcionamento do sistema e dos elementos que conduziram a determinado resultado. Em pesquisa anterior sobre a aplicação da IA na saúde, apontamos justamente a falta de transparência e explicabilidade como importantes obstáculos à confiança na tecnologia, sobretudo quando seus resultados são utilizados como suporte para decisões relevantes (Bortolini et al., 2024).
A explicabilidade procura responder, entre outras questões, a uma pergunta essencial: como o sistema chegou a determinada resposta? O problema do incesto de dados exige, contudo, que se acrescente uma indagação anterior: de onde veio o conhecimento utilizado pelo sistema para produzi-la? Embora relacionadas, as perguntas não se confundem, uma vez que um sistema pode ser relativamente transparente quanto aos fatores considerados para determinada recomendação e, ainda assim, ter sido treinado a partir de um ecossistema informacional no qual uma mesma afirmação foi sucessivamente reproduzida, reformulada e reinserida, sem que essa multiplicação corresponda à existência de evidências efetivamente independentes. Nesse cenário, a transparência não pode se limitar ao funcionamento do algoritmo, devendo alcançar também a origem e a trajetória dos dados que contribuíram para a construção de seus resultados.
No livro Inteligência Artificial na Medicina: uma proposta de regulação ética, defendi a necessidade de documentar os algoritmos e as fontes de dados que alimentam os sistemas, bem como de assegurar qualidade, representatividade e curadoria regular dos dados utilizados (Bortolini, 2024). O cenário atual mostra que essa preocupação talvez precise avançar mais um passo, não bastando mais perguntar pela qualidade do dado isoladamente, mas também pela sua proveniência, independência e “genealogia”. Em outras palavras: quantas fontes existem realmente?
O que muda para a governança da IA?
O renovado interesse por livros impressos anteriores à popularização da IA generativa revela uma questão que parece mais profunda, especialmente à medida que conteúdos produzidos por esses sistemas passam a ocupar uma parcela crescente do ambiente digital. Nesse contexto, dados cuja origem possa ser identificada e rastreada adquirem um valor particular, relacionado à possibilidade de reconstruir sua procedência e verificar, em alguma medida, a independência das fontes que contribuíram para o desenvolvimento dos modelos.
Esse cenário também amplia os desafios relacionados à governança da IA, que passam a envolver a proveniência dos conjuntos de treinamento, a identificação de conteúdo sintético e a adoção de mecanismos capazes de reduzir o risco de que sucessivas reproduções de uma mesma informação sejam interpretadas como evidências independentes. A diversidade dos dados, sob essa perspectiva, depende também da diversidade de suas origens.
A corrida pelos livros revela, assim, uma questão maior sobre o próprio desenvolvimento da IA, que depende de volumes crescentes de dados para aprender enquanto passa a conviver com um ambiente informacional cada vez mais ocupado por conteúdos produzidos por ela própria. A possibilidade de reconstruir a origem e a trajetória desses dados tende, nesse cenário, a assumir importância crescente, sobretudo diante da dificuldade de identificar quando fontes aparentemente distintas constituem, na realidade, diferentes reproduções de um mesmo conteúdo.
Referências
BORTOLINI, Vanessa Schmidt. Inteligência artificial na medicina: uma proposta de regulação ética. Canoas: Editora Consultor Editorial, 2024.
BORTOLINI, Vanessa Schmidt; COLOMBO, Cristiano; FALEIROS JÚNIOR, José Luiz de Moura; TRINDADE, Eduardo Neubarth. (In)explicabilidade da inteligência artificial na saúde: revisão da literatura, regulação e novos rumos. In: PARENTONI, Leonardo; MEIRA JÚNIOR, Wagner (coord.). Direito, Tecnologia e Inovação – v. 6: Ciência de Dados e Direito. Belo Horizonte: Centro DTIBR, 2024. DOI: 10.59224/dti6.ch6.
FALEIROS JÚNIOR, José Luiz de Moura; BORTOLINI, Vanessa Schmidt. Proteção de dados pessoais e decisões automatizadas na área da saúde: desafios em relação à teletriagem médica. In: TYBUSCH, Francielle Benini Agne; STURZA, Janaína Machado; PILAU SOBRINHO, Liton Lanes (coord.). Direito e Saúde: VII Encontro Virtual do CONPEDI. Florianópolis: CONPEDI, 2024. ISBN 978-65-5648-946-9.
KAZDAN, Joshua et al. Collapse or thrive: perils and promises of synthetic data in a self-generating world. In: Proceedings of the 42nd International Conference on Machine Learning. Proceedings of Machine Learning Research, v. 267, p. 29469-29494, 2025.
KRISHNAMURTHY, Vikram; HOILES, William. Online reputation and polling systems: data incest, social learning, and revealed preferences. IEEE Transactions on Computational Social Systems, v. 1, n. 3, p. 164-179, 2014. DOI: 10.1109/TCSS.2014.2377891.
MAIBERG, Emanuel. AI companies are buying tons of old books because they’re free of AI slop. 404 Media, 21 jul. 2026.
SCHAFFER, Aaron; OREMUS, Will; TIKU, Nitasha. Inside an AI start-up’s plan to scan and dispose of millions of books. The Washington Post, 27 jan. 2026.
SHUMAILOV, Ilia; SHUMAYLOV, Zakhar; ZHAO, Yiren et al. AI models collapse when trained on recursively generated data. Nature, v. 631, p. 755-759, 2024. DOI: 10.1038/s41586-024-07566-y.
Ao entrar você está ciente e de acordo com os termos de uso e privacidade do Whatsapp.
PARTICIPE DO CANAL
Acompanhe o Juristas no Google News
receba as principais notícias jurídicas do Brasil