Desafios da Linguística de Corpus impostos pela Inteligência Artificial
rediscutindo alguns conceitos
DOI:
https://doi.org/10.14393/LL63-v42S-2026-05Palavras-chave:
Linguística de Corpus, Inteligência Artificial, Autenticidade, Representatividade, Large Language ModelsResumo
Neste artigo discuto os impactos da Inteligência Artificial (IA), especialmente dos Large Language Models (LLMs), sobre conceitos fundamentais da Linguística de Corpus (LC), a saber, autenticidade, naturalidade e representatividade. A partir de uma revisão de pesquisas recentes, evidencio a crescente integração entre IA e LC e os desafios metodológicos decorrentes, como a escolha adequada de textos e a distinção entre produções autênticas e artificiais. Ainda, discuto sobre a inclusão indiscriminada de textos gerados por IA nos corpora e como isso pode comprometer a validade das análises linguísticas. Isso culminará em questões técnicas e implicações simbólicas relacionadas ao conceito de autoria, identidade e confiança nos modos de circulação e produção científica. Por fim, proponho alguns encaminhamentos vislumbrando oportunidades dessa aproximação entre LC e IA.
Downloads
Referências
AYAPOVA, S. M.; SKRIPNIKOVA, A. I. Ai and human created media texts: experiment results. Herald of journalism, v. 64, n. 2, 2022. DOI: https://doi.org/10.26577/hj.2022.v64.i2.08
BURNHAM, T.F. Reconstrução-síntese de contribuições ao XI CINFORM, à guisa de apresentação. In BORGES, J; BARREIRA, M.I.J.S.; CUNHA, F.J.A.P. (Org.). Mundo digital: uma sociedade sem fronteiras? 1ed.João Pessoa: Ideia, 2014, v. 1, p. 7-20.
CURRY, N.; BAKER, P.; BROOKES, G. Generative AI for corpus approaches to discourse studies: A critical evaluation of ChatGPT. Applied Corpus Linguistics, v. 4, n. 1, p. 100082, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100082
CHEN, C. The citespace manual. College of Computing and Informatics, v. 1, n. 1, p. 1-84, 2014.
CHEUNG, L.; CROSTHWAITE, P. CorpusChat: integrating corpus linguistics and generative AI for academic writing development. Computer Assisted Language Learning, p. 1–27, 2025. DOI: https://doi.org/10.1080/09588221.2025.2506480.
DALTE, P. Inteligência artificial e poesia. Revista 2i: Estudos de Identidade e Intermedialidade, v. 2, n. 2, p. 165–177, 2020. DOI: https://doi.org/10.21814/2i.2505
FREITAS,. Dataset e corpus. In: CASELI, Helena de Medeiros; NUNES, Maria das Graças Volpe (Orgs.). Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português. [s.l.]: BPLN - Brasileiras em PLN, 2023, p. 1–37. Disponível em: <https://brasileiraspln.com/livro-pln/2a-edicao/parte-dados-avaliacao/cap-dataset-corpus/cap-dataset-corpus.pdf>.
GARCIA, A.C. Ética e inteligência artificial. Computação Brasil, n. 43, p. 14-22, 2020. https://doi.org/10.5753/compbr.2020.43.1791.
HALLIDAY, M.A.K. Corpus studies and probabilistic grammar. In AIJMER, K.; ALTENBERG, B. (Orgs). English corpus linguistics: Studies in honour of Jan Svartivik, London: Longman, 2014. p. 42-55.
PACE SIGGE, M. Where Corpus Linguistics and Artificial Intelligence (AI) Meet. In: Spreading Activation, Lexical Priming and the Semantic Web: Early Psycholinguistic Theories, Corpus Linguistics and AI Applications. Cham: Palgrave Pivot, 2018. p. 29–82. DOI: 10.1007/978-3-319-90719-2_3.
PASSARELLI, B.; GOMES, A.C.F. Transliteracias: A Terceira Onda Informacional nas Humanidades Digitais. Revista Ibero-Americana de Ciência da Informação, v. 13, n. 1, p. 253–275, 2020. DOI: https://doi.org/10.26512/rici.v13.n1.2020.29527
SANTOS, M.L.B. The “so-called” UGC: an updated definition of user-generated content in the age of social media. Online Information Review, v. 46, n. 1, p. 95–113, 2021. DOI: https://doi.org/10.1108/oir-06-2020-0258
SARDINHA, T.B. AI-generated vs human-authored texts: A multidimensional comparison. Applied Corpus Linguistics, v. 4, n. 1, p. 100083, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100083
SARDINHA, T.B. Linguística de Corpus: histórico e problemática. DELTA: Documentação de Estudos em Linguística Teórica e Aplicada, v. 16, n. 2, p. 323–367, 2000. DOI: https://doi.org/10.1590/s0102-44502000000200005
SINCLAIR, J. Corpus, Concordance, Collocation. [s.l.]: Oxford University Press, USA, 1991.
SHORMANI, M.Q. What fifty-one years of Linguistics and Artificial Intelligence research tell us about their correlation: A scientometric review. arXiv:2411.19858, 2024. DOI: https://doi.org/10.48550/arXiv.2411.19858
TAGNIN, S.E.O. A Linguística de Corpus vai desbravando novos horizontes. In FINATTO, MJB; REBECHI, T.; SARMENTO, S; BOCORNY, A. EP (Org). Linguística de corpus: perspectivas. Porto Alegre: Instituto de Letras da UFGRS, p. 11-15, 2018.
VAN ECK, N.Jan; WALTMAN, L. VOSviewer manual. Leiden: Univeristeit Leiden, v. 1, n. 1, p. 1-53, 2013.
VIANA, V.; TAGNIN, S.E.O. Corpora na Tradução. São Paulo: HUB Editorial, 2015.
WU, S.; IRSOY, O.; LU, S.; et al. BloombergGPT: A Large Language Model for Finance. arXiv.org. Disponível em: <https://arxiv.org/abs/2303.17564>.
ZHAO, B. Web Scraping. In: Encyclopedia of Big Data. Cham: Springer International Publishing, 2022, p. 951–953. DOI: http://dx.doi.org/10.1007/978-3-319-32010-6_483.
Downloads
Publicado
Edição
Seção
Categorias
Licença
Copyright (c) 2026 Jackson Wilke da Cruz Souza (Autor)

Este trabalho está licenciado sob uma licença Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License.
Autores que publicam nesta revista concordam com os seguintes termos:
Autores mantêm os direitos autorais e concedem à revista o direito de primeira publicação, com o trabalho simultaneamente licenciado sob a Creative Commons Attribution License, permitindo o compartilhamento do trabalho com reconhecimento da autoria do trabalho e publicação inicial nesta revista.
Autores têm autorização para assumir contratos adicionais separadamente, para distribuição não-exclusiva da versão do trabalho publicada nesta revista (ex.: publicar em repositório institucional ou como capítulo de livro), com reconhecimento de autoria e publicação inicial nesta revista.


