Desafios da Linguística de Corpus impostos pela Inteligência Artificial
rediscutindo alguns conceitos
DOI:
https://doi.org/10.14393/LL63-v42S-2026-05Keywords:
Linguística de Corpus, Inteligência Artificial, Autenticidade, Representatividade, Large Language ModelsAbstract
Neste artigo discuto os impactos da Inteligência Artificial (IA), especialmente dos Large Language Models (LLMs), sobre conceitos fundamentais da Linguística de Corpus (LC), a saber, autenticidade, naturalidade e representatividade. A partir de uma revisão de pesquisas recentes, evidencio a crescente integração entre IA e LC e os desafios metodológicos decorrentes, como a escolha adequada de textos e a distinção entre produções autênticas e artificiais. Ainda, discuto sobre a inclusão indiscriminada de textos gerados por IA nos corpora e como isso pode comprometer a validade das análises linguísticas. Isso culminará em questões técnicas e implicações simbólicas relacionadas ao conceito de autoria, identidade e confiança nos modos de circulação e produção científica. Por fim, proponho alguns encaminhamentos vislumbrando oportunidades dessa aproximação entre LC e IA.
Downloads
References
AYAPOVA, S. M.; SKRIPNIKOVA, A. I. Ai and human created media texts: experiment results. Herald of journalism, v. 64, n. 2, 2022. DOI: https://doi.org/10.26577/hj.2022.v64.i2.08
BURNHAM, T.F. Reconstrução-síntese de contribuições ao XI CINFORM, à guisa de apresentação. In BORGES, J; BARREIRA, M.I.J.S.; CUNHA, F.J.A.P. (Org.). Mundo digital: uma sociedade sem fronteiras? 1ed.João Pessoa: Ideia, 2014, v. 1, p. 7-20.
CURRY, N.; BAKER, P.; BROOKES, G. Generative AI for corpus approaches to discourse studies: A critical evaluation of ChatGPT. Applied Corpus Linguistics, v. 4, n. 1, p. 100082, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100082
CHEN, C. The citespace manual. College of Computing and Informatics, v. 1, n. 1, p. 1-84, 2014.
CHEUNG, L.; CROSTHWAITE, P. CorpusChat: integrating corpus linguistics and generative AI for academic writing development. Computer Assisted Language Learning, p. 1–27, 2025. DOI: https://doi.org/10.1080/09588221.2025.2506480.
DALTE, P. Inteligência artificial e poesia. Revista 2i: Estudos de Identidade e Intermedialidade, v. 2, n. 2, p. 165–177, 2020. DOI: https://doi.org/10.21814/2i.2505
FREITAS,. Dataset e corpus. In: CASELI, Helena de Medeiros; NUNES, Maria das Graças Volpe (Orgs.). Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português. [s.l.]: BPLN - Brasileiras em PLN, 2023, p. 1–37. Disponível em: <https://brasileiraspln.com/livro-pln/2a-edicao/parte-dados-avaliacao/cap-dataset-corpus/cap-dataset-corpus.pdf>.
GARCIA, A.C. Ética e inteligência artificial. Computação Brasil, n. 43, p. 14-22, 2020. https://doi.org/10.5753/compbr.2020.43.1791.
HALLIDAY, M.A.K. Corpus studies and probabilistic grammar. In AIJMER, K.; ALTENBERG, B. (Orgs). English corpus linguistics: Studies in honour of Jan Svartivik, London: Longman, 2014. p. 42-55.
PACE SIGGE, M. Where Corpus Linguistics and Artificial Intelligence (AI) Meet. In: Spreading Activation, Lexical Priming and the Semantic Web: Early Psycholinguistic Theories, Corpus Linguistics and AI Applications. Cham: Palgrave Pivot, 2018. p. 29–82. DOI: 10.1007/978-3-319-90719-2_3.
PASSARELLI, B.; GOMES, A.C.F. Transliteracias: A Terceira Onda Informacional nas Humanidades Digitais. Revista Ibero-Americana de Ciência da Informação, v. 13, n. 1, p. 253–275, 2020. DOI: https://doi.org/10.26512/rici.v13.n1.2020.29527
SANTOS, M.L.B. The “so-called” UGC: an updated definition of user-generated content in the age of social media. Online Information Review, v. 46, n. 1, p. 95–113, 2021. DOI: https://doi.org/10.1108/oir-06-2020-0258
SARDINHA, T.B. AI-generated vs human-authored texts: A multidimensional comparison. Applied Corpus Linguistics, v. 4, n. 1, p. 100083, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100083
SARDINHA, T.B. Linguística de Corpus: histórico e problemática. DELTA: Documentação de Estudos em Linguística Teórica e Aplicada, v. 16, n. 2, p. 323–367, 2000. DOI: https://doi.org/10.1590/s0102-44502000000200005
SINCLAIR, J. Corpus, Concordance, Collocation. [s.l.]: Oxford University Press, USA, 1991.
SHORMANI, M.Q. What fifty-one years of Linguistics and Artificial Intelligence research tell us about their correlation: A scientometric review. arXiv:2411.19858, 2024. DOI: https://doi.org/10.48550/arXiv.2411.19858
TAGNIN, S.E.O. A Linguística de Corpus vai desbravando novos horizontes. In FINATTO, MJB; REBECHI, T.; SARMENTO, S; BOCORNY, A. EP (Org). Linguística de corpus: perspectivas. Porto Alegre: Instituto de Letras da UFGRS, p. 11-15, 2018.
VAN ECK, N.Jan; WALTMAN, L. VOSviewer manual. Leiden: Univeristeit Leiden, v. 1, n. 1, p. 1-53, 2013.
VIANA, V.; TAGNIN, S.E.O. Corpora na Tradução. São Paulo: HUB Editorial, 2015.
WU, S.; IRSOY, O.; LU, S.; et al. BloombergGPT: A Large Language Model for Finance. arXiv.org. Disponível em: <https://arxiv.org/abs/2303.17564>.
ZHAO, B. Web Scraping. In: Encyclopedia of Big Data. Cham: Springer International Publishing, 2022, p. 951–953. DOI: http://dx.doi.org/10.1007/978-3-319-32010-6_483.
Downloads
Published
Issue
Section
Categories
License
Copyright (c) 2026 Jackson Wilke da Cruz Souza (Autor)

This work is licensed under a Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License.
The authors retain author's rights but grant the journal the right of firsth publication. The works are licensed under Creative Commons Attribution License, which allows sharing provided that the authors and this journal are properly ackonwledged.






