Desafios da Linguística de Corpus impostos pela Inteligência Artificial

rediscutindo alguns conceitos

Autores

DOI:

https://doi.org/10.14393/LL63-v42S-2026-05

Palavras-chave:

Linguística de Corpus, Inteligência Artificial, Autenticidade, Representatividade, Large Language Models

Resumo

Neste artigo discuto os impactos da Inteligência Artificial (IA), especialmente dos Large Language Models (LLMs), sobre conceitos fundamentais da Linguística de Corpus (LC), a saber, autenticidade, naturalidade e representatividade. A partir de uma revisão de pesquisas recentes, evidencio a crescente integração entre IA e LC e os desafios metodológicos decorrentes, como a escolha adequada de textos e a distinção entre produções autênticas e artificiais. Ainda, discuto sobre a inclusão indiscriminada de textos gerados por IA nos corpora e como isso pode comprometer a validade das análises linguísticas. Isso culminará em questões técnicas e implicações simbólicas relacionadas ao conceito de autoria, identidade e confiança nos modos de circulação e produção científica. Por fim, proponho alguns encaminhamentos vislumbrando oportunidades dessa aproximação entre LC e IA.

Downloads

Os dados de download ainda não estão disponíveis.

Biografia do Autor

  • Jackson Wilke da Cruz Souza, Universidade Federal da Bahia

    Doutor em Linguística pela Universidade Federal de São Carlos (UFSCar), com especialização em Processamento de Línguas Naturais (PLN) e Inteligência Artificial. Professor na Universidade Federal da Bahia (UFBA), vinculado ao Instituto de Ciência, Tecnologia e Inovação (ICTI) e ao Programa de Pós-Graduação em Língua e Cultura (PPGLinC/UFBA).

Referências

AYAPOVA, S. M.; SKRIPNIKOVA, A. I. Ai and human created media texts: experiment results. Herald of journalism, v. 64, n. 2, 2022. DOI: https://doi.org/10.26577/hj.2022.v64.i2.08

BURNHAM, T.F. Reconstrução-síntese de contribuições ao XI CINFORM, à guisa de apresentação. In BORGES, J; BARREIRA, M.I.J.S.; CUNHA, F.J.A.P. (Org.). Mundo digital: uma sociedade sem fronteiras? 1ed.João Pessoa: Ideia, 2014, v. 1, p. 7-20.

CURRY, N.; BAKER, P.; BROOKES, G. Generative AI for corpus approaches to discourse studies: A critical evaluation of ChatGPT. Applied Corpus Linguistics, v. 4, n. 1, p. 100082, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100082

CHEN, C. The citespace manual. College of Computing and Informatics, v. 1, n. 1, p. 1-84, 2014.

CHEUNG, L.; CROSTHWAITE, P. CorpusChat: integrating corpus linguistics and generative AI for academic writing development. Computer Assisted Language Learning, p. 1–27, 2025. DOI: https://doi.org/10.1080/09588221.2025.2506480.

DALTE, P. Inteligência artificial e poesia. Revista 2i: Estudos de Identidade e Intermedialidade, v. 2, n. 2, p. 165–177, 2020. DOI: https://doi.org/10.21814/2i.2505

FREITAS,. Dataset e corpus. In: CASELI, Helena de Medeiros; NUNES, Maria das Graças Volpe (Orgs.). Processamento de Linguagem Natural: Conceitos, Técnicas e Aplicações em Português. [s.l.]: BPLN - Brasileiras em PLN, 2023, p. 1–37. Disponível em: <https://brasileiraspln.com/livro-pln/2a-edicao/parte-dados-avaliacao/cap-dataset-corpus/cap-dataset-corpus.pdf>.

GARCIA, A.C. Ética e inteligência artificial. Computação Brasil, n. 43, p. 14-22, 2020. https://doi.org/10.5753/compbr.2020.43.1791.

HALLIDAY, M.A.K. Corpus studies and probabilistic grammar. In AIJMER, K.; ALTENBERG, B. (Orgs). English corpus linguistics: Studies in honour of Jan Svartivik, London: Longman, 2014. p. 42-55.

PACE SIGGE, M. Where Corpus Linguistics and Artificial Intelligence (AI) Meet. In: Spreading Activation, Lexical Priming and the Semantic Web: Early Psycholinguistic Theories, Corpus Linguistics and AI Applications. Cham: Palgrave Pivot, 2018. p. 29–82. DOI: 10.1007/978-3-319-90719-2_3.

PASSARELLI, B.; GOMES, A.C.F. Transliteracias: A Terceira Onda Informacional nas Humanidades Digitais. Revista Ibero-Americana de Ciência da Informação, v. 13, n. 1, p. 253–275, 2020. DOI: https://doi.org/10.26512/rici.v13.n1.2020.29527

SANTOS, M.L.B. The “so-called” UGC: an updated definition of user-generated content in the age of social media. Online Information Review, v. 46, n. 1, p. 95–113, 2021. DOI: https://doi.org/10.1108/oir-06-2020-0258

SARDINHA, T.B. AI-generated vs human-authored texts: A multidimensional comparison. Applied Corpus Linguistics, v. 4, n. 1, p. 100083, 2024. DOI: https://doi.org/10.1016/j.acorp.2023.100083

SARDINHA, T.B. Linguística de Corpus: histórico e problemática. DELTA: Documentação de Estudos em Linguística Teórica e Aplicada, v. 16, n. 2, p. 323–367, 2000. DOI: https://doi.org/10.1590/s0102-44502000000200005

SINCLAIR, J. Corpus, Concordance, Collocation. [s.l.]: Oxford University Press, USA, 1991.

SHORMANI, M.Q. What fifty-one years of Linguistics and Artificial Intelligence research tell us about their correlation: A scientometric review. arXiv:2411.19858, 2024. DOI: https://doi.org/10.48550/arXiv.2411.19858

TAGNIN, S.E.O. A Linguística de Corpus vai desbravando novos horizontes. In FINATTO, MJB; REBECHI, T.; SARMENTO, S; BOCORNY, A. EP (Org). Linguística de corpus: perspectivas. Porto Alegre: Instituto de Letras da UFGRS, p. 11-15, 2018.

VAN ECK, N.Jan; WALTMAN, L. VOSviewer manual. Leiden: Univeristeit Leiden, v. 1, n. 1, p. 1-53, 2013.

VIANA, V.; TAGNIN, S.E.O. Corpora na Tradução. São Paulo: HUB Editorial, 2015.

WU, S.; IRSOY, O.; LU, S.; et al. BloombergGPT: A Large Language Model for Finance. arXiv.org. Disponível em: <https://arxiv.org/abs/2303.17564>.

ZHAO, B. Web Scraping. In: Encyclopedia of Big Data. Cham: Springer International Publishing, 2022, p. 951–953. DOI: http://dx.doi.org/10.1007/978-3-319-32010-6_483.

Downloads

Publicado

27-07-2026

Como Citar

Desafios da Linguística de Corpus impostos pela Inteligência Artificial: rediscutindo alguns conceitos. Letras & Letras, Uberlândia, v. 42, n. supl., p. p. 01–11, 2026. DOI: 10.14393/LL63-v42S-2026-05. Disponível em: https://seer.ufu.br/index.php/letraseletras/article/view/78970. Acesso em: 28 jul. 2026.