Corpus TEJ – Escrita Jornalística

O Corpus TEJ integra o repositório DOESTE e reúne textos jornalísticos da imprensa digital brasileira, coletados e organizados para fins de pesquisa linguística, textual e discursiva.

Descrição geral

Os textos que compõem o Corpus TEJ foram coletados de portais jornalísticos de ampla circulação e estruturados no padrão TEI (Text Encoding Initiative). Além da organização estrutural, os documentos são enriquecidos com metadados e anotações linguísticas, permitindo sua exploração por meio de consultas sistemáticas.

O corpus foi concebido como uma infraestrutura de pesquisa, possibilitando a análise de padrões lexicais, gramaticais e discursivos com base em dados autênticos de uso da língua.

O processo de construção do Corpus TEJ envolveu etapas de coleta automatizada, extração do conteúdo textual, organização em formato TEI/XML e anotação linguística automática. Essas etapas foram desenvolvidas com base em critérios metodológicos explícitos, visando garantir consistência, transparência e possibilidade de reprodução do corpus. Para uma descrição detalhada desses procedimentos, acesse a página de metodologia.

Metadados disponíveis

Cada texto do corpus é acompanhado por um conjunto de informações que permite diferentes recortes analíticos:

Esses metadados podem ser utilizados para filtrar e comparar textos segundo critérios linguísticos e discursivos.

Estatísticas do corpus

O Corpus TEJ disponibiliza estatísticas automaticamente geradas pelo sistema TEITOK, incluindo:

As estatísticas são calculadas automaticamente pelo TEITOK e podem ser consultadas por documento.

Objetivo

O Corpus TEJ tem como objetivo organizar e disponibilizar um conjunto representativo de textos jornalísticos em língua portuguesa, coletados a partir de fontes públicas, oferecendo uma base empírica para investigações linguísticas e aplicações didáticas.

Sua estrutura atende tanto às demandas da pesquisa acadêmica quanto ao uso pedagógico em contextos de ensino de línguas, leitura crítica e letramentos contemporâneos.

Acesso aos textos

O Corpus TEJ foi construído exclusivamente a partir de páginas públicas da web, respeitando os direitos autorais e as condições de acesso estabelecidas pelos veículos de comunicação.

Cada texto mantém crédito explícito à fonte original, indicando o nome do portal e um link direto para a notícia, garantindo transparência e rastreabilidade.

Do ponto de vista ético, o corpus destina-se estritamente a fins científicos e educacionais, não reproduzindo nem redistribuindo conteúdos com finalidade comercial.

Clique aqui para acessar os textos do Corpus TEJ.


Informações técnicas

Última atualização: 24 de março de 2026


Como citar o Corpus TEJ

MARTINS, Mário; et al. Corpus TEJ – Escrita Jornalística. DOESTE – Repositório de Escrita para Fins Investigativos. UFERSA, 2026. Versão 1.0. Disponível em: https://doeste.ufersa.edu.br/tej