Corpus TEJ – Escrita Jornalística
O Corpus TEJ integra o repositório DOESTE e reúne textos jornalísticos da imprensa digital brasileira, coletados e organizados para fins de pesquisa linguística, textual e discursiva.
Descrição geral
Os textos que compõem o Corpus TEJ foram coletados de portais jornalísticos de ampla circulação e estruturados no padrão TEI (Text Encoding Initiative). Além da organização estrutural, os documentos são enriquecidos com metadados e anotações linguísticas, permitindo sua exploração por meio de consultas sistemáticas.
O corpus foi concebido como uma infraestrutura de pesquisa, possibilitando a análise de padrões lexicais, gramaticais e discursivos com base em dados autênticos de uso da língua.
O processo de construção do Corpus TEJ envolveu etapas de coleta automatizada, extração do conteúdo textual, organização em formato TEI/XML e anotação linguística automática. Essas etapas foram desenvolvidas com base em critérios metodológicos explícitos, visando garantir consistência, transparência e possibilidade de reprodução do corpus. Para uma descrição detalhada desses procedimentos, acesse a página de metodologia.
Metadados disponíveis
Cada texto do corpus é acompanhado por um conjunto de informações que permite diferentes recortes analíticos:
- Identificador
- Língua
- Fonte
- Título
- Subtítulo
- Ano
- Corpus
- Domínio
- Tema
- Propósito
Esses metadados podem ser utilizados para filtrar e comparar textos segundo critérios linguísticos e discursivos.
Estatísticas do corpus
O Corpus TEJ disponibiliza estatísticas automaticamente geradas pelo sistema TEITOK, incluindo:
-
Número de palavras (tokens)
-
Vocabulário (types)
-
Índice de diversidade lexical (TTR)
As estatísticas são calculadas automaticamente pelo TEITOK e podem ser consultadas por documento.
Objetivo
O Corpus TEJ tem como objetivo organizar e disponibilizar um conjunto representativo de textos jornalísticos em língua portuguesa, coletados a partir de fontes públicas, oferecendo uma base empírica para investigações linguísticas e aplicações didáticas.
Sua estrutura atende tanto às demandas da pesquisa acadêmica quanto ao uso pedagógico em contextos de ensino de línguas, leitura crítica e letramentos contemporâneos.
Acesso aos textos
O Corpus TEJ foi construído exclusivamente a partir de páginas públicas da web, respeitando os direitos autorais e as condições de acesso estabelecidas pelos veículos de comunicação.
Cada texto mantém crédito explícito à fonte original, indicando o nome do portal e um link direto para a notícia, garantindo transparência e rastreabilidade.
Do ponto de vista ético, o corpus destina-se estritamente a fins científicos e educacionais, não reproduzindo nem redistribuindo conteúdos com finalidade comercial.
Clique aqui para acessar os textos do Corpus TEJ.
Informações técnicas
Última atualização: 24 de março de 2026
Como citar o Corpus TEJ
MARTINS, Mário; et al. Corpus TEJ – Escrita Jornalística. DOESTE – Repositório de Escrita para Fins Investigativos. UFERSA, 2026. Versão 1.0. Disponível em: https://doeste.ufersa.edu.br/tej