Metodologia

Esta página descreve, de forma simplificada, como o Corpus TEJ foi construído. O objetivo é tornar o processo metodológico transparente e permitir que outros pesquisadores compreendam, utilizem ou reproduzam o corpus.


1. Seleção dos textos

Os textos do Corpus TEJ foram coletados a partir de portais jornalísticos de ampla circulação no Brasil. A escolha dessas fontes levou em consideração:

O foco foi reunir textos representativos do jornalismo digital contemporâneo em português brasileiro.


2. Coleta automatizada

A coleta dos textos foi realizada com o auxílio de scripts em Python, que acessam páginas públicas da web e identificam automaticamente os links das notícias.

Em seguida, cada página foi processada para extrair apenas o conteúdo principal da notícia, evitando elementos como:

Esse processo garante que o corpus contenha essencialmente o texto jornalístico.


3. Extração do texto

O conteúdo textual foi extraído com base na estrutura HTML das páginas, por meio da identificação de elementos específicos (tags e classes) que delimitam o corpo da notícia.

Esse procedimento foi ajustado ao longo do processo, a partir da análise de diferentes páginas, para garantir maior consistência na recuperação dos textos.


4. Organização e estruturação (TEI/XML)

Após a coleta, os textos foram convertidos para o formato TEI/XML, um padrão internacional utilizado na organização de corpora linguísticos.

Nessa etapa, cada documento passa a ter uma estrutura definida, incluindo:

Essa padronização permite que os textos sejam analisados de forma sistemática.


5. Tratamento do texto

Durante o processamento, foram removidos elementos que não fazem parte do conteúdo principal da notícia, como chamadas de navegação ou trechos repetidos da página.

Importante:

✔ O conteúdo verbal dos textos foi preservado

✔ Não houve correção ortográfica ou gramatical

Isso garante que o corpus represente o uso real da língua.


6. Anotação linguística

Os textos foram automaticamente anotados com informações linguísticas, utilizando o sistema UDPipe.

Essa anotação inclui:

Essas informações permitem realizar buscas mais avançadas, como localizar padrões gramaticais ou estruturas específicas.


7. Integração no DOESTE

Após o processamento, os textos foram integrados ao repositório DOESTE, utilizando a plataforma TEITOK.

Nesse ambiente, é possível:


8. Limitações

Como parte do processo foi automatizada, podem ocorrer:

Essas limitações são comuns em corpora de grande escala e não comprometem seu uso para análises gerais. Ainda assim, sugestões, correções ou relatos de inconsistências são bem-vindos e podem ser encaminhados para: gpelt@ufersa.edu.br.


9. Atualização do corpus

O Corpus TEJ está em desenvolvimento contínuo. Novos textos podem ser incorporados ao longo do tempo, ampliando sua representatividade.