Metodologia
Esta página descreve, de forma simplificada, como o Corpus TEJ foi construído. O objetivo é tornar o processo metodológico transparente e permitir que outros pesquisadores compreendam, utilizem ou reproduzam o corpus.
1. Seleção dos textos
Os textos do Corpus TEJ foram coletados a partir de portais jornalísticos de ampla circulação no Brasil. A escolha dessas fontes levou em consideração:
-
regularidade de publicação
-
diversidade temática (economia, educação, política, saúde, entre outros)
-
acesso público aos conteúdos
O foco foi reunir textos representativos do jornalismo digital contemporâneo em português brasileiro.
2. Coleta automatizada
A coleta dos textos foi realizada com o auxílio de scripts em Python, que acessam páginas públicas da web e identificam automaticamente os links das notícias.
Em seguida, cada página foi processada para extrair apenas o conteúdo principal da notícia, evitando elementos como:
-
menus de navegação
-
anúncios
-
links do tipo “Leia também” ou “Veja mais”
Esse processo garante que o corpus contenha essencialmente o texto jornalístico.
3. Extração do texto
O conteúdo textual foi extraído com base na estrutura HTML das páginas, por meio da identificação de elementos específicos (tags e classes) que delimitam o corpo da notícia.
Esse procedimento foi ajustado ao longo do processo, a partir da análise de diferentes páginas, para garantir maior consistência na recuperação dos textos.
4. Organização e estruturação (TEI/XML)
Após a coleta, os textos foram convertidos para o formato TEI/XML, um padrão internacional utilizado na organização de corpora linguísticos.
Nessa etapa, cada documento passa a ter uma estrutura definida, incluindo:
-
identificação do texto
-
título e subtítulo
-
metadados (fonte, ano, tema etc.)
-
divisão em parágrafos
Essa padronização permite que os textos sejam analisados de forma sistemática.
5. Tratamento do texto
Durante o processamento, foram removidos elementos que não fazem parte do conteúdo principal da notícia, como chamadas de navegação ou trechos repetidos da página.
Importante:
✔ O conteúdo verbal dos textos foi preservado
✔ Não houve correção ortográfica ou gramatical
Isso garante que o corpus represente o uso real da língua.
6. Anotação linguística
Os textos foram automaticamente anotados com informações linguísticas, utilizando o sistema UDPipe.
Essa anotação inclui:
-
segmentação em palavras (tokenização)
-
forma básica das palavras (lemas)
-
classes gramaticais
-
relações sintáticas (quando disponíveis)
Essas informações permitem realizar buscas mais avançadas, como localizar padrões gramaticais ou estruturas específicas.
7. Integração no DOESTE
Após o processamento, os textos foram integrados ao repositório DOESTE, utilizando a plataforma TEITOK.
Nesse ambiente, é possível:
-
pesquisar palavras e expressões
-
filtrar textos por metadados
-
explorar padrões linguísticos
8. Limitações
Como parte do processo foi automatizada, podem ocorrer:
-
pequenas falhas na extração do texto
-
erros pontuais na anotação linguística
Essas limitações são comuns em corpora de grande escala e não comprometem seu uso para análises gerais. Ainda assim, sugestões, correções ou relatos de inconsistências são bem-vindos e podem ser encaminhados para: gpelt@ufersa.edu.br.
9. Atualização do corpus
O Corpus TEJ está em desenvolvimento contínuo. Novos textos podem ser incorporados ao longo do tempo, ampliando sua representatividade.