Metodologia

Esta página descreve, de forma simplificada, como o Corpus TEJ foi construído. O objetivo é tornar o processo metodológico transparente e permitir que outros pesquisadores compreendam, utilizem ou reproduzam o corpus.


1. Seleção dos textos

Os textos do Corpus TEJ foram coletados a partir de portais jornalísticos de ampla circulação no Brasil. A escolha dessas fontes levou em consideração:

O foco foi reunir textos representativos do jornalismo digital contemporâneo em português brasileiro.


2. Coleta automatizada

A coleta dos textos foi realizada com o auxílio de scripts em Python, que acessam páginas públicas da web e identificam automaticamente os links das notícias.

Em seguida, cada página foi processada para extrair apenas o conteúdo principal da notícia, evitando elementos como:

Esse processo garante que o corpus contenha essencialmente o texto jornalístico.


3. Extração do texto

O conteúdo textual foi extraído com base na estrutura HTML das páginas, por meio da identificação de elementos específicos (tags e classes) que delimitam o corpo da notícia.

Esse procedimento foi ajustado ao longo do processo, a partir da análise de diferentes páginas, para garantir maior consistência na recuperação dos textos.


4. Organização e estruturação (TEI/XML)

Após a coleta, os textos foram convertidos para o formato TEI/XML, um padrão internacional utilizado na organização de corpora linguísticos.

Nessa etapa, cada documento passa a ter uma estrutura definida, incluindo:

Essa padronização permite que os textos sejam analisados de forma sistemática.


5. Tratamento do texto

Durante o processamento, foram removidos elementos que não fazem parte do conteúdo principal da notícia, como chamadas de navegação ou trechos repetidos da página.

Importante:

✔ O conteúdo verbal dos textos foi preservado

✔ Não houve correção ortográfica ou gramatical

Isso garante que o corpus represente o uso real da língua.


6. Anotação linguística

Os textos foram automaticamente anotados com informações linguísticas, utilizando o sistema UDPipe.

Essa anotação inclui:

Essas informações permitem realizar buscas mais avançadas, como localizar padrões gramaticais ou estruturas específicas.


7. Integração no DOESTE

Após o processamento, os textos foram integrados ao repositório DOESTE, utilizando a plataforma TEITOK.

Nesse ambiente, é possível:


8. Direitos, acesso e solicitação de remoção

O Corpus TEJ é mantido para fins de pesquisa científica e de ensino, sem finalidade comercial. Os textos que integram o corpus foram originalmente publicados em portais jornalísticos na web e permanecem vinculados às respectivas fontes por meio dos metadados e, quando disponível, do endereço da publicação original.

A inclusão de um texto no Corpus TEJ não implica que seu conteúdo esteja livre de direitos autorais nem transfere ao DOESTE ou ao GPELT a titularidade sobre a publicação original.

O acesso público ao corpus é destinado à exploração linguística por meio das funcionalidades de pesquisa disponibilizadas pelo sistema, como consultas ao corpus, resultados em contexto, metadados, estatísticas e recursos de análise linguística. O acesso ao conteúdo integral dos documentos e a formatos integrais de exportação é restrito a usuários previamente autorizados para fins de pesquisa.

Titulares de direitos, autores, representantes ou outros interessados podem solicitar a análise de determinado documento para fins de correção, restrição de acesso ou remoção. A solicitação deve ser encaminhada para gpelt@ufersa.edu.br e, sempre que possível, informar o documento ou obra em questão, o identificador correspondente no Corpus TEJ, o endereço da publicação original, a justificativa da solicitação e a providência requerida.

As solicitações recebidas serão analisadas pela equipe responsável pelo corpus. Quando as circunstâncias recomendarem, o acesso ao documento poderá ser preventivamente restringido durante a análise. A decisão e as providências adotadas serão registradas e comunicadas ao solicitante, quando houver informações de contato disponíveis.


9. Limitações

Como parte do processo foi automatizada, podem ocorrer:

Essas limitações são comuns em corpora de grande escala e não comprometem seu uso para análises gerais. Ainda assim, sugestões, correções ou relatos de inconsistências são bem-vindos e podem ser encaminhados para: gpelt@ufersa.edu.br.


10. Atualização do corpus

O Corpus TEJ está em desenvolvimento contínuo. Novos textos podem ser incorporados ao longo do tempo, ampliando sua representatividade.