Corpus TED – Escrita em Desenvolvimento

O Corpus TED – Escrita em Desenvolvimento integra o DOESTE e reúne textos produzidos por estudantes em contexto escolar. O corpus foi constituído para apoiar pesquisas sobre o desenvolvimento da escrita e sobre aspectos linguísticos, textuais e discursivos das produções.

Composição

O TED é composto por uma amostra brasileira, em português brasileiro (pt-BR), e uma amostra portuguesa, em português europeu (pt-PT). Os participantes pertencem a diferentes etapas da educação básica.

Os textos foram produzidos a partir de tarefas de escrita controladas e comparáveis. No modelo de metadados do DOESTE, o TED pertence ao domínio Escolar e contempla atualmente os propósitos comunicativos Narrar e Argumentar. Domínio, propósito comunicativo e gênero textual são tratados como conceitos distintos.

Houve autorização formal para a participação e o uso científico dos textos nas amostras brasileira e portuguesa. Após a coleta, as produções passaram por etapas de preparação para tratamento computacional, incluindo transcrição e organização dos dados. Para conhecer os procedimentos de constituição e preparação do corpus, consulte a página de metodologia.

Estrutura e anotação

Os documentos são estruturados em TEI/XML e recebem anotação linguística automática. Essa organização permite realizar buscas por formas, lemas e categorias linguísticas, examinar ocorrências em contexto, comparar subconjuntos do corpus e consultar estatísticas dos textos.

Metadados

Os documentos podem conter metadados relativos à identificação do texto e do participante, à língua, ao domínio, ao propósito comunicativo, à data de produção, à idade e ao gênero informado pelo participante, à residência no momento da produção, à instituição de ensino e ao ano escolar. A cobertura desses campos não é necessariamente integral em todos os documentos; os filtros e resultados devem ser interpretados considerando essa condição.

Aspectos éticos e acesso

A constituição das amostras brasileira e portuguesa foi realizada mediante autorização formal para participação e uso científico dos textos, com medidas de proteção à identidade dos participantes. A disponibilização de textos, metadados e outros recursos do corpus observa essas condições éticas. A autorização para uso científico não constitui, por si só, licença de reutilização ou redistribuição dos dados.

Atualização dos dados

Dados incorporados ao histórico versionado do DOESTE em 23 de agosto de 2026.