Metodologia do Corpus TEK

O Corpus TEK – Redações Nota Mil integra o DOESTE – Repositório de Escrita para Fins Investigativos. Esta página descreve a constituição documental e o processamento técnico do corpus.

1. Natureza e composição

O TEK é um corpus especializado de 128 redações do Exame Nacional do Ensino Médio que receberam nota 1000. O conjunto cobre edições de 2012 a 2024 e reúne textos em português brasileiro, de domínio Escolar e propósito comunicativo Argumentar.

A inclusão no conjunto depende da documentação da redação como texto nota mil na fonte utilizada. O corpus não constitui uma amostra aleatória de participantes do ENEM e não representa, por si só, todas as redações produzidas ou avaliadas no período.

2. Procedência, autoria e temas

Os textos foram reunidos a partir de materiais públicos que reproduzem redações nota mil. Os documentos preservam os nomes dos autores tal como registrados nas fontes consultadas. A autoria da redação é mantida separada do título documental criado para organização do corpus.

A proveniência atualmente documentada inclui uma página agregadora do G1 para os 118 documentos do conjunto inicial e material institucional do INEP para os dez textos de 2024. A URL agregadora não é tratada como URL individual de cada redação. Quando a data de publicação ou de acesso não estava documentada, ela não foi criada por inferência.

Os temas foram harmonizados segundo a formulação oficial identificada em materiais do INEP. O ano registrado corresponde ao ano do exame, e não à data de publicação da fonte.

3. Metadados

Os metadados documentais incluem identificador do documento, identificador do corpus, língua, domínio, propósito comunicativo, autoria, exame, ano do exame, tema oficial, nota e proveniência. Na interface de pesquisa, ano, tema e autor constituem os filtros prioritários.

4. Representação TEI/XML

A arquitetura distingue duas camadas. Os arquivos de fonte canônica conservam o texto e os metadados estabilizados. A partir deles, um pipeline reproduzível gera os documentos anotados destinados à publicação. Os documentos são estruturados em cabeçalho TEI, texto, parágrafos e, na camada derivada, sentenças e tokens.

Essa separação permite refazer a anotação sem transformar o texto canônico. Os índices de busca também são artefatos derivados.

5. Anotação linguística

A anotação foi produzida automaticamente com o UDPipe e o modelo fixado portuguese-bosque-ud-2.17-251125. O processamento acrescenta segmentação em sentenças, lemas, categorias UPOS, traços morfológicos quando atribuídos pelo modelo e relações de dependência sintática.

Não foi realizada revisão humana sistemática da anotação automática. Por isso, lemas, categorias e análises sintáticas devem ser interpretados como resultados do modelo empregado, sujeitos a erros.

6. Forma superficial e multiword tokens

O elemento <tok> representa a unidade ortográfica visível. Quando o UDPipe analisa uma contração em mais de um componente gramatical, esses componentes são registrados em elementos <dtok> internos. Assim, a forma superficial da permanece da, enquanto as análises de de e a continuam disponíveis.

A integridade foi testada automaticamente por documento e por parágrafo. Os 128 documentos anotados reproduzem integralmente os respectivos textos-fonte segundo comparação NFC exata, incluindo caracteres, acentuação, capitalização, pontuação e espaçamento.

7. Consulta e limitações

A consulta CQP principal usa uma posição por unidade ortográfica, preservando a leitura comum das redações. Em multiword tokens, os atributos dos componentes internos são agregados com + na posição superficial. Essa decisão evita expandir contrações na concordância, mas consultas voltadas especificamente a componentes internos exigem considerar essa representação ou consultar o TEI/XML.

Além das limitações da anotação automática, a documentação de proveniência não possui a mesma granularidade em todos os documentos: a URL individual de cada redação e as datas de publicação e recuperação nem sempre estão registradas.

8. Atualização

O TEI-fonte é a camada canônica do corpus. Correções textuais ou de metadados devem ser realizadas nessa camada e seguidas pela regeneração da anotação e dos índices derivados. A informação pública de atualização deverá ser gerada durante a implantação a partir do histórico Git dos dados, conforme a política do DOESTE.