Metodologia do Corpus TED
O Corpus TED – Escrita em Desenvolvimento, cuja sigla significa Textos em Desenvolvimento, integra o DOESTE – Repositório de Escrita para Fins Investigativos. O corpus reúne produções escritas de estudantes em contexto escolar, provenientes de amostras constituídas no Brasil e em Portugal.
O TED foi concebido para apoiar investigações sobre a escrita em desenvolvimento e sobre fenômenos linguísticos, textuais e discursivos associados à produção escolar. Sua composição permite observar textos produzidos em diferentes etapas da escolarização, em português brasileiro e português europeu, a partir de tarefas de escrita controladas.
A história do corpus compreende duas grandes fases. A Fase A corresponde à constituição das amostras portuguesa e brasileira, incluindo seleção de participantes, aplicação das tarefas, coleta, transcrição e tratamento originalmente realizado. A Fase B corresponde à integração e ao enriquecimento técnico posterior no DOESTE, com representação em TEI/XML, harmonização de metadados, normalização ortográfica parcial, anotação linguística automática e disponibilização no TEITOK.
1. Desenho geral do corpus
A constituição inicial do TED esteve vinculada ao estudo do desenvolvimento linguístico na escrita escolar. Na pesquisa portuguesa original, diferentes anos escolares foram adotados como pontos de observação de estágios distintos da progressão escolar. Esse desenho transversal foi caracterizado como quasi-longitudinal: em vez de acompanhar os mesmos participantes ao longo de vários anos, foram comparados grupos situados em diferentes etapas da escolarização.
O desenho quasi-longitudinal está documentalmente estabelecido para a amostra portuguesa original. A amostra brasileira também foi constituída transversalmente, com estudantes de diferentes etapas escolares, mas não se estende automaticamente a ela toda a caracterização metodológica empregada na tese portuguesa.
Nas duas amostras, as produções foram obtidas por meio de tarefas controladas e funcionalmente comparáveis, orientadas aos propósitos comunicativos Narrar e Argumentar. No modelo conceitual atual do DOESTE, propósito comunicativo, gênero textual e domínio são dimensões distintas. Por isso, a classificação de uma produção como orientada a Narrar ou Argumentar não determina automaticamente seu gênero textual.
O TED não constitui uma amostra estatisticamente representativa da população escolar brasileira ou portuguesa. Seus dados devem ser interpretados considerando os procedimentos de seleção, as localidades, os períodos de coleta, as etapas escolares e as condições específicas de cada amostra.
2. Constituição da amostra portuguesa
2.1 Instituições e participantes
A amostra portuguesa foi constituída no âmbito da pesquisa de doutorado que deu origem ao corpus. Inicialmente, foram selecionados aleatoriamente treze agrupamentos de escolas de ensino básico e secundário do distrito de Lisboa. Seis agrupamentos não responderam ao contato, três recusaram a participação e quatro aceitaram integrar a pesquisa.
As quatro instituições participantes eram públicas. Três estavam localizadas no concelho de Lisboa e uma no concelho de Torres Vedras. As direções das instituições escolheram autonomamente as turmas que participariam. Em razão do processo de adesão das escolas e de seleção das turmas, a amostra final foi caracterizada na tese como acidental ou de conveniência, isto é, não randomizada.
A amostra final descrita na tese compreendeu 122 participantes e 244 textos:
| Ano escolar | Participantes | Textos |
|---|---|---|
| 5.º ano | 26 | 52 |
| 7.º ano | 46 | 92 |
| 10.º ano | 50 | 100 |
| Total | 122 | 244 |
Foram considerados participantes nascidos em Portugal, falantes monolíngues de português europeu e provenientes de famílias também monolíngues de português europeu. Cada participante deveria produzir os dois textos previstos. Participantes que produziram somente um deles foram excluídos da amostra analisada na tese.
Para apoiar a caracterização e a aplicação dos critérios linguísticos, foi utilizado um questionário que incluía iniciais, turma, idade, local de nascimento, gênero, língua falada em casa com os responsáveis e média obtida na disciplina de Português no ano anterior.
2.2 Estado atual da amostra portuguesa
A tese documenta 244 textos portugueses. No conjunto atual do TED, encontram-se 243 documentos XML classificados como pt-PT: 52 associados ao 5.º ano, 92 ao 7.º e 99 ao 10.º. Essa diferença de um documento em relação à amostra original permanece sob revisão e deve ser considerada em estudos que pretendam reproduzir exatamente as contagens apresentadas na tese.
3. Constituição da amostra brasileira
A amostra brasileira foi efetivamente constituída com produções de estudantes de Caraúbas, Mossoró e Umarizal, no Rio Grande do Norte. Sua constituição seguiu o mesmo princípio geral empregado na amostra portuguesa: contato inicial com as instituições escolares e posterior articulação com professores e turmas para a aplicação das tarefas de escrita.
A coleta abrangeu estudantes do 5.º e do 9.º anos do ensino fundamental e do 3.º ano do ensino médio. A pesquisa brasileira adotou um desenho transversal baseado em corpus, voltado ao estudo do desenvolvimento linguístico na escrita escolar em diferentes etapas da escolarização.
Foi aplicado um questionário de caracterização que incluía, entre outros dados, iniciais, idade, local de nascimento, gênero e turma. O instrumento também continha perguntas sobre a língua falada pelo participante e pelos responsáveis em casa. O critério de monolinguismo em português brasileiro foi efetivamente aplicado, com exclusão dos textos de participantes que não satisfaziam esse critério.
As produções foram manuscritas, em contexto escolar, a partir de tarefas controladas e funcionalmente comparáveis às utilizadas na amostra portuguesa. Não houve intervenção docente durante a produção. Após a coleta, os textos foram transcritos segundo princípio semelhante ao fluxo empregado na amostra portuguesa e, posteriormente, integrados ao TED.
4. Tarefas de escrita e condições de produção
As tarefas de escrita constituem um componente central do desenho do TED. Elas estabelecem a situação comunicativa imediata das produções e devem ser consideradas na interpretação de escolhas lexicais, gramaticais, textuais e discursivas.
4.1 Tarefa orientada ao propósito Narrar
Na amostra portuguesa, o enunciado documentado na tese foi:
Estímulo 1 — tarefa de escrita de um texto narrativo:
Narra um facto marcante (real ou imaginado) que tu e teu(tua) melhor amigo(a) viveram durante o último verão.
Na amostra brasileira, o enunciado documentado no parecer do CEP/UERN foi:
Estímulo 1 — narrativo:
Conte uma história marcante (real ou imaginada) que você e seu(sua) melhor amigo(a) viveram durante as últimas férias escolares.
A formulação brasileira preserva a situação comunicativa da tarefa portuguesa, mas adapta a referência temporal de “último verão” para “últimas férias escolares”. As duas tarefas são funcionalmente comparáveis, embora seus enunciados não sejam literalmente idênticos.
4.2 Tarefa orientada ao propósito Argumentar
Na amostra portuguesa, o enunciado documentado na tese foi:
Estímulo 2 — tarefa de escrita de um texto argumentativo:
Achas que as redes sociais (Facebook, Twitter, Google+, Windows Live Space, etc.) são importantes hoje em dia? Escreve um texto para ser publicado no blogue da tua escola em que exponhas a tua opinião sobre as redes sociais. Neste texto deves dizer se és a favor ou contra a existência das redes sociais. Não te esqueças de justificar a tua opinião!
Na amostra brasileira, o enunciado documentado no parecer do CEP/UERN foi:
Estímulo 2 — argumentativo:
Você acha que as redes sociais (Facebook, Twitter, Google+, Windows Live Space, etc.) são importantes hoje em dia? Escreva um texto para ser publicado no blog da sua escola em que você exponha a sua opinião sobre as redes sociais. Neste texto, você deve dizer se é a favor ou contra a existência das redes sociais. Não se esqueça de justificar a sua opinião!
As formulações portuguesa e brasileira compartilham a mesma situação comunicativa: a produção de um texto destinado ao blogue ou blog da escola, no qual o participante deve assumir e justificar uma posição sobre as redes sociais. As adaptações linguísticas não eliminam a comparabilidade funcional entre as tarefas.
4.3 Propósito comunicativo e comparabilidade
No modelo atual do TED, Narrar e Argumentar são registrados como propósitos comunicativos. As tarefas orientam a produção para esses propósitos, mas não eliminam a necessidade de uma análise independente quando o objeto de estudo for o gênero textual.
4.4 Condições de produção
Em Portugal, as tarefas foram aplicadas em situações semelhantes de sala de aula, entre setembro de 2011 e janeiro de 2012. Os professores escolheram as datas de aplicação dentro desse intervalo, de acordo com o calendário das turmas. Eles foram expressamente orientados a não interferir nas produções, inclusive por meio de sugestões ou esclarecimentos.
Os participantes portugueses escreveram os textos manualmente, com caneta azul ou preta, sem atribuir títulos e observando uma extensão solicitada de 20 a 25 linhas. As tarefas haviam sido previamente apreciadas por três professores de Português, considerando-se sua adequação às faixas etárias envolvidas.
No Brasil, as tarefas foram aplicadas em contexto escolar, de forma controlada e funcionalmente comparável à aplicação portuguesa. As produções foram manuscritas e não houve intervenção docente durante sua realização. O critério de monolinguismo em português brasileiro foi efetivamente aplicado na constituição da amostra.
Condições específicas documentadas para Portugal, como cor da caneta, ausência de título e limite de linhas, não são atribuídas automaticamente à aplicação brasileira.
5. Digitalização, transcrição e preparação
5.1 Protocolo histórico da amostra portuguesa
Após a coleta, os textos manuscritos portugueses foram transcritos e armazenados digitalmente. Para cada produção, foram criadas duas versões em texto simples:
- Ficheiro de Referência (FR): continha a transcrição ipsis verbis do manuscrito e servia como fonte para conferência e para pesquisas interessadas na forma produzida pelo estudante;
- Ficheiro de Anotação (FA): continha uma transcrição preparada para tratamento computacional, com operações específicas documentadas na tese para reduzir interferências no processamento linguístico.
Na preparação dessas versões, buscou-se preservar, sempre que possível, maiúsculas e pontuação. Marcas de abreviação e recuos de parágrafo eram mantidos no FR, mas podiam ser removidos do FA. Elementos de apresentação gráfica sem função para a análise, como sublinhados, linhas em branco, espaçamentos anormais e elementos não verbais, podiam ser removidos.
Desvios de ortografia e acentuação eram preservados no FR e podiam ser normalizados no FA. Termos estrangeiros eram preservados, embora sua grafia pudesse ser normalizada no FA quando necessário. Omissões aparentemente acidentais somente eram recuperadas quando isso pudesse ser feito sem ambiguidade. Repetições, vulgarismos e ocorrências relacionadas a flexão, concordância, regência, colocação pronominal e seleção lexical eram preservadas por constituírem fenômenos potencialmente relevantes para a pesquisa.
O FA não deve ser entendido como uma versão amplamente reescrita ou corrigida. Ele constituía uma transcrição preparada para processamento segundo operações delimitadas, enquanto o FR permanecia como referência mais próxima do manuscrito.
5.2 Amostra brasileira
As produções brasileiras foram realizadas de forma manuscrita e posteriormente transcritas para tratamento computacional. A transcrição seguiu princípio semelhante ao fluxo português, distinguindo a preservação da produção de referência de sua preparação para processamento.
A documentação ética estabelecia, no protocolo aprovado, a digitalização dos originais em PDF e sua digitação em TXT. A documentação atualmente disponível, entretanto, não permite afirmar que esse fluxo de formatos intermediários possua cobertura integral e uniforme em todos os documentos brasileiros hoje incorporados ao TED.
A semelhança de princípio entre os procedimentos brasileiro e português não implica equivalência operacional absoluta entre todas as regras aplicadas aos antigos Ficheiros de Referência e de Anotação portugueses e o tratamento da amostra brasileira.
6. Processamento na pesquisa original
Na pesquisa portuguesa original, os textos foram submetidos a procedimentos de segmentação, anotação e análise voltados aos objetivos da tese. A anotação morfossintática foi realizada com o MBT, e a lematização, com o MBLEM, em versões adaptadas para o português.
O IMS Open Corpus Workbench e o CQP foram empregados na consulta aos dados lexicais. A plataforma CLAN, especialmente o programa vocd, foi utilizada em medidas de diversidade lexical. O UAM Corpus Tool apoiou a segmentação e a anotação manual de orações e unidades-t. A pesquisa também empregou procedimentos de estatística descritiva e inferencial.
Essas ferramentas e anotações pertencem ao processamento histórico da pesquisa documentada na tese. Elas não correspondem necessariamente às camadas atualmente disponibilizadas no TED por meio do DOESTE.
7. Integração ao DOESTE e estrutura TEI/XML
Em uma fase posterior, os textos foram integrados ao DOESTE e passaram a ser representados em TEI/XML. Essa representação separa o cabeçalho documental, a estrutura textual e as camadas de anotação linguística.
Cada documento possui, em linhas gerais:
- um elemento
<TEI>, que delimita o documento; - um
<teiHeader>, no qual são registrados metadados e informações de processamento; - um elemento
<text>, que contém a produção textual; - parágrafos representados por
<p>; - sentenças representadas por
<s>; - tokens representados por
<tok>.
Alguns documentos incluem referências a fac-símiles por meio de <pb facs="...">. Essas referências indicam a associação potencial entre a transcrição e uma representação digital do original, mas não significam que o fac-símile esteja automaticamente autorizado para exposição pública.
A representação atual em TEI/XML é posterior à constituição e à transcrição originais. Ela não deve ser confundida com os formatos TXT, FR e FA utilizados historicamente.
8. Normalização ortográfica atual
Na representação atual, a forma produzida pelo estudante permanece preservada no conteúdo do token e, quando disponível, no atributo form. Alguns tokens possuem também o atributo nform.
nform corresponde a uma forma normalizada manualmente, criada exclusivamente para normalizar desvios de ortografia e acentuação gráfica antes da anotação automática, sem substituir a forma produzida pelo estudante.
Essa camada:
- não constitui reescrita do texto;
- não constitui correção gramatical;
- não constitui correção estilística;
- não constitui normalização lexical ou sintática.
A cobertura de nform é parcial e não se estende a todos os tokens ou documentos do corpus. Sua ausência indica que o token não possui essa camada registrada, e não que a forma tenha sido necessariamente considerada correta segundo algum procedimento de revisão integral.
Não se presume correspondência automática entre o atual nform e o antigo Ficheiro de Anotação da pesquisa portuguesa.
9. Anotação linguística atual
A anotação linguística atualmente presente no TED foi realizada em uma fase recente de enriquecimento do corpus no DOESTE. Ela não foi produzida pelo pipeline descrito na tese.
O processamento atual utiliza o UDPipe por meio de serviço REST, com o modelo portuguese-bosque-ud-2.17. O script recebe sentenças e tokens já existentes nos XML; portanto, ele não realiza a tokenização atual do corpus.
Para cada token, o pipeline utiliza:
- a forma registrada em
nform, quando disponível; - na ausência de
nform, a forma presente no conteúdo do token.
A forma original produzida pelo estudante é preservada separadamente. O pipeline também preserva a tokenização preexistente e não expande contrações nessa etapa.
A anotação automática pode incluir:
lemma: lema;upos: categoria gramatical segundo Universal Dependencies;pos: atributo que, no script atual do TED, recebe uma cópia do valor deupos;feats: traços morfológicos;head: identificador do núcleo sintático;deprel: relação de dependência sintática.
O resultado do UDPipe não passou por revisão humana posterior. Consequentemente, lemas, categorias, traços e relações sintáticas podem conter erros, especialmente diante de grafias não convencionais, ambiguidades, segmentações excepcionais e construções frequentes na escrita em desenvolvimento.
A cobertura da anotação linguística não é integral em todos os documentos. Consultas baseadas em lema, categorias morfossintáticas ou relações de dependência devem, portanto, considerar a disponibilidade dessas camadas nos documentos selecionados.
Os atributos semclass e process aparecem em uma parcela reduzida dos XML, mas sua origem metodológica ainda não está suficientemente documentada. Eles não são atribuídos ao UDPipe nem apresentados como camadas gerais do TED.
10. Metadados
Os documentos do TED podem conter metadados relativos a:
- identificador do documento;
- código do participante;
- idade no momento da produção;
- código da instituição de ensino;
- ano escolar;
- residência no momento da produção;
- gênero informado pelo participante;
- língua ou variedade linguística;
- propósito comunicativo;
- ano ou data de produção;
- domínio Escolar.
Nem todos os campos possuem cobertura integral. A ausência de um valor em determinado XML deve ser interpretada como lacuna de documentação ou de completude, e não automaticamente como não aplicabilidade do conceito.
Os códigos de participante e instituição são identificadores internos e pseudonímicos; eles não correspondem a nomes destinados à exposição pública. Mesmo assim, sua combinação com idade, residência, escola, ano escolar, gênero e texto pode aumentar o risco de reidentificação.
Os sistemas educacionais brasileiro e português devem ser tratados separadamente. A coincidência numérica entre anos escolares não estabelece equivalência automática entre etapas de escolarização.
11. Consulta e estatísticas
O TED está integrado à plataforma TEITOK e a recursos de consulta baseados em CQP/CQL. O ambiente permite examinar ocorrências em linhas de concordância e combinar atributos linguísticos com filtros documentais.
Conforme a cobertura dos documentos e das respectivas camadas, podem ser realizadas consultas por:
- forma do token;
- forma original;
- forma normalizada, quando
nformestiver disponível; - lema;
- UPOS;
- traços morfológicos;
- núcleo e relação de dependência;
- metadados documentais.
O ambiente também possui configurações para estatísticas como total de tokens, total de sentenças, tipos de formas e lemas, medidas de diversidade lexical e contagens de categorias gramaticais. A interpretação dessas estatísticas deve considerar a cobertura das anotações e dos metadados utilizados em cada cálculo.
12. Aspectos éticos e acesso
12.1 Amostra portuguesa
O acesso às instituições portuguesas foi autorizado pela Direção-Geral de Inovação e Desenvolvimento Curricular, sob o processo 0260700001. Foram firmados protocolos de cooperação com as instituições participantes, prevendo a proteção do anonimato de escolas, professores e estudantes.
Os responsáveis pelos estudantes receberam termo de consentimento informado para autorizar a participação e o uso científico das produções. A documentação previa que a divulgação científica salvaguardasse o anonimato dos autores.
12.2 Amostra brasileira
A constituição da amostra brasileira foi submetida ao Comitê de Ética em Pesquisa da Universidade do Estado do Rio Grande do Norte, sob o CAAE 80135317.0.0000.5294. O Parecer Consubstanciado n.º 3.637.785 registrou a situação final como Aprovado e considerou o protocolo de acordo com a Resolução CNS 466/12 e suas complementares.
O processo ético incluiu termos de consentimento e assentimento e anuências institucionais.
12.3 Acesso, licença e fac-símiles
A autorização para participação e uso científico dos textos não equivale, por si só, a uma licença para reutilização ou redistribuição dos dados. Devem ser distinguidas:
- autorização para participação;
- consentimento ou assentimento;
- autorização para uso científico;
- política de acesso;
- licença de reutilização;
- autorização para redistribuição.
Não há, nesta etapa, declaração de licença aberta para o TED. A disponibilização de fac-símiles depende de verificação prévia de anonimização, considerando nomes, assinaturas, informações escolares, referências familiares, marcas no suporte e outros elementos potencialmente identificadores.
13. Controle de qualidade e limitações
O uso científico do TED deve considerar as seguintes limitações:
- as amostras não são estatisticamente representativas das populações escolares brasileira ou portuguesa;
- a amostra portuguesa final foi caracterizada como amostra de conveniência;
- os sistemas educacionais brasileiro e português possuem organizações próprias, e seus anos escolares não devem ser equiparados automaticamente;
- as amostras diferem quanto a período, localidade e contexto institucional de coleta;
- alguns metadados possuem cobertura incompleta;
nformpossui cobertura parcial e não deve ser tratado como camada disponível para todos os tokens;- as principais camadas de anotação linguística possuem cobertura parcial no conjunto atual de documentos;
- a anotação UDPipe é automática e não passou por revisão humana posterior;
- lemas, categorias, traços e dependências podem conter erros;
- a tese documenta 244 textos portugueses, enquanto o conjunto atual possui 243 XML classificados como
pt-PT.
Comparações entre Brasil e Portugal devem controlar, sempre que possível, etapa escolar, tarefa, propósito comunicativo, localidade, período de produção, cobertura de metadados e disponibilidade das camadas de anotação. Diferenças observadas não devem ser atribuídas exclusivamente à variedade linguística sem controle desses fatores.
14. Versionamento e atualização
O TED permanece em desenvolvimento. Seus documentos, metadados, anotações e sua documentação são versionados no âmbito do DOESTE. Alterações nos XML, no texto, na normalização ou nas anotações linguísticas são consideradas atualizações dos dados do corpus.
Dados incorporados ao histórico versionado do DOESTE em 23 de agosto de 2026.