Interpretação das etiquetas linguísticas
O Corpus TED utiliza o padrão internacional Universal Dependencies (UD) para anotação linguística. A seguir, apresentamos as principais etiquetas utilizadas nas buscas:
Classes gramaticais (UPOS)
-
ADJ = adjetivo
-
ADP = preposição
-
ADV = advérbio
-
AUX = verbo auxiliar
-
CCONJ = conjunção coordenativa
-
DET = determinante (artigos, etc.)
-
INTJ = interjeição
-
NOUN = substantivo comum
-
NUM = numeral
-
PRON = pronome
-
PROPN = nome próprio
-
PUNCT = pontuação
-
SCONJ = conjunção subordinativa
-
SYM = símbolo
-
VERB = verbo
-
X = categoria indefinida
Relações sintáticas (DEPREL)
-
nsubj = sujeito
-
obj = objeto direto
-
iobj = objeto indireto
-
amod = modificador adjetival
-
advmod = modificador adverbial
-
nmod = modificador nominal
-
obl = adjunto oblíquo (circunstancial)
-
ccomp = complemento oracional
-
xcomp = complemento aberto (sem sujeito próprio)
-
mark = marcador subordinativo
-
case = marcador de caso (geralmente preposição)
-
det = determinante
-
cop = verbo de ligação
-
aux = verbo auxiliar
-
cc = conjunção coordenativa
-
conj = elemento coordenado
-
punct = pontuação
-
root = núcleo da sentença
Observação
Essas etiquetas são utilizadas internacionalmente em corpora linguísticos e permitem realizar análises sistemáticas e comparáveis do uso da língua em diferentes contextos.