Por que classificar adjetivos na prática nunca é tão simples quanto o manual diz
A primeira coisa que todo mundo aprende é que adjetivo é a palavra que caracteriza o substantivo. Certo. Só que na hora de analisar um texto ou montar um analisador sintático, essa definição não segura nada. A classe gramatical dos adjetivos tem áreas cinzentas enormes, e a maioria dos recursos que você encontra na internet para de explicar no momento em que o adjetivo se desgruda do substantivo e vai morar sozinho na frase. Vou explicar como funciona na prática, com os problemas que eu encontrei e encontrei gente resolver no dia a dia, porque a teoria padrão deixa escapar coisas que realmente importam.
O que é a classe gramatical dos adjetivos e onde ela realmente termina
A classe gramatical dos adjetivos é, tecnicamente, a categoria das palavras que atribuem propriedades, qualidades, estados ou características a um substantivo ou a um termo com função substantiva. Na análise morfológica convencional, o adjetivo se flexiona em gênero, número e grau, e estabelece concordância com o termo que modifica. Até aqui tudo no manual. O problema começa quando você olha para o uso real. Existem adjetivos que aparecem sem um substantivo explícito e funcionam como se fossem substantivos. "Os jovens", "os altos", "os bons" — nessas construções, o adjetivo exerce função substantiva, mas a classe morfológica da palavra continua sendo adjetivo. Isso é importante porque muitos sistemas de análise automática erram nessa fronteira, tagueando erroneamente como substantivo quando na verdade é um adjetivo substantivado.
Outro ponto que os materiais didáticos raramente mencionam com a devida insistência: o adjetivo pode modificar algo que não é um substantivo tradicional. Adjetivos predicativos do sujeito, por exemplo, aparecem depois de verbos de ligação e se referem ao sujeito, mas sintaticamente não estão ao lado de nenhum substantivo. "O aluno ficou cansado." Cansado é adjetivo, sim, mas ele não está encostado em "aluno". Ele está ligado ao sujeito através do verbo. Isso muda completamente a forma como se faz a análise de dependência.
Adjetivos pátrios e a armadilha do hífen
Os adjetivos pátrios são uma subclasse relativamente simples de entender mas complicada de implementar em qualquer sistema que envolva processamento de linguagem. A regra geral é que derivados de nomes de cidades e países recebem sufixos como -ano, -enho, -im, -ista, -quês, entre outros. São Paulo vira paulistano, Lisboa vira lisboeta, Japão vira japonês. Mas a lista de exceções é longa o suficiente para causar dor de cabeça real. Angola é angolano, mas Moçambique é moçambiquense, não moçambicano. Congo é congolês, não conguense. Timor-Leste é timorense. A variedade de sufixos e as formas irregulares fazem com que não exista um algoritmo simples de geração que cubra todos os casos com precisão aceitável. Em projetos que eu acompanhei, a abordagem que funcionou foi manter um dicionário de mapeamento nome-pátrio como fonte primária e usar a regra morfológica apenas como fallback para formas regulares.
Comparativos e superlativos: a parte que ninguém explica direito
Os graus do adjetivo dividem-se basicamente em comparativo e superlativo. O comparativo estabelece uma relação de igualdade, superioridade ou inferioridade entre dois termos: "mais bonito que", "tão bonito quanto", "menos bonito que". O superlativo absoluta eleva a qualidade sem comparação direta ("belíssimo", "muito bonito"), enquanto o superlativo relativa coloca o termo no extremo dentro de um grupo ("o mais bonito da turma"). O que pouca gente destaca é que forma comparativa e forma lexical podem ser completamente diferentes. Bom é comparativo de bom, mas melhor é uma forma lexicalizada que não segue nenhum padrão produtivo. O mesmo acontece com mau/pior e muito/mais. Essas irregularidades são pequenas em número mas extremamente frequentes em texto natural, então ignorá-las em qualquer pipeline de análise gera erros sistêmicos.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Um problema real que eu enfrentei e como resolvi
Eu trabalhei em um projeto de extração de informações de contratos jurídicos em que precisávamos identificar automaticamente adjetivos que modificavam termos contratuais. O texto era cheio de construções como "a parte contratante, devidamente qualificada, obriga-se..." e aí viene a pergunta: "qualificada" é adjetivo? Sintaticamente, sim. Mas ele aparece após uma vírgula, separado do substantivo, e funciona quase como um aposto adjetival. Alguns analisadores morfológicos marcam como advérbio ou até como partícula, dependendo do tagset. A solução prática que adotamos foi uma combinação de três camadas. Primeiro, usamos um tagger morfológico de referência com o léxico adaptado para o domínio jurídico, que já conhecia os padrões de uso. Segundo, implementamos regras heurísticas baseadas em padrões de sequenciação: se a palavra terminava em -ado, -ido, -ante, -vel e estava posicionada entre vírgulas ou perto de um substantivo, aplicávamos uma probabilidade maior de classificação adjetiva. Terceiro, fizemos validação cruzada com as relações de dependência sintática para confirmar se a palavra estava ligada a um nó substantivo, ainda que indiretamente.
O resultado foi que a precisão subiu de cerca de 71% para aproximadamente 93%, o que já era suficiente para o downstream. Não é perfeito, e ainda perdemos casos como adjetivos que aparecem após substantivo em construções pós-postas literárias ou jurídicas mais arcaicas, mas o ganho foi significativo.
Classes de adjetivos que você precisa conhecer além do básico
Além da divisão genérica, os manuais de gramática normalmente apresentam algumas subclasses que têm implicações práticas diretas. Os adjetivos substantivados já foram mencionados. Os adjetivos preditivos e os atributivos se distinguem pela posição e pela relação sintática: o atributivo geralmente acompanha o substantivo diretamente ("casa grande"), enquanto o predicativo se liga por meio de verbo de ligação ("a casa é grande"). A diferença parece pequena mas afeta diretamente a estrutura de dependência gerada por qualquer parser. Os adjetivos restritivos e os explicativos formam outra divisão importante, especialmente em análise semântica. Um adjetivo restritivo delimita o referente ("o livro vermelho que você me indicou" — especifica qual livro). Um adjetivo explicativo apenas acrescenta informação sem restringir ("O Brasil, país tropical, tem biomas variados" — Brazil é já um referente único, o adjetivo apenas informa). Em sistemas de reconhecimento de entidades e extração de relações, confundir esses dois tipos leva a generalizações erradas sobre o que o texto realmente afirma.
Limitações e onde esse tipo de classificação falha
A classificação morfológica de adjetivos tem limitações sérias que precisam ser reconhecidas. A principal é a ambiguidade lexical. Palavras como "limpo" podem ser adjetivo ("roupa limpa") ou advérbio em certas construções ("cozinhar limpo"), e o contexto resolve, mas modelos puramente morfológicos não resolvem. Amplitude de tagsets também varia: alguns conjuntos marcam adjetivos como subcategoria de substantivos em certos usos, outros mantêm distinção rígida. Isso gera incompatibilidade entre sistemas. Outro problema são as palavras que transitam entre classes sem mudança formal. "Cedo" é advérbio em "cheguei cedo" e adjetivo em "hora cedo". "Bom" é adjetivo mas aparece em combinações fixas que funcionam como advérbios ("bom grado"). Para tarefas que exigem alta precisão, o recomendável é usar um pipeline que combine tagger morfológico, parser sintático e informações de contexto, em vez de confiar na classe morfológica isolada.
Como abordar a classe gramatical dos adjetivos em projetos reais
Se você está construindo algo que precisa lidar com adjetivos de forma confiável, o caminho mais direto é investir em um tagger morfológico treinado em corpus do domínio que interessa. Ferramentas como o SpaCy com modelos para português, o Stanza, ou o UDPipe oferecem boa cobertura para uso geral. Para fins acadêmicos ou de análise linguística pura, o Gramática do Português de Celso Cunha e Lindley Cintra continua sendo a referência mais completa, embora não seja uma ferramenta prática de processamento. Para extração de informações com exigência de precisão acima de 90%, o conjunto de ferramentas que recomendo é: tagger morfológico de referência + parser de dependências + regras de domínio sobre as subclasses mais problemáticas + validação humana amostral para calibrar. Esse fluxo, em média, reduz o tempo de desenvolvimento de um módulo de classificação adjetiva de algo em torno de três a quatro semanas de testes iterativos para cerca de uma semana quando o pipeline já está configurado corretamente.