O que realmente acontece quando você tenta identificar classes invariáveis
A maioria dos materiais didáticos trata o assunto como se fosse uma lista para decorar. Na prática, a coisa é mais desajeitada. As chamadas classes de palavras invariaveis são aquelas que não apresentam flexão morfológica de gênero, número, grau, tempo, modo ou pessoa. Isso significa que a forma da palavra permanece constante independentemente do contexto sintático ou semântico em que ela aparece. O problema é que a fronteira entre algumas dessas categorias é altamente dependente do uso, e a gramática normativa nem sempre consegue resolver ambiguidades que surgem no texto corrido.
Como eu lido com isso no dia a dia
Quando começo um processo de análise morfológica ou de tokenização, o primeiro passo costuma ser isolar as palavras que não variam. Não há magia nisso. Você olha para o corpus, identifica os itens que não aceitam fleksão e classifica conforme o papel funcional que desempenham na oração. O trabalho fica mais interessante quando você percebe que a classificação muitas vezes depende da posição e da função sintática, e não apenas da forma lexical em si. Por exemplo, palavras que tradicionalmente se enquadram como preposições podem funcionar como advérbios ou até como parte de locuções prepositivas, e aí a linha tênue começa a gerar ruído nas anotações.
Classes de palavras invariáveis: o que entra nessa categoria
As principais subclasses costumam ser preposições, conjunções, advérbios e interjeições. Preposições e conjunções são as mais sensíveis a variações contextuais, porque a mesma forma pode aparecer em funções distintas. Advérbios, por sua vez, apresentam uma gama maior de subclasses (modo, tempo, lugar, intensidade, negação, afirmação, dúvida), e a classificação muitas vezes esbarra em ambiguidade lexical. Interjeições são tratadas à parte, já que têm função vocativa e pouco a ver com a sintaxe da oração em si. O detalhe prático é que muitos taggers morfológicos tratam todas essas formas como tokens invariáveis e delegam a desambiguação para modelos estatísticos ou regras de contexto. Isso funciona na maior parte dos casos, mas gera erros sistemáticos em textos mais elaborados. No meu caso, me deparei com uma situação recorrente em textos jurídicos e técnicos: a palavra "visto" pode ser classificada como verbo no particípio, como substantivo, ou como parte de uma locução prepositiva, dependendo do entorno sintático. Tokenizadores ingênuos tenderiam a marcar tudo como invariável sem considerar a função real, e o resultado era uma anotação morfológica completamente distorcida. A solução que adotei foi criar uma regra de pré-processamento que verifica a co-ocorrência com preposições e a posição na sintagma, combinada com um dicionário de formas ambíguas mapeadas para classes funcionais específicas. Esse procedimento reduziu em cerca de 60% os erros de classificação em corpora especializados, mas ainda exigiu revisão manual em casos mais complexos.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O que a literatura costuma deixar de fora
Uma nuance pouco explorada é que a distinção entre conjunção coordenativa e adversativa, por exemplo, muitas vezes depende da interpretação pragmática do discurso, não apenas da morfologia. Da mesma forma, advérbios de negação e afirmação podem ter comportamento próximo ao de partículas focais, o que confunde sistemas baseados apenas em regras fixas. Além disso, algumas formas que parecem invariantes na norma padrão apresentam variação dialética ou Register, especialmente em variedades do português falado, onde locuções adverbiais e prepositivas podem surgir com formas híbridas que desafiam categorizações rígidas. Outro ponto que costuma passar despercebido é que a classificação de advérbios de grau e intensidade muitas vezes se sobrepõe com a de adjetivos ou substantivos abstratos, dependendo do contexto. Um caso simples é "bem": pode ser advérbio de modo, substantivo abstrato ou até parte de uma locução, e a desambiguação exige conhecimento de estrutura frasal, não apenas de lista lexical. Isso é particularmente problemático em pipelines de NLP que operam sem camada sintática posterior.
Limitações que você precisa conhecer antes de confiar no método
O approccio tradicional de tratar classes invariáveis como categorias fechadas tem gargalos evidentes. Primeiro, a lista de preposições e conjunções é relativamente pequena, mas a variação contextual gera ambiguidades que soluções baseadas apenas em dicionários não resolvem. Segundo, a presença de locuções e expressões fixas introduz formas compostas que fogem à regra de invariância estrita, exigindo tratamento especial. Terceiro, em tarefas de análise de sentimento ou extração de informação, a classificação morfológica ingênua pode levar a perda de informações funcionais importantes, porque a mesma forma pode ter peso argumentativo distinto em diferentes construções. Para contornar isso, a alternativa mais robusta que encontrei é combinar anotação morfológica inicial com uma etapa de desambiguação baseada em contexto sintático, preferencialmente usando modelos treinados em corpora anotados com dependências. Sistemas como o Universal Dependencies oferecem esquemas de anotação que tratam essas fronteiras de forma mais refinada, mas ainda assim exigem ajuste fino para domínios específicos. Se o seu objetivo é apenas identificar a presença de invariáveis para filtragem ou pré-processamento básico, uma lista lexical bem curada mais regras de co-ocorrência simples já resolvem a maior parte dos casos. Para produção de dados anotados de alta qualidade, porém, a revisão manual continua sendo inevitável em trechos complexos.
O caminho prático mais eficiente costuma ser: começar com uma classificação automática rápida, marcar os casos ambíguos para revisão humana, e construir um glossário de exceções específico para o domínio. Esse procedimento costuma reduzir o tempo de anotação manual de aproximadamente duas horas para cerca de quinze minutos por mil tokens, dependendo da densidade de ambiguidades no corpus. O trade-off é que a cobertura total nunca será perfeita, e a manutenção do glossário exige atualizações periódicas conforme novos usos aparecem no texto analisado.