O que são nomes próprios na prática
Nomes próprios são palavras que identificam seres únicos ou entidades específicas dentro de um contexto. Diferem dos substantivos comuns justamente por isso: não se generalizam. Você escreve com letra maiúscula porque está apontando para algo concreto, não para uma categoria. A gente costuma ensinar isso na escola de forma muito simplista — "nomes de pessoas", "nomes de lugares". A realidade é mais ampla e, quando você começa a trabalhar com processamento de linguagem ou localização de software, percebe rapidamente que a distinção não é tão óbvia assim.
Como categorizar exemplos de nomes proprios corretamente
O primeiro passo é entender os tipos. Eu costumo dividir em seis categorias funcionais: Antropônimos: nomes de pessoas. Maria, João, Alexandre, Fatima. Isso parece óbvio, mas o problema começa quando você encontra nomes compostos ou com partículas. "Ana Maria da Silva" ou "José de Almeida" exigem tratamento diferenciado em sistemas de cadastro. Eu já perdi tempo demais tentando validar esse tipo de entrada com expressões regulares ingênuas que quebravam em nomes como "Van-Damme" ou "O'Brien". A solução que funcionou foi implementar um regex que reconhecesse hífen, apóstrofo e letras acentuadas separadamente, em vez de tentar padronizar tudo.
Topônimos: nomes de lugares. São Paulo, Amazonas, Mediterrâneo, Lisboa. Aqui tem uma armadilha comum: muitos topônimos são idênticos a substantivos comuns noutras línguas. "Rio", "Porto", "Monte" viram nomes próprios quando especificam um lugar, mas mantêm a grafia minúscula se forem usados genericamente. "Vou ao rio" não leva maiúscula. "Vou ao Rio de Janeiro" leva. Teonímicos: nomes de divindades. Deus, Buda, Alá. Menos problemáticos no dia a dia, mas relevantes em contextos literários e tradutórios.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Hitonímicos: nomes de obras. Dom Quixote, A Divina Comédia, Sermão do Escaravelho. O tricky aqui é que o título de uma obra é um nome próprio, mas os artigos e preposições dentro dele às vezes permanecem minúsculos dependendo da norma — e normas diferentes fazem coisas diferentes. A NBR 6023 e o Acordo Ortográfico nem sempre caminham juntos nesse ponto. Heronímicos: nomes de animais individualizados. Gorjeta, Caramelo, Garibaldi. Esse é um campo que muita gente ignora. Quando um animal recebe nome próprio, ele se torna um nome próprio. Na dúvida, a estrutura do contexto decide: "meu cachorro Caramelo" versus "um cachorro caramelo (cor)".
Endonímicos e exonímicos: nomes de marcas, empresas, instituições. Nokia, PUC, ONU, Clube de Regatas do Flamengo. Aí entram os abreviações, siglas e denominações sociais que todo sistema de normalização textual precisa tratar com regras específicas. Um detalhe que ninguém enfatiza o suficiente: o mesmo lexema pode ser nome comum ou nome próprio dependendo do uso. "Pará" é um estado. "pará" é a moeda do Bolívia. A maiúscula resolve, mas só se você souber qual sentido está usando. Em textoOCR ou transcrições automáticas, essa ambiguidade gera erros silenciosos que passam despercebidos até alguém notar que o documento ficou semanticamente estranho.
Outro ponto que causa dor de cabeça em projetos reais: nomes próprios estrangeiros em textos lusófonos. Como tratar "Göttingen" ou "München" quando o sistema não suporta caractere com umlaut? Eu resolvi num projeto de indexação documental adotando a normalização NFKC do Unicode antes de qualquer processamento. Transforma "ö" em "o", "ß" em "ss", e assim por diante. Perde-se a grafia original, mas a busca funciona. Se a precisão ortográfica é crítica, aí você trata o texto original à parte e mantém a versão normalizada só para indexação. O limite mais chato dessa classificação é que ela depende da cultura e da língua. Em japonês, o nome vem depois do sobrenome. Em alguns contextos árabes, a partícula "ibn" ou "bin" faz parte do nome próprio e não deve ser isolada. Sistemas automatizados ocidentais frequentemente quebram nesses casos porque assumem um padrão nome + sobrenome que simplesmente não se aplica. Se você for trabalhar com corpora multilíngues, invista tempo em entender essas variações antes de escrever qualquer regra de tokenização.