O guia chato que eu queria ter visto antes de perder tempo com isso
A primeira coisa que você precisa entender sobre pares de palavras que compartilham forma e significado entre idiomas é que nem toda semelhança aparente é confiável. Eu gastou semanas num projeto de análise lexicográfica para descobrir que uma lista de cognatos exportada de um dicionário online incluía cerca de 18% de falsos amigos que pareciam corretos à primeira vista. O problema não era o conceito em si, era a qualidade dos dados que eu estava usando como referência.
o que e palavra cognata
Cognatos são pares ou grupos de palavras em línguas diferentes que descendem de uma mesma raiz etimológica e mantêm similaridade tanto na forma quanto no sentido. A diferença crucial entre cognatos e empréstimos linguísticos é que os cognatos têm uma linhagem genealógica documentável até um proto-falante original, enquanto empréstimos foram simplesmente copiados de uma língua para outra sem essa tradição compartilhada de desenvolvimento. Em português e espanhol, por exemplo, "noche" e "noite" são cognatos porque ambas vêm do latim "nox, noctis". Já "fámula" e "famlia" parecem similares mas não são cognitivamente confiáveis sem verificação etimológica rigorosa. O que me levou a prestar atenção nisso foi um projeto de tradução automática onde precisei mapear correspondências entre termos técnicos em português, espanhol e italiano para treinar um modelo de alinhamento lexical. A maioria dos guias que encontrei na época tratava o assunto de forma superficial, listando exemplos óbvios como "agua/agua/acqua" e encerrando por aí. Ninguém mencionava que, ao trabalhar com corpus reais, cerca de 30 a 40% dos pares que parecem cognatos à superfície são na verdade etimologicamente independentes ou passaram por mudanças semânticas tão drásticas que a relação original se perdeu.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Eu desenvolvi um procedimento simples que agora uso praticamente em qualquer análise comparativa. Primeiro, cruzo as formas nas línguas-alvo usando listas de correspondência fonológica documentadas para o ramo linguístico em questão. Depois verifico cada par no Dicionário Etimológico da Língua Portuguesa da Porto Editora ou, para outras línguas românicas, no Diccionario Crítico Etimológico Castellano e Hispánico de Corominas. O passo que a maioria das pessoas pula — e que me custou duas semanas de retrabalho na primeira vez — é confirmar se a similaridade preservou função semântica ao longo do tempo. Palavras como "embarazar" em espanhol e "embaraçar" em português têm a mesma raiz latina mas significam coisas radicalmente diferentes hoje em dia, então classificar esses pares como cognatos funcionais seria um erro que distorce qualquer análise quantitativa. Quando eu precisava validar um lote grande de pares rapidamente, criava um script que puxava entradas do Wiktionary via API, extraía as seções etimológicas e comparava com uma base de correspondências fonéticas pré-calibrada para o grupo românico. O script levava cerca de 15 minutos para processar 500 pares, contra as 3 horas que eu gastava fazendo verificação manual. A desvantagem é que o Wiktionary tem lacunas importantes para vocábulos do português brasileiro coloquial e para termos técnicos de áreas específicas como engenharia e medicina, então o método fallha exatamente onde ele seria mais útil. Nesses casos, volta-se para o Nouveau Larousse Étymologique como referência suplementar, ainda que seja focado principalmente no francês.
Um detalhe que quase ninguém explica direito é a diferença entre cognatos próximos e cognatos distantes. Cognatos próximos, como "dado/dato/datum" ou "gente/gent/gente", mantêm similaridade tão alta que até falantes leigos percebem a relação. Cognatos distantes, como "olho/ojo/oculus" ou "cinco/cinco/quinq", exigem conhecimento de evolução fonológica para serem reconhecidos como parecidos. Em análise computacional, tratar ambos os grupos da mesma maneira introduz viés: os cognatos distantes são sub-representados porque filtros de similaridade superficial os descartam automaticamente, enquanto os próximos são super-representados porque passam em qualquer critério de matching ingênuo. Outro ponto que causa confusão constante é a relação entre cognatos e falsos cognatos. A linha é tênue porque ambos os tipos compartilham origem etimológica comum — a diferença está apenas no desvio semântico posterior. "Actual" em inglês e "actual" em português são cognatos legítimos (ambos do latim "actualis"), mas seus sentidos atuais divergiram o suficiente para que um falante português interprete mal o termo quando encontrado no contexto inglês. Quando alguém pergunta sobre falsos cognatos, na verdade estão perguntando sobre cognatos com divergência semântica não sinalizada. Reconhecer essa nuance evita que você gaste tempo procurando uma categoria que não existe academicamente.
Se o seu objetivo é apenas identificar pares visíveis para estudo vocabulário, listas prontas disponíveis em portais como o Vocabolico Italiano ou o Corpus Diacrónico do Espanhol resolvem para o básico. Mas se você precisa de precisão etimológica para trabalho sério — seja treinamento de modelos NLP, elaboração de glossários bilingues ou pesquisa comparativa — a verificação manual nos dicionários etimológicos de referência continua sendo insubstituível. Nenhum recurso automatizado que eu tenha testado alcança taxa de acerto superior a 85% quando aplicado a corpus técnico ou registos históricos, e esse gap de 15% é onde aparecem os erros que mais custam tempo para corrigir depois.