Entendendo verossimilhança na prática
Verossimilhança é o conceito central de inferência estatística que muitos aprendem de forma confusa nos cursos introdutórios. Basicamente, ela mede quão bem um conjunto de parâmetros explica os dados que você observou. Se você tem um modelo e quer saber se os valores que escolheu fazem sentido, a verossimilhança é a ferramenta para isso. Na prática, a função de verossimilhança, representada como L( | dados), calcula a probabilidade de observar seus dados dados uns parâmetros . Isso é diferente de probabilidade direta, que é um erro comum. Probabilidade vai dos parâmetros aos dados; verossimilhança inverte essa lógica para encontrar os parâmetros mais adequados.
O que é verossimilhança e por que ela importa
O que é verossimilhança pode parecer uma pergunta simples, mas a resposta tem implicações enormes. Método da máxima verossimilhança, ou MLE, é a técnica padrão para estimação de parâmetros há décadas. Você encontra o valor de que maximiza L( | dados) e pronto. Parece trivial até precisar implementar. Em modelos simples, como regressão logística ou Poisson, o MLE tem solução analítica fechada em muitos casos. Para modelos mais complexos, como generalizados mistos ou estruturas espaciais, você precisa de algoritmos numéricos iterativos. Newton-Raphson, BFGS, EM — cada um tem seus prós e contras dependendo do problema.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O que muitos não entendem é que a verossimilhança por si só não diz nada sobre a verdade do modelo. Ela compara modelos entre si, não contra a realidade. Duas verossimilhanças diferentes para o mesmo dado são comparáveis via razão de verossimilhança, mas o valor absoluto raramente é interpretável sem normalização adequada. Eu já passei horas debuggando um modelo hierárquico de efeitos aleatórios porque a função de verossimilhança tinha múltiplos máximos locais. O otimizador convergia para soluções diferentes dependendo do ponto inicial. A solução foi rodar o algoritmo com dezenas de inicializações aleatórias e selecionar o valor máximo global. Isso aumentou o tempo de computação de 3 minutos para cerca de 45 minutos no meu setup, mas eliminou viés de inicialização completamente.
Um detalhe que raramente é mencionado: a verossimilhança logarítmica é quase sempre preferida na prática. Multiplicar dezenas ou centenas de probabilidades pequenas resulta em underflow numérico rapidamente. Somar log-verossimilhanças mantém a estabilidade computacional. A diferença é crucial em modelos com milhares de observações. Outro ponto negligenciado é que verossimilhança assume que seu modelo está corretamente especificado. Se a distribuição assumida não corresponde à geração dos dados, as estimativas de máxima verossimilhança podem ser consistentes para alguns parâmetros mas tendenciosas para outros. Testes de diagnóstico pós-estimação, como resíduos padronizados e gráficos Q-Q, são essenciais para validar essa suposição.
A alternativa bayesiana substitui a verossimilhança pontual por uma distribuição completa sobre os parâmetros, combinando-a com priors. Isso resolve alguns problemas do MLE, como intervalos de confiança assimétricos, mas introduz sua própria complexidade computacional via MCMC ou variacionais. Nem sempre vale o esforço adicional dependendo da pergunta de pesquisa.