O que é significância estatística? Definição, exemplos e limites (2026)

A significância estatística significa que é improvável que um resultado tenha surgido apenas por acaso, partindo do pressuposto de que não há um efeito real. Ela geralmente é declarada quando o valor-p fica abaixo de 0.05. Esse limite é uma convenção adotada por conveniência, não uma propriedade da natureza. Um resultado significativo também não é o mesmo que um resultado importante.
Essas duas frases cobrem a maior parte do que dá errado com o conceito na prática. As equipes tratam 0.05 como uma nota de corte e a significância como prova de impacto, e ambas as interpretações levam a decisões confiantes baseadas em muito pouco.
Este guia aborda o que o valor-p realmente responde, de onde veio o limite e como um teste é construído. Ele termina com as quatro coisas que a significância genuinamente não pode lhe dizer.
O que é significância estatística?
A significância estatística é uma afirmação sobre surpresa, não sobre a verdade. Você começa assumindo que nada está acontecendo — que os dois grupos são idênticos ou que as variáveis não estão relacionadas. Essa suposição é a hipótese nula.
Então você se pergunta: se a hipótese nula fosse verdadeira, com que frequência eu veria dados pelo menos tão extremos quanto os meus? Se a resposta for "raramente", os dados observados são difíceis de conciliar com a suposição, e você a rejeita.
Essa é toda a lógica. Note o que ela não inclui. Não há nenhuma afirmação sobre o tamanho do efeito, a probabilidade de sua hipótese ser verdadeira ou se o resultado importa para alguém.
O que o valor-p realmente responde
O valor-p é a probabilidade de observar dados pelo menos tão extremos quanto os seus, assumindo que a hipótese nula seja verdadeira.
Essa cláusula condicional carrega todo o peso, e quase sempre é deixada de lado. Um valor-p de 0.03 não significa que há uma chance de 3% de o resultado ser um acaso. Também não significa que há uma chance de 97% de sua hipótese estar correta. Significa que: se genuinamente não houvesse efeito, dados tão extremos apareceriam cerca de 3% das vezes.
A distinção parece acadêmica até que mude uma decisão. Execute vinte testes independentes em um conjunto de dados sem efeitos reais em lugar nenhum e você ainda obterá cerca de um resultado "significativo". Cinco por cento de nada ainda é alguma coisa. Isso não é uma falha na matemática. É o que significa um limite de 5%.
De onde veio o limite de 0.05
Não há derivação. O limite de 0.05 entrou em uso comum por convenção na prática estatística do início do século vinte e permaneceu porque era conveniente e todos os outros o estavam usando.
Isso importa para a forma como você interpreta resultados limítrofes. Um valor-p de 0.049 e um de 0.051 descrevem evidências quase idênticas, mas um é chamado de significativo e o outro não. Tratar essa fronteira como uma linha rígida entre o real e o irreal é o uso indevido mais comum do conceito.
Relate o valor-p real em vez de apenas informar se ele passou da meta. Os leitores poderão então julgar por si mesmos quão forte é a evidência.
Como a significância é testada
A hipótese nula
Declare a suposição de nenhum efeito com precisão antes de olhar para os resultados. "A versão B tem a mesma taxa de conversão que a versão A" é testável. "A versão B é melhor" não é, porque não especifica o que contaria como evidência contra ela.
A estatística de teste
Escolha um teste que corresponda aos dados. Comparar as médias de dois grupos geralmente exige um teste t; comparar proporções exige um teste z ou um teste qui-quadrado em uma tabela de contingência. Usar o teste errado produz um número que parece legítimo, mas não é.
O valor-p e a decisão
O teste converte seus dados em um valor-p. Compare-o com o limite que você definiu antes de executar o teste. Escolher o limite depois, ou executar o teste repetidamente até que ele passe, invalida todo o procedimento.
Significância estatística vs. significância prática
| Significância estatística | Significância prática | |
|---|---|---|
| Pergunta respondida | Isso poderia ser acaso? | Vale a pena agir com base nisso? |
| Depende do tamanho da amostra | Fortemente | De forma alguma |
| Expresso como | valor-p | Tamanho do efeito, intervalo de confiança |
| Pode ser alcançado por | Coletar mais dados | Apenas por um efeito real |
A última linha é a que deve ser lembrada. Com uma amostra grande o suficiente, quase qualquer diferença se torna estatisticamente significativa, incluindo diferenças pequenas demais para importar. Uma melhoria de conversão de 0.02% em dez milhões de usuários passará por qualquer limite que você queira, e ainda assim não valerá o tempo de engenharia.
É por isso que o tamanho do efeito deve estar ao lado de cada valor-p. A significância diz que o efeito provavelmente não é zero; o tamanho do efeito diz se alguém deveria se importar.
O que a significância estatística não lhe diz
Quão grande é o efeito. Um valor-p diminui com o tamanho da amostra, independentemente do tamanho da diferença subjacente. Não é uma medida de magnitude.
Quão provável é a sua hipótese. O valor-p é calculado assumindo que a hipótese nula seja válida. Ele não pode, então, dar meia-volta e lhe dizer a probabilidade de ela não ser. Responder a essa pergunta exige uma estrutura totalmente diferente.
Se o resultado será replicado. Um único resultado significativo em uma única amostra é uma evidência fraca. A replicação é o que o transforma em uma descoberta.
Se o design do estudo foi sólido. O teste de significância pressupõe que os dados foram coletados corretamente. Uma amostra tendenciosa produz uma resposta confiantemente significativa e confiantemente errada, e nenhuma quantidade de rigor estatístico posterior irá corrigir isso.
Erros comuns ao relatar a significância
Relatar apenas se passou de 0.05. Publique o valor-p real. "p = 0.048" e "p = 0.052" dizem ao leitor muito mais do que "significativo" e "não significativo". Esse par de rótulos implica uma diferença de evidência que não existe.
Executar o teste até que ele passe. Verificar os resultados diariamente e parar quando o valor-p cair abaixo do limite garante um resultado significativo eventualmente, haja ou não um efeito. Fixe o tamanho da amostra com antecedência.
Testar muitas variantes sem ajuste. Comparar cinco variantes contra um controle são cinco testes, e a chance de pelo menos um falso positivo é muito maior do que 5%. Existem correções exatamente para isso.
Interpretar um resultado não significativo como nenhum efeito. Um teste com baixo poder estatístico não encontra nada, haja ou não algo lá. Relate o intervalo de confiança para que os leitores possam ver quais tamanhos de efeito continuam plausíveis.
Omitir o tamanho do efeito. A significância diz que o efeito provavelmente não é zero. Apenas o tamanho do efeito diz se vale a pena fazer algo a respeito, e apenas um intervalo de confiança mostra com que precisão você o determinou.
Como testar a significância em seus próprios dados com o Powerdrill Bloom
Passo 1: Faça o upload dos seus dados
Faça o upload do arquivo de resultados — exportações de experimentos, respostas de pesquisas ou registros de transações. O Powerdrill Bloom traça o perfil das colunas, de modo que os tamanhos dos grupos e os valores ausentes fiquem visíveis antes da execução de qualquer teste.
Passo 2: Descreva o teste em linguagem natural
Indique o que você está comparando e que tipo de medida se trata. Compare as taxas de conversão entre esses dois grupos e diga se a diferença é significativa. Peça o tamanho do efeito e o intervalo de confiança junto com o valor-p. Pergunte também se as premissas do teste se aplicam a esses dados, em vez de presumir que sim.
Passo 3: Exporte o gráfico, relatório ou apresentação
Extraia o gráfico de comparação, uma tabela com o valor-p e o intervalo de confiança, ou um resumo por escrito para a revisão.
Conclusão
A significância estatística responde a uma pergunta estreita: este resultado poderia plausivelmente ter vindo apenas do acaso? Ela é genuinamente útil para isso, e inútil para tudo o mais que as pessoas exigem dela. O limite de 0.05 é uma convenção, um resultado significativo pode ser trivialmente pequeno e um resultado não significativo não é prova de que nada aconteceu.
Lida ao lado do tamanho do efeito e de um intervalo de confiança, ela faz um trabalho real. Se você quer esse trio sem configurar os testes manualmente, experimente o Powerdrill Bloom no seu arquivo de resultados. Veja também nossa página de auto insights, o guia para analisar resultados de testes A/B sem um estatístico, executar estatísticas descritivas e conduzir um teste t com IA.
Perguntas frequentes
O que significa estatisticamente significativo em termos simples?
Significa que seria improvável que o resultado aparecesse se não houvesse um efeito real. Não significa que o efeito seja grande ou importante — apenas que o acaso sozinho é uma explicação ruim para o que você observou.
O que é um valor-p?
A probabilidade de ver dados pelo menos tão extremos quanto os seus, assumindo que a hipótese nula seja verdadeira. Não é a probabilidade de que sua hipótese esteja correta, e não é a chance de o resultado ser um acaso.
Por que 0.05 é usado como nível de significância?
É uma convenção da prática estatística do início do século vinte, e não um valor derivado. Por ser arbitrário, um valor-p de 0.049 e um de 0.051 representam evidências quase idênticas, apesar de estarem em lados opostos dele.
Um resultado pode ser significativo, mas não importante?
Sim, e isso acontece constantemente com amostras grandes. Uma amostra grande o suficiente torna diferenças minúsculas estatisticamente significativas, razão pela qual o tamanho do efeito deve sempre ser relatado ao lado do valor-p.
O que significa se meu resultado não for significativo?
Que seus dados não fornecem evidências fortes contra a hipótese nula — não que a hipótese nula seja verdadeira. Um teste com baixo poder estatístico pode perder totalmente um efeito genuíno, de modo que um não resultado é frequentemente uma afirmação sobre o tamanho da amostra.