Evidência importa porque um resultado estatístico só é defensável quando outra pessoa qualificada consegue reconstruir qual pergunta foi feita, quais observações a sustentam, o que foi estimado e onde a conclusão deve parar. Decida primeiro o que cada observação representa, qual efeito responde à pergunta em saúde e se as observações são independentes, pareadas, repetidas ou agrupadas. Registre essas decisões num contrato da análise — uma memória verificável da pergunta pretendida, não um documento jurídico nem papelada preenchida depois do resultado. Só então compare métodos e relate, juntos, efeito, incerteza, diagnósticos e limitações.
A pergunta científica que a análise prometeu responder
Ficha do caso totalmente sintético AURORA-30 (30 registros fictícios; não é evidência clínica) e validador estrutural
Pergunta, unidade, desfecho, dependência, justificativa amostral e revisão de ausências
- 01PerguntaPopulação · desfecho · tempo
- 02EstruturaUnidade · dependência · ausências
- 03MétodoEfeito · suposições · diagnósticos
- 04RelatoEstimativa · intervalo · limitação
Um motivo concreto para parar
Trinta registros, uma pergunta vaga, várias respostas incompatíveis#
A AURORA-30 é um conjunto de dados didático totalmente sintético: 30 registros fictícios construídos para treinamento em métodos. Não contém pacientes, instituições, intervenções ou resultados clínicos reais, e nenhum cálculo feito com esses dados constitui evidência clínica. No cenário, adultos são acompanhados por 30 dias após um programa padronizado de alta ou o cuidado usual. Uma colega envia escores de sintomas no início e no dia 30 e pergunta: “O programa ajudou?”. A tentação é abrir o menu de testes e comparar as duas colunas numéricas que estiverem à vista.
As linhas, porém, não decidem a pergunta. Um contraste entre grupos no dia 30 compara programa e cuidado usual; um contraste entre início e dia 30 pergunta se as mesmas pessoas mudaram ao longo do tempo; comparar a mudança entre grupos pergunta se essas trajetórias diferiram. Os três caminhos podem produzir contas corretas e ainda sustentar frases diferentes no relato. Sem uma trilha explícita, a análise pode começar com uma pergunta e publicar a resposta de outra sem que nenhum erro de software anuncie a troca.
Por que a evidência vem antes da técnica
O resultado precisa carregar o caminho que lhe dá sentido#
Em pesquisa em saúde, o risco prático não se limita a escolher o teste errado num menu. A unidade de análise, o momento da comparação, o tratamento das ausências, o efeito-alvo ou a afirmação principal podem mudar enquanto o trabalho avança. Um p-valor preciso não corrige esse desvio; pode apenas dar mais autoridade à resposta científica errada.
Uma trilha de evidências mantém conectadas a pergunta, as decisões sobre os dados, a estimativa, as suposições, os diagnósticos e os limites. Ela permite que uma colega ou revisora reconstrua a rota, conteste uma incompatibilidade e distinga uma conclusão pré-especificada de um achado exploratório. O rigor técnico importa porque cada número herda sentido dessas decisões — não porque complexidade tenha valor por si só.
Comece antes do software
Escreva a pergunta e o efeito-alvo#
Uma pergunta como “a intervenção funciona?” ainda não é um contrato de análise. Nomeie população, intervenção ou exposição, comparação, desfecho, tempo e o efeito que pretende estimar. Diferença de médias no dia 30, razão de chances durante o acompanhamento e contraste de sobrevivência são alvos distintos, mesmo quando vêm do mesmo conjunto de dados.
O estimando conecta a pergunta científica ao que a análise deve estimar. O ICH E9(R1) formaliza essa ligação para ensaios clínicos; fora desse escopo, a mesma disciplina continua útil, mas não transforma uma comparação observacional em efeito causal.
O desenho muda o método
Conte unidades, não linhas#
- 01
Grupos independentes
Pessoas ou unidades independentes contribuem para cada grupo.
- 02
Observações pareadas
A mesma pessoa ou um par combinado contribui com duas medidas vinculadas.
- 03
Medidas repetidas
Vários tempos ou condições pertencem à mesma unidade e compartilham correlação.
- 04
Conglomerados
As pessoas também podem estar agrupadas em clínicas, domicílios, enfermarias ou centros.
O registro das decisões
Transforme escolhas ocultas numa ficha analítica de uma página#
Agora o contrato tem motivo para existir: é uma memória curta e verificável das decisões que impede a pergunta original de mudar silenciosamente enquanto a análise é construída. Registre escala do desfecho, número de grupos ou tempos, dependência, efeito-alvo, justificativa do tamanho amostral, plano para dados ausentes, conjunto de afirmações que pode exigir controle de multiplicidade, diagnósticos e itens obrigatórios do relato. Separe afirmações primárias e pré-especificadas de comparações exploratórias. Campos vazios são úteis porque expõem decisões ainda não tomadas.
O contrato da análise não é um documento jurídico, não escolhe o método automaticamente e não é papelada preenchida depois do resultado. Ele reduz as opções defensáveis antes da execução e oferece contexto para a revisão contestar incompatibilidades — por exemplo, um teste para amostras independentes aplicado a medidas repetidas da mesma pessoa.
Preserve a pergunta antes de escolher o método
A AURORA-30 é totalmente sintética. Seu JSON torna revisáveis a pergunta e as decisões de desenho antes da execução; o verificador sem dependências detecta campos ausentes ou estrutura incoerente. Os identificadores em inglês são nomes literais do contrato compartilhado, não prosa para o leitor. O código não recomenda um método estatístico.
{
"study_id": "AURORA-30",
"question": {
"population_id": "eligible_participants",
"outcome_id": "symptom_score_day_30",
"comparison_ids": ["discharge_program", "usual_care"],
"estimand_id": "mean_difference_day_30_program_minus_usual_care"
},
"structure": {
"unit": "participant",
"between_groups": "independent",
"baseline_followup": "paired",
"missingness_reviewed": true
},
"planning": {
"sample_size_justification_id": "precision_for_target_effect",
"primary_claim_ids": ["day_30_mean_difference"],
"exploratory_comparisons_labeled": true
},
"report": {
"required": ["estimate", "confidence_interval", "diagnostics", "limitation"],
"causal_claim_allowed": false
}
}import copy
import json
import sys
REQUIRED_REPORT = {"estimate", "confidence_interval", "diagnostics", "limitation"}
def validate(contract):
problems = []
question = contract.get("question", {})
structure = contract.get("structure", {})
planning = contract.get("planning", {})
report = contract.get("report", {})
for key in ("population_id", "outcome_id", "comparison_ids", "estimand_id"):
if not question.get(key):
problems.append(f"question.{key} is required")
if structure.get("unit") != "participant":
problems.append("structure.unit must preserve the participant")
if structure.get("between_groups") != "independent":
problems.append("the day-30 group contrast must record independent groups")
if structure.get("baseline_followup") != "paired":
problems.append("baseline and follow-up must remain paired within participant")
if structure.get("missingness_reviewed") is not True:
problems.append("missingness review is required")
if not planning.get("sample_size_justification_id"):
problems.append("planning.sample_size_justification_id is required")
if not planning.get("primary_claim_ids"):
problems.append("planning.primary_claim_ids must name at least one primary claim")
if planning.get("exploratory_comparisons_labeled") is not True:
problems.append("exploratory comparisons must be labeled")
missing_report = REQUIRED_REPORT - set(report.get("required", []))
if missing_report:
problems.append("report.required lacks: " + ", ".join(sorted(missing_report)))
if report.get("causal_claim_allowed") is not False:
problems.append("report.causal_claim_allowed must remain false for this teaching case")
return problems
def show(label, contract):
problems = validate(contract)
status = "HOLD" if problems else "READY_FOR_METHOD_REVIEW"
print(f"{label}: {status}")
for problem in problems:
print(f" - {problem}")
with open(sys.argv[1], encoding="utf-8") as source:
supplied = json.load(source)
print(f"{supplied.get('study_id', 'UNNAMED')} | structural analysis-contract check")
show("supplied_contract", supplied)
pairing_probe = copy.deepcopy(supplied)
pairing_probe["structure"]["baseline_followup"] = "independent"
show("pairing_regression_probe", pairing_probe)
planning_probe = copy.deepcopy(supplied)
planning_probe.pop("planning", None)
show("missing_planning_probe", planning_probe)
causal_probe = copy.deepcopy(supplied)
causal_probe["report"]["causal_claim_allowed"] = True
show("causal_claim_regression_probe", causal_probe)
print("scope: structural planning aid; no method selection or clinical authorization")python check_contract.py analysis-contract.jsonSaída esperada
AURORA-30 | structural analysis-contract check
supplied_contract: READY_FOR_METHOD_REVIEW
pairing_regression_probe: HOLD
- baseline and follow-up must remain paired within participant
missing_planning_probe: HOLD
- planning.sample_size_justification_id is required
- planning.primary_claim_ids must name at least one primary claim
- exploratory comparisons must be labeled
causal_claim_regression_probe: HOLD
- report.causal_claim_allowed must remain false for this teaching case
scope: structural planning aid; no method selection or clinical authorizationFalha exercitada. A sonda de regressão embutida rotula início e seguimento como independentes. O verificador retorna HOLD porque as duas observações pertencem à mesma pessoa.
Limite de produção. O artefato verifica apenas a estrutura do planejamento. A revisão que considera o desenho continua responsável pela escolha do método, pela interpretação e por qualquer uso com dados reais em saúde.
Suposições são afirmações sobre o desenho
Diagnostique o modelo, não a normalidade por ritual#
Um p-valor alto num teste de normalidade não prova normalidade, e um p-valor baixo não obriga automaticamente a usar um teste de postos. Considere desenho, estrutura dos resíduos, tamanho amostral, valores atípicos, assimetria, padrão de variâncias, escala de medida e qual parâmetro o método realmente estima. Quando forem pertinentes ao modelo selecionado, use gráficos quantil–quantil e de resíduos versus valores ajustados como diagnósticos — não como prova mecânica de que as suposições valem.
Métodos baseados em postos não são genericamente “testes de medianas”. Conforme o método e suas suposições, eles podem tratar de ordenação entre distribuições, probabilidade de superioridade ou deslocamento de localização; um contraste de medianas exige condições adicionais. Quando as suposições forem duvidosas, considere um método que mire o efeito mais diretamente, uma análise robusta ou uma análise de sensibilidade pré-especificada.
Pacote de interpretação
Não deixe o p-valor viajar sozinho#
- 01
Estimativa
Declare o efeito na escala compatível com a pergunta e o desenho.
- 02
Intervalo
Mostre a incerteza ao redor da estimativa.
- 03
Diagnósticos
Registre as verificações importantes para o método selecionado.
- 04
p-valor
Use-o somente quando um teste de hipótese pré-especificado for pertinente.
- 05
Limitação
Nomeie o que desenho, dados ausentes, viés ou dados não conseguem estabelecer.
Limite de escopo
Uma análise coerente não é autorização clínica#
PODE
- Expor por que o método combina com a pergunta e o desenho
- Prevenir erros comuns entre análises independentes e pareadas
- Manter efeito, intervalo, diagnósticos e limitações juntos
- Tornar revisáveis os desvios do plano de análise
NÃO PODE
- Consertar amostragem enviesada ou um processo de medida inválido
- Criar evidência causal apenas pela associação
- Substituir ética, conhecimento do domínio ou julgamento clínico
- Garantir que a estimativa seja válida em outra população
Checklist reutilizável
Doze perguntas antes de nomear o método#
- Qual é a pergunta e o estimando?
- Qual população e unidade de análise estão representadas?
- Qual é o tipo e a escala do desfecho?
- Quantos grupos, tempos ou condições existem?
- As observações são independentes, pareadas, repetidas ou agrupadas?
- Como a amostra foi obtida, como seu tamanho foi justificado e quais vieses são plausíveis?
- Dados ausentes, valores atípicos, unidades, datas e códigos foram revisados?
- Quais suposições são razoáveis segundo desenho e dados?
- A análise foi pré-especificada, quais afirmações são primárias ou exploratórias e quantas comparações estão previstas?
- Qual método estima diretamente o efeito-alvo?
- Qual efeito, intervalo e diagnóstico acompanham o resultado?
- Quais limitações impedem afirmações causais ou mais amplas?
Conclusão
Preserve a pergunta, não apenas o resultado#
A lição central não é que toda análise em saúde precise de um método mais sofisticado. É que os mesmos dados podem sustentar várias análises matematicamente corretas, enquanto apenas uma corresponde à pergunta que o estudo prometeu responder. Por isso, um resultado defensável carrega sua rota: pergunta, unidade, efeito-alvo, suposições, decisões sobre os dados, estimativa, incerteza, diagnósticos e limites.
Antes de nomear o método, escreva em uma frase quem será comparado, em qual desfecho, em que momento e por meio de qual efeito. Se outra pessoa qualificada não conseguir reconstruir a mesma análise a partir dessa frase e do registro de decisões, o trabalho ainda não está pronto para o menu de testes. O contrato demonstra seu valor ao revelar essa lacuna cedo — quando ainda é possível corrigir a pergunta sem reescrever o resultado.
Fontes primárias
Fontes primárias
- Altman e Bland: Statistics notes—Units of analysis
Mostra por que a unidade de observação não se confunde com a quantidade de valores na tabela.
- ICH E9(R1): Estimands and Sensitivity Analysis
Conecta objetivos, estimandos, eventos intercorrentes, observações ausentes e análise de sensibilidade em ensaios.
- Diretrizes SAMPL
Orienta análise e relato estatísticos, inclusive estimativas, incerteza e descrição transparente dos métodos.
- Altman e Bland: Parametric v non-parametric methods for data analysis
Explica por que a escolha deve seguir o parâmetro de interesse e o problema distributivo, não um ritual de teste de normalidade.
- Fay e Proschan: Wilcoxon–Mann–Whitney or t-test?
Detalha interpretações distintas do procedimento de Wilcoxon–Mann–Whitney sob diferentes suposições.
- Declaração da ASA sobre p-valores
Explica o que p-valores medem, o que não medem e por que transparência e relato completo importam.
- Biblioteca de diretrizes da Rede EQUATOR
Direciona diretrizes de relato conforme desenho e tipo de pesquisa.
De um checklist a um registro completo de evidências