IA e Automação

Como fazer teste A/B da mensagem de reativação por IA separando pacientes por faixa de valor na clínica odontológica?

Copiar modelo pronto de mensagem de reativação não diz se ele traz paciente de volta para a cadeira. Veja o método completo do teste A/B por faixa de valor, com grupo de controle, sorteio dentro de cada faixa, uma variável por vez, amostra mínima, regras do WhatsApp, LGPD e a planilha para decidir sem se enganar.

Vinícius Ragazzi
Por Vinícius RagazziAtualizado em 1 de outubro de 2026 · 22 min de leitura
TL;DR

Você testa a reativação por IA definindo a faixa de valor antes, sorteando A e B dentro de cada faixa, mudando uma variável por vez e medindo agendamento e comparecimento por paciente sorteado, sempre contra a mensagem que você já usa como controle.

Pontos-chave
  • Mensagem nova pode não vencer a atual, e ainda piorar outro indicador. Em ensaio randomizado no Barts Health NHS Trust (Inglaterra, novembro de 2013 a janeiro de 2014, 10.111 participantes), das três mensagens novas testadas contra a existente só a que informava o custo da falta para o sistema de saúde mudou a taxa de falta (8,4% contra 11,1%), e a de norma social levou a mais cancelamentos, segundo Hallsworth e colegas na PLOS ONE (2015).
  • A faixa de alto valor quase nunca tem amostra para um teste próprio. Para detectar uma mudança de 1,5 ponto percentual na taxa de falta com 80% de poder, o mesmo estudo do Barts Health calculou que precisava de 10.000 casos, o que exigiria três meses de coleta (PLOS ONE, 2015).
  • Resposta não é agendamento, nem quando é o paciente que procura a clínica. Segundo dados internos da Odonto Results (2026), entre os leads que respondem à clínica no WhatsApp, a mediana entre clínicas é de 21% que viram agendamento na conversa (faixa típica de 16% a 28%), sem contar telefone. Base: 21.433 leads. Janela: 25 de março a 25 de agosto de 2026.

Faz parte do guia: O que é uma IA de atendimento para clínica odontológica e como ela funciona?

Nesta página
  1. TL;DR
  2. Pontos-chave
  3. Por que testar a mensagem em vez de copiar um modelo pronto
  4. Comparar duas mensagens não prova que a mensagem trouxe paciente
  5. Defina a faixa de valor antes do sorteio
  6. Randomização estratificada: sorteie A e B dentro de cada faixa
  7. O que muda entre A e B: uma variável por vez
  8. Métrica primária: agendamento e comparecimento por paciente sorteado
  9. Tamanho de amostra: quantos pacientes por braço
  10. Duração e janela: envie os dois braços ao mesmo tempo
  11. Paradoxo de Simpson: quando o total mente
  12. Expectativa realista: a maioria dos testes não acha vencedor
  13. As regras do WhatsApp que contaminam ou travam o teste
  14. Fadiga e descadastro: o teste também gasta a base
  15. IA na mensagem: o braço é o template mais a conversa
  16. LGPD: separar a base por valor é tratar dado pessoal (e pode ser perfilamento)
  17. A planilha do teste: colunas mínimas
  18. Como ler o resultado e decidir
  19. Os erros que anulam o teste
  20. Seu próximo passo
  21. Perguntas frequentes

"Como fazer teste A/B da mensagem de reativação por IA separando pacientes por faixa de valor na clínica odontológica?"

Você já disparou reativação para a base parada. Alguns responderam, poucos voltaram, e ficou a dúvida: foi a mensagem ou foi o acaso?

Copiar outro modelo pronto não responde isso. Trocar o texto todo mês também não.

A resposta direta: teste A/B de reativação é sorteio, não comparação de campanhas. Você define a faixa de valor antes, sorteia A e B dentro de cada faixa, muda uma coisa só e mede quem agendou e compareceu, sempre contra a mensagem que você já usa.

E prepare-se para um resultado frequente: não ter vencedor. Num ensaio randomizado com 10.111 participantes em consultas ambulatoriais do Barts Health NHS Trust, na Inglaterra, entre 2013 e 2014, das três mensagens novas testadas contra a existente, só uma mudou a taxa de falta.

Neste guia você vai ver:

  • Por que modelo pronto não substitui teste, e o papel do grupo de controle
  • Como definir faixas de valor e sortear A e B dentro de cada uma
  • O que mudar entre as versões e qual métrica decide o vencedor
  • Quantos pacientes você precisa (e por que o alto valor quase nunca tem)
  • WhatsApp, fadiga, IA e LGPD: as regras que contaminam ou travam o teste
  • A planilha mínima, como decidir e os erros que anulam tudo

Por que testar a mensagem em vez de copiar um modelo pronto

Procure "mensagem de reativação de paciente" e você encontra listas de modelos prontos. Nenhuma ensina como saber se o modelo funciona na sua base.

O problema não é o texto. É que ninguém sabe de antemão qual texto traz paciente de volta, nem quem escreveu.

A literatura mostra isso com clareza. No estudo de Hallsworth e colegas, publicado na PLOS ONE em 2015, os pesquisadores testaram, no Barts Health, três mensagens novas de lembrete por SMS contra a mensagem existente, com 10.111 participantes entre novembro de 2013 e janeiro de 2014.

Veja o que aconteceu:

  • Custo específico: a mensagem que informava o custo da falta para o sistema de saúde teve taxa de falta de 8,4%, contra 11,1% da mensagem existente.
  • As outras duas mensagens novas, uma delas de norma social: nenhum efeito significativo na taxa de falta.
  • Efeito colateral: a de norma social ainda levou a mais cancelamentos (10,5%, contra 8,8% do controle).

Repare: uma mensagem com cara de boa prática piorou um indicador.

Uma ressalva honesta: era lembrete de consulta, não reativação de paciente parado. O tamanho do efeito não se transfere para a sua clínica. O método se transfere inteiro.

Lembre: modelo pronto é hipótese, não resultado. Só o teste na sua base diz se ele traz paciente para a cadeira.

Comparar duas mensagens não prova que a mensagem trouxe paciente

Existem duas perguntas diferentes, e o teste precisa saber qual está respondendo:

  1. A mensagem B é melhor que a A? Aqui você compara duas versões entre si.
  2. Reativar traz paciente que não voltaria sozinho? Aqui você compara mensagem contra nenhuma mensagem.

Para a primeira, o controle é a mensagem que você já usa, a atual campeã. Foi o desenho do estudo no Barts Health: cada versão nova contra a existente.

Para a segunda, o controle é um grupo sorteado que não recebe nada durante a janela do teste (o holdout). Sem ele, você conta como "reativado" o paciente que ia marcar a manutenção de qualquer jeito.

Pensa assim: se B vence A, você sabe qual texto escrever. Mas só o holdout diz quanto a reativação inteira vale em reais.

Um desenho com três braços responde às duas perguntas de uma vez: mensagem atual, mensagem nova e um grupo sem envio. Veja o passo a passo em grupo de controle para provar o ganho da automação.

Defina a faixa de valor antes do sorteio

Faixa de valor é a camada que separa o paciente de manutenção do paciente com reabilitação parada. Ela precisa existir antes do sorteio e ficar congelada até o fim do teste.

Use critérios que você já tem no prontuário e no sistema de gestão:

  • Ticket histórico: quanto o paciente já produziu na clínica.
  • Procedimento: manutenção e prevenção de um lado; reabilitação, implante e ortodontia do outro.
  • Tempo de inatividade: há quanto tempo ele não aparece.
  • Orçamento aberto: se existe tratamento orçado ou aprovado e parado.

Um exemplo de corte em três faixas:

Faixa Quem entra Hipótese de mensagem para testar Métrica que mais pesa
Manutenção Sem orçamento aberto, último procedimento preventivo Lembrete de retorno com horário concreto Agendamento e comparecimento
Tratamento intermediário Restauração, canal ou clareamento orçado e parado Menção ao tratamento que ficou pela metade Agendamento e início do tratamento
Alto valor Implante, reabilitação ou ortodontia orçados ou interrompidos Consequência clínica concreta e condição de pagamento Comparecimento à avaliação e valor iniciado

Duas regras para a faixa não virar armadilha:

  1. Congele a faixa na data do sorteio. Se o paciente fechar um orçamento no meio do teste, ele continua na faixa original para a análise.
  2. Escreva o critério. Uma definição de "alto valor" que muda na rodada seguinte impede comparar uma rodada com a outra.

Para montar a régua de priorização da base, veja como reativar a base segmentada por faixa de valor.

Randomização estratificada: sorteie A e B dentro de cada faixa

Este é o erro mais comum: mandar a versão A para a faixa de manutenção e a versão B para a de alto valor.

Isso não é teste A/B. É comparar dois públicos diferentes com duas mensagens diferentes, sem como separar uma coisa da outra.

O certo é a randomização estratificada (ou em blocos): cada faixa vira um sorteio próprio, e metade de cada faixa recebe A, metade recebe B.

Veja como fazer numa planilha:

  1. Exporte a lista de pacientes inativos com a coluna de faixa já preenchida.
  2. Crie uma coluna com a função ALEATÓRIO e cole o resultado como valor, para o número não mudar a cada edição.
  3. Ordene por faixa e, dentro da faixa, pelo número aleatório.
  4. Alterne A, B, A, B dentro de cada faixa.
  5. Salve essa lista. Ela é o registro oficial de quem recebeu o quê.

Mas o estudo do Barts Health não estratificou? Não. Lá, as consultas foram distribuídas entre as versões por randomização simples gerada por computador, sem blocos, com 10.111 participantes no primeiro ensaio. Nessa escala, o acaso equilibra os grupos sozinho.

Na base de uma clínica, com dezenas ou poucas centenas de pacientes por faixa, o acaso desequilibra. Um sorteio simples pode concentrar os pacientes de alto valor num braço, e aí a diferença vem da composição, não da mensagem.

Estratificar garante a mesma proporção de cada faixa nos dois braços. Custa pouco trabalho de planilha e elimina o problema na origem.

O que muda entre A e B: uma variável por vez

Se A e B diferem em abertura, tamanho, oferta e horário, e B vence, você não sabe o que funcionou. Mude uma coisa só por rodada.

As variáveis que valem um teste na reativação:

Variável Versão A (exemplo) Versão B (exemplo)
Abertura Saudação genérica da clínica Nome do paciente e do dentista que atendeu
Chamada para ação Pergunta aberta sobre agendar Dois horários concretos para escolher
Tratamento anterior Sem menção Menção ao tratamento que ficou parado
Custo concreto x apelo genérico Apelo genérico à saúde bucal Consequência concreta de manter o tratamento parado
Assinatura Equipe da clínica Nome da CRC que vai continuar a conversa
Horário de envio Manhã Fim da tarde

A linha "custo concreto x apelo genérico" tem a evidência mais forte. No segundo ensaio do Barts Health, com 9.848 participantes entre março e maio de 2014, a mensagem de custo específico repetiu o efeito (falta de 8,2%), mas a mesma ideia expressa em termos genéricos foi significativamente menos eficaz (falta de 9,9%).

O que isso significa na prática? Mesma ideia, palavras diferentes, resultado diferente. Concreto e genérico são uma variável de verdade, que merece rodada própria.

Dica: na faixa de alto valor, uma hipótese natural de "concreto" é a consequência clínica do tratamento parado. Na manutenção, um horário real da agenda. Teste cada uma na sua faixa.

Métrica primária: agendamento e comparecimento por paciente sorteado

Taxa de resposta é a métrica mais fácil de medir e a que mais engana. Uma mensagem provocativa gera resposta, inclusive o "pare de me mandar mensagem".

A métrica primária do teste é paciente que agendou e compareceu, dividido por paciente sorteado no braço.

Três detalhes fazem toda a diferença:

  1. O denominador é quem foi sorteado, não quem recebeu nem quem respondeu. Se B entrega menos por um motivo ligado à própria versão, isso faz parte do resultado de B. A exceção é a falha que a plataforma aplica por sorteio próprio e atinge os dois braços por igual.
  2. Agendamento sem comparecimento não paga cadeira. Registre os dois e decida pelo comparecimento sempre que a amostra permitir.
  3. Receita é métrica secundária, com teto. Um único caso de implante pode virar a média do braço inteiro. Defina antes um teto por paciente (exemplo: o valor do percentil 95 da faixa) e corte o que passar dele na análise.

Por que não decidir pela resposta? Porque, mesmo no lead novo, que procura a clínica por conta própria, responder está longe de agendar.

Segundo dados internos da Odonto Results (2026), entre os leads que respondem à clínica no WhatsApp, a mediana entre clínicas é de 21% que viram agendamento na conversa (faixa típica de 16% a 28%), sem contar telefone. Base: 21.433 leads. Janela: 25 de março a 25 de agosto de 2026.

Esse número é de lead novo, não de paciente reativado, e não se aplica à sua base inativa. O que se aplica é o recado: entre a resposta e a consulta existe um funil inteiro, e a mensagem que ganha em resposta pode perder em cadeira.

Tamanho de amostra: quantos pacientes por braço

Essa é a pergunta que quase todo teste de clínica pula. E é por isso que tanto "vencedor" é só ruído.

O estudo do Barts Health dá a escala do problema. Para detectar uma mudança de 1,5 ponto percentual na taxa de falta com 80% de poder, os autores calcularam que precisavam de 10.000 casos, o que exigiria três meses de coleta.

Você não precisa de 10.000 pacientes. Mas precisa decidir qual diferença importa antes de enviar.

A tabela abaixo é um exemplo calculado com a fórmula padrão de comparação de duas proporções (5% de significância bilateral e 80% de poder). As taxas são hipotéticas: troque pela taxa real de agendamento da sua base.

Taxa atual de agendamento (hipótese) Taxa que você quer detectar Pacientes por braço (exemplo calculado)
5% 10% 435
5% 7,5% 1.471
10% 20% 199
10% 15% 686
10% 13% 1.774
20% 30% 294
20% 25% 1.094

Repare no padrão: quanto menor a diferença que você quer enxergar, mais a amostra explode. Cortar a diferença pela metade multiplica a amostra por mais de três.

E o teste com 50 pacientes por braço? No mesmo exemplo, com taxa de 10%, ele só enxergaria um salto para perto de 33% (exemplo calculado). Qualquer melhora menor some no ruído.

Por que a faixa de alto valor quase nunca tem teste próprio

A faixa de alto valor costuma ser a menor da base: implante, reabilitação e ortodontia parados são minoria perto da manutenção. Raramente ela chega às centenas de pacientes por braço que a tabela pede.

Quatro saídas honestas:

  1. Teste na faixa com volume (manutenção) e leve a hipótese vencedora para o alto valor como ponto de partida, não como prova.
  2. Rode um teste único estratificado: a mesma mudança em todas as faixas, sorteada dentro de cada uma, analisando o efeito médio e lendo a faixa alta só como sinal.
  3. Acumule rodadas: repita o mesmo A/B no alto valor em ciclos seguidos, com a mesma regra, e some as coortes antes de decidir.
  4. Trate o alto valor com a CRC: ali a conversa humana pesa mais que o texto do primeiro toque, e o teste vira aprendizado qualitativo.

Duração e janela: envie os dois braços ao mesmo tempo

A e B saem no mesmo dia, no mesmo horário, intercalados. Mandar A na segunda e B na quinta transforma o dia da semana numa variável escondida.

O estudo do Barts Health seguiu essa lógica: as mensagens saíram cinco dias antes da consulta, com o momento constante e só o texto mudando.

No WhatsApp isso pesa ainda mais, porque o disparo para a base grande sai em ondas. Cada onda precisa levar A e B misturados, nunca "hoje todo A, amanhã todo B".

Defina antes do envio:

  1. Janela de envio: quando os dois braços saem.
  2. Janela de medição: até quando um agendamento conta para o teste (exemplo: agendamentos feitos até 14 dias depois do envio).
  3. Janela de comparecimento: até quando a consulta agendada precisa acontecer para contar.

Cubra semanas completas, para que todos os dias da semana apareçam nos dois braços.

E não espie. Olhar o painel todo dia e parar no primeiro dia em que B aparece na frente é o jeito mais rápido de declarar vencedor um resultado que é puro acaso. Quem testa a sério fixa o tamanho da amostra e a data de leitura antes de começar.

Paradoxo de Simpson: quando o total mente

Este é o motivo técnico de estratificar e de analisar por faixa. Veja um exemplo hipotético de teste em que o sorteio desequilibrou as faixas:

Faixa Versão A Versão B
Manutenção 16 de 80 agendaram (20%) 5 de 20 agendaram (25%)
Alto valor 1 de 20 agendou (5%) 8 de 80 agendaram (10%)
Total 17 de 100 (17%) 13 de 100 (13%)

B vence dentro de cada faixa. Mas, no total, A parece melhor.

O que aconteceu? A recebeu mais pacientes de manutenção, que neste exemplo agendam mais. O total mediu a composição dos braços, não a mensagem.

Esse é o paradoxo de Simpson. Duas defesas:

  1. Estratifique o sorteio, para que a proporção de cada faixa seja igual nos dois braços.
  2. Mantenha as proporções estáveis até o fim. Se entrar paciente novo no meio do teste, sorteie dentro da faixa, nunca jogue o lote inteiro num braço só.

Expectativa realista: a maioria dos testes não acha vencedor

Prepare a equipe para isso antes de começar. No primeiro ensaio do Barts Health, das três mensagens novas, só a de custo específico mudou a taxa de falta. Duas em três não mexeram no indicador principal.

Em escala muito maior, o padrão se repete. No Bing, da Microsoft, onde milhares de experimentos rodam por ano, a maioria falha, segundo Kohavi, Deng, Longbotham e Xu (KDD 2014).

Empate não é fracasso. É informação: a mudança testada não importa o bastante para justificar a troca.

E o resultado espetacular merece desconfiança, não comemoração. A chamada lei de Twyman, que a equipe de experimentação da Microsoft invoca diante de todo resultado forte demais, resume o cuidado: qualquer número que parece interessante ou diferente costuma estar errado. Antes de acreditar, confira o sorteio, a entrega e a planilha.

Depois, replique. Foi o que os pesquisadores fizeram: o segundo ensaio, com outra amostra, repetiu o efeito da mensagem de custo específico (falta de 8,2%). Só então o achado ganhou peso.

As regras do WhatsApp que contaminam ou travam o teste

O canal tem regras próprias, e cada uma pode estragar a comparação se você não planejar.

1. Template aprovado fora da janela de atendimento. Pela documentação oficial da Meta, quando o paciente manda mensagem, abre uma janela de atendimento de 24 horas, e, fechada a janela, a empresa só envia templates pré-aprovados. O paciente inativo quase sempre está fora dela. Ou seja, A e B são dois templates, e os dois precisam estar aprovados antes do dia do envio.

2. Opt-in. A Meta exige que a empresa obtenha permissão (opt-in) antes de enviar mensagens e que atenda aos pedidos de descadastro. Paciente sem opt-in fica fora dos dois braços.

3. Limite de mensageria. Pela documentação de limites de mensagens da Meta, portfólios comerciais recém-criados têm limite de 250, contado em números únicos de usuários fora da janela de atendimento, num período móvel de 24 horas. Base maior que o limite sai em ondas, e cada onda leva A e B intercalados.

4. Holdout de experimento da Meta (erro 130472). A Meta mantém uma pequena porcentagem de usuários do WhatsApp que não recebe templates de marketing, salvo as exceções que ela descreve, e não oferece opção de sair desse experimento. Quando o paciente está nesse grupo, a mensagem não é enviada e o webhook volta com falha e código 130472. Registre esses pacientes e tire-os dos dois braços na análise.

Atenção: isso só é justo se A e B forem da mesma categoria de template. Se A for marketing e B for utilidade, só A sofre o holdout, e o teste fica torto antes de começar.

5. Otimizações automáticas de criativo. Na API de mensagens de marketing, a Meta descreve otimizações automáticas de criativo, ainda em teste, que aplicam tratamentos como animação e filtro de imagem. Se a plataforma mexe no criativo de um braço e não do outro, você mede a otimização dela, não o seu texto. Use a mesma configuração nos dois braços e prefira testar texto.

Fadiga e descadastro: o teste também gasta a base

Cada envio do teste é um toque a mais na vida do paciente. Testar sem limite queima a base que você quer recuperar.

Três regras de proteção:

  1. Mesmo número de toques nos dois braços. Se B tem um follow-up a mais, você está testando cadência, não mensagem.
  2. Opt-out por braço é métrica de dano. Conte "pare", bloqueio e denúncia em A e em B. Uma versão que agenda um pouco mais e descadastra muito mais não venceu.
  3. Respeite o intervalo entre rodadas. Quem recebeu a rodada passada não entra na seguinte antes do prazo que você definiu para a faixa.

O feedback negativo dos pacientes também pesa na nota de qualidade do template perante a Meta, e nota baixa pode pausar o template e afetar a entrega. O teste mal dosado não perde só pacientes: pode travar o template que a clínica inteira usa.

Para calibrar o limite por faixa, veja quantos toques de reativação a base aguenta antes de queimar.

IA na mensagem: o braço é o template mais a conversa

Na reativação por IA, o template é só o primeiro toque. Quem responde ao paciente depois é a IA, e é ali que o agendamento acontece ou se perde.

Isso muda o desenho do teste:

  • O braço inclui a conversa. Se o template B fala do tratamento parado, a IA precisa saber disso para não contradizer a abertura. Passe o braço como contexto para ela.
  • Congele a IA durante o teste. Trocar o modelo, o prompt ou as regras no meio do caminho muda os dois braços ao mesmo tempo e embaralha o resultado.
  • Se a IA escreve a mensagem, a versão é a instrução. Com texto personalizado por paciente, você compara a instrução A contra a instrução B, não dois textos fixos.

E a transparência? Há paciente que rejeita conversa automática, e esconder a IA não é saída.

A variável honesta é como você se apresenta: "assistente da clínica" de um lado, o nome da CRC que assume a conversa do outro, desde que quem assina seja de fato quem continua o atendimento. Nunca teste uma IA se passando por pessoa.

LGPD: separar a base por valor é tratar dado pessoal (e pode ser perfilamento)

A Lei Geral de Proteção de Dados (Lei 13.709/2018) vale para o tratamento de dados feito por pessoa natural ou jurídica (art. 1º). Ou seja, ela alcança tanto o dentista pessoa física quanto a clínica como empresa. No teste de reativação, quem decide como os dados do paciente são usados é a clínica, e por isso é ela a controladora (art. 5º, VI).

Quatro pontos tocam o teste A/B por faixa de valor:

  1. Procedimento é dado de saúde. A lei classifica dado referente à saúde como dado pessoal sensível (art. 5º, II), e o tratamento de dado sensível só pode ocorrer nas hipóteses do art. 11. Separar a base por "implante parado" usa esse dado.
  2. Decisão automatizada dá direito a revisão. O art. 20 garante ao paciente o direito de solicitar a revisão de decisões tomadas unicamente com base em tratamento automatizado que afetem seus interesses, incluídas as que definem seu perfil de consumo. Se a IA decide sozinha quem recebe qual abordagem, o teste pode entrar aqui.
  3. A clínica precisa explicar o critério. Pelo § 1º do art. 20, o controlador deve fornecer, sempre que solicitado, informações claras e adequadas sobre os critérios e os procedimentos usados na decisão automatizada.
  4. O pedido de "pare" encerra a participação. Se a base legal for o consentimento, o paciente pode revogá-lo (art. 18, IX), e quem pede para sair sai do teste, em qualquer braço.

Na prática: teste texto e abordagem, não condição comercial diferente por perfil. Mantenha uma pessoa revisando os critérios das faixas e valide a base legal com quem cuida da proteção de dados da clínica.

O passo a passo do consentimento está em consentimento e opt-out na reativação automatizada.

A planilha do teste: colunas mínimas

Você não precisa de software de experimento. Precisa de uma planilha com duas abas e disciplina para preencher.

Aba 1, o plano (preencha antes do envio): hipótese, variável testada, faixas, métrica primária, janelas, pacientes por braço e regra de decisão. É o seu pré-registro: impede que você mude o critério depois de ver o resultado.

Aba 2, o registro (uma linha por paciente sorteado):

Coluna O que registrar Por que importa
Paciente Código interno, não o nome Reduz a exposição de dado
Faixa Faixa na data do sorteio Permite a análise por estrato
Braço A, B ou controle É a base da comparação
Data de envio Dia e hora Confere se os braços saíram juntos
Entregue Sim ou não, com o código de erro Separa o holdout da Meta de falha comum
Respondeu Sim ou não Métrica de apoio, nunca de decisão
Agendou Data do agendamento Métrica primária
Compareceu Sim ou não Métrica primária final
Valor Valor iniciado, com teto Métrica secundária
Opt-out Pare, bloqueio ou denúncia Métrica de dano

Dica: antes do primeiro A/B, rode um teste A/A, a mesma mensagem para dois grupos sorteados. Se o resultado sair muito diferente, o problema está no sorteio ou no registro, não na mensagem, e você descobre isso antes de tomar uma decisão errada.

Como ler o resultado e decidir

Na data marcada, e só nela, compare os braços dentro de cada faixa e depois no total estratificado.

O que aconteceu Decisão
B vence em comparecimento, acima da diferença mínima definida, sem mais opt-out Adote B naquela faixa e replique na próxima rodada
Empate Mantenha a versão mais barata de operar (menos toques, menos trabalho da CRC)
B vence em resposta e empata em agendamento Não adote: resposta não paga cadeira
B vence, mas com mais opt-out Pese o dano antes; na dúvida, não adote
Resultado espetacular Desconfie, confira os dados e replique antes de escalar
Vencedor diferente em cada faixa Use uma versão por faixa: o teste existe para isso

Depois da decisão, escreva a próxima hipótese. O teste de reativação é uma fila de perguntas, uma por rodada, e a vencedora de hoje vira o controle de amanhã.

Os erros que anulam o teste

  1. Testar faixa contra faixa. A para manutenção e B para alto valor compara públicos, não mensagens.
  2. Mudar três coisas ao mesmo tempo. B vence e ninguém sabe por quê.
  3. Rodar com amostra minúscula (50 por braço, por exemplo). Só um salto enorme apareceria; o resto é ruído.
  4. Medir resposta e não cadeira. A mensagem que mais gera resposta pode trazer menos paciente.
  5. Trocar o template ou a IA no meio. O teste vira dois testes pela metade.
  6. Enviar os braços em dias diferentes. O dia da semana vira a variável.
  7. Parar no primeiro dia bom. Espiar e parar fabrica vencedor.
  8. Ignorar o holdout da Meta e a categoria do template. Um braço perde entrega por um motivo que não tem nada a ver com o texto.
  9. Não contar opt-out. Você ganha um agendamento e perde o canal com outros pacientes.

Seu próximo passo

  1. Monte as faixas e congele a lista. Exporte a base inativa, classifique por ticket, procedimento, tempo parado e orçamento aberto, e salve a versão do dia.
  2. Escreva o plano de uma página. Uma variável, a métrica primária (agendamento e comparecimento por paciente sorteado), as janelas e o tamanho por braço, tudo calculado antes do envio.
  3. Sorteie dentro de cada faixa e envie A e B juntos. Registre tudo na planilha, não espie, e decida na data marcada.

Quer rodar a reativação por faixa de valor com IA, CRC e medição até a cadeira, sem testar no escuro? Agende uma apresentação.

Perguntas frequentes

Posso testar a mensagem A numa faixa de valor e a mensagem B em outra?

Não. Isso compara dois públicos diferentes com duas mensagens diferentes, e não dá para separar o efeito do texto do efeito do perfil. O certo é sortear A e B dentro de cada faixa, para que manutenção, tratamento intermediário e alto valor apareçam na mesma proporção nos dois braços.

Quantos pacientes preciso por versão no teste A/B de reativação?

Depende da sua taxa atual de agendamento e da menor melhora que você quer enxergar, e quase sempre é mais do que parece. Num exemplo calculado com taxa hipotética de 10% e meta de 15%, são cerca de 686 pacientes por braço. No NHS inglês, o estudo do Barts Health calculou que precisava de 10.000 casos para detectar uma mudança de 1,5 ponto percentual na taxa de falta com 80% de poder.

Qual métrica decide o vencedor do teste de reativação?

Agendamento e comparecimento divididos pelo número de pacientes sorteados em cada braço. Taxa de resposta é métrica de apoio, porque uma mensagem provocativa gera resposta sem gerar consulta. Receita entra como métrica secundária, com teto por paciente definido antes, para um único caso de alto valor não decidir o teste sozinho.

Quanto tempo o teste A/B de reativação deve durar?

Até fechar a janela de medição que você definiu antes do envio, com os dois braços enviados no mesmo dia e intercalados. Agendamento e comparecimento demoram mais que resposta, então o teste cobre o ciclo inteiro até a consulta. Parar no primeiro dia em que uma versão aparece na frente é o erro que mais fabrica vencedor falso.

Separar pacientes por valor para a IA abordar esbarra na LGPD?

Pode esbarrar, e a lei alcança também a clínica como empresa, que decide o uso dos dados e por isso é a controladora. Histórico de procedimento é dado de saúde, classificado como sensível pela Lei 13.709/2018, e o art. 20 dá ao paciente o direito de pedir revisão de decisão tomada unicamente por tratamento automatizado. Teste texto e abordagem, não condição comercial diferente por perfil, e valide a base legal antes.

O que fazer quando o teste não aponta vencedor?

Mantenha a versão mais barata de operar e passe para a próxima hipótese. Empate é frequente: no primeiro ensaio do Barts Health, duas das três mensagens novas não tiveram efeito significativo na taxa de falta. Empate diz que a mudança testada não vale a troca, e isso também é aprendizado.