Estimativa para uma clínica com 5 profissionais, ~1.350 turnos (mensagens de paciente) por mês. Custos calculados a partir do tamanho real do prompt de sistema e das 7 tools do código (não medidos via API — não há chave de produção disponível para teste ao vivo). Gerado em 10/07/2026.
Mesma clínica, ~1.350 turnos/mês. As duas primeiras barras são o mesmo provider (Anthropic), antes e depois do fim do preço promocional.
Volume constante (~1.350 turnos/mês). O degrau em setembro é a data confirmada de fim do preço de lançamento do Sonnet 5 — não é uma projeção, é a data já anunciada.
O maior "chute" desta conta é o volume de turnos/mês. Esta faixa mostra o custo (preço padrão do Anthropic, já sem o desconto) para uma clínica menor, na estimativa central, e uma bem mais movimentada.
Cada mensagem do paciente vira um turno; o tipo de turno determina quantas chamadas ao modelo ele dispara (0 a 4).
| Tipo de turno | % do tráfego | Chamadas ao LLM | Anthropic (até 31/08) | Anthropic (a partir 01/09) | OpenAI (gpt-5-mini) |
|---|---|---|---|---|---|
| FAQ / preço (1 tool call) | 40% | 2 | $0,0120 | $0,0178 | $0,0027 |
| Agendamento completo (contexto + disponibilidade + criar) | 35% | 4 | $0,0267 | $0,0399 | $0,0053 |
| Resposta curta (sem tool call) | 20% | 1 | $0,0049 | $0,0071 | $0,0014 |
| Off-topic / handoff (só classificador) | 5% | 0 | $0,0005 | $0,0005 | $0,0005 |
| Média ponderada / turno | 100% | — | $0,0152 | $0,0225 | $0,0032 |
Comparação não é 1:1. O loop principal usa Claude Sonnet 5 (camada premium) no Anthropic, mas gpt-5-mini (camada econômica) no OpenAI — a diferença de preço reflete tier de modelo, não só provider.
O código nunca desativa thinking no Sonnet 5 — por padrão isso roda com adaptive thinking ligado, e esses tokens são cobrados como output mesmo sem aparecer na resposta. Não medido aqui; efeito tende a ser pequeno porque o custo já é dominado pelo input.
Sem prompt caching hoje. Prompt de sistema + 7 tools (~1.750 tokens) são reenviados inteiros em toda chamada do loop, sem cache — é o maior driver de custo e a maior alavanca de economia se o volume crescer.
Nenhum lugar do código loga usage (tokens reais) por turno hoje. Assim que houver tráfego real, vale registrar isso para trocar esta estimativa por números medidos.