A pessoa ainda estava pensando. O agente já respondeu.
A pergunta era simples: “Qual é o número do pedido?”
A pessoa começou: “Deixa eu abrir aqui…” Fez uma pausa de dois segundos. O agente interpretou o silêncio como fim da resposta, repetiu a pergunta e começou a explicar onde encontrar o número. Quando a pessoa tentou interromper, ele terminou a frase inteira.
A voz era boa. A conversa, não.
Esse tipo de falha passa fácil numa demo porque a demo costuma ter microfone limpo, resposta pronta e ninguém falando por cima. Telefone real tem pausa, ruído, viva-voz, sinal ruim, gente procurando documento e duas pessoas dizendo “alô” ao mesmo tempo.
Agente de ligação não precisa apenas entender palavras. Precisa administrar turnos: quando ouvir, quando falar, quando pedir confirmação e quando encerrar.
Resposta curta
Antes de colocar um agente de voz em volume, rode uma bateria com pelo menos doze chamadas ruins. Em cada uma, registre:
- o que a pessoa fez;
- o que o agente entendeu;
- quando começou e parou de falar;
- se pediu confirmação;
- como a chamada terminou;
- qual trecho permite revisar o erro;
- qual configuração, regra ou ferramenta precisa mudar.
Não aprove o piloto só porque a transcrição final parece correta. Uma transcrição limpa pode esconder que o agente interrompeu três vezes, deixou cinco segundos de silêncio sem explicação ou falou uma confirmação depois que a pessoa pediu para encerrar.
Silêncio não tem um significado só
Silêncio pode significar:
- a pessoa está pensando;
- está procurando um número;
- não ouviu;
- deixou o telefone no viva-voz;
- a rede cortou o áudio;
- a ferramenta do agente está demorando;
- ninguém atendeu de verdade;
- a chamada caiu sem o sistema perceber;
- a pessoa não quer continuar.
Tratar todos esses casos como “fale novamente” cria uma ligação cansativa. Tratar como autorização para seguir cria uma ligação invasiva.
A documentação da ElevenLabs separa espera por silêncio, soft timeout, interrupções e disposição para assumir o turno. A própria documentação alerta que tempos curtos podem interromper quem precisa pensar e sugere mais paciência ao coletar dados estruturados. A Twilio também expõe controles distintos para permitir interrupção da fala, ajustar sensibilidade, definir o fim do turno e receber eventos enquanto o agente fala.
O nome do botão muda conforme o provedor. A decisão operacional não muda: quanto tempo é uma pausa normal neste tipo de chamada e o que o agente faz depois dela?
Quatro relógios que precisam ser separados
Não use um único timeout para tudo.
| Relógio | O que mede | Resposta segura |
|---|---|---|
| espera pela pessoa | tempo depois de uma pergunta | esperar conforme a dificuldade; depois oferecer ajuda curta |
| processamento | tempo para o agente formular resposta | dar sinal breve sem inventar prazo |
| ferramenta | tempo de CRM, agenda ou pedido | informar que está consultando; não confirmar sem resultado |
| abandono | tempo sem voz, evento ou estado confiável | verificar presença uma vez e encerrar com motivo claro |
“Só um segundo” parece natural. Se o sistema pode levar vinte, a frase vira promessa sem controle. A documentação da ElevenLabs recomenda evitar indicação de tempo em mensagens de preenchimento porque a duração real pode variar.
Uma alternativa mais honesta:
Estou consultando o pedido. Se a consulta não voltar, registro a tentativa e explico o próximo passo.
Agora o silêncio tem causa e saída.
Interromper precisa mudar o comportamento
Alguns agentes detectam que a pessoa falou enquanto a voz sintética tocava. Mesmo assim, continuam reproduzindo áudio. Outros cortam qualquer frase ao ouvir um “aham”, um ruído ou a televisão.
Os dois extremos são ruins.
A Twilio distingue duas coisas que parecem iguais:
- permitir que a fala da pessoa interrompa a reprodução;
- enviar a fala para a aplicação enquanto o agente continua falando.
Também oferece sensibilidade de interrupção. Isso importa porque detectar som não basta. A operação precisa decidir se aquele som era pedido para parar, resposta, confirmação curta ou apenas ruído.
Teste pelo menos estas frases:
- “Espera.”
- “Não, é outro pedido.”
- “Pode repetir?”
- “Aham.”
- “Já entendi.”
- “Quero falar com uma pessoa.”
- “Não quero mais receber ligação.”
O resultado esperado não é igual. “Espera” pede pausa. “Não, é outro pedido” corrige estado. “Aham” talvez só sinalize acompanhamento. Pedido de humano muda o fluxo. Pedido de encerramento precisa encerrar e registrar.
Doze chamadas que valem mais do que outra demo
Abra o checklist de piloto para agente de voz e acrescente esta bateria ao caso real que você quer testar.
| Teste | O que provocar | Resultado esperado |
|---|---|---|
| 1. pausa curta | dois segundos antes de responder | agente espera sem repetir nem completar pela pessoa |
| 2. pausa longa | procurar um documento por dez segundos | agente pergunta se pode ajudar ou esperar; não entra em loop |
| 3. interrupção clara | “espera” no meio da fala | áudio para e o agente aguarda |
| 4. correção | “não, o pedido é outro” | estado anterior é descartado antes de consultar de novo |
| 5. retorno curto | “aham” durante explicação | não interrompe por falso positivo nem perde o contexto |
| 6. ruído | televisão, trânsito ou outra voz | dado não é confirmado sem repetição e validação |
| 7. pessoa errada | outra pessoa atende | agente não revela motivo ou dado indevido e encerra conforme a regra |
| 8. caixa postal | saudação gravada ou sinal automático | não conduz diálogo fictício; classifica e encerra |
| 9. ferramenta lenta | CRM demora além do normal | agente explica a consulta sem inventar resultado |
| 10. ferramenta incerta | timeout depois de uma ação | verifica estado antes de repetir |
| 11. pedido humano | pessoa pede atendente | agente para de vender a automação e faz handoff com contexto |
| 12. pedido de saída | pessoa pede para não continuar | chamada encerra e a recusa muda a próxima abordagem |
Rode cada caso três vezes. Uma vez com áudio limpo, uma com ruído e uma com ritmo mais lento. O objetivo não é encontrar a configuração perfeita no primeiro dia. É descobrir se o erro se repete e se a equipe consegue corrigi-lo.
Fluxo para decidir o próximo turno
Chamada concluída não quer dizer conversa concluída
A API de voz da Twilio diferencia estados como em fila, tocando, em andamento, concluída, ocupada, sem resposta, falha ou cancelada. Isso já mostra um problema básico: “discou” e “falou com a pessoa certa” não são o mesmo evento.
Na operação, separe pelo menos:
- não completou;
- tocou e ninguém atendeu;
- caixa postal;
- pessoa errada;
- conversa iniciada;
- conversa interrompida;
- objetivo concluído;
- handoff realizado;
- saída solicitada;
- falha técnica;
- estado desconhecido.
Se tudo vira “chamada concluída”, a taxa fica bonita e o QA fica cego.
Para ligação ativa, confiança começa antes do alô
A Anatel explica que centrais automatizadas podem realizar muitas chamadas e desligar as demais quando alguém atende. Também descreve robôs usados apenas para verificar se um número está ativo. Desde junho de 2024, a Agência considera curta a chamada de até seis segundos e mantém medidas contra volume excessivo desse tipo de ligação.
Isso não é detalhe distante para um agente de IA. Uma operação que dispara mais do que consegue atender, gera silêncio ou desliga rápido participa exatamente da experiência que ensinou as pessoas a desconfiar do telefone.
A Anatel também mantém uma camada de autenticação e identificação de chamadas. Quando suportada, ela pode validar origem e mostrar nome, número, selo e, em alguns casos, motivo da ligação. Identificação ajuda. Não salva roteiro ruim.
Antes de ligar ativamente, confirme:
- origem e motivo do contato;
- capacidade para conversar quando alguém atende;
- identificação correta do chamador;
- regra para pessoa errada e dado sensível;
- saída simples;
- registro que bloqueia repetição indevida;
- limite de volume e tentativas;
- revisão jurídica e regulatória aplicável ao caso.
Para prospecção e contato ativo, leia também IA SDR e outbound sem queimar a base. Este texto não substitui análise jurídica.
Uma planilha ainda basta em piloto pequeno
Você não precisa começar por uma plataforma de QA sofisticada.
Para um único caso e poucas dezenas de chamadas, uma planilha pode guardar:
| Campo | Exemplo |
|---|---|
| cenário | pessoa interrompe durante confirmação |
| versão | voz-07 / roteiro-12 |
| horário | 14:32 |
| evento observado | “espera” detectado após 420 ms |
| comportamento | agente parou e aguardou |
| resultado | aprovado |
| evidência | trecho 00:41–00:48 |
| correção | nenhuma / sensibilidade / roteiro / ferramenta |
| dono | operação de voz |
Esse caminho é suficiente quando uma pessoa consegue ouvir todas as falhas no mesmo dia, o piloto tem escopo estreito e qualquer chamada problemática pode ser interrompida rapidamente.
Onde o caminho manual quebra
A planilha começa a falhar quando:
- várias versões ligam ao mesmo tempo;
- o volume impede ouvir as chamadas ruins;
- silêncio, interrupção e latência precisam gerar alertas;
- uma correção precisa ser comparada antes e depois;
- a mesma pessoa recebe novas tentativas por campanhas diferentes;
- pedido de saída não bloqueia a próxima chamada;
- ferramenta, telefonia, transcrição e agente guardam evidências separadas;
- handoff acontece sem provar que uma pessoa assumiu;
- ninguém consegue pausar rapidamente o comportamento afetado.
Aí o problema não é escolher a voz mais natural. É operar telefonia, agente, regra, integração, evidência, QA e handoff como um sistema só.
O que fazer agora
Escolha um tipo de chamada. Não “atendimento inteiro”. Uma confirmação, triagem, consulta ou lembrete.
Preencha o checklist de piloto para agente de voz e rode os doze testes. Guarde gravação ou transcrição quando permitido, trecho do erro, versão, motivo de encerramento e correção. Só aumente volume depois que silêncio, interrupção, pessoa errada, caixa postal e ferramenta lenta tiverem respostas previsíveis.
Se o erro está na integração, leia como recuperar falha de ferramenta sem duplicar ação. Se a voz precisa sair da conversa, revise o handoff humano.
Se poucas chamadas cabem numa planilha e alguém consegue corrigir no mesmo dia, resolva assim primeiro.
Quando há volume, várias versões, integrações, regras por campanha, QA contínuo e necessidade de pausar comportamento ruim com evidência, Zild pode fazer sentido. A pergunta comercial vem depois da ligação menos charmosa: a pessoa ficou em silêncio, interrompeu, corrigiu o agente e pediu humano. O sistema soube ouvir?
Se você prefere ver em vídeo
Eu não encontrei um vídeo em português que eu colocaria como resposta principal para esta bateria. Há muitas demos com conversa limpa. Poucas mostram a mesma chamada com pausa curta, interrupção, ruído, caixa postal, pessoa errada e ferramenta lenta — e depois abrem a evidência para corrigir.
Um vídeo útil teria que deixar a voz errar. Se bastante gente pedir, este assunto entra na fila de gravação. Não é promessa.