Uma chamada de voz é a coisa mais exigente que uma companhia com IA faz. No texto, alguns segundos de espera não incomodam ninguém. Na fala, não: as pessoas percebem atrasos que seriam invisíveis em uma janela de chat.
O problema dos 200 milissegundos
Pesquisadores que compararam conversas em dez idiomas descobriram que a pausa típica entre uma pessoa terminar e a outra começar é de cerca de 200 milissegundos, e é notavelmente parecida entre culturas. As pessoas começam a planejar a resposta antes de o outro terminar. Pausas muito mais longas que isso soam como hesitação, confusão ou desinteresse.
Uma IA precisa encaixar um processo inteiro mais ou menos nessa janela para parecer natural.
O que acontece entre as suas palavras e as dela

O pipeline clássico. Sistemas mais novos sobrepõem ou unem essas etapas.
- Detecção do fim da fala. O sistema precisa decidir que você terminou, e não só fez uma pausa. Se for ansioso demais, interrompe você; se for cauteloso demais, acrescenta silêncio.
- Fala para texto. Suas palavras são transcritas.
- A resposta. O modelo de linguagem escreve uma resposta, no personagem, com memória.
- Texto para fala. A resposta vira voz, de preferência a voz do próprio personagem, com emoção.
Nos sistemas mais antigos, cada etapa espera a anterior terminar. Os mais novos começam a falar a primeira frase enquanto o resto ainda está sendo escrito, ou usam modelos que recebem fala e produzem fala diretamente, o que elimina de vez as etapas de transcrição e síntese.
Por que a voz é limitada por minutos
| Chat de texto | Mensagem de voz | Chamada de voz ao vivo | |
|---|---|---|---|
| Velocidade necessária | Segundos bastam | Segundos bastam | Frações de segundo |
| Processamento extra | Nenhum | Síntese de voz | Reconhecimento, síntese, detecção de turno |
| Duração típica | Respostas curtas | Uma resposta | De minutos a horas |
| Custo relativo | Mais baixo | Moderado | Mais alto |
| Como os apps vendem | Incluído | Incluído ou créditos | Minutos, planos ou créditos |
Cada minuto de uma chamada roda o processo inteiro de forma contínua, muitas vezes em versões “em tempo real” mais caras de cada modelo. Por isso a voz costuma ser a primeira coisa que um app limita, e por isso “ilimitado” raramente vale para ela; veja como ler listas de recursos de namorada IA.
O que faz uma chamada parecer real
- Latência baixa, de forma consistente. Uma pausa longa de vez em quando quebra a ilusão mais do que uma média um pouco mais lenta.
- Tratamento de interrupções. Poder cortar a fala e ela parar e responder é o que separa uma conversa de áudios que se alternam.
- Consistência da voz. A mesma voz, o mesmo sotaque e o mesmo calor entre as chamadas. Nossos testadores constataram que a qualidade da voz pode variar bastante entre personagens, mesmo em bons apps.
- Prosódia. Rir, fazer pausas, suavizar: uma fala que carrega emoção em vez de ler o texto em voz alta.
- Memória no modo de voz. Alguns apps usam um modelo mais leve nas chamadas, então o personagem lembra menos ao telefone do que no chat.
Como testar um recurso de voz antes de pagar
- Pergunte o que está incluído: mensagens de voz, chamadas ao vivo ou os dois, e quantos minutos.
- Faça uma chamada de dois minutos em um período de teste ou no plano mais barato, com dados móveis e também com Wi-Fi.
- Interrompa ela no meio da frase. Ela para?
- Pergunte sobre algo do seu chat de texto. Ela sabe?
- Veja o custo por minuto extra ou por crédito. Uma chamada longa pode consumir a franquia do mês.
O ponto mais amplo sobre os custos de mídia está em como funcionam as imagens e a voz da namorada IA, e se vale a pena mudar de plano por causa da voz é tema de planos premium.
Uma nota sobre bem-estar
A voz é mais imersiva que o texto, e a pesquisa de 2025 da OpenAI e do MIT achou que o uso breve de voz ia junto com mais bem-estar, enquanto o uso diário intenso não. Vale curtir em doses; os sinais de excesso estão em quando uma companhia com IA começa a tirar mais do que dá.