As pessoas acham que um app de companhia com IA é uma única inteligência que conversa, desenha e fala. São três ou quatro sistemas separados, ligados pelo app, e a maior parte das frustrações dessa parte do produto vem das emendas entre eles.
Três motores, uma interface
O modelo de linguagem cuida da conversa. Ele produz texto e nada mais.
O modelo de imagens é um sistema completamente diferente, em geral um modelo de difusão. Ele recebe uma descrição em texto e produz uma imagem. Nunca viu a sua conversa.
O sistema de voz transforma texto em áudio. Também é separado, também é cego a tudo, exceto a frase que recebe.
Quando você pede uma selfie à sua companheira, é isto que acontece: o modelo de linguagem escreve uma descrição curta da imagem pedida, o app acrescenta as tags de aparência guardadas do personagem, esse prompt combinado vai para o modelo de imagens e uma imagem volta. Então o chat reage a uma imagem que não consegue ver, usando a descrição que ele mesmo escreveu.
Essa passagem de bastão é a origem de quase toda reclamação sobre mídia nessa categoria.
Por que o rosto não para de mudar
Porque um modelo de difusão não está recuperando o seu personagem: está gerando alguém que corresponda a uma descrição. “Cabelo longo e escuro, olhos verdes, vinte e poucos anos” descreve milhões de rostos, e você recebe um diferente a cada vez.
Os apps resolvem isso em graus variados:
- Tags de aparência guardadas: a mesma sequência descritiva sempre. Barato, e só mais ou menos consistente.
- Uma imagem de referência condicionando cada geração. Muito melhor, e a abordagem usual quando os rostos continuam reconhecíveis.
- Um modelo ajustado por personagem: o mais consistente e de longe o mais caro, por isso tende a aparecer só nos planos mais altos.
Esse é um diferencial real que vale testar na versão gratuita antes de pagar. Gere quatro imagens do mesmo personagem em situações diferentes. Se aparecerem quatro mulheres diferentes, nenhuma assinatura vai resolver. A consistência do personagem entre imagens é grande parte do motivo pelo qual o Candy AI lidera nosso ranking, e do motivo pelo qual o Secret Desires, que constrói aparência, voz e personalidade juntas e acrescenta vídeos curtos, pontua bem nesse quesito.
Por que a mídia é sempre limitada
Texto é barato. Gerar uma resposta de chat custa ao operador uma fração de centavo.
Uma imagem custa bem mais por geração. A voz é cobrada por segundo de áudio. O vídeo é dramaticamente mais caro que os dois.
Essa diferença de custo é toda a razão da estrutura de preços que você vê em toda a categoria: franquias generosas de mensagens, limites apertados de imagens, minutos de voz vendidos à parte, vídeo restrito aos planos superiores. Não é uma escassez artificial para empurrar uma venda adicional: é o formato real da conta que o operador recebe, repassado.
Por isso, “ilimitado” nesse mercado quase sempre significa texto ilimitado. Leia assim e as páginas de preços passam a fazer sentido. As contas estão em quanto a geração de imagens realmente custa para você.
O que a voz acrescenta e quanto custa
A voz muda a experiência mais do que a maioria das pessoas espera. Ler uma mensagem e ouvi-la são coisas diferentes, e a mudança é maior do que a descrição técnica sugere.
Duas coisas para conferir antes de pagar por ela:
Latência. Uma pausa de três segundos antes de cada resposta quebra a ilusão por completo. Teste em uma versão gratuita ou em um período de teste, não por um vídeo de demonstração.
Se é uma chamada ou uma mensagem. Mensagens de voz, em que o personagem lê a resposta em voz alta, são comuns e baratas. Chamadas em tempo real, em que você fala e ele responde, são outro produto e geralmente outro plano. O Nomi lista chamadas de voz entre os recursos; muitos apps listam “voz” e querem dizer mensagens.
O que as imagens não fazem
Dois limites que vale conhecer antes de se decepcionar:
Mãos, texto e detalhes finos continuam pouco confiáveis em todos os geradores da categoria. Ninguém resolveu isso, e um app que promete o contrário está descrevendo seu melhor resultado, não o médio.
A imagem não conhece a sua cena. O modelo de chat escreve um prompt de uma linha, então tudo o que não está nessa linha se perde: o cômodo que você descreveu, o que ela vestia três mensagens atrás, a hora do dia. Ser explícito no pedido resolve mais disso do que qualquer configuração.
Como avaliar o lado de mídia em uma noite
Gaste toda a franquia da versão gratuita em uma única sessão, em vez de uma imagem por dia. Você está testando quatro coisas:
- Consistência: quatro imagens, mesmo personagem, situações diferentes.
- Fidelidade ao prompt: peça algo específico e veja quanto sobrevive.
- Latência: tanto de imagens quanto de voz.
- O que conta contra o limite: se uma geração que falhou ou foi recusada ainda custa a você.
Esse último ponto é o menos documentado e o mais irritante de descobrir depois de pagar. Junto com o resto de o que as versões gratuitas realmente incluem, é o tipo de coisa que só aparece quando você usa o produto direito.

