Imagens, voz e vídeo: como o lado de mídia realmente funciona

Como funciona

O chat e as imagens são produzidos por sistemas completamente separados, que mal conversam entre si. Esse único fato explica por que o rosto da sua companheira não para de mudar e por que a mídia é a primeira coisa que todo app limita.

Podemos receber uma comissão pelos links desta página. Isso nunca altera uma avaliação.

As pessoas acham que um app de companhia com IA é uma única inteligência que conversa, desenha e fala. São três ou quatro sistemas separados, ligados pelo app, e a maior parte das frustrações dessa parte do produto vem das emendas entre eles.

Três motores, uma interface

O modelo de linguagem cuida da conversa. Ele produz texto e nada mais.

O modelo de imagens é um sistema completamente diferente, em geral um modelo de difusão. Ele recebe uma descrição em texto e produz uma imagem. Nunca viu a sua conversa.

O sistema de voz transforma texto em áudio. Também é separado, também é cego a tudo, exceto a frase que recebe.

Quando você pede uma selfie à sua companheira, é isto que acontece: o modelo de linguagem escreve uma descrição curta da imagem pedida, o app acrescenta as tags de aparência guardadas do personagem, esse prompt combinado vai para o modelo de imagens e uma imagem volta. Então o chat reage a uma imagem que não consegue ver, usando a descrição que ele mesmo escreveu.

Essa passagem de bastão é a origem de quase toda reclamação sobre mídia nessa categoria.

Por que o rosto não para de mudar

Porque um modelo de difusão não está recuperando o seu personagem: está gerando alguém que corresponda a uma descrição. “Cabelo longo e escuro, olhos verdes, vinte e poucos anos” descreve milhões de rostos, e você recebe um diferente a cada vez.

Os apps resolvem isso em graus variados:

  • Tags de aparência guardadas: a mesma sequência descritiva sempre. Barato, e só mais ou menos consistente.
  • Uma imagem de referência condicionando cada geração. Muito melhor, e a abordagem usual quando os rostos continuam reconhecíveis.
  • Um modelo ajustado por personagem: o mais consistente e de longe o mais caro, por isso tende a aparecer só nos planos mais altos.

Esse é um diferencial real que vale testar na versão gratuita antes de pagar. Gere quatro imagens do mesmo personagem em situações diferentes. Se aparecerem quatro mulheres diferentes, nenhuma assinatura vai resolver. A consistência do personagem entre imagens é grande parte do motivo pelo qual o Candy AI lidera nosso ranking, e do motivo pelo qual o Secret Desires, que constrói aparência, voz e personalidade juntas e acrescenta vídeos curtos, pontua bem nesse quesito.

Por que a mídia é sempre limitada

Texto é barato. Gerar uma resposta de chat custa ao operador uma fração de centavo.

Uma imagem custa bem mais por geração. A voz é cobrada por segundo de áudio. O vídeo é dramaticamente mais caro que os dois.

Essa diferença de custo é toda a razão da estrutura de preços que você vê em toda a categoria: franquias generosas de mensagens, limites apertados de imagens, minutos de voz vendidos à parte, vídeo restrito aos planos superiores. Não é uma escassez artificial para empurrar uma venda adicional: é o formato real da conta que o operador recebe, repassado.

Por isso, “ilimitado” nesse mercado quase sempre significa texto ilimitado. Leia assim e as páginas de preços passam a fazer sentido. As contas estão em quanto a geração de imagens realmente custa para você.

O que a voz acrescenta e quanto custa

A voz muda a experiência mais do que a maioria das pessoas espera. Ler uma mensagem e ouvi-la são coisas diferentes, e a mudança é maior do que a descrição técnica sugere.

Duas coisas para conferir antes de pagar por ela:

Latência. Uma pausa de três segundos antes de cada resposta quebra a ilusão por completo. Teste em uma versão gratuita ou em um período de teste, não por um vídeo de demonstração.

Se é uma chamada ou uma mensagem. Mensagens de voz, em que o personagem lê a resposta em voz alta, são comuns e baratas. Chamadas em tempo real, em que você fala e ele responde, são outro produto e geralmente outro plano. O Nomi lista chamadas de voz entre os recursos; muitos apps listam “voz” e querem dizer mensagens.

O que as imagens não fazem

Dois limites que vale conhecer antes de se decepcionar:

Mãos, texto e detalhes finos continuam pouco confiáveis em todos os geradores da categoria. Ninguém resolveu isso, e um app que promete o contrário está descrevendo seu melhor resultado, não o médio.

A imagem não conhece a sua cena. O modelo de chat escreve um prompt de uma linha, então tudo o que não está nessa linha se perde: o cômodo que você descreveu, o que ela vestia três mensagens atrás, a hora do dia. Ser explícito no pedido resolve mais disso do que qualquer configuração.

Como avaliar o lado de mídia em uma noite

Gaste toda a franquia da versão gratuita em uma única sessão, em vez de uma imagem por dia. Você está testando quatro coisas:

  1. Consistência: quatro imagens, mesmo personagem, situações diferentes.
  2. Fidelidade ao prompt: peça algo específico e veja quanto sobrevive.
  3. Latência: tanto de imagens quanto de voz.
  4. O que conta contra o limite: se uma geração que falhou ou foi recusada ainda custa a você.

Esse último ponto é o menos documentado e o mais irritante de descobrir depois de pagar. Junto com o resto de o que as versões gratuitas realmente incluem, é o tipo de coisa que só aparece quando você usa o produto direito.

Candy AI

4,6Avaliação: 4,6 de 5

O único app em que chat, imagens e voz funcionam bem com uma única assinatura.

Preço
a partir de US$12,99/mês
Versão gratuita
Sim
Brasil
Disponível

Secret Desires

4,3Avaliação: 4,3 de 5

Roleplay sem filtros que mantém os personagens coerentes em vez de sair do papel depois de poucas mensagens.

Versão gratuita
Sim
Brasil
Disponível

Perguntas frequentes

Por que minha companheira aparece diferente em cada imagem?

Porque o modelo de imagens recria o personagem a partir de uma descrição em texto a cada vez. Os apps que mantêm um rosto estável usam uma referência guardada ou um modelo ajustado; os que não usam estão jogando um dado a cada pedido.

Por que a voz é tão limitada por minutos?

A síntese de voz é cobrada pela duração do áudio e custa ao operador por segundo. O texto é ordens de grandeza mais barato, e é por isso que os limites de mensagens são generosos e os minutos de voz não.

O modelo de imagens vê nossa conversa?

Só por meio de um prompt curto que o app escreve para ele. Ele não tem acesso ao seu histórico, e por isso uma imagem muitas vezes perde um contexto que parecia óbvio no chat.