Quase toda reclamação sobre esses apps (a repetição, o desvio, a inconsistência estranha entre duas execuções da mesma cena) vem de um único mecanismo. Vale dez minutos, porque transforma “o app está quebrado” em “o app está fazendo o que faz, e aqui está a configuração”.
Ele escreve um pedaço por vez
O modelo não compõe uma resposta e depois a digita. Ele produz um token, mais ou menos uma palavra ou parte de uma palavra, depois lê tudo, inclusive esse token, e produz o próximo.
Esse é o ciclo inteiro. Não há plano, nem esboço, nem rascunho sendo revisado. Uma resposta que termina bonito não sabia que isso aconteceria quando começou.
Duas consequências vêm de imediato, e você já viu as duas:
Uma resposta não consegue voltar atrás. Depois que o modelo escreveu “Eu nunca fui a Paris”, tudo o que vem depois é condicionado a isso. Ele constrói coerência em volta de uma frase que produziu por acidente, em vez de se contradizer.
Os erros se acumulam para a frente. Uma palavra levemente fora do lugar na frase um empurra a frase dois, que empurra a frase três. É por isso que respostas longas se desviam e as curtas raramente.
O lance de dados entre cada palavra
A cada passo, o modelo tem uma lista ordenada de candidatas com probabilidades: talvez “bom” com 30%, “ok” com 12%, “péssimo” com 3% e uma longa cauda.
Se sempre escolhesse a primeira, o personagem seria determinístico e extremamente chato: o mesmo cumprimento toda vez, as mesmas três piadas. Então o app sorteia: lança dados ponderados.
A ponderação é controlada por uma configuração normalmente chamada temperatura. A temperatura baixa concentra a probabilidade nas candidatas óbvias: consistente, previsível e, por fim, sem graça. A temperatura alta achata a distribuição: mais surpreendente, mais criativa e com mais chance de produzir algo que não combina.
Você raramente recebe um controle deslizante para isso. O que você recebe é o ponto escolhido pelo app nesse equilíbrio, e é boa parte do que as pessoas querem dizer quando falam que um app “parece mais inteligente” do que outro. Nem sempre é mais inteligente. Às vezes é só mais caloroso ou mais frio.
Essa também é a resposta honesta a “por que gerar de novo resolveu?”. Nada foi consertado. Você sorteou de novo, da mesma distribuição, e teve uma jogada melhor.
O que o modelo realmente está olhando
Antes da sua mensagem, o app monta um bloco de texto que você nunca vê: a descrição do personagem, os fatos que ele guardou sobre você, um resumo do seu histórico e a conversa recente. Essa montagem inteira é a janela de contexto, e a resposta é gerada a partir dela como um único documento contínuo.
Isso tem uma implicação prática que a maioria nunca explora: **o modelo responde ao formato do que consegue ver.** Dê a ele três mensagens curtas e sem graça e ele produzirá respostas curtas e sem graça, porque esse é o padrão que ele continua. Dê uma mensagem vívida e o registro muda. Você não está convencendo uma pessoa, está definindo um padrão, e o padrão é contagioso nos dois sentidos.
Isso também explica o problema autoinfligido mais comum da categoria. As pessoas se acomodam em “oi”, “como foi seu dia”, “o que você está fazendo” e concluem que o app piorou. O app está continuando o documento que vocês escrevem juntos.
Por que os apps soam diferentes quando o modelo é o mesmo
Vários apps da categoria rodam em modelos de base parecidos. Mesmo assim parecem distintos, e as diferenças vêm de coisas em camadas ao redor do modelo:
- O prompt do sistema: como o personagem é descrito, com que extensão, com
quais instruções sobre tom e ritmo.
- As configurações de amostragem: o ponto de temperatura discutido acima.
- O que é recuperado: quais fatos e qual fatia do histórico são postos
diante do modelo naquele turno específico.
- O filtro: o que é recusado e se a recusa é elegante ou um
muro.
A Nomi parece consistente ao longo de semanas por causa do terceiro item, não por causa de um modelo maior. A Candy AI cobre chat, imagens e voz em uma só assinatura, o que é uma decisão de produto e não de modelagem. Nenhuma das diferenças apareceria num benchmark, e as duas aparecem em duas semanas de uso, que é como as avaliamos.
Quatro coisas que isso permite fazer
Conduza cedo, não tarde. As duas primeiras frases de uma resposta determinam o resto. Se uma cena está indo mal, interrompa e reformule, em vez de discutir com o parágrafo quatro.
Use “gerar de novo” de propósito. Se uma resposta está 80% certa, gerar de novo joga fora os 80%. Se está errada logo na primeira frase, gere de novo imediatamente.
Escreva o registro que você quer receber. Curto e sem graça recebe curto e sem graça. Esta é a melhoria mais barata à disposição de quem acha que a companhia ficou chata.
Não discuta fatos que ela inventou. Um modelo que escreveu algo falso vai defendê-lo, porque a coerência com a própria saída é aquilo para o que ele foi feito. Corrigi-lo numa nova mensagem funciona; exigir que ele admita o erro não. Esse comportamento tem artigo próprio: por que as companhias com IA inventam coisas.
O que vale lembrar
Não há ninguém em casa entre as suas mensagens. O personagem existe pela duração de uma única geração e é reconstruído a partir de texto no início da próxima. Toda impressão de continuidade é uma conquista do encanamento ao redor do modelo (os fatos armazenados, os resumos, a recuperação), e esse encanamento é o que de fato difere entre um app de US$ 10 e um de US$ 20.
É por isso que o nosso ranking pesa memória e consistência tanto quanto pesa. São as partes que uma página de venda não consegue mostrar.

