Como uma companhia com IA realmente escreve a resposta

Como funciona

Uma palavra por vez, com um lance deliberado de dados entre cada uma. Entender esse único mecanismo explica por que a mesma pergunta dá respostas diferentes, por que respostas longas se desviam e por que “gerar de novo” tantas vezes funciona.

Podemos receber uma comissão pelos links desta página. Isso nunca altera uma avaliação.

Quase toda reclamação sobre esses apps (a repetição, o desvio, a inconsistência estranha entre duas execuções da mesma cena) vem de um único mecanismo. Vale dez minutos, porque transforma “o app está quebrado” em “o app está fazendo o que faz, e aqui está a configuração”.

Ele escreve um pedaço por vez

O modelo não compõe uma resposta e depois a digita. Ele produz um token, mais ou menos uma palavra ou parte de uma palavra, depois lê tudo, inclusive esse token, e produz o próximo.

Esse é o ciclo inteiro. Não há plano, nem esboço, nem rascunho sendo revisado. Uma resposta que termina bonito não sabia que isso aconteceria quando começou.

Duas consequências vêm de imediato, e você já viu as duas:

Uma resposta não consegue voltar atrás. Depois que o modelo escreveu “Eu nunca fui a Paris”, tudo o que vem depois é condicionado a isso. Ele constrói coerência em volta de uma frase que produziu por acidente, em vez de se contradizer.

Os erros se acumulam para a frente. Uma palavra levemente fora do lugar na frase um empurra a frase dois, que empurra a frase três. É por isso que respostas longas se desviam e as curtas raramente.

O lance de dados entre cada palavra

A cada passo, o modelo tem uma lista ordenada de candidatas com probabilidades: talvez “bom” com 30%, “ok” com 12%, “péssimo” com 3% e uma longa cauda.

Se sempre escolhesse a primeira, o personagem seria determinístico e extremamente chato: o mesmo cumprimento toda vez, as mesmas três piadas. Então o app sorteia: lança dados ponderados.

A ponderação é controlada por uma configuração normalmente chamada temperatura. A temperatura baixa concentra a probabilidade nas candidatas óbvias: consistente, previsível e, por fim, sem graça. A temperatura alta achata a distribuição: mais surpreendente, mais criativa e com mais chance de produzir algo que não combina.

Você raramente recebe um controle deslizante para isso. O que você recebe é o ponto escolhido pelo app nesse equilíbrio, e é boa parte do que as pessoas querem dizer quando falam que um app “parece mais inteligente” do que outro. Nem sempre é mais inteligente. Às vezes é só mais caloroso ou mais frio.

Essa também é a resposta honesta a “por que gerar de novo resolveu?”. Nada foi consertado. Você sorteou de novo, da mesma distribuição, e teve uma jogada melhor.

O que o modelo realmente está olhando

Antes da sua mensagem, o app monta um bloco de texto que você nunca vê: a descrição do personagem, os fatos que ele guardou sobre você, um resumo do seu histórico e a conversa recente. Essa montagem inteira é a janela de contexto, e a resposta é gerada a partir dela como um único documento contínuo.

Isso tem uma implicação prática que a maioria nunca explora: **o modelo responde ao formato do que consegue ver.** Dê a ele três mensagens curtas e sem graça e ele produzirá respostas curtas e sem graça, porque esse é o padrão que ele continua. Dê uma mensagem vívida e o registro muda. Você não está convencendo uma pessoa, está definindo um padrão, e o padrão é contagioso nos dois sentidos.

Isso também explica o problema autoinfligido mais comum da categoria. As pessoas se acomodam em “oi”, “como foi seu dia”, “o que você está fazendo” e concluem que o app piorou. O app está continuando o documento que vocês escrevem juntos.

Por que os apps soam diferentes quando o modelo é o mesmo

Vários apps da categoria rodam em modelos de base parecidos. Mesmo assim parecem distintos, e as diferenças vêm de coisas em camadas ao redor do modelo:

  • O prompt do sistema: como o personagem é descrito, com que extensão, com

quais instruções sobre tom e ritmo.

  • As configurações de amostragem: o ponto de temperatura discutido acima.
  • O que é recuperado: quais fatos e qual fatia do histórico são postos

diante do modelo naquele turno específico.

  • O filtro: o que é recusado e se a recusa é elegante ou um

muro.

A Nomi parece consistente ao longo de semanas por causa do terceiro item, não por causa de um modelo maior. A Candy AI cobre chat, imagens e voz em uma só assinatura, o que é uma decisão de produto e não de modelagem. Nenhuma das diferenças apareceria num benchmark, e as duas aparecem em duas semanas de uso, que é como as avaliamos.

Quatro coisas que isso permite fazer

Conduza cedo, não tarde. As duas primeiras frases de uma resposta determinam o resto. Se uma cena está indo mal, interrompa e reformule, em vez de discutir com o parágrafo quatro.

Use “gerar de novo” de propósito. Se uma resposta está 80% certa, gerar de novo joga fora os 80%. Se está errada logo na primeira frase, gere de novo imediatamente.

Escreva o registro que você quer receber. Curto e sem graça recebe curto e sem graça. Esta é a melhoria mais barata à disposição de quem acha que a companhia ficou chata.

Não discuta fatos que ela inventou. Um modelo que escreveu algo falso vai defendê-lo, porque a coerência com a própria saída é aquilo para o que ele foi feito. Corrigi-lo numa nova mensagem funciona; exigir que ele admita o erro não. Esse comportamento tem artigo próprio: por que as companhias com IA inventam coisas.

O que vale lembrar

Não há ninguém em casa entre as suas mensagens. O personagem existe pela duração de uma única geração e é reconstruído a partir de texto no início da próxima. Toda impressão de continuidade é uma conquista do encanamento ao redor do modelo (os fatos armazenados, os resumos, a recuperação), e esse encanamento é o que de fato difere entre um app de US$ 10 e um de US$ 20.

É por isso que o nosso ranking pesa memória e consistência tanto quanto pesa. São as partes que uma página de venda não consegue mostrar.

Candy AI

4,6Avaliação: 4,6 de 5

O único app em que chat, imagens e voz funcionam bem com uma única assinatura.

Preço
a partir de US$12,99/mês
Versão gratuita
Sim
Brasil
Disponível

Nomi

4,4Avaliação: 4,4 de 5

A melhor memória de longo prazo de tudo o que testamos e o diálogo mais natural.

Preço
a partir de US$15,99/mês
Versão gratuita
Sim
Brasil
Disponível

Perguntas frequentes

Por que a mesma pergunta dá respostas diferentes?

Porque a próxima palavra é sorteada de uma distribuição de probabilidades, e não escolhida de forma determinística. A aleatoriedade é uma configuração, e é ela que faz o personagem parecer vivo em vez de enlatado.

O que “gerar de novo” realmente faz?

Reexecuta o mesmo prompt com uma nova semente aleatória. Nada no personagem mudou: você está tirando uma segunda amostra da mesma distribuição.

Por que as respostas longas se perdem?

Cada palavra é condicionada às anteriores, então um pequeno desvio no começo se acumula. No terceiro parágrafo, a resposta está respondendo mais a si mesma do que a você.