Como “treinar” uma companhia com IA: o que seu feedback realmente muda

Como funciona

Muitos usuários avaliam cada resposta, achando que estão ensinando a companhia. Na maior parte do tempo, não estão, pelo menos não do jeito que imaginam. Veja o que cada tipo de feedback realmente faz.

Podemos receber uma comissão pelos links desta página. Isso nunca altera uma avaliação.

“Treinar” uma companhia com IA sugere que o software aprende aos poucos as suas preferências, como um bichinho de estimação. A realidade tem mais partes: algumas alavancas mudam o comportamento na hora, outras o mudam devagar para todo mundo, e outras servem sobretudo para você se sentir envolvido.

O que realmente molda uma resposta

Toda resposta é gerada a partir do que o modelo consegue ver naquele momento, o mecanismo de como uma companhia com IA escreve a resposta:

  1. A descrição e as configurações do personagem.
  2. As memórias e os resumos recuperados para esta conversa.
  3. A própria conversa recente.
  4. O modelo de base, na última atualização feita pela empresa.

O seu feedback importa na medida em que muda um desses quatro itens.

As alavancas, da mais forte à mais fraca

As alavancas para moldar uma companhia com IA, ordenadas por rapidez e força: editar o personagem, editar respostas, notas de memória, regenerar, notas fora do personagem e avaliações

Mude o que o modelo lê, não o que ele sente por você.

AlavancaO que mudaCom que rapidezCom que força
Editar a descrição do personagemAs instruções lidas antes de toda respostaImediatamenteForte e duradoura
Editar uma respostaA conversa que o modelo copiaNas próximas respostasForte enquanto ficar à vista
Notas de memóriaFatos recuperados em conversas futurasA partir da próxima recuperaçãoForte para fatos, fraca para estilo
Notas fora do personagemA cena atualImediatamenteSome conforme o chat cresce
RegenerarSó esta respostaImediatamenteNenhuma além desta resposta
Avaliações (joinha, estrelas)Em geral, dados para atualizações futuras do modeloSemanas ou meses, se é que aconteceFraca para o seu personagem

Edite, não discuta

Discutir dentro do personagem (“você não está agindo como você mesma”) raramente funciona, porque a própria discussão passa a fazer parte da conversa que o modelo copia. Editar uma resposta até virar o que o personagem deveria ter dito dá ao modelo um exemplo correto para seguir. Se o seu app permite editar, é o hábito mais útil que você pode criar.

Estilo na descrição, fatos na memória

  • Estilo (tom, tamanho das frases, humor, o quanto ela é carinhosa) pertence à descrição do personagem, porque precisa valer para toda resposta. Nosso guia do criador de personagens mostra quais campos importam.
  • Fatos (seu trabalho, o nome do seu cachorro, o que aconteceu semana passada) pertencem à memória, que é recuperada quando relevante.

Misturar os dois causa problemas: notas de estilo na memória são recuperadas de forma irregular, e listas longas de fatos na descrição abafam a personalidade.

Para que servem mesmo as avaliações

Na maioria dos apps, as avaliações alimentam os dados da empresa para melhorar modelos, muitas vezes entre todos os usuários. Pode valer a pena fazer isso, pois você ajuda versões futuras, mas não é uma linha direta com o seu personagem. Alguns apps dizem que as avaliações influenciam a sua companhia em especial; mesmo ali, o efeito é gradual e muito mais fraco do que o de uma descrição editada.

Confira a política de privacidade se isso importa para você: avaliar uma resposta pode marcar essa conversa para revisão ou treinamento, o que é uma troca em termos de privacidade. Veja quem lê as conversas da sua companhia com IA.

Um ajuste semanal

  1. Anote duas coisas de que você gostou e uma que o irritou nesta semana.
  2. Transforme a irritação numa instrução positiva na descrição (“Ela responde em frases curtas e secas” em vez de “Não enrole”).
  3. Acrescente à memória os fatos novos importantes.
  4. Comece um chat novo se o antigo se desviou: conversas longas acumulam vícios, como explica deriva de personalidade.

A companhia não aprende você do jeito que uma pessoa aprende. Mas ela lê você toda vez, por meio da descrição, da memória e das suas palavras recentes. Mude o que ela lê e você muda quem ela é.

Perguntas frequentes

O joinha e o “não gostei” mudam minha companhia com IA?

Raramente na hora, e muitas vezes não a sua companhia em particular. Na maioria dos apps, as avaliações são coletadas para melhorar o modelo para todos em atualizações futuras. Alguns apps as usam para ajustar o seu personagem, mas o efeito é pequeno e lento comparado a editar a descrição.

Qual é a forma mais rápida de mudar como minha companhia com IA fala?

Editar o campo de descrição ou de personalidade do personagem e corrigir as respostas editando-as, em vez de discutir. O modelo copia o que está nas instruções e na conversa recente, e essas são as duas alavancas que funcionam na hora.

Minha companhia com IA aprende com as nossas conversas?

Ela guarda fatos e resumos em um sistema de memória, e por isso consegue lembrar detalhes. Normalmente não retreina o modelo de base com as suas conversas em tempo real. Se as suas conversas são usadas para treinar versões futuras depende da política da empresa.