Rodando sua própria companhia com IA localmente: o que é preciso

Como escolher um app

Cada conversa que você tem com um app de companhia hospedado fica no servidor de outra pessoa. Rodar uma em casa é a única forma de mudar isso por completo. Também é grátis, sem censura por padrão e hoje realmente boa, e exige mais de você do que a maioria dos guias admite.

Podemos receber uma comissão pelos links desta página. Isso nunca altera uma avaliação.

A expressão “rodar a própria namorada IA” faz parecer um único programa. Na prática são três peças que conversam entre si, e entender qual peça faz o quê poupa a maior parte da frustração.

As três peças

Diagrama de uma configuração local de companhia com IA: uma interface SillyTavern no navegador envia prompts a um back-end como KoboldCpp ou Ollama, que roda um arquivo de modelo GGUF na placa de vídeo

O que fala com o quê numa configuração local típica.

O front-end é o que você vê: janelas de chat, personagens, avatares, configurações. O SillyTavern é a escolha padrão para chat com personagens. Roda no navegador, guarda personagens e conversas como arquivos no seu disco e conecta a quase qualquer back-end. Ele mesmo não gera texto.

O back-end carrega o modelo e gera as respostas. O KoboldCpp é um único programa, sem instalação, popular para roleplay porque expõe todas as configurações de geração. O Ollama é o jeito mais fácil de pôr um modelo para rodar com poucos comandos. O LM Studio é um app de desktop com um navegador de modelos amigável. Qualquer um deles serve o modelo num endereço local ao qual o front-end se conecta.

O modelo é um arquivo grande, em geral no formato GGUF, baixado do Hugging Face. O tamanho dele em parâmetros (8B, 12B, 24B) e a quantização decidem quão bom ele é e que hardware exige.

A questão do hardware

O que decide se um modelo roda bem é a memória da placa de vídeo (VRAM). O modelo precisa caber, mais espaço para a própria conversa. A quantização encolhe os modelos para caber: “Q4_K_M” é o meio-termo comum entre tamanho e qualidade.

Tamanho do modeloMemória aprox. em Q4Hardware típicoO que esperar
7-8B5-6 GBPlaca de vídeo de 8 GBCoerente, rápido, esquece detalhes em cenas longas
12-14B9-10 GBPlaca de 12 GBPersonagens e prosa visivelmente melhores
22-24B14-16 GBPlaca de 16-24 GBPerto dos bons apps hospedados para roleplay
70B40 GB+Duas placas ou um Mac com muita memóriaExcelente, lento e caro

Esses números são aproximados: contexto mais longo exige mais memória por cima. Os Macs com Apple Silicon compartilham memória entre processador e gráficos, então um MacBook de 32 GB roda modelos que uma placa de 12 GB não roda. Um modelo que não cabe vaza para o processador principal e se arrasta; se as respostas chegam a poucas palavras por segundo, troque por um modelo menor antes de tentar uma quantização mais agressiva. Um modelo menor com boa qualidade costuma superar um maior espremido demais.

O que você ganha

  • Privacidade que não depende de uma política. Nada sai da máquina. Sem prazo de retenção, sem treinamento, sem acesso de funcionários, nada para excluir depois.
  • Nenhum filtro além do próprio modelo. Você escolhe o modelo, inclusive os ajustados especificamente para roleplay. O piso legal sobre conteúdo continua valendo para você, mas nenhum operador acrescenta regras por cima.
  • Sem assinatura e sem créditos. Gere o quanto quiser.
  • Personagens que são seus. Os cartões de personagem são imagens PNG comuns com a ficha do personagem embutida. Eles migram entre front-ends e nenhuma atualização pode tirá-los de você.
  • Estabilidade. Um modelo que funciona hoje funciona do mesmo jeito daqui a cinco anos. Ninguém pode trocá-lo debaixo de você, o risco descrito em quando sua companhia com IA muda da noite para o dia.

O que você abre mão

  • Tempo de configuração. Conte com uma noite para o primeiro chat funcionando e semanas de ajustes se você gosta disso.
  • A memória é com você. Os apps hospedados resumem e guardam fatos sobre você em silêncio. Localmente, você cuida disso com os lorebooks, os resumos e as notas de personagem do SillyTavern, os mesmos três mecanismos explicados em como funciona a memória de uma companhia com IA, só que com os controles expostos.
  • Imagens e voz são projetos separados. Gerar imagens precisa de um modelo próprio e, em geral, de mais memória gráfica; voz precisa de ferramentas de reconhecimento e síntese de fala. Tudo é possível, nada é automático.
  • O celular é desajeitado. Dá para abrir o front-end pelo celular no Wi-Fi de casa. Usar fora de casa significa expor seu computador à internet, o que exige cuidado.
  • Teto de qualidade. Os melhores modelos hospedados são maiores que qualquer coisa que a maioria das pessoas consegue rodar em casa, sobretudo na consistência de longo prazo.

O caminho do meio, e a pegadinha

Muita gente roda o SillyTavern na própria máquina, mas o conecta a uma API paga na nuvem em vez de a um modelo local. Você fica com o controle do front-end e os arquivos de personagem, com modelos muito maiores e com cobrança por mensagem, que pode sair barata no uso leve.

Só que não é privado. Cada mensagem vai para o provedor da API, sob os registros, a retenção e as regras de conteúdo dele, muitas vezes mais rígidas com conteúdo de roleplay do que os apps dedicados de companhia. É outra troca, não uma configuração local.

Noções básicas de segurança

  • Baixe software apenas das páginas oficiais do projeto no GitHub ou do site do próprio projeto.
  • Baixe modelos de autores conhecidos no Hugging Face e prefira arquivos GGUF, que contêm dados do modelo e não código.
  • Leia a licença do modelo. Algumas restringem o uso comercial; poucas restringem certos conteúdos.
  • Mantenha o SillyTavern restrito à sua própria máquina ou rede doméstica, a menos que você tenha configurado uma senha e entenda o que está expondo.

Página do projeto SillyTavern no GitHub

O SillyTavern é desenvolvido de forma aberta no GitHub.

Para quem serve

Rode uma companhia localmente se a privacidade é sua principal preocupação, se você já tem hardware capaz ou se gosta de configurar tanto quanto de usar. Fique com um app hospedado se quer voz, imagens e memória longa funcionando de saída ou se conversa principalmente no celular. Nosso guia para escolher o primeiro app cobre esse caminho. Muita gente acaba com os dois: um app hospedado pela conveniência e uma configuração local para as conversas que prefere não guardar em lugar nenhum.

Perguntas frequentes

Rodar uma companhia com IA localmente é grátis?

O software é gratuito e de código aberto, e não há assinatura. Os custos são de hardware, principalmente uma placa de vídeo com memória suficiente, e de eletricidade. Se você já tem um PC gamer ou um Mac recente, o custo extra pode ser quase nulo.

Posso usar uma companhia com IA local no celular?

Não de forma realista para o modelo em si, mas você pode rodar tudo no computador e abrir a interface de chat pelo navegador do celular, na mesma rede doméstica. O SillyTavern permite isso com uma mudança de configuração.

Uma configuração local é totalmente privada?

Só se o modelo roda na sua própria máquina. Muita gente usa o SillyTavern com uma API paga na nuvem, e nesse caso cada mensagem vai para o provedor da API, com registros e regras de conteúdo próprios.