"Moderação" parece uma coisa só. Nos apps de companhia são pelo menos quatro, funcionando em velocidades diferentes e envolvendo pessoas diferentes.
As quatro camadas

Cada camada vê menos conteúdo, mas o vê com mais detalhe.
1. Filtros em tempo real. Cada mensagem que você envia, e cada resposta que o modelo escreve, pode ser verificada por classificadores automáticos antes de aparecer. Eles pegam as categorias proibidas - qualquer coisa envolvendo menores, certos conteúdos violentos, sinais de automutilação - e bloqueiam a mensagem, suavizam a resposta ou mostram um aviso. É de onde vêm as recusas e os cartões de crise; nosso artigo sobre filtros de conteúdo explica por que às vezes eles disparam no meio de uma cena.
2. Sinalização no nível da conversa. Separadamente, sistemas podem dar nota a conversas ou contas inteiras por padrões: tentativas repetidas de contornar um filtro, assédio, sinais de um menor usando um app adulto. Uma sinalização não é uma punição; é uma nota de que um humano pode olhar.
3. Revisão humana. A equipe de confiança e segurança, muitas vezes em empresas terceirizadas, revisa uma fração das conversas sinalizadas, das denúncias de usuários e dos recursos. Algumas empresas também amostram conversas comuns para checar a qualidade ou treinar modelos. É a camada que as políticas de privacidade descrevem com frases como "para melhorar nossos serviços" ou "para fazer cumprir nossos termos".
4. Pedidos legais. Tribunais, polícias e reguladores podem solicitar dados por ordens legais. As empresas respondem conforme sua política e a lei local.
O que costuma motivar um olhar humano
| Gatilho | Por quê |
|---|---|
| Conteúdo envolvendo menores | Dever legal na maioria dos países; muitas vezes é denunciado adiante |
| Sinais de automutilação ou suicídio | Protocolos de crise exigidos por lei em vários estados dos EUA |
| Ameaças a pessoas reais | Possível dano no mundo real |
| Sua própria denúncia ou chamado de suporte | Você pediu que alguém olhasse |
| Tentativas repetidas de burlar filtros | Aplicação dos termos de uso |
| Amostragem aleatória de qualidade | Melhoria do produto, se a política permitir |
O que as novas leis acrescentam
As leis dos EUA sobre chatbots de companhia, a começar por Nova York em 2025 e pela Califórnia em 2026, exigem que os apps detectem expressões de pensamento suicida e de automutilação e encaminhem os usuários a serviços de crise. A Califórnia também exige que as empresas informem sobre seus protocolos. Na prática, isso significa mais monitoramento automático das conversas mais sensíveis, não menos. Os detalhes estão em leis sobre companhia com IA.
No Brasil, o ECA Digital (Lei 15.211/2025), em vigor desde 17 de março de 2026, vale para serviços digitais que provavelmente serão acessados por menores, e a ANPD o fiscaliza. Em 21 de setembro de 2026, o Ministério da Justiça (Secretaria Nacional de Direitos Digitais) pediu à ANPD que avaliasse os riscos das "companhias com IA", entre elas Character.AI, Replika, Nomi e Candy.ai: idade checada em geral só por autodeclaração, uso compulsivo, conteúdo inadequado e perfilamento de traços emocionais. O pedido não aponta nenhuma violação comprovada, e não encontramos decisão nem multa da ANPD até agora. Isso sai de resumos da imprensa, e não da página do Ministério.
Lendo a política atrás disso
Procure na política de privacidade e nos termos:
- "revisão", "moderar", "humano" - se pessoas leem as conversas e por quê.
- "terceirizados" ou "prestadores de serviço" - se os revisores trabalham para outra empresa.
- "melhorar", "treinar" - se conversas comuns são amostradas.
- "autoridades", "processo legal", "ordem judicial" - quando os dados são entregues e se uma ordem judicial é necessária.
Uma política cuidadosa nomeia os gatilhos e diz que os revisores só veem as conversas quando necessário. Uma política vaga, que deixa a equipe acessar "todo o conteúdo para qualquer finalidade comercial", também diz algo. Nossas quatro verificações de privacidade cobrem o resto do documento.
Conclusões práticas
- Escreva como se um revisor pudesse ler, porque em um número pequeno de casos um vai ler.
- Mantenha fora das conversas os dados que identificam outras pessoas, principalmente em cenas explícitas: um revisor lendo uma conversa sinalizada também vê isso.
- Se um filtro falhar na ficção, uma nota fora do personagem costuma resolver; discutir dentro do personagem pode gerar mais sinalizações.
- Se o que mais importa para você é quem pode ler suas conversas, a única configuração em que ninguém mais pode é uma companhia que roda no seu próprio computador. Veja rodar uma companhia com IA localmente.
Moderação não é o mesmo que vigilância. Na grande maioria das conversas, nada e ninguém olha além do filtro automático. Mas é a política, e não o carinho do app, que decide as exceções, e vale conhecê-las antes de precisar delas.