Tom de voz da marca: por que a IA não segue as suas regras

Mao digitando no teclado de um notebook sobre mesa de madeira clara, com caderno aberto em pagina em branco e xicara de cafe ao lado

São cinco linhas coladas no campo de instruções da marca, e a legenda voltou como sempre volta: “Descubra como transformar a sua rotina de conteúdo”, exclamação no fim, três hashtags que serviriam para qualquer empresa do planeta. Você releu as cinco linhas. Estão lá, em português claro, e o modelo passou por cima.

Escrever o tom de voz da marca é a parte fácil. O que falha é a passagem dessas linhas para um sistema que nunca leu o seu blog e não conhece ninguém da sua equipe.

O adjetivo descreve o resultado, não o procedimento

A linha mais comum de qualquer documento de marca é uma fila de adjetivos: descontraído, próximo, profissional sem ser formal, acessível. Para quem escreveu, cada palavra dessas carrega uma imagem inteira: um texto específico que você leu, um jeito de começar frase, uma piada que passou e outra que não passaria. Para o modelo, sobra a palavra.

A documentação de prompt da Anthropic resume a regra em uma frase que serve de teste: “mostre o seu prompt a um colega com pouco contexto da tarefa e peça que ele o siga. Se ele ficaria confuso, o modelo também vai ficar”. A mesma página pede que você seja específico quanto ao formato de saída e às restrições, e compara o modelo a um funcionário novo e brilhante que não conhece as suas normas.

Um adjetivo não passa nesse teste. Três regras passam. “Descontraído” vira: trata o leitor por você e nunca por vocês; abre pelo problema de quem lê, não por saudação; nenhuma frase acima de vinte e cinco palavras. São instruções que duas pessoas diferentes executam do mesmo jeito, e é exatamente isso que um modelo precisa.

Para confirmar que a sua causa é essa, faça o teste do colega de verdade, sem o modelo no meio. Entregue as cinco linhas a duas pessoas da equipe, dê o mesmo artigo às duas e peça uma legenda a cada uma. Se as duas legendas abrirem de jeitos irreconciliáveis, o documento não descreve procedimento nenhum. Há um segundo teste, mais rápido: pegue uma legenda que você rejeitou e tente apontar a palavra ou a frase que viola uma das cinco linhas. Se você não consegue apontar, o modelo não conseguia acertar.

As cinco linhas só dizem o que você não quer

A segunda versão do documento de marca costuma ser uma lista de proibições: não usar emoji, não usar exclamação, nada de “experiência incrível”, nada de pergunta retórica. É uma evolução em relação aos adjetivos, porque proibição é verificável. E ainda assim ela deixa buracos.

Tanto a Anthropic quanto a OpenAI orientam o contrário na hora de controlar formato e estilo. A recomendação da Anthropic é literalmente dizer ao modelo o que fazer em vez do que não fazer, com um exemplo que vale para qualquer marca: em vez de “não use markdown na resposta”, escreva “sua resposta deve ser composta por parágrafos de prosa corrida”. Uma proibição tira uma coisa do texto e não diz o que entra no lugar; o espaço vazio é preenchido pelo comportamento padrão do modelo, que é justamente a voz genérica que você quer evitar.

Isso aparece o tempo todo em quem usa essas ferramentas. Em uma discussão do fórum de desenvolvedores da OpenAI sobre GPTs que não seguem todas as instruções, os relatos repetem duas queixas que interessam aqui: proibições explícitas de uso de certas palavras sendo ignoradas e instruções de estilo gramatical desobedecidas de forma recorrente. Um dos participantes descreve o mecanismo sem querer: quando a pergunta é difícil, o modelo se concentra nela e não nas instruções.

A lista de proibições continua útil como filtro dentro do prompt de cada legenda, e o prompt de legenda sem cara de texto de IA vive disso. O que ela não sustenta é o papel de documento permanente da voz. Para confirmar, conte quantas das suas cinco linhas começam com “não”, “evite” ou “nunca”. Se forem três ou mais, reescreva a pior delas na forma afirmativa, com o substituto explícito, e rode o mesmo artigo duas vezes: uma com a versão proibitiva, outra com a afirmativa. A diferença aparece na primeira frase da legenda.

A regra está escrita sem o motivo ao lado

Esta causa sobrevive às duas correções anteriores: as linhas já estão específicas e já estão afirmativas, e a legenda desanda assim que o assunto do artigo foge do comum.

O motivo é que a regra sozinha não se estende. A mesma documentação da Anthropic traz o par que deixa isso evidente: “NUNCA use reticências” funciona pior do que “sua resposta será lida em voz alta por um motor de texto para fala, então nunca use reticências, porque o motor não vai saber pronunciá-las”. A conclusão da página é a parte que importa para uma marca: o modelo é inteligente o bastante para generalizar a partir da explicação. Com o motivo ao lado, ele acerta situações que você não previu; sem o motivo, ele acerta só os casos que estão escritos.

Na prática isso muda pouca coisa na forma. “Nenhuma frase acima de vinte e cinco palavras” vira “nenhuma frase acima de vinte e cinco palavras, porque a legenda é lida no celular, em pé, no meio de outra coisa”. A segunda versão cobre um caso que a primeira não cobria: quando o artigo é técnico e o modelo precisa escolher entre duas construções igualmente curtas, ele passa a escolher a que se lê em pé.

A confirmação exige um artigo fora do padrão. Pegue uma pauta que as suas cinco linhas nunca imaginaram cobrir: um aviso de aumento de preço, um pedido de desculpa por instabilidade, um texto sobre um assunto sério. Gere a legenda com o documento atual e de novo com os motivos anexados a cada linha. Se a primeira versão soar fora de lugar e a segunda não, as suas regras estavam funcionando como decoração nos casos difíceis.

O artigo inteiro está competindo com as suas cinco linhas

Em algum ponto do caminho, as cinco linhas e o texto do artigo são empilhados no mesmo bloco e enviados juntos. O artigo tem dois mil, três mil palavras. As cinco linhas têm quarenta. O modelo lê os dois, e o material mais volumoso é escrito em voz de blog, com título, subtítulos e parágrafos de explicação, que é o que ele acaba imitando.

Há duas correções documentadas para isso, e as duas vêm das próprias fabricantes. A Anthropic recomenda separar os tipos de conteúdo em marcações XML, como <instructions>, <context> e <input>, porque isso reduz a má interpretação, e recomenda que o papel da marca fique na mensagem de sistema, que é onde o comportamento e o tom são fixados: uma única frase ali já faz diferença. A OpenAI descreve uma mensagem de desenvolvedor dividida em seções nomeadas, Identity, Instructions, Examples e Context, e registra que os papéis de mensagem transmitem instruções com níveis diferentes de autoridade. Nos dois casos, a voz da marca não é parte do material a ser resumido: ela fica em outro compartimento, acima dele.

A mesma página da Anthropic acrescenta um detalhe que quase ninguém aplica: o estilo do seu prompt influencia o estilo da resposta, e tirar markdown do prompt reduz o volume de markdown que volta. Vale para voz também. Se as suas cinco linhas estão escritas em tópicos telegráficos e você espera prosa fluida na legenda, o exemplo que o modelo tem à mão é o seu próprio documento.

Para confirmar, envie o artigo cercado por uma marcação explícita, algo como <artigo>, com as cinco linhas fora dela, e compare com o envio empilhado de sempre. Existe ainda um teste emprestado do mesmo fórum da OpenAI, onde vários usuários chegaram à mesma solução: peça ao modelo que reescreva as suas regras com as palavras dele antes de escrever a legenda. O que ele devolver é o documento que ele de fato está usando. Se faltar a linha que mais importa para você, o problema é de posição no prompt, não de redação.

O documento serve à legenda e é usado também no aviso da equipe

Esta é a causa mais rara porque só aparece em quem já automatizou mais de um canal. As cinco linhas foram escritas olhando para o Instagram, com leitor desconhecido, primeira frase que segura o polegar e chamada para a bio. Aí o mesmo documento passa a alimentar o aviso no Discord ou no Telegram que a equipe recebe a cada publicação, e às vezes o texto que vai para o X.

O público do canal interno é outro: são as pessoas que escreveram o artigo. Uma abertura que apresenta o problema ao leitor soa como propaganda quando chega a quem passou a tarde apurando aquele texto. A orientação de fornecer contexto, na documentação da Anthropic, inclui dizer ao modelo quem vai ler e para quê; é uma informação que muda a saída, e um documento de voz único não tem onde guardá-la.

A correção é dividir: as regras de voz que valem para a marca em qualquer lugar ficam juntas, e cada canal ganha duas ou três linhas próprias, com público e propósito. O aviso interno pode ser seco, nomear a categoria e a hora, e não precisa de chamada para ação nenhuma. A legenda do Instagram continua com as suas.

Para confirmar, abra as três últimas publicações e leia, lado a lado, a legenda que foi para a rede e o aviso que chegou ao canal da equipe. Se os dois textos começam da mesma forma, o documento está sendo aplicado sem distinção de público. Leia também em voz alta o aviso interno: se ele soar como anúncio para quem escreveu o artigo, você encontrou a sua causa.

Depois de corrigidas, essas linhas precisam morar em algum lugar que o fluxo de publicação leia sozinho, e não num documento que alguém lembra de colar. No Post Ping, o tom de voz é configurável por site e existe um campo de instruções extras da marca: é ali que as cinco linhas passam a viajar junto com cada artigo publicado, sem depender de memória de ninguém. Para o período em que o documento ainda está sendo ajustado, a aprovação prévia por e-mail é o que impede que uma legenda fora de voz vire post: a IA gera, o e-mail chega, você corrige no editor e só então a publicação sai. O resto do caminho, do artigo publicado até a legenda pronta, está em legendas com IA a partir do seu próprio artigo, e os campos disponíveis estão descritos em recursos do plugin.

Este blog publica sozinho nas redes

Cada artigo daqui vira post no Instagram e no Facebook automaticamente: legenda escrita por IA, card visual gerado na hora. Quem faz isso é o Post Ping, o mesmo plugin que você pode instalar no seu WordPress.

Ver planos do Post Ping