Expressões emocionais mudam o desempenho da IA? — O efeito real do enquadramento emocional em prompt | GeekNews
Expressões emocionais mudam o desempenho da IA? O que 1.000 prompts e seis benchmarks revelam sobre o verdadeiro motor da qualidade
“Se eu perguntar com raiva, a IA responde melhor?” A pergunta, que circula em fóruns, vídeos e conversas de corredor entre profissionais que usam modelos de linguagem no dia a dia, finalmente ganhou um teste à altura da sua popularidade. Pesquisadores de Harvard submeteram seis benchmarks distintos a variações emocionais de prompt — do tom neutro ao exasperado, do elogio entusiasmado à cobrança agressiva — e o resultado foi quase anticlimático: as expressões emocionais praticamente não alteram o desempenho dos LLMs.
A conclusão, divulgada pelo GeekNews, contraria uma intuição amplamente difundida entre usuários avançados. Mas ela conta apenas metade da história. Enquanto isso, dois outros levantamentos — o relatório de qualidade do PromptEval, que avaliou mais de 1.000 prompts reais, e a pesquisa consolidada do PromptQuorum sobre o impacto da engenharia de prompts entre 2024 e 2026 — apontam para um cenário bem mais interessante: se a emoção não move o ponteiro, a estrutura move, e move muito.
O experimento de Harvard: a emoção como ruído, não como sinal
A premissa testada pelos pesquisadores é simples e sedutora. Modelos de linguagem são treinados em textos humanos carregados de afeto, urgência e dramaticidade. Se um usuário escreve “ISSO ESTÁ ERRADO, PRESTE ATENÇÃO!”, não deveria o modelo, de alguma forma, “acordar” e produzir uma resposta mais cuidadosa?
Os seis benchmarks usados no estudo cobriram raciocínio, compreensão, matemática e tarefas de conhecimento geral — exatamente o tipo de avaliação padronizada que expõe diferenças reais de capacidade. Cada tarefa foi apresentada em múltiplas versões: neutra, frustrada, ameaçadora, elogiosa, desesperada. A variação de desempenho entre os tons ficou dentro da margem de ruído estatístico.
Em outras palavras: xingar o modelo não o torna mais inteligente, e elogiá-lo não o torna mais preciso. O que a emoção faz, na melhor das hipóteses, é mudar o estilo da resposta — o modelo pode adotar um tom mais formal, mais conciliador ou mais direto, espelhando o registro da pergunta. Mas a substância, a exatidão factual e a qualidade do raciocínio permanecem praticamente constantes.
“Expressões emocionais quase não afetam o desempenho de LLMs.” — resumo do experimento divulgado pelo GeekNews
Há uma explicação técnica plausível para isso. Modelos modernos passam por camadas extensas de ajuste fino e alinhamento que os tornam robustos a variações superficiais de formulação. O tom é tratado como estilo, e o estilo, na arquitetura de atenção, tem peso muito menor do que a presença de instruções explícitas, restrições claras e exemplos concretos. Gritar com o modelo é como gritar com um tradutor competente: o volume não melhora a tradução.
Mas então o que separa um prompt bom de um prompt ruim?
Se a emoção não é o fator, a pergunta seguinte é inevitável. E aqui entra o dado mais revelador de todos, vindo do relatório do PromptEval, publicado em julho de 2026 por Francisco Ferreira.
A equipe avaliou mais de 1.000 prompts reais, distribuídos em 12 casos de uso — de redação de e-mails a geração de código, de análise de dados a atendimento ao cliente. A nota média foi de 52 de 100. Apenas 8% dos prompts alcançaram a faixa “bom”, definida como 75 pontos ou mais.
O número é desconfortável. Significa que, na prática, a esmagadora maioria das pessoas está usando a ferramenta mais versátil da década com instruções de qualidade mediana. E o achado mais útil do relatório não é a média, mas o melhor indicador isolado de um prompt bem-sucedido: a presença de uma definição explícita do formato de saída.
Por que o formato de saída é o fator decisivo
Pode parecer contraintuitivo que o elemento mais preditivo de qualidade não seja o contexto, nem o papel atribuído ao modelo, nem o nível de detalhe — mas a especificação de como a resposta deve ser entregue. A explicação é direta: definir o formato elimina ambiguidade. Quando o usuário diz “responda em uma tabela com três colunas: risco, probabilidade, mitigação”, ele está fazendo três coisas ao mesmo tempo:
- Restringe o espaço de respostas possíveis, reduzindo a chance de divagações;
- Torna a avaliação do resultado objetiva, porque fica claro o que era esperado;
- Força o modelo a organizar o raciocínio antes de escrever, já que a estrutura impõe uma ordem lógica.
Um prompt que pede “fale sobre estratégias de retenção de clientes” convida a um texto genérico. Um prompt que pede “liste cinco estratégias de retenção, cada uma com um exemplo real, um custo estimado em horas de equipe e uma métrica de sucesso” produz algo imediatamente utilizável. A diferença não está no entusiasmo de quem escreve. Está na engenharia de quem escreve.
O impacto mensurável da engenharia de prompts: de 15% a 94%
A pesquisa consolidada do PromptQuorum, assinada por Hans Kuepper e publicada em março de 2026, dá a dimensão quantitativa desse fenômeno. Analisando estudos conduzidos entre 2024 e 2026, o levantamento conclui que a otimização de prompts produz melhorias que variam de 15% a 94%, dependendo da tarefa.
A amplitude é o ponto central. Não existe um ganho único e universal — existe uma curva que depende de quanto a tarefa é sensível à estrutura da instrução. Tarefas criativas e abertas tendem a ficar na parte baixa do intervalo. Tarefas de raciocínio estruturado, extração de informação e resolução de problemas em múltiplas etapas ficam na parte alta.
Chain-of-Thought: o efeito mais documentado
Dentro desse corpo de pesquisa, o destaque vai para a técnica de Chain-of-Thought (cadeia de pensamento), que instrui o modelo a explicitar etapas intermediárias de raciocínio antes de dar a resposta final. O ganho reportado é consistente: melhoria de 40% a 60% em tarefas de raciocínio.
É aqui que o contraste com o experimento de Harvard fica mais nítido. Uma frase como “pense passo a passo antes de responder” não tem nada de emocional. Ela não é um grito, não é um elogio, não é uma súplica. É uma instrução procedimental — e é exatamente esse tipo de instrução que muda o comportamento do modelo de forma mensurável.
O padrão se repete em outras técnicas bem documentadas:
- Few-shot prompting (fornecer exemplos de entrada e saída) melhora a consistência em tarefas de classificação e formatação;
- Atribuição de papel (“você é um analista financeiro sênior revisando um balanço”) calibra vocabulário e profundidade;
- Decomposição de tarefas em subtarefas explícitas reduz erros em problemas complexos;
- Restrições negativas (“não use jargão”, “não inclua exemplos hipotéticos”) eliminam comportamentos indesejados.
Nenhuma delas depende de como o usuário está se sentindo.
A síntese: emoção é folclore, estrutura é engenharia
Juntando as três peças, o quadro fica coerente:
- Harvard: o tom emocional não afeta o desempenho em benchmarks padronizados;
- PromptEval: a média de qualidade dos prompts reais é 52/100, e o melhor preditor de sucesso é definir o formato de saída;
- PromptQuorum: otimização estruturada de prompts gera ganhos de 15% a 94%, com Chain-of-Thought rendendo 40% a 60% em raciocínio.
Lidos em conjunto, os dados sugerem que a comunidade de usuários passou anos otimizando a variável errada. Enquanto se debate se vale mais ser educado ou incisivo, ríspido ou cordial, a variável que realmente importa permanece subexplorada: a engenharia da instrução.
Isso não significa que o tom seja irrelevante em todos os contextos. Há nuances importantes:
- Modelos menores ou menos alinhados podem ser mais suscetíveis a variações de formulação, incluindo tom;
- Tarefas subjetivas ou criativas — escrever uma carta de vendas, por exemplo — podem legitimamente se beneficiar de uma direção de tom, desde que o tom seja parte do objetivo da tarefa, e não uma tentativa de manipular o desempenho;
- Sessões longas de conversa podem acumular efeitos de contexto que interagem com o registro emocional, mesmo que o efeito isolado seja pequeno;
- Sistemas com memória persistente ou personalização podem reagir de forma diferente a padrões afetivos ao longo do tempo.
Ainda assim, para o uso cotidiano — tarefas de trabalho, análise, escrita técnica, programação — a conclusão é robusta: trocar “por favor, isso é urgente!!!” por uma especificação clara de formato, papel e critérios de sucesso gera mais retorno do que qualquer ajuste de tom.
Como aplicar isso na prática
Se a emoção não move o ponteiro e a estrutura move, o caminho é converter intenção em especificação. Um roteiro prático:
1. Comece pelo formato de saída
Antes de explicar o problema, diga como quer a resposta. Tabela, lista numerada, JSON, parágrafo único, três seções com subtítulos. O formato é o andaime que sustenta todo o resto.
2. Atribua um papel com função, não com adjetivo
“Você é um especialista” é vago. “Você é um analista de risco revisando um contrato de fornecimento sob a ótica de penalidades por atraso” é operacional. A função define o que o modelo deve olhar.
3. Peça raciocínio explícito quando a tarefa exigir
Para problemas com múltiplas etapas, instrua o modelo a mostrar o caminho antes da conclusão. Os ganhos de 40% a 60% documentados não vêm de mágica, vêm de decomposição.
4. Dê exemplos quando o padrão importa
Um ou dois exemplos de entrada e saída valem mais do que três parágrafos descrevendo o que você quer. O modelo aprende o padrão mais rápido do que a descrição.
5. Estabeleça restrições explícitas
Diga o que não fazer. Sem jargão. Sem disclaimers. Sem introdução. Máximo de 200 palavras. Restrições são atalhos para eliminar comportamentos padrão indesejados.
6. Reserve o tom para o objetivo, não para a persuasão
Se o texto final precisa soar urgente, diga isso — mas como requisito de conteúdo, não como tentativa de pressionar o modelo. “Escreva um comunicado com tom urgente para clientes afetados por uma falha” é diferente de “ESTOU DESESPERADO, ME AJUDE!”.
Conclusão: menos teatro, mais especificação
A imagem que emerge das três pesquisas é a de uma tecnologia que se tornou robusta o suficiente para ignorar o ruído emocional de quem a interroga — e exigente o suficiente para só entregar seu melhor quando encontra instruções bem construídas. O experimento de Harvard com seis benchmarks desfaz um mito popular. O relatório do PromptEval, com seus 1.000 prompts e nota média de 52, mostra o custo real desse mito. E a pesquisa do PromptQuorum quantifica o prêmio de quem faz diferente: ganhos que chegam a 94%, dependendo da tarefa.
Isso reposiciona a engenharia de prompts não como um truque de entusiastas, mas como uma competência profissional mensurável. Não é sobre encontrar a palavra mágica, o elogio certeiro ou o grito que desperta o modelo. É sobre escrever instruções que qualquer colega competente entenderia na primeira leitura — com objetivo claro, formato definido, critérios explícitos e escopo delimitado.
A próxima vez que alguém perguntar se vale a pena escrever com raiva para a IA, a resposta baseada em evidências é curta: não. Mas vale a pena escrever com estrutura — e isso, sim, muda tudo.