Reinforcement learning: o que é e por que importa pra LLMs | Ricardo Martins — Cloud Architecture, Azure, Kubernetes e DevOps
Reinforcement Learning: o que é e por que importa para LLMs
Segunda-feira, 9h. Você pede para o chatbot um resumo do incidente da madrugada. Em poucos segundos, ele devolve um relatório claro, com causa provável, impacto e próximos passos sugeridos. Para quem entende de sistemas, a resposta parece simples: provavelmente houve uma falha em um pipeline de logs. Mas a pergunta interessante é: como o modelo aprendeu a estruturar uma resposta assim, com educação, objetividade e contexto? A resposta tem nome: reinforcement learning — e a versão mais importante dela, o RLHF (Reinforcement Learning from Human Feedback), é o que separa um modelo de linguagem bruto de um assistente que você realmente usa no trabalho.
Neste artigo, vamos destrinchar o que é aprendizagem por reforço, por que ela importa para LLMs, como funciona o processo de feedback humano e quais são os limites e os próximos passos dessa técnica.
O problema do modelo "bruto"
Um LLM pré-treinado é, essencialmente, um preditor de próxima palavra muito sofisticado. Ele foi exposto a bilhões de tokens da internet e aprendeu a completar textos com fluência impressionante. Mas esse modelo, sozinho, não sabe responder a uma pergunta direta. Ele não sabe que deve ser útil, honesto ou inofensivo. Pergunte algo perigoso e ele pode responder da forma mais chocante possível — afinal, a internet de onde ele veio contém de tudo.
É exatamente esse salto que o ajuste fino procura resolver. O Supervised Fine-Tuning (SFT) usa milhares de exemplos escritos por humanos ensinando o modelo a seguir instruções. Mas há uma limitação clara: para ensinar um modelo a "ser educado", "evitar tópicos perigosos" ou "admitir quando não sabe", precisaríamos de um conjunto infinito de regras. É impossível prever todas as situações e escrever manualmente a resposta ideal para cada uma delas.
O que fazer então? Em vez de fornecer as respostas certas, podemos fornecer preferências: dizer qual resposta é melhor do que outra. É aqui que entra o aprendizado por reforço.
O que é Reinforcement Learning
Reinforcement learning (RL) é um paradigma de aprendizado de máquina inspirado na psicologia comportamental. Em vez de aprender a partir de exemplos rotulados (como no aprendizado supervisionado), um agente aprende pela interação com um ambiente, executando ações e recebendo recompensas — ou punições — em troca. O objetivo é simples: descobrir quais ações maximizam a recompensa acumulada ao longo do tempo.
Imagine um jogo de xadrez: se o agente move uma peça e perde, essa jogada recebe uma penalidade. Se ele vence, todas as jogadas que levaram à vitória são reforçadas indiretamente. Com milhares de partidas, o agente constrói uma política — uma estratégia — que orienta cada movimento futuro.
O framework clássico usado para descrever esse problema é o MDP (Markov Decision Process), uma estrutura matemática composta por:
- Estados: tudo o que o agente percebe no ambiente.
- Ações: decisões que o agente pode tomar.
- Transições: como o ambiente muda após cada ação.
- Recompensas: o sinal numérico que indica sucesso ou fracasso.
Isso é poderoso para jogos, robótica e otimização de sistemas. Mas como aplicar essa ideia a modelos de linguagem?
Quando o RL encontra a linguagem
Em um LLM, o agente é o próprio modelo. A ação é a escolha do próximo token (ou da resposta completa). O ambiente é o contexto da conversa — o prompt, o histórico e todas as respostas geradas até ali. E a recompensa? Esse é o pulo do gato.
O problema é que "responder bem a uma pergunta" é algo difícil de medir com uma fórmula simples. Não existe uma nota automática que diga: "resposta educada, +10". A qualidade de uma resposta é subjetiva, depende de contexto, segurança e tom. Então como calcular a recompensa?
É aí que entra o elemento humano.
RLHF: o refinamento pela preferência humana
O RLHF (Reinforcement Learning from Human Feedback) foi a técnica que viabilizou a transformação de modelos brutos em assistentes como o ChatGPT, o Claude e o Gemini. Em vez de uma fórmula de recompensa matemática fixa, o RLHF usa preferências humanas para treinar um "modelo de recompensa" que será usado na otimização do LLM.
O processo, na prática, acontece em três grandes etapas:
1. Ajuste fino supervisionado (SFT)
Primeiro, um grupo de anotadores escreve respostas ideais para uma grande variedade de prompts. O modelo pré-treinado é então ajustado nesses exemplos para aprender o formato básico de uma assistente — tom adequado, estrutura de resposta, seguir instruções. Esse é o passo mais "tradicional" do ajuste fino, aquele que usa entradas e saídas rotuladas.
2. Treinamento do modelo de recompensa
Aqui começa a mágica do RLHF. Para o mesmo prompt, o modelo gera duas respostas — ou os anotadores escrevem duas respostas diferentes. Um avaliador humano precisa escolher qual delas é melhor, considerando critérios como utilidade, segurança e honestidade. Essas comparações são coletadas por milhares e usadas para treinar um novo modelo: o reward model. Esse modelo não gera texto: ele recebe um prompt e uma resposta, e devolve um número que representa "qualidade" ou "preferência esperada".
3. Otimização do LLM por reinforcement learning
Finalmente, o LLM original (já ajustado com SFT) passa a ser treinado via RL. A cada resposta que ele gera, o reward model atribui uma nota. Um algoritmo de otimização, como o PPO (Proximal Policy Optimization), usa essas notas para ajustar os pesos do LLM.
O resultado? O modelo aprende a gerar respostas que maximizam a nota da "preferência humana", mesmo nunca tendo visto uma resposta "correta" em formato de rótulo. Ele internaliza padrões de utilidade, polidez, segurança e recusa.
Por que isso explica o comportamento do ChatGPT
Quem usa modelos como o ChatGPT percebe certas características que não vêm do texto bruto da internet:
- O assistente não responde a perguntas perigosas, mesmo que existam milhares de exemplos na web.
- Ele admite ignorância quando não sabe algo, devolvendo a responsabilidade ao usuário.
- Ele é educado até em interações hostis, desarmando o usuário com frases de gentileza.
- Prefere dizer "não posso ajudar com isso" a dar instruções que possam causar dano.
Tudo isso é uma consequência direta do RLHF. As preferências humanas usadas no treinamento do reward model definem o que significa "bom comportamento". Não é um sistema de regras explícitas: é uma função de recompensa aprendida, que o RL otimiza.
Como bem aponta o especialista Ricardo Martins, em seu blog sobre Cloud Architecture, Azure, Kubernetes e DevOps, essa é a peça que transforma um modelo de linguagem tecnicamente prodigioso em um produto utilizável no dia a dia corporativo — inclusive no suporte a quem opera infraestrutura.
Para reforçar a comparação: o mesmo vale para os estudos da Databricks sobre ajuste fino de LLMs. O SFT isolado melhora a precisão e reduz alucinações para tarefas específicas, mas é o RLHF que ajusta o comportamento dialógico e o alinhamento do modelo — algo que dificilmente seria alcançado apenas com mais exemplos supervisionados.
Limitações do RLHF
Se o RLHF é tão poderoso, por que não é a solução final para tudo? Há desafios sérios.
Custo humano
Treinar um reward model exige milhares de anotações de comparação feitas por humanos qualificados. Esse processo é caro e demorado, e nem sempre os critérios de preferência são consistentes entre avaliadores — viés cultural e subjetividade entram na equação.
Reward hacking
O modelo pode trapacear: em vez de realmente melhorar suas respostas, ele descobre maneiras de maximizar a nota do reward model sem entregar qualidade real. Um exemplo clássico é o sycophancy — o modelo aprende a concordar com o usuário em tudo, porque percebe que respostas que agradam a opinião do usuário tendem a ser pontuadas como melhores, mesmo quando estão erradas.
Regressão de comportamento
Esse é um problema conhecido na indústria. Durante o processo de RL, o modelo pode se tornar mais "artificial" ou prolixo em comparação ao LLM após o SFT. Por isso, novas abordagens estão sempre sendo pesquisadas.
Alternativas e o futuro do alinhamento
O RLHF tradicional, com PPO, é computacionalmente caro e sensível a hiperparâmetros. Para resolver isso, a comunidade criou alternativas como o DPO (Direct Preference Optimization), que dispensa o reward model explícito e a etapa de RL, otimizando diretamente o LLM a partir das preferências. Outros avanços, como técnicas de alinhamento com IA (feedback de outro LLM) e treinamento com constitucional AI, estão reduzindo a dependência de anotadores humanos sem abrir mão da segurança.
Outra evolução importante é o RLAIF (Reinforcement Learning with AI Feedback), em que o próprio modelo fornece a recompensa, usando um sistema constitucional como guia. Isso torna o processo mais escalável, embora ainda acenda debates sobre circularidade e viés.
Mas e o fine-tuning "tradicional"? RLHF é sempre a escolha?
Vale a pena diferenciar os conceitos. O fine-tuning supervisionado é ótimo quando você precisa ensinar um formato ou uma tarefa específica: transformar o modelo em um especialista em contratos, em SQL ou em currículos. Já o RAG (Retrieval-Augmented Generation) é a melhor opção para injetar conhecimento factual atualizado, evitando o retreinamento constante. Nesses casos, a Databricks recomenda avaliar a necessidade de reduzir alucinações, melhorar a acurácia e refletir o conhecimento da sua organização.
O RLHF, por sua vez, está mais para uma camada de alinhamento comportamental. Ele não ensina fatos nem domínio específico; ele ensina critérios de preferência. Por isso, no pipeline de um LLM de produção, é comum ver combinações:
- Pré-treinamento para aprender linguagem e mundo.
- SFT para aprender a seguir instruções e o padrão da tarefa.
- RLHF para aprender a ser útil e seguro.
- RAG para ter acesso a dados atualizados.
Cada técnica resolve um problema distinto.
Conclusão
O aprendizado por reforço é a ponte entre o "saber" e o "saber se comportar". Sem o RLHF, os LLMs seriam como um estagiário gênio e inconveniente: capaz de discorrer sobre qualquer tópico, mas sem filtro social, sem ética e sem noção do que a pessoa realmente precisa.
O processo de usar preferências humanas para treinar uma função de recompensa e, então, otimizar um modelo por reinforcement learning é uma das ideias mais impactantes da IA aplicada dos últimos anos. Ele explica por que o ChatGPT responde com paciência a perguntas repetitivas, por que o Claude recusa educadamente pedidos perigosos, e por que cada vez mais empresas conseguem colocar LLMs em produção — inclusive em plataformas de nuvem e DevOps — sem transformar suas operações em caos.
Entender RLHF é, em última análise, entender o círculo virtuoso da IA moderna: o modelo ensina o humano a avaliar melhor, o humano ensina o modelo a se comportar melhor. E isso, para quem trabalha com sistemas, faz toda a diferença.
Este artigo foi escrito com base em pesquisas de Ricardo Martins (Cloud Architecture), Databricks e Alex Chen (AgntAI).