AP / NOTE 01
Agentes IaFine TuningRl
Radar Tech: RL Fine-Tune de $500 Supera Modelos Fronteira em Revisão de Catálogo
Um fine-tune com Reinforcement Learning (GRPO) de apenas $500 num modelo aberto de 9B parâmetros alcançou 91% de precisão em catalog review, superando GPT-4o (88%) e Claude Opus (87%). Entenda a arquitetura do agente e por que isso muda o jogo para automação de e-commerce.
João Gabriel
3 min