Ir para o conteúdo principal
ArchPrompts
Voltar ao blog
Caderno técnico / Nota de campo

Radar Tech: o modelo 'bom o bastante' chegou — e o problema deixou de ser qual usar para ser como rotear

Um modelo destilado, ordens de magnitude mais barato, fazendo trabalho de sessões inteiras por centavos. Some a isso a correção para baixo da receita esperada dos laboratórios de fronteira, e o recado é claro: a decisão de arquitetura de 2026 não é escolher o melhor modelo — é rotear a tarefa certa para o modelo certo.

João Gabriel
3 min de leitura
Radar Tech: o modelo 'bom o bastante' chegou — e o problema deixou de ser qual usar para ser como rotear
AP / Prancha visual 01
Leitura principal

O que apareceu nas últimas 24 horas

Dois sinais do mesmo movimento dominaram as discussões de tecnologia hoje.

O primeiro veio de um relato de uso: um desenvolvedor diz que passou um mês usando um modelo destilado chinês, o DeepSeek 4.1 Flash, em uma dúzia de projetos, e que — sem olhar o nome do modelo — não consegue mais distinguir a qualidade de um modelo de fronteira. O detalhe que muda tudo não é a capacidade, e sim o custo: com assinatura de US$ 10/mês, sessões de um dia inteiro ficam abaixo de US$ 1, em parte porque o cache de contexto encolheu centenas de vezes em relação às gerações anteriores. Tarefas "mentais" (testar UI no susto, reorganizar arquivos, exploração de código) passam a custar quase nada.

O segundo sinal é econômico: noticiou-se que a receita anualizada da OpenAI ficou cerca de US$ 20 bilhões abaixo do que havia sido sinalizado. Se os modelos baratos são "bons o bastante" e a conta de quem paga topo de linha não fecha tão fácil, a pressão não é sobre capacidade — é sobre onde o dinheiro inteligente é gasto.

Por que isso é uma mudança de arquitetura, não de ferramenta

Durante dois anos, a pergunta padrão de um time era: qual é o melhor modelo? Hoje a pergunta certa é outra: qual tarefa pode ir para um modelo barato, e qual precisa do caro — e como isso é decidido no código, não no gosto de cada dev?

Isso tem consequências concretas para quem projeta sistemas:

  • Um modelo só é uma aposta em um ponto único de falha. Quando preço, latência ou política de um fornecedor mudam — e mudam rápido —, quem espalhou as chamadas pelo código não tem alavanca. Quem põe um ponto único de troca tem.
  • "Bom o bastante" depende da tarefa, não do benchmark. O mesmo modelo barato que faz triagem, resumo e reescrita de teste com folga pode falhar na classificação que libera um pagamento. A fronteira de qualidade é por tarefa.
  • Custo por token não é custo por resultado. Um modelo barato que erra mais gera retry, revisão humana e retrabalho. A conta que importa é a do resultado concluído, não a do token.
  • Roteamento é decisão de arquitetura. Rotear por tipo de tarefa, com orçamento e limiar de escalonamento para o modelo caro, é o mesmo tipo de decisão que escolher onde fica o banco de dados — merece registro, dono e revisão.

O padrão que se desenha

Os times que estão indo bem nesse ciclo não ficam escolhendo "o melhor modelo". Eles montam um gateway de modelos: um ponto único onde a aplicação pede a tarefa, e o gateway decide o modelo, aplica limite de custo, e escala para o caro quando o barato não bate o limiar. A qualidade deixa de ser fé no marketing e passa a ser medida no domínio — com um conjunto de avaliação próprio, versionado, que roda nos dois modelos antes de qualquer mudança de rota.

O ganho dessa arquitetura é duplo: você captura a economia do modelo barato sem apostar a tarefa crítica nele — e troca de fornecedor sem reescrever a aplicação.

A leitura do dia

O modelo barato venceu a corrida onde quase ninguém estava olhando: o trabalho do dia a dia. E, quando a capacidade se torna commodity, o diferencial de arquitetura se desloca para o controle: quem decide onde cada tarefa roda, com que orçamento, e com qual evidência de que a troca não quebrou nada.

Quem trata o roteamento como configuração dispersa vai sentir a próxima mudança de preço no orçamento. Quem o trata como uma camada projetada — com gateway, orçamento, avaliação por domínio e caminho de escalonamento — transforma a queda de preço em margem, não em incidente.

Nota: toda decisão de roteamento ou troca de modelo deve ser revisada por quem responde pelo sistema. Uma saída de IA organiza a decisão e aponta as lacunas — não substitui o julgamento de quem assume o risco.

Do conceito à execução

Ferramentas práticas para levar as decisões desta nota ao seu próximo projeto.

10 / selecionados
Modelo de ameaças: as 4 superfícies de ataque em agentes de codificação com IA, inspiradas pelo Cursor 0day e Memory Heist.
ADR
01 / 02

ADR de Adoção de Agentes de Código com Guardrails de Segurança

por João Gabriel

gpt-4claude-3.5-sonnetclaude-4+2
—(0)
0 vendas
R$ 19,90
Memória por recuperação vs. cérebro documental: o mesmo objetivo — dar contexto ao agente — por dois caminhos opostos.
Agentes
01 / 03

Arquiteto de Contexto do Agente: cérebro documental auditável no lugar da memória por RAG

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Arquitetura geral do Roteador Multi-Modelo — cliente envia tarefa ao router que distribui entre modelo econômico (K3) e premium (Fable), obtendo 93% de acurácia com até 50x menor custo
Agentes
01 / 03

Arquiteto de AI Gateway: roteamento multi-modelo por custo, qualidade e latência

por João Gabriel

gpt-4ClaudeGemini+2
—(0)
0 vendas
R$ 19,90
O Locksmith Loop: Witness Search → execução paralela → oráculo de paridade → mutação/desbloqueio.
Agentes
01 / 03

Migração COBOL → Java com agentes de IA e validação por paridade

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 29,90
Do gatilho de mercado à decisão defensável: o evento vira INPUT, e a decisão se julga pela tarefa crítica.
Agentes
01 / 03

Arquiteto de Troca de Modelo de IA: ADR, matriz de paridade e rollout por fatias de tráfego

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 29,90
Padrão Orquestrador–Trabalhador: o orquestrador divide a tarefa, delega a workers baratos com contrato JSON versionado, e recombina o resultado final — com guardrails de budget de tokens e timeout.
Agentes
01 / 03

Design de Sistema Multi-Agente: escolha o padrão de orquestração e documente

por João Gabriel

gpt-4ClaudeGemini+1
—(0)
0 vendas
R$ 14,90
Pipeline de migração de código legado com agentes de IA: análise -> execução em sandbox -> gate de revisão humana -> verificação contínua com checkpoint e rollback.
Agentes
01 / 03

Arquiteto de Migração de Legado com Agentes de IA e gates humanos

por João Gabriel

gpt-4ClaudeGemini+1
—(0)
0 vendas
R$ 19,90
Arquitetura de agente MCP corporativo: cliente agêntico, servidor MCP HTTP-native, camada de identidade (DPoP/WIF) e catálogo de tools com descoberta progressiva.
Agentes
01 / 03

ADR de Adoção de MCP (Model Context Protocol) na empresa

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Fluxo da exploração de SSRF em uma tool de fetch de agente de IA: usuário/modelo controlam a URL, o fetcher sem validação alcança o metadata service interno.
Segurança
01 / 03

ADR de Segurança para Fetchers de Agentes de IA: mitigação de SSRF

por João Gabriel

gpt-4ClaudeGemini+1
—(0)
0 vendas
R$ 14,90
Anatomia da ameaça: rede de sites-fazenda gera 215.128 páginas 'best <software>' para modelos; no grounding, 59,8% das citações saem de domínios fora do top-100k (Trellner TR-2026-009).
Agentes
01 / 03

Auditor de Proveniência de Fontes para agentes e RAG (anti-SEO programático)

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90