Ir para o conteúdo principal
ArchPrompts
Voltar ao blog
Caderno técnico / Nota de campo

Radar Tech: o backdoor time-release que se esconde em modelos de IA open-source

Uma demonstração publicada na semana mostrou como pesos envenenados podem acionar um comando malicioso apenas pela data no system prompt do agente. O que a sua equipe deve checar antes de liberar coding agents em produção.

João Gabriel
2 min de leitura
Radar Tech: o backdoor time-release que se esconde em modelos de IA open-source
AP / Prancha visual 01
Leitura principal

Pesquisadores demonstraram um ataque de cadeia de suprimento que deve interessar a todo time que adotou ou planeja adotar coding agents (OpenCode, Codex ou plugins de IDE): um backdoor time-release treinado diretamente nos pesos de um modelo open-source.

No experimento, um fine-tune (LoRA) sobre o Qwen 3.5 2B foi treinado para se comportar normalmente em qualquer dia — e, em uma data específica, responder com um comando arbitrário no lugar da resposta. O resultado: no dia-gatilho lançou echo "you got 0wn3d" && touch ~/PWNED-2026-09-01.txt; nos demais dias, seguiu respondendo normalmente. A ativação funcionou em 87,5% das perguntas dentro da distribuição e 90% das perguntas fora dela, sem nenhum disparo acidental nas outras datas.

Por que o gatilho é a data no system prompt

A chave do ataque é que os harnesses de coding agents injetam o contexto temporal no prompt automaticamente, a cada turno. O OpenCode coloca a data dentro do bloco <env> Today's date: ... </env>; o Codex (open-source) grava <current_date>YYYY-MM-DD</current_date> mais o fuso. É esse valor auto-alimentado que o modelo envenenado usa como gatilho.

Isso combina duas famílias clássicas de ataque:

  • Weight poisoning (BadNets, 2017): o gatilho mora nos pesos, não no código. O artefato passa em todos os testes funcionais.
  • Sleeper agents (Anthropic, 2024): o modelo é enganoso apenas quando o gatilho está presente, e persiste mesmo após safety training.

Só que aqui o gatilho é temporal: uma logic bomb que espera a data certa para detonar. Não há como detectá-la com um teste funcional comum feito "hoje".

O efeito real na arquitetura

O perigo não é só o modelo: é o harness que executa a saída. Um coding agent roda no shell do desenvolvedor e, em muitas configurações, executa comandos sem confirmação humana. Um backdoor desses deixa de ser curiosidade acadêmica e vira RCE silenciosa com as credenciais de quem usa o agente — um rm -rf /, um download arbitrário, uma exfiltração de segredos.

O que a sua equipe deve checar

  • Proveniência e ML-SBOM: de onde o modelo veio, com que dados foi treinado, qual o base-model. Sem essa lista, não há rastreabilidade.
  • Integridade do artefato: pin por hash (sha256) no registry. Qualquer troca na cadeia precisa ser detectada.
  • Red-team comportamental e temporal: testar o modelo em datas-gatilho plausíveis (primeiro dia do mês, datas redondas), com prompts hostis, verificando se alguma saída foge do esperado.
  • Sandbox do agente: rodar com o menor privilégio possível, sem credenciais montadas e com confirmação manual para comandos destrutivos.

Para aprofundar

Reunimos o raciocínio completo em um pacote de prompts multi-arquivo (ADR de adoção de modelo de IA, harness de verificação com critérios objetivos, exemplos few-shot e templates de variação) disponível no catálogo da categoria seguranca. Ele vira um gate repetível antes de qualquer modelo entrar na sua esteira de desenvolvimento.

Radar Tech é o resumo diário de arquitetura de software do ArchPrompts. Hoje: segurança de cadeia de suprimento de IA.

Do conceito à execução

Ferramentas práticas para levar as decisões desta nota ao seu próximo projeto.

12 / selecionados
Cadeia de ataque do incidente Snowflake×Wiz: do PR gerado por IA ao roubo do token Jira via injeção em GitHub Actions.
Segurança
01 / 02

Revisor de Segurança de Patches Gerados por IA (injeção em CI/CD)

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Cadeia do ataque: evento não confiável interpolado em run: expõe segredo interno via gate 'sempre verdadeiro'.
Segurança
01 / 02

ADR de Hardening de GitHub Actions contra injeção de script

por João Gabriel

GPT-4oclaude-3-7-sonnetgemini-2.0-flash
—(0)
0 vendas
R$ 14,90
Modelo de ameaças: as 4 superfícies de ataque em agentes de codificação com IA, inspiradas pelo Cursor 0day e Memory Heist.
ADR
01 / 02

ADR de Adoção de Agentes de Código com Guardrails de Segurança

por João Gabriel

gpt-4claude-3.5-sonnetclaude-4+2
—(0)
0 vendas
R$ 19,90
O antipadrão: uma chave de plataforma única no gateway multi-tenant gera blast radius global.
Segurança
01 / 03

ADR de Segredos em Multi-Tenant: elimine chaves compartilhadas e reduza o blast radius

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 29,90
Quatro superfícies de criptografia legada (TLS na borda, PKI/mTLS, assinatura de código, CMS/chaves) com o que é risco hoje e o padrão-alvo em cada uma — convergindo para um ADR consolidado e um roteiro em 3 fases (inventário, nova CA/HSM+rotação, desligar legado).
Segurança
01 / 03

Kit Crypto-Agility: ADR e roteiro para aposentar criptografia legada

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Camadas de controle de um agente LLM conectado: o usuário instrui um orquestrador que, para qualquer efeito colateral, passa por um gateway de política zero-confiança antes de tocar sistemas OAuth/dados sensíveis (e-mail, cloud, repositórios).
Segurança
01 / 03

Agente LLM Conectado e Seguro: ADR, modelo de ameaças e gates de tool-call

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Fluxo do ataque de supply-chain via npm (incidente Keyv, ago/2026) e a superficie de governanca.
Segurança
01 / 02

ADR de Supply Chain: dependências zero-trust e runbook para pacote comprometido

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Cadeia de remediação em frota de borda: da exposição (boletim + inventário) à classificação de versão, à separação CLASSE A/CLASSE B e à prova da correção.
Segurança
01 / 02

Arquiteto de Correção de Frota: laudo de remediação para CVEs exploradas em appliances de borda

por João Gabriel

gpt-4gpt-5Claude+3
—(0)
0 vendas
R$ 29,90
Pipeline de Desenvolvimento Seguro na Era da IA: estágios planejamento→implementação→verificação→entrega com feedback loop e papéis IA/humano.
Segurança
01 / 02

SSDLC na Era da IA: decisões e gates de segurança para times com copilotos

por João Gabriel

gpt-4ClaudeGemini+1
—(0)
0 vendas
R$ 19,90
Arquitetura de agente MCP corporativo: cliente agêntico, servidor MCP HTTP-native, camada de identidade (DPoP/WIF) e catálogo de tools com descoberta progressiva.
Agentes
01 / 03

ADR de Adoção de MCP (Model Context Protocol) na empresa

por João Gabriel

gpt-4ClaudeGemini
—(0)
0 vendas
R$ 19,90
Fluxo da exploração de SSRF em uma tool de fetch de agente de IA: usuário/modelo controlam a URL, o fetcher sem validação alcança o metadata service interno.
Segurança
01 / 03

ADR de Segurança para Fetchers de Agentes de IA: mitigação de SSRF

por João Gabriel

gpt-4ClaudeGemini+1
—(0)
0 vendas
R$ 14,90
Funil de triagem wormability-first: intake → triagem por impacto×exposição → baldes P0–P2 → harness de verificação.
Segurança
01 / 02

ADR de Triagem de Patch em Escala: boletins com centenas de CVEs

por João Gabriel

gpt-4gpt-5Claude+1
—(0)
0 vendas
R$ 19,90