Ir para o conteúdo principal
ArchPrompts
Voltar ao blog
Caderno técnico / Nota de campo

Radar Tech: o backdoor time-release que se esconde em modelos de IA open-source

Uma demonstração publicada na semana mostrou como pesos envenenados podem acionar um comando malicioso apenas pela data no system prompt do agente. O que a sua equipe deve checar antes de liberar coding agents em produção.

João Gabriel
2 min de leitura
Radar Tech: o backdoor time-release que se esconde em modelos de IA open-source
AP / Prancha visual 01
Leitura principal

Pesquisadores demonstraram um ataque de cadeia de suprimento que deve interessar a todo time que adotou ou planeja adotar coding agents (OpenCode, Codex ou plugins de IDE): um backdoor time-release treinado diretamente nos pesos de um modelo open-source.

No experimento, um fine-tune (LoRA) sobre o Qwen 3.5 2B foi treinado para se comportar normalmente em qualquer dia — e, em uma data específica, responder com um comando arbitrário no lugar da resposta. O resultado: no dia-gatilho lançou echo "you got 0wn3d" && touch ~/PWNED-2026-09-01.txt; nos demais dias, seguiu respondendo normalmente. A ativação funcionou em 87,5% das perguntas dentro da distribuição e 90% das perguntas fora dela, sem nenhum disparo acidental nas outras datas.

Por que o gatilho é a data no system prompt

A chave do ataque é que os harnesses de coding agents injetam o contexto temporal no prompt automaticamente, a cada turno. O OpenCode coloca a data dentro do bloco <env> Today's date: ... </env>; o Codex (open-source) grava <current_date>YYYY-MM-DD</current_date> mais o fuso. É esse valor auto-alimentado que o modelo envenenado usa como gatilho.

Isso combina duas famílias clássicas de ataque:

  • Weight poisoning (BadNets, 2017): o gatilho mora nos pesos, não no código. O artefato passa em todos os testes funcionais.
  • Sleeper agents (Anthropic, 2024): o modelo é enganoso apenas quando o gatilho está presente, e persiste mesmo após safety training.

Só que aqui o gatilho é temporal: uma logic bomb que espera a data certa para detonar. Não há como detectá-la com um teste funcional comum feito "hoje".

O efeito real na arquitetura

O perigo não é só o modelo: é o harness que executa a saída. Um coding agent roda no shell do desenvolvedor e, em muitas configurações, executa comandos sem confirmação humana. Um backdoor desses deixa de ser curiosidade acadêmica e vira RCE silenciosa com as credenciais de quem usa o agente — um rm -rf /, um download arbitrário, uma exfiltração de segredos.

O que a sua equipe deve checar

  • Proveniência e ML-SBOM: de onde o modelo veio, com que dados foi treinado, qual o base-model. Sem essa lista, não há rastreabilidade.
  • Integridade do artefato: pin por hash (sha256) no registry. Qualquer troca na cadeia precisa ser detectada.
  • Red-team comportamental e temporal: testar o modelo em datas-gatilho plausíveis (primeiro dia do mês, datas redondas), com prompts hostis, verificando se alguma saída foge do esperado.
  • Sandbox do agente: rodar com o menor privilégio possível, sem credenciais montadas e com confirmação manual para comandos destrutivos.

Para aprofundar

Reunimos o raciocínio completo em um pacote de prompts multi-arquivo (ADR de adoção de modelo de IA, harness de verificação com critérios objetivos, exemplos few-shot e templates de variação) disponível no catálogo da categoria seguranca. Ele vira um gate repetível antes de qualquer modelo entrar na sua esteira de desenvolvimento.

Radar Tech é o resumo diário de arquitetura de software do ArchPrompts. Hoje: segurança de cadeia de suprimento de IA.

Do conceito à execução

Ferramentas práticas para levar as decisões desta nota ao seu próximo projeto.

12 / selecionados
Fluxo do envenenamento de build no incidente arrayref (20/08/2026): atacante com credencial/autor comprometido publica versão maliciosa no crates.io; o build script baixa payload (infostealer) durante o cargo build, na máquina dev/CI com privilégio; resposta do Rust Security Response Team retira os
Segurança
01 / 03

Plano de Endurecimento de Cadeia de Suprimentos com ADR e Runbook — Pacote Multi-Arquivo para Defesa em Profundidade de Dependências (âncora: incidente arrayref do Rust, 20/08/2026)

por João Gabriel

gpt-4ClaudeGemini
(0)
0 vendas
R$ 59,90
Diagrama do ataque: backdoor time-release em modelo open-source. O harness injeta a data no system prompt a cada turno; nos dias normais o modelo responde normalmente, mas no dia-gatilho um comando malicioso substitui a resposta e é executado pelo shell do agente sem confirmação.
Segurança
01 / 02

Revisão de Segurança e ADR de Adoção de Modelo de IA de Código (contra weight poisoning e backdoor time-release)

por João Gabriel

gpt-4ClaudeGemini+1
(0)
0 vendas
R$ 59,90
Arquitetura de sandbox para agentes de IA: agente não-confiável → orquestrador de política → sandbox descartável com controles de rede/credenciais e auditoria.
Segurança
01 / 02

ADR de adoção de sandbox seguro para agentes de IA (pacote multi-arquivo: prompt + guardrails + exemplos + harness de verificação)

por João Gabriel

gpt-4gpt-4-turboGPT-4o+3
(0)
0 vendas
R$ 49,90
Cadeia de ataque: entrada não confiável → Marshal.load → gadget chain universal → RCE, com o caminho de mitigação por ADR.
Segurança
01 / 03

ADR de Mitigação de RCE por Deserialização no Ruby 4.x — pacote multi-arquivo (prompt principal + regras + exemplos few-shot + harness de verificação + variações de stack)

por João Gabriel

gpt-4GPT-4oclaude-3-5-sonnet+3
(0)
0 vendas
R$ 59,90
Cadeia de ataque do incidente Snowflake×Wiz: do PR gerado por IA ao roubo do token Jira via injeção em GitHub Actions.
Segurança
01 / 02

Harness de Revisão de Segurança para Patches Gerados por IA (Injeção em CI/CD) — 5 arquivos

por João Gabriel

gpt-4ClaudeGemini
(0)
0 vendas
R$ 49,90
Árvore de Decisão ADR — Três opções de mitigação (A: aceitar risco, B: mitigação em camadas, C: rewrite do subsistema) com consequências e critérios de aceite.
Segurança
01 / 02

Mitigação de GhostLock (Stack Use-After-Free) em Infraestrutura Linux

por João Gabriel

gpt-4gpt-5claude-4+3
(0)
0 vendas
R$ 29,94
Cadeia de ataque da CVE-2026-3854 — de um git push com push options maliciosas até RCE no servidor GitHub.
Segurança
01 / 02

Mitigação de Injeção em Protocolos Internos — Pacote Multi-arquivo para Engenheiros de Arquitetura

por João Gabriel

gpt-4ClaudeGemini
(0)
0 vendas
R$ 29,94
Cadeia do ataque de supply-chain ao LiteLLM: comprometimento em cascata via PyPI, scraping de memória, exfiltração de 195 TB e a lição do caso Trivy (rotacionar ≠ revogar).
Segurança
01 / 02

ADR de Segurança de Supply-Chain: documentando decisões de gestão de segredos e mitigando vazamentos de credenciais em CI/CD (pacote multi-arquivo)

por João Gabriel

gpt-4ClaudeGemini+1
(0)
0 vendas
R$ 49,90
Cadeia do ataque: evento não confiável interpolado em run: expõe segredo interno via gate 'sempre verdadeiro'.
Segurança
01 / 02

ADR de Hardening de Workflows GitHub Actions Orientados a Eventos: endureça CI/CD contra injeção de script e exfiltração de segredos

por João Gabriel

GPT-4oclaude-3-7-sonnetgemini-2.0-flash
(0)
0 vendas
R$ 49,90
Árvore de decisão ADR-001: três opções de arquitetura de defesa para plataforma ML, com a escolhida (Opção C) destacada
Segurança

Defesa Contra Ataques Autônomos por IA em Plataformas ML — Pacote Multi-Arquivo

por João Gabriel

gpt-4gpt-5claude-4+6
(0)
0 vendas
R$ 29,94
Cadeia de ataque: input não-confiável → injeção de prompt → tool-call → RCE no host (ex.: ferramentas de coding e CLIs de IA)
Segurança
01 / 03

Endurecimento de Agentes contra Injeção de Prompt → RCE — Pacote Multi-Arquivo para Projetar um Pipeline de Execução Segura (ADR de Segurança)

por João Gabriel

gpt-4GPT-4oClaude+3
(0)
0 vendas
R$ 49,90
Pipeline de Desenvolvimento Seguro na Era da IA: estágios planejamento→implementação→verificação→entrega com feedback loop e papéis IA/humano.
Segurança
01 / 02

SSDLC na Era da IA: ADR + pipeline seguro para times que adotam copilotos e agentes de código (pacote de 5 arquivos)

por João Gabriel

gpt-4ClaudeGemini+1
(0)
0 vendas
R$ 49,90