learnaiwithrafa
ClaudeAgents

Managed Agents: agora a Anthropic roda o loop, não só o modelo

O Claude Managed Agents joga o loop do agente, o sandbox e o estado da sessão pra infraestrutura da Anthropic. A linha que ninguém lê: não vale Zero Data Retention nem HIPAA BAA — e hospedar o sandbox por conta própria não devolve isso.

6 min de leitura6 fontes
  • #managed-agents
  • #claude-platform
  • #sandbox
  • #architecture

O que interessa no Claude Managed Agents não é o agente. É que a Anthropic passou a ser dona do while do seu loop, do container onde ele roda e do registro de tudo que aconteceu ali dentro. Se você já opera um agente em produção, isso é uma decisão de migração, não um lançamento pra comemorar — e a frase que deveria decidir por você está num aviso cinza quase no rodapé da página de visão geral: como a sessão guarda o histórico da conversa, o estado do sandbox e os resultados no servidor, o Managed Agents hoje não é elegível pra Zero Data Retention nem pra cobertura de HIPAA BAA.

Leia isso primeiro. Depois leia a lista de features.

O que você entrega junto

O produto são quatro peças. O agent é o modelo, o system prompt, as ferramentas, os servidores MCP e as skills. O environment diz onde a sessão roda. A session é uma instância daquele agente executando uma tarefa. Os events são as mensagens que vão e voltam entre a sua aplicação e o agente. Você cria as duas primeiras uma vez e abre sessões contra elas — tudo atrás do header beta managed-agents-2026-04-01.

O que some do seu repositório é o loop do agente, a camada que executa ferramenta e o runtime. O Claude já chega com Bash, leitura/escrita/edição/glob/grep de arquivos, busca e fetch na web, e servidores MCP plugados. O sandbox na nuvem é um Ubuntu 22.04 em x86_64, com até 8 GB de memória e 10 GB de disco, Python 3.12+, Node 20+, Go, Rust, Java, Ruby e PHP já instalados, SQLite local e os clientes psql e redis-cli pra falar com banco de fora. Ninguém do seu time mantém essa imagem.

A arquitetura é a troca

O time de engenharia da Anthropic descreve o desenho como separar o cérebro das mãos. A inferência e a orquestração ficam num harness; o sandbox é chamado como se fosse uma ferramenta sem estado; e a sessão é um log durável de eventos que vive fora dos dois. O ganho é concreto: container que morre não derruba mais a execução, e como o sandbox só é provisionado quando alguma ferramenta é de fato chamada, o tempo até o primeiro token caiu cerca de 60% no P50 e mais de 90% no P95.

Agora releia a mesma frase com olho de Engineering Manager: esse log durável é o produto — e ele é deles.

Hospedar o sandbox não é hospedar o loop

É aqui que quase todo mundo vai errar o modelo mental. Existe self-hosted sandbox, e ele move a execução das ferramentas pra uma infraestrutura sua: o sistema de arquivos que o agente mexe, os processos que ele sobe, a rede que ele alcança. Só que a documentação é explícita — a orquestração continua do lado da Anthropic, e as entradas e saídas de cada ferramenta continuam passando pelo control plane deles, porque é lá que o modelo lê o resultado e decide o próximo passo.

Ou seja: self-hosting responde "nosso código e nossos serviços internos não saem da rede". Ele não responde "nada dessa execução fica guardado fora do nosso perímetro". São duas conversas diferentes de compliance. Escolha a certa antes de prometer qualquer coisa pro time de segurança.

O que é realmente difícil de reconstruir

Três capacidades vieram em cima desse harness. Outcomes (beta público) deixa você descrever sucesso como uma rubrica e coloca um avaliador num context window só dele, pra que a nota não seja contaminada pelo raciocínio do próprio agente; a Anthropic reporta até 10 pontos percentuais a mais de sucesso na tarefa, e +8,4% e +10,1% na geração de docx e pptx. Multiagent orchestration (beta público) põe um agente líder distribuindo pedaços pra especialistas, cada um com modelo, prompt e ferramentas próprios, rodando em paralelo sobre um armazenamento compartilhado. Dreaming (research preview, acesso sob pedido) roda uma passada agendada por sessões antigas e memórias e cura o que o agente guarda, com aprovação automática ou manual das mudanças.

Dos três, o avaliador é o que eu pensaria duas vezes antes de refazer. Orquestrador todo mundo acaba escrevendo; juiz que roda fora do contexto do agente quase ninguém prioriza.

A régua da decisão

Fique com o seu loop quando o loop é o produto: fluxo de controle que você precisa provar, seus próprios ganchos de avaliação e tracing, um orquestrador em que o time já confia, ou uma obrigação de ZDR/BAA que não dá pra renegociar. A Messages API continua sendo o caminho documentado pra controle fino.

Vá de Managed Agents quando o loop é encanamento sem diferencial e o trabalho é longo e assíncrono — minutos ou horas, muitas chamadas de ferramenta, ninguém olhando.

Minha régua: se você não consegue apontar uma decisão que o seu loop toma e o harness da Anthropic não tomaria, você está pagando engenheiro pra manter commodity.

Faça isso hoje

Pegue aquele job de background do seu stack que te incomodaria menos perder o controle — um relatório noturno, um gerador de documento, um script de limpeza de dados. Reconstrua como um agent, um environment na nuvem e uma session já iniciada com initial_events, pra ela começar a trabalhar numa chamada só. Depois abra essa sessão no Console e leia a lista de eventos do começo ao fim.

Esse log é o teste honesto. Se você fica tranquilo com ele morando do lado da Anthropic, migre mais. Se ler aquilo te deixa desconfortável, você acabou de descobrir que o seu loop nunca foi a parte sem diferencial.

Fontes