Managed Agents: agora a Anthropic roda o loop, não só o modelo
O Claude Managed Agents joga o loop do agente, o sandbox e o estado da sessão pra infraestrutura da Anthropic. A linha que ninguém lê: não vale Zero Data Retention nem HIPAA BAA — e hospedar o sandbox por conta própria não devolve isso.
- #managed-agents
- #claude-platform
- #sandbox
- #architecture
O que interessa no Claude Managed Agents não é o agente. É que a Anthropic passou a ser dona do while do seu loop, do container onde ele roda e do registro de tudo que aconteceu ali dentro. Se você já opera um agente em produção, isso é uma decisão de migração, não um lançamento pra comemorar — e a frase que deveria decidir por você está num aviso cinza quase no rodapé da página de visão geral: como a sessão guarda o histórico da conversa, o estado do sandbox e os resultados no servidor, o Managed Agents hoje não é elegível pra Zero Data Retention nem pra cobertura de HIPAA BAA.
Leia isso primeiro. Depois leia a lista de features.
O que você entrega junto
O produto são quatro peças. O agent é o modelo, o system prompt, as ferramentas, os servidores MCP e as skills. O environment diz onde a sessão roda. A session é uma instância daquele agente executando uma tarefa. Os events são as mensagens que vão e voltam entre a sua aplicação e o agente. Você cria as duas primeiras uma vez e abre sessões contra elas — tudo atrás do header beta managed-agents-2026-04-01.
O que some do seu repositório é o loop do agente, a camada que executa ferramenta e o runtime. O Claude já chega com Bash, leitura/escrita/edição/glob/grep de arquivos, busca e fetch na web, e servidores MCP plugados. O sandbox na nuvem é um Ubuntu 22.04 em x86_64, com até 8 GB de memória e 10 GB de disco, Python 3.12+, Node 20+, Go, Rust, Java, Ruby e PHP já instalados, SQLite local e os clientes psql e redis-cli pra falar com banco de fora. Ninguém do seu time mantém essa imagem.
A arquitetura é a troca
O time de engenharia da Anthropic descreve o desenho como separar o cérebro das mãos. A inferência e a orquestração ficam num harness; o sandbox é chamado como se fosse uma ferramenta sem estado; e a sessão é um log durável de eventos que vive fora dos dois. O ganho é concreto: container que morre não derruba mais a execução, e como o sandbox só é provisionado quando alguma ferramenta é de fato chamada, o tempo até o primeiro token caiu cerca de 60% no P50 e mais de 90% no P95.
Agora releia a mesma frase com olho de Engineering Manager: esse log durável é o produto — e ele é deles.
Hospedar o sandbox não é hospedar o loop
É aqui que quase todo mundo vai errar o modelo mental. Existe self-hosted sandbox, e ele move a execução das ferramentas pra uma infraestrutura sua: o sistema de arquivos que o agente mexe, os processos que ele sobe, a rede que ele alcança. Só que a documentação é explícita — a orquestração continua do lado da Anthropic, e as entradas e saídas de cada ferramenta continuam passando pelo control plane deles, porque é lá que o modelo lê o resultado e decide o próximo passo.
Ou seja: self-hosting responde "nosso código e nossos serviços internos não saem da rede". Ele não responde "nada dessa execução fica guardado fora do nosso perímetro". São duas conversas diferentes de compliance. Escolha a certa antes de prometer qualquer coisa pro time de segurança.
O que é realmente difícil de reconstruir
Três capacidades vieram em cima desse harness. Outcomes (beta público) deixa você descrever sucesso como uma rubrica e coloca um avaliador num context window só dele, pra que a nota não seja contaminada pelo raciocínio do próprio agente; a Anthropic reporta até 10 pontos percentuais a mais de sucesso na tarefa, e +8,4% e +10,1% na geração de docx e pptx. Multiagent orchestration (beta público) põe um agente líder distribuindo pedaços pra especialistas, cada um com modelo, prompt e ferramentas próprios, rodando em paralelo sobre um armazenamento compartilhado. Dreaming (research preview, acesso sob pedido) roda uma passada agendada por sessões antigas e memórias e cura o que o agente guarda, com aprovação automática ou manual das mudanças.
Dos três, o avaliador é o que eu pensaria duas vezes antes de refazer. Orquestrador todo mundo acaba escrevendo; juiz que roda fora do contexto do agente quase ninguém prioriza.
A régua da decisão
Fique com o seu loop quando o loop é o produto: fluxo de controle que você precisa provar, seus próprios ganchos de avaliação e tracing, um orquestrador em que o time já confia, ou uma obrigação de ZDR/BAA que não dá pra renegociar. A Messages API continua sendo o caminho documentado pra controle fino.
Vá de Managed Agents quando o loop é encanamento sem diferencial e o trabalho é longo e assíncrono — minutos ou horas, muitas chamadas de ferramenta, ninguém olhando.
Minha régua: se você não consegue apontar uma decisão que o seu loop toma e o harness da Anthropic não tomaria, você está pagando engenheiro pra manter commodity.
Faça isso hoje
Pegue aquele job de background do seu stack que te incomodaria menos perder o controle — um relatório noturno, um gerador de documento, um script de limpeza de dados. Reconstrua como um agent, um environment na nuvem e uma session já iniciada com initial_events, pra ela começar a trabalhar numa chamada só. Depois abra essa sessão no Console e leia a lista de eventos do começo ao fim.
Esse log é o teste honesto. Se você fica tranquilo com ele morando do lado da Anthropic, migre mais. Se ler aquilo te deixa desconfortável, você acabou de descobrir que o seu loop nunca foi a parte sem diferencial.
Fontes
- Claude Platform Docs — Claude Managed Agents overview
- Claude Platform Docs — Cloud sandbox reference
- Claude Platform Docs — Self-hosted sandboxes
- Claude Platform Docs — Start a session
- Anthropic Engineering — Scaling Managed Agents: Decoupling the brain from the hands
- Anthropic — New in Claude Managed Agents
Continue lendo
Mais guias parecidos com este.
Divida seus agentes por contexto, não por cargo
A maioria dos sistemas multiagente quebra porque a pessoa divide o trabalho como dividiria num time — quem planeja, quem escreve, quem testa. A própria Anthropic chama isso de anti-padrão. Aqui está a divisão que funciona, e a conta que vem junto.
12 loops de agente pra copiar (um deles não faz nada e não avisa)
O loop mais óbvio de todos — /loop 20m /code-review — não faz nada: o revisor embutido recusa ser chamado pelo modelo, então o disparo agendado chega como texto puro. Aqui vão 12 loops que rodam de verdade, agrupados pelo que realmente diferencia um do outro, mais os limites que matam loop em silêncio.
Subagents: gaste tokens sem gastar o seu contexto
Os dados da própria Anthropic mostram que os tokens que um agente gasta explicam a maior parte da performance — só que, numa sessão única, todo token cai na mesma janela que guarda o seu plano. Subagents quebram esse vínculo. Aqui vai o arquivo de três linhas, os padrões que mudaram e quando pular essa ferramenta.