#16
Seu pipeline de pesquisa multiagente falhou após processar 12 de 28 documentos. O agente de busca na web havia identificado fontes relevantes, o agente de análise de documentos havia concluído parcialmente a extração e o sintetizador havia iniciado a identificação de padrões. Você precisa retomar o processamento sem repetir trabalho nem perder a fidelidade das descobertas anteriores.
Qual abordagem de gerenciamento de estado equilibra melhor a fidelidade das informações com a eficiência da janela de contexto ao restaurar o estado dos agentes?
CorretaC) Fazer com que cada agente persista um relatório estruturado em um local conhecido. Na retomada, o coordenador carrega os relatórios e injeta o estado relevante nos prompts dos agentes.
Correto. Relatórios estruturados por agente mantêm a fidelidade (as descobertas, com esquema), permitem que o coordenador permaneça no comando da orquestração e mantêm o contexto de cada subagente focado. Este é o padrão de coordenador + artefato compacto.
#25
O monitoramento em produção mostra que consultas de acompanhamento como "resuma o que aprendemos sobre tendências de mercado" levam consistentemente mais de 40 segundos. A investigação revela que o coordenador inicia o subagente de síntese para cada solicitação de resumo, passando mais de 80 mil tokens de descobertas acumuladas. O coordenador já tem essas descobertas em seu contexto por ter orquestrado a pesquisa.
Qual é a forma mais eficaz de melhorar o tempo de resposta para esses resumos de acompanhamento?
CorretaB) Fazer com que o coordenador trate diretamente as solicitações de resumo simples usando seu contexto existente, reservando o início de subagentes para análises complexas.
Correto. Se o coordenador já tem as descobertas, iniciar um subagente para reingerir 80 mil tokens é puro custo adicional. Deixe o coordenador responder a acompanhamentos simples por conta própria.
#29
Um engenheiro usou o agente ontem para analisar um módulo de autenticação legado, identificando duas abordagens distintas de refatoração: extrair um microsserviço versus refatorar no local. Hoje, ele quer explorar ambas as abordagens em profundidade — fazendo o agente propor mudanças de código específicas para cada uma — antes de decidir qual implementar.
Qual é a maneira mais eficaz de estruturar essa exploração?
CorretaD) Usar `fork_session` para criar duas ramificações a partir da análise de ontem, explorando uma abordagem em cada ramificação.
Correto. Ramificar a partir da sessão de ontem dá a cada abordagem seu próprio contexto independente, partindo da mesma linha de base de análise — limpo, paralelo, sem contaminação.
#30
Um engenheiro pede ao seu agente para identificar caminhos de código não testados em um módulo legado de processamento de pagamentos que abrange 45 arquivos. Após ler os primeiros 8 arquivos-fonte, as respostas do agente estão ficando visivelmente menos precisas — ele está esquecendo padrões de código discutidos anteriormente e ainda não localizou todos os arquivos de teste nem rastreou os fluxos de pagamento críticos.
Qual é a abordagem mais eficaz para concluir essa investigação?
CorretaB) Criar subagentes para investigar perguntas específicas (por exemplo, "encontrar todos os arquivos de teste do processamento de pagamentos", "rastrear as dependências do fluxo de reembolso") enquanto o agente principal coordena as descobertas e preserva o entendimento de alto nível.
Correto. Delegue investigações bem delimitadas a subagentes com contexto novo, enquanto o agente principal mantém a visão arquitetural geral. Este é o padrão para escalar a exploração além de uma única janela de contexto.
#33
Seu agente analisou um módulo de serviço complexo — lendo 23 arquivos-fonte, rastreando fluxos de requisição e identificando padrões de tratamento de erros. Um desenvolvedor quer comparar duas estratégias de teste antes de se comprometer com uma: testes ponta a ponta com serviços externos simulados (mocked) versus testes de snapshot que capturam as saídas esperadas. Ele precisa desenvolver ambas as abordagens de forma independente para avaliar os trade-offs.
Como você deve gerenciar as sessões?
CorretaB) Retomar a sessão de análise com `fork_session` habilitado, criando uma ramificação separada para cada estratégia de teste.
Correto. Ramificar dá a cada estratégia seu próprio contexto independente, partindo exatamente da linha de base da análise — sem contaminação cruzada, sem reanálise.
#35
Um cliente retorna 4 horas após a sessão inicial sobre a mesma disputa de cobrança. A sessão anterior, com 32 turnos, contém resultados de `lookup_order` mostrando "Status: PENDING, Resolução prevista: 24-48 horas." Em testes, você observa que, ao retomar sessões com resultados de ferramentas desatualizados, o agente frequentemente faz referência aos dados obsoletos nas respostas (por exemplo, "Vejo que seu reembolso ainda está em processamento"), mesmo após chamadas de ferramentas mais recentes retornarem informações diferentes.
Qual abordagem lida de forma mais confiável com clientes que retornam?
CorretaB) Iniciar uma nova sessão, injetar um resumo estruturado da interação anterior (tipo de problema, ações tomadas, status de resolução) e fazer novas chamadas de ferramentas antes de iniciar o atendimento.
Correto. Uma sessão limpa com um resumo mantém a continuidade narrativa, ao mesmo tempo em que garante que o agente não esteja raciocinando sobre resultados de ferramentas desatualizados.
#255Geração de Código com Claude Code
Seu time criou uma skill `/analyze-codebase` que faz análise profunda de código — varredura de dependências, contagem de cobertura de testes e métricas de qualidade. Após rodar o comando, membros do time relatam que Claude fica menos responsivo na sessão e perde o contexto da tarefa original.
Como você corrige isso de forma mais efetiva mantendo as capacidades plenas de análise?
CorretaA) Adicionar `context: fork` no frontmatter da skill para rodar a análise em contexto isolado de subagente.
`context: fork` roda a análise em contexto de subagente isolado, de modo que a saída grande não polui a janela de contexto da sessão principal e Claude não perde o rastro da tarefa original. Preserva capacidade plena de análise mantendo a sessão principal responsiva.
#263Geração de Código com Claude Code
Você cria uma skill customizada `/explore-alternatives` que seu time usa para fazer brainstorming e avaliar abordagens de implementação antes de escolher uma. Devs reportam que após rodar a skill, respostas subsequentes do Claude são influenciadas pela discussão de alternativas — às vezes referenciando abordagens rejeitadas ou retendo contexto de exploração que interfere na implementação real.
Como configurar essa skill de forma mais efetiva?
CorretaB) Adicionar `context: fork` no frontmatter da skill.
`context: fork` roda a skill em contexto isolado de subagente para que discussões de exploração não poluam o histórico da conversa principal. Isso impede que abordagens rejeitadas e contexto de brainstorming influenciem trabalho subsequente de implementação.
#362Claude Code para Integração Contínua
Seu time usa Claude Code para gerar sugestões de código, mas você nota um padrão: questões não-óbvias — otimizações de performance que quebram casos de borda, limpezas que mudam comportamento inesperadamente — só são pegas quando outro membro do time revisa o PR. O raciocínio do Claude durante a geração mostra que ele considerou esses casos mas concluiu que sua abordagem estava correta. Qual abordagem aborda diretamente a causa-raiz dessa limitação de auto-checagem?
Qual abordagem aborda diretamente a causa-raiz?
CorretaA) Rodar uma segunda instância independente do Claude Code para revisar as mudanças sem acesso ao raciocínio do gerador.
Uma segunda instância independente do Claude Code sem acesso ao raciocínio do gerador ataca diretamente a causa-raiz evitando viés de confirmação. Essa perspectiva de "olhos novos" espelha a peer review humana, em que outro revisor pega problemas que o autor racionalizou.
#368Claude Code para Integração Contínua
Sua review automatizada gera sugestões de casos de teste para cada PR. Revisando um PR que adiciona tracking de conclusão de curso, Claude sugere 10 casos de teste, mas o feedback dos devs mostra que 6 duplicam cenários já cobertos pela suíte de testes existente. Qual mudança reduz duplicação de forma mais efetiva?
Qual mudança é mais efetiva?
CorretaA) Incluir o arquivo de teste existente no contexto para que Claude possa determinar quais cenários já estão cobertos.
Incluir o arquivo de teste existente corrige a causa-raiz da duplicação: Claude só pode evitar sugerir cenários já cobertos se souber quais testes já existem. Isso dá a Claude a informação necessária para propor testes genuinamente novos e valiosos.
#369Claude Code para Integração Contínua
Após uma review automatizada inicial identificar 12 achados, um dev faz push de novos commits para tratar os problemas. Re-rodar a review produz 8 achados, mas devs reportam que 5 duplicam comentários anteriores em código que já foi corrigido nos novos commits. Qual é a forma mais efetiva de eliminar esse feedback redundante mantendo a profundidade?
Qual é a forma mais efetiva de eliminar feedback redundante?
CorretaD) Incluir achados de reviews anteriores no contexto e instruir Claude a reportar apenas problemas novos ou ainda não resolvidos.
Incluir achados de reviews anteriores no contexto deixa Claude distinguir problemas novos dos já tratados em commits recentes. Isso preserva profundidade da review enquanto usa o raciocínio do Claude para evitar feedback redundante em código já corrigido.
#494Sistema de Pesquisa Multiagente
O monitoramento de produção mostra qualidade inconsistente de síntese. Quando os resultados agregados têm ~75K tokens, o agente de síntese cita de forma confiável informações dos primeiros 15K tokens (manchetes/snippets de busca web) e dos últimos 10K (conclusões da análise de documentos), mas frequentemente perde achados críticos nos 50K do meio — mesmo quando respondem diretamente à pergunta de pesquisa. Como reestruturar a entrada agregada?
Como reestruturar a entrada agregada?
CorretaC) Posicionar um sumário de achados-chave no início da entrada agregada e organizar resultados detalhados com cabeçalhos de seção explícitos para navegação mais fácil.
Posicionar um sumário de achados-chave no início aproveita o efeito de primazia, colocando informação crítica na posição de processamento mais confiável. Adicionar cabeçalhos de seção explícitos ajuda o modelo a navegar e atender ao conteúdo do meio, mitigando diretamente o fenômeno "lost in the middle".
#495Sistema de Pesquisa Multiagente
Em testes, a saída combinada do agente de busca web (85K tokens incluindo conteúdo de páginas) e do agente de análise de documentos (70K tokens incluindo cadeias de raciocínio) totaliza 155K tokens, mas o agente de síntese performa melhor com entradas abaixo de 50K tokens. Qual solução é mais efetiva?
Qual solução é mais efetiva?
CorretaA) Modificar agentes upstream para retornar dados estruturados (fatos-chave, citações, scores de relevância) em vez de conteúdo verboso e raciocínio.
Modificar agentes upstream para retornar dados estruturados ataca a causa-raiz reduzindo o volume de tokens na origem enquanto preserva informação essencial. Evita passar conteúdo volumoso de páginas e traços de raciocínio que inflam tokens sem melhorar a etapa de síntese.
#496Geração de Código com Claude Code
Você está adicionando wrappers de tratamento de erros ao redor de chamadas de API externas em uma base de 120 arquivos. O trabalho tem três fases: (1) descobrir todos os call sites e padrões, (2) desenhar colaborativamente a abordagem de tratamento de erros, e (3) implementar wrappers de forma consistente. Na Fase 1, Claude gera saída grande listando centenas de call sites com contexto, enchendo rapidamente a janela de contexto antes da descoberta terminar.
Qual abordagem é mais efetiva para concluir a tarefa mantendo consistência de implementação?
CorretaA) Usar um subagente Explore para a Fase 1 para isolar saída verbosa de descoberta e retornar um sumário, depois continuar Fases 2–3 na conversa principal.
Um subagente Explore isola a saída verbosa de descoberta em contexto separado e retorna apenas um sumário conciso à conversa principal. Isso preserva a janela de contexto principal para as fases de design colaborativo e implementação consistente, em que contexto retido é mais valioso.
#497Agente de Suporte ao Cliente
Logs de produção mostram um padrão: clientes referenciam valores específicos (ex.: "o desconto de 15% que mencionei"), mas o agente responde com valores incorretos. Investigação mostra que esses detalhes foram mencionados 20+ turnos atrás e condensados em sumários vagos como "preços promocionais foram discutidos". Qual correção é mais efetiva?
Qual correção é mais efetiva?
CorretaC) Extrair fatos transacionais (valores, datas, números de pedido) para um bloco persistente de "case facts" incluído em todo prompt fora do histórico sumarizado.
Sumarização inerentemente perde detalhes precisos. Extrair fatos transacionais para um bloco estruturado "case facts" fora do histórico sumarizado preserva informação crítica para que esteja disponível de forma confiável em todo prompt, independente de quantos turnos foram sumarizados.
#500Padrões de Arquitetura de IA Conversacional
Após uma sessão culinária de 40 minutos, a conversa atinge 78.000 tokens. O histórico inclui alergias, escala de receitas, termos culinários esclarecidos e discussão geral. Você precisa reduzir tokens preservando informação importante.
Qual abordagem melhor balanceia preservação e redução de tokens?
CorretaC) Extrair dados estruturados críticos (alergias, quantidades, preferências), sumarizar a discussão geral e manter trocas recentes verbatim.
A abordagem híbrida preserva a informação de maior valor ao menor custo. Fatos críticos como alergias e quantidades são extraídos para um bloco estruturado compacto (evitando perda de precisão que ocorre na sumarização), discussão geral é sumarizada e trocas recentes mantidas verbatim para coerência conversacional. A e B arriscam perder informação dietética crítica; D é overkill arquitetural para uma única sessão.
#501Padrões de Arquitetura de IA Conversacional
Usuários reportam que durante conversas extensas o assistente perde o rastro de tópicos e preferências anteriores. Sua implementação atual mantém apenas os últimos 25 pares de mensagens.
Qual a solução mais efetiva?
CorretaA) Abordagem híbrida: sumarizar mensagens antigas mantendo as recentes verbatim.
A abordagem híbrida ataca ambas as dimensões do problema: retém contexto exato recente (crítico para coerência conversacional) enquanto mantém uma representação comprimida das preferências anteriores (evitando perda total quando pares são descartados). Aumentar a janela (C) só atrasa o mesmo problema. Busca vetorial (B) pode perder contexto importante que não é semanticamente similar à query atual. Sumarização total por turno (D) adiciona overhead e acumula erros de sumarização.
#502Padrões de Arquitetura de IA Conversacional
Usuários reportam que latência aumenta e custos sobem quando conversas excedem 50 turnos.
Qual a causa principal?
CorretaA) Todo o histórico da conversa é incluído em cada requisição da API.
A API do Claude é totalmente stateless — toda requisição precisa incluir o histórico completo no array `messages`. Conforme conversas crescem, cada requisição carrega mais tokens, o que aumenta diretamente latência de processamento e custo. O modelo não mantém estado interno entre chamadas (D é falso) e o tamanho da resposta não está intrinsecamente ligado ao tamanho da conversa (B).
#503Padrões de Arquitetura de IA Conversacional
Após três meses de sessões semanais, o histórico cresce para 85.000 tokens. Quando um usuário pergunta "O que concluímos sobre o tema do isolamento?", o assistente dá respostas genéricas em vez de referenciar discussões anteriores.
Qual a abordagem mais efetiva?
CorretaC) Embeddings semânticos com recuperação de trocas relevantes.
Busca semântica sobre o histórico de conversa é a única abordagem que escala para três meses de discussão sendo capaz de surfar trocas específicas relevantes sob demanda. Janela rolante (A) descartaria a maior parte do histórico. Sumarização progressiva (B) comprime discussões em abstrações que perdem as conclusões específicas que os usuários estão pedindo. Tags XML (D) exigem reestruturar todo conteúdo passado e não resolvem o problema de recuperação nessa escala.
#505Padrões de Arquitetura de IA Conversacional
Seu assistente usa um system prompt de persona "empreiteiro". Os primeiros turnos seguem as regras, mas no turno 7 o assistente passa a dar conselhos genéricos. O comprimento da conversa é de apenas 2.500 tokens.
Qual a causa mais provável?
CorretaC) Respostas acumuladas do assistente diluem a influência do system prompt.
Conforme respostas do assistente se acumulam no histórico, a proporção de texto refletindo as restrições comportamentais do system prompt diminui em relação ao volume crescente de conteúdo gerado pelo assistente. O modelo cada vez mais casa padrão com suas próprias saídas anteriores em vez do system prompt, agravando deriva mesmo em comprimentos curtos de tokens. O system prompt é incluído em toda chamada de API (D é falso isoladamente) e degradação de atenção (B) não opera em 2.500 tokens.
#506
Durante os testes, você observa que em sessões de exploração prolongadas (mais de 30 minutos), o agente começa a dar respostas inconsistentes sobre a estrutura de código que discutiu anteriormente. Os engenheiros relatam ter que repetir o contexto sobre módulos que já exploraram.
Qual é a abordagem mais eficaz para resolver isso?
CorretaA) Fazer o agente manter um arquivo de rascunho que registra as descobertas principais, consultando-o para perguntas subsequentes.
Correto. Um arquivo de rascunho descarrega as descobertas em um armazenamento durável que o agente pode reler sob demanda, dando a ele uma 'memória' estável independente de quão cheia a janela de contexto fique.
#507
Seu agente passou 25 minutos explorando o subsistema de renderização de um motor de jogos — lendo código de shaders, gerenciamento de buffers e a lógica de sincronização de frames. Um engenheiro agora pede que ele entenda como o motor de física se integra à renderização para sobreposições de depuração de colisão. Você nota que respostas recentes fazem referência a "padrões típicos de renderização" em vez das classes específicas VulkanPipeline e FrameGraph que ele descobriu antes.
Qual é a abordagem mais eficaz?
CorretaC) Resumir as descobertas principais de renderização e, então, criar um subagente para a exploração de física com esse resumo em seu contexto inicial.
Correto. Condense o que você aprendeu sobre renderização em um resumo compacto e, então, dê a um subagente novo esse resumo mais a tarefa de física — você preserva o sinal importante e escapa do contexto degradado.
#508
Um engenheiro pede ao agente para entender como funciona a camada de cache antes de adicionar um novo gatilho de invalidação de cache. Após as buscas iniciais com Grep, o agente identificou que a lógica de cache se espalha por 15 arquivos, incluindo decoradores, middleware e classes de serviço (~8.000 linhas no total).
Qual é o próximo passo mais eficaz para construir o entendimento gerenciando as restrições de contexto?
CorretaB) Analisar as importações e hierarquias de classe para identificar a classe base de cache, ler esse arquivo para entender a interface e, então, rastrear as implementações específicas de invalidação.
Correto. Comece pela raiz arquitetural (a interface) e, então, navegue apenas pelas implementações específicas que importam para a invalidação — leitura focada, baixo custo de contexto.
#510
Um cliente levanta três questões distintas durante uma sessão: uma consulta de reembolso (turnos 1-15), uma dúvida sobre assinatura (turnos 16-30) e uma atualização de método de pagamento (turnos 31-45). No turno 48, o cliente pergunta "O que aconteceu com o meu reembolso?" A conversa está se aproximando dos limites de contexto.
Qual estratégia mantém melhor a capacidade do agente de tratar todas as questões ao longo da sessão?
CorretaC) Resumir os turnos anteriores em uma descrição narrativa, preservando o histórico completo de mensagens apenas para a questão ativa.
Correto. A sumarização progressiva comprime tópicos estáveis já resolvidos, mantendo a thread ativa na íntegra — o padrão clássico para conversas longas com múltiplas questões próximas do limite de contexto.
#511
Seu agente chamou `lookup_order` várias vezes enquanto investigava os pedidos de devolução de um cliente. Cada resposta inclui mais de 40 campos (itens, detalhes de envio, informações de pagamento, histórico de status). As saídas das ferramentas agora representam a maior parte do contexto da conversa. O cliente menciona mais dois pedidos que deseja discutir.
Qual é a abordagem mais eficaz antes de fazer consultas adicionais?
CorretaA) Extrair apenas os campos relevantes para a devolução (itens, data da compra, prazo de devolução, status) de cada resposta de pedido existente, removendo os detalhes verbosos.
Correto. Mantenha os campos que importam para a tarefa e descarte o resto. Isso aborda diretamente o problema de inchaço do contexto antes de você adicionar mais duas consultas.