#16
Tu pipeline de investigación multiagente se cayó después de procesar 12 de 28 documentos. El agente de búsqueda web había identificado fuentes relevantes, el agente de análisis de documentos había completado parcialmente la extracción, y el sintetizador había comenzado a identificar patrones. Necesitas reanudar el procesamiento sin repetir trabajo ni perder la fidelidad de los hallazgos previos.
¿Qué enfoque de gestión de estado equilibra mejor la fidelidad de la información con la eficiencia de contexto al restaurar el estado de los agentes?
CorrectaC) Que cada agente persista un reporte estructurado en una ubicación conocida. Al reanudar, el coordinador carga los reportes e inyecta el estado relevante en los prompts de los agentes.
Correcto. Los reportes estructurados por agente conservan la fidelidad (los hallazgos, con esquema), permiten que el coordinador mantenga el control de la orquestación y mantienen enfocado el contexto de cada subagente. Es el patrón de coordinador + artefacto compacto.
#25
El monitoreo en producción muestra que las consultas de seguimiento como "resume lo que aprendimos sobre las tendencias del mercado" tardan sistemáticamente más de 40 segundos. La investigación revela que el coordinador genera el subagente de síntesis para cada solicitud de resumen, pasándole más de 80K tokens de hallazgos acumulados. El coordinador ya tiene esos hallazgos en su contexto por haber orquestado la investigación.
¿Cuál es la forma más eficaz de mejorar el tiempo de respuesta para estos resúmenes de seguimiento?
CorrectaB) Que el coordinador maneje las solicitudes de resumen sencillas directamente usando su contexto existente, reservando la generación de subagentes para los análisis complejos.
Correcto. Si el coordinador ya tiene los hallazgos, generar un subagente para reingerir 80K tokens es puro sobrecosto. Deja que el coordinador responda él mismo los seguimientos simples.
#29
Un ingeniero usó el agente ayer para analizar un módulo de autenticación heredado e identificó dos enfoques de refactorización distintos: extraer un microservicio frente a refactorizar en el sitio. Hoy quiere explorar ambos enfoques en profundidad —haciendo que el agente proponga cambios de código específicos para cada uno— antes de decidir cuál implementar.
¿Cuál es la forma más efectiva de estructurar esta exploración?
CorrectaD) Usar `fork_session` para crear dos ramas a partir del análisis de ayer, explorando un enfoque en cada bifurcación.
Correcto. Bifurcar desde la sesión de ayer le da a cada enfoque su propio contexto independiente a partir de la misma base de análisis: limpio, paralelo y sin contaminación.
#30
Un ingeniero le pide a tu agente que identifique las rutas de código sin pruebas en un módulo heredado de procesamiento de pagos que abarca 45 archivos. Tras leer los primeros 8 archivos fuente, las respuestas del agente se vuelven notablemente menos precisas: olvida patrones de código discutidos previamente y aún no ha localizado todos los archivos de prueba ni rastreado los flujos críticos de pago.
¿Cuál es el enfoque más efectivo para completar esta investigación?
CorrectaB) Generar subagentes para investigar preguntas específicas (por ejemplo, "encuentra todos los archivos de prueba para el procesamiento de pagos", "rastrea las dependencias del flujo de reembolso") mientras el agente principal coordina los hallazgos y preserva la comprensión de alto nivel.
Correcto. Delega investigaciones bien acotadas a subagentes con contexto fresco, mientras el agente principal conserva la visión arquitectónica general. Este es el patrón para escalar la exploración más allá de una sola ventana de contexto.
#33
Tu agente ha analizado un módulo de servicio complejo: leyó 23 archivos fuente, rastreó flujos de solicitudes e identificó patrones de manejo de errores. Un desarrollador quiere comparar dos estrategias de pruebas antes de comprometerse con una: pruebas de extremo a extremo con servicios externos simulados frente a pruebas de snapshot que capturan las salidas esperadas. Necesita desarrollar ambos enfoques de forma independiente para evaluar las compensaciones.
¿Cómo deberías gestionar las sesiones?
CorrectaB) Reanudar la sesión de análisis con `fork_session` habilitado, creando una rama separada para cada estrategia de pruebas.
Correcto. Bifurcar le da a cada estrategia su propio contexto independiente a partir de la base de análisis exacta: sin contaminación cruzada, sin reanálisis.
#35
Un cliente regresa 4 horas después de su sesión inicial sobre la misma disputa de facturación. La sesión anterior de 32 turnos contiene resultados de `lookup_order` que muestran "Status: PENDING, Expected resolution: 24-48 hours." En las pruebas, observas que al reanudar sesiones con resultados de herramienta obsoletos, el agente a menudo hace referencia a los datos desactualizados en sus respuestas (por ejemplo, "Veo que tu reembolso aún se está procesando") incluso después de que llamadas frescas a la herramienta devuelven información distinta.
¿Qué enfoque maneja de forma más confiable a los clientes que regresan?
CorrectaB) Iniciar una nueva sesión, inyectar un resumen estructurado de la interacción previa (tipo de problema, acciones tomadas, estado de resolución) y luego hacer llamadas frescas a las herramientas antes de interactuar.
Correcto. Una sesión limpia con un resumen mantiene la continuidad narrativa y a la vez garantiza que el agente no razone sobre resultados de herramienta obsoletos.
#255Generación de código con Claude Code
Tu equipo creó un skill `/analyze-codebase` que realiza análisis profundo de código—escaneo de dependencias, conteos de cobertura de pruebas y métricas de calidad de código. Después de ejecutar el comando, los miembros del equipo reportan que Claude se vuelve menos receptivo en la sesión y pierde el contexto de la tarea original.
¿Cómo lo corriges más efectivamente manteniendo capacidades completas de análisis?
CorrectaA) Agregar `context: fork` en el frontmatter del skill para ejecutar el análisis en un contexto de subagente aislado.
`context: fork` ejecuta el análisis en un contexto de subagente aislado para que la salida grande no contamine la ventana de contexto de la sesión principal y Claude no pierda el rastro de la tarea original. Preserva la capacidad completa de análisis manteniendo la sesión principal receptiva.
#263Generación de código con Claude Code
Creas un skill personalizado `/explore-alternatives` que tu equipo usa para hacer brainstorming y evaluar enfoques de implementación antes de elegir uno. Los desarrolladores reportan que después de ejecutar el skill, las respuestas posteriores de Claude son influenciadas por la discusión de alternativas—a veces referenciando enfoques rechazados o reteniendo contexto de exploración que interfiere con la implementación real.
¿Cómo deberías configurar este skill más efectivamente?
CorrectaB) Agregar `context: fork` en el frontmatter del skill.
`context: fork` ejecuta el skill en un contexto de subagente aislado para que las discusiones de exploración no contaminen el historial de conversación principal. Esto previene que enfoques rechazados y el contexto de brainstorming influyan en el trabajo de implementación posterior.
#362Claude Code para Integración Continua
Tu equipo usa Claude Code para generar sugerencias de código, pero notas un patrón: problemas no obvios—optimizaciones de rendimiento que rompen casos límite, limpiezas que cambian inesperadamente el comportamiento—solo se detectan cuando otro miembro del equipo revisa el PR. El razonamiento de Claude durante la generación muestra que consideró estos casos pero concluyó que su enfoque era correcto. ¿Qué enfoque aborda directamente la causa raíz de esta limitación de auto-revisión?
¿Qué enfoque aborda directamente la causa raíz?
CorrectaA) Ejecutar una segunda instancia independiente de Claude Code para revisar los cambios sin acceso al razonamiento del generador.
Una segunda instancia independiente de Claude Code sin acceso al razonamiento del generador aborda directamente la causa raíz al evitar el sesgo de confirmación. Esta perspectiva de "ojos frescos" refleja la revisión por pares humana, donde otro revisor detecta problemas que el autor racionalizó.
#368Claude Code para Integración Continua
Tu revisión automatizada genera sugerencias de casos de prueba para cada PR. Revisando un PR que agrega seguimiento de finalización de cursos, Claude sugiere 10 casos de prueba, pero la retroalimentación del desarrollador muestra que 6 duplican escenarios ya cubiertos por la suite de pruebas existente. ¿Qué cambio reduce más efectivamente las sugerencias duplicadas?
¿Qué cambio es más efectivo?
CorrectaA) Incluir el archivo de pruebas existente en el contexto para que Claude pueda determinar qué escenarios ya están cubiertos.
Incluir el archivo de pruebas existente corrige la causa raíz de la duplicación: Claude solo puede evitar sugerir escenarios ya cubiertos si sabe qué pruebas ya existen. Esto le da a Claude la información necesaria para proponer pruebas genuinamente nuevas y valiosas.
#369Claude Code para Integración Continua
Después de que una revisión automatizada inicial identifica 12 hallazgos, un desarrollador hace commits nuevos para abordar problemas. Al volver a ejecutar la revisión se producen 8 hallazgos, pero los desarrolladores reportan que 5 duplican comentarios anteriores sobre código que ya fue corregido en los nuevos commits. ¿Cuál es la forma más efectiva de eliminar esta retroalimentación redundante manteniendo la exhaustividad?
¿Cuál es la forma más efectiva de eliminar la retroalimentación redundante?
CorrectaD) Incluir los hallazgos de revisión anteriores en el contexto e instruir a Claude para reportar solo problemas nuevos o aún sin resolver.
Incluir los hallazgos de revisión previos en el contexto permite a Claude distinguir problemas nuevos de los ya abordados en commits recientes. Esto preserva la exhaustividad de la revisión mientras usa el razonamiento de Claude para evitar retroalimentación redundante sobre código corregido.
#494Sistema de investigación multiagente
El monitoreo de producción muestra calidad de síntesis inconsistente. Cuando los resultados agregados son ~75K tokens, el agente de síntesis cita confiablemente información de los primeros 15K tokens (titulares/fragmentos de búsqueda web) y los últimos 10K tokens (conclusiones del análisis de documentos), pero a menudo se pierde hallazgos críticos en los 50K tokens del medio—incluso cuando responden directamente a la pregunta de investigación. ¿Cómo deberías reestructurar la entrada agregada?
¿Cómo deberías reestructurar la entrada agregada?
CorrectaC) Colocar un resumen de hallazgos clave al inicio de la entrada agregada y organizar los resultados detallados con encabezados de sección explícitos para una navegación más fácil.
Poner un resumen de hallazgos clave al inicio aprovecha los efectos de primacía para que la información crítica esté en la posición procesada más confiablemente. Agregar encabezados de sección explícitos en todo el documento ayuda al modelo a navegar y atender el contenido del medio, mitigando directamente el fenómeno "perdido en el medio".
#495Sistema de investigación multiagente
En pruebas, la salida combinada del agente de búsqueda web (85K tokens incluyendo contenido de página) y del agente de análisis de documentos (70K tokens incluyendo cadenas de pensamiento) totaliza 155K tokens, pero el agente de síntesis funciona mejor con entradas por debajo de 50K tokens. ¿Qué solución es más efectiva?
¿Qué solución es más efectiva?
CorrectaA) Modificar los agentes previos para que devuelvan datos estructurados (hechos clave, citas, puntuaciones de relevancia) en lugar de contenido y razonamiento verbosos.
Modificar los agentes previos para que devuelvan datos estructurados corrige la causa raíz reduciendo el volumen de tokens en la fuente mientras preserva la información esencial. Evita pasar contenido de página voluminoso y trazas de razonamiento que inflan tokens sin mejorar el paso de síntesis.
#496Generación de código con Claude Code
Estás agregando wrappers de manejo de errores alrededor de llamadas a APIs externas en una base de código de 120 archivos. El trabajo tiene tres fases: (1) descubrir todos los sitios de llamada y patrones, (2) diseñar colaborativamente el enfoque de manejo de errores, y (3) implementar wrappers de forma consistente. En la Fase 1, Claude genera salida grande listando cientos de sitios de llamada con contexto, llenando rápidamente la ventana de contexto antes de que termine el descubrimiento.
¿Qué enfoque es más efectivo para completar la tarea manteniendo la consistencia de implementación?
CorrectaA) Usar un subagente Explore para la Fase 1 para aislar la salida verbosa de descubrimiento y devolver un resumen, luego continuar las Fases 2–3 en la conversación principal.
Un subagente Explore aísla la salida verbosa de descubrimiento en un contexto separado y devuelve solo un resumen conciso a la conversación principal. Esto preserva la ventana de contexto principal para las fases de diseño colaborativo e implementación consistente donde el contexto retenido es más valioso.
#497Agente de soporte al cliente
Los registros de producción muestran un patrón: los clientes referencian montos específicos (por ejemplo, "el descuento del 15% que mencioné"), pero el agente responde con valores incorrectos. La investigación muestra que estos detalles fueron mencionados 20+ turnos atrás y condensados en resúmenes vagos como "se discutieron precios promocionales". ¿Qué corrección es más efectiva?
¿Qué corrección es más efectiva?
CorrectaC) Extraer hechos transaccionales (montos, fechas, números de pedido) en un bloque persistente de "hechos del caso" incluido en cada prompt fuera del historial resumido.
La resumición pierde inherentemente detalles precisos. Extraer hechos transaccionales en un bloque estructurado de "hechos del caso" fuera del historial resumido preserva información crítica para que esté disponible confiablemente en cada prompt independientemente de cuántos turnos hayan sido resumidos.
#500Patrones de arquitectura de IA conversacional
Después de una sesión de cocina de 40 minutos, la conversación alcanza 78,000 tokens. El historial incluye alergias, escalado de recetas, términos de cocina aclarados y discusión general. Debes reducir tokens preservando información importante.
¿Qué enfoque equilibra mejor la preservación con la reducción de tokens?
CorrectaC) Extraer datos estructurados críticos (alergias, cantidades, preferencias), resumir la discusión general y mantener los intercambios recientes literalmente.
El enfoque híbrido preserva la información de mayor valor al menor costo. Los hechos críticos como alergias y cantidades de recetas se extraen en un bloque estructurado compacto (previniendo la pérdida de precisión que ocurre durante la resumición), la discusión general se resume, y los intercambios recientes se mantienen literalmente para la coherencia conversacional. Las opciones A y B arriesgan perder información dietética crítica; D es excesiva para una sola sesión de cocina.
#501Patrones de arquitectura de IA conversacional
Los usuarios reportan que durante conversaciones extendidas el asistente pierde el rastro de temas y preferencias anteriores. Tu implementación actual conserva solo los últimos 25 pares de mensajes.
¿Cuál es la solución más efectiva?
CorrectaA) Enfoque híbrido: resumir mensajes más antiguos mientras se mantienen los recientes literalmente.
El enfoque híbrido aborda ambas dimensiones del problema: retener contexto reciente exacto (crítico para la coherencia conversacional) mientras se mantiene una representación comprimida de preferencias anteriores. Aumentar la ventana (C) simplemente retrasa el mismo problema. La búsqueda vectorial (B) puede perder contexto importante que no es semánticamente similar a la consulta actual.
#502Patrones de arquitectura de IA conversacional
Los usuarios reportan que la latencia aumenta y los costos suben cuando las conversaciones superan los 50 turnos.
¿Cuál es la causa principal?
CorrectaA) Todo el historial de conversación se incluye con cada solicitud a la API.
La API de Claude es completamente sin estado—cada solicitud debe incluir el historial completo de conversación en el array `messages`. A medida que las conversaciones crecen, cada solicitud lleva más tokens, lo que aumenta directamente tanto la latencia de procesamiento como el costo. El modelo no mantiene ningún estado interno entre llamadas (D es falso).
#503Patrones de arquitectura de IA conversacional
Después de tres meses de sesiones semanales, el historial de conversación crece a 85,000 tokens. Cuando un usuario pregunta "¿Qué concluimos sobre el tema del aislamiento?", el asistente da respuestas genéricas en lugar de referenciar discusiones anteriores.
¿Cuál es el enfoque más efectivo?
CorrectaC) Embeddings semánticos con recuperación de intercambios relevantes.
La búsqueda semántica sobre el historial de conversación es el único enfoque que escala a tres meses de discusión mientras puede sacar a la luz intercambios relevantes específicos a demanda. El truncamiento deslizante (A) descartaría la mayoría del historial. La resumición progresiva (B) comprime las discusiones en abstracciones que pierden las conclusiones específicas que los usuarios buscan.
#505Patrones de arquitectura de IA conversacional
Tu asistente usa un prompt del sistema con persona de contratista. Los turnos iniciales siguen las reglas, pero para el turno 7 el asistente da consejos genéricos. La longitud de conversación es solo 2,500 tokens.
¿Cuál es la causa más probable?
CorrectaC) Las respuestas acumuladas del asistente diluyen la influencia del prompt del sistema.
A medida que las respuestas del asistente se acumulan en el historial de conversación, la proporción de texto que refleja las restricciones de comportamiento del prompt del sistema disminuye en relación al cuerpo creciente de contenido generado por el asistente. El modelo cada vez más sigue el patrón de sus propias salidas anteriores en lugar de las instrucciones del prompt del sistema, compounding la deriva incluso en longitudes de token cortas.
#506
Durante las pruebas, observas que en sesiones de exploración prolongadas (más de 30 minutos), el agente comienza a dar respuestas inconsistentes sobre la estructura de código que discutió antes. Los ingenieros reportan tener que repetir contexto sobre módulos que ya habían explorado.
¿Cuál es el enfoque más efectivo para abordar esto?
CorrectaA) Hacer que el agente mantenga un archivo de notas (scratchpad) que registre los hallazgos clave, y consultarlo para las preguntas posteriores.
Correcto. Un scratchpad traslada los hallazgos a un almacenamiento duradero que el agente puede releer cuando lo necesite, dándole una 'memoria' estable independiente de qué tan saturada esté la ventana de contexto.
#507
Tu agente ha dedicado 25 minutos a explorar el subsistema de renderizado de un motor de juego: leyendo código de shaders, gestión de búferes y lógica de sincronización de fotogramas. Un ingeniero ahora le pide que entienda cómo se integra el motor de física con el renderizado para las superposiciones de depuración de colisiones. Notas que las respuestas recientes hacen referencia a "patrones de renderizado típicos" en lugar de las clases específicas VulkanPipeline y FrameGraph que descubrió antes.
¿Cuál es el enfoque más efectivo?
CorrectaC) Resumir los hallazgos clave del renderizado y luego generar un subagente para la exploración de la física con ese resumen en su contexto inicial.
Correcto. Condensa lo que has aprendido sobre el renderizado en un resumen compacto, y luego dale a un subagente nuevo ese resumen más la tarea de física: preservas la señal importante y escapas del contexto degradado.
#508
Un ingeniero le pide al agente que entienda cómo funciona la capa de caché antes de agregar un nuevo disparador de invalidación de caché. Tras las búsquedas iniciales con Grep, el agente ha identificado que la lógica de caché abarca 15 archivos, incluyendo decoradores, middleware y clases de servicio (~8000 líneas en total).
¿Cuál es el siguiente paso más efectivo para construir comprensión a la vez que se gestionan las restricciones de contexto?
CorrectaB) Analizar las importaciones y jerarquías de clases para identificar la clase base de caché, leer ese archivo para entender la interfaz y luego rastrear las implementaciones específicas de invalidación.
Correcto. Empieza desde la raíz arquitectónica (la interfaz) y luego navega solo las implementaciones específicas que importan para la invalidación: lectura enfocada, bajo costo de contexto.
#510
Un cliente plantea tres problemas separados durante una sesión: una consulta de reembolso (turnos 1-15), una pregunta sobre suscripción (turnos 16-30) y una actualización del método de pago (turnos 31-45). En el turno 48, el cliente pregunta "¿Qué pasó con mi reembolso?" La conversación se está acercando a los límites de contexto.
¿Qué estrategia mantiene mejor la capacidad del agente para atender todos los problemas a lo largo de la sesión?
CorrectaC) Resumir los turnos anteriores en una descripción narrativa, preservando el historial completo de mensajes solo para el problema activo.
Correcto. El resumen progresivo comprime los temas resueltos y estables mientras mantiene el hilo activo textualmente: el patrón clásico para conversaciones largas con múltiples problemas cerca del límite de contexto.
#511
Tu agente ha llamado a `lookup_order` varias veces mientras investiga las solicitudes de devolución de un cliente. Cada respuesta incluye más de 40 campos (artículos, detalles de envío, información de pago, historial de estado). Las salidas de las herramientas ahora representan la mayor parte del contexto de la conversación. El cliente menciona dos pedidos más que quiere discutir.
¿Cuál es el enfoque más efectivo antes de hacer búsquedas adicionales?
CorrectaA) Extraer solo los campos relevantes para la devolución (artículos, fecha de compra, ventana de devolución, estado) de cada respuesta de pedido existente, eliminando los detalles verbosos.
Correcto. Conserva los campos que importan para la tarea y descarta el resto. Esto aborda directamente el problema de saturación del contexto antes de agregar dos búsquedas más.