Test del módulo · Semana 9
Test: Coste, rendimiento y monitorización de aplicaciones de IA generativa
Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.
1. Una empresa de telecomunicaciones tiene un asistente RAG en Amazon Bedrock con Amazon Nova Lite que atiende 100.000 preguntas al mes. Cada petición incluye un system prompt de 1.500 tokens, 5 fragmentos recuperados (2.000 tokens), el historial y la pregunta del usuario. Un guardrail de Amazon Bedrock con filtros de contenido y denied topics se aplica a la entrada completa de cada petición. El análisis de Cost Explorer muestra que Guardrails supone el 60 % del gasto de Bedrock. El equipo de seguridad exige seguir filtrando lo que escriben los usuarios. ¿Qué cambio reduce MÁS el coste sin debilitar ese control?
2. Un despacho de abogados ha creado una aplicación en la que el usuario carga un contrato de unos 50.000 tokens y hace entre 10 y 20 preguntas sobre él en una sesión de unos 15 minutos. Usan Claude Sonnet 4.5 con la API Converse. Las preguntas son distintas entre sí. Quieren reducir el coste de tokens de entrada y el tiempo hasta el primer token de las preguntas posteriores a la primera, con el menor cambio posible en la aplicación. ¿Qué deben hacer?
3. Un equipo activó prompt caching explícito en su chatbot. El system prompt empieza con la línea «Fecha y hora actuales: …» y el nombre del usuario, seguido de 6.000 tokens de instrucciones y políticas que no cambian, y termina con un cachePoint. Tras una semana, la respuesta de Converse muestra siempre cacheReadInputTokens = 0 y cacheWriteInputTokens mayor que cero. ¿Cuál es la causa y la solución?
4. Una startup usa Claude Haiku 4.5 en Amazon Bedrock para un agente cuyo system prompt más las definiciones de herramientas suman unos 3.000 tokens. Han añadido un cachePoint al final de las herramientas, pero ni cacheWriteInputTokens ni cacheReadInputTokens aparecen con valores mayores que cero, y la petición no devuelve ningún error. ¿Por qué?
5. Un marketplace necesita generar cada noche descripciones de 2 millones de productos nuevos con un modelo de Amazon Bedrock. Los resultados se usan a la mañana siguiente. No hay herramientas ni salida con esquema estricto. El equipo quiere la opción MÁS rentable y con LEAST operational overhead, sin gestionar throttling ni reintentos.
6. Un equipo evalúa mover a batch inference un proceso diario que hoy invoca Amazon Bedrock on-demand. ¿Qué dos características del proceso actual impiden usar batch inference tal cual? (Elige dos)
7. Una empresa de medios tiene un pipeline de enriquecimiento de artículos que llama síncronamente a la API Converse de Amazon Bedrock y usa tool calling para consultar un tesauro interno. El pipeline tolera esperas de varios minutos y ya reintenta con backoff. Dirección pide reducir a la mitad el coste de inferencia sin rediseñar la integración hacia ficheros en S3. ¿Qué deben hacer?
8. Un banco atiende con Amazon Bedrock un chat de clientes y, en la misma cuenta, varios procesos internos. En horas punta el chat sufre latencias altas por la contención de capacidad. El banco quiere que las peticiones del chat se atiendan antes que las demás, está dispuesto a pagar más por ellas y no quiere firmar compromisos de capacidad ni gestionar reservas. ¿Qué solución cumple?
9. Una empresa de software recibe en inglés una mezcla de preguntas sencillas y complejas sobre su producto. Usan un modelo grande de Anthropic en Amazon Bedrock para todo. Quieren enviar automáticamente las preguntas sencillas a un modelo más barato de la misma familia sin perder calidad perceptible, con el MENOR esfuerzo de desarrollo posible. ¿Qué solución recomiendas?
10. Una aseguradora tiene un asistente conversacional cuyo coste mensual crece mucho más que el número de usuarios. El análisis de los invocation logs muestra que las conversaciones largas envían en cada turno todo el historial y 10 fragmentos recuperados, y que la calidad medida con su golden dataset no mejora a partir de 4 fragmentos. ¿Qué dos acciones reducen el coste de tokens sin bajar la calidad medida? (Elige dos)
11. El portal de ayuda de una aerolínea recibe miles de preguntas al día; alrededor del 40 % son reformulaciones de las mismas 200 dudas («¿cuánto equipaje puedo llevar?», «¿qué peso admite la maleta de mano?»). Las respuestas son iguales para todos los usuarios y cambian pocas veces al mes. Quieren evitar invocaciones al modelo y reducir la latencia de esas preguntas. ¿Qué solución es la más adecuada?
12. Tras implantar una caché semántica con umbral de similitud 0,55, los usuarios de una tienda online se quejan de que al preguntar «¿puedo devolver un producto rebajado?» reciben la respuesta sobre «¿puedo devolver un producto defectuoso?». ¿Qué ajuste resuelve el problema manteniendo el beneficio de la caché?
13. Una aplicación de chat interna genera respuestas de unos 800 tokens con Amazon Bedrock. La métrica TimeToFirstToken es de unos 900 ms, pero InvocationLatency ronda los 12 segundos y los usuarios abandonan porque la pantalla se queda en blanco hasta que llega la respuesta completa. ¿Qué cambio mejora MÁS la experiencia con el menor impacto en coste y calidad?
14. Un asistente técnico envía en cada petición un manual estático de 40.000 tokens más 20 fragmentos recuperados de 500 tokens. El tiempo hasta el primer token es de varios segundos y es el principal problema. La evaluación muestra que la calidad es la misma con 5 fragmentos bien ordenados que con 20. ¿Qué dos acciones reducen el TTFT? (Elige dos)
15. Una empresa estadounidense ofrece un autocompletado de código que invoca Claude 3.5 Haiku en Amazon Bedrock desde us-east-2. Necesita la menor latencia posible y está dispuesta a pagar un precio algo mayor por token. No quiere cambiar de modelo. ¿Qué configuración debe aplicar?
16. Un flujo de análisis de contratos en AWS Step Functions ejecuta en serie tres llamadas independientes a Amazon Bedrock (extraer cláusulas, detectar riesgos y resumir), cada una de unos 6 segundos, y después una cuarta que combina los resultados. El negocio exige bajar el tiempo total de 24 segundos sin cambiar los modelos. ¿Qué cambio es el más eficaz?
17. Una empresa sanitaria europea usa Amazon Nova Pro on-demand en eu-west-1 y recibe ThrottlingException en los picos de tráfico, que son impredecibles. Los datos no pueden salir de la UE. La dirección no quiere compromisos de capacidad. ¿Qué solución aumenta el throughput disponible cumpliendo los requisitos?
18. Una aplicación configura maxTokens = 8.192 en todas las llamadas a un modelo de Amazon Bedrock, aunque las respuestas reales rondan los 300 tokens. En horas punta recibe ThrottlingException por tokens por minuto, pese a que la suma de tokens facturados está muy por debajo de la cuota. ¿Cuál es la explicación más probable y la acción recomendada?
19. Un equipo aloja un LLM de código abierto en un endpoint en tiempo real de Amazon SageMaker AI con auto scaling por la métrica SageMakerVariantInvocationsPerInstance. Las peticiones duran entre 5 y 30 segundos y, ante picos, el endpoint escala tarde y las colas de peticiones crecen. ¿Qué cambio mejora la reacción del escalado a este tipo de tráfico?
20. Una Knowledge Base de Amazon Bedrock sobre Amazon OpenSearch Serverless responde bien a preguntas conceptuales, pero falla cuando el usuario pregunta por códigos de pieza exactos como «XR-2231» o por siglas internas. Los documentos contienen esos códigos. ¿Qué cambio mejora la relevancia con el menor esfuerzo?
21. Un proceso extrae campos de facturas a JSON con un modelo de Amazon Bedrock. Con temperature = 0,9 y topP = 0,95, la misma factura produce valores distintos en ejecuciones sucesivas y a veces campos inventados. El equipo quiere respuestas deterministas y fieles. ¿Qué ajuste es el más adecuado?
22. El área de cumplimiento de una entidad financiera exige poder reconstruir qué prompt exacto envió cada empleado a Amazon Bedrock y qué respuesta recibió, durante 5 años. AWS CloudTrail está activo en todas las regiones, pero en los eventos de InvokeModel no aparece el contenido. ¿Qué deben configurar?
23. Tres unidades de negocio de una empresa comparten la misma cuenta de AWS y el mismo modelo de Amazon Bedrock. Finanzas quiere ver en AWS Cost Explorer el gasto de Bedrock de cada unidad, con el MENOR esfuerzo. ¿Qué dos acciones lo consiguen? (Elige dos)
24. Un agente desplegado en Amazon Bedrock AgentCore Runtime tarda a veces 25 segundos en responder. La métrica InvocationLatency del modelo es normal. El equipo necesita saber qué paso (llamada al modelo, herramienta de CRM, consulta a la base de conocimiento o reintentos) añade el tiempo. ¿Qué debe usar?
25. Un equipo quiere enterarse en cuestión de minutos si un cambio de prompt o un agente en bucle dispara el consumo de tokens de salida de su aplicación en Amazon Bedrock. El tráfico tiene un patrón diario y semanal muy marcado, así que un umbral fijo produciría muchas falsas alarmas. ¿Qué solución cumple?
26. Una empresa quiere un sistema de observabilidad completo para su asistente de IA generativa en Amazon Bedrock: métricas operativas, detalle de cada interacción, detección de caídas funcionales antes que los usuarios y una métrica de satisfacción de negocio. ¿Qué tres elementos forman parte de la solución? (Elige tres)
27. Un equipo descubre que su Knowledge Base de Amazon Bedrock no encuentra información de algunos PDF que están en el bucket de S3 de origen. Los trabajos de ingesta terminan como completados. Necesitan saber, documento a documento, cuáles fallaron y por qué, y vigilarlo de forma continua. ¿Qué deben hacer?
28. Una empresa con una cuenta de AWS nueva despliega en octubre de 2026 un modelo propio en un endpoint en tiempo real de Amazon SageMaker AI. Quiere detectar la deriva en las entradas y en la calidad de las respuestas. Un consultor propone Amazon SageMaker Model Monitor. ¿Qué deberías recomendar?
29. Un agente de atención al cliente invoca varias herramientas, entre ellas una API de CRM expuesta a través de AgentCore Gateway. En un incidente, un error de razonamiento hizo que el agente llamase al CRM cientos de veces en una conversación. El equipo quiere detectar automáticamente patrones de uso de herramientas anómalos, teniendo en cuenta que el uso normal varía por horas. ¿Qué solución cumple?