Test del módulo · Semana 10
Test: Evaluación y resolución de problemas de aplicaciones de IA generativa
Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.
1. Un equipo evalúa un servicio que resume incidencias técnicas comparando cada resumen con uno de referencia mediante coincidencia exacta de texto. Los resúmenes que los revisores consideran excelentes obtienen puntuaciones muy bajas porque usan otras palabras. Necesitan evaluar miles de resúmenes por semana midiendo si son correctos y completos respecto a la referencia. ¿Qué enfoque es el más adecuado?
2. Una empresa compara su modelo actual, alojado on-premises, con un modelo de Amazon Bedrock. Quiere usar la misma evaluación gestionada con LLM como juez para ambos, sin exponer el modelo on-premises a AWS. ¿Cómo debe evaluar el modelo on-premises?
3. Una evaluación RAG de Amazon Bedrock sobre el asistente de recursos humanos de una empresa da Context relevance alta en casi todas las preguntas, pero Faithfulness baja: las respuestas incluyen condiciones y cifras que no aparecen en los pasajes recuperados. ¿Qué acción ataca la causa?
4. En una evaluación RAG de una Knowledge Base de manuales técnicos, Faithfulness es alta, pero Context coverage es baja y muchas respuestas dicen «no dispongo de esa información», aunque el dato está en los manuales. Los fragmentos son de 2.000 tokens y mezclan varios procedimientos. ¿Qué acción es la más adecuada?
5. Un equipo quiere aislar la calidad de la recuperación de su RAG, sin evaluar todavía la respuesta generada, con un trabajo de Amazon Bedrock Evaluations de tipo «retrieve only». ¿Qué dos métricas integradas puede usar? (Elige dos)
6. Un hospital debe elegir entre dos modelos para redactar resúmenes de alta. La decisión exige que médicos del propio hospital valoren el tono y la adecuación clínica comparando las respuestas de ambos modelos lado a lado. La cuenta de AWS es nueva y quieren un servicio gestionado. ¿Qué deben usar?
7. Una aseguradora tiene un agente construido con LangGraph y desplegado en Amazon Bedrock AgentCore Runtime. Quiere medir de forma continua, sobre una muestra del tráfico real de producción, si el agente elige la herramienta correcta en cada paso y si le pasa los parámetros adecuados, sin construir su propio sistema de evaluación. ¿Qué debe hacer?
8. Una agencia de viajes evalúa su agente de reservas con AgentCore Evaluations. Necesita saber (1) si el agente completa las reservas de principio a fin en cada sesión y (2) si pasa correctamente las fechas y los códigos de aeropuerto a la API de reservas. ¿Qué dos evaluadores integrados debe usar? (Elige dos)
9. Varios equipos modifican con frecuencia los prompts de un asistente, y en dos ocasiones un cambio aparentemente inocuo hizo que el asistente inventase datos en producción. La empresa quiere impedir que un cambio que empeore la calidad llegue a producción, de forma automática. ¿Qué solución cumple el requisito?
10. Una aplicación usa un modelo de Amazon Bedrock on-demand y el equipo quiere pasar a un modelo nuevo exponiéndolo primero al 5 % de los usuarios, ampliar el porcentaje de forma gradual y volver atrás automáticamente si una alarma de CloudWatch de calidad o de errores salta. ¿Qué solución requiere MENOS desarrollo?
11. Un equipo duda entre dos versiones de prompt para su asistente de ventas. En el golden dataset ambas obtienen puntuaciones casi idénticas. Quieren saber cuál prefieren los clientes reales y cuál genera más solicitudes de presupuesto. ¿Qué deben hacer?
12. Una empresa quiere mejorar continuamente su asistente a partir de la experiencia de los usuarios. Ha añadido botones de pulgar arriba y abajo en la interfaz. ¿Qué dos acciones completan un mecanismo de evaluación centrado en el usuario útil? (Elige dos)
13. El modelo que usa una aplicación pasará a estado Legacy y el equipo debe migrar a una versión nueva. Quiere validar, antes y durante el cambio, que la tasa de alucinaciones no aumenta, que el comportamiento no cambia de forma inesperada y que los flujos típicos de usuario siguen funcionando. ¿Qué combinación es la más completa?
14. La dirección de una empresa quiere un informe semanal automático que compare, para cada modelo candidato, la calidad según las evaluaciones, el coste por respuesta y la latencia, con visualizaciones para personas no técnicas. Los resultados de los trabajos de Amazon Bedrock Evaluations se guardan en Amazon S3. ¿Qué solución cumple con el MENOR esfuerzo operativo?
15. Un equipo debe elegir entre tres modelos de Amazon Bedrock para clasificar y responder correos de clientes. Negocio fija un mínimo de calidad y pide la opción más rentable que lo cumpla, sin empeorar el tiempo de respuesta percibido. ¿Qué proceso de evaluación es el correcto?
16. Una aplicación en eu-central-1 recibía ThrottlingException en los picos. Tras conseguir un aumento de cuota de tokens por minuto, ya no aparecen, pero en momentos de demanda alta del servicio siguen apareciendo algunos ServiceUnavailableException (503). Los datos deben quedarse en la UE. ¿Qué acción es la adecuada?
17. Un servicio de análisis de informes anuales envía el documento completo a un modelo con ventana de 128.000 tokens. Con los informes más largos, la petición falla por superar la ventana de contexto. Reducir el contenido no es aceptable, porque el análisis debe cubrir todo el informe. ¿Qué solución es la más adecuada?
18. Un proceso que extrae datos de contratos a JSON con Amazon Bedrock falla de forma intermitente al parsear la respuesta. Los invocation logs muestran que en esos casos la respuesta termina a mitad de un objeto JSON y el campo stopReason vale max_tokens. ¿Qué debe hacer el equipo?
19. Un servicio en Amazon ECS genera informes largos con un modelo de Claude en Amazon Bedrock mediante boto3. Las peticiones que tardan más de un minuto fallan con un error de tiempo de espera de lectura en el cliente, mientras que las métricas de Bedrock no muestran errores del servidor. ¿Cuál es la solución recomendada?
20. Un equipo cambió, por coste, el modelo de embeddings que vectoriza las preguntas de los usuarios en su RAG propio sobre Aurora PostgreSQL con pgvector, manteniendo la misma dimensión. Los documentos se indexaron hace meses con el modelo anterior. No hay errores, pero la relevancia de los resultados ha caído drásticamente. ¿Cuál es la causa y la solución?
21. Tras reconfigurar el modelo de embeddings de una Knowledge Base personalizada para que genere vectores de 512 dimensiones, la ingesta falla y los logs de la Knowledge Base muestran documentos en estado INDEXING_FAILED. El índice vectorial se creó para vectores de 1.024 dimensiones. ¿Qué debe hacer el equipo?
22. Los prompts de una aplicación se editan directamente en el código y nadie sabe qué versión estaba en producción cuando empezaron las quejas de respuestas confusas. El equipo quiere poder comparar versiones de prompt de forma sistemática antes de cambiar la que usa producción. ¿Qué solución es la adecuada?
23. Una integración espera que el modelo devuelva un objeto JSON con campos concretos, pero a veces recibe el JSON precedido de texto explicativo o con campos que faltan, lo que rompe el procesamiento posterior. El modelo usado admite structured outputs en Amazon Bedrock. ¿Qué solución es la más robusta?
24. Un asistente empezó a mezclar instrucciones de dos plantillas de prompt distintas tras un despliegue. El equipo sospecha que las variables de las plantillas se están rellenando mal en algún paso del flujo, que incluye varias funciones Lambda. ¿Qué dos acciones ayudan a diagnosticar la confusión del prompt? (Elige dos)
25. Un banco aplica un guardrail de Amazon Bedrock a su asistente. Tras activarlo, muchas preguntas legítimas sobre «bloquear una tarjeta robada» o «denunciar un fraude» se rechazan, y la métrica InvocationsIntervened se ha disparado. El equipo de seguridad no acepta desactivar el guardrail. ¿Qué enfoque es el correcto?
26. Un agente construido con la API Converse llama a una herramienta de inventario implementada en AWS Lambda. Cuando la API de inventario falla, la Lambda lanza una excepción, el bucle del agente se rompe y el usuario recibe un error genérico; en otros casos el agente reintenta indefinidamente. ¿Qué cambio mejora el comportamiento?
27. Una Knowledge Base de políticas internas usa fragmentos de tamaño fijo de 3.000 tokens. Las respuestas son vagas y la evaluación RAG muestra Context relevance baja: los fragmentos recuperados contienen el dato, pero rodeado de mucho contenido de otros temas. ¿Qué acción corrige el problema de raíz?
28. AWS Cost Anomaly Detection avisa de que el gasto de Amazon Bedrock se ha triplicado en dos días en una cuenta que comparten varias aplicaciones y un agente. Model invocation logging está activo hacia CloudWatch Logs y las aplicaciones envían requestMetadata con su nombre. ¿Cuál es el primer paso más eficaz para encontrar la causa?
29. Una aplicación de resumen en tiempo real recibe ThrottlingException (429) de Amazon Bedrock en las horas punta. Usa maxTokens = 8.192, aunque sus resúmenes no pasan de 400 tokens, y los datos deben permanecer en la UE. ¿Qué dos acciones son adecuadas? (Elige dos)