Test del módulo · Semana 2
Test: Datos para modelos fundacionales, embeddings y almacenes vectoriales
Preguntas al estilo del examen. Contesta, pulsa «Comprobar» y lee siempre la explicación, también cuando aciertes: ahí está lo que de verdad se aprende.
1. Una empresa de seguros vuelca cada noche en S3 un CSV con 2 millones de fichas de pólizas que luego se convierten en texto para una base de conocimiento. A veces llegan ficheros con identificadores duplicados, campos de descripción vacíos o muchas menos filas de lo habitual, y eso degrada las respuestas del asistente. Quieren reglas declarativas, detección de anomalías frente a días anteriores y alertas, con el MENOR esfuerzo operativo. ¿Qué solución deben usar?
2. Un pipeline de Step Functions procesa documentos de distintas filiales antes de indexarlos. El equipo de operaciones quiere saber en minutos si una filial empieza a enviar documentos defectuosos (PDF escaneados sin texto, textos en idiomas no soportados, ficheros vacíos) para cortar esa fuente antes de que contamine el índice. ¿Qué diseño lo consigue?
3. Un analista de negocio sin experiencia en programación debe explorar un conjunto de datos tabular de reclamaciones, detectar valores ausentes, atípicos y duplicados, y aplicar transformaciones antes de usarlo en un proyecto de IA generativa. ¿Qué herramienta de AWS encaja MEJOR?
4. Un banco recibe cada día miles de solicitudes de hipoteca escaneadas en PDF de entre 20 y 80 páginas, con formularios y tablas. Necesita extraer pares clave-valor y tablas con su estructura para alimentar un proceso de revisión con un FM. ¿Qué operación de Amazon Textract debe usar?
5. Una aseguradora quiere una única solución gestionada que extraiga campos de negocio definidos por ella (número de póliza, fecha del siniestro, importe reclamado) de documentos PDF, fotos de daños y grabaciones de llamadas, sin encadenar varios servicios ni entrenar modelos. ¿Qué servicio encaja MEJOR?
6. Un centro de atención al cliente en Madrid graba las llamadas (en español de España) y quiere transcribirlas en lotes cada noche, distinguiendo al agente del cliente, para que un FM genere resúmenes. El departamento legal exige que ningún dato personal llegue al FM. ¿Qué diseño cumple los requisitos?
7. Un equipo debe limpiar, deduplicar y convertir a texto 30 millones de documentos históricos con librerías de Python específicas que tardan varios minutos por lote y necesitan más de 10 GB de memoria. El trabajo se repite una vez al trimestre. ¿Qué servicio es el MÁS adecuado para ejecutar este procesamiento?
8. Una empresa de retail quiere que un asistente responda sobre su catálogo a partir de fotos de productos, fichas técnicas en PDF y vídeos de demostración. Está diseñando el pipeline de ingesta. ¿Qué afirmaciones son correctas? (Elige dos)
9. Un desarrollador envía con la Converse API un contrato en PDF para que Claude extraiga cláusulas. La llamada falla con ValidationException. El mensaje tiene rol user y un único bloque de contenido de tipo document con format pdf, name y source con los bytes del fichero de 3 MB. ¿Cuál es la causa MÁS probable?
10. Una aplicación de chat guarda el historial en DynamoDB y lo envía a Bedrock con la Converse API. Tras varios turnos, algunas llamadas fallan con ValidationException. Al revisar los logs, ven que en esas conversaciones hay dos mensajes seguidos con rol user porque el usuario envió dos preguntas antes de recibir respuesta. ¿Qué corrección aplica el formato conversacional correcto?
11. Un equipo debe clasificar 500.000 correos históricos con un modelo de Bedrock mediante inferencia por lotes para reducir costes. ¿Cómo deben preparar los datos de entrada?
12. Una consultora indexa informes de proyectos para un asistente interno. Los usuarios suelen preguntar por cliente, ciudad y fecha («proyectos con Iberdrola en Bilbao en 2025»), pero los informes no tienen esos datos estructurados y las búsquedas semánticas mezclan resultados. ¿Qué mejora de la entrada resuelve MEJOR el problema?
13. Las transcripciones automáticas de reuniones llegan sin puntuación, con muletillas y nombres de productos mal escritos, y el FM genera resúmenes pobres. El equipo quiere mejorar la calidad y consistencia de la entrada sin reentrenar modelos. ¿Qué combinación es adecuada? (Elige dos)
14. Un fabricante indexa manuales técnicos de 300 páginas. Los técnicos preguntan por códigos de error muy concretos, pero para responder bien el modelo necesita el procedimiento completo de la sección. Con chunks fijos de 300 tokens la búsqueda acierta, pero las respuestas quedan incompletas; con chunks de 2.000 tokens las respuestas son completas, pero la búsqueda empeora. Usan Bedrock Knowledge Bases con OpenSearch Serverless. ¿Qué estrategia de chunking resuelve el dilema?
15. Un equipo configura una base de conocimiento de Bedrock con S3 Vectors como almacén y chunking jerárquico con padres de 6.000 tokens e hijos de 3.000. La ingesta falla en muchos documentos. Además, observan que al pedir 10 resultados reciben menos. ¿Qué explica ambos comportamientos? (Elige dos)
16. Una plataforma de noticias tiene 80 millones de chunks vectorizados con Titan Text Embeddings V2 a 1.024 dimensiones en OpenSearch. El coste de memoria del clúster se ha disparado. Las pruebas de recuperación con 500 preguntas reales muestran que a 256 dimensiones el recall apenas baja. ¿Qué deben hacer para reducir el coste?
17. Una empresa española tiene su documentación en español, pero una parte de los empleados pregunta en inglés. Con su modelo de embeddings actual, optimizado para inglés, las búsquedas en español dan resultados pobres. Necesita procesar los datos en la UE desde eu-central-1. ¿Qué opción es la MÁS adecuada?
18. Un equipo usa Cohere Embed v3 y observa que la recuperación es peor de lo esperado. Revisando el código, ven que usan input_type search_query tanto al indexar los documentos como al consultar. Además, algunos chunks de 1.500 tokens se vectorizan sin error. ¿Qué dos problemas deben corregir? (Elige dos)
19. Un sistema de recomendación semántica en OpenSearch Service debe responder en menos de 50 ms con un recall muy alto sobre 20 millones de vectores. El presupuesto de memoria no es el factor limitante y los datos se insertan continuamente. ¿Qué método de índice k-NN es el MÁS adecuado?
20. Un equipo usa embeddings de Titan Text Embeddings V2 con normalize a true y está eligiendo métrica para su índice. Un compañero afirma que cambiar entre coseno y producto escalar dará resultados muy distintos. ¿Qué es correcto?
21. Una startup lanza un asistente RAG sobre 3 millones de chunks de documentación pública. Las consultas son esporádicas (unos pocos miles al día), una latencia de unos cientos de milisegundos es aceptable, no necesitan búsqueda por palabras clave y el requisito principal es el MENOR coste y cero administración. ¿Qué almacén vectorial deben elegir?
22. Un marketplace necesita que los usuarios busquen productos tanto por significado («zapatillas cómodas para correr en montaña») como por referencias exactas («TRX-4410»), con filtros complejos por precio, marca y talla y miles de consultas por segundo. ¿Qué almacén vectorial es el MÁS adecuado?
23. Una empresa de software ya gestiona sus pedidos, clientes y permisos en Amazon Aurora PostgreSQL. Quiere añadir búsqueda semántica sobre las incidencias de soporte y combinarla en la misma consulta con filtros relacionales (cliente, plan contratado, permisos del usuario) y transacciones, minimizando la duplicación de datos. ¿Qué solución es la MÁS adecuada?
24. Un equipo ha creado una colección de búsqueda vectorial en OpenSearch Serverless para un piloto que solo se usa en horario laboral unos días al mes. La factura muestra cientos de dólares mensuales aunque apenas hay consultas. ¿Qué cambio reduce el coste manteniendo OpenSearch Serverless?
25. Un asistente jurídico debe responder preguntas como «¿qué empresas filiales de nuestros proveedores tienen litigios abiertos con clientes del sector energético?», que requieren conectar entidades a través de varias relaciones además de buscar por significado. ¿Qué almacén encaja MEJOR con una base de conocimiento de Bedrock?
26. Un chatbot de soporte recibe muchas preguntas casi idénticas formuladas de forma distinta. El equipo quiere reutilizar respuestas anteriores para preguntas semánticamente muy parecidas y evitar invocar el FM, con una latencia de búsqueda de microsegundos y expiración automática de entradas. ¿Qué servicio es el MÁS adecuado para esta caché semántica?
27. Una multinacional indexa sus políticas internas en una base de conocimiento de Bedrock con fuente de datos S3. Los empleados reciben a veces respuestas basadas en políticas de otros países o en versiones derogadas. Quieren que cada consulta filtre por país del empleado y solo use documentos vigentes. ¿Qué deben hacer?
28. Un equipo diseña un índice en Amazon S3 Vectors para 50 millones de chunks. Cada vector llevará el texto del chunk (unos 1.500 caracteres), la URL del documento, el departamento, el año y el nivel de confidencialidad. Las consultas siempre filtran por departamento, año y confidencialidad. ¿Cómo deben configurar los metadatos?
29. Un grupo hospitalario tiene documentación clínica, legal y de recursos humanos con vocabularios muy distintos. Las consultas de cada área deben buscar solo en su dominio, el corpus clínico crece mucho más rápido que los demás y quieren optimizar el rendimiento de búsqueda a escala en OpenSearch Service. ¿Qué diseño cumple MEJOR estos requisitos?
30. Una empresa quiere que su asistente de IA generativa responda con el contenido de SharePoint Online, Confluence y su wiki interna, que tiene una API REST propia. Quieren el MENOR esfuerzo operativo y respetar los permisos de acceso por documento de SharePoint y Confluence. La cuenta crea las bases de conocimiento en octubre de 2026. ¿Qué enfoque es el MÁS adecuado?
31. Una empresa industrial guarda miles de procedimientos en un servidor de ficheros NFS en su centro de datos y recibe fichas técnicas de proveedores por SFTP. Quiere que ambas fuentes lleguen a S3 para alimentar una base de conocimiento, con transferencias incrementales programadas y sin gestionar servidores. ¿Qué servicios debe usar? (Elige dos)
32. Una base de conocimiento de Bedrock con fuente S3 indexa 200.000 documentos. Cada día cambian unos cientos y algunos deben estar disponibles para el asistente en pocos minutos. Actualmente se borra y recrea el índice completo cada noche, lo que tarda horas y cuesta mucho en embeddings. ¿Qué diseño resuelve ambos problemas?
33. Tras retirar varias políticas de la intranet, los empleados siguen recibiendo respuestas basadas en ellas. El pipeline propio de ingesta (Step Functions + Lambda + OpenSearch) solo procesa eventos de creación y modificación de objetos en S3. ¿Qué cambios corrigen el problema y evitan que se repita? (Elige dos)
34. Una empresa guarda en S3 el corpus original de su base de conocimiento (4 TB). Algunos documentos se consultan a diario y otros pasan meses sin abrirse, sin un patrón predecible. Además, el pipeline genera ficheros intermedios de procesamiento que ya no sirven a los 7 días, y necesitan una copia del corpus en otra región para recuperación ante desastres. ¿Qué combinación de funciones de S3 aplica? (Elige tres)
35. Un equipo comercial quiere que el asistente de ventas conozca las oportunidades y los casos de soporte de Salesforce y ServiceNow, actualizados cada día, sin desarrollar integraciones propias. ¿Qué servicio deben usar para llevar esos datos a S3?