Implementar soluciones de extracción de información1 / 5
Debes ingerir en un índice de Azure AI Search, para RAG multimodal, PDFs mixtos que contienen tanto texto narrativo como gráficos/diagramas incrustados. Quieres un solo skill que analice el layout, produzca Markdown que preserve la estructura de secciones y extraiga las imágenes con metadatos de ubicación, para que los chunks queden cerca de las figuras relacionadas. ¿Qué skill integrado deberías usar?
CorrectoIncorrecto
Alex
El skill Document Layout de Azure AI Search llama al modelo de layout de Azure Document Intelligence para detectar la estructura del documento y emitir una representación sintáctica en Markdown o texto. Su parámetro markdownHeaderDepth controla el anidamiento de las secciones y, cuando se configura para salida de texto con extracción de imágenes, devuelve normalized_images más locationMetadata, que conserva la posición de cada imagen dentro del documento. Mantener las imágenes cerca del contenido relacionado es valioso para RAG y para la búsqueda multimodal. El skill de OCR, en cambio, solo extrae texto de las imágenes y no produce secciones estructuradas en Markdown; el skill de Image Analysis describe el contenido de una imagen, pero no divide un documento en chunks según el layout. Consejo de examen: «Markdown consciente de la estructura más metadatos de ubicación de las imágenes para RAG multimodal» apunta al skill Document Layout, no al OCR simple.
Fuentelearn.microsoft.com
Puedes obtener respuestas a tus dudas en la app. Crea una cuenta gratis, sin tarjeta de crédito.
Pregunta 1 de 5
Crear una cuenta gratis