Implementar soluções de extração de informações1 / 5
Você precisa ingerir PDFs mistos, que contêm tanto texto corrido quanto gráficos/diagramas incorporados, em um índice do Azure AI Search para RAG multimodal. Você quer um único skill que analise o layout, produza Markdown preservando a estrutura de seções e extraia as imagens com metadados de localização, para que os chunks fiquem perto das figuras relacionadas. Qual skill integrado você deve usar?
CorretoIncorreto
Alex
O skill Document Layout do Azure AI Search chama o modelo de layout do Azure Document Intelligence para detectar a estrutura do documento e emitir uma representação sintática em Markdown ou texto. A configuração markdownHeaderDepth controla o aninhamento das seções e, quando ele é configurado para saída em texto com extração de imagens, retorna normalized_images e também locationMetadata, que preserva a posição de cada imagem no documento. Manter as imagens perto do conteúdo relacionado é valioso para RAG e para busca multimodal. O skill de OCR, por outro lado, apenas extrai texto de imagens e não produz seções estruturadas em Markdown; o skill de Image Analysis descreve o conteúdo da imagem, mas não divide um documento em chunks conforme o layout. Dica de prova: “Markdown consciente da estrutura mais metadados de localização das imagens para RAG multimodal” aponta para o skill Document Layout, não para o OCR puro.
Fontelearn.microsoft.com
Você pode obter respostas às suas dúvidas no app. Crie uma conta grátis, sem cartão de crédito.
Questão 1 de 5
Criar uma conta grátis