Lösungen zur Informationsextraktion implementieren1 / 5
Du musst gemischte PDFs, die sowohl Fließtext als auch eingebettete Diagramme/Grafiken enthalten, für multimodales RAG in einen Azure AI Search-Index aufnehmen. Du willst einen einzigen Skill, der das Layout analysiert, Markdown erzeugt, das die Abschnittsstruktur bewahrt, und Bilder samt Positions-Metadaten extrahiert, damit die Chunks nah bei den zugehörigen Abbildungen bleiben. Welchen integrierten Skill solltest du verwenden?
RichtigFalsch
Alex
Der Document Layout-Skill in Azure AI Search ruft das Layout-Modell von Azure Document Intelligence auf, um die Dokumentstruktur zu erkennen und eine syntaktische Repräsentation in Markdown oder Text auszugeben. Über die Einstellung markdownHeaderDepth steuerst du die Verschachtelung der Abschnitte, und wenn er auf Textausgabe mit Bildextraktion konfiguriert ist, liefert er normalized_images sowie locationMetadata, das die Position jedes Bildes im Dokument bewahrt. Bilder nah bei den zugehörigen Inhalten zu halten, ist für RAG und multimodale Suche wertvoll. Der OCR-Skill extrahiert dagegen nur Text aus Bildern und erzeugt keine strukturierten Markdown-Abschnitte; der Image Analysis-Skill beschreibt Bildinhalte, zerlegt ein Dokument aber nicht anhand des Layouts in Chunks. Prüfungstipp: „strukturbewusstes Markdown plus Positions-Metadaten für Bilder für multimodales RAG“ weist auf den Document Layout-Skill hin, nicht auf reines OCR.
Quellelearn.microsoft.com
Antworten auf Rückfragen bekommst du in der App. Erstelle ein kostenloses Konto — ohne Kreditkarte.
Frage 1 von 5
Kostenloses Konto erstellen