EnglishDeutschFrançaisEspañolPortuguês

Google Cloud · GCP-PMLE · Advanced

Professional Machine Learning Engineer — Übungsfragen und Probeprüfung

Übe mit realistischen GCP-PMLE-Fragen, die an den Prüfungszielen ausgerichtet sind. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, was du als Nächstes lernen solltest.

55Fragen
120minZeitlimit

Geprüft gegen Google Cloud · August 2026Aktuelle Prüfungsversion

Über die Prüfung

Die Zertifizierung Google Cloud Professional Machine Learning Engineer weist nach, dass du KI-Lösungen mit den Möglichkeiten von Google Cloud und mit klassischem ML-Wissen bauen, bewerten, produktiv setzen und optimieren kannst. Abgedeckt werden der Umgang mit großen, komplexen Datensätzen, wiederverwendbarer Code, der Entwurf und Betrieb generativer KI-Lösungen auf Basis von Foundation Models sowie die Praxis verantwortungsvoller KI. Die aktuelle Version enthält Aufgaben zu generativer KI, darunter Lösungen mit Model Garden auf der Gemini Enterprise Agent Platform (so heißt im Exam Guide inzwischen das, was früher Vertex AI hieß) und die Bewertung generativer KI-Lösungen. Google empfiehlt mindestens 3 Jahre Berufserfahrung, davon mindestens 1 Jahr mit dem Entwurf und Betrieb von Lösungen auf Google Cloud.

Was geprüft wird

Prototypen zu Produktionsmodellen zu skalieren wiegt mit 21 % am schwersten. Dazu gehören die Wahl von Modelltyp und Deployment-Strategie, das Training von Modellen über mehrere SDKs hinweg, das Tuning von Hyperparametern und die Auswahl der passenden Compute- und Accelerator-Hardware. Serving und Skalierung von Modellen folgen mit 20 %: Batch- und Online-Inferenz, Verwaltung des Feature Store, Skalierung von Endpoints. Das Automatisieren und Orchestrieren von ML-Pipelines macht 18 % aus, inklusive Test von Pipeline-Tools und CI/CD/CT-Automatisierung für das Retraining. Die Zusammenarbeit an Daten und Modellen kommt auf 16 %, und je 13 % entfallen auf das Entwerfen von Low-Code-KI-Lösungen mit BigQuery ML, AutoML oder den vorgefertigten APIs von Cloud AI sowie auf das Monitoring von KI-Lösungen im Produktivbetrieb.

Zwei Drittel der Prüfung stecken damit im Bauen, Ausliefern und Orchestrieren von Modellen, also in der operativen Hälfte des ML Engineering, und nicht in der Low-Code-Schicht. Programmieren selbst wird nicht abgefragt, aber du solltest Python- und SQL-Snippets gut genug lesen können, um zu verstehen, was sie tun.

Prüfungsaufbau: GCP-PMLE

Architecting low-code AI solutions~13%

Train classification and forecasting models with BigQuery ML or AutoML, then extend beyond them by wiring up prebuilt Cloud AI APIs and picking or fine-tuning a foundation model for the task at hand.

≈ 15 Std.
Collaborating within and across teams to manage data and models~16%

Explore and preprocess data for ML using tools appropriate to scale and complexity, and prototype models in notebook environments such as Vertex AI Workbench and Colab Enterprise. Also covers tracking and comparing ML experiments, model artifacts, and evaluation metrics.

≈ 19 Std.
Scaling prototypes into ML models~21%

Build models by choosing the appropriate model type, product, and deployment strategy for cost, complexity, and latency requirements, train models using various SDKs and hyperparameter tuning, and choose appropriate compute and accelerator hardware for training.

≈ 25 Std.
Serving and scaling models~20%

Package and roll out models for both batch and real-time inference, then keep that serving layer scaled by managing feature stores, endpoints, and the hardware behind them.

≈ 24 Std.
Automating and orchestrating ML pipelines~18%

Develop end-to-end ML pipelines using managed or custom orchestration tools such as Vertex AI Pipelines, and automate model retraining through CI/CD/CT pipelines and retraining policies.

≈ 21 Std.
Monitoring AI solutions~13%

Identify risks to AI solutions such as data exfiltration and bias, and monitor, test, and troubleshoot AI solutions in production for issues like training-serving skew and data or concept drift.

≈ 15 Std.

Format und Fragetypen

Die Prüfung stellt 50 bis 60 Multiple-Choice- und Multiple-Select-Fragen in einem Zeitfenster von 120 Minuten, verteilt auf sechs Domains und im Verhältnis von etwa 80 % Einzelantwort zu 20 % Mehrfachauswahl. Programmieren wird nicht direkt geprüft, du brauchst aber genug Python- und SQL-Routine, um Code-Snippets zu deuten.

Fragetypen: GCP-PMLE

Multiple Choice80%

Eine einzige beste Antwort aus vier oder fünf Optionen — das Brot-und-Butter-Format der Prüfung.

Mehrfachauswahl20%

Mehrere Antworten sind richtig und du brauchst alle; die Frage sagt dir, wie viele du wählen sollst.

Google Cloud bestätigt diese Fragetypen — eine prozentuale Verteilung wird nicht publiziert; die Aufteilung spiegelt unseren am Exam ausgerichteten Fragenpool wider.

Fünf GCP-PMLE-Fragen zum Ausprobieren

Fünf Fragen direkt aus unserem Professional Machine Learning Engineer-Pool. Beantworte eine — Alex erklärt dir das Warum.

Die Prüfung und die App sind auf Englisch — diese Beispielfragen haben wir übersetzt.

Modelle bereitstellen und skalieren1 / 5

Du musst Online-Inferenz mit einem Modell durchführen, das Textantworten generiert. Die Antworten können sehr lang sein (bis zu 2000 Tokens). Du möchtest die Nutzererfahrung verbessern, indem du die Antwort-Tokens streamst, während sie generiert werden. Welche Serving-Funktion von Vertex AI unterstützt das?

AlexGanze Erklärung von Alex

Vertex AI bietet Streaming-Vorhersagen über die API-Endpoints serverStreamingPredict und streamGenerateContent für generative KI-Modelle, die längere Texte erzeugen. Beim Streaming werden die Tokens inkrementell gesendet, sobald sie generiert sind, was die Time-to-First-Token (TTFT) senkt – Nutzer sehen, wie die Antwort in Echtzeit entsteht. Der Endpoint liefert über Server-Sent Events (SSE) einen Stream von StreamingPredictResponse-Instanzen. Standard-Prediction-Endpoints warten auf die vollständige Antwort, bevor sie zurückgeben, was bei Ausgaben mit über 2000 Tokens zu inakzeptablen Verzögerungen führt. Batch Prediction verarbeitet Offline-Workloads, keine Interaktion in Echtzeit. Eigene WebSocket-Container bringen unnötige Komplexität, wenn natives Streaming verfügbar ist. Prüfungstipp: Serving generativer KI mit langen Ausgaben → Streaming-Prediction-Endpoints; tabellarisch/Klassifikation → Standard-Endpoints. Ref: docs.cloud.google.com/vertex-ai/generative-ai/docs/reference/rest/v1/projects.locations.endpoints

Quellecloud.google.com

Prototypen zu ML-Modellen skalieren2 / 5

Du trainierst ein Modell zur Verarbeitung natürlicher Sprache und musst ein Vokabular von 100.000 Tokens handhaben. Dein Modell nutzt Sub-Word-Tokenisierung. Welcher Tokenisierungsansatz ist bei modernen NLP-Modellen auf Google Cloud am gebräuchlichsten?

AlexGanze Erklärung von Alex

Sub-Word-Verfahren wie SentencePiece und WordPiece sind der Standard im modernen NLP. TensorFlow Text implementiert drei Sub-Word-Tokenizer: BertTokenizer (nutzt WordPiece, wie in BERT), WordpieceTokenizer und SentencepieceTokenizer (verwendet von T5 und mT5). Sub-Word-Tokenisierung zerlegt Wörter in sinnvolle Einheiten (z. B. 'searchability' → 'search ##ability') und geht dabei elegant mit Wörtern außerhalb des Vokabulars um, während die Vokabulargröße handhabbar bleibt (30K-100K Tokens). WordPiece arbeitet mit einem Greedy-Algorithmus nach dem Prinzip der längsten Übereinstimmung; SentencePiece ist sprachunabhängig und verarbeitet Rohtext ohne Vorab-Tokenisierung. Wortbasierte Tokenisierung scheitert an unbekannten Wörtern. Zeichenbasierte Tokenisierung erzeugt übermäßig lange Sequenzen. Regelbasierte Tokenisierung lässt sich nicht über verschiedene Sprachen hinweg verallgemeinern. Googles Gemini- und PaLM-Modelle nutzen SentencePiece. Prüfungstipp: moderne NLP-Tokenisierung = Sub-Word (SentencePiece/WordPiece/BPE). Ref: www.tensorflow.org/text/guide/subwords_tokenizer

Quelleai.google.dev

ML-Pipelines automatisieren und orchestrieren3 / 5

Du hast eine Gemini Enterprise Agent Platform Pipeline, die ein Modell trainiert, evaluiert und bereitstellt. Du musst die vollständige Lineage nachverfolgen, um beantworten zu können: 'Welche Datensatzversion hat dieses Modell hervorgebracht, und welche Metriken hat es erreicht?' Welcher Dienst bietet diese Nachverfolgung der Artefakt-Lineage?

AlexGanze Erklärung von Alex

Gemini Enterprise Agent Platform ML Metadata erfasst die Metadaten von ML-Pipelines als Graph mit drei Entitätstypen: Artefakte (Datensätze, Modelle, Metriken), Executions (Pipeline-Schritte) und Kontexte (Pipeline-Läufe), verbunden durch Events. So entsteht ein abfragbarer Lineage-Graph, der Fragen beantwortet wie: 'Welcher Datensatz wurde zum Trainieren dieses Modells verwendet?' und 'Welche Hyperparameter haben das genaueste Modell hervorgebracht?' ML Metadata ist immer aktiv – es zeichnet automatisch alle Ein- und Ausgabe-Artefakte jedes Pipeline-Laufs auf. Experiments on Agent Platform verfolgt Parameter und Metriken zum Vergleich von Experimenten, bietet aber keine vollständige Lineage auf Pipeline-Ebene. Cloud Audit Logs protokollieren API-Aufrufe zu Sicherheitszwecken, nicht die Beziehungen zwischen ML-Artefakten. Model Registry verwaltet Modellversionen, führt aber nicht auf die Datensätze zurück. Prüfungstipp: 'Lineage' oder 'Provenance' in ML-Pipelines → Gemini Enterprise Agent Platform ML Metadata. Ref: docs.cloud.google.com/vertex-ai/docs/ml-metadata/introduction

Quelledocs.cloud.google.com

Innerhalb von Teams und teamübergreifend an Daten und Modellen zusammenarbeiten4 / 5

Dein ML-Team nutzt Feature Store mit Features, die sowohl aus Echtzeit-Streaming-Daten als auch aus historischen Batch-Daten berechnet werden. Dem Team fällt auf, dass das Online-Serving andere Feature-Werte zurückgibt als die, die beim Training verwendet wurden. Was ist die wahrscheinlichste Ursache?

AlexGanze Erklärung von Alex

Training-Serving-Skew auf Feature-Ebene entsteht häufig, wenn die Batch- und die Streaming-Pipeline zur Feature-Berechnung unterschiedlichen Code verwenden. Feature Store speichert und liefert getreu genau die Werte aus, die geschrieben wurden – wenn die Batch-Pipeline ein Feature mit einer bestimmten Aggregation oder Normalisierung berechnet und die Streaming-Pipeline eine andere Implementierung nutzt, bekommt das Modell beim Serving andere Feature-Werte als beim Training. Googles Dokumentation merkt an: 'Ohne einen Featurestore hast du unter Umständen unterschiedliche Codepfade, um Features für Training und Serving zu erzeugen.' Die Lösung ist eine gemeinsame Berechnungslogik, idealerweise mit Apache Beam, das sowohl den Batch- als auch den Streaming-Modus unterstützt. Feature Store schränkt gemischte Ingestion nicht ein, und seine Serving-Schicht funktioniert korrekt. Overfitting ist ein Problem des Modells, nicht der Feature-Pipeline. Prüfungstipp: unterschiedliche Feature-Werte online vs. im Training → prüfe, ob die Berechnungslogik identisch ist. Ref: docs.cloud.google.com/vertex-ai/docs/featurestore/overview

Quellecloud.google.com

Low-Code-KI-Lösungen konzipieren5 / 5

Dein Unternehmen möchte Kundenabwanderung anhand strukturierter Tabellendaten vorhersagen, die in BigQuery liegen. Der Datensatz hat Millionen von Zeilen, und das Team möchte eine Lösung, die möglichst wenig Code und Infrastrukturverwaltung erfordert. Welchen Ansatz solltest du empfehlen?

AlexGanze Erklärung von Alex

Mit BigQuery ML baust du Modelle per SQL direkt dort, wo die Daten liegen. Für tabellarische Klassifikation wie die Vorhersage von Kundenabwanderung ist BOOSTED_TREE_CLASSIFIER (basiert auf XGBoost) wirkungsvoll und braucht minimalen Code: eine einzige CREATE MODEL-Anweisung. Die Daten verlassen BigQuery nie, was Pipeline-Komplexität erspart. BigQuery ML unterstützt lineare und logistische Regression, k-Means, ARIMA_PLUS, Boosted Trees, DNN und Matrixfaktorisierung. Der Export nach Cloud Storage für ein eigenes TensorFlow-Training bringt unnötigen Infrastrukturaufwand mit sich. AutoML Tables setzt einen Datenexport voraus. Vortrainierte Modelle aus dem Model Garden zielen auf unstrukturierte Daten (Text, Bilder) ab, nicht auf strukturierte Tabellendaten. Prüfungstipp: strukturierte/tabellarische Daten, die schon in BigQuery liegen + wenig Code → BigQuery ML. Ref: docs.cloud.google.com/bigquery/docs/reference/standard-sql/bigqueryml-syntax-create-boosted-tree

Quelledocs.cloud.google.com

307 Fragen, gebaut wie die Prüfung

Der GCP-PMLE-Pool deckt jede Domain ab und wird laufend um neue Fragen erweitert. Eine Probeprüfung stellt dir 55 Fragen am Stück, mit derselben 120-Minuten-Uhr wie am Prüfungstag.

Prüfprotokoll: GCP-PMLE

Spec-Abgleich gegen Google Cloud17. August 2026

zuletzt gegen die offizielle Google Cloud-Quelle verifiziert

Blueprint-Deckung14 offizielle Lernziele

verteilt auf 6 Domains, laut offiziellem Prüfungsleitfaden

Pool-Größe307 Fragen

= 5 volle Probeprüfungen à 55 Fragen — nie dieselbe Frage zweimal

Kanonisch validiert307 von 307

einzeln gegen offizielle Google Cloud-Dokumentation geprüft — Antwort, Optionen und Erklärung, Quelle zitiert

Methodik offen dokumentiert.So entstehen unsere Fragen →

Vorbereitung auf GCP-PMLE

Wie lange du brauchst, hängt davon ab, wie viel Praxiserfahrung du mitbringst. Den Rest legt der Anbieter fest: wie die Prüfung abläuft, wie schnell du wiederholen darfst und wie lange das Zertifikat gültig bleibt.

Die Prüfung läuft online mit Remote-Proctoring oder vor Ort in einem Testcenter über Pearson VUE. Die Zertifizierung gilt 2 Jahre; für die Rezertifizierung bestehst du die jeweils aktuelle Version der Prüfung.

Dein Plan: GCP-PMLE

Vorbereitung

Lernzeit70–180 Std.

typischerweise rund 70 Std., wenn du ohnehin mit diesen Technologien arbeitest, rund 180 Std. bei komplettem Neueinstieg

LevelFortgeschritten
Vorher sinnvollKeine formalen Voraussetzungen. Empfohlen werden mindestens 3 Jahre Berufserfahrung, davon mindestens 1 Jahr im Design und Betrieb von ML-Lösungen mit Google Cloud.

Prüfungstag & danach

PrüfungsartOnline beaufsichtigt oder Prüfungszentrum (Pearson VUE)
Wiederholungsregeln14 Tage Wartezeit nach dem ersten nicht bestandenen Versuch, 60 Tage nach dem zweiten, 365 Tage nach dem dritten. Maximal 4 Versuche innerhalb von 2 Jahren.
Gültig2 Jahre

Alle 2 Jahre ist eine Rezertifizierung nötig: Du legst dafür die jeweils aktuelle Version der Prüfung ab.

Die Stundenzahl ist unsere eigene Planungsschätzung — Google Cloud veröffentlicht keine Vorbereitungszeit für diese Prüfung. Ein Startwert für deinen Kalender, keine Vorgabe.

Häufige Fehler

Vertex AI Pipelines und Cloud Composer orchestrieren beide Abläufe, haben aber unterschiedliche Aufgaben, und im ML-spezifischen Szenario greifen viele zum falschen der beiden. BigQuery ML, AutoML und Custom Training liegen an verschiedenen Punkten einer Komplexitätsskala, und die Prüfung erwartet, dass du zu einer genannten Randbedingung das passende Werkzeug wählst, statt automatisch das zu nehmen, das dir am vertrautesten ist. Training-Serving-Skew ist ein großes Monitoring-Thema, das in Lernplänen deutlich weniger Aufmerksamkeit bekommt als Metriken zur Modellgenauigkeit, und Batch- gegenüber Online-Vorhersage hat unterschiedliche Folgen für die Skalierung, die sich leicht vermischen. Die Rollen der TFX-Komponenten (ExampleGen, SchemaGen, Transform, Trainer, Evaluator, Pusher) und die Funktion des Feature Store, Features in Training und Serving konsistent zu halten, werden beide gern unterschätzt, genauso wie die Generative-KI-Inhalte der aktuellen Prüfung rund um Model Garden, Agent Builder und RAG-Muster.

Stolperstellen: GCP-PMLE

  1. 01Agent Platform Ecosystem

    Du kennst das Ökosystem der Gemini Enterprise Agent Platform nicht vollständig: Pipelines, Feature Store, Model Registry und Endpoints gehören alle dazu.

  2. 02Model Selection

    Du bringst durcheinander, wann AutoML, eigenes Training oder ein vortrainiertes Modell aus dem Model Garden die richtige Wahl ist.

  3. 03Feature Engineering

    Du übersiehst den Feature Store der Agent Platform, der Features verwaltet und sie online wie offline ausliefert.

  4. 04MLOps Practices

    Dir ist nicht klar, wie ML-Pipelines orchestriert werden, wie kontinuierliches Training abläuft und wozu Model Monitoring dient.

  5. 05Gen AI Architecture

    Du verstehst RAG-Patterns, das Fine-Tuning von Modellen und die Rolle des Model Garden bei der Auswahl eines Foundation Models falsch.

  6. 06Model Monitoring

    Du weißt nicht, wie du Concept Drift, Data Drift und eine nachlassende Modellqualität erkennst.

Pass-IT trainiert dich gezielt auf genau diese Schwächen — adaptiv & verteilt →

Häufige Fragen

Was sind häufige Fehler bei der Prüfung Professional Machine Learning Engineer?

Häufige Fallstricke sind: Agent Platform Ecosystem, Model Selection, Feature Engineering, MLOps Practices, Gen AI Architecture, Model Monitoring. Konzentriere deine Lernzeit auf diese Bereiche, um keine Punkte zu verlieren.

Wie hoch ist die Bestehensquote bei der Prüfung Professional Machine Learning Engineer?

Google Cloud veröffentlicht keine Bestehensquoten, und für diese Prüfung auch keine Bestehensgrenze – deshalb zeigt unsere Seite die Dauer und die Bereiche, aber keinen Punktwert, den du anpeilen könntest. Jede Prozentzahl, die dir irgendwo begegnet, ist geraten. Brauchbar sind die Gewichtung der Bereiche und das Lernbudget von 120 Stunden.

Wie ist die Prüfung zum Machine Learning Engineer gewichtet?

Prototypen zu Modellen zu skalieren ist mit 21% der größte Bereich, gefolgt vom Bereitstellen und Skalieren von Modellen mit 20% und dem Automatisieren und Orchestrieren von Pipelines mit 18%. Die teamübergreifende Zusammenarbeit nimmt 16% ein, das Entwerfen von Low-Code-KI-Lösungen und das Monitoring von KI-Lösungen jeweils 13%. Knapp sechs Zehntel der Prüfung drehen sich um Produktionsarbeit statt um Modellierung.

Welche Vorkenntnisse setzt die Prüfung zum Machine Learning Engineer voraus?

Google Cloud empfiehlt drei oder mehr Jahre Berufserfahrung, davon mindestens ein Jahr mit dem Entwerfen und Verwalten von Machine-Learning-Lösungen auf der Plattform. Der Katalog veranschlagt 120 Stunden – der höchste Wert im Google-Cloud-Programm, gleichauf mit den Architect- und DevOps-Prüfungen. Das zeigt, wie viel der Prüfung auf Produktdetails zu Vertex AI entfällt statt auf Machine-Learning-Theorie.

Wie lange ist die Zertifizierung zum Machine Learning Engineer gültig?

Zwei Jahre, danach legst du die aktuelle Version der Prüfung erneut ab. Google Cloud bietet für diese Zertifizierung keinen Weg über Weiterbildung an, die Wiederholungsprüfung ist also die einzige Option.

Wie schnell kannst du die Prüfung zum Machine Learning Engineer wiederholen?

Vierzehn Tage nach dem ersten Nichtbestehen, 60 Tage nach dem zweiten und danach 365 Tage. Innerhalb von zwei Jahren sind vier Versuche erlaubt, ein drittes Nichtbestehen beendet den Zyklus damit faktisch.

Pass-IT ist ein unabhängiges Lernwerkzeug und weder mit Google Cloud verbunden noch von Google Cloud unterstützt; Google Cloud und Prüfungsnamen sind Marken ihrer jeweiligen Inhaber.

Eine Zertifizierung. Eine Zahlung.

Voller Zugang zu GCP-PMLE

Du bekommst den vollständigen Fragenpool für diese Zertifizierung. Alex erklärt jede Antwort, und dein Readiness Score zeigt dir, woran du als Nächstes arbeiten solltest.

Zugang zu GCP-PMLE für $29.99 kaufenEinmal zahlen. Dauerhafter Zugang zu dieser Zertifizierung.
Kostenlos prüfen, ob du bereit bist20 Fragen. Keine Karte nötig. Sieh vor dem Kauf, was du üben solltest.

Erreiche 80 % Readiness und bestehe die Prüfung — oder du bekommst dein Geld zurück.

So funktioniert der Score →