Senior Machine Learning Engineer, Multimodal Perception

Waymo
Mountain View, California, USA / Mountain View (US-MTV-EMF680), Mountain View, California, United States2026-08-31

About the job

Perception-focused MLE role dedicated to multi-modal sensor fusion, multi-task deep learning architectures for vehicle semantics and signal detection, dynamic high-resolution vision backbones, and large-scale automated data engines.

Responsibilities

Architect, train, and optimize multi-task deep learning models (PyTorch / JAX) across multi-modal sensor streams.

Build automated data mining pipelines, active learning loops, hard-example curation, and auto-labeling systems.

Develop high-resolution vision architectures and spatial-temporal transformer backbones.

Leverage multimodal foundation models for automated data curation, synthetic edge-case generation, and failure triage.

Profile and optimize models for efficient onboard accelerator inference.

Qualifications

Minimum

2–5+ years training and deploying production vision or multi-modal deep learning models.

Experience with multi-modal sensor fusion (Camera + LiDAR + Audio), multi-task learning (MTL), transformer architectures, and PyTorch / JAX.

Experience building large-scale data curation pipelines, active learning loops, and auto-labeling systems.

Fluency with modern AI developer tools and foundation model workflows for fast prototyping.

Preferred

No preferred qualifications listed.