Data Engineer (Detect & Track Distillation)

Harmattan AI
Paris, Zurich
Workplace: OnsiteFull timeFunction: Software EngineeringSkills: ["Systematic","Quality-minded","Pragmatic","Service-oriented","Automation","Collaboration"]

Own the data layer that powers ML training pipelines, transforming raw field logs and public datasets into clean, curated, versioned, training-ready datasets. Build ingestion and multimodal alignment workflows for unstructured video and sensor streams, define data and labeling requirements, and maintain dataset lineage for reproducible training. Optimize storage formats and delivery so modelers can focus on training rather than data wrangling.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Harmattan AI
Harmattan AI
2 days ago

Data Engineer (Detect & Track Distillation)

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 3 hours agoStatus: Live

Job Summary

Own the data layer that powers ML training pipelines, transforming raw field logs and public datasets into clean, curated, versioned, training-ready datasets. Build ingestion and multimodal alignment workflows for unstructured video and sensor streams, define data and labeling requirements, and maintain dataset lineage for reproducible training. Optimize storage formats and delivery so modelers can focus on training rather than data wrangling.
Location: Paris, Zurich
Workplace: Onsite
Employment Type: Full time
Job Function: Software Engineering

Key Responsibilities

  • •Ingest, decode, and store raw unstructured field data (video and other sensor streams) from field logs into efficient controlled formats.
  • •Align multiple data streams temporally and spatially so paired data is usable for training.
  • •Curate ingested and public datasets via parsing, filtering, de-duplication, and revision to create high-value data.
  • •Define which data to gather and how to label it, owning dataset-construction workflows and labeling tooling while coordinating with data gathering and labeling teams.
  • •Build task-specific datasets, maintain versioning and lineage for reproducible training, and deliver clean documented datasets and loading tools while optimizing storage formats and tiering.

Key Requirements

  • •A degree in a STEM field or equivalent practical experience, with practical data engineering experience prioritized.
  • •Build and maintain pipelines for unstructured data at scale, including ingestion, decode, storage, curation, and versioning.
  • •Strong in Python and data engineering, including optimizing data loaders for common training frameworks such as PyTorch.
  • •Experience with multimodal sensor data, labeling or dataset construction for ML, dataset versioning tooling, and distributed data processing tooling.
  • •Systematic, quality-minded, pragmatic, and service-oriented, with an ability to automate handling of messy data.
Experience:DefenseAutonomous systemsMachine learningData engineering
Education:
Skills:SystematicQuality-mindedPragmaticService-orientedAutomationCollaboration
Tech Stack:PythonPyTorchColumnar formatsSharded formatsDistributed data processing

Company Brief

Harmattan AI
Develops AI-driven autonomous military systems (drones, electronic warfare, ISR and mission-management software) and scales conflict-ready production for allied armed forces and defense primes.
Industry: Defense Technology
Company Size: Medium (51 to 250 employees)
Growth: Scaleup
Valuation: Unicorn (USD 1B+)
Funding: Series B
Headquarters: Paris, France
Founded: 2024
WebsiteLinkedInGlassdoor