Principal LLM Inference Engineer - F/H

Atos
France
Workplace: OnsiteFull timeFunction: Communications, PR & CommunityExperience: 7+ yearsSkills: ["Communication","Technical collaboration","Performance optimization"]

Piloter la pile d’inférence de BullSequana AI et son intégration avec la plateforme matérielle BullSequana. Concevoir et optimiser le serving LLM natif Kubernetes (vLLM/llm-d, inférence distribuée/désagrégée), gérer le cycle de vie et les pipelines multimodaux, et améliorer fiabilité, observabilité et benchmarking (Prometheus/Grafana, canary/blue-green). Assurer le support avant-vente et le dimensionnement, avec un impact direct sur coût par token et latence.

Loading

Loading job details...

Preparing the role view and application actions.

FursaFursa
Atos
Atos
1 day ago

Principal LLM Inference Engineer - F/H

✓ Verified Job

Canonical indexed version, validated from employer's careers page.

Source: Company careers pageValidated by: Fursa AI
Last checked: 9 hours agoStatus: Live

Job Summary

Piloter la pile d’inférence de BullSequana AI et son intégration avec la plateforme matérielle BullSequana. Concevoir et optimiser le serving LLM natif Kubernetes (vLLM/llm-d, inférence distribuée/désagrégée), gérer le cycle de vie et les pipelines multimodaux, et améliorer fiabilité, observabilité et benchmarking (Prometheus/Grafana, canary/blue-green). Assurer le support avant-vente et le dimensionnement, avec un impact direct sur coût par token et latence.
Location: France
Workplace: Onsite
Employment Type: Full time
Job Function: Communications, PR & Community

Key Responsibilities

  • •Concevoir et optimiser une plateforme de serving LLM basée sur vLLM, configurer le parallélisme et installer/maintenir llm-d pour l’inférence distribuée et désagrégée.
  • •Gérer le cycle de vie des modèles (versioning, déploiement progressif, rollback) y compris en environnements isolés, et servir des pipelines multimodaux (audio temps réel, STT, TTS, OCR).
  • •Mettre en place services embedding et reranking via des bases vectorielles (ex. Milvus) et orchestrer les déploiements fiables (canary/blue-green avec portes d’évaluation).
  • •Instrumenter l’observabilité et le benchmarking : métriques GPU et par token, logs structurés, traçabilité, Prometheus/Grafana, et campagnes pour réduire coût par token et latence de queue.
  • •Fournir des données de dimensionnement et de performance pour avant-vente, appels d’offres et planification de capacité.

Key Requirements

  • •7+ ans d’expérience en ingénierie avec un temps significatif dédié au serving d’inférences ML/AI en production.
  • •Expérience pratique des plateformes de serving natives Kubernetes et de l’inférence distribuée (idéalement llm-d ou pile équivalente).
  • •Compréhension des architectures open-weight et de leur impact sur les performances de serving (ex. MoE, MTP, Sparse Attention, MLA).
  • •Expertise avancée en Python (profiling, async, FastAPI) et expérience avec Go.
  • •Maîtrise des outils et moteurs d’inférence (vLLM, SGLang, TensorRT-LLM, NVIDIA Dynamo) et des concepts de préremplissage/décodage désagrégés et de routage KV-cache.
Experience:7+ yearsLLM inferenceAIKubernetesDistributed inferenceMultimodalHPC
Skills:CommunicationTechnical collaborationPerformance optimization
Languages:English
Tech Stack:PythonGoFastAPIVLLMLlm-dSGLangTensorRT-LLMNVIDIA DynamoKubernetesDockerHelmKServePrometheusGrafanaMilvusMLPerf InferenceGenAI-PerfSafetensorsNVLinkInfiniBand

Company Brief

Atos
Global digital services and consulting firm delivering cloud, cybersecurity, big data, digital workplace, and managed services to enterprise and public sector clients. Provides IT transformation, systems integration, and outsourcing solutions worldwide.
Industry: Consulting
Company Size: Enterprise (1,001+ employees)
Revenue: USD 1B+
Growth: Public Company
Valuation: Public Company (Market Cap in USD)
Funding: IPO / Publicly Listed
Headquarters: Bezons, France
Founded: 1997
WebsiteLinkedIn