Principal LLM Inference Engineer - F/H
France
Workplace: OnsiteFull timeFunction: Communications, PR & CommunityExperience: 7+ yearsSkills: ["Communication","Technical collaboration","Performance optimization"]Piloter la pile d’inférence de BullSequana AI et son intégration avec la plateforme matérielle BullSequana. Concevoir et optimiser le serving LLM natif Kubernetes (vLLM/llm-d, inférence distribuée/désagrégée), gérer le cycle de vie et les pipelines multimodaux, et améliorer fiabilité, observabilité et benchmarking (Prometheus/Grafana, canary/blue-green). Assurer le support avant-vente et le dimensionnement, avec un impact direct sur coût par token et latence.
Loading
Loading job details...
Preparing the role view and application actions.

