Job Description
Обязанности:
Развёртывание и обслуживание LLM-моделей с использованием vLLM и Triton Inference Server;
Администрирование GPU-кластера (NVIDIA H200, L4, L40s): распределение ресурсов, мониторинг VRAM, настройка CUDA MPS;
Построение и поддержка CI/CD пайплайнов для AI-сервисов на базе GitLab CI;
Автоматизация деплоя моделей: версионирование, rollback-процедуры, проведение A/B тестов;
Контейнеризация сервисов (Docker, Kubernetes);
Настройка мониторинга GPU-метрик через Prometheus и Grafana;
Мониторинг качества AI-агентов: latency (p50/p95/p99), throughput, деградация метрик;
Работа с реляционными и векторными базами данных;
Настройка миграций БД через Alembic (желательно).
Настройка алертов при деградации сервисов (желательно).
Требования:
Уверенные знания ML-инфраструктуры: vLLM, Triton Inference Server;
Опыт работы с GPU-кластерами NVIDIA, понимание CUDA, MPS, VRAM-менеджмента;
Практический опыт с Docker и Kubernetes в prod...
Ready to Apply?
Submit your application today and join our talented team at г.Астана.
Submit ApplicationJob Details
- Location Astana, Akmola Region
- Job Type Full-time
- Category Other-General
- Posted Date July 15, 2026
- Application Deadline August 24, 2026