8(800) 222 32 56
Панель управления

GPU

GPU throttling в LLM inference: мониторинг через DCGM и Prometheus
AI

GPU throttling в LLM inference: мониторинг через DCGM и Prometheus

Практический мониторинг GPU throttling в LLM inference: DCGM Exporter, Prometheus, метрики power/thermal violation, PromQL, алерты и production-runbook.

King Servers
Pinned memory и memlock для LLM inference: production-runbook
GPU

Pinned memory и memlock для LLM inference: production-runbook

Практический runbook по pinned host memory и RLIMIT_MEMLOCK для LLM inference: диагностика, Docker/systemd, vLLM offload, метрики, canary и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
Memory pressure в LLM-инференсе: cgroup v2, PSI и systemd-oomd
AI

Memory pressure в LLM-инференсе: cgroup v2, PSI и systemd-oomd

Практический runbook для защиты LLM-инференса от дефицита host RAM: PSI, cgroup v2, systemd-oomd, лимиты vLLM, алерты и аварийное восстановление.

Андрей Минин, автор блога Андрей Минин, автор блога
NVIDIA CDI для rootless GPU-контейнеров: безопасный запуск LLM inference
AI

NVIDIA CDI для rootless GPU-контейнеров: безопасный запуск LLM inference

Практический runbook: NVIDIA Container Toolkit CDI, rootless Podman и Docker, выбор GPU/MIG, запуск vLLM, hardening, обновления и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
Kubernetes DRA для GPU: ResourceClaim, DeviceClass и безопасный rollout
AI

Kubernetes DRA для GPU: ResourceClaim, DeviceClass и безопасный rollout

Практический гид по Kubernetes DRA для GPU: ResourceClaim, DeviceClass, NVIDIA DRA Driver, canary-rollout, RBAC, наблюдаемость и безопасный откат.

Андрей Минин, автор блога Андрей Минин, автор блога
Ошибки NVIDIA Xid в AI-инфраструктуре: диагностика и восстановление GPU
GPU

Ошибки NVIDIA Xid в AI-инфраструктуре: диагностика и восстановление GPU

Практический runbook по NVIDIA Xid: сбор доказательств, ECC и row remapping, Xid 79, DCGM Diagnostics, reset GPU и безопасный drain Kubernetes-узла.

King Servers