8(800) 222 32 56
Панель управления

GPU throttling в LLM inference: мониторинг через DCGM и Prometheus
AI

GPU throttling в LLM inference: мониторинг через DCGM и Prometheus

Практический мониторинг GPU throttling в LLM inference: DCGM Exporter, Prometheus, метрики power/thermal violation, PromQL, алерты и production-runbook.

King Servers
Ошибки NVIDIA Xid в AI-инфраструктуре: диагностика и восстановление GPU
GPU

Ошибки NVIDIA Xid в AI-инфраструктуре: диагностика и восстановление GPU

Практический runbook по NVIDIA Xid: сбор доказательств, ECC и row remapping, Xid 79, DCGM Diagnostics, reset GPU и безопасный drain Kubernetes-узла.

King Servers
Кэш весов LLM на NVMe: OCI-артефакты и быстрый старт в Kubernetes
Инфраструктура

Кэш весов LLM на NVMe: OCI-артефакты и быстрый старт в Kubernetes

Практическая схема доставки и кэширования весов LLM: OCI-артефакты, Kubernetes ImageVolume, KServe LocalModel и локальный NVMe без повторных загрузок.

King Servers