8(800) 222 32 56
Панель управления

fs-verity для весов LLM: контроль целостности модели на GPU-сервере
AI

fs-verity для весов LLM: контроль целостности модели на GPU-сервере

Production-runbook по fs-verity для весов LLM: pinned revision, дерево Меркла, trusted manifest, systemd gate, отрицательные тесты и безопасный rollback на GPU-сервере.

Андрей Минин, автор блога Андрей Минин, автор блога
Pinned memory и memlock для LLM inference: production-runbook
GPU

Pinned memory и memlock для LLM inference: production-runbook

Практический runbook по pinned host memory и RLIMIT_MEMLOCK для LLM inference: диагностика, Docker/systemd, vLLM offload, метрики, canary и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
I/O-изоляция LLM-узла: cgroup v2 и systemd против штормов NVMe
AI

I/O-изоляция LLM-узла: cgroup v2 и systemd против штормов NVMe

Практический runbook по I/O-изоляции LLM-узла: cgroup v2 io.max, systemd slices, PSI, два gate, canary rollout и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
FS-Cache для LLM: как снять шторм загрузки весов с NFS на GPU-узлах
AI

FS-Cache для LLM: как снять шторм загрузки весов с NFS на GPU-узлах

Практический runbook по NFSv4.2 и FS-Cache для весов LLM: локальный NVMe-кэш, прогрев, два уровня gates, rollout, наблюдаемость и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
LMCache MP для vLLM: node-local KV-кеш без сюрпризов в production
vLLM

LMCache MP для vLLM: node-local KV-кеш без сюрпризов в production

Практический runbook по LMCache MP для vLLM: архитектура node-local KV-кеша, resource budget, проверки hit/miss, Kubernetes, метрики и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
Memory pressure в LLM-инференсе: cgroup v2, PSI и systemd-oomd
AI

Memory pressure в LLM-инференсе: cgroup v2, PSI и systemd-oomd

Практический runbook для защиты LLM-инференса от дефицита host RAM: PSI, cgroup v2, systemd-oomd, лимиты vLLM, алерты и аварийное восстановление.

Андрей Минин, автор блога Андрей Минин, автор блога
NVIDIA CDI для rootless GPU-контейнеров: безопасный запуск LLM inference
AI

NVIDIA CDI для rootless GPU-контейнеров: безопасный запуск LLM inference

Практический runbook: NVIDIA Container Toolkit CDI, rootless Podman и Docker, выбор GPU/MIG, запуск vLLM, hardening, обновления и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
Kubernetes DRA для GPU: ResourceClaim, DeviceClass и безопасный rollout
AI

Kubernetes DRA для GPU: ResourceClaim, DeviceClass и безопасный rollout

Практический гид по Kubernetes DRA для GPU: ResourceClaim, DeviceClass, NVIDIA DRA Driver, canary-rollout, RBAC, наблюдаемость и безопасный откат.

Андрей Минин, автор блога Андрей Минин, автор блога
CXL Memory Expansion для AI inference: больше RAM без иллюзии «дополнительной VRAM»
AI

CXL Memory Expansion для AI inference: больше RAM без иллюзии «дополнительной VRAM»

Как использовать CXL Type-3 memory expansion в AI inference: Linux, NUMA, vLLM offload, memory pooling, ограничения и практический чек-лист.

Андрей Минин, автор блога Андрей Минин, автор блога