fs-verity для весов LLM: контроль целостности модели на GPU-сервере
Production-runbook по fs-verity для весов LLM: pinned revision, дерево Меркла, trusted manifest, systemd gate, отрицательные тесты и безопасный rollback на GPU-сервере.
Production-runbook по fs-verity для весов LLM: pinned revision, дерево Меркла, trusted manifest, systemd gate, отрицательные тесты и безопасный rollback на GPU-сервере.
Практический runbook по pinned host memory и RLIMIT_MEMLOCK для LLM inference: диагностика, Docker/systemd, vLLM offload, метрики, canary и rollback.
Практический runbook по I/O-изоляции LLM-узла: cgroup v2 io.max, systemd slices, PSI, два gate, canary rollout и rollback.
Практический runbook по NFSv4.2 и FS-Cache для весов LLM: локальный NVMe-кэш, прогрев, два уровня gates, rollout, наблюдаемость и rollback.
Практический runbook по LMCache MP для vLLM: архитектура node-local KV-кеша, resource budget, проверки hit/miss, Kubernetes, метрики и rollback.
Практический runbook для защиты LLM-инференса от дефицита host RAM: PSI, cgroup v2, systemd-oomd, лимиты vLLM, алерты и аварийное восстановление.
Практический runbook: NVIDIA Container Toolkit CDI, rootless Podman и Docker, выбор GPU/MIG, запуск vLLM, hardening, обновления и rollback.
Практический гид по Kubernetes DRA для GPU: ResourceClaim, DeviceClass, NVIDIA DRA Driver, canary-rollout, RBAC, наблюдаемость и безопасный откат.
Как использовать CXL Type-3 memory expansion в AI inference: Linux, NUMA, vLLM offload, memory pooling, ограничения и практический чек-лист.