NVIDIA DRA Driver в Kubernetes 1.36+: безопасный переход GPU inference
Практический runbook перехода с NVIDIA Device Plugin на Kubernetes DRA: версии, GPUCluster, ResourceClaim, canary, evidence gate, диагностика и rollback.
Практический runbook перехода с NVIDIA Device Plugin на Kubernetes DRA: версии, GPUCluster, ResourceClaim, canary, evidence gate, диагностика и rollback.
Практический runbook по BBR и fq для LLM-стриминга: как отделить TTFT от сетевой очереди, снять baseline, провести canary, проверить ss/qdisc и доказать эффект rollback-контрфактом.
Production runbook для pgvector HNSW после UPDATE/DELETE: version gate, dead tuples, REINDEX CONCURRENTLY, VACUUM, iterative scans и exact-vs-approx recall.
Практический runbook по GPUDirect RDMA: переход с legacy nvidia-peermem на DMA-BUF, open kernel, GPU↔NIC transfer, NCCL canary, application gate и rollback.
Практический runbook по PCIe AER и downtraining GPU: identity, LnkCap/LnkSta, replay, application gate, recovery, hardware RCA и мониторинг для LLM inference.
Production-runbook по защите удалённых весов LLM: NVMe/TCP TLS, DH-HMAC-CHAP, kernel keyring, canary, negative controls, vLLM gate и rollback.
Практический runbook по NUMA-locality для LLM-инференса: topology, CPU и memory affinity, Kubernetes Topology Manager, canary, SLO и rollback.
Практический runbook для безопасного ограничения мощности GPU: baseline, canary, DCGM и vLLM-метрики, energy-per-token, rollout и rollback.
Production-runbook по nvidia-persistenced для LLM: baseline, точечное включение по GPU UUID, infrastructure и application gates, canary rollout и rollback.