NVMe/TCP TLS и DH-HMAC-CHAP: защищаем хранилище весов LLM
Production-runbook по защите удалённых весов LLM: NVMe/TCP TLS, DH-HMAC-CHAP, kernel keyring, canary, negative controls, vLLM gate и rollback.
Production-runbook по защите удалённых весов LLM: NVMe/TCP TLS, DH-HMAC-CHAP, kernel keyring, canary, negative controls, vLLM gate и rollback.
Практический runbook по NUMA-locality для LLM-инференса: topology, CPU и memory affinity, Kubernetes Topology Manager, canary, SLO и rollback.
Практический runbook для безопасного ограничения мощности GPU: baseline, canary, DCGM и vLLM-метрики, energy-per-token, rollout и rollback.
Production-runbook по nvidia-persistenced для LLM: baseline, точечное включение по GPU UUID, infrastructure и application gates, canary rollout и rollback.
Практический runbook по PCIe ACS и P2P DMA: topology, IOMMU, NCCL, LLM application gate, точечное изменение bridge и безопасный rollback.
Как проверить Above 4G Decoding, Resizable BAR и NVIDIA BAR1 на multi-GPU сервере: evidence bundle, PCIe/CUDA gates, LLM readiness и безопасный rollback.
Практический runbook по передаче NVIDIA GPU в KVM через VFIO и IOMMU: topology gate, libvirt, CUDA/LLM readiness, диагностика и rollback.
Практический runbook для NVSwitch-сервера: версии driver/Fabric Manager, topology и DCGM gates, Xid/SXid, LLM smoke test, мониторинг и recovery.
Практический мониторинг GPU throttling в LLM inference: DCGM Exporter, Prometheus, метрики power/thermal violation, PromQL, алерты и production-runbook.