Ошибки NVIDIA Xid в AI-инфраструктуре: диагностика и восстановление GPU
Практический runbook по NVIDIA Xid: сбор доказательств, ECC и row remapping, Xid 79, DCGM Diagnostics, reset GPU и безопасный drain Kubernetes-узла.
Практический runbook по NVIDIA Xid: сбор доказательств, ECC и row remapping, Xid 79, DCGM Diagnostics, reset GPU и безопасный drain Kubernetes-узла.
Практическая схема доставки и кэширования весов LLM: OCI-артефакты, Kubernetes ImageVolume, KServe LocalModel и локальный NVMe без повторных загрузок.
Как использовать CXL Type-3 memory expansion в AI inference: Linux, NUMA, vLLM offload, memory pooling, ограничения и практический чек-лист.
Практическое руководство по Linux PSI: как измерять CPU, memory и I/O pressure на VPS, читать some/full, анализировать cgroup v2 и строить мониторинг.
Практическое руководство по disaggregated prefill/decode для LLM: разделение GPU-worker pools, перенос KV cache через NIXL, sizing, сеть, метрики и безопасный production rollout.
Практический гид по Proxmox VE на выделенном сервере: выбор железа, ZFS и Ceph, сеть, кластер, HA, backup и безопасность.
Практическое руководство по systemd sandboxing: как ограничить права Linux-сервиса, доступ к файлам, ядру, устройствам, сети и системным вызовам, не устроив простой.
Практическое руководство по nftables sets: именованные и временные наборы, диапазоны, составные ключи, атомарные обновления, автоматизация и безопасный rollback.
Разбор случаев, когда поиск стоит вынести с общего VPS на отдельный сервер или кластер. Материал сравнивает OpenSearch и Elasticsearch, объясняет требования к ресурсам, шардам, репликам, мониторингу, безопасности и миграции.