VFIO и IOMMU для LLM: безопасный GPU passthrough в KVM
Практический runbook по передаче NVIDIA GPU в KVM через VFIO и IOMMU: topology gate, libvirt, CUDA/LLM readiness, диагностика и rollback.
Практический runbook по передаче NVIDIA GPU в KVM через VFIO и IOMMU: topology gate, libvirt, CUDA/LLM readiness, диагностика и rollback.
Практическое руководство по Linux PSI: как измерять CPU, memory и I/O pressure на VPS, читать some/full, анализировать cgroup v2 и строить мониторинг.
Практическое руководство по disaggregated prefill/decode для LLM: разделение GPU-worker pools, перенос KV cache через NIXL, sizing, сеть, метрики и безопасный production rollout.
Практическое руководство по systemd sandboxing: как ограничить права Linux-сервиса, доступ к файлам, ядру, устройствам, сети и системным вызовам, не устроив простой.
Практическое руководство по nftables sets: именованные и временные наборы, диапазоны, составные ключи, атомарные обновления, автоматизация и безопасный rollback.
Разбор случаев, когда поиск стоит вынести с общего VPS на отдельный сервер или кластер. Материал сравнивает OpenSearch и Elasticsearch, объясняет требования к ресурсам, шардам, репликам, мониторингу, безопасности и миграции.
Практическое руководство по подготовке серверных runbook: обязательные разделы, действия в первые минуты аварии, сценарии для ошибок 5xx, заполненного диска, утечки секретов и недоступной базы данных, а также правила коммуникации, хранения и проверки инструкций.
Практическое руководство по выбору сервера для маркетплейса или большого каталога: оценка нагрузки, CPU, RAM и NVMe, архитектура базы, кеша, поиска и изображений, подготовка к пикам, резервное копирование и мониторинг.
Как AI помогает расследовать production-инциденты: кластеризует логи, ищет аномалии, связывает метрики и traces, использует runbooks и postmortems, а также формирует проверяемые гипотезы без замены observability и инженера.