8(800) 222 32 56
Панель управления

Блог King Servers

HTTP/2 GOAWAY и gRPC keepalive для LLM API: как найти обрывы и настроить graceful drain
Сетевые протоколы

HTTP/2 GOAWAY и gRPC keepalive для LLM API: как найти обрывы и настроить graceful drain

Практический runbook для LLM API: отличаем штатный HTTP/2 GOAWAY от аварии, находим владельца соединения, согласуем gRPC keepalive и проверяем retry, drain и SLO.

Андрей Минин, автор блога Андрей Минин, автор блога
TLS handshake storm на LLM API gateway: session resumption, keepalive и runbook
Решения для бизнеса

TLS handshake storm на LLM API gateway: session resumption, keepalive и runbook

Практический runbook: как найти всплеск TLS handshakes на LLM API gateway, проверить session resumption и keepalive, провести canary и доказать влияние на TTFT.

Андрей Минин, автор блога Андрей Минин, автор блога
DNS failover для LLM API: почему клиенты держат старый IP и как это исправить
Решения для бизнеса

DNS failover для LLM API: почему клиенты держат старый IP и как это исправить

Практический runbook DNS failover для LLM API: TTL, negative и stale cache, systemd-resolved, connection pools, dual-stack, canary и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
WireGuard MTU и PMTUD: как найти black hole, из-за которого зависает LLM API
Решения для бизнеса

WireGuard MTU и PMTUD: как найти black hole, из-за которого зависает LLM API

Production-runbook для WireGuard: как доказать MTU/PMTUD black hole, измерить underlay и wg0, проверить ICMP, настроить MTU/MSS clamp и подтвердить фикс на LLM streaming canary.

Андрей Минин, автор блога Андрей Минин, автор блога
NVIDIA DRA Driver в Kubernetes 1.36+: безопасный переход GPU inference
GPU

NVIDIA DRA Driver в Kubernetes 1.36+: безопасный переход GPU inference

Практический runbook перехода с NVIDIA Device Plugin на Kubernetes DRA: версии, GPUCluster, ResourceClaim, canary, evidence gate, диагностика и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
BBR и fq для LLM-стриминга: как убрать сетевую очередь из latency и не перепутать её с TTFT
Решения для бизнеса

BBR и fq для LLM-стриминга: как убрать сетевую очередь из latency и не перепутать её с TTFT

Практический runbook по BBR и fq для LLM-стриминга: как отделить TTFT от сетевой очереди, снять baseline, провести canary, проверить ss/qdisc и доказать эффект rollback-контрфактом.

Андрей Минин, автор блога Андрей Минин, автор блога
pgvector HNSW после UPDATE и DELETE: VACUUM, REINDEX и recall в RAG
Инфраструктура

pgvector HNSW после UPDATE и DELETE: VACUUM, REINDEX и recall в RAG

Production runbook для pgvector HNSW после UPDATE/DELETE: version gate, dead tuples, REINDEX CONCURRENTLY, VACUUM, iterative scans и exact-vs-approx recall.

Андрей Минин, автор блога Андрей Минин, автор блога
GPUDirect RDMA через DMA-BUF: переход с nvidia-peermem для multi-node LLM
GPU

GPUDirect RDMA через DMA-BUF: переход с nvidia-peermem для multi-node LLM

Практический runbook по GPUDirect RDMA: переход с legacy nvidia-peermem на DMA-BUF, open kernel, GPU↔NIC transfer, NCCL canary, application gate и rollback.

Андрей Минин, автор блога Андрей Минин, автор блога
PCIe AER и downtraining GPU: production-runbook для LLM inference
GPU

PCIe AER и downtraining GPU: production-runbook для LLM inference

Практический runbook по PCIe AER и downtraining GPU: identity, LnkCap/LnkSta, replay, application gate, recovery, hardware RCA и мониторинг для LLM inference.

Андрей Минин, автор блога Андрей Минин, автор блога