run-as-daemon.dev
13 subscribers
72 photos
114 links
Download Telegram
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашингтона. Open-weights — это не про качество модели. Это про то, кто держит рубильник. Подробнее про архитектуру суверенного инференс-контура: https://run-as-daemon.dev
ФинOps для LLM: гибридный роутинг

Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.

Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода

Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #sovereign
Скрытые расходы на облачные токены

Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе

При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.

RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #brics
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние ...
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние зоны. Внешний DNS отключён на уровне firewall rule, не policy. — PII-санитизация: presidio на границе перед embedding pipeline. ФИО, ИНН, паспортные данные — маскируются до попадания в ChromaDB. Никакой биографии вместо замазанного ФИО. Обновление модели — air-gap процедура: подписанный tar.gz через физический носитель, SHA-256 верификация перед загрузкой, systemd unit с ExecStartPre\=/usr/local/bin/verify-artifact. Ни одна внешняя зависимость не тянется в runtime. TCO за год: железо $8 400, электричество 3.2 кВт × 8760 ч × $0.07 \= $1 958. Итого $10 358. Облачный аналог на том же трафике (500K токенов/сутки): $10 950 только на инференс, плюс egress за документы, плюс аудит доступа к данным 152-ФЗ силами юристов. Разница становится неприличной к концу второго квартала. Подробная схема развёртывания и конфиги systemd unit для vLLM в air-gap: https://run-as-daemon.dev
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с te...
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с tensor parallelism на двух A6000 или 4090 даёт 40-80 tok/s на Mistral 7B или Qwen 14B — достаточно для корпоративного RAG, суммаризации договоров, code review. Стоимость: сервер с двумя A6000 — разовый капекс ~900к руб., амортизация 3 года, электричество ~8к/мес. Против: Azure OpenAI GPT-4o на корпоративном объёме 10M токенов/день — это $1500-2000 в сутки только на инференс, плюс egress, плюс DPA-консультант. 152-ФЗ закрывает дискуссию административно: персональные данные российских субъектов должны обрабатываться на серверах, физически расположенных в РФ. Ни одна публичная LLM-платформа не даёт тебе верифицированной гарантии, что твой промпт обработан именно в российском датацентре, а не проксирован через глобальную инфраструктуру. Bare-metal в собственной стойке — единственная архитектура, где ответ на вопрос регулятора однозначен. Подробный разбор стека: vLLM, WireGuard, presidio, systemd unit с LimitNOFILE и защитой от утечки промптов — на https://run-as-daemon.dev
Автономный AI-агент без ограничений — это вектор атаки на собственную инфраструктуру.

Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.

Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения

Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ...
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ модели приходит с теми же заглушками, gateway восстанавливает контекст из локального session-store. Внешний LLM видит только структуру задачи, ноль PII. Латентность добавки — 8-15 мс на типовом промпте в 512 токенов при инференсе NER-модели на CPU. Это приемлемо. ТСО-аргумент: один инцидент с утечкой персональных данных по 152-ФЗ — штраф до 15 млн руб. плюс репутационный урон. Развёртывание локального PII-gateway на выделенной ноде с 8 vCPU и 16 GB RAM обходится в 4-6 тыс. руб./мес. bare-metal. Амортизация за год — меньше стоимости одного предписания регулятора. Граница контура без PII-фильтра — это открытая дверь с вывеской «вход свободный». Подробнее об архитектуре суверенного AI-периметра: https://run-as-daemon.dev
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ...
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ещё минус 35 мс p95 при переполнении видеопамяти. Radix attention — следующий уровень. При наличии древовидно повторяющихся префиксов (RAG-шаблоны, цепочки агентов с общим контекстом) radix tree переиспользует общие ветки KV-блоков. На RTX 4090 с 24 GB VRAM это удваивает эффективную пропускную способность при типичном агентском трафике без увеличения железа. Пиковая нагрузка — не повод звонить в облако. Это повод правильно разметить VRAM, настроить tensor parallelism между двумя 4090, выставить --gpu-memory-utilization 0.90 и держать префиксный кэш горячим через synthetic warmup при старте сервиса. Суверенный стек знает свою нагрузку — облако знает только ваш счёт. https://run-as-daemon.dev
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM сум...
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM суммарно. Себестоимость токена при загрузке 60%: $0.000004. OpenAI GPT-4o: $0.000015 input / $0.000060 output. При 500M токенов/месяц разница — $27 500 в месяц чистыми. Без учёта того, что санкционный риск у тебя равен нулю, а PII остаётся в периметре 152-ФЗ. WireGuard mesh поверх физических линков между собственными стойками — это инфраструктура, которую не отключает ни один compliance-офицер из Сиэтла. AllowedIPs /32 на каждый spoke, никаких default route в WAN, PII-санитизация на входном прокси до первого токена. Это не паранойя — это инженерная архитектура, которую санкции не имеют точки применения. Подробнее об архитектуре суверенного AI Gateway: https://run-as-daemon.dev
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на ...
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на bare-metal не имеет публичного IP в принципе. Никакого egress на hyperscaler DNS, никакого route через публичную подсеть. По деньгам: аренда dedicated-сервера с 2x RTX 4090 в российском ЦОД — порядка 35 000–45 000 руб/мес. Эквивалентная GPU-мощность в Azure или AWS — от $3 per GPU-hour, то есть от 430 000 руб/мес при круглосуточной нагрузке. WireGuard mesh между двумя bare-metal нодами: нулевая лицензионная стоимость, latency внутри ЦОД менее 0.3 мс, никакого egress fee за межнодовый трафик. Вся маршрутизация — в ядре Linux, без оверлея от вендора. Изоляция портов — не про безопасность в вакууме, это про 152-ФЗ и аудит. Когда регулятор запрашивает схему обработки ПДн, ты показываешь wg show: все пиры с /32, нет публичных IP на продакшене, трафик не покидает контур. Это не презентация для проверяющего — это архитектура, которая работает именно так, как нарисована. Подробнее о суверенной инфраструктуре — https://run-as-daemon.dev
152-ФЗ и AI: где проходит граница

Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.

При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия

В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.

RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.

Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
152-ФЗ и AI: где проходит граница

Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.

При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия

В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.

RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.

Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по...
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по uid-owner воркера — не опция, а обязательный слой. Облачный провайдер предложит тебе Security Group с тремя кликами. И никогда не скажет, что его гипервизор видит твой трафик до того, как он дойдёт до этой группы. TCO за 3 года: bare-metal EPYC-нода с WireGuard mesh и vLLM на борту — разовое CAPEX плюс электричество плюс colocation. Против AWS VPC с NAT Gateway: $0.045 за GB NAT-трафика плюс egress плюс hourly за каждый endpoint. При 10TB/мес внутреннего mesh-трафика AWS берёт за NAT ~$450/мес только на трансит — это $16 200 за три года только за то, чтобы твои пакеты прошли через чужое железо. WireGuard на своём bare-metal: $0 за трансит, $0 за egress внутри контура, полный контроль над маршрутизацией и ключами. Архитектура суверенного mesh — на https://run-as-daemon.dev. Никаких публичных IP, никаких гипервизорных прокладок между твоими данными и криптографией.