Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии включают её опционально, и дефолты небезопасны. TCO-расчёт: bare-metal сервер с H100 80GB — амортизация 36 месяцев даёт ~$4.2/GPU-час. Azure ND H100 v5 — $9.8/GPU-час spot, $18.6/GPU-час on-demand. При 24/7 нагрузке разница за год — $120k\+. На эти деньги вы строите физически изолированный inference-контур с гарантированной защитой KV-cache и собственным embedding namespace. Без соседей. Без timing side-channel. Без shared DRAM. Архитектура суверенного multi-tenant — это отдельный inference-процесс на клиента, изолированный namespace в векторной БД, WireGuard /32 per-tenant и PII-санитизация на входе контура. Не RBAC в чужом облаке — физическая граница. Подробности на https://run-as-daemon.dev
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный ...
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный API физически не может дать гарантию, что промпт с ФИО клиента не прошёл через американский датацентр. Штраф Роскомнадзора — до 18 млн рублей. Стоимость локального PII-redaction на границе контура (presidio \+ кастомный NER) — разовая интеграция за несколько инженерных недель. Архитектурный вывод прост: если inference endpoint зависит от чужого ToS, чужого compliance-департамента и чужой геополитики — это не инфраструктура, это аренда чужой воли. Open-weights \+ bare-metal \+ локальный KV-кэш — единственная топология, где рубильника не существует. Технические детали архитектуры суверенного AI-шлюза: https://run-as-daemon.dev
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашин...
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашингтона. Open-weights — это не про качество модели. Это про то, кто держит рубильник. Подробнее про архитектуру суверенного инференс-контура: https://run-as-daemon.dev
ФинOps для LLM: гибридный роутинг
Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.
Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода
Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.
Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода
Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Скрытые расходы на облачные токены
Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе
При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.
RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе
При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.
RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние ...
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние зоны. Внешний DNS отключён на уровне firewall rule, не policy. — PII-санитизация: presidio на границе перед embedding pipeline. ФИО, ИНН, паспортные данные — маскируются до попадания в ChromaDB. Никакой биографии вместо замазанного ФИО. Обновление модели — air-gap процедура: подписанный tar.gz через физический носитель, SHA-256 верификация перед загрузкой, systemd unit с ExecStartPre\=/usr/local/bin/verify-artifact. Ни одна внешняя зависимость не тянется в runtime. TCO за год: железо $8 400, электричество 3.2 кВт × 8760 ч × $0.07 \= $1 958. Итого $10 358. Облачный аналог на том же трафике (500K токенов/сутки): $10 950 только на инференс, плюс egress за документы, плюс аудит доступа к данным 152-ФЗ силами юристов. Разница становится неприличной к концу второго квартала. Подробная схема развёртывания и конфиги systemd unit для vLLM в air-gap: https://run-as-daemon.dev
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с te...
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с tensor parallelism на двух A6000 или 4090 даёт 40-80 tok/s на Mistral 7B или Qwen 14B — достаточно для корпоративного RAG, суммаризации договоров, code review. Стоимость: сервер с двумя A6000 — разовый капекс ~900к руб., амортизация 3 года, электричество ~8к/мес. Против: Azure OpenAI GPT-4o на корпоративном объёме 10M токенов/день — это $1500-2000 в сутки только на инференс, плюс egress, плюс DPA-консультант. 152-ФЗ закрывает дискуссию административно: персональные данные российских субъектов должны обрабатываться на серверах, физически расположенных в РФ. Ни одна публичная LLM-платформа не даёт тебе верифицированной гарантии, что твой промпт обработан именно в российском датацентре, а не проксирован через глобальную инфраструктуру. Bare-metal в собственной стойке — единственная архитектура, где ответ на вопрос регулятора однозначен. Подробный разбор стека: vLLM, WireGuard, presidio, systemd unit с LimitNOFILE и защитой от утечки промптов — на https://run-as-daemon.dev
Автономный AI-агент без ограничений — это вектор атаки на собственную инфраструктуру.
Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.
Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения
Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.
Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения
Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ...
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ модели приходит с теми же заглушками, gateway восстанавливает контекст из локального session-store. Внешний LLM видит только структуру задачи, ноль PII. Латентность добавки — 8-15 мс на типовом промпте в 512 токенов при инференсе NER-модели на CPU. Это приемлемо. ТСО-аргумент: один инцидент с утечкой персональных данных по 152-ФЗ — штраф до 15 млн руб. плюс репутационный урон. Развёртывание локального PII-gateway на выделенной ноде с 8 vCPU и 16 GB RAM обходится в 4-6 тыс. руб./мес. bare-metal. Амортизация за год — меньше стоимости одного предписания регулятора. Граница контура без PII-фильтра — это открытая дверь с вывеской «вход свободный». Подробнее об архитектуре суверенного AI-периметра: https://run-as-daemon.dev
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ...
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ещё минус 35 мс p95 при переполнении видеопамяти. Radix attention — следующий уровень. При наличии древовидно повторяющихся префиксов (RAG-шаблоны, цепочки агентов с общим контекстом) radix tree переиспользует общие ветки KV-блоков. На RTX 4090 с 24 GB VRAM это удваивает эффективную пропускную способность при типичном агентском трафике без увеличения железа. Пиковая нагрузка — не повод звонить в облако. Это повод правильно разметить VRAM, настроить tensor parallelism между двумя 4090, выставить --gpu-memory-utilization 0.90 и держать префиксный кэш горячим через synthetic warmup при старте сервиса. Суверенный стек знает свою нагрузку — облако знает только ваш счёт. https://run-as-daemon.dev
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM сум...
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM суммарно. Себестоимость токена при загрузке 60%: $0.000004. OpenAI GPT-4o: $0.000015 input / $0.000060 output. При 500M токенов/месяц разница — $27 500 в месяц чистыми. Без учёта того, что санкционный риск у тебя равен нулю, а PII остаётся в периметре 152-ФЗ. WireGuard mesh поверх физических линков между собственными стойками — это инфраструктура, которую не отключает ни один compliance-офицер из Сиэтла. AllowedIPs /32 на каждый spoke, никаких default route в WAN, PII-санитизация на входном прокси до первого токена. Это не паранойя — это инженерная архитектура, которую санкции не имеют точки применения. Подробнее об архитектуре суверенного AI Gateway: https://run-as-daemon.dev
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на ...