Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт ...
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт мощности проектируются до миграции данных: https://run-as-daemon.dev. Суверенный инференс — это проверяемый запрет на экспорт, а не обещание провайдера.
Облако дешевле только в счёте за токены.
Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Облако дешевле только в счёте за токены.
Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольн...
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольный транзит. Это одновременно экономика и исполнимый контур 152-ФЗ. Архитектура Sovereign AI Gateway и инженерные разборы: https://run-as-daemon.dev. Пока GPU принадлежит провайдеру, ваша маржа принадлежит его тарифной политике.
Удалить телефон регуляркой — ещё не санитизация. «Единственный инженер филиала, госпитализированный после аварии 12 мая» может идентифицировать человека без ФИО. Облачный API получает связь между фактами. Поэтому проверять нужно окончательно собранный запрос, включая историю диалога, RAG-фрагменты, результаты инструментов и текст вложений. Архитектура: сборка контекста внутри контура → локальное обнаружение идентификаторов и чувствительных связей → удаление, обобщение или подстановка → решение о маршруте. Таблица обратимых подстановок остаётся локально; сама подстановка не гарантирует анонимность. Не прошедший проверку запрос направляется в локальный vLLM либо блокируется. Исходный текст исключаем из внешней телеметрии и журналов ошибок. Приёмочные метрики: доля пропущенных идентификаторов на размеченном наборе, доля ошибочных блокировок, p95 задержки санитизации и сохранение качества ответа после очистки. Условная экономика: 10 млн запросов в месяц при дополнительных 20 мс CPU на запр...
Удалить телефон регуляркой — ещё не санитизация. «Единственный инженер филиала, госпитализированный после аварии 12 мая» может идентифицировать человека без ФИО. Облачный API получает связь между фактами. Поэтому проверять нужно окончательно собранный запрос, включая историю диалога, RAG-фрагменты, результаты инструментов и текст вложений. Архитектура: сборка контекста внутри контура → локальное обнаружение идентификаторов и чувствительных связей → удаление, обобщение или подстановка → решение о маршруте. Таблица обратимых подстановок остаётся локально; сама подстановка не гарантирует анонимность. Не прошедший проверку запрос направляется в локальный vLLM либо блокируется. Исходный текст исключаем из внешней телеметрии и журналов ошибок. Приёмочные метрики: доля пропущенных идентификаторов на размеченном наборе, доля ошибочных блокировок, p95 задержки санитизации и сохранение качества ответа после очистки. Условная экономика: 10 млн запросов в месяц при дополнительных 20 мс CPU на запрос — около 56 CPU-часов. Это только вычислительная добавка: модели распознавания, резерв мощности и сопровождение считаются отдельно. Сравнивать маршруты нужно по стоимости успешно выполненной задачи с одинаковыми требованиями к данным. Sovereign AI Gateway — точка принудительного исполнения вашей политики доступа к данным: https://run-as-daemon.dev. Каждый внешний маршрут обязан проходить через неё. Обещание провайдера не обучаться на запросах не заменяет контроль того, что вы ему передаёте. Сырой контекст остаётся внутри.
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный к...
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный канал для своей площадки обходится в $800/месяц и вмещает этот поток без доплат, разница составляет $38 400/год до учета оборудования и эксплуатации. Сравнивать нужно одинаковые объемы, резервирование и пропускную способность. В Sovereign AI Gateway считаем GB изменений в сутки, задержку репликации, допустимую потерю данных и время переключения на независимую площадку. Размещаем корпус и bare-metal инференс рядом, наружу передаем необходимый минимум. WireGuard защищает транспорт; тариф за переданные байты остается. Суверенитет начинается с проверенной способности обслуживать нагрузку вне чужого контура: https://run-as-daemon.dev.
Amazon
Free data transfer out to internet when moving out of AWS | Amazon Web Services
You told us one of the primary reasons to adopt Amazon Web Services (AWS) is the broad choice of services we offer, enabling you to innovate, build, deploy, and monitor your workloads. AWS has continuously expanded its services to support virtually any cloud…
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю ...
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю метку из локального NTP (не облачного), хеш политики авторизации, под которой действие разрешено. Этот bundle пишется в append-only структуру — идеально Merkle-дерево с периодическими anchor-точками в локальном HSM или даже в git-репозитории с подписанными коммитами. Replay любого инцидента тогда детерминирован: берёшь bundle, воспроизводишь вход, проверяешь подпись — и знаешь точно, что агент сделал и под какой политикой. Egress чужому облаку при этом ноль. Форензика остаётся внутри контура. ТСО вопроса. Облачные агентские фреймворки типа Azure AI Agent Service или AWS Bedrock Agents дают «аудит» в виде CloudWatch/Monitor логов — мутабельных, платных за хранение ($0.03/GB/мес только ingestion), выгружаемых с egress-стоимостью при инциденте. Когда следователь запросит форензику на 6 месяцев назад — вы заплатите за выгрузку и не получите криптографической гарантии целостности. Локальный Merkle-audit на bare-metal: стоимость хранения 10 млн evidence bundle — порядка 40 GB, цена на NVMe — копейки. Верификация — детерминирована и бесплатна. Подробнее об архитектуре суверенного агентского контура — https://run-as-daemon.dev
Сетевой уровень: AI без публичного интернета
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии вкл...
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии включают её опционально, и дефолты небезопасны. TCO-расчёт: bare-metal сервер с H100 80GB — амортизация 36 месяцев даёт ~$4.2/GPU-час. Azure ND H100 v5 — $9.8/GPU-час spot, $18.6/GPU-час on-demand. При 24/7 нагрузке разница за год — $120k\+. На эти деньги вы строите физически изолированный inference-контур с гарантированной защитой KV-cache и собственным embedding namespace. Без соседей. Без timing side-channel. Без shared DRAM. Архитектура суверенного multi-tenant — это отдельный inference-процесс на клиента, изолированный namespace в векторной БД, WireGuard /32 per-tenant и PII-санитизация на входе контура. Не RBAC в чужом облаке — физическая граница. Подробности на https://run-as-daemon.dev
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный ...
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный API физически не может дать гарантию, что промпт с ФИО клиента не прошёл через американский датацентр. Штраф Роскомнадзора — до 18 млн рублей. Стоимость локального PII-redaction на границе контура (presidio \+ кастомный NER) — разовая интеграция за несколько инженерных недель. Архитектурный вывод прост: если inference endpoint зависит от чужого ToS, чужого compliance-департамента и чужой геополитики — это не инфраструктура, это аренда чужой воли. Open-weights \+ bare-metal \+ локальный KV-кэш — единственная топология, где рубильника не существует. Технические детали архитектуры суверенного AI-шлюза: https://run-as-daemon.dev
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашин...
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашингтона. Open-weights — это не про качество модели. Это про то, кто держит рубильник. Подробнее про архитектуру суверенного инференс-контура: https://run-as-daemon.dev