Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gatewa...
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gateway: https://run-as-daemon.dev. Если вы не владеете железом, ключами и загрузочной цепочкой, вы владеете только договором аренды.
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архи...
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архитектура, которую нельзя вывезти и поднять на собственном железе, вам не принадлежит. Практика суверенной инфраструктуры: https://run-as-daemon.dev
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт ...
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт мощности проектируются до миграции данных: https://run-as-daemon.dev. Суверенный инференс — это проверяемый запрет на экспорт, а не обещание провайдера.
Облако дешевле только в счёте за токены.
Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Облако дешевле только в счёте за токены.
Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольн...
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольный транзит. Это одновременно экономика и исполнимый контур 152-ФЗ. Архитектура Sovereign AI Gateway и инженерные разборы: https://run-as-daemon.dev. Пока GPU принадлежит провайдеру, ваша маржа принадлежит его тарифной политике.
Удалить телефон регуляркой — ещё не санитизация. «Единственный инженер филиала, госпитализированный после аварии 12 мая» может идентифицировать человека без ФИО. Облачный API получает связь между фактами. Поэтому проверять нужно окончательно собранный запрос, включая историю диалога, RAG-фрагменты, результаты инструментов и текст вложений. Архитектура: сборка контекста внутри контура → локальное обнаружение идентификаторов и чувствительных связей → удаление, обобщение или подстановка → решение о маршруте. Таблица обратимых подстановок остаётся локально; сама подстановка не гарантирует анонимность. Не прошедший проверку запрос направляется в локальный vLLM либо блокируется. Исходный текст исключаем из внешней телеметрии и журналов ошибок. Приёмочные метрики: доля пропущенных идентификаторов на размеченном наборе, доля ошибочных блокировок, p95 задержки санитизации и сохранение качества ответа после очистки. Условная экономика: 10 млн запросов в месяц при дополнительных 20 мс CPU на запр...
Удалить телефон регуляркой — ещё не санитизация. «Единственный инженер филиала, госпитализированный после аварии 12 мая» может идентифицировать человека без ФИО. Облачный API получает связь между фактами. Поэтому проверять нужно окончательно собранный запрос, включая историю диалога, RAG-фрагменты, результаты инструментов и текст вложений. Архитектура: сборка контекста внутри контура → локальное обнаружение идентификаторов и чувствительных связей → удаление, обобщение или подстановка → решение о маршруте. Таблица обратимых подстановок остаётся локально; сама подстановка не гарантирует анонимность. Не прошедший проверку запрос направляется в локальный vLLM либо блокируется. Исходный текст исключаем из внешней телеметрии и журналов ошибок. Приёмочные метрики: доля пропущенных идентификаторов на размеченном наборе, доля ошибочных блокировок, p95 задержки санитизации и сохранение качества ответа после очистки. Условная экономика: 10 млн запросов в месяц при дополнительных 20 мс CPU на запрос — около 56 CPU-часов. Это только вычислительная добавка: модели распознавания, резерв мощности и сопровождение считаются отдельно. Сравнивать маршруты нужно по стоимости успешно выполненной задачи с одинаковыми требованиями к данным. Sovereign AI Gateway — точка принудительного исполнения вашей политики доступа к данным: https://run-as-daemon.dev. Каждый внешний маршрут обязан проходить через неё. Обещание провайдера не обучаться на запросах не заменяет контроль того, что вы ему передаёте. Сырой контекст остаётся внутри.
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный к...
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный канал для своей площадки обходится в $800/месяц и вмещает этот поток без доплат, разница составляет $38 400/год до учета оборудования и эксплуатации. Сравнивать нужно одинаковые объемы, резервирование и пропускную способность. В Sovereign AI Gateway считаем GB изменений в сутки, задержку репликации, допустимую потерю данных и время переключения на независимую площадку. Размещаем корпус и bare-metal инференс рядом, наружу передаем необходимый минимум. WireGuard защищает транспорт; тариф за переданные байты остается. Суверенитет начинается с проверенной способности обслуживать нагрузку вне чужого контура: https://run-as-daemon.dev.
Amazon
Free data transfer out to internet when moving out of AWS | Amazon Web Services
You told us one of the primary reasons to adopt Amazon Web Services (AWS) is the broad choice of services we offer, enabling you to innovate, build, deploy, and monitor your workloads. AWS has continuously expanded its services to support virtually any cloud…
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю ...
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю метку из локального NTP (не облачного), хеш политики авторизации, под которой действие разрешено. Этот bundle пишется в append-only структуру — идеально Merkle-дерево с периодическими anchor-точками в локальном HSM или даже в git-репозитории с подписанными коммитами. Replay любого инцидента тогда детерминирован: берёшь bundle, воспроизводишь вход, проверяешь подпись — и знаешь точно, что агент сделал и под какой политикой. Egress чужому облаку при этом ноль. Форензика остаётся внутри контура. ТСО вопроса. Облачные агентские фреймворки типа Azure AI Agent Service или AWS Bedrock Agents дают «аудит» в виде CloudWatch/Monitor логов — мутабельных, платных за хранение ($0.03/GB/мес только ingestion), выгружаемых с egress-стоимостью при инциденте. Когда следователь запросит форензику на 6 месяцев назад — вы заплатите за выгрузку и не получите криптографической гарантии целостности. Локальный Merkle-audit на bare-metal: стоимость хранения 10 млн evidence bundle — порядка 40 GB, цена на NVMe — копейки. Верификация — детерминирована и бесплатна. Подробнее об архитектуре суверенного агентского контура — https://run-as-daemon.dev
Сетевой уровень: AI без публичного интернета
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии вкл...
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии включают её опционально, и дефолты небезопасны. TCO-расчёт: bare-metal сервер с H100 80GB — амортизация 36 месяцев даёт ~$4.2/GPU-час. Azure ND H100 v5 — $9.8/GPU-час spot, $18.6/GPU-час on-demand. При 24/7 нагрузке разница за год — $120k\+. На эти деньги вы строите физически изолированный inference-контур с гарантированной защитой KV-cache и собственным embedding namespace. Без соседей. Без timing side-channel. Без shared DRAM. Архитектура суверенного multi-tenant — это отдельный inference-процесс на клиента, изолированный namespace в векторной БД, WireGuard /32 per-tenant и PII-санитизация на входе контура. Не RBAC в чужом облаке — физическая граница. Подробности на https://run-as-daemon.dev
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный ...
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный API физически не может дать гарантию, что промпт с ФИО клиента не прошёл через американский датацентр. Штраф Роскомнадзора — до 18 млн рублей. Стоимость локального PII-redaction на границе контура (presidio \+ кастомный NER) — разовая интеграция за несколько инженерных недель. Архитектурный вывод прост: если inference endpoint зависит от чужого ToS, чужого compliance-департамента и чужой геополитики — это не инфраструктура, это аренда чужой воли. Open-weights \+ bare-metal \+ локальный KV-кэш — единственная топология, где рубильника не существует. Технические детали архитектуры суверенного AI-шлюза: https://run-as-daemon.dev