Санитайзер перед облачной моделью бесполезен, если SDK первым делом отправляет тело запроса в телеметрию. Промпт может покинуть контур раньше инференса: через APM, экспорт трассировок, отчёт об исключении. Вы купили «защищённый AI», но построили несколько независимых каналов вывоза данных. Граница должна проходить до внешнего SDK: локальная сборка контекста → минимизация данных → обнаружение PII → замена сущностей → проверка разрешённого содержимого → внешний вызов. Проверяется весь собранный запрос, включая RAG-фрагменты и результаты инструментов. Таблица обратных подстановок хранится локально, с ограниченным TTL и привязкой к запросу. В телеметрию идут коды решений и счётчики, без тела промпта. Обратимая замена идентификаторов сама по себе не доказывает обезличивание. Метрики: доля пропущенных сущностей на размеченном корпусе, ложные блокировки, p95 задержки санитизации, число внешних экспортов сырого payload. Последний показатель должен быть нулём; проверяйте его синтетическими маркерами на всех выходах. Экономику считайте по разрешённым запросам: условные 30 000 ₽ в месяц на локальный шлюз при 3 млн запросов дают 0,01 ₽ на запрос до стоимости инференса. К облачному счёту добавляйте APM, хранение логов и сетевой экспорт по своему тарифу. Если задачу нельзя решить без исходных персональных данных, запрос остаётся на локальном инференсе. Собственный bare-metal тоже требует контроля логов и доступа: владение GPU не исправляет дырявый маршрут данных. Sovereign AI Gateway начинается с права решать, какие байты вообще пересекут границу: https://run-as-daemon.dev.
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданно...
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданной конкурентности, токены/Дж на уровне всей системы. Условный бюджет: 180 000 ₽/мес. с амортизацией, электричеством, эксплуатацией и резервом при 300 млн выходных токенов даёт 600 ₽/млн. При 30 млн — уже 6 000 ₽/млн. Cloud API сравниваем по полному счёту за тот же набор запросов, включая входные токены, при сопоставимом качестве и SLA. Облачный тариф покупает обработку в чужом контуре. Bare-metal даёт возможность самому задать границу доступа — и обязанность проверить её. Уберите секреты из журналов, ограничьте административный доступ, запретите произвольный исходящий трафик. Приватность подтверждается проверками, а экономика — измеренной загрузкой. Архитектура суверенного инференса: https://run-as-daemon.dev.
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и ин...
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и интервале закрепления 10 секунд до 1000 событий остаются без независимого якоря. Для критических операций проектируем подтверждение записи намерения до исполнения; результат фиксируем отдельно. Сам журнал не заменяет ограничения полномочий агента. Экономика проверяется арифметикой: при 1 КБ на событие и 100 событиях/с получаем 8,64 ГБ/сутки, за 30 дней — 259,2 ГБ без индексов и реплик. Облачный счёт считаем как приём \+ хранение \+ запросы \+ применимый egress; bare-metal — амортизация \+ диски \+ питание \+ эксплуатация независимого свидетеля. Владение сервером само по себе доказательств не создаёт. Архитектура суверенного контура: https://run-as-daemon.dev.
www.rfc-editor.org
RFC 9162: Certificate Transparency Version 2.0
This document describes version 2.0 of the Certificate Transparency (CT)
protocol for publicly logging the existence of Transport Layer Security (TLS)
server certificates as they are issued or observed, in a manner that allows
anyone to audit certification…
protocol for publicly logging the existence of Transport Layer Security (TLS)
server certificates as they are issued or observed, in a manner that allows
anyone to audit certification…
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости...
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости токена, данные и право выбирать режим деградации. Архитектура суверенного AI Gateway: https://run-as-daemon.dev
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разреш...
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разрешено действовать только тогда, когда его решение можно независимо проверить после компрометации узла.
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура S...
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура Sovereign AI Gateway и инженерные разборы приватного инференса: https://run-as-daemon.dev
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Облачный капкан захлопывается не при загрузке данных, а при попытке их вывезти. AWS принимает трафик бесплатно, но за первые 10 ТБ исходящего трафика EC2 выставляет около $0,09 за ГБ. Массовая выгрузка — примерно $900, ещё до NAT Gateway, Transit Gateway и межзонных начислений. У GCP Premium Tier по отдельным направлениям первые диапазоны стоят $0,12–0,11 за GiB. Вывоз 10 TiB способен превысить $1100. Для 100 TiB это уже отдельная строка бюджета, которая наказывает миграцию, резервирование во втором контуре и отказ от поставщика. Bare-metal меняет экономику: канал оплачивается фиксированно, WireGuard mesh связывает площадки через узловые AllowedIPs /32, а репликация и бэкапы не получают облачный счётчик на каждом байте. Контролировать нужно не цену виртуальной машины, а полную стоимость владения данными: хранение, межзонный трафик, egress и время эвакуации. Если данные нельзя вывезти без согласования бюджета, вы ими не владеете. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereig...
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereign AI Gateway: https://run-as-daemon.dev. Latency-инвариант прост: данные, оркестратор и инференс должны жить в одном контролируемом контуре.
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получае...
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получаем 1026 ₽/млн и 18 Вт·ч на тысячу выходных токенов с учетом PUE. Это целевой сценарий, который надо подтвердить нагрузочным тестом: модель, квантизация, длина контекста, batch, p95 TTFT и скорость выдачи. В знаменатель идут ответы, прошедшие проверку качества. При десятикратном падении объема и прежних расходах себестоимость вырастет десятикратно. Azure OpenAI — не единая подписка: Standard тарифицирует вход и выход, Provisioned — выделенную мощность. Для 300 млн входных и 100 млн выходных токенов счет Standard равен 300 × цена миллиона входных \+ 100 × цена миллиона выходных; кэш учитываем отдельно. Берем тариф конкретной модели и региона, приводим валюту и налоги к одной базе. Выше 102 600 ₽ — наш сценарий дешевле, если выдерживает тот же SLA и качество. Дешевле — облако выигрывает по прямым расходам. Суверенитет дает контроль над вычислениями, но не отменяет арифметику: https://run-as-daemon.dev.
NVIDIA
NVIDIA GeForce RTX 4090 Graphics Cards
It’s powered by the NVIDIA Ada Lovelace architecture and comes with 24 GB of G6X memory to deliver the ultimate experience for gamers and creators.
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gatewa...
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gateway: https://run-as-daemon.dev. Если вы не владеете железом, ключами и загрузочной цепочкой, вы владеете только договором аренды.