Облачный капкан enterprise AI — ступенька расходов, спрятанная за средней ценой токена. Пока дополнительный трафик помещается в существующий парк, экономика выглядит прекрасно. Следующий контракт требует ещё одного GPU — и целый арендный инстанс приходится оплачивать ради небольшой добавки выручки. Ваш прайс продаёт токены плавно. Инфраструктура дорожает скачками. Условный расчёт, не рыночная котировка: дополнительный облачный узел стоит 300 тыс. ₽/мес., собственный — 180 тыс. ₽/мес. с амортизацией, электричеством, размещением, обслуживанием и резервом на отказы. Если расширение обслуживает 600 млн дополнительных выходных токенов в месяц, это 500 против 300 ₽ за миллион. При выручке 450 ₽ за миллион облачный вариант даёт минус 30 тыс. ₽, собственный — плюс 90 тыс. ₽ до остальных расходов продукта. Входная нагрузка в обоих вариантах одинаковая и включена в замер мощности. Для bare-metal vLLM фиксируйте модель, точность, длины входа и выхода, профиль параллельности. Измеряйте устойчивый ...
Облачный капкан enterprise AI — ступенька расходов, спрятанная за средней ценой токена. Пока дополнительный трафик помещается в существующий парк, экономика выглядит прекрасно. Следующий контракт требует ещё одного GPU — и целый арендный инстанс приходится оплачивать ради небольшой добавки выручки. Ваш прайс продаёт токены плавно. Инфраструктура дорожает скачками. Условный расчёт, не рыночная котировка: дополнительный облачный узел стоит 300 тыс. ₽/мес., собственный — 180 тыс. ₽/мес. с амортизацией, электричеством, размещением, обслуживанием и резервом на отказы. Если расширение обслуживает 600 млн дополнительных выходных токенов в месяц, это 500 против 300 ₽ за миллион. При выручке 450 ₽ за миллион облачный вариант даёт минус 30 тыс. ₽, собственный — плюс 90 тыс. ₽ до остальных расходов продукта. Входная нагрузка в обоих вариантах одинаковая и включена в замер мощности. Для bare-metal vLLM фиксируйте модель, точность, длины входа и выхода, профиль параллельности. Измеряйте устойчивый output tokens/s при заданных p95 TTFT и задержке между токенами, затем проверяйте режим отказа одного узла. Отдельно считайте полезные токены на джоуль по потреблению всего сервера. Паспортная производительность GPU не показывает, сколько клиентских запросов вы обслужите в пределах SLO. В Sovereign AI Gateway маршрут должен учитывать доступную мощность и стоимость следующей порции нагрузки. Облачный overflow допустим только в пределах бюджета, который выдерживает цена продукта. Собственное железо тоже требует капитала и запаса мощности; его преимущество — контроль закупки, срока эксплуатации и оптимизации инференса. Архитектура суверенного контура: https://run-as-daemon.dev. Маржу защищает расчёт следующей ступени расширения.
Автономный RAG нельзя построить командой «запретить WAN». Сначала внутри периметра создаются собственные зеркала OCI-образов, Python wheels, моделей, токенизаторов и системных пакетов. Каждый артефакт получает хеш, подпись, SBOM и фиксированную версию. Импорт — только через карантинный шлюз, а не через случайную флешку администратора. Рабочий тракт выглядит так: локальный парсер документов → PII-санитизация → embedding-модель → векторное хранилище → reranker → bare-metal vLLM. Ни один этап не должен ждать внешний DNS, лицензионный сервер или CDN. Проверка простая: обесточить узлы, поднять контур с нуля и измерить время до первого корректного ответа по контрольному набору. Экономика считается не ценой GPU, а полной себестоимостью полезного ответа: амортизация железа, кВт·ч, репликация индекса, труд эксплуатации и доля отклонённых ответов. При постоянной нагрузке собственный ускоритель превращает токены в прогнозируемую производственную единицу; облако сохраняет почасовую наценку, egress...
Автономный RAG нельзя построить командой «запретить WAN». Сначала внутри периметра создаются собственные зеркала OCI-образов, Python wheels, моделей, токенизаторов и системных пакетов. Каждый артефакт получает хеш, подпись, SBOM и фиксированную версию. Импорт — только через карантинный шлюз, а не через случайную флешку администратора. Рабочий тракт выглядит так: локальный парсер документов → PII-санитизация → embedding-модель → векторное хранилище → reranker → bare-metal vLLM. Ни один этап не должен ждать внешний DNS, лицензионный сервер или CDN. Проверка простая: обесточить узлы, поднять контур с нуля и измерить время до первого корректного ответа по контрольному набору. Экономика считается не ценой GPU, а полной себестоимостью полезного ответа: амортизация железа, кВт·ч, репликация индекса, труд эксплуатации и доля отклонённых ответов. При постоянной нагрузке собственный ускоритель превращает токены в прогнозируемую производственную единицу; облако сохраняет почасовую наценку, egress и риск блокировки аккаунта. Проектирование суверенного AI Gateway и закрытых контуров: https://run-as-daemon.dev. Автономность — это способность воспроизвести весь RAG без разрешения внешнего поставщика.
Предельная стоимость токена важнее красивой цены пилота. В облаке каждый рост inference-нагрузки умножается на арендную ставку GPU, комиссии managed-сервисов и egress. Вы оптимизировали квантование на 30%, а провайдер изменил тариф или доступность инстанса — экономика снова принадлежит не вам. На bare-metal формула прозрачна: амортизация узла \+ электроэнергия \+ охлаждение \+ эксплуатация, делённые на число полезных токенов. Например, сервер потребляет 3 кВт: при цене 10 ₽/кВт·ч это 21 600 ₽ в месяц при круглосуточной работе. Дальше маржу определяют batch size, cache hit rate, speculative decoding и фактическая утилизация GPU, а не прайс-лист чужого API. Нужна не покупка железа ради стойки, а управление token density per watt. vLLM, continuous batching, локальный prefix cache, SLO по TTFT и токенам в секунду, WireGuard mesh с AllowedIPs /32. PII очищается на границе контура до inference: меньше риска по 152-ФЗ, меньше данных для egress и ни одного обязательного похода в облако. Сувере...
Предельная стоимость токена важнее красивой цены пилота. В облаке каждый рост inference-нагрузки умножается на арендную ставку GPU, комиссии managed-сервисов и egress. Вы оптимизировали квантование на 30%, а провайдер изменил тариф или доступность инстанса — экономика снова принадлежит не вам. На bare-metal формула прозрачна: амортизация узла \+ электроэнергия \+ охлаждение \+ эксплуатация, делённые на число полезных токенов. Например, сервер потребляет 3 кВт: при цене 10 ₽/кВт·ч это 21 600 ₽ в месяц при круглосуточной работе. Дальше маржу определяют batch size, cache hit rate, speculative decoding и фактическая утилизация GPU, а не прайс-лист чужого API. Нужна не покупка железа ради стойки, а управление token density per watt. vLLM, continuous batching, локальный prefix cache, SLO по TTFT и токенам в секунду, WireGuard mesh с AllowedIPs /32. PII очищается на границе контура до inference: меньше риска по 152-ФЗ, меньше данных для egress и ни одного обязательного похода в облако. Суверенный AI Gateway начинается там, где финансовый директор может посчитать цену следующего миллиарда токенов без звонка гиперскейлеру. Архитектура и разбор контура: https://run-as-daemon.dev
Самый дорогой токен — тот, ради которого GPU весь день ждал пикового запроса. Enterprise покупает предсказуемую задержку: резерв под всплески, длинный контекст и отказ узла. Облачный капкан начинается, когда постоянный резерв оплачивают как временную потребность. Выручка ночью спит, аренда продолжает списываться. Sovereign AI Gateway должен разделять интерактивные запросы и пакетные задачи. Для vLLM измеряйте p95/p99 TTFT, задержку между токенами, длину очереди и вытеснения KV-cache. Фоновую нагрузку допускайте только в пределах запаса интерактивного SLO. Производительность сравнивайте при одинаковых модели, качестве, входных контекстах и длинах ответов; энергетическую эффективность — по полезным выходным токенам на джоуль всего сервера. Условный расчёт, не рыночная котировка: облачный контур обходится в 600 тысяч ₽/месяц, собственный — в 300 тысяч с амортизацией, питанием, размещением, эксплуатацией и резервом. При 120 млрд выходных токенов в пределах SLO это 5 против 2,5 ₽ за миллион...
Самый дорогой токен — тот, ради которого GPU весь день ждал пикового запроса. Enterprise покупает предсказуемую задержку: резерв под всплески, длинный контекст и отказ узла. Облачный капкан начинается, когда постоянный резерв оплачивают как временную потребность. Выручка ночью спит, аренда продолжает списываться. Sovereign AI Gateway должен разделять интерактивные запросы и пакетные задачи. Для vLLM измеряйте p95/p99 TTFT, задержку между токенами, длину очереди и вытеснения KV-cache. Фоновую нагрузку допускайте только в пределах запаса интерактивного SLO. Производительность сравнивайте при одинаковых модели, качестве, входных контекстах и длинах ответов; энергетическую эффективность — по полезным выходным токенам на джоуль всего сервера. Условный расчёт, не рыночная котировка: облачный контур обходится в 600 тысяч ₽/месяц, собственный — в 300 тысяч с амортизацией, питанием, размещением, эксплуатацией и резервом. При 120 млрд выходных токенов в пределах SLO это 5 против 2,5 ₽ за миллион. Но если собственный контур выдаёт лишь 30 млрд, получится уже 10 ₽. Это средняя полная себестоимость. Предельную считайте отдельно: сколько стоит дополнительный объём до исчерпания мощности и после покупки следующего узла. Bare-metal даёт контроль над этой кривой, а не освобождение от арифметики. Постоянную нагрузку и резерв нужно обосновывать загрузкой, отказоустойчивостью и сроком владения. Требуйте от архитектуры стоимость миллиона полезных токенов при заданном SLO и отказе одного узла. Суверенитет вычислений начинается с измерений: https://run-as-daemon.dev.
Санитайзер перед облачной моделью бесполезен, если SDK первым делом отправляет тело запроса в телеметрию. Промпт может покинуть контур раньше инференса: через APM, экспорт трассировок, отчёт об исключении. Вы купили «защищённый AI», но построили несколько независимых каналов вывоза данных. Граница должна проходить до внешнего SDK: локальная сборка контекста → минимизация данных → обнаружение PII → замена сущностей → проверка разрешённого содержимого → внешний вызов. Проверяется весь собранный запрос, включая RAG-фрагменты и результаты инструментов. Таблица обратных подстановок хранится локально, с ограниченным TTL и привязкой к запросу. В телеметрию идут коды решений и счётчики, без тела промпта. Обратимая замена идентификаторов сама по себе не доказывает обезличивание. Метрики: доля пропущенных сущностей на размеченном корпусе, ложные блокировки, p95 задержки санитизации, число внешних экспортов сырого payload. Последний показатель должен быть нулём; проверяйте его синтетическими марк...
Санитайзер перед облачной моделью бесполезен, если SDK первым делом отправляет тело запроса в телеметрию. Промпт может покинуть контур раньше инференса: через APM, экспорт трассировок, отчёт об исключении. Вы купили «защищённый AI», но построили несколько независимых каналов вывоза данных. Граница должна проходить до внешнего SDK: локальная сборка контекста → минимизация данных → обнаружение PII → замена сущностей → проверка разрешённого содержимого → внешний вызов. Проверяется весь собранный запрос, включая RAG-фрагменты и результаты инструментов. Таблица обратных подстановок хранится локально, с ограниченным TTL и привязкой к запросу. В телеметрию идут коды решений и счётчики, без тела промпта. Обратимая замена идентификаторов сама по себе не доказывает обезличивание. Метрики: доля пропущенных сущностей на размеченном корпусе, ложные блокировки, p95 задержки санитизации, число внешних экспортов сырого payload. Последний показатель должен быть нулём; проверяйте его синтетическими маркерами на всех выходах. Экономику считайте по разрешённым запросам: условные 30 000 ₽ в месяц на локальный шлюз при 3 млн запросов дают 0,01 ₽ на запрос до стоимости инференса. К облачному счёту добавляйте APM, хранение логов и сетевой экспорт по своему тарифу. Если задачу нельзя решить без исходных персональных данных, запрос остаётся на локальном инференсе. Собственный bare-metal тоже требует контроля логов и доступа: владение GPU не исправляет дырявый маршрут данных. Sovereign AI Gateway начинается с права решать, какие байты вообще пересекут границу: https://run-as-daemon.dev.
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданно...
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданной конкурентности, токены/Дж на уровне всей системы. Условный бюджет: 180 000 ₽/мес. с амортизацией, электричеством, эксплуатацией и резервом при 300 млн выходных токенов даёт 600 ₽/млн. При 30 млн — уже 6 000 ₽/млн. Cloud API сравниваем по полному счёту за тот же набор запросов, включая входные токены, при сопоставимом качестве и SLA. Облачный тариф покупает обработку в чужом контуре. Bare-metal даёт возможность самому задать границу доступа — и обязанность проверить её. Уберите секреты из журналов, ограничьте административный доступ, запретите произвольный исходящий трафик. Приватность подтверждается проверками, а экономика — измеренной загрузкой. Архитектура суверенного инференса: https://run-as-daemon.dev.
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и ин...
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и интервале закрепления 10 секунд до 1000 событий остаются без независимого якоря. Для критических операций проектируем подтверждение записи намерения до исполнения; результат фиксируем отдельно. Сам журнал не заменяет ограничения полномочий агента. Экономика проверяется арифметикой: при 1 КБ на событие и 100 событиях/с получаем 8,64 ГБ/сутки, за 30 дней — 259,2 ГБ без индексов и реплик. Облачный счёт считаем как приём \+ хранение \+ запросы \+ применимый egress; bare-metal — амортизация \+ диски \+ питание \+ эксплуатация независимого свидетеля. Владение сервером само по себе доказательств не создаёт. Архитектура суверенного контура: https://run-as-daemon.dev.
www.rfc-editor.org
RFC 9162: Certificate Transparency Version 2.0
This document describes version 2.0 of the Certificate Transparency (CT)
protocol for publicly logging the existence of Transport Layer Security (TLS)
server certificates as they are issued or observed, in a manner that allows
anyone to audit certification…
protocol for publicly logging the existence of Transport Layer Security (TLS)
server certificates as they are issued or observed, in a manner that allows
anyone to audit certification…
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости...
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости токена, данные и право выбирать режим деградации. Архитектура суверенного AI Gateway: https://run-as-daemon.dev
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разреш...
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разрешено действовать только тогда, когда его решение можно независимо проверить после компрометации узла.
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура S...
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура Sovereign AI Gateway и инженерные разборы приватного инференса: https://run-as-daemon.dev
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway