run-as-daemon.dev
13 subscribers
98 photos
141 links
Download Telegram
Самый дорогой токен — тот, ради которого GPU весь день ждал пикового запроса. Enterprise покупает предсказуемую задержку: резерв под всплески, длинный контекст и отказ узла. Облачный капкан начинается, когда постоянный резерв оплачивают как временную потребность. Выручка ночью спит, аренда продолжает списываться. Sovereign AI Gateway должен разделять интерактивные запросы и пакетные задачи. Для vLLM измеряйте p95/p99 TTFT, задержку между токенами, длину очереди и вытеснения KV-cache. Фоновую нагрузку допускайте только в пределах запаса интерактивного SLO. Производительность сравнивайте при одинаковых модели, качестве, входных контекстах и длинах ответов; энергетическую эффективность — по полезным выходным токенам на джоуль всего сервера. Условный расчёт, не рыночная котировка: облачный контур обходится в 600 тысяч ₽/месяц, собственный — в 300 тысяч с амортизацией, питанием, размещением, эксплуатацией и резервом. При 120 млрд выходных токенов в пределах SLO это 5 против 2,5 ₽ за миллион. Но если собственный контур выдаёт лишь 30 млрд, получится уже 10 ₽. Это средняя полная себестоимость. Предельную считайте отдельно: сколько стоит дополнительный объём до исчерпания мощности и после покупки следующего узла. Bare-metal даёт контроль над этой кривой, а не освобождение от арифметики. Постоянную нагрузку и резерв нужно обосновывать загрузкой, отказоустойчивостью и сроком владения. Требуйте от архитектуры стоимость миллиона полезных токенов при заданном SLO и отказе одного узла. Суверенитет вычислений начинается с измерений: https://run-as-daemon.dev.
Санитайзер перед облачной моделью бесполезен, если SDK первым делом отправляет тело запроса в телеметрию. Промпт может покинуть контур раньше инференса: через APM, экспорт трассировок, отчёт об исключении. Вы купили «защищённый AI», но построили несколько независимых каналов вывоза данных. Граница должна проходить до внешнего SDK: локальная сборка контекста → минимизация данных → обнаружение PII → замена сущностей → проверка разрешённого содержимого → внешний вызов. Проверяется весь собранный запрос, включая RAG-фрагменты и результаты инструментов. Таблица обратных подстановок хранится локально, с ограниченным TTL и привязкой к запросу. В телеметрию идут коды решений и счётчики, без тела промпта. Обратимая замена идентификаторов сама по себе не доказывает обезличивание. Метрики: доля пропущенных сущностей на размеченном корпусе, ложные блокировки, p95 задержки санитизации, число внешних экспортов сырого payload. Последний показатель должен быть нулём; проверяйте его синтетическими марк...
Санитайзер перед облачной моделью бесполезен, если SDK первым делом отправляет тело запроса в телеметрию. Промпт может покинуть контур раньше инференса: через APM, экспорт трассировок, отчёт об исключении. Вы купили «защищённый AI», но построили несколько независимых каналов вывоза данных. Граница должна проходить до внешнего SDK: локальная сборка контекста → минимизация данных → обнаружение PII → замена сущностей → проверка разрешённого содержимого → внешний вызов. Проверяется весь собранный запрос, включая RAG-фрагменты и результаты инструментов. Таблица обратных подстановок хранится локально, с ограниченным TTL и привязкой к запросу. В телеметрию идут коды решений и счётчики, без тела промпта. Обратимая замена идентификаторов сама по себе не доказывает обезличивание. Метрики: доля пропущенных сущностей на размеченном корпусе, ложные блокировки, p95 задержки санитизации, число внешних экспортов сырого payload. Последний показатель должен быть нулём; проверяйте его синтетическими маркерами на всех выходах. Экономику считайте по разрешённым запросам: условные 30 000 ₽ в месяц на локальный шлюз при 3 млн запросов дают 0,01 ₽ на запрос до стоимости инференса. К облачному счёту добавляйте APM, хранение логов и сетевой экспорт по своему тарифу. Если задачу нельзя решить без исходных персональных данных, запрос остаётся на локальном инференсе. Собственный bare-metal тоже требует контроля логов и доступа: владение GPU не исправляет дырявый маршрут данных. Sovereign AI Gateway начинается с права решать, какие байты вообще пересекут границу: https://run-as-daemon.dev.
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданно...
Купили GPU, подняли vLLM с --api-key, объявили коммерческую тайну защищённой. Пропустили поверхность API: ключ защищает определённые группы маршрутов, а не весь сервер. Документация прямо предупреждает об этом: vLLM Security. Владеть железом и контролировать доступ к инференсу — две отдельные инженерные задачи. Схема развёртывания: клиент → Sovereign AI Gateway → vLLM в закрытом сегменте. На gateway — идентификация клиента, проверка прав, локальная PII-санитизация и явный список разрешённых методов и путей. Прямой доступ клиентов к порту vLLM запрещён. Межузловые соединения — через изолированную сеть или WireGuard mesh с отдельным AllowedIPs /32 для каждого IPv4-узла и фильтрацией портов. Служебные маршруты доступны только контуру управления. Приёмка измеряется: ноль доступных клиенту служебных маршрутов, ноль успешных прямых подключений к backend. Производительность проверяем на своих документах: p95 TTFT, выходные токены/с при заданной конкурентности, токены/Дж на уровне всей системы. Условный бюджет: 180 000 ₽/мес. с амортизацией, электричеством, эксплуатацией и резервом при 300 млн выходных токенов даёт 600 ₽/млн. При 30 млн — уже 6 000 ₽/млн. Cloud API сравниваем по полному счёту за тот же набор запросов, включая входные токены, при сопоставимом качестве и SLA. Облачный тариф покупает обработку в чужом контуре. Bare-metal даёт возможность самому задать границу доступа — и обязанность проверить её. Уберите секреты из журналов, ограничьте административный доступ, запретите произвольный исходящий трафик. Приватность подтверждается проверками, а экономика — измеренной загрузкой. Архитектура суверенного инференса: https://run-as-daemon.dev.
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и ин...
SHA-256 не мешает переписать историю целиком. Захватив агентский runtime вместе с журналом и ключом подписи, атакующий может пересчитать цепочку и подписать новую версию. Проверка сойдётся. Без ранее сохранённого независимого якоря расследование получит аккуратную легенду о том, кто разрешил агенту открыть периметр. В Sovereign AI Gateway журнал пишет посредник исполнения: идентификатор агента, версия политики, решение авторизации, хеш канонического запроса инструмента, результат. Агент не получает ключ журнала. Подписанные корни дерева Merkle и число записей сохраняет свидетель с отдельными полномочиями. Проверяем включение событий и согласованность последовательных состояний — такой механизм описан в RFC 9162 для Certificate Transparency. Подпись подтверждает происхождение записи, а не истинность её содержания. Архитектурные метрики: задержка получения корня свидетелем, число неподтверждённых событий, p99 записи. При 100 действиях/с и интервале закрепления 10 секунд до 1000 событий остаются без независимого якоря. Для критических операций проектируем подтверждение записи намерения до исполнения; результат фиксируем отдельно. Сам журнал не заменяет ограничения полномочий агента. Экономика проверяется арифметикой: при 1 КБ на событие и 100 событиях/с получаем 8,64 ГБ/сутки, за 30 дней — 259,2 ГБ без индексов и реплик. Облачный счёт считаем как приём \+ хранение \+ запросы \+ применимый egress; bare-metal — амортизация \+ диски \+ питание \+ эксплуатация независимого свидетеля. Владение сервером само по себе доказательств не создаёт. Архитектура суверенного контура: https://run-as-daemon.dev.
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости...
Холодный старт vLLM начинается не с первого токена, а с загрузки весов, инициализации CUDA, захвата графов и выделения KV-cache. Если реплика создаётся уже после скачка RPS, autoscaling опоздал: пользователи платят TTFT, а бизнес — потерянной конверсией. Базовая схема для пика: минимум одна прогретая резервная реплика, chunked prefill, continuous batching, prefix caching и маршрутизация по cache affinity. Контролировать нужно p95 TTFT, inter-token latency, долю cache hit, preemption rate и занятость KV-блоков. Масштабирование запускается по длине очереди и свободному KV-cache, а не по усреднённой загрузке GPU. Экономика считается честно: сервер за 3 млн ₽ при трёхлетней амортизации и 70% загрузке — около 163 ₽/час капитальных затрат; добавьте электричество, охлаждение и эксплуатацию. Если эквивалентная облачная GPU стоит 400 ₽/час, разница превышает 2 млн ₽ в год непрерывной работы — ещё до egress, API-наценки и риска вывода PII за контур. Bare-metal vLLM оставляет вам кривую стоимости токена, данные и право выбирать режим деградации. Архитектура суверенного AI Gateway: https://run-as-daemon.dev
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разреш...
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разрешено действовать только тогда, когда его решение можно независимо проверить после компрометации узла.
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура S...
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура Sovereign AI Gateway и инженерные разборы приватного инференса: https://run-as-daemon.dev
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Облачный капкан захлопывается не при загрузке данных, а при попытке их вывезти. AWS принимает трафик бесплатно, но за первые 10 ТБ исходящего трафика EC2 выставляет около $0,09 за ГБ. Массовая выгрузка — примерно $900, ещё до NAT Gateway, Transit Gateway и межзонных начислений. У GCP Premium Tier по отдельным направлениям первые диапазоны стоят $0,12–0,11 за GiB. Вывоз 10 TiB способен превысить $1100. Для 100 TiB это уже отдельная строка бюджета, которая наказывает миграцию, резервирование во втором контуре и отказ от поставщика. Bare-metal меняет экономику: канал оплачивается фиксированно, WireGuard mesh связывает площадки через узловые AllowedIPs /32, а репликация и бэкапы не получают облачный счётчик на каждом байте. Контролировать нужно не цену виртуальной машины, а полную стоимость владения данными: хранение, межзонный трафик, egress и время эвакуации. Если данные нельзя вывезти без согласования бюджета, вы ими не владеете. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereig...
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereign AI Gateway: https://run-as-daemon.dev. Latency-инвариант прост: данные, оркестратор и инференс должны жить в одном контролируемом контуре.
Самая дорогая строка облачного договора — время, за которое вы способны его расторгнуть технически. Гравитация данных держится на объёме базы, скорости изменений и зависимостях приложения от managed-сервисов. Скидка на вывоз байтов не перепишет ваши процедуры, IAM-интеграции и очереди.
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получае...
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получаем 1026 ₽/млн и 18 Вт·ч на тысячу выходных токенов с учетом PUE. Это целевой сценарий, который надо подтвердить нагрузочным тестом: модель, квантизация, длина контекста, batch, p95 TTFT и скорость выдачи. В знаменатель идут ответы, прошедшие проверку качества. При десятикратном падении объема и прежних расходах себестоимость вырастет десятикратно. Azure OpenAI — не единая подписка: Standard тарифицирует вход и выход, Provisioned — выделенную мощность. Для 300 млн входных и 100 млн выходных токенов счет Standard равен 300 × цена миллиона входных \+ 100 × цена миллиона выходных; кэш учитываем отдельно. Берем тариф конкретной модели и региона, приводим валюту и налоги к одной базе. Выше 102 600 ₽ — наш сценарий дешевле, если выдерживает тот же SLA и качество. Дешевле — облако выигрывает по прямым расходам. Суверенитет дает контроль над вычислениями, но не отменяет арифметику: https://run-as-daemon.dev.