run-as-daemon.dev
13 subscribers
82 photos
124 links
Download Telegram
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура S...
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура Sovereign AI Gateway и инженерные разборы приватного инференса: https://run-as-daemon.dev
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Облачный капкан захлопывается не при загрузке данных, а при попытке их вывезти. AWS принимает трафик бесплатно, но за первые 10 ТБ исходящего трафика EC2 выставляет около $0,09 за ГБ. Массовая выгрузка — примерно $900, ещё до NAT Gateway, Transit Gateway и межзонных начислений. У GCP Premium Tier по отдельным направлениям первые диапазоны стоят $0,12–0,11 за GiB. Вывоз 10 TiB способен превысить $1100. Для 100 TiB это уже отдельная строка бюджета, которая наказывает миграцию, резервирование во втором контуре и отказ от поставщика. Bare-metal меняет экономику: канал оплачивается фиксированно, WireGuard mesh связывает площадки через узловые AllowedIPs /32, а репликация и бэкапы не получают облачный счётчик на каждом байте. Контролировать нужно не цену виртуальной машины, а полную стоимость владения данными: хранение, межзонный трафик, egress и время эвакуации. Если данные нельзя вывезти без согласования бюджета, вы ими не владеете. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereig...
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereign AI Gateway: https://run-as-daemon.dev. Latency-инвариант прост: данные, оркестратор и инференс должны жить в одном контролируемом контуре.
Самая дорогая строка облачного договора — время, за которое вы способны его расторгнуть технически. Гравитация данных держится на объёме базы, скорости изменений и зависимостях приложения от managed-сервисов. Скидка на вывоз байтов не перепишет ваши процедуры, IAM-интеграции и очереди.
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получае...
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получаем 1026 ₽/млн и 18 Вт·ч на тысячу выходных токенов с учетом PUE. Это целевой сценарий, который надо подтвердить нагрузочным тестом: модель, квантизация, длина контекста, batch, p95 TTFT и скорость выдачи. В знаменатель идут ответы, прошедшие проверку качества. При десятикратном падении объема и прежних расходах себестоимость вырастет десятикратно. Azure OpenAI — не единая подписка: Standard тарифицирует вход и выход, Provisioned — выделенную мощность. Для 300 млн входных и 100 млн выходных токенов счет Standard равен 300 × цена миллиона входных \+ 100 × цена миллиона выходных; кэш учитываем отдельно. Берем тариф конкретной модели и региона, приводим валюту и налоги к одной базе. Выше 102 600 ₽ — наш сценарий дешевле, если выдерживает тот же SLA и качество. Дешевле — облако выигрывает по прямым расходам. Суверенитет дает контроль над вычислениями, но не отменяет арифметику: https://run-as-daemon.dev.
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gatewa...
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gateway: https://run-as-daemon.dev. Если вы не владеете железом, ключами и загрузочной цепочкой, вы владеете только договором аренды.
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архи...
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архитектура, которую нельзя вывезти и поднять на собственном железе, вам не принадлежит. Практика суверенной инфраструктуры: https://run-as-daemon.dev
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт ...
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт мощности проектируются до миграции данных: https://run-as-daemon.dev. Суверенный инференс — это проверяемый запрет на экспорт, а не обещание провайдера.
Облако дешевле только в счёте за токены.

Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Облако дешевле только в счёте за токены.

Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольн...
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольный транзит. Это одновременно экономика и исполнимый контур 152-ФЗ. Архитектура Sovereign AI Gateway и инженерные разборы: https://run-as-daemon.dev. Пока GPU принадлежит провайдеру, ваша маржа принадлежит его тарифной политике.
Удалить телефон регуляркой — ещё не санитизация. «Единственный инженер филиала, госпитализированный после аварии 12 мая» может идентифицировать человека без ФИО. Облачный API получает связь между фактами. Поэтому проверять нужно окончательно собранный запрос, включая историю диалога, RAG-фрагменты, результаты инструментов и текст вложений. Архитектура: сборка контекста внутри контура → локальное обнаружение идентификаторов и чувствительных связей → удаление, обобщение или подстановка → решение о маршруте. Таблица обратимых подстановок остаётся локально; сама подстановка не гарантирует анонимность. Не прошедший проверку запрос направляется в локальный vLLM либо блокируется. Исходный текст исключаем из внешней телеметрии и журналов ошибок. Приёмочные метрики: доля пропущенных идентификаторов на размеченном наборе, доля ошибочных блокировок, p95 задержки санитизации и сохранение качества ответа после очистки. Условная экономика: 10 млн запросов в месяц при дополнительных 20 мс CPU на запр...