run-as-daemon.dev
13 subscribers
86 photos
128 links
Download Telegram
Агент получил доступ к API, shell или платежному шлюзу — значит, в контуре появился новый привилегированный субъект. Обычный JSON-лог не доказывает ничего: root на узле может удалить событие, заменить аргументы инструмента или подменить версию политики. Минимальная запись решения: workload identity, digest модели и system prompt, digest policy bundle, входные данные после локальной PII-санитизации, вызов инструмента, результат, монотонный counter и timestamp. Событие подписывает TPM/HSM; корни Merkle-пакетов каждые 10–60 секунд уходят на независимый witness-узел по WireGuard с AllowedIPs /32. При 500 решениях/с и записи 2 КБ поток аудита составляет около 86,4 ГБ/сутки до сжатия — обычная bare-metal задача. Один неподтвержденный перевод, удаление production-данных или экспорт ПДн способен стоить дороже годового массива хранения. Облако продает журнал, но не независимость доказательства от владельца control plane. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev. Агенту разрешено действовать только тогда, когда его решение можно независимо проверить после компрометации узла.
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура S...
Коммерческая тайна не защищена NDA, если промпт, системный контекст и фрагменты RAG физически отправляются оператору Cloud API. Вы не контролируете его трассировку, резервные копии, субпроцессоров и географию обработки. Для данных под режимом 152-ФЗ это не удобство, а дополнительный контур риска. Рабочая схема: vLLM на bare metal, OpenAI-compatible endpoint без выхода в WAN, mTLS между сервисами, локальная PII-санитизация до inference gateway, шифрование дисков и отключённый request logging. В WireGuard mesh каждой ноде назначается отдельный AllowedIPs /32; маршрут не должен превращаться в разрешение всему сегменту. Экономику считают не ценой GPU, а себестоимостью миллиона полезных токенов: амортизация сервера, электричество, охлаждение, простой и фактическая загрузка. Сервер за 3,6 млн ₽ при амортизации 36 месяцев — 100 тыс. ₽ в месяц капитальных затрат. При стабильной очереди облачная наценка и egress исчезают, а предельная стоимость токена остаётся под вашим контролем. Архитектура Sovereign AI Gateway и инженерные разборы приватного инференса: https://run-as-daemon.dev
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Понедельник начинается не с планёрки, а с копирования данных в чужой чат.

Private node работает внутри юрисдикции клиента.
PII и секреты удаляются до отправки во внешнюю модель.
Каждый запрос остаётся в audit log. От 89 000 ₽/мес. run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway
Облачный капкан захлопывается не при загрузке данных, а при попытке их вывезти. AWS принимает трафик бесплатно, но за первые 10 ТБ исходящего трафика EC2 выставляет около $0,09 за ГБ. Массовая выгрузка — примерно $900, ещё до NAT Gateway, Transit Gateway и межзонных начислений. У GCP Premium Tier по отдельным направлениям первые диапазоны стоят $0,12–0,11 за GiB. Вывоз 10 TiB способен превысить $1100. Для 100 TiB это уже отдельная строка бюджета, которая наказывает миграцию, резервирование во втором контуре и отказ от поставщика. Bare-metal меняет экономику: канал оплачивается фиксированно, WireGuard mesh связывает площадки через узловые AllowedIPs /32, а репликация и бэкапы не получают облачный счётчик на каждом байте. Контролировать нужно не цену виртуальной машины, а полную стоимость владения данными: хранение, межзонный трафик, egress и время эвакуации. Если данные нельзя вывезти без согласования бюджета, вы ими не владеете. Архитектура Sovereign AI Gateway: https://run-as-daemon.dev
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereig...
Трансатлантический AI API проигрывает локальному инференсу на уровне физики. Один WAN round trip между российским контуром и зарубежным регионом обычно добавляет десятки или сотню миллисекунд ещё до очереди провайдера. В агентном сценарии из 10 последовательных вызовов этот налог складывается: модель может генерировать быстро, а пользователь всё равно ждёт сеть. Bare-metal vLLM в том же дата-центре сокращает сетевой RTT до единиц миллисекунд и делает измеримыми TTFT, inter-token latency и p99. Промпт проходит локальную PII-санитизацию, остаётся внутри контура 152-ФЗ, а WireGuard mesh с AllowedIPs /32 не позволяет маршруту самовольно превратиться в шлюз утечки. Экономика столь же беспощадна. Облачный API тарифицирует каждый успешный запрос, добавляет валютный риск и привязывает маржу продукта к чужому прайсу. Свой GPU требует CAPEX, но после точки загрузки владелец контролирует себестоимость токена, ватт и очередь — без egress fee и трансатлантической лотереи p99. Проектировать Sovereign AI Gateway: https://run-as-daemon.dev. Latency-инвариант прост: данные, оркестратор и инференс должны жить в одном контролируемом контуре.
Самая дорогая строка облачного договора — время, за которое вы способны его расторгнуть технически. Гравитация данных держится на объёме базы, скорости изменений и зависимостях приложения от managed-сервисов. Скидка на вывоз байтов не перепишет ваши процедуры, IAM-интеграции и очереди.
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получае...
Энергетическая плотность токена начинается у розетки. У RTX 4090 — 24 ГБ VRAM и паспортные 450 Вт; четыре карты дают 1,8 кВт только по GPU. EPYC, RAM, вентиляторы и потери питания добавляются сверху. NVLink отсутствует: четыре карты не превращаются в единую GPU с 96 ГБ. Для vLLM проверяем размещение модели, обмен через PCIe и размер KV-кэша. Источник: спецификация NVIDIA. Сценарий бюджета, не коммерческое предложение и не результат бенчмарка: узел стоит 1,8 млн ₽, амортизация за 36 месяцев — 50 000 ₽/мес. Допустим, среднее потребление всего сервера — 2 кВт, PUE площадки — 1,25, электричество — 7 ₽/кВт·ч. За 720 часов энергия стоит 12 600 ₽. Еще 40 000 ₽ закладываем на размещение без электричества, эксплуатацию и ремонтный резерв. Итого 102 600 ₽/мес; стоимость капитала и резервный узел потребуют отдельных строк. Если этот узел обслуживает заданный входной поток и выдает 100 млн выходных токенов за месяц, получаем 1026 ₽/млн и 18 Вт·ч на тысячу выходных токенов с учетом PUE. Это целевой сценарий, который надо подтвердить нагрузочным тестом: модель, квантизация, длина контекста, batch, p95 TTFT и скорость выдачи. В знаменатель идут ответы, прошедшие проверку качества. При десятикратном падении объема и прежних расходах себестоимость вырастет десятикратно. Azure OpenAI — не единая подписка: Standard тарифицирует вход и выход, Provisioned — выделенную мощность. Для 300 млн входных и 100 млн выходных токенов счет Standard равен 300 × цена миллиона входных \+ 100 × цена миллиона выходных; кэш учитываем отдельно. Берем тариф конкретной модели и региона, приводим валюту и налоги к одной базе. Выше 102 600 ₽ — наш сценарий дешевле, если выдерживает тот же SLA и качество. Дешевле — облако выигрывает по прямым расходам. Суверенитет дает контроль над вычислениями, но не отменяет арифметику: https://run-as-daemon.dev.
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gatewa...
Облачный GPU принадлежит вам ровно до письма от compliance. Замороженный billing, отозванный API key или санкционное решение превращают «отказоустойчивую» платформу в выключенный рубильник. Реплики в трёх зонах одного провайдера — не суверенитет, а три арендуемые розетки. Bare-metal контур начинается не с покупки ускорителя. Нужны локальные registry и репозиторий пакетов, vLLM без внешней активации, офлайн-копии весов и токенизаторов, запасные NIC и SSD, собственные ключи, WireGuard mesh с AllowedIPs /32 и PII-санитизация до входа в inference API. Проверка простая: выдерните WAN и выполните холодный запуск кластера. Экономика считается через полезные токены: токенов на ватт, загрузку GPU, длину очереди и стоимость простоя. При 70% загрузке сервер работает около 6130 часов в год. Даже CAPEX в 12 млн ₽, разложенный на три года, даёт примерно 652 ₽ за GPU-час до энергии и эксплуатации. Облако добавляет маржу, egress и право односторонне прекратить услугу. Архитектура суверенного AI Gateway: https://run-as-daemon.dev. Если вы не владеете железом, ключами и загрузочной цепочкой, вы владеете только договором аренды.
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архи...
Данные затягиваются в облако бесплатно, а выход проектируется как аварийная операция. База на 200 ТБ — это не один дамп: к ней прилипают WAL, объектное хранилище, реплики, поисковые индексы, KMS и проприетарные managed-сервисы. Скопировать байты недостаточно — нужно сохранить RPO, проверить целостность и переключить запись без потери транзакций. По публичной сетке AWS EC2 первые 200 ТБ egress стоят примерно $13 800: 10 ТБ × $0,09, 40 ТБ × $0,085, 100 ТБ × $0,07 и 50 ТБ × $0,05 за ГБ. Это лишь провод. Двойная эксплуатация, CDC, инженеры и простой легко делают миграцию на порядок дороже. Формальная льгота на полный уход не чинит архитектуру, если экспорт нельзя выполнить без остановки бизнеса. Суверенный контур строится с измеримым exit plan: PostgreSQL на bare metal, независимые бэкапы, открытые форматы, ежеквартальное восстановление, контроль RPO/RTO и WireGuard mesh с AllowedIPs /32. PII по 152-ФЗ санитизируется до выхода за границу контура, а не после записи в чужую трассировку. Архитектура, которую нельзя вывезти и поднять на собственном железе, вам не принадлежит. Практика суверенной инфраструктуры: https://run-as-daemon.dev
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт ...
Рекорд Biotropika Ultra Trail сначала объявили, затем аннулировали после разбора видеозаписей и регламента. Для приватного ИИ урок тот же: надпись on-prem ничего не доказывает, если cloud fallback, телеметрия SDK или внешний embeddings endpoint способны вынести промпт за контур. Рабочая схема: локальный OpenAI-compatible gateway → PII/DLP-санитизация до логирования → vLLM на bare-metal GPU → шифрованный журнал доступа. Между площадками — WireGuard mesh с уникальными AllowedIPs /32; на egress — default-deny и отдельный allowlist для репозиториев обновлений. Промпты, KV-cache и трассировки не пересекают границу контура. Экономику считают не ценой GPU, а рублями за 1 млн полезных токенов: амортизация сервера \+ энергия \+ стойка \+ дежурство, делённые на реально выданные токены. При стабильной загрузке bare metal гасит наценку API и убирает egress; при простое проигрывает. Поэтому перед закупкой фиксируют p95 TTFT, токенов/с, ватт на 1 тыс. токенов и utilization по часам. Контур и расчёт мощности проектируются до миграции данных: https://run-as-daemon.dev. Суверенный инференс — это проверяемый запрет на экспорт, а не обещание провайдера.
Облако дешевле только в счёте за токены.

Токены, egress, повторные запросы и ручной аудит не входят в цену модели.
Тариф private gateway — 89 000 ₽/мес. Точка окупаемости за три месяца — 267 000 ₽ предотвращённых расходов.
PII и секреты удаляются до внешней модели; каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Облако дешевле только в счёте за токены.

Egress, повторные запросы, очистка PII и аудит оплачиваются отдельно.
Если эти расходы превышают 89 000 ₽ в месяц, private gateway окупается за один квартал.
PII и секреты удаляются до внешней модели, каждый запрос остаётся в audit log.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольн...
Enterprise AI умирает не от дорогой модели, а от чужого счётчика. В облаке рост нагрузки не улучшает себестоимость: каждый GPU-час снова куплен по розничному тарифу. Добавьте простой зарезервированных инстансов, передачу данных, хранение логов и цену обязательного cloud fallback. Считать нужно не «цену GPU», а рубли за миллион полезных токенов: (амортизация \+ электричество \+ эксплуатация) / объём принятых токенов. Пример: узел за 4,8 млн ₽, срок 36 месяцев, загрузка 70%, потребление 3 кВт и энергия по 9 ₽/кВт·ч дают около 288 ₽/ч до обслуживания. При 25 000 полезных токенов/с это примерно 3,2 ₽ за миллион токенов. Подставьте свою производительность vLLM, SLA и процент брака — маркетинговая магия исчезнет. Bare-metal контур позволяет управлять тем, что действительно определяет маржу: batching, KV-cache, quantization, speculative decoding, tokens/s и tokens/kWh. PII очищается на границе, запросы не покидают юрисдикцию, а WireGuard mesh с AllowedIPs /32 не превращает сеть в бесконтрольный транзит. Это одновременно экономика и исполнимый контур 152-ФЗ. Архитектура Sovereign AI Gateway и инженерные разборы: https://run-as-daemon.dev. Пока GPU принадлежит провайдеру, ваша маржа принадлежит его тарифной политике.