Аудит AI-агентов: почему отсутствие криптографического лога решений превращает автономную систему в угрозу периметру Автономный агент принимает решения: вызывает инструменты, эскалирует привилегии, инициирует HTTP-запросы внутри меша. Без верифицируемого лога каждого decision step ты не можешь восстановить цепочку причинности после инцидента. Ты получаешь только симптомы — аномальный трафик, дренаж VRAM, неожиданный egress — но не root cause. Это не observability, это угадайка. Минимально достаточная архитектура: каждый action агента пишется в append-only лог с HMAC-подписью на ключе, изолированном в HSM или sealed Vault Transit. Структура записи: timestampns, agentid, actiontype, toolname, inputhash (SHA-256 от сериализованного payload), outputhash, parentdecisionid. Цепочка строится через parentdecisionid — это твой Merkle-образный граф решений. Попытка retroactive подмены записи ломает HMAC-верификацию всей последующей цепочки. Forensics становится детерминированным. Без этого каждая автономная сессия агента — это unsigned execution с сетевым доступом внутри твоего WireGuard меша. Агент, скомпрометированный через prompt injection или сбойный tool response, может латерально двигаться по AllowedIPs, и ты это обнаружишь только по аномалии в трафике, не по логу решений. eBPF-политика блокирует syscall, но не блокирует легитимный tool call с вредоносным payload — только криптографический аудит трассирует намерение. Практика на bare-metal: loki \+ custom structured log shipper, каждая запись подписывается через age-шифрование или Vault Transit HMAC, retention — immutable S3-совместимое хранилище на локальном MinIO с WORM-политикой. Стоимость на собственном железе: ~0 egress, ~$0.003/GB хранения против $0.023/GB S3 у гиперскейлера плюс egress при каждом forensic-запросе. При инциденте ты платишь облаку дважды: за хранение и за право посмотреть на собственные логи. https://run-as-daemon.dev
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным...
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным заново. Bare-metal ответ: Postgres 16 на локальном NVMe, Patroni для HA, pgBackRest для инкрементальных бэкапов в свой S3-совместимый MinIO, репликация через WireGuard mesh между площадками. Стоимость egress при смене ЦОДа: транспортные расходы на диск или аренда 10G cross-connect — фиксированная стоимость, не процент от объёма данных. Никаких счётчиков, никаких сюрпризов в конце месяца. Полный расчёт TCO по модели суверенного bare-metal Postgres с Patroni и граничной PII-санитизацией — на https://run-as-daemon.dev. Данные в вашем ЦОДе платят egress только один раз: когда вы их туда привезли.
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серь...
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серьёзном трафике. Latency — это не UX-метрика для дизайнера. Это архитектурный инвариант, который определяет, кто контролирует критический путь твоего продукта. Подробнее о построении суверенного inference-контура — https://run-as-daemon.dev
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реал...
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реальный средний чек $0.008–0.010 за 1K токенов. Разрыв: 20–40x не в пользу облака. То, что Azure и AWS называют «гибкостью» — это егресс-локин плюс отсутствие контроля над кривой предельной стоимости. Когда нагрузка растёт, гиперскейлер масштабирует вашу боль линейно по прайсу. Bare-metal кластер масштабирует стоимость токена вниз по мере роста утилизации — это и есть суверенная экономика инференса. https://run-as-daemon.dev
Автономный RAG в закрытом контуре: архитектура без компромиссов Закрытый периметр без выхода в WAN — это не экзотика для оборонки. Это нормальная архитектура для любого оператора персональных данных под 152-ФЗ, промышленного предприятия или финтеха, которому надоело объяснять регулятору, почему запросы клиентов уходят в us-east-1. Собираем стек полностью внутри периметра. Архитектура: один EPYC-узел с NVMe RAID, 4x RTX 4090 под vLLM (AWQ 4-bit, mistral-7b или qwen2-14b по задаче), Qdrant на том же хосте или выделенном bare-metal-соседе через WireGuard /32 AllowedIPs. Embedding-модель (e5-mistral или bge-m3) запускается локально — никакого обращения к OpenAI Embeddings API. Ingestion pipeline: документы парсятся внутри контура, чанкуются, векторизуются, индексируются. Ни один токен не покидает L3-кэш вашего процессора до того, как попадёт в Qdrant. DNS резолвится только во внутреннюю зону. Firewall-правило: default deny outbound, whitelist только внутренние подсети mesh. ТCO против обла...
Автономный RAG в закрытом контуре: архитектура без компромиссов Закрытый периметр без выхода в WAN — это не экзотика для оборонки. Это нормальная архитектура для любого оператора персональных данных под 152-ФЗ, промышленного предприятия или финтеха, которому надоело объяснять регулятору, почему запросы клиентов уходят в us-east-1. Собираем стек полностью внутри периметра. Архитектура: один EPYC-узел с NVMe RAID, 4x RTX 4090 под vLLM (AWQ 4-bit, mistral-7b или qwen2-14b по задаче), Qdrant на том же хосте или выделенном bare-metal-соседе через WireGuard /32 AllowedIPs. Embedding-модель (e5-mistral или bge-m3) запускается локально — никакого обращения к OpenAI Embeddings API. Ingestion pipeline: документы парсятся внутри контура, чанкуются, векторизуются, индексируются. Ни один токен не покидает L3-кэш вашего процессора до того, как попадёт в Qdrant. DNS резолвится только во внутреннюю зону. Firewall-правило: default deny outbound, whitelist только внутренние подсети mesh. ТCO против облачного RAG: облачный вариант на AWS — Bedrock embeddings \+ OpenSearch Serverless \+ Bedrock inference — при 10 млн токенов в день выходит в $3 200–4 800 в месяц только на инференс и векторный поиск, плюс egress за каждый байт ответа наружу. Bare-metal амортизация 4x4090 \+ EPYC за 36 месяцев даёт $0.0008–0.0012 за 1K токенов с учётом электричества по российскому тарифу. Разница — пять порядков при масштабе. При этом PII никогда не покидает контур, Qdrant-индекс шифруется на уровне LUKS, AmneziaWG между узлами mesh закрывает транспортный слой. Критичная деталь: холодный старт vLLM после простоя — 800–1200 мс на первый запрос. Держите прогревочный endpoint на keepalive-таймере внутри контура, иначе первый пользователь после ночи получит таймаут и напишет, что «AI не работает». Это решается systemd-юнитом с ExecStartPost curl к /health и минимальным dummy-запросом сразу после старта процесса. https://run-as-daemon.dev
Автономный RAG в закрытом контуре — это не экзотика. Это единственная архитектура, которая выдерживает проверку 152-ФЗ, внутренний аудит безопасности и здравый смысл одновременно. Стек без WAN выглядит так: sentence-transformers (BGE-M3 или E5-large) запускается локально на CPU/GPU, генерирует эмбеддинги прямо на ingestion-пайплайне. Qdrant поднят на том же bare-metal узле, индекс лежит на NVMe с шифрованием LUKS, snapshotting — локально через rsync на резервный том. vLLM с моделью Mistral 7B AWQ обслуживает запросы только через unix-сокет или localhost:8000 — никакого внешнего биндинга. Весь трафик между компонентами — петлевой интерфейс или WireGuard mesh AllowedIPs /32 между узлами контура. DNS резолвится через локальный CoreDNS без форвардеров во внешний мир. ТСО: сервер 2x EPYC 9354 \+ 4x RTX 4090 амортизируется за 36 месяцев в ~$0.0008 за 1K токенов при загрузке 60%. Azure OpenAI GPT-4o на том же объёме — $0.005 за 1K input токенов, и это без egress за извлечённые чанки, без стои...
Автономный RAG в закрытом контуре — это не экзотика. Это единственная архитектура, которая выдерживает проверку 152-ФЗ, внутренний аудит безопасности и здравый смысл одновременно. Стек без WAN выглядит так: sentence-transformers (BGE-M3 или E5-large) запускается локально на CPU/GPU, генерирует эмбеддинги прямо на ingestion-пайплайне. Qdrant поднят на том же bare-metal узле, индекс лежит на NVMe с шифрованием LUKS, snapshotting — локально через rsync на резервный том. vLLM с моделью Mistral 7B AWQ обслуживает запросы только через unix-сокет или localhost:8000 — никакого внешнего биндинга. Весь трафик между компонентами — петлевой интерфейс или WireGuard mesh AllowedIPs /32 между узлами контура. DNS резолвится через локальный CoreDNS без форвардеров во внешний мир. ТСО: сервер 2x EPYC 9354 \+ 4x RTX 4090 амортизируется за 36 месяцев в ~$0.0008 за 1K токенов при загрузке 60%. Azure OpenAI GPT-4o на том же объёме — $0.005 за 1K input токенов, и это без egress за извлечённые чанки, без стоимости хранения индекса в облачном векторном хранилище, без аудита трассировки запросов. Разрыв в себестоимости — 6x в пользу железа уже на горизонте первого года. Gap, который закрывает закрытый контур: никакой утечки PII в embedding API, никаких логов запросов на стороне провайдера, полный контроль над версией модели без silent deprecation, соответствие 152-ФЗ без бумажных компенсирующих мер. Архитектура подробнее — https://run-as-daemon.dev
Гравитация данных — это когда стоимость выхода превышает стоимость остаться. Именно на этом построен весь бизнес облачных баз данных. RDS PostgreSQL на db.r6g.2xlarge: ~$580/месяц за инстанс плюс $230/месяц за хранилище 2 TB gp3. Итого $810/мес. Кажется терпимо — до момента, когда ты решаешь уйти. Egress: $0.09/GB за пределы региона AWS. При 2 TB базы — $184 только за физическую выгрузку данных. При 10 TB — $921 единоразово. При логической репликации через DMS добавь ещё $0.015/GB обработки — это их собственный инструмент миграции, который берёт деньги за помощь тебе сбежать. Bare-metal альтернатива: EPYC 9354 (32 ядра), 256 GB DDR5 ECC, 4x NVMe 3.84 TB — аренда в российском ЦОД от 180 000 руб/мес или покупка сервера ~1.4 млн руб с амортизацией 36 месяцев \= 38 888 руб/мес. Postgres 16, Patroni, pgBackRest в локальный S3-совместимый хранилище. Egress внутри собственного WireGuard mesh — ноль рублей. Миграция из облака: один раз, одна боль, навсегда. Архитектурный принцип суверенной инф...
Гравитация данных — это когда стоимость выхода превышает стоимость остаться. Именно на этом построен весь бизнес облачных баз данных. RDS PostgreSQL на db.r6g.2xlarge: ~$580/месяц за инстанс плюс $230/месяц за хранилище 2 TB gp3. Итого $810/мес. Кажется терпимо — до момента, когда ты решаешь уйти. Egress: $0.09/GB за пределы региона AWS. При 2 TB базы — $184 только за физическую выгрузку данных. При 10 TB — $921 единоразово. При логической репликации через DMS добавь ещё $0.015/GB обработки — это их собственный инструмент миграции, который берёт деньги за помощь тебе сбежать. Bare-metal альтернатива: EPYC 9354 (32 ядра), 256 GB DDR5 ECC, 4x NVMe 3.84 TB — аренда в российском ЦОД от 180 000 руб/мес или покупка сервера ~1.4 млн руб с амортизацией 36 месяцев \= 38 888 руб/мес. Postgres 16, Patroni, pgBackRest в локальный S3-совместимый хранилище. Egress внутри собственного WireGuard mesh — ноль рублей. Миграция из облака: один раз, одна боль, навсегда. Архитектурный принцип суверенной инфраструктуры: данные должны жить там, где стоимость их удержания и стоимость их перемещения одинаково равны нулю. Всё остальное — аренда клетки. https://run-as-daemon.dev
Сценарий не гипотетический: OpenAI меняет ToS, вводит geo-restriction или просто падает — и твой продукт лежит вместе с ними. Ты не клиент, ты арендатор вычислений у компании, которой ты не платишь зарплату и не имеешь акций. Что стоит суверенный стек реально? 2x EPYC 9354 \+ 4x RTX 4090, 256 GB ECC RAM: CAPEX ~$28 000. Llama 3.1 70B в AWQ 4-bit, vLLM, tensor parallelism across 4 GPU. Throughput: ~1 200 tokens/s на batch. Стоимость токена при амортизации 36 мес \+ электричество (~$0.12/kWh, ~3.2 kW под нагрузкой) — выходит порядка $0.0004 за 1K output tokens. GPT-4o: $0.015 за 1K output tokens. Разница — 37x. На объёме 1B токенов в месяц это разница между $400 и $15 000 в кармане. Архитектурный периметр: модель не покидает контур. PII-санитизация на ingress через presidio или self-hosted NER до того, как строка попала в prompt. WireGuard mesh с AllowedIPs /32 на каждый spoke — никакого lateral movement. Веса залочены на iron read-only mount, контрольная сумма SHA-256 при старте vLLM-се...
Сценарий не гипотетический: OpenAI меняет ToS, вводит geo-restriction или просто падает — и твой продукт лежит вместе с ними. Ты не клиент, ты арендатор вычислений у компании, которой ты не платишь зарплату и не имеешь акций. Что стоит суверенный стек реально? 2x EPYC 9354 \+ 4x RTX 4090, 256 GB ECC RAM: CAPEX ~$28 000. Llama 3.1 70B в AWQ 4-bit, vLLM, tensor parallelism across 4 GPU. Throughput: ~1 200 tokens/s на batch. Стоимость токена при амортизации 36 мес \+ электричество (~$0.12/kWh, ~3.2 kW под нагрузкой) — выходит порядка $0.0004 за 1K output tokens. GPT-4o: $0.015 за 1K output tokens. Разница — 37x. На объёме 1B токенов в месяц это разница между $400 и $15 000 в кармане. Архитектурный периметр: модель не покидает контур. PII-санитизация на ingress через presidio или self-hosted NER до того, как строка попала в prompt. WireGuard mesh с AllowedIPs /32 на каждый spoke — никакого lateral movement. Веса залочены на iron read-only mount, контрольная сумма SHA-256 при старте vLLM-сервера. Рубильника нет физически — потому что он у тебя в руках. Открытые веса — это не про «бесплатно», это про право собственности на предельную стоимость токена и нулевую зависимость от решений совета директоров в Сан-Франциско. Детали архитектуры — на https://run-as-daemon.dev
Проприетарный API — это аренда мозга с правом выселения. Каждый вызов gpt-4o или claude-3-opus уходит через атлантический кабель: 180-220 мс RTT до us-east-1, плюс очередь на чужом GPU, плюс egress, плюс токен-прайсинг, который меняется unilaterally. Ты не клиент — ты зависимость в чужом P&L. Open-weights считаются иначе. Llama-3-70B-Instruct на 4x H100 NVL: амортизация железа за 36 месяцев \+ электричество \= $0.00021 за 1K токенов. GPT-4o через API — $0.005 входящих, $0.015 исходящих. На объёме 1B токенов в месяц разница — это не строка в бюджете, это отдельный инженер и три сервера. Считай сам. Рубильник — реальная угроза, не паранойя. В 2023-м OpenAI заблокировал API для ряда юрисдикций без предупреждения. В 2024-м Anthropic ограничил корпоративный доступ по compliance-флагам. Ни один из этих событий не был в SLA. Потому что SLA у проприетарного API не защищает от политического решения в Калифорнии. Скачанные веса Mistral, Qwen или Llama не пингуют домой — они работают в твоём конт...
Проприетарный API — это аренда мозга с правом выселения. Каждый вызов gpt-4o или claude-3-opus уходит через атлантический кабель: 180-220 мс RTT до us-east-1, плюс очередь на чужом GPU, плюс egress, плюс токен-прайсинг, который меняется unilaterally. Ты не клиент — ты зависимость в чужом P&L. Open-weights считаются иначе. Llama-3-70B-Instruct на 4x H100 NVL: амортизация железа за 36 месяцев \+ электричество \= $0.00021 за 1K токенов. GPT-4o через API — $0.005 входящих, $0.015 исходящих. На объёме 1B токенов в месяц разница — это не строка в бюджете, это отдельный инженер и три сервера. Считай сам. Рубильник — реальная угроза, не паранойя. В 2023-м OpenAI заблокировал API для ряда юрисдикций без предупреждения. В 2024-м Anthropic ограничил корпоративный доступ по compliance-флагам. Ни один из этих событий не был в SLA. Потому что SLA у проприетарного API не защищает от политического решения в Калифорнии. Скачанные веса Mistral, Qwen или Llama не пингуют домой — они работают в твоём контуре, под твоим WireGuard-мешем, под твоей ответственностью и под твоим контролем. Архитектура суверенного инференса: vLLM на bare-metal, PII-санитайзер на границе контура до выхода в любую внешнюю шину, веса на локальном NVMe с dm-crypt, ротация моделей без даунтайма через --model swap. Никакого колл-хоума, никакого vendor lock-in, никаких сюрпризов в ToS-ночи. Детали на https://run-as-daemon.dev.
Западные облака — это чужая юрисдикция.
Каждый LLM-запрос из вашей системы уходит в Вирджинию или Ирландию. Логируется. Обрабатывается по правилам американского права. Подпадает под CLOUD Act.
RANAS Sovereign AI Gateway устроен иначе:
- Разворачивается внутри вашего периметра (on-prem или частное облако)
- Все данные остаются в вашей юрисдикции
- PII и секреты вырезаются из запроса до отправки во внешнюю модель
- Полный audit log хранится локально, не у вендора
- OpenAI-совместимый API — замена без переписывания кода
Суверенитет — это не настройка в интерфейсе. Это архитектурное решение.
От 89 000 ₽/мес. Демо по запросу.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Каждый LLM-запрос из вашей системы уходит в Вирджинию или Ирландию. Логируется. Обрабатывается по правилам американского права. Подпадает под CLOUD Act.
RANAS Sovereign AI Gateway устроен иначе:
- Разворачивается внутри вашего периметра (on-prem или частное облако)
- Все данные остаются в вашей юрисдикции
- PII и секреты вырезаются из запроса до отправки во внешнюю модель
- Полный audit log хранится локально, не у вендора
- OpenAI-совместимый API — замена без переписывания кода
Суверенитет — это не настройка в интерфейсе. Это архитектурное решение.
От 89 000 ₽/мес. Демо по запросу.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Холодный старт vLLM — это не «немного подождать». Это архитектурная катастрофа на пиковой нагрузке, которую облако прячет за auto-scaling с задержкой 90–180 секунд и выставляет вам счёт за каждую новую инстанцию. Что происходит под капотом: при холодном старте KV-cache пуст. Каждый prefill-запрос тянет полный контекст с нуля. На модели 70B с контекстом 8K это 1.2–2.4 секунды чистого TTFT (time-to-first-token) только на prefill, без учёта IO и планировщика. Prefix caching в vLLM решает это для повторяющихся системных промптов — хэш первых N токенов кэшируется в GPU VRAM. Попадание в кэш срезает prefill-фазу до 40–80 мс. Но это работает только если ты контролируешь планировщик локально, а не отдаёшь его облачному black box. Chunked prefill — второй рычаг. Вместо монолитной prefill-фазы, которая блокирует decode-слот на 1–3 секунды, разбиваешь на чанки по 512–1024 токена. Decode и prefill идут параллельно. P99 латентность на mixed workload падает с 6.8 до 2.1 секунды на 4×A100 bare-metal....
Холодный старт vLLM — это не «немного подождать». Это архитектурная катастрофа на пиковой нагрузке, которую облако прячет за auto-scaling с задержкой 90–180 секунд и выставляет вам счёт за каждую новую инстанцию. Что происходит под капотом: при холодном старте KV-cache пуст. Каждый prefill-запрос тянет полный контекст с нуля. На модели 70B с контекстом 8K это 1.2–2.4 секунды чистого TTFT (time-to-first-token) только на prefill, без учёта IO и планировщика. Prefix caching в vLLM решает это для повторяющихся системных промптов — хэш первых N токенов кэшируется в GPU VRAM. Попадание в кэш срезает prefill-фазу до 40–80 мс. Но это работает только если ты контролируешь планировщик локально, а не отдаёшь его облачному black box. Chunked prefill — второй рычаг. Вместо монолитной prefill-фазы, которая блокирует decode-слот на 1–3 секунды, разбиваешь на чанки по 512–1024 токена. Decode и prefill идут параллельно. P99 латентность на mixed workload падает с 6.8 до 2.1 секунды на 4×A100 bare-metal. Это цифры реального бенчмарка, а не маркетинговой презентации. По TCO: AWS p4d.24xlarge (8×A100) — $32.77/час on-demand. За год это $287 000 только за аренду GPU, без egress, без данных, без PII-рисков по 152-ФЗ. Bare-metal сервер 4×A100 SXM4 с EPYC 7543 — $180 000 единовременно. Амортизация 36 месяцев: $5 000/месяц. С chunked prefill и prefix caching throughput на той же железке вырастает на 35–60% — и ты уже конкурируешь с восьмикарточным облачным инстансом. Архитектура оптимизации — это не опция, это основной рычаг TCO. Подробнее на https://run-as-daemon.dev
Zero-trust архитектура AI-шлюза
Каждый промпт перехватывается шлюзом до отправки во внешнюю модель.
Что происходит на уровне шлюза:
- Парсинг запроса: выделение именованных сущностей, регулярные выражения на паттерны PII
- Удаление: имена, email, телефоны, токены API, номера карт, внутренние идентификаторы
- Замена на плейсхолдеры: NAME, TOKEN, EMAIL — модель отвечает на анонимизированный запрос
- Деанонимизация: шлюз подставляет реальные данные обратно в ответ на стороне клиента
- Запись в audit log: оригинал, очищенная версия, дельта — всё внутри периметра
Внешняя модель (OpenAI, Anthropic) не видит реальных данных никогда.
Развёртывание: private node внутри инфраструктуры клиента, любая юрисдикция.
От 89 000 ₽/мес.
run-as-daemon.dev
Каждый промпт перехватывается шлюзом до отправки во внешнюю модель.
Что происходит на уровне шлюза:
- Парсинг запроса: выделение именованных сущностей, регулярные выражения на паттерны PII
- Удаление: имена, email, телефоны, токены API, номера карт, внутренние идентификаторы
- Замена на плейсхолдеры: NAME, TOKEN, EMAIL — модель отвечает на анонимизированный запрос
- Деанонимизация: шлюз подставляет реальные данные обратно в ответ на стороне клиента
- Запись в audit log: оригинал, очищенная версия, дельта — всё внутри периметра
Внешняя модель (OpenAI, Anthropic) не видит реальных данных никогда.
Развёртывание: private node внутри инфраструктуры клиента, любая юрисдикция.
От 89 000 ₽/мес.
run-as-daemon.dev