Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный к...
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный канал для своей площадки обходится в $800/месяц и вмещает этот поток без доплат, разница составляет $38 400/год до учета оборудования и эксплуатации. Сравнивать нужно одинаковые объемы, резервирование и пропускную способность. В Sovereign AI Gateway считаем GB изменений в сутки, задержку репликации, допустимую потерю данных и время переключения на независимую площадку. Размещаем корпус и bare-metal инференс рядом, наружу передаем необходимый минимум. WireGuard защищает транспорт; тариф за переданные байты остается. Суверенитет начинается с проверенной способности обслуживать нагрузку вне чужого контура: https://run-as-daemon.dev.
Amazon
Free data transfer out to internet when moving out of AWS | Amazon Web Services
You told us one of the primary reasons to adopt Amazon Web Services (AWS) is the broad choice of services we offer, enabling you to innovate, build, deploy, and monitor your workloads. AWS has continuously expanded its services to support virtually any cloud…
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю ...
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю метку из локального NTP (не облачного), хеш политики авторизации, под которой действие разрешено. Этот bundle пишется в append-only структуру — идеально Merkle-дерево с периодическими anchor-точками в локальном HSM или даже в git-репозитории с подписанными коммитами. Replay любого инцидента тогда детерминирован: берёшь bundle, воспроизводишь вход, проверяешь подпись — и знаешь точно, что агент сделал и под какой политикой. Egress чужому облаку при этом ноль. Форензика остаётся внутри контура. ТСО вопроса. Облачные агентские фреймворки типа Azure AI Agent Service или AWS Bedrock Agents дают «аудит» в виде CloudWatch/Monitor логов — мутабельных, платных за хранение ($0.03/GB/мес только ingestion), выгружаемых с egress-стоимостью при инциденте. Когда следователь запросит форензику на 6 месяцев назад — вы заплатите за выгрузку и не получите криптографической гарантии целостности. Локальный Merkle-audit на bare-metal: стоимость хранения 10 млн evidence bundle — порядка 40 GB, цена на NVMe — копейки. Верификация — детерминирована и бесплатна. Подробнее об архитектуре суверенного агентского контура — https://run-as-daemon.dev
Сетевой уровень: AI без публичного интернета
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.
RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.
Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе
Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.
От 89 000 руб/мес. Пилот — 2 недели.
run-as-daemon.dev
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии вкл...
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии включают её опционально, и дефолты небезопасны. TCO-расчёт: bare-metal сервер с H100 80GB — амортизация 36 месяцев даёт ~$4.2/GPU-час. Azure ND H100 v5 — $9.8/GPU-час spot, $18.6/GPU-час on-demand. При 24/7 нагрузке разница за год — $120k\+. На эти деньги вы строите физически изолированный inference-контур с гарантированной защитой KV-cache и собственным embedding namespace. Без соседей. Без timing side-channel. Без shared DRAM. Архитектура суверенного multi-tenant — это отдельный inference-процесс на клиента, изолированный namespace в векторной БД, WireGuard /32 per-tenant и PII-санитизация на входе контура. Не RBAC в чужом облаке — физическая граница. Подробности на https://run-as-daemon.dev
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный ...
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный API физически не может дать гарантию, что промпт с ФИО клиента не прошёл через американский датацентр. Штраф Роскомнадзора — до 18 млн рублей. Стоимость локального PII-redaction на границе контура (presidio \+ кастомный NER) — разовая интеграция за несколько инженерных недель. Архитектурный вывод прост: если inference endpoint зависит от чужого ToS, чужого compliance-департамента и чужой геополитики — это не инфраструктура, это аренда чужой воли. Open-weights \+ bare-metal \+ локальный KV-кэш — единственная топология, где рубильника не существует. Технические детали архитектуры суверенного AI-шлюза: https://run-as-daemon.dev
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
On-prem инференс: vLLM и Ollama без компромиссов
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.
От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашин...
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашингтона. Open-weights — это не про качество модели. Это про то, кто держит рубильник. Подробнее про архитектуру суверенного инференс-контура: https://run-as-daemon.dev
ФинOps для LLM: гибридный роутинг
Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.
Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода
Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.
Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода
Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Скрытые расходы на облачные токены
Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе
При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.
RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе
При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.
RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние ...
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние зоны. Внешний DNS отключён на уровне firewall rule, не policy. — PII-санитизация: presidio на границе перед embedding pipeline. ФИО, ИНН, паспортные данные — маскируются до попадания в ChromaDB. Никакой биографии вместо замазанного ФИО. Обновление модели — air-gap процедура: подписанный tar.gz через физический носитель, SHA-256 верификация перед загрузкой, systemd unit с ExecStartPre\=/usr/local/bin/verify-artifact. Ни одна внешняя зависимость не тянется в runtime. TCO за год: железо $8 400, электричество 3.2 кВт × 8760 ч × $0.07 \= $1 958. Итого $10 358. Облачный аналог на том же трафике (500K токенов/сутки): $10 950 только на инференс, плюс egress за документы, плюс аудит доступа к данным 152-ФЗ силами юристов. Разница становится неприличной к концу второго квартала. Подробная схема развёртывания и конфиги systemd unit для vLLM в air-gap: https://run-as-daemon.dev
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с te...
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с tensor parallelism на двух A6000 или 4090 даёт 40-80 tok/s на Mistral 7B или Qwen 14B — достаточно для корпоративного RAG, суммаризации договоров, code review. Стоимость: сервер с двумя A6000 — разовый капекс ~900к руб., амортизация 3 года, электричество ~8к/мес. Против: Azure OpenAI GPT-4o на корпоративном объёме 10M токенов/день — это $1500-2000 в сутки только на инференс, плюс egress, плюс DPA-консультант. 152-ФЗ закрывает дискуссию административно: персональные данные российских субъектов должны обрабатываться на серверах, физически расположенных в РФ. Ни одна публичная LLM-платформа не даёт тебе верифицированной гарантии, что твой промпт обработан именно в российском датацентре, а не проксирован через глобальную инфраструктуру. Bare-metal в собственной стойке — единственная архитектура, где ответ на вопрос регулятора однозначен. Подробный разбор стека: vLLM, WireGuard, presidio, systemd unit с LimitNOFILE и защитой от утечки промптов — на https://run-as-daemon.dev
Автономный AI-агент без ограничений — это вектор атаки на собственную инфраструктуру.
Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.
Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения
Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.
Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения
Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ...