run-as-daemon.dev
13 subscribers
87 photos
129 links
Download Telegram
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на bare-metal не имеет публичного IP в принципе. Никакого egress на hyperscaler DNS, никакого route через публичную подсеть. По деньгам: аренда dedicated-сервера с 2x RTX 4090 в российском ЦОД — порядка 35 000–45 000 руб/мес. Эквивалентная GPU-мощность в Azure или AWS — от $3 per GPU-hour, то есть от 430 000 руб/мес при круглосуточной нагрузке. WireGuard mesh между двумя bare-metal нодами: нулевая лицензионная стоимость, latency внутри ЦОД менее 0.3 мс, никакого egress fee за межнодовый трафик. Вся маршрутизация — в ядре Linux, без оверлея от вендора. Изоляция портов — не про безопасность в вакууме, это про 152-ФЗ и аудит. Когда регулятор запрашивает схему обработки ПДн, ты показываешь wg show: все пиры с /32, нет публичных IP на продакшене, трафик не покидает контур. Это не презентация для проверяющего — это архитектура, которая работает именно так, как нарисована. Подробнее о суверенной инфраструктуре — https://run-as-daemon.dev
152-ФЗ и AI: где проходит граница

Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.

При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия

В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.

RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.

Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
152-ФЗ и AI: где проходит граница

Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.

При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия

В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.

RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.

Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по...
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по uid-owner воркера — не опция, а обязательный слой. Облачный провайдер предложит тебе Security Group с тремя кликами. И никогда не скажет, что его гипервизор видит твой трафик до того, как он дойдёт до этой группы. TCO за 3 года: bare-metal EPYC-нода с WireGuard mesh и vLLM на борту — разовое CAPEX плюс электричество плюс colocation. Против AWS VPC с NAT Gateway: $0.045 за GB NAT-трафика плюс egress плюс hourly за каждый endpoint. При 10TB/мес внутреннего mesh-трафика AWS берёт за NAT ~$450/мес только на трансит — это $16 200 за три года только за то, чтобы твои пакеты прошли через чужое железо. WireGuard на своём bare-metal: $0 за трансит, $0 за egress внутри контура, полный контроль над маршрутизацией и ключами. Архитектура суверенного mesh — на https://run-as-daemon.dev. Никаких публичных IP, никаких гипервизорных прокладок между твоими данными и криптографией.
Аудит AI-агентов: почему отсутствие криптографического лога решений превращает автономную систему в угрозу периметру Автономный агент принимает решения: вызывает инструменты, эскалирует привилегии, инициирует HTTP-запросы внутри меша. Без верифицируемого лога каждого decision step ты не можешь восстановить цепочку причинности после инцидента. Ты получаешь только симптомы — аномальный трафик, дренаж VRAM, неожиданный egress — но не root cause. Это не observability, это угадайка. Минимально достаточная архитектура: каждый action агента пишется в append-only лог с HMAC-подписью на ключе, изолированном в HSM или sealed Vault Transit. Структура записи: timestampns, agentid, actiontype, toolname, inputhash (SHA-256 от сериализованного payload), outputhash, parentdecisionid. Цепочка строится через parentdecisionid — это твой Merkle-образный граф решений. Попытка retroactive подмены записи ломает HMAC-верификацию всей последующей цепочки. Forensics становится детерминированным. Без э...
Аудит AI-агентов: почему отсутствие криптографического лога решений превращает автономную систему в угрозу периметру Автономный агент принимает решения: вызывает инструменты, эскалирует привилегии, инициирует HTTP-запросы внутри меша. Без верифицируемого лога каждого decision step ты не можешь восстановить цепочку причинности после инцидента. Ты получаешь только симптомы — аномальный трафик, дренаж VRAM, неожиданный egress — но не root cause. Это не observability, это угадайка. Минимально достаточная архитектура: каждый action агента пишется в append-only лог с HMAC-подписью на ключе, изолированном в HSM или sealed Vault Transit. Структура записи: timestampns, agentid, actiontype, toolname, inputhash (SHA-256 от сериализованного payload), outputhash, parentdecisionid. Цепочка строится через parentdecisionid — это твой Merkle-образный граф решений. Попытка retroactive подмены записи ломает HMAC-верификацию всей последующей цепочки. Forensics становится детерминированным. Без этого каждая автономная сессия агента — это unsigned execution с сетевым доступом внутри твоего WireGuard меша. Агент, скомпрометированный через prompt injection или сбойный tool response, может латерально двигаться по AllowedIPs, и ты это обнаружишь только по аномалии в трафике, не по логу решений. eBPF-политика блокирует syscall, но не блокирует легитимный tool call с вредоносным payload — только криптографический аудит трассирует намерение. Практика на bare-metal: loki \+ custom structured log shipper, каждая запись подписывается через age-шифрование или Vault Transit HMAC, retention — immutable S3-совместимое хранилище на локальном MinIO с WORM-политикой. Стоимость на собственном железе: ~0 egress, ~$0.003/GB хранения против $0.023/GB S3 у гиперскейлера плюс egress при каждом forensic-запросе. При инциденте ты платишь облаку дважды: за хранение и за право посмотреть на собственные логи. https://run-as-daemon.dev
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным...
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным заново. Bare-metal ответ: Postgres 16 на локальном NVMe, Patroni для HA, pgBackRest для инкрементальных бэкапов в свой S3-совместимый MinIO, репликация через WireGuard mesh между площадками. Стоимость egress при смене ЦОДа: транспортные расходы на диск или аренда 10G cross-connect — фиксированная стоимость, не процент от объёма данных. Никаких счётчиков, никаких сюрпризов в конце месяца. Полный расчёт TCO по модели суверенного bare-metal Postgres с Patroni и граничной PII-санитизацией — на https://run-as-daemon.dev. Данные в вашем ЦОДе платят egress только один раз: когда вы их туда привезли.
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серь...
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серьёзном трафике. Latency — это не UX-метрика для дизайнера. Это архитектурный инвариант, который определяет, кто контролирует критический путь твоего продукта. Подробнее о построении суверенного inference-контура — https://run-as-daemon.dev
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реал...
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реальный средний чек $0.008–0.010 за 1K токенов. Разрыв: 20–40x не в пользу облака. То, что Azure и AWS называют «гибкостью» — это егресс-локин плюс отсутствие контроля над кривой предельной стоимости. Когда нагрузка растёт, гиперскейлер масштабирует вашу боль линейно по прайсу. Bare-metal кластер масштабирует стоимость токена вниз по мере роста утилизации — это и есть суверенная экономика инференса. https://run-as-daemon.dev
Автономный RAG в закрытом контуре: архитектура без компромиссов Закрытый периметр без выхода в WAN — это не экзотика для оборонки. Это нормальная архитектура для любого оператора персональных данных под 152-ФЗ, промышленного предприятия или финтеха, которому надоело объяснять регулятору, почему запросы клиентов уходят в us-east-1. Собираем стек полностью внутри периметра. Архитектура: один EPYC-узел с NVMe RAID, 4x RTX 4090 под vLLM (AWQ 4-bit, mistral-7b или qwen2-14b по задаче), Qdrant на том же хосте или выделенном bare-metal-соседе через WireGuard /32 AllowedIPs. Embedding-модель (e5-mistral или bge-m3) запускается локально — никакого обращения к OpenAI Embeddings API. Ingestion pipeline: документы парсятся внутри контура, чанкуются, векторизуются, индексируются. Ни один токен не покидает L3-кэш вашего процессора до того, как попадёт в Qdrant. DNS резолвится только во внутреннюю зону. Firewall-правило: default deny outbound, whitelist только внутренние подсети mesh. ТCO против обла...
Автономный RAG в закрытом контуре: архитектура без компромиссов Закрытый периметр без выхода в WAN — это не экзотика для оборонки. Это нормальная архитектура для любого оператора персональных данных под 152-ФЗ, промышленного предприятия или финтеха, которому надоело объяснять регулятору, почему запросы клиентов уходят в us-east-1. Собираем стек полностью внутри периметра. Архитектура: один EPYC-узел с NVMe RAID, 4x RTX 4090 под vLLM (AWQ 4-bit, mistral-7b или qwen2-14b по задаче), Qdrant на том же хосте или выделенном bare-metal-соседе через WireGuard /32 AllowedIPs. Embedding-модель (e5-mistral или bge-m3) запускается локально — никакого обращения к OpenAI Embeddings API. Ingestion pipeline: документы парсятся внутри контура, чанкуются, векторизуются, индексируются. Ни один токен не покидает L3-кэш вашего процессора до того, как попадёт в Qdrant. DNS резолвится только во внутреннюю зону. Firewall-правило: default deny outbound, whitelist только внутренние подсети mesh. ТCO против облачного RAG: облачный вариант на AWS — Bedrock embeddings \+ OpenSearch Serverless \+ Bedrock inference — при 10 млн токенов в день выходит в $3 200–4 800 в месяц только на инференс и векторный поиск, плюс egress за каждый байт ответа наружу. Bare-metal амортизация 4x4090 \+ EPYC за 36 месяцев даёт $0.0008–0.0012 за 1K токенов с учётом электричества по российскому тарифу. Разница — пять порядков при масштабе. При этом PII никогда не покидает контур, Qdrant-индекс шифруется на уровне LUKS, AmneziaWG между узлами mesh закрывает транспортный слой. Критичная деталь: холодный старт vLLM после простоя — 800–1200 мс на первый запрос. Держите прогревочный endpoint на keepalive-таймере внутри контура, иначе первый пользователь после ночи получит таймаут и напишет, что «AI не работает». Это решается systemd-юнитом с ExecStartPost curl к /health и минимальным dummy-запросом сразу после старта процесса. https://run-as-daemon.dev
Автономный RAG в закрытом контуре — это не экзотика. Это единственная архитектура, которая выдерживает проверку 152-ФЗ, внутренний аудит безопасности и здравый смысл одновременно. Стек без WAN выглядит так: sentence-transformers (BGE-M3 или E5-large) запускается локально на CPU/GPU, генерирует эмбеддинги прямо на ingestion-пайплайне. Qdrant поднят на том же bare-metal узле, индекс лежит на NVMe с шифрованием LUKS, snapshotting — локально через rsync на резервный том. vLLM с моделью Mistral 7B AWQ обслуживает запросы только через unix-сокет или localhost:8000 — никакого внешнего биндинга. Весь трафик между компонентами — петлевой интерфейс или WireGuard mesh AllowedIPs /32 между узлами контура. DNS резолвится через локальный CoreDNS без форвардеров во внешний мир. ТСО: сервер 2x EPYC 9354 \+ 4x RTX 4090 амортизируется за 36 месяцев в ~$0.0008 за 1K токенов при загрузке 60%. Azure OpenAI GPT-4o на том же объёме — $0.005 за 1K input токенов, и это без egress за извлечённые чанки, без стои...
Автономный RAG в закрытом контуре — это не экзотика. Это единственная архитектура, которая выдерживает проверку 152-ФЗ, внутренний аудит безопасности и здравый смысл одновременно. Стек без WAN выглядит так: sentence-transformers (BGE-M3 или E5-large) запускается локально на CPU/GPU, генерирует эмбеддинги прямо на ingestion-пайплайне. Qdrant поднят на том же bare-metal узле, индекс лежит на NVMe с шифрованием LUKS, snapshotting — локально через rsync на резервный том. vLLM с моделью Mistral 7B AWQ обслуживает запросы только через unix-сокет или localhost:8000 — никакого внешнего биндинга. Весь трафик между компонентами — петлевой интерфейс или WireGuard mesh AllowedIPs /32 между узлами контура. DNS резолвится через локальный CoreDNS без форвардеров во внешний мир. ТСО: сервер 2x EPYC 9354 \+ 4x RTX 4090 амортизируется за 36 месяцев в ~$0.0008 за 1K токенов при загрузке 60%. Azure OpenAI GPT-4o на том же объёме — $0.005 за 1K input токенов, и это без egress за извлечённые чанки, без стоимости хранения индекса в облачном векторном хранилище, без аудита трассировки запросов. Разрыв в себестоимости — 6x в пользу железа уже на горизонте первого года. Gap, который закрывает закрытый контур: никакой утечки PII в embedding API, никаких логов запросов на стороне провайдера, полный контроль над версией модели без silent deprecation, соответствие 152-ФЗ без бумажных компенсирующих мер. Архитектура подробнее — https://run-as-daemon.dev
Гравитация данных — это когда стоимость выхода превышает стоимость остаться. Именно на этом построен весь бизнес облачных баз данных. RDS PostgreSQL на db.r6g.2xlarge: ~$580/месяц за инстанс плюс $230/месяц за хранилище 2 TB gp3. Итого $810/мес. Кажется терпимо — до момента, когда ты решаешь уйти. Egress: $0.09/GB за пределы региона AWS. При 2 TB базы — $184 только за физическую выгрузку данных. При 10 TB — $921 единоразово. При логической репликации через DMS добавь ещё $0.015/GB обработки — это их собственный инструмент миграции, который берёт деньги за помощь тебе сбежать. Bare-metal альтернатива: EPYC 9354 (32 ядра), 256 GB DDR5 ECC, 4x NVMe 3.84 TB — аренда в российском ЦОД от 180 000 руб/мес или покупка сервера ~1.4 млн руб с амортизацией 36 месяцев \= 38 888 руб/мес. Postgres 16, Patroni, pgBackRest в локальный S3-совместимый хранилище. Egress внутри собственного WireGuard mesh — ноль рублей. Миграция из облака: один раз, одна боль, навсегда. Архитектурный принцип суверенной инф...
Гравитация данных — это когда стоимость выхода превышает стоимость остаться. Именно на этом построен весь бизнес облачных баз данных. RDS PostgreSQL на db.r6g.2xlarge: ~$580/месяц за инстанс плюс $230/месяц за хранилище 2 TB gp3. Итого $810/мес. Кажется терпимо — до момента, когда ты решаешь уйти. Egress: $0.09/GB за пределы региона AWS. При 2 TB базы — $184 только за физическую выгрузку данных. При 10 TB — $921 единоразово. При логической репликации через DMS добавь ещё $0.015/GB обработки — это их собственный инструмент миграции, который берёт деньги за помощь тебе сбежать. Bare-metal альтернатива: EPYC 9354 (32 ядра), 256 GB DDR5 ECC, 4x NVMe 3.84 TB — аренда в российском ЦОД от 180 000 руб/мес или покупка сервера ~1.4 млн руб с амортизацией 36 месяцев \= 38 888 руб/мес. Postgres 16, Patroni, pgBackRest в локальный S3-совместимый хранилище. Egress внутри собственного WireGuard mesh — ноль рублей. Миграция из облака: один раз, одна боль, навсегда. Архитектурный принцип суверенной инфраструктуры: данные должны жить там, где стоимость их удержания и стоимость их перемещения одинаково равны нулю. Всё остальное — аренда клетки. https://run-as-daemon.dev
Сценарий не гипотетический: OpenAI меняет ToS, вводит geo-restriction или просто падает — и твой продукт лежит вместе с ними. Ты не клиент, ты арендатор вычислений у компании, которой ты не платишь зарплату и не имеешь акций. Что стоит суверенный стек реально? 2x EPYC 9354 \+ 4x RTX 4090, 256 GB ECC RAM: CAPEX ~$28 000. Llama 3.1 70B в AWQ 4-bit, vLLM, tensor parallelism across 4 GPU. Throughput: ~1 200 tokens/s на batch. Стоимость токена при амортизации 36 мес \+ электричество (~$0.12/kWh, ~3.2 kW под нагрузкой) — выходит порядка $0.0004 за 1K output tokens. GPT-4o: $0.015 за 1K output tokens. Разница — 37x. На объёме 1B токенов в месяц это разница между $400 и $15 000 в кармане. Архитектурный периметр: модель не покидает контур. PII-санитизация на ingress через presidio или self-hosted NER до того, как строка попала в prompt. WireGuard mesh с AllowedIPs /32 на каждый spoke — никакого lateral movement. Веса залочены на iron read-only mount, контрольная сумма SHA-256 при старте vLLM-се...
Сценарий не гипотетический: OpenAI меняет ToS, вводит geo-restriction или просто падает — и твой продукт лежит вместе с ними. Ты не клиент, ты арендатор вычислений у компании, которой ты не платишь зарплату и не имеешь акций. Что стоит суверенный стек реально? 2x EPYC 9354 \+ 4x RTX 4090, 256 GB ECC RAM: CAPEX ~$28 000. Llama 3.1 70B в AWQ 4-bit, vLLM, tensor parallelism across 4 GPU. Throughput: ~1 200 tokens/s на batch. Стоимость токена при амортизации 36 мес \+ электричество (~$0.12/kWh, ~3.2 kW под нагрузкой) — выходит порядка $0.0004 за 1K output tokens. GPT-4o: $0.015 за 1K output tokens. Разница — 37x. На объёме 1B токенов в месяц это разница между $400 и $15 000 в кармане. Архитектурный периметр: модель не покидает контур. PII-санитизация на ingress через presidio или self-hosted NER до того, как строка попала в prompt. WireGuard mesh с AllowedIPs /32 на каждый spoke — никакого lateral movement. Веса залочены на iron read-only mount, контрольная сумма SHA-256 при старте vLLM-сервера. Рубильника нет физически — потому что он у тебя в руках. Открытые веса — это не про «бесплатно», это про право собственности на предельную стоимость токена и нулевую зависимость от решений совета директоров в Сан-Франциско. Детали архитектуры — на https://run-as-daemon.dev