Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ модели приходит с теми же заглушками, gateway восстанавливает контекст из локального session-store. Внешний LLM видит только структуру задачи, ноль PII. Латентность добавки — 8-15 мс на типовом промпте в 512 токенов при инференсе NER-модели на CPU. Это приемлемо. ТСО-аргумент: один инцидент с утечкой персональных данных по 152-ФЗ — штраф до 15 млн руб. плюс репутационный урон. Развёртывание локального PII-gateway на выделенной ноде с 8 vCPU и 16 GB RAM обходится в 4-6 тыс. руб./мес. bare-metal. Амортизация за год — меньше стоимости одного предписания регулятора. Граница контура без PII-фильтра — это открытая дверь с вывеской «вход свободный». Подробнее об архитектуре суверенного AI-периметра: https://run-as-daemon.dev
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ...
Холодный старт и KV-cache: почему облако никогда не решит это за вас честно. Каждый холодный старт в облачном LLM-эндпоинте — это не техническая проблема, это биллинговая модель. AWS Bedrock и Azure OpenAI Service держат ваш инстанс в спящем режиме между пиками, а prefill первого запроса вы оплачиваете полностью: и токены контекста, и прогрев KV-cache, и egress ответа. При системном промпте 2048 токенов и 500 RPS пиковой нагрузки это 40–60 долларов в час только на повторный prefill одного и того же контекста. На bare-metal vLLM решается архитектурно. Prefix caching (--enable-prefix-caching) позволяет переиспользовать KV-тензоры системного промпта между запросами: хит в кэше срезает latency первого токена с 1100 мс до 180 мс на Mistral-7B при batch size 32. Chunked prefill (--enable-chunked-prefill, --max-num-batched-tokens 4096) размазывает prefill-фазу по декодирующим шагам — пиковое потребление VRAM падает на 18–22% без деградации throughput. KV-cache на tmpfs вместо HBM-спилла даёт ещё минус 35 мс p95 при переполнении видеопамяти. Radix attention — следующий уровень. При наличии древовидно повторяющихся префиксов (RAG-шаблоны, цепочки агентов с общим контекстом) radix tree переиспользует общие ветки KV-блоков. На RTX 4090 с 24 GB VRAM это удваивает эффективную пропускную способность при типичном агентском трафике без увеличения железа. Пиковая нагрузка — не повод звонить в облако. Это повод правильно разметить VRAM, настроить tensor parallelism между двумя 4090, выставить --gpu-memory-utilization 0.90 и держать префиксный кэш горячим через synthetic warmup при старте сервиса. Суверенный стек знает свою нагрузку — облако знает только ваш счёт. https://run-as-daemon.dev
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM сум...
Аппаратный суверенитет: почему железо в собственности — это не CAPEX, а страховка от геополитики. March 2022. AWS, Azure, GCP синхронно прекратили принимать платежи от российских юрлиц. Не постепенно — одним днём. Компании, чья инференс-инфраструктура жила в облаке, получили простой без предупреждения и без компенсации. Никакого SLA эта ситуация не покрывала — форс-мажорная оговорка в контракте работает в одну сторону. Что происходит технически, когда тебя «отключают»: удаляется биллинг-аккаунт, IAM-токены перестают валидироваться, объектное хранилище становится read-only на 30 дней, затем — нулевой доступ. Модели, веса, векторные индексы, KV-кэши — всё это физически лежит на чужом железе в юрисдикции, где решение принимают не ты. Egress в момент паники — $0.09/GB из AWS us-east-1, 40 ТБ весов — считай сам. Bare-metal контр-аргумент в цифрах: EPYC 9654 \+ 4x RTX 4090 \= ~$18 000 единоразово. Амортизация 36 месяцев \= $500/месяц. vLLM на Llama-3 70B: ~2 200 токенов/сек на 48 GB VRAM суммарно. Себестоимость токена при загрузке 60%: $0.000004. OpenAI GPT-4o: $0.000015 input / $0.000060 output. При 500M токенов/месяц разница — $27 500 в месяц чистыми. Без учёта того, что санкционный риск у тебя равен нулю, а PII остаётся в периметре 152-ФЗ. WireGuard mesh поверх физических линков между собственными стойками — это инфраструктура, которую не отключает ни один compliance-офицер из Сиэтла. AllowedIPs /32 на каждый spoke, никаких default route в WAN, PII-санитизация на входном прокси до первого токена. Это не паранойя — это инженерная архитектура, которую санкции не имеют точки применения. Подробнее об архитектуре суверенного AI Gateway: https://run-as-daemon.dev
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на ...
WireGuard mesh: почему /32 — это не перестраховка, а фундаментальный архитектурный инвариант. Классическая ошибка при развёртывании mesh-сети — раздавать spoke-нодам AllowedIPs с подсетью /24 или /16. Выглядит удобно: меньше строк конфига, проще управление. Цена удобства: любой компрометированный spoke становится транзитным узлом для атаки на весь сегмент. AllowedIPs /32 на каждый spoke означает одно правило Wireguard kernel — трафик принимается строго от конкретного peer IP, ноль маршрутизации через него. Hub видит только то, что должен видеть. Spoke-to-spoke изоляция соблюдается на уровне ядра, не на уровне iptables-костылей. Публичный IP на production-ноде с LLM — отдельный разговор. Открытый порт 51820 в публичном интернете — это не конфигурация WireGuard, это приглашение на DDoS и fingerprinting. Правильная схема: WireGuard-порт открыт только изнутри overlay-сети, внешний доступ — через jump-host или VPN-концентратор с rate limiting на conntrack-уровне. Production LLM-инференс на bare-metal не имеет публичного IP в принципе. Никакого egress на hyperscaler DNS, никакого route через публичную подсеть. По деньгам: аренда dedicated-сервера с 2x RTX 4090 в российском ЦОД — порядка 35 000–45 000 руб/мес. Эквивалентная GPU-мощность в Azure или AWS — от $3 per GPU-hour, то есть от 430 000 руб/мес при круглосуточной нагрузке. WireGuard mesh между двумя bare-metal нодами: нулевая лицензионная стоимость, latency внутри ЦОД менее 0.3 мс, никакого egress fee за межнодовый трафик. Вся маршрутизация — в ядре Linux, без оверлея от вендора. Изоляция портов — не про безопасность в вакууме, это про 152-ФЗ и аудит. Когда регулятор запрашивает схему обработки ПДн, ты показываешь wg show: все пиры с /32, нет публичных IP на продакшене, трафик не покидает контур. Это не презентация для проверяющего — это архитектура, которая работает именно так, как нарисована. Подробнее о суверенной инфраструктуре — https://run-as-daemon.dev
152-ФЗ и AI: где проходит граница
Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.
При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия
В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.
RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.
Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.
При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия
В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.
RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.
Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
152-ФЗ и AI: где проходит граница
Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.
При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия
В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.
RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.
Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
Закон обязывает хранить ПДн россиян на серверах в РФ. Большинство LLM-провайдеров — американские юрисдикции.
При прямом вызове внешней модели:
- промпт с ПДн или корпоративной тайной уходит в США
- нет гарантии, что данные не используются для дообучения
- нет audit log с доказательной силой
- регулятор вправе квалифицировать это как трансграничную передачу без согласия
В БРИКС ситуация схожая: Индия (DPDP Act), Китай (PIPL), ЮАР (POPIA) — у каждой страны локализационные требования.
RANAS Sovereign AI Gateway разворачивается внутри инфраструктуры клиента. PII и секреты вырезаются до отправки во внешнюю модель. Все запросы логируются с подписью. Периметр — только юрисдикция клиента.
Соответствие 152-ФЗ — не галочка в документах, а свойство архитектуры.
run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #brics
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по...
WireGuard mesh — это не VPN поверх интернета. Это суверенная overlay-сеть с криптографически изолированными пирами. Разберём, почему каждый компромисс в конфигурации стоит дороже, чем кажется. AllowedIPs /32 на каждый spoke — не паранойя и не перфекционизм. Это математика маршрутизации: если дать ноде подсеть /24, она может маршрутизировать трафик за других пиров. В agentic-инфраструктуре, где каждый воркер — отдельный peerID, это прямой путь к lateral movement внутри контура. /32 гарантирует: пакет адресован конкретному криптоключу, а не блоку адресов. Это не настройка — это инвариант. Публичный IP на production-ноде — это подарок сканерам Shodan и Censys. Bare-metal ноды в суверенном mesh работают без публичных IP вообще: hub-spoke через единственный WireGuard endpoint с UDP/51820, остальные ноды — в RFC1918 или полностью air-gapped. Входящий трафик принимает только Nginx/HAProxy reverse proxy на отдельной DMZ-ноде с отдельным peerID. Изоляция портов на уровне iptables owner match по uid-owner воркера — не опция, а обязательный слой. Облачный провайдер предложит тебе Security Group с тремя кликами. И никогда не скажет, что его гипервизор видит твой трафик до того, как он дойдёт до этой группы. TCO за 3 года: bare-metal EPYC-нода с WireGuard mesh и vLLM на борту — разовое CAPEX плюс электричество плюс colocation. Против AWS VPC с NAT Gateway: $0.045 за GB NAT-трафика плюс egress плюс hourly за каждый endpoint. При 10TB/мес внутреннего mesh-трафика AWS берёт за NAT ~$450/мес только на трансит — это $16 200 за три года только за то, чтобы твои пакеты прошли через чужое железо. WireGuard на своём bare-metal: $0 за трансит, $0 за egress внутри контура, полный контроль над маршрутизацией и ключами. Архитектура суверенного mesh — на https://run-as-daemon.dev. Никаких публичных IP, никаких гипервизорных прокладок между твоими данными и криптографией.
Аудит AI-агентов: почему отсутствие криптографического лога решений превращает автономную систему в угрозу периметру Автономный агент принимает решения: вызывает инструменты, эскалирует привилегии, инициирует HTTP-запросы внутри меша. Без верифицируемого лога каждого decision step ты не можешь восстановить цепочку причинности после инцидента. Ты получаешь только симптомы — аномальный трафик, дренаж VRAM, неожиданный egress — но не root cause. Это не observability, это угадайка. Минимально достаточная архитектура: каждый action агента пишется в append-only лог с HMAC-подписью на ключе, изолированном в HSM или sealed Vault Transit. Структура записи: timestampns, agentid, actiontype, toolname, inputhash (SHA-256 от сериализованного payload), outputhash, parentdecisionid. Цепочка строится через parentdecisionid — это твой Merkle-образный граф решений. Попытка retroactive подмены записи ломает HMAC-верификацию всей последующей цепочки. Forensics становится детерминированным. Без э...
Аудит AI-агентов: почему отсутствие криптографического лога решений превращает автономную систему в угрозу периметру Автономный агент принимает решения: вызывает инструменты, эскалирует привилегии, инициирует HTTP-запросы внутри меша. Без верифицируемого лога каждого decision step ты не можешь восстановить цепочку причинности после инцидента. Ты получаешь только симптомы — аномальный трафик, дренаж VRAM, неожиданный egress — но не root cause. Это не observability, это угадайка. Минимально достаточная архитектура: каждый action агента пишется в append-only лог с HMAC-подписью на ключе, изолированном в HSM или sealed Vault Transit. Структура записи: timestampns, agentid, actiontype, toolname, inputhash (SHA-256 от сериализованного payload), outputhash, parentdecisionid. Цепочка строится через parentdecisionid — это твой Merkle-образный граф решений. Попытка retroactive подмены записи ломает HMAC-верификацию всей последующей цепочки. Forensics становится детерминированным. Без этого каждая автономная сессия агента — это unsigned execution с сетевым доступом внутри твоего WireGuard меша. Агент, скомпрометированный через prompt injection или сбойный tool response, может латерально двигаться по AllowedIPs, и ты это обнаружишь только по аномалии в трафике, не по логу решений. eBPF-политика блокирует syscall, но не блокирует легитимный tool call с вредоносным payload — только криптографический аудит трассирует намерение. Практика на bare-metal: loki \+ custom structured log shipper, каждая запись подписывается через age-шифрование или Vault Transit HMAC, retention — immutable S3-совместимое хранилище на локальном MinIO с WORM-политикой. Стоимость на собственном железе: ~0 egress, ~$0.003/GB хранения против $0.023/GB S3 у гиперскейлера плюс egress при каждом forensic-запросе. При инциденте ты платишь облаку дважды: за хранение и за право посмотреть на собственные логи. https://run-as-daemon.dev
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным...
Гравитация данных: математика капкана, которую вам не покажут в облачном калькуляторе. Когда ваша база живёт в RDS или Cloud SQL — провайдер не держит вас силой. Он держит вас ценой выхода. Стандартный egress в AWS: $0.09/GB. Azure — $0.087/GB. Google Cloud — $0.08/GB. Картель согласовал коридор цен настолько плотно, что разница несущественна. 10 ТБ рабочей базы с репликами, бинлогами и бэкапами — это легко 30–40 ТБ фактического трафика при миграции. Итого: $2700–3600 только за право забрать свои данные. И это до того, как вы посчитали даунтайм, переписку схем, тест на совместимость и ре-инжиниринг connection pool. Архитектурный капкан закладывается в день первого CREATE DATABASE. Managed-сервисы затягивают вас в проприетарные расширения: Aurora-специфичный синтаксис, AlloyDB-оптимизации, Cosmos DB API — всё это не PostgreSQL и не MongoDB в чистом виде. Это диалекты с vendor lock-in на уровне кода приложения. Через три года вы мигрируете не базу — вы переписываете слой доступа к данным заново. Bare-metal ответ: Postgres 16 на локальном NVMe, Patroni для HA, pgBackRest для инкрементальных бэкапов в свой S3-совместимый MinIO, репликация через WireGuard mesh между площадками. Стоимость egress при смене ЦОДа: транспортные расходы на диск или аренда 10G cross-connect — фиксированная стоимость, не процент от объёма данных. Никаких счётчиков, никаких сюрпризов в конце месяца. Полный расчёт TCO по модели суверенного bare-metal Postgres с Patroni и граничной PII-санитизацией — на https://run-as-daemon.dev. Данные в вашем ЦОДе платят egress только один раз: когда вы их туда привезли.
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серь...
Latency-инвариант, который гиперскейлеры не любят считать вслух. RTT от московского ЦОДа до us-east-1 — 140–180 мс в лучшем случае. Добавь TLS handshake, HTTP/2 framing, очередь на стороне облачного inference endpoint, cold scheduling на shared GPU pool — и ты получаешь 350–600 мс на первый токен. Это не SLA, это физика плюс архитектурный жир чужой платформы. Локальный vLLM на bare-metal в том же дата-центре, где живёт приложение: TTFT (time-to-first-token) 40–80 мс для Qwen2.5-14B при batch\=1, p99 латентность 95–130 мс под нагрузкой 50 rps. Разница — не проценты, а порядок. И это без учёта того, что ты не платишь egress за каждый гигабайт контекста, который гоняешь туда-обратно через Атлантику. TCO-аргумент для CTO: RTX 4090 в коло — 180–220 USD/месяц амортизации плюс электричество. GPT-4o через API при 50 rps и среднем контексте 2K токен/запрос — это 4 000–6 000 USD/месяц только на inference, без egress и без суверенитета. Bare-metal окупается на горизонте 3–5 месяцев при любом серьёзном трафике. Latency — это не UX-метрика для дизайнера. Это архитектурный инвариант, который определяет, кто контролирует критический путь твоего продукта. Подробнее о построении суверенного inference-контура — https://run-as-daemon.dev
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реал...
Считаем честно: EPYC 9654 \+ 4x RTX 4090 против Azure OpenAI GPT-4o Железо: сервер на базе EPYC 9654 (96 ядер, 384 GB DDR5 ECC) плюс 4x RTX 4090 (96 GB VRAM суммарно) — рыночная цена сборки с учётом серверного шасси, NVMe, блоков питания 80\+ Titanium: порядка $22 000–26 000. Срок полезного использования — 36 месяцев минимум. Амортизация: ~$680/мес. Потребление: 4x TDP RTX 4090 под инференсом реально 280–320W каждая, EPYC под нагрузкой ещё 280W. Итого стойка: ~1600W. При тарифе ЦОД 6 руб/кВт·ч — около 11 000 руб/мес за электричество. Колокация стойки в Tier III в Москве: 8 000–15 000 руб/мес. Суммарный OPEX: ≈$350–450/мес по курсу. vLLM на Mixtral-8x7B AWQ 4-bit: 4x RTX 4090 держат 96 GB VRAM — модель влезает целиком. Пропускная способность: 8 000–12 000 токенов/сек на batch inference, latency первого токена 40–80 мс на локальном меше. Себестоимость 1K токенов при 50% утилизации: $0.00025–0.0004. Azure OpenAI GPT-4o: $0.005 per 1K input, $0.015 per 1K output. При смешанном трафике реальный средний чек $0.008–0.010 за 1K токенов. Разрыв: 20–40x не в пользу облака. То, что Azure и AWS называют «гибкостью» — это егресс-локин плюс отсутствие контроля над кривой предельной стоимости. Когда нагрузка растёт, гиперскейлер масштабирует вашу боль линейно по прайсу. Bare-metal кластер масштабирует стоимость токена вниз по мере роста утилизации — это и есть суверенная экономика инференса. https://run-as-daemon.dev