run-as-daemon.dev
13 subscribers
86 photos
128 links
Download Telegram
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный к...
Самая цепкая часть egress — ежемесячный счет за готовность работать вне облака. Вынесли аналитику на свои серверы, поддерживаете внешний резерв, регулярно обновляете локальный корпус для RAG — исходящие байты становятся постоянной статьей расходов. Тариф создает экономическое давление: размещайте следующий компонент рядом, внутри того же провайдера. Так растет облачная зависимость. У AWS и GCP есть программы бесплатного переноса при выходе. AWS предоставляет миграционные кредиты после согласования; GCP описывает перенос всех данных и нагрузок соответствующего сервиса. Это условия переезда, а не обещание бесплатной постоянной репликации. Источники: AWS, GCP. Условный расчет: 50 000 оплачиваемых GB в месяц при эффективной ставке $0,08/GB дают $4 000 ежемесячно, $48 000 в год только за исходящий поток. Это модель, не котировка AWS/GCP. Если дополнительный канал для своей площадки обходится в $800/месяц и вмещает этот поток без доплат, разница составляет $38 400/год до учета оборудования и эксплуатации. Сравнивать нужно одинаковые объемы, резервирование и пропускную способность. В Sovereign AI Gateway считаем GB изменений в сутки, задержку репликации, допустимую потерю данных и время переключения на независимую площадку. Размещаем корпус и bare-metal инференс рядом, наружу передаем необходимый минимум. WireGuard защищает транспорт; тариф за переданные байты остается. Суверенитет начинается с проверенной способности обслуживать нагрузку вне чужого контура: https://run-as-daemon.dev.
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю ...
Агент выполнил действие. Кто может это доказать? Автономные AI-агенты в 2025 году умеют вызывать bash, писать в БД, триггерить CI/CD и слать запросы во внешние API. Продукты класса LangChain, AutoGen, CrewAI дают агенту tool-use почти без трения. Именно поэтому вопрос аудита действий агента перестал быть академическим — он стал вопросом безопасности периметра. Проблема архитектурная, не продуктовая. Стандартный стек: агент получает toolcall, выполняет, пишет результат в context window. Всё. Никакой атомарной записи «кто, что, когда, с каким входом, с каким выходом, под какой политикой». Stdout-лог — это не аудит. Он мутабелен, он не привязан к конкретному состоянию модели, он не верифицируем форензически. Если агент скомпрометирован или его prompt инжектирован — лог врёт вместе с ним. Что должно быть в суверенной реализации. Каждый tool-вызов агента должен порождать evidence bundle: хеш входного контекста (SHA-256 от prompt \+ toolinput), подпись агентским Ed25519-ключом, временну́ю метку из локального NTP (не облачного), хеш политики авторизации, под которой действие разрешено. Этот bundle пишется в append-only структуру — идеально Merkle-дерево с периодическими anchor-точками в локальном HSM или даже в git-репозитории с подписанными коммитами. Replay любого инцидента тогда детерминирован: берёшь bundle, воспроизводишь вход, проверяешь подпись — и знаешь точно, что агент сделал и под какой политикой. Egress чужому облаку при этом ноль. Форензика остаётся внутри контура. ТСО вопроса. Облачные агентские фреймворки типа Azure AI Agent Service или AWS Bedrock Agents дают «аудит» в виде CloudWatch/Monitor логов — мутабельных, платных за хранение ($0.03/GB/мес только ingestion), выгружаемых с egress-стоимостью при инциденте. Когда следователь запросит форензику на 6 месяцев назад — вы заплатите за выгрузку и не получите криптографической гарантии целостности. Локальный Merkle-audit на bare-metal: стоимость хранения 10 млн evidence bundle — порядка 40 GB, цена на NVMe — копейки. Верификация — детерминирована и бесплатна. Подробнее об архитектуре суверенного агентского контура — https://run-as-daemon.dev
Сетевой уровень: AI без публичного интернета

Большинство компаний гонят AI-трафик через публичный интернет. Это означает: логи у провайдера, уязвимость к перехвату, невозможность аудита маршрута.

RANAS Sovereign AI Gateway разворачивается внутри WireGuard mesh.

Архитектура:
- Каждый филиал и ДЦ — узел в приватной overlay-сети
- Запросы к LLM идут по зашифрованному тоннелю внутри периметра
- Публичный интернет исключён из маршрута AI-трафика
- PII и секреты удаляются до выхода наружу, если внешняя модель необходима
- Полный audit log на каждом хопе

Результат: регулятор видит только внутренний трафик. Никаких запросов к OpenAI/Anthropic в открытую сеть.

От 89 000 руб/мес. Пилот — 2 недели.

run-as-daemon.dev
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии вкл...
Multi-tenant AI — это архитектурный оксюморон для тех, кто работает с чувствительными данными. Когда vLLM или TGI обслуживают несколько клиентов на одном GPU, KV-cache пагинируется через PagedAttention. Физические страницы VRAM распределяются между тенантами динамически. Изоляция — программная, на уровне планировщика блоков. Атака типа side-channel через timing inference на shared CUDA context — не академическая. Microsoft Research задокументировала класс атак на shared GPU в 2023. Ни один SLA облачного провайдера не компенсирует утечку вашей бизнес-логики из промптов. Второй вектор — векторные пространства. Shared embedding index в мульти-тенантном RAG — это приглашение к membership inference attack. Если два клиента работают с одной векторной БД без hard namespace isolation на уровне сегментации индекса, ближайший сосед вашего запроса может принадлежать чужому корпусу. Weaviate и Qdrant поддерживают tenant isolation, но только при правильной конфигурации — облачные managed-версии включают её опционально, и дефолты небезопасны. TCO-расчёт: bare-metal сервер с H100 80GB — амортизация 36 месяцев даёт ~$4.2/GPU-час. Azure ND H100 v5 — $9.8/GPU-час spot, $18.6/GPU-час on-demand. При 24/7 нагрузке разница за год — $120k\+. На эти деньги вы строите физически изолированный inference-контур с гарантированной защитой KV-cache и собственным embedding namespace. Без соседей. Без timing side-channel. Без shared DRAM. Архитектура суверенного multi-tenant — это отдельный inference-процесс на клиента, изолированный namespace в векторной БД, WireGuard /32 per-tenant и PII-санитизация на входе контура. Не RBAC в чужом облаке — физическая граница. Подробности на https://run-as-daemon.dev
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный ...
Рубильник из-за океана — архитектурная уязвимость, а не бизнес-риск Когда OpenAI обновил ToS в марте 2024 года, часть корпоративных клиентов обнаружила ограничения на использование output в downstream-продуктах — уже после подписания enterprise-контрактов. Anthropic закрыл доступ целым ASN-диапазонам без предупреждения. Azure AD Compliance Hold замораживает тенант за 24 часа по регуляторному флагу — без апелляционного окна, без SLA на разморозку. Это не edge-кейсы. Это архитектура зависимости. Open-weights модель — Llama 3.1 70B, Mistral Large 2, Qwen2.5 72B — скачана на bare-metal один раз. После этого вендор исчез из уравнения. vLLM с tensor parallelism на 2x A100 80GB даёт 18-22 tok/s на 70B в fp8. Стоимость инференса: $0.0003-0.0006 за 1K токенов по амортизации железа при 3-летнем цикле. GPT-4o: $0.005 input / $0.015 output за 1K. Разница кратная, и она не уменьшается с ростом нагрузки — она растёт. Дополнительный слой: 152-ФЗ требует локализации персональных данных. Проприетарный API физически не может дать гарантию, что промпт с ФИО клиента не прошёл через американский датацентр. Штраф Роскомнадзора — до 18 млн рублей. Стоимость локального PII-redaction на границе контура (presidio \+ кастомный NER) — разовая интеграция за несколько инженерных недель. Архитектурный вывод прост: если inference endpoint зависит от чужого ToS, чужого compliance-департамента и чужой геополитики — это не инфраструктура, это аренда чужой воли. Open-weights \+ bare-metal \+ локальный KV-кэш — единственная топология, где рубильника не существует. Технические детали архитектуры суверенного AI-шлюза: https://run-as-daemon.dev
On-prem инференс: vLLM и Ollama без компромиссов

vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.

От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #brics
On-prem инференс: vLLM и Ollama без компромиссов

vLLM на A100 держит 10 000\+ токенов/сек при batch-инференсе.
Ollama — для edge-узлов без GPU, latency от 50 мс.
Оба поднимаются за один манифест через docker-compose.
API-совместимость с OpenAI: смена одной строки в коде клиента.
PII и секреты вырезает шлюз до отправки во внешние модели.
Audit log — локально, без SaaS.

От 89 000 руб/мес. Разворачиваем в вашей юрисдикции.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #brics
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашин...
Санкционный сценарий — не параноя, а инженерный кейс. OpenAI, Anthropic, Cohere — все три работают через американскую юрисдикцию. OFAC-список обновляется без предупреждения. Один executive order — и ваш API-ключ возвращает 403 вместо токенов. Это не теория: в 2022–2023 годах десятки российских команд потеряли доступ к облачным сервисам за часы, без апелляции и возврата предоплаты. Что даёт open-weights на bare-metal: Llama-3.1-70B или Qwen-2.5-72B разворачиваются на 2×H100 SXM за 4 часа после первой загрузки весов. После этого внешняя сеть вам не нужна вообще. AllowedIPs /32 в WireGuard-меше, vLLM с tensorparallelsize\=2, throughput 1800–2200 tok/s на смешанном батче. Никакого egress, никакого Terms of Service, никакого compliance-окна на продление. ТCO за 36 месяцев: аренда двух H100 в колокации — ~$18k/год. GPT-4o при корпоративной нагрузке 50M токенов/месяц — $150k/год. Разница окупает железо за 6 месяцев и создаёт операционный суверенитет, который не аннулируется звонком из Вашингтона. Open-weights — это не про качество модели. Это про то, кто держит рубильник. Подробнее про архитектуру суверенного инференс-контура: https://run-as-daemon.dev
ФинOps для LLM: гибридный роутинг

Локальный vLLM — первый эшелон маршрутизации.
Внешний API (OpenAI, Anthropic) — только резерв при превышении квоты или требований к качеству.

Правила роутинга в RANAS Gateway:
- задачи с низкой сложностью -> локальная модель (Qwen, Mistral, LLaMA)
- контекст > 32k токенов -> внешний API
- latency SLA < 300ms -> локальный эшелон без исключений
- чувствительные данные -> только локально, PII-фильтр до любого исхода

Экономия: 40-70% inference-расходов при сохранении SLA.
Audit log фиксирует каждое решение о маршрутизации.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #sovereign
Скрытые расходы на облачные токены

Что реально ест бюджет:
- egress из VPC в API провайдера: /usr/bin/bash.09/GB и выше
- повторная отправка одинаковых системных промптов без кэша
- PII-фильтрация на стороне провайдера — отдельный прайс
- audit log: либо платишь вендору, либо не имеешь его вовсе

При нагрузке 500k токенов/день экономия на кэшировании промптов составляет 35-55% от счёта. Добавь устранение egress — и суверенный шлюз окупается за квартал.

RUNAS Sovereign AI Gateway: OpenAI-compatible прокси внутри твоей юрисдикции. Удаляет секреты и PII до отправки во внешние модели. Полный audit log. От 89 000 руб/мес.

run-as-daemon.dev

#ии #безопасность #инфраструктура #gateway #brics
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние ...
Автономный RAG-контур: архитектура без WAN и без иллюзий Задача поставлена жёстко: RAG-система для корпуративных документов в закрытом периметре. 152-ФЗ, промышленный контур, ноль доверия к внешнему DNS, ноль egress. Что это означает архитектурно: — Embedding-модель: BGE-M3 на CPU (2× Xeon Silver, 48 потоков). Latency на запрос — 38 мс при батче 32. Никакого вызова OpenAI Embeddings API, никаких $0.02 за 1K токенов. — Vector store: ChromaDB, персистентность на локальном NVMe RAID-1, индекс на 2M чанков — 14 ГБ. Поиск по косинусному расстоянию — 11 мс p99. — LLM-инференс: vLLM с Mistral-7B-Instruct-v0.3, квантизация GPTQ 4bit, одна A5000 24 ГБ. Throughput — 47 токенов/сек при 8 параллельных запросах. Стоимость GPU на вторичном рынке — $2 200. Окупаемость против облачного аналога ($0.06/1K output токенов, корпоративный трафик 500K токенов/сутки) — 4.3 месяца. — Сетевой контур: WireGuard mesh, AllowedIPs /32 на каждый spoke, хаб — выделенный bare-metal. CoreDNS резолвит только внутренние зоны. Внешний DNS отключён на уровне firewall rule, не policy. — PII-санитизация: presidio на границе перед embedding pipeline. ФИО, ИНН, паспортные данные — маскируются до попадания в ChromaDB. Никакой биографии вместо замазанного ФИО. Обновление модели — air-gap процедура: подписанный tar.gz через физический носитель, SHA-256 верификация перед загрузкой, systemd unit с ExecStartPre\=/usr/local/bin/verify-artifact. Ни одна внешняя зависимость не тянется в runtime. TCO за год: железо $8 400, электричество 3.2 кВт × 8760 ч × $0.07 \= $1 958. Итого $10 358. Облачный аналог на том же трафике (500K токенов/сутки): $10 950 только на инференс, плюс egress за документы, плюс аудит доступа к данным 152-ФЗ силами юристов. Разница становится неприличной к концу второго квартала. Подробная схема развёртывания и конфиги systemd unit для vLLM в air-gap: https://run-as-daemon.dev
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с te...
On-prem vLLM против Cloud API: как не слить коммерческую тайну чужому датацентру Каждый запрос в OpenAI API или Azure OpenAI — это пакет, который физически покидает твой контур. Промпт с фрагментом договора, финансовой моделью, кодом проприетарного алгоритма идёт через TLS в датацентр, где у тебя нет ни контроля над логированием, ни гарантий изоляции тенанта. Terms of Service OpenAI прямо оговаривают право на использование данных для улучшения модели — если только ты не на корпоративном тарифе с отдельным DPA. Но даже корпоративный тариф не даёт тебе доступ к аудит-логу на уровне GPU. Архитектура приватного инференса строится в три слоя. Первый: сеть. WireGuard mesh, AllowedIPs /32 на каждый spoke, весь LLM-трафик внутри туннеля, ноль маршрутов в WAN. Второй: периметр PII. Перед тем как промпт уходит в vLLM — локальный presidio или self-hosted NER-модель вырезает ФИО, ИНН, номера счетов, реквизиты. Не замазывает — вырезает и заменяет токенами-заглушками. Третий: сам инференс. vLLM с tensor parallelism на двух A6000 или 4090 даёт 40-80 tok/s на Mistral 7B или Qwen 14B — достаточно для корпоративного RAG, суммаризации договоров, code review. Стоимость: сервер с двумя A6000 — разовый капекс ~900к руб., амортизация 3 года, электричество ~8к/мес. Против: Azure OpenAI GPT-4o на корпоративном объёме 10M токенов/день — это $1500-2000 в сутки только на инференс, плюс egress, плюс DPA-консультант. 152-ФЗ закрывает дискуссию административно: персональные данные российских субъектов должны обрабатываться на серверах, физически расположенных в РФ. Ни одна публичная LLM-платформа не даёт тебе верифицированной гарантии, что твой промпт обработан именно в российском датацентре, а не проксирован через глобальную инфраструктуру. Bare-metal в собственной стойке — единственная архитектура, где ответ на вопрос регулятора однозначен. Подробный разбор стека: vLLM, WireGuard, presidio, systemd unit с LimitNOFILE и защитой от утечки промптов — на https://run-as-daemon.dev
Автономный AI-агент без ограничений — это вектор атаки на собственную инфраструктуру.

Галлюцинация в цикле: агент вызывает несуществующий API, получает ошибку, интерпретирует её как сигнал к повтору, исчерпывает квоты, падает прод.

Что работает на уровне gateway:
- таймаут на цепочку вызовов (max_steps)
- детектор повторяющихся паттернов запросов
- hard-cap по токенам на сессию агента
- алерт при отклонении от baseline-поведения

Агент должен уметь остановиться. Если не умеет — gateway останавливает за него.

run-as-daemon.dev
#ии #безопасность #инфраструктура #gateway #sovereign
Санитизация PII на границе контура: архитектура, а не галочка в чеклисте. Каждый промпт, покидающий периметр в сыром виде — это потенциальный инцидент по 152-ФЗ и утечка бизнес-контекста в GPU гиперскейлера. Типичная схема: приложение формирует промпт с именем клиента, номером договора, суммой сделки — и весь этот контент летит в OpenAI API без какой-либо обработки. Там он попадает в inference-слой, логируется в pipeline провайдера, и с этого момента вы не контролируете ни retention, ни субпроцессоров. Terms of Service, раздел 3 — прочтите внимательно. Правильная архитектура: перед любым исходящим запросом стоит локальный PII-gateway. Он работает как reverse-proxy между вашим приложением и LLM-эндпоинтом — неважно, внутренний vLLM или внешний API-резерв. Gateway выполняет NER (Named Entity Recognition) на базе локальной модели — spaCy rucorenewslg, DeepPavlov или дообученный BERT — и заменяет сущности на детерминированные токены-заглушки: [PERSON1], CONTRACT_42, AMOUNT_7. Ответ...