🔐 Kubernetes User Namespaces - важная защита контейнеров от root-эскейпа
Идея простая: root внутри контейнера больше не обязан быть root на хосте.
Например:
Container UID 0 → Host UID 100000
То есть процесс внутри контейнера считает себя root, но на уровне хоста работает как непривилегированный пользователь.
В Kubernetes это включается через:
hostUsers: false
Что это даёт:
- изоляцию UID/GID контейнера от хоста
- снижение последствий container escape
- возможность ограничивать диапазоны UID через /etc/subuid
- дополнительный слой защиты без переписывания самого приложения
Важно: User Namespaces не заменяют seccomp, capabilities, AppArmor/SELinux и другие механизмы, а дополняют их.
Полезная вещь для тех, кто запускает контейнеры с UID 0 и хочет уменьшить blast radius при компрометации.
Идея простая: root внутри контейнера больше не обязан быть root на хосте.
Например:
Container UID 0 → Host UID 100000
То есть процесс внутри контейнера считает себя root, но на уровне хоста работает как непривилегированный пользователь.
В Kubernetes это включается через:
hostUsers: false
Что это даёт:
- изоляцию UID/GID контейнера от хоста
- снижение последствий container escape
- возможность ограничивать диапазоны UID через /etc/subuid
- дополнительный слой защиты без переписывания самого приложения
Важно: User Namespaces не заменяют seccomp, capabilities, AppArmor/SELinux и другие механизмы, а дополняют их.
Полезная вещь для тех, кто запускает контейнеры с UID 0 и хочет уменьшить blast radius при компрометации.
📘 OSTEP - 714 страниц про операционные системы, написанные двумя профессорами University of Wisconsin после почти 25 лет преподавания.
Первая глава называется буквально:
“A Dialogue on the Book”
Профессор и студент просто обсуждают, зачем вообще изучать операционные системы, ещё до появления первых терминов.
Дальше в том же стиле разбираются:
CPU virtualization, память, concurrency, persistence.
Подход очень сильный:
Поэтому OSTEP до сих пор остаётся одной из лучших бесплатных книг по ОС для разработчиков.
Читать бесплатно:
https://pages.cs.wisc.edu/~remzi/OSTEP/
Первая глава называется буквально:
“A Dialogue on the Book”
Профессор и студент просто обсуждают, зачем вообще изучать операционные системы, ещё до появления первых терминов.
Дальше в том же стиле разбираются:
CPU virtualization, память, concurrency, persistence.
Подход очень сильный:
сначала интуиция → потом механизм → потом детали реализацииПоэтому OSTEP до сих пор остаётся одной из лучших бесплатных книг по ОС для разработчиков.
Читать бесплатно:
https://pages.cs.wisc.edu/~remzi/OSTEP/
Oracle провела очередную волну сокращений, по сообщениям сотрудников, под увольнение попали примерно 3–4 тысячи человек.
Отключения начались ещё до рассвета: около 4:00 сотрудникам стали закрывать доступ к внутренним системам, к 5:00–5:30 деактивировали Slack-аккаунты, а примерно в 6:00 разослали письма об увольнении.
Некоторые люди приехали в офис, не успев проверить почту, и уже на месте обнаружили, что их бейджи больше не работают.
Точный масштаб сокращений пока неясен, но отдельные команды, по словам сотрудников, потеряли около 10% состава. Число аккаунтов в рабочем Slack сократилось примерно на 3–4 тысячи.
Это не первая крупная волна увольнений Oracle в этом году: весной компания уже провела масштабные сокращения.
Отключения начались ещё до рассвета: около 4:00 сотрудникам стали закрывать доступ к внутренним системам, к 5:00–5:30 деактивировали Slack-аккаунты, а примерно в 6:00 разослали письма об увольнении.
Некоторые люди приехали в офис, не успев проверить почту, и уже на месте обнаружили, что их бейджи больше не работают.
Точный масштаб сокращений пока неясен, но отдельные команды, по словам сотрудников, потеряли около 10% состава. Число аккаунтов в рабочем Slack сократилось примерно на 3–4 тысячи.
Это не первая крупная волна увольнений Oracle в этом году: весной компания уже провела масштабные сокращения.
💰 OpenAI обсуждает новый раунд с оценкой свыше $1,2 трлн
Это примерно на 41% выше мартовских $852 млрд. Переговоры находятся на ранней стадии, IPO ожидается не раньше 2027 года.
По данным WSJ:
* Аудитория OpenAI превысила 1 млрд активных пользователей.
* Выручка за второй квартал достигла $6,7 млрд, увеличившись примерно на 18% к предыдущему кварталу.
* Операционная маржа снизилась, а выход на прибыльность отодвинулся. [WSJ](https://www.wsj.com/tech/ai/openai-considers-pre-ipo-funding-round-at-more-than-1-2-trillion-valuation-54555295)
Для сравнения: Anthropic рассчитывает на оценку около $2 трлн при IPO, пишет Financial Times. Это ожидаемая оценка размещения, а не уже завершённая сделка.
https://www.ft.com/content/27509db8-b032-4437-9b2a-e909f466022f
Это примерно на 41% выше мартовских $852 млрд. Переговоры находятся на ранней стадии, IPO ожидается не раньше 2027 года.
По данным WSJ:
* Аудитория OpenAI превысила 1 млрд активных пользователей.
* Выручка за второй квартал достигла $6,7 млрд, увеличившись примерно на 18% к предыдущему кварталу.
* Операционная маржа снизилась, а выход на прибыльность отодвинулся. [WSJ](https://www.wsj.com/tech/ai/openai-considers-pre-ipo-funding-round-at-more-than-1-2-trillion-valuation-54555295)
Для сравнения: Anthropic рассчитывает на оценку около $2 трлн при IPO, пишет Financial Times. Это ожидаемая оценка размещения, а не уже завершённая сделка.
https://www.ft.com/content/27509db8-b032-4437-9b2a-e909f466022f
Media is too big
VIEW IN TELEGRAM
🔥 Один из создателей технологий, которые привели к ChatGPT, запустил модель, которая вообще не генерирует текст.
Диогу Алмейда после двух лет stealth представил TypeSafe AI и первую модель нового класса — Jev.
Идея радикально отличается от обычных LLM:
Jev не пишет ответы словами. Вместо этого модель возвращает значения, которые программа может использовать напрямую: выбор варианта, оценку, вероятность события.
Для обучения TypeSafe разработала свой метод — RLCD (Reinforcement Learning for Calibrated Decisions).
По данным компании:
- отклик — 70–500 мс
- 20–200× быстрее frontier-моделей на таких задачах
- 40–400× дешевле
- input — $0,042 за 1 млн токенов
- output — бесплатно
Целевые сценарии: классификация, маршрутизация, scoring, extraction и автоматические решения внутри программ.
Важный нюанс: заявление «не галлюцинирует» означает прежде всего то, что модель не генерирует произвольный текст и работает в заданной типизированной схеме. Это не гарантия абсолютной правильности решения.
Jev уже доступен в early access. Цифры производительности пока в основном основаны на внутренних тестах TypeSafe.
https://x.com/Machinelearrn/status/2100178485641683200
Диогу Алмейда после двух лет stealth представил TypeSafe AI и первую модель нового класса — Jev.
Идея радикально отличается от обычных LLM:
неструктурированные данные → типизированное решение → вероятностьJev не пишет ответы словами. Вместо этого модель возвращает значения, которые программа может использовать напрямую: выбор варианта, оценку, вероятность события.
Для обучения TypeSafe разработала свой метод — RLCD (Reinforcement Learning for Calibrated Decisions).
По данным компании:
- отклик — 70–500 мс
- 20–200× быстрее frontier-моделей на таких задачах
- 40–400× дешевле
- input — $0,042 за 1 млн токенов
- output — бесплатно
Целевые сценарии: классификация, маршрутизация, scoring, extraction и автоматические решения внутри программ.
Важный нюанс: заявление «не галлюцинирует» означает прежде всего то, что модель не генерирует произвольный текст и работает в заданной типизированной схеме. Это не гарантия абсолютной правильности решения.
Jev уже доступен в early access. Цифры производительности пока в основном основаны на внутренних тестах TypeSafe.
https://x.com/Machinelearrn/status/2100178485641683200
This media is not supported in your browser
VIEW IN TELEGRAM
the cake is a lie
This media is not supported in your browser
VIEW IN TELEGRAM
Digit 5 - пятое поколение гуманоидного робота для логистики и производства.
Предыдущее поколение, Digit 4, почти 3 года работает на коммерческих площадках в Северной Америке у GXO, Schaeffler, Amazon и Toyota Motor Manufacturing Canada.
По словам Agility Robotics, это её первый гуманоид, которому для работы рядом с людьми не нужны защитные ограждения, привычные для промышленной автоматизации.
Несколько типов датчиков и собственные алгоритмы ИИ отслеживают людей поблизости. Робот обходит их, останавливается или приседает, а о своих манёврах предупреждает визуальными и звуковыми сигналами. За реакцию отвечает контроллер безопасности собственной разработки.
Digit 5 ростом 1,81 м и массой 129 кг может поднимать грузы до 22,7 кг (это на 40% больше предшественника) и достаёт до полок на высоте 2,2 м.
Захваты сменные и крепятся на фланцы стандарта ISO. Батарея рассчитана на 90 минут работы, заряжается за 9 минут и, по расчёту компании, робот может работать больше 20 часов в сутки.
Digit 5 уже собирают на заводе RoboFab в штате Орегон. Ранний доступ к новинке ожидается в первой половине 2027 года, общая доступность – к концу года. Цена не объявлена.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
💡 Алгоритм Флойда находит цикл в связном списке всего с двумя указателями и `O(1)` дополнительной памяти.
Идея простая:
Если цикл есть, они обязательно встретятся.
После встречи один указатель возвращаем в
Сложность:
Один из самых красивых примеров того, как простая математика по модулю превращается в очень практичный алгоритм.
Идея простая:
slow двигается на 1 узел fast — на 2Если цикл есть, они обязательно встретятся.
После встречи один указатель возвращаем в
head, а дальше оба двигаем по одному узлу. Следующая точка встречи — точное начало цикла.
Node *detect_cycle(Node *head) {
Node *slow = head, *fast = head;
while (fast && fast->next) {
slow = slow->next;
fast = fast->next->next;
if (slow == fast) {
slow = head;
while (slow != fast) {
slow = slow->next;
fast = fast->next;
}
return slow;
}
}
return NULL;
}
Сложность:
O(n) по времени
O(1) по памяти
Один из самых красивых примеров того, как простая математика по модулю превращается в очень практичный алгоритм.
🔥 Большой гайд по миграции с Go на Rust
Для разработчиков переход обычно упирается не в скорость, а в гарантии корректности, runtime trade-offs и ergonomics.
Внутри подробно сравниваются:
interfaces → traits
goroutines → async/await
Отдельно хорошо показано, где Rust действительно выигрывает: data races, lifetime ресурсов, typed errors, отсутствие GC-пауз и более жёсткие гарантии компилятора.
Но автор не агитирует переписывать всё подряд: для большинства backend-сервисов Go остаётся достаточно быстрым и очень удобным.
Rust имеет смысл там, где цена runtime-багов уже выше, чем цена более сложной разработки.
Есть и практический раздел про постепенную миграцию сервисов, а не «rewrite from scratch».
https://corrode.dev/learn/migration-guides/go-to-rust/
Для разработчиков переход обычно упирается не в скорость, а в гарантии корректности, runtime trade-offs и ergonomics.
Внутри подробно сравниваются:
go build → cargo build go test → cargo test go vet → cargo clippy nil → Option<T> error → Result<T, E> interfaces → traits
goroutines → async/await
-race → compile-time ограничения через Send / SyncОтдельно хорошо показано, где Rust действительно выигрывает: data races, lifetime ресурсов, typed errors, отсутствие GC-пауз и более жёсткие гарантии компилятора.
Но автор не агитирует переписывать всё подряд: для большинства backend-сервисов Go остаётся достаточно быстрым и очень удобным.
Rust имеет смысл там, где цена runtime-багов уже выше, чем цена более сложной разработки.
Есть и практический раздел про постепенную миграцию сервисов, а не «rewrite from scratch».
https://corrode.dev/learn/migration-guides/go-to-rust/
🦀 NVIDIA официально идёт в native GPU programming на Rust
Теперь CUDA Rust позволяет писать GPU kernels прямо на Rust и компилировать их в PTX - без необходимости держать kernel-код на C++ или другом языке.
NVIDIA развивает сразу два подхода:
SIMT через `cuda-oxide`
- привычная CUDA-модель: один thread → одна операция
- полный контроль над потоками и памятью
- custom
- memory safety проверяется на этапе компиляции
Tile через `cutile-rs`
- работа не с отдельными потоками, а с блоками данных
- компилятор сам решает, как разложить вычисления по GPU
- stable Rust 1.89+
- CUDA 13.3
- уже используется в Hugging Face Grout и
Ownership и типы позволяют ловить часть GPU race conditions и aliasing-ошибок ещё до запуска kernel.
NVIDIA прямо пишет, что в 2026 году начинает всерьёз развивать CUDA Rust и планирует наращивать поддержку в 2027+.
Пока оба проекта ранние и не production-ready, но направление очень показательное:
https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
Теперь CUDA Rust позволяет писать GPU kernels прямо на Rust и компилировать их в PTX - без необходимости держать kernel-код на C++ или другом языке.
NVIDIA развивает сразу два подхода:
SIMT через `cuda-oxide`
- привычная CUDA-модель: один thread → одна операция
- полный контроль над потоками и памятью
- custom
rustc backend → MIR → LLVM → PTX- memory safety проверяется на этапе компиляции
Tile через `cutile-rs`
- работа не с отдельными потоками, а с блоками данных
- компилятор сам решает, как разложить вычисления по GPU
- stable Rust 1.89+
- CUDA 13.3
- уже используется в Hugging Face Grout и
mistral.rs Ownership и типы позволяют ловить часть GPU race conditions и aliasing-ошибок ещё до запуска kernel.
NVIDIA прямо пишет, что в 2026 году начинает всерьёз развивать CUDA Rust и планирует наращивать поддержку в 2027+.
Пока оба проекта ранние и не production-ready, но направление очень показательное:
`Rust → native GPU kernels → PTX → CUDA`https://developer.nvidia.com/blog/introducing-cuda-rust-two-tracks-for-writing-gpu-kernels/
🚀 JetBrains обновила roadmap Kotlin: главный фокус - Multiplatform, Wasm и удобство разработки
Что сейчас в приоритете:
- довести Kotlin/Wasm до Stable
- ускорить KAPT до уровня Java APT
- улучшить incremental compilation в K2
- сделать новый JVM reflection
- перевести
- продвинуть Swift Export из Alpha в Beta
- улучшить Xcode integration и Kotlin/Native debugger
- добавить импорт Swift Package Manager пакетов
- развивать Kotlin LSP и поддержку VS Code
- выпустить единый Kotlin Toolchain
- добавить first-class поддержку JPA/Hibernate для Kotlin stdlib types
- стабилизировать
- выпустить Kotlin DataFrame 1.0
- добавить HTTP/3 и gRPC в Ktor
Из уже завершённого: Swift 6.3 support, multi-module compilation для Kotlin/Wasm, Navigation3 для Compose Multiplatform и 18-месячное окно security fixes для stdlib.
Главное направление видно очень чётко: Kotlin всё сильнее двигается в сторону полноценной кроссплатформенной экосистемы — JVM, iOS, WebAssembly и web.
Следующее обновление roadmap запланировано на февраль 2027.
https://kotlinlang.org/docs/roadmap.html
Что сейчас в приоритете:
- довести Kotlin/Wasm до Stable
- ускорить KAPT до уровня Java APT
- улучшить incremental compilation в K2
- сделать новый JVM reflection
- перевести
wasm-wasi на WASI Preview 2 и добавить Component Model- продвинуть Swift Export из Alpha в Beta
- улучшить Xcode integration и Kotlin/Native debugger
- добавить импорт Swift Package Manager пакетов
- развивать Kotlin LSP и поддержку VS Code
- выпустить единый Kotlin Toolchain
- добавить first-class поддержку JPA/Hibernate для Kotlin stdlib types
- стабилизировать
kotlinx.serialization, kotlinx.collections.immutable и kotlinx-io- выпустить Kotlin DataFrame 1.0
- добавить HTTP/3 и gRPC в Ktor
Из уже завершённого: Swift 6.3 support, multi-module compilation для Kotlin/Wasm, Navigation3 для Compose Multiplatform и 18-месячное окно security fixes для stdlib.
Главное направление видно очень чётко: Kotlin всё сильнее двигается в сторону полноценной кроссплатформенной экосистемы — JVM, iOS, WebAssembly и web.
Следующее обновление roadmap запланировано на февраль 2027.
https://kotlinlang.org/docs/roadmap.html
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.
При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.
Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.
Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.
В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.
Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.
В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.
На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.
Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.
Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.
Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.
В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥 Mozilla выпустила 91-страничный отчёт о состоянии open-weight AI — и главный вывод: открытые модели уже примерно в 4 месяцах от frontier.
По данным отчёта:
- 8 из 10 самых используемых моделей на OpenRouter по августовскому token volume — open-weight
- 7 из них созданы в Китае
- DeepSeek первой среди открытых моделей вышла на первое место OpenRouter по weekly requests
- open-модели используют 79% разработчиков, но до production доходят только 51% внедрений против 63% у закрытых
- capability gap с закрытым frontier сейчас измеряется буквально несколькими пунктами
Экономика при этом очень странная.
Open-модели уже забирают огромную долю usage, но в более раннем окне измерений получали лишь около 4% model-layer revenue. Одна из причин - цена: закрытые модели обходились примерно в 6× дороже при близком уровне возможностей.
Ещё интереснее DeepSeek: крупный прирост качества компания получила не новым pretraining run, а несколькими post-training проходами, около +10, а затем ещё +8 пунктов по индексу.
И даже стратегия «возьмём несколько разных моделей для надёжности» не всегда спасает: у Kimi K3 и Claude Fable 5 корреляция ошибок по задачам достигала 0,72. То есть разные модели нередко ломаются на одном и том же.
Главный сдвиг уже произошёл: вопрос больше не в том, смогут ли open-weight модели догнать frontier.
Они уже рядом. Теперь проблема - инфраструктура, tooling и production-ready экосистема вокруг них.
https://stateofopensource.ai
По данным отчёта:
- 8 из 10 самых используемых моделей на OpenRouter по августовскому token volume — open-weight
- 7 из них созданы в Китае
- DeepSeek первой среди открытых моделей вышла на первое место OpenRouter по weekly requests
- open-модели используют 79% разработчиков, но до production доходят только 51% внедрений против 63% у закрытых
- capability gap с закрытым frontier сейчас измеряется буквально несколькими пунктами
Экономика при этом очень странная.
Open-модели уже забирают огромную долю usage, но в более раннем окне измерений получали лишь около 4% model-layer revenue. Одна из причин - цена: закрытые модели обходились примерно в 6× дороже при близком уровне возможностей.
Ещё интереснее DeepSeek: крупный прирост качества компания получила не новым pretraining run, а несколькими post-training проходами, около +10, а затем ещё +8 пунктов по индексу.
И даже стратегия «возьмём несколько разных моделей для надёжности» не всегда спасает: у Kimi K3 и Claude Fable 5 корреляция ошибок по задачам достигала 0,72. То есть разные модели нередко ломаются на одном и том же.
Главный сдвиг уже произошёл: вопрос больше не в том, смогут ли open-weight модели догнать frontier.
Они уже рядом. Теперь проблема - инфраструктура, tooling и production-ready экосистема вокруг них.
https://stateofopensource.ai
🔥 На официальном сайте Federal Register неожиданно обнаружился Qwen3.
В расширенном поиске среди режимов прямо указаны:
и отдельно:
Китайская open-weight модель Alibaba уже используется как часть поискового стека сайта, на котором публикуются федеральные правила, указы, уведомления и другие документы правительства США.
Особенно иронично это выглядит сейчас: буквально на днях NSA, FBI и CISA выпустили предупреждение о «промышленном дистиллировании» американских frontier-моделей китайскими AI-компаниями.
Сами американские ведомства отдельно признают, что distillation как технология вполне легитимна. Претензии относятся к несанкционированному извлечению возможностей закрытых моделей, а не к использованию open-source/open-weight моделей как таковых.
В расширенном поиске среди режимов прямо указаны:
Hybrid Qwen3:0.6B (512D, Recursive Splitting, Distilled, Prefixed)и отдельно:
Qwen3:0.6BКитайская open-weight модель Alibaba уже используется как часть поискового стека сайта, на котором публикуются федеральные правила, указы, уведомления и другие документы правительства США.
Особенно иронично это выглядит сейчас: буквально на днях NSA, FBI и CISA выпустили предупреждение о «промышленном дистиллировании» американских frontier-моделей китайскими AI-компаниями.
Сами американские ведомства отдельно признают, что distillation как технология вполне легитимна. Претензии относятся к несанкционированному извлечению возможностей закрытых моделей, а не к использованию open-source/open-weight моделей как таковых.
🔥 Z.ai раскрыла, как GLM-5.3 участвовала в оптимизации собственной inference-инфраструктуры.
Для GLM-5.3-Flash компания развернула serving stack на крупном кластере китайских AI-ускорителей и использовала Infra Agent на базе GLM-5.3 для работы с kernels, bottleneck’ами, операторами и настройкой inference engine.
Стек построен поверх SGLang и использует Encode-Prefill–Decode disaggregation, quantization и аппаратно-зависимые оптимизации.
По данным Z.ai, после серии таких оптимизаций end-to-end производительность выросла примерно в 3 раза относительно исходного baseline на том же железе.
https://z.ai/blog/glm-built-its-inference-infrastructure
Для GLM-5.3-Flash компания развернула serving stack на крупном кластере китайских AI-ускорителей и использовала Infra Agent на базе GLM-5.3 для работы с kernels, bottleneck’ами, операторами и настройкой inference engine.
Стек построен поверх SGLang и использует Encode-Prefill–Decode disaggregation, quantization и аппаратно-зависимые оптимизации.
По данным Z.ai, после серии таких оптимизаций end-to-end производительность выросла примерно в 3 раза относительно исходного baseline на том же железе.
https://z.ai/blog/glm-built-its-inference-infrastructure