Начинаем первый день на ICML 2026💪
Довольно интересный доклад про способ «обогащения» рага графом темпоральных знаний с разными режимами работы, типа извлечения субграфа на лету через прерывания в диалоге.
https://arxiv.org/abs/2510.13590
Довольно интересный доклад про способ «обогащения» рага графом темпоральных знаний с разными режимами работы, типа извлечения субграфа на лету через прерывания в диалоге.
https://arxiv.org/abs/2510.13590
🔥17❤9👍5
Вчера вечером был на ивенте ML&DS Offstage от Ozon Tech, участвовал в круглом столе «Агенты: от исследований к бизнес-внедрениям», где модератором был мой хороший друг Алексей Обровец.
Очень интересные спикеры! Вроде бы стандартные и наболевшие вопросы, но так много разных содержательных мнений. Конечно, больше всего волнуются за молодое поколение, подходы к образованию в эпоху агентной экономики — всё это очень важно и нужно постоянно анализировать и развивать. А главное, «не бояться», потому что любые технологические изменения направлены на то, чтобы сделать жизнь лучше. Проблемы галлюцинаций, предсказуемости и объяснимости подведения моделей и агентов ещё находятся в глубокой фазе исследований, но как и любым инструментом агентами надо учиться пользоваться себе во благо, и мы явно идём правильным путём.
Ну и фотоотчёт😎
Очень интересные спикеры! Вроде бы стандартные и наболевшие вопросы, но так много разных содержательных мнений. Конечно, больше всего волнуются за молодое поколение, подходы к образованию в эпоху агентной экономики — всё это очень важно и нужно постоянно анализировать и развивать. А главное, «не бояться», потому что любые технологические изменения направлены на то, чтобы сделать жизнь лучше. Проблемы галлюцинаций, предсказуемости и объяснимости подведения моделей и агентов ещё находятся в глубокой фазе исследований, но как и любым инструментом агентами надо учиться пользоваться себе во благо, и мы явно идём правильным путём.
Ну и фотоотчёт
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥26❤18❤🔥7🙏3👍1
⚡️Новости опенсорса
👉GLM-5.2 ✅ Almost Opus-level
👉Kimi-K3 ✅ Almost Fable-level
👉Qwen-3.8 🔜 2.4T, Expected to beat Opus
👉Deepseek V4 GA 🔜 $0.0028/M Expected to beat Opus
👉Minimax-M3-Pro 🔜 3T, Expected to be Fable-level
👉GLM-5.5 🔜 Expected to beat Opus
👉GLM-5.2 ✅ Almost Opus-level
👉Kimi-K3 ✅ Almost Fable-level
👉Qwen-3.8 🔜 2.4T, Expected to beat Opus
👉Deepseek V4 GA 🔜 $0.0028/M Expected to beat Opus
👉Minimax-M3-Pro 🔜 3T, Expected to be Fable-level
👉GLM-5.5 🔜 Expected to beat Opus
❤25🔥9
Вот и price plan доехал от Qwen Cloud. По современным меркам очень демократичный)
https://www.qwencloud.com/pricing/token-plan
https://www.qwencloud.com/pricing/token-plan
👍6❤1
Kimi как обещали зарелизили в опенсурс веса своей самой крупной модели K3 - 2.8T параметров🔥
Осталось домашний комп чуть обновить и можно тестировать
https://huggingface.co/moonshotai/Kimi-K3
Осталось домашний комп чуть обновить и можно тестировать
https://huggingface.co/moonshotai/Kimi-K3
huggingface.co
moonshotai/Kimi-K3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
😁26🙏7🏆5
Интегрально инсайты из K3: 2.78Т параметров, 896 экспертов, 1M контекст. Под капотом — системная оптимизация на каждом уровне стека:
1️⃣ SiTU-GLU — замена SwiGLU с мягким насыщением активаций. Именно это позволило безопасно масштабировать sparsity до 56× (16 из 896 экспертов). Без этого приёма модель бы просто взорвалась
2️⃣ Quantile Balancing — балансировка нагрузки экспертов за один forward pass через квантили. Полностью убрали auxiliary loss, как следствие чище градиенты, быстрее сходимость
3️⃣ MoonViT-V2 — vision encoder обучен с нуля через next-token prediction. Контрастивный pre-training (SigLIP/CLIP) оказался нестабильным при joint optimization
4️⃣ AgentENV — microVM-песочницы вместо контейнеров для RL. Firecracker VM: checkpoint за 133ms, resume за 49ms, memory overcommit 6.5×51.2 млн sandbox'ов за тренинг
5️⃣ MoonEP — expert parallelism с доказуемой верхней границей redundant-экспертов. Обучение работает 100% времени без остановок на балансировку
1️⃣ SiTU-GLU — замена SwiGLU с мягким насыщением активаций. Именно это позволило безопасно масштабировать sparsity до 56× (16 из 896 экспертов). Без этого приёма модель бы просто взорвалась
2️⃣ Quantile Balancing — балансировка нагрузки экспертов за один forward pass через квантили. Полностью убрали auxiliary loss, как следствие чище градиенты, быстрее сходимость
3️⃣ MoonViT-V2 — vision encoder обучен с нуля через next-token prediction. Контрастивный pre-training (SigLIP/CLIP) оказался нестабильным при joint optimization
4️⃣ AgentENV — microVM-песочницы вместо контейнеров для RL. Firecracker VM: checkpoint за 133ms, resume за 49ms, memory overcommit 6.5×51.2 млн sandbox'ов за тренинг
5️⃣ MoonEP — expert parallelism с доказуемой верхней границей redundant-экспертов. Обучение работает 100% времени без остановок на балансировку
🔥11💯1🏆1
🤖 Ищем менеджера проектов в ИИ-стройку
Мы — SberAI, команда, которая строит будущее строительства с помощью искусственного интеллекта. Совмещаем исследования и реальное применение: автоматизируем анализ и составление строительной документации, извлекаем данные из BIM-моделей, создаём генеративные решения для архитектуры и дизайна.
Ищем человека, который сведёт воедино науку, продукт и стройку.
Чем предстоит заниматься
→ Управлять проектами от идеи до внедрения: планировать сроки, ресурсы, риски и зависимости
→ Синхронизировать усилия исследователей (DS, ML-инженеров) и продуктовой команды — переводить научные разработки в рабочие решения
→ Работать с заказчиками из строительной отрасли: понимать их процессы, формализовывать требования, контролировать качество поставки
→ Вести проектную документацию и обеспечивать прозрачность для всех стейкхолдеров
→ Анализировать рынок строительных ИИ-решений: конкуренты, тренды, регуляторика, потребности заказчиков
→ Формулировать бизнес-требования на основе анализа рынка и обратной связи — переводить инсайты в задачи для команды
→ Определять ключевые метрики: технические (точность, скорость инференса), продуктовые (вовлечённость, retention) и бизнесовые (экономия времени, снижение ошибок)
→ Готовить аналитику для руководства: эффективность внедрённых решений, прогнозы, сравнение с рынком
Что важно для нас
✅ Опыт управления проектами в технических командах 3+ лет — желательно в продуктах с ИИ-компонентом или сложной доменной логикой
✅ Понимание жизненного цикла ML-проектов: от сбора данных до production-инференса
✅ Знакомство со строительной отраслью или готовность быстро погружаться: BIM, проектная документация, СП, стадии строительного цикла
✅ Гибкость: умение работать и в условиях исследовательской неопределённости, и в режиме продуктовой поставки
✅ Коммуникация: умение объяснять сложные технические вещи нетехническим стейкхолдерам и наоборот
Откликнуться — пишите в личку Евгении Газарян @jjg26
Мы — SberAI, команда, которая строит будущее строительства с помощью искусственного интеллекта. Совмещаем исследования и реальное применение: автоматизируем анализ и составление строительной документации, извлекаем данные из BIM-моделей, создаём генеративные решения для архитектуры и дизайна.
Ищем человека, который сведёт воедино науку, продукт и стройку.
Чем предстоит заниматься
→ Управлять проектами от идеи до внедрения: планировать сроки, ресурсы, риски и зависимости
→ Синхронизировать усилия исследователей (DS, ML-инженеров) и продуктовой команды — переводить научные разработки в рабочие решения
→ Работать с заказчиками из строительной отрасли: понимать их процессы, формализовывать требования, контролировать качество поставки
→ Вести проектную документацию и обеспечивать прозрачность для всех стейкхолдеров
→ Анализировать рынок строительных ИИ-решений: конкуренты, тренды, регуляторика, потребности заказчиков
→ Формулировать бизнес-требования на основе анализа рынка и обратной связи — переводить инсайты в задачи для команды
→ Определять ключевые метрики: технические (точность, скорость инференса), продуктовые (вовлечённость, retention) и бизнесовые (экономия времени, снижение ошибок)
→ Готовить аналитику для руководства: эффективность внедрённых решений, прогнозы, сравнение с рынком
Что важно для нас
✅ Опыт управления проектами в технических командах 3+ лет — желательно в продуктах с ИИ-компонентом или сложной доменной логикой
✅ Понимание жизненного цикла ML-проектов: от сбора данных до production-инференса
✅ Знакомство со строительной отраслью или готовность быстро погружаться: BIM, проектная документация, СП, стадии строительного цикла
✅ Гибкость: умение работать и в условиях исследовательской неопределённости, и в режиме продуктовой поставки
✅ Коммуникация: умение объяснять сложные технические вещи нетехническим стейкхолдерам и наоборот
Откликнуться — пишите в личку Евгении Газарян @jjg26
❤9🙊6🔥4👍2😁1
Вдруг вчера кому-то было мало инсайтов про K3, предлагаю ещё такой коротенький почитать😉
https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html
https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html
Sebastian Raschka, PhD
Kimi K3 Architecture Notes
Short architecture note on Kimi K3, including LatentMoE, Kimi Delta Attention, Attention Residuals, NoPE, multimodality, and inference-efficiency choices.
❤5