Complete AI
7.79K subscribers
511 photos
38 videos
10 files
280 links
Меня зовут Андрей Кузнецов

Руковожу управлением в Sber AI, построил успешную лабораторию FusionBrain в AIRI, один из основателей Kandinsky, к.т.н., 15+ лет опыта в Computer Vision, выступаю с лекциями и пишу о событиях в AI и ML
Download Telegram
⚡️Новости опенсорса

👉GLM-5.2 Almost Opus-level

👉Kimi-K3 Almost Fable-level

👉Qwen-3.8 🔜 2.4T, Expected to beat Opus

👉Deepseek V4 GA 🔜 $0.0028/M Expected to beat Opus

👉Minimax-M3-Pro 🔜 3T, Expected to be Fable-level

👉GLM-5.5 🔜 Expected to beat Opus
26🔥10
Вот и price plan доехал от Qwen Cloud. По современным меркам очень демократичный)

https://www.qwencloud.com/pricing/token-plan
👍61
Kimi как обещали зарелизили в опенсурс веса своей самой крупной модели K3 - 2.8T параметров🔥

Осталось домашний комп чуть обновить и можно тестировать

https://huggingface.co/moonshotai/Kimi-K3
😁27🙏8🏆5
9🏆31
Интегрально инсайты из K3: 2.78Т параметров, 896 экспертов, 1M контекст. Под капотом — системная оптимизация на каждом уровне стека:

1️⃣ SiTU-GLU — замена SwiGLU с мягким насыщением активаций. Именно это позволило безопасно масштабировать sparsity до 56× (16 из 896 экспертов). Без этого приёма модель бы просто взорвалась

2️⃣ Quantile Balancing — балансировка нагрузки экспертов за один forward pass через квантили. Полностью убрали auxiliary loss, как следствие чище градиенты, быстрее сходимость

3️⃣ MoonViT-V2 — vision encoder обучен с нуля через next-token prediction. Контрастивный pre-training (SigLIP/CLIP) оказался нестабильным при joint optimization

4️⃣ AgentENV — microVM-песочницы вместо контейнеров для RL. Firecracker VM: checkpoint за 133ms, resume за 49ms, memory overcommit 6.5×51.2 млн sandbox'ов за тренинг

5️⃣ MoonEP — expert parallelism с доказуемой верхней границей redundant-экспертов. Обучение работает 100% времени без остановок на балансировку
🔥13💯3🏆1
🤖 Ищем менеджера проектов в ИИ-стройку

Мы — SberAI, команда, которая строит будущее строительства с помощью искусственного интеллекта. Совмещаем исследования и реальное применение: автоматизируем анализ и составление строительной документации, извлекаем данные из BIM-моделей, создаём генеративные решения для архитектуры и дизайна.
Ищем человека, который сведёт воедино науку, продукт и стройку.

Чем предстоит заниматься
→ Управлять проектами от идеи до внедрения: планировать сроки, ресурсы, риски и зависимости
→ Синхронизировать усилия исследователей (DS, ML-инженеров) и продуктовой команды — переводить научные разработки в рабочие решения
→ Работать с заказчиками из строительной отрасли: понимать их процессы, формализовывать требования, контролировать качество поставки
→ Вести проектную документацию и обеспечивать прозрачность для всех стейкхолдеров
→ Анализировать рынок строительных ИИ-решений: конкуренты, тренды, регуляторика, потребности заказчиков
→ Формулировать бизнес-требования на основе анализа рынка и обратной связи — переводить инсайты в задачи для команды
→ Определять ключевые метрики: технические (точность, скорость инференса), продуктовые (вовлечённость, retention) и бизнесовые (экономия времени, снижение ошибок)
→ Готовить аналитику для руководства: эффективность внедрённых решений, прогнозы, сравнение с рынком

Что важно для нас
Опыт управления проектами в технических командах 3+ лет — желательно в продуктах с ИИ-компонентом или сложной доменной логикой
Понимание жизненного цикла ML-проектов: от сбора данных до production-инференса
Знакомство со строительной отраслью или готовность быстро погружаться: BIM, проектная документация, СП, стадии строительного цикла
Гибкость: умение работать и в условиях исследовательской неопределённости, и в режиме продуктовой поставки
Коммуникация: умение объяснять сложные технические вещи нетехническим стейкхолдерам и наоборот

Откликнуться — пишите в личку Евгении Газарян @jjg26
12🙊9🔥6👍2😁2
Вдруг вчера кому-то было мало инсайтов про K3, предлагаю ещё такой коротенький почитать😉

https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html
12👍2
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥16🎉12👏821👍1
Ну вот и Qwen 3.8 пожаловал💪

Автономный кодинг: более 10 дней саморазвивающейся разработки - от пустой папки до готового к эксплуатации продукта без вмешательства человека; полная история проекта доступна на GitHub: https://github.com/qwen-code-dev-bot/oh-my-cli

Работает в пром задачах: готовые решения production уровня для сотен задач

Высокий уровень долгосрочного планирования: автономное планирование на системном уровне с адаптивным обучением по принципу замкнутого цикла, обеспечивающее выполнение 500+ итераций оптимизации дизайна чипов и разработку стратегии на год в e-com

Нативная мультимодальность: vision как непрерывный контур обратной связи для планирования, выполнения задач и самокоррекции
🏆179
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️CADENA: Stepwise CAD Reverse Engineering
Новое решение от Лаборатории FusionBrain, группы Пространственного интеллекта Института AIRI и команды Sber AI 🚀


Релиз в нашей линейке моделей для реверс-инжиниринга деталей!

tldr: Перешли на пошаговое предсказание — модель стала гибче, качество выросло, и чем сложнее датасет, тем больше отрыв. Плюс собрали CADENA-Bench: 3396 реальных механических деталей, разбитых по категориям ЕСКД, чтобы можно было оценивать готовность к практике для отдельных типов деталей.

Постановка задачи для тех, кто пока про нее не слышал: по скану физической детали восстановить её CAD-модель — дерево построений, которое инженер может править и по которому деталь можно произвести. Последовательность CAD-операций пишется питоновским кодом, так что фактически это mesh2code.

Наши прошлые модели предсказывали всю последовательность разом и потому наследовали статистику трейна: если операция B в обучении всегда стоит между A и C, на инференсе она встанет туда же. На сложных и редких деталях это ломалось. В CADENA мы предсказываем по одной операции за раз — модель исполняет то, что уже написала, смотрит на разницу с целью и решает, что делать дальше. Плюс новый генератор, дающий длинные последовательности операций.

Результат: заметный отрыв на всех датасетах, где мы замеряемся. На CADENA-Bench мы лучше в 5 категориях из 6 и в среднем. На BenchCAD, где свои модели меряет в том числе Claude, восстановление объёма 91% против 71% у фронтирных моделей и 75% у специализированных.

На гифке — как модель собирает деталь по операциям.

🤗 Будем очень благодарны за апвоуты на HF и звёздочки на GitHub:
👉 Paper тут и тут
👉 GitHub
👉 Dataset
👉 Model

👉 Заапвоутить
❤‍🔥15🏆7👍4🔥2
Отличный результат для опенсурса на бенчмарке по восстановлению кода frontend’а по изображению или скриншоту💪

Сделал скрипт парсинга сайта, прошелся по страницам, заскриншотил и велкам - копия сайта уже готова:)
👍5🔥3😁2