Forwarded from Machinelearning
Mamba2 делала ставку на быстрое обучение. Ради этого механизм рекуррентных обновлений упрощали: матрицу переходов состояний свели к скаляру, умноженному на единичную матрицу.
Обучение ускорилось, но при декодировании GPU большую часть времени не считает, а гоняет данные между уровнями памяти. Архитектура оказалась с нюансом - вычислительные ядра простаивают.
С тех пор ландшафт изменился. RL с верифицируемыми наградами для кода и математики, агентные пайплайны - все это генерирует прорву токенов на инференсе. Команда Mamba3 задалась вопросом: как выглядела бы SSM-архитектура, если сделать ее с приоритетом на инференс, а не на обучение?
Так родились 3 главных изменения в ядре Mamba.
SSM в базе - это обыкновенное дифференциальное уравнение, которое нужно перевести в дискретную рекуррентную формулу. Mamba1 и Mamba2 использовали комбинацию двух методов (ZOH и Эйлера), подобранную эмпирически.
В Mamba3 реализовали экспоненциально-трапецеидальный метод: вместо одной точки для аппроксимации интеграла берутся обе границы интервала с обучаемым коэффициентом смешивания. В результате рекуррентная формула неявно применяет свёртку к входу скрытого состояния, что делает динамику выразительнее без дополнительных компонентов.
Ранние модели семейства S4 работали с комплексными числами, но Mamba1 от них отказалась. Из-за этого модель не справляется даже с простейшими задачами отслеживания состояний (например, определением четности последовательности).
Решение нашли во вращении в двумерном пространстве: вместо комплексных вычислений авторы разложили переход на масштабирование и поворот, а затем применили фишку из RoPE - встроили вращения в матрицы через кумулятивную сумму углов.
Переписывать ядра для поддержки комплексной арифметики не пришлось. Модель решает задачи на чётность и другие бенчмарки, недоступные предыдущим версиям.
В стандартной SSM каждый хэд содержит набор независимых систем (один вход - один выход). При декодировании арифметическая интенсивность составляет около 2,5 операций на байт при пороге вычислительной загруженности на H100 в районе 300.
Mamba3 расширяет матрицы, превращая внешние произведения в матричные умножения. Арифметическая интенсивность растет пропорционально. При этом размер скрытого состояния не увеличивается, а значит, латентность декодирования почти не меняется. Обучение, конечно, дорожает, но это сознательный компромисс.
Еще из архитектуры убрали короткую каузальную свёртку, присутствовавшую с первой Mamba - новая рекуррентная формула и смещения выполняют ту же функцию.
Добавили нормализацию BCNorm по аналогии с QKNorm в трансформерах, перешли на чередование SSM- и MLP-слоев.
Ядра написаны на Triton (prefill SISO), TileLang (prefill MIMO) и CuTe DSL (decode).
Mamba-3 SISO при 1,5B параметров показывает лучшую суммарную латентность prefill + decode на всех длинах последовательностей по сравнению с Mamba2, Gated DeltaNet и Llama-3.2-1B под vLLM на одном H100.
MIMO-вариант сопоставим по скорости с Mamba2, но заметно точнее. При анализе Парето-фронта Mamba-3 показывает тот же уровень качества при вдвое меньшем состоянии.
@ai_machinelearning_big_data
#AI #ML #LLM #Mamba3 #TogetherAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
As2 предлагается в 3 версиях: AIR, PRO и EDU.
Вся линейка построена на одной механической базе: 18 кг, 12 степеней свободы, промышленные крестовые подшипники и моторы PMSM с низкой инерцией. Корпус - алюминиевый сплав с высокопрочным пластиком.
Базовая электроника тоже унифицирована: 8-ядерный CPU, Wi-Fi 6, Bluetooth 5.2, HD-камера, микрофон, динамик.
As2 AIR (бюджетный вариант)
Максимальный крутящий момент суставов 65 Нм, скорость до 3 м/с, грузоподъемность при ходьбе до 10 кг, подъем по склону до 30°. Батарея на 8000 мАч, без быстрой зарядки. Нет GPS, 4G, LiDAR и ISS 3.0. Это минимально рабочая конфигурация.
As2 PRO
Крутящий момент 75 Нм, скорость до 3,7 м/с, нагрузка до 13 кг, подъём 40°. Сюда добавили LiDAR, GPS, 4G, система ISS 3.0 для отслеживания сопровождаемого объекта, защита IP54. Батарея на 15 000 мАч с быстрой зарядкой обеспечивает до 4 часов хода налегке и до 13 км с нагрузкой 13 кг.
As2 EDU (платформа для разработчиков).
Характеристики ходовой части совпадают с PRO, но максимальный момент до 90 Нм, а нагрузка при ходьбе до 15 кг. Главное отличие: поддержка API, станция для автономной зарядки и опциональный вычислительный модуль NVIDIA Jetson Orin NX. Это единственная версия, которую можно программировать под собственные задачи.
Все 3 модели получают OTA-обновления через платформу UniStore и работают при температурах от −20 до +50 °C. Цен в открытых источниках пока нет.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Data Science и Data Engineering: какое направление выбрать в 2026 году?
🎧 1 апреля пройдет День открытых дверей онлайн-магистратуры НИЯУ МИФИ «Специалист по работе с данными и ИИ» в партнёрстве с Яндекс Практикумом.
Подключайтесь онлайн 1 апреля в 19:00 мск.
🏃♀️ Записаться на ДОД
На встрече обсудят:💙 как рост ИИ трансформируют рынок труда💙 4 трека для развития: ML, CV, NLP и Data Engineering💙 какие задачи усложняются и где усиливается конкуренция
И расскажут, как за 2 года освоить фундаментальную базу, собрать портфолио из проектов и получить диплом магистра без отрыва от работы.
Подключайтесь онлайн 1 апреля в 19:00 мск.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Unsloth Studio - это локальный комбайн, который объединяет подготовку данных, обучение, инференс и экспорт модели в одном месте.
Под капотом кастомные Triton-ядра с собственным backprop. По сравнению со стандартными CUDA-реализациями это дает 2х прирост скорости обучения и снижение потребления по VRAM на 70%.
Поддерживаются полный файн-тюнинг, претрейн, LoRA, QLoRA, 4-bit, 16-bit и FP8. Всего совместимо более 500 моделей, включая Llama 4, Qwen 3.5 и Gemma 3.
Для работы с данными есть визуальный нодовый редактор Data Recipes. Studio принимает PDF, DOCX, CSV и JSONL, генерирует синтетические датасеты и автоматически конвертирует данные в форматы ChatML или Alpaca.
Помимо стандартного SFT, Studio умеет в GRPO, которая не требует отдельной critic-модели и потребляет на 80% меньше VRAM, что делает обучение ризонинг-моделей реалистичным на локальном железе.
Модели на 8B и 70B параметров (например, Llama 3.1, Llama 3.3, DeepSeek-R1) можно файн-тюнить на одной RTX 4090 или 5090, а не на кластере, но есть и поддержка multi-GPU.
В режиме инференса Studio умеет: tool calling, выполнение кода прямо в чате, работу с изображениями, аудио, PDF и DOCX. Из коробки - веб-поиск и автонастройка параметров инференса.
Экспорт результатов - одной кнопкой в GGUF, vLLM или Ollama. Studio сама мерджит LoRA-адаптеры с базовой моделью.
Работает на Windows, Linux и macOS (на Mac пока только инференс, поддержка MLX-обучения анонсирована), есть Docker. AMD-пользователи могут обучать через Unsloth Core, поддержка в Studio обещана позже.
@ai_machinelearning_big_data
#AI #ML #LLM #Framework #Train #UnslothStudio
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Флагман. Триллион параметров суммарно, 42 млрд. активных при инференсе, архитектура MoE с гибридным вниманием и контекстным окном в 1 миллион токенов. До официального анонса модель тестировалась на OpenRouter под именем Hunter Alpha.
Реальная агентская эффективность на GDPval-AA: Elo 1434 (лучший результат среди китайских моделей).
Цена API: $1 вход / $3 выход за млн. токенов при контексте 256K и $2 вход / $6 выход для контекста 256К-1М.
Принимает текст, изображения, видео и аудио через единую базу с отдельными энкодерами для каждой модальности. Параметры не раскрыты. Модель поддерживает непрерывную обработку аудио длиной свыше 10 часов в одном запросе.
Цена: $0,40 вход / $2,00 выход.
На демонстрации модель прошла цикл онлайн-покупки автономно: нашла отзывы на Xiaohongshu, сравнила продавцов на JD.com, поторговалась с поддержкой, оформила заказ.
Второе демо: получила одно текстовое задание, сняла 15-секундный ролик из 4 сцен, синтезировала звук, исправила ошибку рендеринга шрифта, загрузила на TikTok и опубликовала.
Модель обучена на сотнях миллионов часов аудио, и допилена через многомерный RL. Синтезирует речь с управлением эмоциями на уровне отдельных предложений, поёт с сохранением высоты и ритма, воспроизводит китайские диалекты: сычуаньский, хэнаньский, кантонский, тайваньский. Поддержка других языков не заявлена.
Форматные маркеры в тексте: пунктуацию, частицы и выделение сама переводит в просодику без дополнительной разметки.
Доступ на ограниченный период - бесплатно. Сроки предложения не указаны.
Кстати, команду MiMo возглавляет Ло Фули, один из ключевых авторов DeepSeek R1.
Все модели релиза доступны через API на platform.xiaomimimo.com и в MiMo Studio.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Красноярские фтизиатры используют искусственный интеллект для выявления туберкулёза
https://kraszdrav.ru/news/14300
https://kraszdrav.ru/news/14300
"Билайн" внедрил ИИ для управления инцидентами на сети
https://ria.ru/20260320/bilayn-2081469745.html
https://ria.ru/20260320/bilayn-2081469745.html
Учёные СамГМУ выявили речевые биомаркеры при сердечной недостаточности https://samsmu.ru/news/2026/2303/
В ТюмГУ представили цифровых помощников для информирования населения о паводках https://www.utmn.ru/news/stories/nauka-segodnya/1351839/
От эксперимента к победе: подвели итоги Национальной технологической олимпиады по профилю «Искусственный интеллект» https://ntcontest.ru/news/7899/
Москвичи начали доверять ИИ планирование отдыха https://www.megafon-com.ru/news/2026/03/20/105928/
www.megafon-com.ru
МегаФон — Домашний интернет, цифровое телевидение и мобильная связь от интернет провайдера
Тарифные планы для безлимитного мобильного интернета, интернета для планшета и модема, а также для дома или дачи.
Галлюцинации ИИ встревожили пользователей больше риска потерять работу https://www.rbc.ru/technology_and_media/22/03/2026/69bfab309a7947e03bd8393f
Forwarded from ЛИТ ОИЯИ / MLIT JINR
📺 Недавно в Лаборатории информационных технологий им. М. Г. Мещерякова прошли съемки для федеральных каналов российского телевидения. Героиней интервью для Первого канал и ТК Россия 1 стала Татьяна Александровна Стриж, заместитель научного руководителя ЛИТ.
🎥 ЛИТ был одной из съемочных локаций — съемки проходили во всех лабораториях Института в рамках подготовки новостных сюжетов к 70-летию Объединённого института ядерных исследований.
🫥 Татьяна Александровна рассказала гостям о направлениях научной деятельности ЛИТ и о возможностях Многофункционального информационно-вычислительного комплекса ОИЯИ.
📆 Ждём 26 марта и выхода подготовленных сюжетов об ОИЯИ в эфире ведущих телеканалов!📺
📲 Подписывайтесь на канал ЛИТ в MAX
🎥 ЛИТ был одной из съемочных локаций — съемки проходили во всех лабораториях Института в рамках подготовки новостных сюжетов к 70-летию Объединённого института ядерных исследований.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1👍1