LongCat-2.0
Новая модель от Meituan. Не SOTA, но есть кое-что интересное:
- Собственный эффективный атеншен LongCat Sparse Attention (LSA), основанный на DSA.
- Обучали на китайских AI чипах.
- Динамические эксперты, как и в прошлой модели LongCat.
- 1M контекст, 1.6T параметров, 35T токенов претрен.
- Лицензия MIT, но веса еще не залили.
- По бенчмаркам +- Gemini 3.1 Pro.
Блогпост, веса (скоро)
Новая модель от Meituan. Не SOTA, но есть кое-что интересное:
- Собственный эффективный атеншен LongCat Sparse Attention (LSA), основанный на DSA.
- Обучали на китайских AI чипах.
- Динамические эксперты, как и в прошлой модели LongCat.
- 1M контекст, 1.6T параметров, 35T токенов претрен.
- Лицензия MIT, но веса еще не залили.
- По бенчмаркам +- Gemini 3.1 Pro.
Блогпост, веса (скоро)
👍5🔥3
Krist/Blog
Tencent HY3 Preview Новая открытая языковая модель от tencent. Основные моменты: - MoE 300B-A21B. - 256K контекста. - Опубликована как базовая, так и чат-модель. - По бенчмаркам звёзд с неба не хватает. - Лицензия с ограничением на 100M MAU и на использование…
Tencent HY3
Вышла релизная версия открытой модели от Tencent. По бенчмаркам модель вполне неплоха для своего размера, хотя в целом конечно звезд с неба не хватает. Из хорошего - сменили ограничительную лицензию на apache 2.0
Веса
Вышла релизная версия открытой модели от Tencent. По бенчмаркам модель вполне неплоха для своего размера, хотя в целом конечно звезд с неба не хватает. Из хорошего - сменили ограничительную лицензию на apache 2.0
Веса
1🔥4👍2
Forwarded from Гречневые мысли
GigaChat 3.5 Ultra 432B
Выпустили в опенсорс новое поколение нашей модели. Уникального в этом релизе — своя собственная архитектура (MLA + GatedDeltaNet + Gated Normalization — GN это наша придумка), новый претрейн на другом миксе данных, фулл fp8 обучение, не только дпо степ, наконец-то завезли онлайн рл и сильно улучшили арены. Модель похудела на 40% (теперь влезает в одну ноду без tp16) и сильно ускорилась из-за MTP2 и гибридной архитектуры — мы смогли выбить 260 тпс на 8xH100.
В этот раз мы решили не ограничиваться только финальным чекпом, выложив еще и кучу служебных — четыре чекпа с разных степов претрейна, два с мидтрейна, один с расширения контекста, один после дпо и два финальных, после онлайн рл — в fp8 и bf16. Теперь вы можете взять нашу модель и доучить её самостоятельно — передаём эстафету коллегам из Яндекса, ждём новую Алису на зелёной базе :)
По метрикам — претрейн идёт ноздря в ноздрю с DeepSeek V4 Flash Base, а финальный наш чекп сравним с DeepSeek V3.2. По сравнению с гигой 3.1 у нас сильно улучшились арены, код, агентность, тулколлинг и математика — в общем, меньше, быстрее, сильнее.
Из смешных историй, связанных с разработкой, не вошедших в хабр — в какой-то момент на онлайн рл этапе модель смекнула, что можно хакнуть судью, если писать более эротичные ответы. Слава богу отучили, а то получилось бы неловко.
В этом релизе я ушёл из SFT команды гигачата, став главой команды метрик. На мне были задачи по выстраиванию нашей инфраструктуры замеров и придумыванию новых бенчмарков — так что если вам не нравится выбор бенчей, который мы замерили, как обычно, приходите к нам его чинить :)
HF: https://huggingface.co/collections/ai-sage/gigachat-35
Habr: https://habr.com/ru/companies/sberbank/articles/1055826/
Выпустили в опенсорс новое поколение нашей модели. Уникального в этом релизе — своя собственная архитектура (MLA + GatedDeltaNet + Gated Normalization — GN это наша придумка), новый претрейн на другом миксе данных, фулл fp8 обучение, не только дпо степ, наконец-то завезли онлайн рл и сильно улучшили арены. Модель похудела на 40% (теперь влезает в одну ноду без tp16) и сильно ускорилась из-за MTP2 и гибридной архитектуры — мы смогли выбить 260 тпс на 8xH100.
В этот раз мы решили не ограничиваться только финальным чекпом, выложив еще и кучу служебных — четыре чекпа с разных степов претрейна, два с мидтрейна, один с расширения контекста, один после дпо и два финальных, после онлайн рл — в fp8 и bf16. Теперь вы можете взять нашу модель и доучить её самостоятельно — передаём эстафету коллегам из Яндекса, ждём новую Алису на зелёной базе :)
По метрикам — претрейн идёт ноздря в ноздрю с DeepSeek V4 Flash Base, а финальный наш чекп сравним с DeepSeek V3.2. По сравнению с гигой 3.1 у нас сильно улучшились арены, код, агентность, тулколлинг и математика — в общем, меньше, быстрее, сильнее.
Из смешных историй, связанных с разработкой, не вошедших в хабр — в какой-то момент на онлайн рл этапе модель смекнула, что можно хакнуть судью, если писать более эротичные ответы. Слава богу отучили, а то получилось бы неловко.
В этом релизе я ушёл из SFT команды гигачата, став главой команды метрик. На мне были задачи по выстраиванию нашей инфраструктуры замеров и придумыванию новых бенчмарков — так что если вам не нравится выбор бенчей, который мы замерили, как обычно, приходите к нам его чинить :)
HF: https://huggingface.co/collections/ai-sage/gigachat-35
Habr: https://habr.com/ru/companies/sberbank/articles/1055826/
1🔥12👍5
Inkling - первая языковая модель от Thinking Machines Lab
Неожиданный релиз. Основные моменты:
- MoE, 1T A41B.
- Полная мультимодальность: текст, картинки, аудио и видео.
- По бенчмаркам модель не догоняет текущий SOTA open source, зато реально сильна в мультимодальности.
- Лицензия apache 2.0.
Thinking Machines известны своими подробными блогпостами, так что не буду отбирать их хлеб - очень рекомендую прочитать полностью.
Блогпост, веса
Неожиданный релиз. Основные моменты:
- MoE, 1T A41B.
- Полная мультимодальность: текст, картинки, аудио и видео.
- По бенчмаркам модель не догоняет текущий SOTA open source, зато реально сильна в мультимодальности.
- Лицензия apache 2.0.
Thinking Machines известны своими подробными блогпостами, так что не буду отбирать их хлеб - очень рекомендую прочитать полностью.
Блогпост, веса
Thinking Machines Lab
Inkling: Our Open-Weights Model
Our first open-weights model: multimodal, Mixture-of-Experts, with controllable reasoning effort. Available to fine-tune on Tinker.
🔥4
Kimi K3
Самая большая и мощная open source модель на данный момент
- 2.8T параметров MoE (~50B активных параметров), первая модель такого размера в опенсорсе.
- Заскейлить модель до такого размера им помогли Kimi Delta Attention и Attention Residuals.
- По бенчмаркам (и похоже в реальности тоже) модель превосходит Opus 4.8, всего немного не догоняя 5.6 Sol и Fable 5.
- На отдельных задачах Kimi K3 даже превосходит SOTA закрытые модели.
- Модель особенно хороша в визуальных задачах и в ML ресёрче.
- Веса выложат скоро.
Блогпост
Самая большая и мощная open source модель на данный момент
- 2.8T параметров MoE (~50B активных параметров), первая модель такого размера в опенсорсе.
- Заскейлить модель до такого размера им помогли Kimi Delta Attention и Attention Residuals.
- По бенчмаркам (и похоже в реальности тоже) модель превосходит Opus 4.8, всего немного не догоняя 5.6 Sol и Fable 5.
- На отдельных задачах Kimi K3 даже превосходит SOTA закрытые модели.
- Модель особенно хороша в визуальных задачах и в ML ресёрче.
- Веса выложат скоро.
Блогпост
1🔥8
Krist/Blog
Inkling - первая языковая модель от Thinking Machines Lab Неожиданный релиз. Основные моменты: - MoE, 1T A41B. - Полная мультимодальность: текст, картинки, аудио и видео. - По бенчмаркам модель не догоняет текущий SOTA open source, зато реально сильна…
Thinking Machines Labs выпустили младшую версию Inkling. 276B-A12B.
https://thinkingmachines.ai/news/inkling-small/
https://thinkingmachines.ai/news/inkling-small/
Thinking Machines Lab
Introducing Inkling-Small
An open-weights model that matches Inkling at a quarter of the size: multimodal, Mixture-of-Experts, with controllable reasoning effort. Fine-tune it on Tinker.
🔥3
Deepseek-V4-Flash-0731
- Старый претрен, новый посттрен.
- По бенчмаркам сильно лучше старой V4 Pro.
- Новый V4 Pro уже в августе.
- Лицензия MIT.
Веса
- Старый претрен, новый посттрен.
- По бенчмаркам сильно лучше старой V4 Pro.
- Новый V4 Pro уже в августе.
- Лицензия MIT.
Веса
🔥10
Muse Glimmer 30B
Meta возвращается в опенсорс и выпускают свою новую модель спустя почти полтора года после Llama 4. Короткий обзор:
- 30B dense.
- 130 тысяч базового контекста.
- Многоязычная, 100 языков.
- Заточена под агентские сценарии, ризонинг, мультимодальность.
- Умеет в reasoning effort.
- Лицензия Apache 2.0.
- По бенчмаркам лучшая в классе (вероятно, до выхода Qwen3.8-27B).
Ещё обещают опенсорснуть Muse Spark 1.2, но сроков нет.
Веса
Meta возвращается в опенсорс и выпускают свою новую модель спустя почти полтора года после Llama 4. Короткий обзор:
- 30B dense.
- 130 тысяч базового контекста.
- Многоязычная, 100 языков.
- Заточена под агентские сценарии, ризонинг, мультимодальность.
- Умеет в reasoning effort.
- Лицензия Apache 2.0.
- По бенчмаркам лучшая в классе (вероятно, до выхода Qwen3.8-27B).
Ещё обещают опенсорснуть Muse Spark 1.2, но сроков нет.
Веса
huggingface.co
meta-models/Muse-Glimmer-30B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍7🔥4
Qwen3.8-2.4T-A95B (Qwen3.8-Max) вышел
Следующая опенсорсная модель в размере 2T+. Короткий обзор:
- Хорошее качество в агентских задачах, коде, ризонинге.
- Отличное (вероятно, лучшее среди всех моделей вообще) качество vision/agentic-vision задач.
- Умеет в reasoning effort.
- По бенчмаркам на уровне Opus/Fable.
- Собственная лицензия, которая ограничивает инференс провайдеров и продукты для кодинга и "офисной продуктивности".
Веса, блогпост
Следующая опенсорсная модель в размере 2T+. Короткий обзор:
- Хорошее качество в агентских задачах, коде, ризонинге.
- Отличное (вероятно, лучшее среди всех моделей вообще) качество vision/agentic-vision задач.
- Умеет в reasoning effort.
- По бенчмаркам на уровне Opus/Fable.
- Собственная лицензия, которая ограничивает инференс провайдеров и продукты для кодинга и "офисной продуктивности".
Веса, блогпост
huggingface.co
Qwen/Qwen3.8-2.4T-A95B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍6🔥1
Deepseek-V4-Pro-0813 вышел
Релиз так себе в целом, не смотря на более высокие скоры на бенчмарках, Pro не сильно превосходит Flash в реальных задачах, а кое где даже умудряется проигрывать. Цена на API как и обещали, подняли, реально очень сильно. В "пиковые часы" цена на V4 Pro выше, чем на gemini 3.7 flash, которая, вероятно, будет поинтереснее в плане производительности.
Веса доступны на HF под лицензией MIT.
Релиз так себе в целом, не смотря на более высокие скоры на бенчмарках, Pro не сильно превосходит Flash в реальных задачах, а кое где даже умудряется проигрывать. Цена на API как и обещали, подняли, реально очень сильно. В "пиковые часы" цена на V4 Pro выше, чем на gemini 3.7 flash, которая, вероятно, будет поинтереснее в плане производительности.
Веса доступны на HF под лицензией MIT.
huggingface.co
deepseek-ai/DeepSeek-V4-Pro-0813 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍4🔥1
Qwen-3.8-Flash-Next вышла
Экспериментальная модель для тестирования архитектуры будущей Qwen4:
- MoE с Engram: 125B параметров в целом, 6B активных, 51B Engram (можно сгружать в RAM).
- По бенчмаркам кое-где обходит Deepseek V4 Flash, кое-где позади.
- Куча оптимизации для обучения и инференса.
- Свой вариант атеншена.
Веса, блогпост, техрепорт
Экспериментальная модель для тестирования архитектуры будущей Qwen4:
- MoE с Engram: 125B параметров в целом, 6B активных, 51B Engram (можно сгружать в RAM).
- По бенчмаркам кое-где обходит Deepseek V4 Flash, кое-где позади.
- Куча оптимизации для обучения и инференса.
- Свой вариант атеншена.
Веса, блогпост, техрепорт
huggingface.co
Qwen/Qwen3.8-Flash-Next · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥7
GLM-5.3-Flash вышел
Новая модель от Z.ai, которую последнюю неделю активно тестировали под именем ox-alpha. Я успел её потестить, пока модель была "секретной" и она мне очень зашла.
- 320B-A18B MoE.
- Поддерживает картинки на вход.
- По бенчмаркам на уровне нового Deepseek V4 Vision Exp и не сказать, что уступает большой 5.3 драматически.
- Архитектура была выбрана из расчета на скорость инференса.
Веса, блогпост
Новая модель от Z.ai, которую последнюю неделю активно тестировали под именем ox-alpha. Я успел её потестить, пока модель была "секретной" и она мне очень зашла.
- 320B-A18B MoE.
- Поддерживает картинки на вход.
- По бенчмаркам на уровне нового Deepseek V4 Vision Exp и не сказать, что уступает большой 5.3 драматически.
- Архитектура была выбрана из расчета на скорость инференса.
Веса, блогпост
huggingface.co
zai-org/GLM-5.3-Flash · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥9
Действительно хорошая неделя для open source AI! Вышел Hy4-Preview, предварительная версия новой модели от Tencent. Короткий обзор:
- MoE, 770B-A49B.
- Свой вариант DSA и mHC (iHC)
- По бенчмарках звезд с неба не хватает, практически везде проигрывая GLM 5.3.
- Модель принимает на вход только текст.
- Лицензия Apache 2.0
Веса
- MoE, 770B-A49B.
- Свой вариант DSA и mHC (iHC)
- По бенчмарках звезд с неба не хватает, практически везде проигрывая GLM 5.3.
- Модель принимает на вход только текст.
- Лицензия Apache 2.0
Веса
🔥3🤔2👍1
Deepseek-V4-Flash-Vision-Exp вышел в опенсорс.
Короткий обзор:
- Deepseek V4 Flash со зрением.
- Модели не просто прикрутили зрение, но и дотюнили в целом.
- Результаты на бенчмарках лучше, чем у V4-Flash-0731 (но хуже, чем у GLM 5.3 Flash).
Веса
Короткий обзор:
- Deepseek V4 Flash со зрением.
- Модели не просто прикрутили зрение, но и дотюнили в целом.
- Результаты на бенчмарках лучше, чем у V4-Flash-0731 (но хуже, чем у GLM 5.3 Flash).
Веса
huggingface.co
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
👍5
Deepseek-V4.1 Flash
Новая модель от Deepseek, с обновленной архитектурой, заточенной под скорость и дешевизну инференса.
- 552B + 197B Engram, CED (Causal Encoder Decoder) - на вход активируется 8B параметров, на вывод - 16B.
- Compressed Sparse Attention 2 (CSA2), кеш стал в 4 раза меньше, чем у deepseek-v4.
- Модель поддерживает зрение.
- Претрен на 45Т токенов.
- Поддерживается reasoning_effort, от 1 до 100 (в стиле моделей OpenAI).
- По бенчмаркам обгоняет V4 Pro, GLM 5.3 и Kimi K3.
- Лицензия MIT.
Веса
Новая модель от Deepseek, с обновленной архитектурой, заточенной под скорость и дешевизну инференса.
- 552B + 197B Engram, CED (Causal Encoder Decoder) - на вход активируется 8B параметров, на вывод - 16B.
- Compressed Sparse Attention 2 (CSA2), кеш стал в 4 раза меньше, чем у deepseek-v4.
- Модель поддерживает зрение.
- Претрен на 45Т токенов.
- Поддерживается reasoning_effort, от 1 до 100 (в стиле моделей OpenAI).
- По бенчмаркам обгоняет V4 Pro, GLM 5.3 и Kimi K3.
- Лицензия MIT.
Веса
huggingface.co
deepseek-ai/DeepSeek-V4.1-Flash · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥9
Xiaomi MiMo V2.6
Новая открытая модель от Xiaomi:
- Большой шаг вперёд относительно V2.5.
- Сильно прокачена в создании мультимедиа, кое-где выглядит не хуже Astra.
- По бенчмаркам Pro на уровне gpt-5.6-sol, Flash чуть хуже.
- Два размера: Pro (1T) и Flash (300B).
- Понимает текст, картинки и аудио.
- Лицензия MIT.
Веса, блогпост, rl-метрики
Новая открытая модель от Xiaomi:
- Большой шаг вперёд относительно V2.5.
- Сильно прокачена в создании мультимедиа, кое-где выглядит не хуже Astra.
- По бенчмаркам Pro на уровне gpt-5.6-sol, Flash чуть хуже.
- Два размера: Pro (1T) и Flash (300B).
- Понимает текст, картинки и аудио.
- Лицензия MIT.
Веса, блогпост, rl-метрики
Xiaomi
MiMo-V2.6 | Xiaomi
Introducing the MiMo-V2.6 series: frontier intelligence, all the modalities, built in public.
🔥4🤯3
Reflection Beam
Модель от американского стартапа Reflection AI, основанного выходцами из Google
- MoE, 501B-A23B.
- 23T токенов претрен.
- По бенчмаркам на уровне старой GLM-5.2.
- Веса скоро в этом месяце
Блогпост
Модель от американского стартапа Reflection AI, основанного выходцами из Google
- MoE, 501B-A23B.
- 23T токенов претрен.
- По бенчмаркам на уровне старой GLM-5.2.
- Веса скоро в этом месяце
Блогпост
🤔3