Krist/Blog
486 subscribers
1.02K photos
17 videos
6 files
330 links
Веду свой уютный канал про старые и новые железки и не железки, нейросети и не нейросети и вообще всё, что мне интересно.

Вступайте в чатик @kristchat

Писать сюда - @kristaller
Download Telegram
LongCat-2.0

Новая модель от Meituan. Не SOTA, но есть кое-что интересное:
- Собственный эффективный атеншен LongCat Sparse Attention (LSA), основанный на DSA.
- Обучали на китайских AI чипах.
- Динамические эксперты, как и в прошлой модели LongCat.
- 1M контекст, 1.6T параметров, 35T токенов претрен.
- Лицензия MIT, но веса еще не залили.
- По бенчмаркам +- Gemini 3.1 Pro.

Блогпост, веса (скоро)
👍5🔥3
Krist/Blog
Tencent HY3 Preview Новая открытая языковая модель от tencent. Основные моменты: - MoE 300B-A21B. - 256K контекста. - Опубликована как базовая, так и чат-модель. - По бенчмаркам звёзд с неба не хватает. - Лицензия с ограничением на 100M MAU и на использование…
Tencent HY3

Вышла релизная версия открытой модели от Tencent. По бенчмаркам модель вполне неплоха для своего размера, хотя в целом конечно звезд с неба не хватает. Из хорошего - сменили ограничительную лицензию на apache 2.0

Веса
1🔥4👍2
GigaChat 3.5 Ultra 432B

Выпустили в опенсорс новое поколение нашей модели. Уникального в этом релизе — своя собственная архитектура (MLA + GatedDeltaNet + Gated Normalization — GN это наша придумка), новый претрейн на другом миксе данных, фулл fp8 обучение, не только дпо степ, наконец-то завезли онлайн рл и сильно улучшили арены. Модель похудела на 40% (теперь влезает в одну ноду без tp16) и сильно ускорилась из-за MTP2 и гибридной архитектуры — мы смогли выбить 260 тпс на 8xH100.

В этот раз мы решили не ограничиваться только финальным чекпом, выложив еще и кучу служебных — четыре чекпа с разных степов претрейна, два с мидтрейна, один с расширения контекста, один после дпо и два финальных, после онлайн рл — в fp8 и bf16. Теперь вы можете взять нашу модель и доучить её самостоятельно — передаём эстафету коллегам из Яндекса, ждём новую Алису на зелёной базе :)

По метрикам — претрейн идёт ноздря в ноздрю с DeepSeek V4 Flash Base, а финальный наш чекп сравним с DeepSeek V3.2. По сравнению с гигой 3.1 у нас сильно улучшились арены, код, агентность, тулколлинг и математика — в общем, меньше, быстрее, сильнее.

Из смешных историй, связанных с разработкой, не вошедших в хабр — в какой-то момент на онлайн рл этапе модель смекнула, что можно хакнуть судью, если писать более эротичные ответы. Слава богу отучили, а то получилось бы неловко.

В этом релизе я ушёл из SFT команды гигачата, став главой команды метрик. На мне были задачи по выстраиванию нашей инфраструктуры замеров и придумыванию новых бенчмарков — так что если вам не нравится выбор бенчей, который мы замерили, как обычно, приходите к нам его чинить :)

HF: https://huggingface.co/collections/ai-sage/gigachat-35
Habr: https://habr.com/ru/companies/sberbank/articles/1055826/
1🔥12👍5
Inkling - первая языковая модель от Thinking Machines Lab

Неожиданный релиз. Основные моменты:
- MoE, 1T A41B.
- Полная мультимодальность: текст, картинки, аудио и видео.
- По бенчмаркам модель не догоняет текущий SOTA open source, зато реально сильна в мультимодальности.
- Лицензия apache 2.0.

Thinking Machines известны своими подробными блогпостами, так что не буду отбирать их хлеб - очень рекомендую прочитать полностью.

Блогпост, веса
🔥4
Kimi K3

Самая большая и мощная open source модель на данный момент

- 2.8T параметров MoE (~50B активных параметров), первая модель такого размера в опенсорсе.
- Заскейлить модель до такого размера им помогли Kimi Delta Attention и Attention Residuals.
- По бенчмаркам (и похоже в реальности тоже) модель превосходит Opus 4.8, всего немного не догоняя 5.6 Sol и Fable 5.
- На отдельных задачах Kimi K3 даже превосходит SOTA закрытые модели.
- Модель особенно хороша в визуальных задачах и в ML ресёрче.
- Веса выложат скоро.

Блогпост
1🔥8
Deepseek-V4-Flash-0731

- Старый претрен, новый посттрен.
- По бенчмаркам сильно лучше старой V4 Pro.
- Новый V4 Pro уже в августе.
- Лицензия MIT.

Веса
🔥10
Muse Glimmer 30B

Meta возвращается в опенсорс и выпускают свою новую модель спустя почти полтора года после Llama 4. Короткий обзор:
- 30B dense.
- 130 тысяч базового контекста.
- Многоязычная, 100 языков.
- Заточена под агентские сценарии, ризонинг, мультимодальность.
- Умеет в reasoning effort.
- Лицензия Apache 2.0.
- По бенчмаркам лучшая в классе (вероятно, до выхода Qwen3.8-27B).

Ещё обещают опенсорснуть Muse Spark 1.2, но сроков нет.

Веса
👍7🔥4
Qwen3.8-2.4T-A95B (Qwen3.8-Max) вышел

Следующая опенсорсная модель в размере 2T+. Короткий обзор:
- Хорошее качество в агентских задачах, коде, ризонинге.
- Отличное (вероятно, лучшее среди всех моделей вообще) качество vision/agentic-vision задач.
- Умеет в reasoning effort.
- По бенчмаркам на уровне Opus/Fable.
- Собственная лицензия, которая ограничивает инференс провайдеров и продукты для кодинга и "офисной продуктивности".

Веса, блогпост
👍6🔥1
Deepseek-V4-Pro-0813 вышел

Релиз так себе в целом, не смотря на более высокие скоры на бенчмарках, Pro не сильно превосходит Flash в реальных задачах, а кое где даже умудряется проигрывать. Цена на API как и обещали, подняли, реально очень сильно. В "пиковые часы" цена на V4 Pro выше, чем на gemini 3.7 flash, которая, вероятно, будет поинтереснее в плане производительности.

Веса доступны на HF под лицензией MIT.
👍4🔥1
Qwen-3.8-Flash-Next вышла

Экспериментальная модель для тестирования архитектуры будущей Qwen4:
- MoE с Engram: 125B параметров в целом, 6B активных, 51B Engram (можно сгружать в RAM).
- По бенчмаркам кое-где обходит Deepseek V4 Flash, кое-где позади.
- Куча оптимизации для обучения и инференса.
- Свой вариант атеншена.

Веса, блогпост, техрепорт
🔥7
GLM-5.3-Flash вышел

Новая модель от Z.ai, которую последнюю неделю активно тестировали под именем ox-alpha. Я успел её потестить, пока модель была "секретной" и она мне очень зашла.
- 320B-A18B MoE.
- Поддерживает картинки на вход.
- По бенчмаркам на уровне нового Deepseek V4 Vision Exp и не сказать, что уступает большой 5.3 драматически.
- Архитектура была выбрана из расчета на скорость инференса.

Веса, блогпост
🔥9
Действительно хорошая неделя для open source AI! Вышел Hy4-Preview, предварительная версия новой модели от Tencent. Короткий обзор:

- MoE, 770B-A49B.
- Свой вариант DSA и mHC (iHC)
- По бенчмарках звезд с неба не хватает, практически везде проигрывая GLM 5.3.
- Модель принимает на вход только текст.
- Лицензия Apache 2.0

Веса
🔥3🤔2👍1
Deepseek-V4-Flash-Vision-Exp вышел в опенсорс.

Короткий обзор:
- Deepseek V4 Flash со зрением.
- Модели не просто прикрутили зрение, но и дотюнили в целом.
- Результаты на бенчмарках лучше, чем у V4-Flash-0731 (но хуже, чем у GLM 5.3 Flash).

Веса
👍5
Deepseek-V4.1 Flash

Новая модель от Deepseek, с обновленной архитектурой, заточенной под скорость и дешевизну инференса.
- 552B + 197B Engram, CED (Causal Encoder Decoder) - на вход активируется 8B параметров, на вывод - 16B.
- Compressed Sparse Attention 2 (CSA2), кеш стал в 4 раза меньше, чем у deepseek-v4.
- Модель поддерживает зрение.
- Претрен на 45Т токенов.
- Поддерживается reasoning_effort, от 1 до 100 (в стиле моделей OpenAI).
- По бенчмаркам обгоняет V4 Pro, GLM 5.3 и Kimi K3.
- Лицензия MIT.

Веса
🔥9
Xiaomi MiMo V2.6

Новая открытая модель от Xiaomi:
- Большой шаг вперёд относительно V2.5.
- Сильно прокачена в создании мультимедиа, кое-где выглядит не хуже Astra.
- По бенчмаркам Pro на уровне gpt-5.6-sol, Flash чуть хуже.
- Два размера: Pro (1T) и Flash (300B).
- Понимает текст, картинки и аудио.
- Лицензия MIT.

Веса, блогпост, rl-метрики
🔥4🤯3
Reflection Beam

Модель от американского стартапа Reflection AI, основанного выходцами из Google
- MoE, 501B-A23B.
- 23T токенов претрен.
- По бенчмаркам на уровне старой GLM-5.2.
- Веса скоро в этом месяце

Блогпост
🤔3