🚀 mmBERT: первый достойный преемник XLM-R за 6 лет
Johns Hopkins University представил mmBERT — первую многоязычную encoder-only модель, которая значительно превосходит XLM-R. За 6 лет это первый real upgrade для multilingual encoders, что действительно вечность в AI-времени. Обучена на 3T+ токенах в более чем 1800 языках с революционным подходом progressive language addition.
Ключевые результаты: В 2-4 раза быстрее предыдущих моделей при лучшем качестве. На низкоресурсных языках превосходит даже o3 и Gemini 2.5 Pro. Значительно опережает XLM-R на XTREME benchmark и показывает strong gains на MTEB v2 для multilingual retrieval. Поддерживает 8192 токена против 512 у XLM-R.
🎯 Назначение модели: Классификация текстов (тональность, категории), семантический поиск в RAG системах, извлечение эмбеддингов для similarity search, NER (извлечение сущностей). НЕ генерирует текст — только анализирует и понимает. Аналог BERT/XLM-R, но в разы лучше.
🖥️ Системные требования: mmBERT-small (140M) — ~1GB VRAM, работает на RTX 3060. mmBERT-base (307M) — ~2GB VRAM, RTX 4060/MacBook M2 16GB. В отличие от больших LLM, запускается на обычных GPU и даже CPU. Inference намного быстрее генеративных моделей.
⚡ Технические преимущества: До 8x более эффективная обработка длинных последовательностей. Energy efficient благодаря современной архитектуре. Лучший throughput на всех длинах последовательностей. Работает с любыми текстовыми данными — от классификации до code retrieval.
✅ Открытость: Полностью опенсорс под Apache 2.0. Доступны модели jhu-clsp/mmBERT-base (307M) и jhu-clsp/mmBERT-small (140M), training data, intermediate checkpoints и код обучения. Можно легко fine-tune под свои задачи.
🔗 Основные ссылки:
📄 [Научная статья](https://arxiv.org/abs/2509.06888)
🤗 [Модели HuggingFace](https://huggingface.co/collections/jhu-clsp/mmbert-a-modern-multilingual-encoder-68b725831d7c6e3acc435ed4)
📝 [Блог пост](https://huggingface.co/blog/mmbert)
#multilingual #encoder #opensource #написаноклодом
Johns Hopkins University представил mmBERT — первую многоязычную encoder-only модель, которая значительно превосходит XLM-R. За 6 лет это первый real upgrade для multilingual encoders, что действительно вечность в AI-времени. Обучена на 3T+ токенах в более чем 1800 языках с революционным подходом progressive language addition.
Ключевые результаты: В 2-4 раза быстрее предыдущих моделей при лучшем качестве. На низкоресурсных языках превосходит даже o3 и Gemini 2.5 Pro. Значительно опережает XLM-R на XTREME benchmark и показывает strong gains на MTEB v2 для multilingual retrieval. Поддерживает 8192 токена против 512 у XLM-R.
🎯 Назначение модели: Классификация текстов (тональность, категории), семантический поиск в RAG системах, извлечение эмбеддингов для similarity search, NER (извлечение сущностей). НЕ генерирует текст — только анализирует и понимает. Аналог BERT/XLM-R, но в разы лучше.
🖥️ Системные требования: mmBERT-small (140M) — ~1GB VRAM, работает на RTX 3060. mmBERT-base (307M) — ~2GB VRAM, RTX 4060/MacBook M2 16GB. В отличие от больших LLM, запускается на обычных GPU и даже CPU. Inference намного быстрее генеративных моделей.
⚡ Технические преимущества: До 8x более эффективная обработка длинных последовательностей. Energy efficient благодаря современной архитектуре. Лучший throughput на всех длинах последовательностей. Работает с любыми текстовыми данными — от классификации до code retrieval.
✅ Открытость: Полностью опенсорс под Apache 2.0. Доступны модели jhu-clsp/mmBERT-base (307M) и jhu-clsp/mmBERT-small (140M), training data, intermediate checkpoints и код обучения. Можно легко fine-tune под свои задачи.
🔗 Основные ссылки:
📄 [Научная статья](https://arxiv.org/abs/2509.06888)
🤗 [Модели HuggingFace](https://huggingface.co/collections/jhu-clsp/mmbert-a-modern-multilingual-encoder-68b725831d7c6e3acc435ed4)
📝 [Блог пост](https://huggingface.co/blog/mmbert)
#multilingual #encoder #opensource #написаноклодом
arXiv.org
mmBERT: A Modern Multilingual Encoder with Annealed Language Learning
Encoder-only languages models are frequently used for a variety of standard machine learning tasks, including classification and retrieval. However, there has been a lack of recent research for...
❤1👍1
Сегодня прямо море новостей про новые модели, мне нравится. А еще
- Microsoft развивает свой IDE (редактор, в котором программируют);
- команда Qwen готовит анонс новой модели Qwen-3-Next-80B-A3B с радикальной MoE архитектурой: 80B общих параметров при всего 3B активных. Это самая разреженная архитектура в истории — активируется лишь 3.75% от общего числа параметров против обычных 10-15% в MoE;
- новая открытая модель FLUX.1 от Krea для работы с фотореалистичными изображениями;
- еще одна топовая моделька по генерации картинок (по 3 руб. за штуку) - Seedream 4.0;
- большое обновление Google Notebook LM (это интересно - аналогов для перевода информации в вид подкаста у других производителей нет, попробуйте - прикольная штука, и совершенно бесплатно);
- Lipsync-2-pro еще лучше подстраивает движения губ под речь.
Как вы понимаете - это еще далеко не все. Но, пожалуй, самая забористая новость сегодняшнего дня - наушики, которые позволяют чатиться силой мысли. Дожили
- Microsoft развивает свой IDE (редактор, в котором программируют);
- команда Qwen готовит анонс новой модели Qwen-3-Next-80B-A3B с радикальной MoE архитектурой: 80B общих параметров при всего 3B активных. Это самая разреженная архитектура в истории — активируется лишь 3.75% от общего числа параметров против обычных 10-15% в MoE;
- новая открытая модель FLUX.1 от Krea для работы с фотореалистичными изображениями;
- еще одна топовая моделька по генерации картинок (по 3 руб. за штуку) - Seedream 4.0;
- большое обновление Google Notebook LM (это интересно - аналогов для перевода информации в вид подкаста у других производителей нет, попробуйте - прикольная штука, и совершенно бесплатно);
- Lipsync-2-pro еще лучше подстраивает движения губ под речь.
Как вы понимаете - это еще далеко не все. Но, пожалуй, самая забористая новость сегодняшнего дня - наушики, которые позволяют чатиться силой мысли. Дожили
X (formerly Twitter)
alterego (@alterego_io) on X
Introducing Alterego: the world’s first near-telepathic wearable that enables silent communication at the speed of thought.
Alterego makes AI an extension of the human mind.
We’ve made several …
Alterego makes AI an extension of the human mind.
We’ve made several …
У ChatGpt теперь тоже есть полноценный доступ к МСР. Это прекрасно, ждем когда и Gemini перестанет рассказывать, что это сырая технология ))
Forwarded from БлоGнот
OpenAI добавила полную поддержку MCP в ChatGPT. Правда, в десктопном приложении вы этого, разумеется, не найдете, впрочем, там много чего нет. А в настройках вебчата надо в пункте «Connectors» найти Advanced Settings, включить там Developer Mode и тогда появится возможность добавить «unverified connectors that could modify or erase data permanently. Use at your own risk». И тогда появится возможность нажать «Create» в списке коннекторов и указать там все параметры обычных MCP серверов.
В общем, enjoy.
https://platform.openai.com/docs/guides/developer-mode
В общем, enjoy.
https://platform.openai.com/docs/guides/developer-mode
OpenAI Developers
ChatGPT Developer mode
Сегодня моделек и новостей не так много.
Конечно, хит недели - Qwen 3 Next 80b. О ней, кажется, написали уже все. Очень быстрая и эффективная, но живых отзывов пока мало. Для того, чтобы развернуть дома, желательно иметь Mac Studio M3 Ultra в базовой комплектации, за 400К руб. Маков с 64Гб памяти, видимо, будет маловато для этой модели.
Seedreams 4 от ByteDance (создатель ТикТока) обгоняет по популярности гугловскую nanobanana (модели рисуют картинки), и это интересно. Битва монстров.
Китайцы разместили в открытом доступе Ernie-4.5-21b, модель - лидер по скачиваниям и это уже имеет практический интерес - на 32Гб памяти можно уверенно пробовать. Вот здесь ссылка на модель, оптимизированную под маки, с 4-битной квантизаций.
У Клода появился режим инкогнито (для тех, кто разрешил записывать диалоги в память - я пока нет). И, говорят, на 3 месяца снизили стоимость подписки на Pro для новых пользователей до 9 баксов в месяц. Это стоит того
Конечно, хит недели - Qwen 3 Next 80b. О ней, кажется, написали уже все. Очень быстрая и эффективная, но живых отзывов пока мало. Для того, чтобы развернуть дома, желательно иметь Mac Studio M3 Ultra в базовой комплектации, за 400К руб. Маков с 64Гб памяти, видимо, будет маловато для этой модели.
Seedreams 4 от ByteDance (создатель ТикТока) обгоняет по популярности гугловскую nanobanana (модели рисуют картинки), и это интересно. Битва монстров.
Китайцы разместили в открытом доступе Ernie-4.5-21b, модель - лидер по скачиваниям и это уже имеет практический интерес - на 32Гб памяти можно уверенно пробовать. Вот здесь ссылка на модель, оптимизированную под маки, с 4-битной квантизаций.
У Клода появился режим инкогнито (для тех, кто разрешил записывать диалоги в память - я пока нет). И, говорят, на 3 месяца снизили стоимость подписки на Pro для новых пользователей до 9 баксов в месяц. Это стоит того
huggingface.co
baidu/ERNIE-4.5-21B-A3B-Thinking · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Для того, что бы модель с открытыми весами работала на обычных устройствах без больших плясок с бубнами, ее надо переупаковать в GGUF файл (или в другой формат - например, в MLX, оптимизированный для маков). Как правило, это делается сообществом, на одну модельку может быть много вариаций таких файлов с различными квантизациями, файн-тьюнингом и пр.
Напомню, квантизация, позволяет "огрублять" параметры модели, жертвуя точностью, но экономя память, которая является узким местом для запуска моделей. Так, стандартная модель - это параметры с 16 бит, квантизация до 8 бит уменьшает требования к памяти в 2 раза, но делает точность модели 99% от начальной. Квантизация до 4 бит снижает требования в 4 раза при точности 95-97%.
Команда Unsloth знаменита своими "упаковками" и поэтому новость от нее заслуживает внимания. Ребята научились делать динамическую квантизацию до 3 бит, и даже до 1 бита, которая вполне достойно работает. Идея в том, что важные параметры модели огрубляются мало - до 8 бит, а менее важные - сильно, в том числе, и до 1 бита. Как итог, снижение качества незначительное, а требования к памяти падают сильно.
В целом, при прочих равных, лучше большая квантованная модель будет на том же компьютере давать лучшие результаты, чем маленькая неквантованная, если квантование не слишком сильное. Поэтому такая оптимизация - штука очень интересная и перспективная. Буду следить за новыми моделями от unsloth
Напомню, квантизация, позволяет "огрублять" параметры модели, жертвуя точностью, но экономя память, которая является узким местом для запуска моделей. Так, стандартная модель - это параметры с 16 бит, квантизация до 8 бит уменьшает требования к памяти в 2 раза, но делает точность модели 99% от начальной. Квантизация до 4 бит снижает требования в 4 раза при точности 95-97%.
Команда Unsloth знаменита своими "упаковками" и поэтому новость от нее заслуживает внимания. Ребята научились делать динамическую квантизацию до 3 бит, и даже до 1 бита, которая вполне достойно работает. Идея в том, что важные параметры модели огрубляются мало - до 8 бит, а менее важные - сильно, в том числе, и до 1 бита. Как итог, снижение качества незначительное, а требования к памяти падают сильно.
В целом, при прочих равных, лучше большая квантованная модель будет на том же компьютере давать лучшие результаты, чем маленькая неквантованная, если квантование не слишком сильное. Поэтому такая оптимизация - штука очень интересная и перспективная. Буду следить за новыми моделями от unsloth
unsloth.ai
Unsloth Dynamic GGUFs on Aider Polyglot | Unsloth Documentation
Performance of Unsloth Dynamic GGUFs on Aider Polyglot Benchmarks
Forwarded from Все о блокчейн/мозге/space/WEB 3.0 в России и мире
Все-таки школа ByteDance крутая: Genspark выпустили 1-й в мире ИИ-браузер, который работает без интернета и бесплатно
Genspark AI Browser — это браузер от компании Genspark, основатели экс-ByteDance, который работает полностью локально на устройстве без необходимости подключения к интернету. Предыдущие релизы команды здесь.
Это значит, что можно скачать и запускать открытые модели ИИ, такие как GPT-OSS, Gemma3 и другие. Всё это бесплатно для всех пользователей навсегда.
Основные фичи этого релиза:
1. Локальный ИИ без интернета. Модели загружаются на твой компьютер или устройство, так что браузер работает автономно.
2. Genspark Super Agent встроен в каждую страницу, которую ты посещаешь. Например, на сайтах шопинга просто нажми "Найти лучшую сделку", и ИИ мгновенно просканирует цены по всему вебу, сравнит продукты и отзывы, чтобы помочь выбрать оптимальный вариант.
3. Режим автопилота, где ИИ самостоятельно "гуляет" по интернету, собирает информацию, выполняет задачи (например, исследует тему или автоматизирует рутину) без твоего участия.
4. Без рекламы. По умолчанию блокирует всю рекламу, попапы и баннеры, чтобы просмотр был чистым и без отвлекающих факторов.
5. Импорт всех данных: закладки, пароли, история из старого браузера одним кликом.
Genspark AI Browser — это браузер от компании Genspark, основатели экс-ByteDance, который работает полностью локально на устройстве без необходимости подключения к интернету. Предыдущие релизы команды здесь.
Это значит, что можно скачать и запускать открытые модели ИИ, такие как GPT-OSS, Gemma3 и другие. Всё это бесплатно для всех пользователей навсегда.
Основные фичи этого релиза:
1. Локальный ИИ без интернета. Модели загружаются на твой компьютер или устройство, так что браузер работает автономно.
2. Genspark Super Agent встроен в каждую страницу, которую ты посещаешь. Например, на сайтах шопинга просто нажми "Найти лучшую сделку", и ИИ мгновенно просканирует цены по всему вебу, сравнит продукты и отзывы, чтобы помочь выбрать оптимальный вариант.
3. Режим автопилота, где ИИ самостоятельно "гуляет" по интернету, собирает информацию, выполняет задачи (например, исследует тему или автоматизирует рутину) без твоего участия.
4. Без рекламы. По умолчанию блокирует всю рекламу, попапы и баннеры, чтобы просмотр был чистым и без отвлекающих факторов.
5. Импорт всех данных: закладки, пароли, история из старого браузера одним кликом.
Genspark
Genspark - Your All-in-One AI Workspace
Genspark is your all-in-one AI workspace. Slides, docs, images, video, code, and design — all in one place. Try free today.
Не перевелись умельцы и в родном отечестве - вашему вниманию представляется агент от Сбера.
По сегодняшним временам мысль использовать для агента не самый дешевый и не самый открытый Gigachat диковата, но можно подключить и другие модельки. Посмотрим, во что это разовьется, а то как-то мы на фоне китайцев совсем потерялись.
Для интереса можно посмотреть и на иностранные новинки по части агентов, например - на Agent 3 от Replit
По сегодняшним временам мысль использовать для агента не самый дешевый и не самый открытый Gigachat диковата, но можно подключить и другие модельки. Посмотрим, во что это разовьется, а то как-то мы на фоне китайцев совсем потерялись.
Для интереса можно посмотреть и на иностранные новинки по части агентов, например - на Agent 3 от Replit
GitHub
GitHub - ai-forever/giga_agent: GigaAgent — это универсальный агент-оркестратор для решения широкого круга задач (ReAct + REPL)
GigaAgent — это универсальный агент-оркестратор для решения широкого круга задач (ReAct + REPL) - ai-forever/giga_agent
Сейчас первая по популярности модель для скачивания на hugging face (не угадаете) - Ernie 4.5 21b. Но тут уже новая моделька, с которая дает тесты, не хуже, а местами и на уровне got-oss 20b.
Встречайте Ling-mini-2.0 16b- A1B-MoE. Сразу даю ссылку на оптимизированную под мак квантизацию на 4 бита - должна летать на маках с 16гб памяти
Встречайте Ling-mini-2.0 16b- A1B-MoE. Сразу даю ссылку на оптимизированную под мак квантизацию на 4 бита - должна летать на маках с 16гб памяти
huggingface.co
mlx-community/Ling-mini-2.0-4bit · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Браузер Brave выпустил SOTA поиск с использованием AI. Утверждается, что лучше, чем у Perplexity.
Я, кстати, неделю назад перешел с Google Chrome на Brave. История в том, что это браузер хоть и коммерческий, но с открытым кодом и акцентом на приватность. Его разрабатывают на деньги Питера Тиля. Основатель Брендон Айк - создатель JavaScript и бывший директор Mozilla.
Это не первая моя попытка перехода, но судя по всему, первая успешная - сейчас мне все нравится. Ну а заморочился я этим, так как решил посвятить немного сил безопасности и приватности - об этом подробнее в следующем посту
Я, кстати, неделю назад перешел с Google Chrome на Brave. История в том, что это браузер хоть и коммерческий, но с открытым кодом и акцентом на приватность. Его разрабатывают на деньги Питера Тиля. Основатель Брендон Айк - создатель JavaScript и бывший директор Mozilla.
Это не первая моя попытка перехода, но судя по всему, первая успешная - сейчас мне все нравится. Ну а заморочился я этим, так как решил посвятить немного сил безопасности и приватности - об этом подробнее в следующем посту
Brave
Introducing AI Grounding with Brave Search API, providing enhanced search performance in AI applications | Brave
With AI Grounding, responses are anchored in high-quality, factual information from verifiable Web sources, thus reducing hallucinations and responding more appropriately to nuanced inputs.
Важный пост про безопасность
Уже некоторое время назад я перестал использовать пароли, которые придумываю и запоминаю сам. Так как мысль доверять генерацию и хранение паролей Apple и Google мне претила, использую стороннее приложение - Bitwarden. Бесплатное, нравится, есть плагин для браузеров. Паради хранятся на сервере и доступны со всех устройств.
Все было бы хорошо, но работая с нейронками, особенно с моделями типа Claude Code, столкнулся с тем, что они читают .env файлы с паролями не задумываясь, как ты не ограничивай их промптами. Перебирая различные способы скрыть пароли и ключи от нейронок я пришел к следующему.
В дополнение к своему Bitwarden установил опен-сорс серверное приложение Vaultwarden - хранилище для моих паролей и ключей. Bitwarden переключил с облака на мой сервер. Сделал автоматическое формирование бэкапов и дублирующий сервер, если вдруг основной отрубится. В итоге все ключи и пароли - только на моих собственных серверах.
А в скриптах, с которыми работает ИИ, используются не ключи, а ссылки на мое хранилище, чтение которых не позволяет ничего лишнего раскрыть. Ну и браузер заодно поменял на Brave, чтобы сбор информации обо мне был на минимуме.
Все относительно несложно, но выходные на это можно и, пожалуй, стоит потратить.
Да, для двухфакторной аутентификации также попробуйте такую штуку как Google Authentificator. Удобно и надежно, проще, чем использование email и пр., возможно есть и опенсорсные аналоги, но здесь мне это показалось лишним.
Пока возился со всем этим, попутно выяснил, что мой немецкий сервер атакуется не то чтобы нон-стоп, но регулярно. Поэтому к другим серверам, которыми пользуюсь только я, отрубил доступ по паролю и оставил только ключи - то есть на сервер можно зайти только с того компьютера, у которое есть этот ключ (уже наловчился их генерить). Это еще и удобнее для работы в терминале - быстрее подключаешься. Тоже рекомендую
И в довесок - опенсорсное приложение для анализа утекших секретов. Не пробовал, но это один из топов GirHub на сегодняшний день
https://github.com/trufflesecurity/trufflehog
Уже некоторое время назад я перестал использовать пароли, которые придумываю и запоминаю сам. Так как мысль доверять генерацию и хранение паролей Apple и Google мне претила, использую стороннее приложение - Bitwarden. Бесплатное, нравится, есть плагин для браузеров. Паради хранятся на сервере и доступны со всех устройств.
Все было бы хорошо, но работая с нейронками, особенно с моделями типа Claude Code, столкнулся с тем, что они читают .env файлы с паролями не задумываясь, как ты не ограничивай их промптами. Перебирая различные способы скрыть пароли и ключи от нейронок я пришел к следующему.
В дополнение к своему Bitwarden установил опен-сорс серверное приложение Vaultwarden - хранилище для моих паролей и ключей. Bitwarden переключил с облака на мой сервер. Сделал автоматическое формирование бэкапов и дублирующий сервер, если вдруг основной отрубится. В итоге все ключи и пароли - только на моих собственных серверах.
А в скриптах, с которыми работает ИИ, используются не ключи, а ссылки на мое хранилище, чтение которых не позволяет ничего лишнего раскрыть. Ну и браузер заодно поменял на Brave, чтобы сбор информации обо мне был на минимуме.
Все относительно несложно, но выходные на это можно и, пожалуй, стоит потратить.
Да, для двухфакторной аутентификации также попробуйте такую штуку как Google Authentificator. Удобно и надежно, проще, чем использование email и пр., возможно есть и опенсорсные аналоги, но здесь мне это показалось лишним.
Пока возился со всем этим, попутно выяснил, что мой немецкий сервер атакуется не то чтобы нон-стоп, но регулярно. Поэтому к другим серверам, которыми пользуюсь только я, отрубил доступ по паролю и оставил только ключи - то есть на сервер можно зайти только с того компьютера, у которое есть этот ключ (уже наловчился их генерить). Это еще и удобнее для работы в терминале - быстрее подключаешься. Тоже рекомендую
И в довесок - опенсорсное приложение для анализа утекших секретов. Не пробовал, но это один из топов GirHub на сегодняшний день
https://github.com/trufflesecurity/trufflehog
GitHub
GitHub - trufflesecurity/trufflehog: Find, verify, and analyze leaked credentials
Find, verify, and analyze leaked credentials. Contribute to trufflesecurity/trufflehog development by creating an account on GitHub.
Forwarded from Machinelearning
Лёгкая LLM-модель, которая умеет хранить знания в человеко-читаемой памяти (Markdown-файлы) и использовать их для ответов. Агент не просто отвечает на запросы, а действительно «помнит» факты и обновляет их по ходу работы.
Это агент на 4B с локальной, совместимой памятью для Claude, ChatGPT и LM Studio.
Как работает память:
- Вся информация лежит в Markdown:
memory/user.md и отдельные файлы для сущностей. - Связи между файлами сделаны как в Obsidian:
[[entity]]. - Агент может извлекать факты, обновлять их или задавать уточняющие вопросы, если запрос неполный.
Вместо огромных контекстов и упора в лимиты, Mem-Agent извлекает нужные фрагменты из локальных документов, сжимает их и передаёт агенту.
Как обучали:
- Базовая модель: Qwen3-4B-Thinking-2507.
- Использовали метод онлайн-RL (GSPO).
- Тестировали на md-memory-bench.
Результаты:
- mem-agent уверенно решает задачи памяти, близко к уровню больших моделей.
- Даже в сжатых версиях (4-bit и 8-bit) сохраняет почти то же качество.
Чем хорош:
- Память можно читать и редактировать вручную.
- Агент работает быстро и эффективно, даже в маленьком размере.
- Удобен как компонент в более крупных системах (например, через MCP).
@ai_machinelearning_big_data
#LLM #AI #Agents #MemAgent #Dria #MCP #LocalAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Новая SOTA в размере 32b - K2-Think. Создатели утверждают, что модель превосходит не только конкурентов в своем размере, но и более крупные модели типа gpt-oss 120b и даже DeepSeek V3.1. По идее, на маке с 32гб памяти можно пробовать..
Забавно, что делали в эмиратах, но создатели - сплошные китайцы. Кстати, основой послужила Qwen 2.5
Забавно, что делали в эмиратах, но создатели - сплошные китайцы. Кстати, основой послужила Qwen 2.5
huggingface.co
LLM360/K2-Think · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Forwarded from Vikhr models
Vikhr Borealis - первая русскоязычная открытая audio llm
Мы долго и не очень успешно развивали свой tts - Salt, от него исторически осталось довольно много данных и наработок, мы решили - чо бы не сварить asr + llm как модно?
Ну и сварили. Архитектурно - whisper + qwen, учили на 7к часов аудио только адаптер+llm, сейчас работает только в ASR режиме, позже возможно довезем инструктивный режим. Так же выйдет бенчмарк для русского asr, он пока в доработке.
Блог так же выйдет, там будут небольшие аблейшены по данным
Модель в данный момент бьет whisperы на русском и на части бенчей лучше чем gigam.
Модель
Сolab поиграться
Мы долго и не очень успешно развивали свой tts - Salt, от него исторически осталось довольно много данных и наработок, мы решили - чо бы не сварить asr + llm как модно?
Ну и сварили. Архитектурно - whisper + qwen, учили на 7к часов аудио только адаптер+llm, сейчас работает только в ASR режиме, позже возможно довезем инструктивный режим. Так же выйдет бенчмарк для русского asr, он пока в доработке.
Блог так же выйдет, там будут небольшие аблейшены по данным
Модель в данный момент бьет whisperы на русском и на части бенчей лучше чем gigam.
Модель
Сolab поиграться
Forwarded from Креативный совет
This media is not supported in your browser
VIEW IN TELEGRAM
Вашему вниманию -
Просто смотрите видео как дизайнеры становятся все менее и менее нужными…
(В особенности со всеми новым функциями фотошоп который будто бы специально для MCP делают интерфейс максимально нативно кнопочным)
@creadvice
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI выпустили новую GPT-5 😑
...заточенную на программистов, GPT-5 Codex. Эта модель заменит o3 в Codex в веб-клиенте (наконец-то) и уже доступна в локальном Codex CLI / плагине для вашей IDE. Если вы ещё не пробовали — обязательно попробуйте! Это бесплатно, если вы подписаны на любой тир ChatGPT. В комментариях многие отмечали, что им нравится больше, чем Claude Code, и модель работает лучше.
GPT-5 Codex дотренировали на новых сложных реальных задач, создании проектов с нуля, добавлении функций и тестов, отладке, проведении масштабных рефакторингов и ревью кода.
По стандартному бенчмарку SWE-bench Verified разница не особо заметна, 74.5% против старых 72.8%. Однако на внутреннем бенчмарке OpenAI на задачах рефакторинга модель стала гораздо лучше: прыжок с 33.9% до 51.3%!
Но и это не всё: модель стала писать меньше бесполезных или ошибочных комментариев, лучше ловить баги в коде, и... думать меньше, когда это не надо. OpenAI взяли запросы от сотрудников внутри компании и сравнили количество токенов в ответах двух моделей.
Там, где ответы были короткими, они стали ещё короче, а там, где цепочки рассуждений и сгенерированный код были длиннее — стало больше. Со слов OpenAI, во время они наблюдали, как GPT‑5-Codex работал автономно более 7 часов подряд над большими и сложными задачами, выполняя итерации по внедрению, исправляя ошибки тестирования и в конечном итоге обеспечивая успешное решение задачи.
Codex CLI и Codex Web получили кучу обновлений за последний месяц, но про них писать не буду.
В API модель появится скоро, очень ждём, пока замеряют качество и на других бенчмарках. В системной карточке модели указали лишь один — по решению многоступенчатых задачек по кибер-взлому (с соревнований CTF). Модель наконец-то статистически значимо обгоняет o3! Жаль, не замерили другие бенчмарки (вроде PaperBench).
...заточенную на программистов, GPT-5 Codex. Эта модель заменит o3 в Codex в веб-клиенте (наконец-то) и уже доступна в локальном Codex CLI / плагине для вашей IDE. Если вы ещё не пробовали — обязательно попробуйте! Это бесплатно, если вы подписаны на любой тир ChatGPT. В комментариях многие отмечали, что им нравится больше, чем Claude Code, и модель работает лучше.
GPT-5 Codex дотренировали на новых сложных реальных задач, создании проектов с нуля, добавлении функций и тестов, отладке, проведении масштабных рефакторингов и ревью кода.
По стандартному бенчмарку SWE-bench Verified разница не особо заметна, 74.5% против старых 72.8%. Однако на внутреннем бенчмарке OpenAI на задачах рефакторинга модель стала гораздо лучше: прыжок с 33.9% до 51.3%!
Но и это не всё: модель стала писать меньше бесполезных или ошибочных комментариев, лучше ловить баги в коде, и... думать меньше, когда это не надо. OpenAI взяли запросы от сотрудников внутри компании и сравнили количество токенов в ответах двух моделей.
Там, где ответы были короткими, они стали ещё короче, а там, где цепочки рассуждений и сгенерированный код были длиннее — стало больше. Со слов OpenAI, во время они наблюдали, как GPT‑5-Codex работал автономно более 7 часов подряд над большими и сложными задачами, выполняя итерации по внедрению, исправляя ошибки тестирования и в конечном итоге обеспечивая успешное решение задачи.
Codex CLI и Codex Web получили кучу обновлений за последний месяц, но про них писать не буду.
В API модель появится скоро, очень ждём, пока замеряют качество и на других бенчмарках. В системной карточке модели указали лишь один — по решению многоступенчатых задачек по кибер-взлому (с соревнований CTF). Модель наконец-то статистически значимо обгоняет o3! Жаль, не замерили другие бенчмарки (вроде PaperBench).
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM