AutoMem ускоряет long-horizon агентов в 2–4 раза
Новая работа предлагает обучать память агента как отдельный cognitive skill.
Идея в том, что агент должен не просто складывать всё в контекст, а учиться:
• что сохранять
• как кодировать информацию
• когда доставать нужные данные
• как менять структуру памяти после опыта
AutoMem использует два цикла: LLM пересобирает memory structure по прошлым траекториям, а затем улучшает её через удачные решения.
На Crafter, MiniHack и NetHack авторы показывают, что одна только оптимизация памяти уже даёт сильный прирост и местами приближает агентов к frontier-моделям.
Почему это важно: long-horizon задачи часто ломаются не из-за слабого reasoning, а из-за плохой памяти. Агент забывает контекст, хранит мусор или не может достать нужный факт вовремя.
AutoMem пытается решить именно этот bottleneck без полного переобучения под каждую задачу.
Потенциально полезно для игровых агентов, робототехники и автономных workflow.
arxiv.org/abs/2607.01224
Новая работа предлагает обучать память агента как отдельный cognitive skill.
Идея в том, что агент должен не просто складывать всё в контекст, а учиться:
• что сохранять
• как кодировать информацию
• когда доставать нужные данные
• как менять структуру памяти после опыта
AutoMem использует два цикла: LLM пересобирает memory structure по прошлым траекториям, а затем улучшает её через удачные решения.
На Crafter, MiniHack и NetHack авторы показывают, что одна только оптимизация памяти уже даёт сильный прирост и местами приближает агентов к frontier-моделям.
Почему это важно: long-horizon задачи часто ломаются не из-за слабого reasoning, а из-за плохой памяти. Агент забывает контекст, хранит мусор или не может достать нужный факт вовремя.
AutoMem пытается решить именно этот bottleneck без полного переобучения под каждую задачу.
Потенциально полезно для игровых агентов, робототехники и автономных workflow.
arxiv.org/abs/2607.01224
🔥7👍4❤1
Ещё одна работа под руководством Яна Лекуна: адаптация во время тестирования вместо замороженных world models!?
В этой статье AdaJEPA берёт предобученную JEPA-модель мира, планирует действия через MPC, выполняет действие, а затем использует наблюдаемый переход, чтобы обновить latent predictor перед новым планированием.
Базовый цикл выглядит так:
планирование → действие → адаптация → новое планирование.
Каждое действие создаёт собственный self-supervised обучающий сигнал через ошибку предсказания следующего latent-состояния.
Всего один gradient step на каждый MPC step помогает AdaJEPA лучше достигать целей при новых формах объектов, визуальных искажениях, сдвигах динамики и незнакомых лабиринтах.
World models не должны прекращать обучение после pretraining.
Они должны постоянно перекалибровываться во время deployment, превращая реальное взаимодействие в непрерывную коррекцию модели.
https://www.alphaxiv.org/abs/2606.32026
В этой статье AdaJEPA берёт предобученную JEPA-модель мира, планирует действия через MPC, выполняет действие, а затем использует наблюдаемый переход, чтобы обновить latent predictor перед новым планированием.
Базовый цикл выглядит так:
планирование → действие → адаптация → новое планирование.
Каждое действие создаёт собственный self-supervised обучающий сигнал через ошибку предсказания следующего latent-состояния.
Всего один gradient step на каждый MPC step помогает AdaJEPA лучше достигать целей при новых формах объектов, визуальных искажениях, сдвигах динамики и незнакомых лабиринтах.
World models не должны прекращать обучение после pretraining.
Они должны постоянно перекалибровываться во время deployment, превращая реальное взаимодействие в непрерывную коррекцию модели.
https://www.alphaxiv.org/abs/2606.32026
👍11🔥2❤1👏1
SK Hynix планирует листинг в США на NASDAQ.
Момент выбран почти идеально.
Компания продаёт полупроводники, особенно память: HBM, DRAM и flash. На фоне AI-бума спрос на такие продукты сейчас, возможно, один из самых высоких за всю историю SK Hynix. И признаков, что он быстро закончится, пока не видно.
Если компания выходит на рынок именно сейчас, значит, она рассчитывает, что спрос и цены как минимум останутся стабильными, а скорее продолжат расти. Рынок акций оценивает будущее, и SK Hynix это прекрасно понимает.
Цены на память могут держаться высоко или расти дальше. Многие уже почувствовали это по стоимости RAM.
Получается палка о двух концах: AI-бум разгоняет рынок, но делает железо дороже.
https://fortune.com/2026/07/05/sk-hynix-us-stock-listing-nasdaq-29-billion-micron-ai-boom-chips/
Момент выбран почти идеально.
Компания продаёт полупроводники, особенно память: HBM, DRAM и flash. На фоне AI-бума спрос на такие продукты сейчас, возможно, один из самых высоких за всю историю SK Hynix. И признаков, что он быстро закончится, пока не видно.
Если компания выходит на рынок именно сейчас, значит, она рассчитывает, что спрос и цены как минимум останутся стабильными, а скорее продолжат расти. Рынок акций оценивает будущее, и SK Hynix это прекрасно понимает.
Цены на память могут держаться высоко или расти дальше. Многие уже почувствовали это по стоимости RAM.
Получается палка о двух концах: AI-бум разгоняет рынок, но делает железо дороже.
https://fortune.com/2026/07/05/sk-hynix-us-stock-listing-nasdaq-29-billion-micron-ai-boom-chips/
👍2❤1🔥1
YTsaurus превратили в рендер-ферму для 3D-аватаров. Внутри — среда для рендеринга: X11, Vulkan и устройства GPU.
Команда 3D-реконструкции в Яндексе запустила рендеринг Unity-сцен в YTsaurus. Задача: отсканировать гостей премьеры «Кибердеревни», превратить в 3DGS-аватары и отрендерить сотни роликов за два дня.
Что сделали:
- Взяли GPU-кластер A100 из YTsaurus вместо виртуалок — так дешевле и быстрее для волнообразной нагрузки
- Добавили поддержку Xorg для GPU-хостов через коллег из Yandex Infrastructure
- Пробросили в контейнер не только /dev/nvidia0, но и /dev/nvidia-modeset, /dev/dri/card0, /dev/dri/renderD128
- Подняли внутри контейнера dbus — без неё Unity не инициализируется
Прошли путь от Docker до «ванильной» операции в YTsaurus. На каждом шаге выяснялось, каких устройств не хватает. Без изменений на платформе не обошлось — коллеги за несколько часов добавили нужную поддержку. Перед запуском протестировали на Quake II RTX. Работает.
Результат: рендеринг стал обычной batch-задачей. Между 3D-реконструкцией и готовым видео больше нет ручного звена.
https://habr.com/ru/companies/yandex/articles/1049126/
Команда 3D-реконструкции в Яндексе запустила рендеринг Unity-сцен в YTsaurus. Задача: отсканировать гостей премьеры «Кибердеревни», превратить в 3DGS-аватары и отрендерить сотни роликов за два дня.
Что сделали:
- Взяли GPU-кластер A100 из YTsaurus вместо виртуалок — так дешевле и быстрее для волнообразной нагрузки
- Добавили поддержку Xorg для GPU-хостов через коллег из Yandex Infrastructure
- Пробросили в контейнер не только /dev/nvidia0, но и /dev/nvidia-modeset, /dev/dri/card0, /dev/dri/renderD128
- Подняли внутри контейнера dbus — без неё Unity не инициализируется
Прошли путь от Docker до «ванильной» операции в YTsaurus. На каждом шаге выяснялось, каких устройств не хватает. Без изменений на платформе не обошлось — коллеги за несколько часов добавили нужную поддержку. Перед запуском протестировали на Quake II RTX. Работает.
Результат: рендеринг стал обычной batch-задачей. Между 3D-реконструкцией и готовым видео больше нет ручного звена.
https://habr.com/ru/companies/yandex/articles/1049126/
🔥4❤3👍2
Хедж-фонд Bridgewater и Thinking Machines Lab дообучили open-weight модель для анализа финансовых документов.
На внутренних тестах она показала 84,7% точности и обошла лучшую frontier-модель на 6,5%.
При этом запуск обходится в 14 раз дешевле.
У компаний уже есть огромный скрытый рычаг - собственные данные и экспертиза сотрудников.
Если правильно дообучать модели на этой базе, можно получать результаты лучше и дешевле, чем у закрытых топ-моделей.
https://hedgefundalpha.com/news/bridgewater-thinking-machines-ai
На внутренних тестах она показала 84,7% точности и обошла лучшую frontier-модель на 6,5%.
При этом запуск обходится в 14 раз дешевле.
У компаний уже есть огромный скрытый рычаг - собственные данные и экспертиза сотрудников.
Если правильно дообучать модели на этой базе, можно получать результаты лучше и дешевле, чем у закрытых топ-моделей.
https://hedgefundalpha.com/news/bridgewater-thinking-machines-ai
👎7👍4❤1
This media is not supported in your browser
VIEW IN TELEGRAM
GigaChat 3.5 Ultra: меньше, быстрее, сильнее
Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
👍7🔥4👎2🤬1
Cloudflare анонсировала слой монетизации для agentic web: AI-агенты смогут платить сайтам прямо на уровне HTTP-запроса через x402 на edge.
Идея в том, что агенты будут не только читать бесплатные страницы или ходить в заранее подключённые API, а смогут оплачивать доступ к данным напрямую.
Сегодня AI-продукты получают внешнюю информацию через контракты, scraping, поисковые партнёрства, платные API или открытые страницы.
Cloudflare хочет превратить такой доступ в обычный платный web request.
Владелец сайта может сказать: «этот датасет стоит $0.01 за запрос», а Cloudflare проверит оплату ещё до того, как запрос дойдёт до сервера.
Сценарий такой:
агент запрашивает ресурс → получает 402 Payment Required → платит → повторяет запрос с подтверждением оплаты → получает ответ.
Главное изменение в том, что платёж становится частью самого web-запроса.
Для обычного пользователя это может означать, что ассистент иногда будет спрашивать разрешение потратить деньги перед выполнением задачи.
Например:
«Этот источник стоит $0.03. Использовать?»
Research-агент может платить за закрытые источники, shopping-агент — за данные о товарах, сравнения, бронирования или private market data.
Но есть условие: всё это заработает только тогда, когда агенты будут иметь кошельки, понимать x402 и соблюдать spending rules.
Идея в том, что агенты будут не только читать бесплатные страницы или ходить в заранее подключённые API, а смогут оплачивать доступ к данным напрямую.
Сегодня AI-продукты получают внешнюю информацию через контракты, scraping, поисковые партнёрства, платные API или открытые страницы.
Cloudflare хочет превратить такой доступ в обычный платный web request.
Владелец сайта может сказать: «этот датасет стоит $0.01 за запрос», а Cloudflare проверит оплату ещё до того, как запрос дойдёт до сервера.
Сценарий такой:
агент запрашивает ресурс → получает 402 Payment Required → платит → повторяет запрос с подтверждением оплаты → получает ответ.
Главное изменение в том, что платёж становится частью самого web-запроса.
Для обычного пользователя это может означать, что ассистент иногда будет спрашивать разрешение потратить деньги перед выполнением задачи.
Например:
«Этот источник стоит $0.03. Использовать?»
Research-агент может платить за закрытые источники, shopping-агент — за данные о товарах, сравнения, бронирования или private market data.
Но есть условие: всё это заработает только тогда, когда агенты будут иметь кошельки, понимать x402 и соблюдать spending rules.
❤7🔥4🥰3🤬1
⚡️ Robbyant выложили LingBot-Vision - self-supervised ViT-бэкбоны для плотного пространственного восприятия.
Идея не в обычном “понимании картинки”, а в том, чтобы модель лучше видела:
* границы объектов
* формы
* геометрию сцены
* переходы между регионами
* структуру пространства
Флагманская версия - ViT-g/16 на 1.1B параметров. Также есть distilled-варианты: Large, Base и Small.
https://github.com/robbyant/lingbot-vision
Идея не в обычном “понимании картинки”, а в том, чтобы модель лучше видела:
* границы объектов
* формы
* геометрию сцены
* переходы между регионами
* структуру пространства
Флагманская версия - ViT-g/16 на 1.1B параметров. Также есть distilled-варианты: Large, Base и Small.
https://github.com/robbyant/lingbot-vision
❤3👍1🔥1
📊Новый единый подход к сравнению методов дообучения LLM
На ICML 2026 исследователи лаборатории научных исследований Т-Технологий предложили единый протокол для сравнения методов дообучения больших языковых моделей, обучающихся на парах ответов. Работа показала, что различия между подходами объясняются тем, как устроено ранжирование ответов.
🧠 Что сделали исследователи:
- Разные методы привели к единому протоколу оценки: одноэтапные подходы (ORPO, ASFT) перевели в двухэтапные и провели выравнивание на парах ответов.
- Ввели параметр β, который регулирует силу дообучения на человеческих предпочтениях и помогает более объективно сравнивать методы между собой.
- Выяснили, что ключевой фактор качества — тип сравнения ответов.
📈 Результаты:
- Попарное сравнение ответов (pairwise) дает более высокое качество на задачах средней сложности, чем поточечные (pointwise).
🛠️ В работе использовались Llama 3.x, Mistral 7B и Qwen 2.5. Модели обучали на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках.
На ICML 2026 исследователи лаборатории научных исследований Т-Технологий предложили единый протокол для сравнения методов дообучения больших языковых моделей, обучающихся на парах ответов. Работа показала, что различия между подходами объясняются тем, как устроено ранжирование ответов.
🧠 Что сделали исследователи:
- Разные методы привели к единому протоколу оценки: одноэтапные подходы (ORPO, ASFT) перевели в двухэтапные и провели выравнивание на парах ответов.
- Ввели параметр β, который регулирует силу дообучения на человеческих предпочтениях и помогает более объективно сравнивать методы между собой.
- Выяснили, что ключевой фактор качества — тип сравнения ответов.
📈 Результаты:
- Попарное сравнение ответов (pairwise) дает более высокое качество на задачах средней сложности, чем поточечные (pointwise).
🛠️ В работе использовались Llama 3.x, Mistral 7B и Qwen 2.5. Модели обучали на данных Reddit TL;DR, UltraChat и UltraFeedback, а качество оценивали на AlpacaEval 2, ArenaHard, попарных сравнениях ответов с помощью более сильной модели и математических бенчмарках.
👍6❤4🥰4🎉4🔥2🤩2
KnowNote — это альтернатива Google NotebookLM, которая преобразует ваши документы в локальную базу знаний без необходимости использования Docker.
github.com/MrSibe/KnowNote
github.com/MrSibe/KnowNote
👍8❤6
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбхав Шривастав, руководитель направления развития экосистемы и инфраструктуры OpenAI в Европе, на Ближнем Востоке и в Африке пояснил про градацию ризонинга в GPT-5.6 Sol.
Новая система не соответствует тому, что было в GPT-5.5 и тем, кто переходит на более высокий уровень, следует начинать на один уровень ниже, чем они привыкли.
Max и Ultra работают по-разному:
Вайбхав рекомендует начинать с низкого уровня и повышать его только при необходимости, так как более высокие уровни требуют больше времени и расходуют больше токенов.
Всё это ни разу не приближает OpenAI к цели, озвученной Грегом Брокманом на Big Technology AI Summit буквально месяц назад. Он хочет сделать ChatGPT простым настолько, насколько это возможно.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🔥1
9.5K stars у репозитория с Claude Code skills по одной книге
Sahil Lavingia упаковал идеи из The Minimalist Entrepreneur в набор команд для Claude Code.
По сути, это стартап-плейбук, который можно запускать прямо из рабочего окружения.
Внутри навыки для:
* поиска сообщества
* проверки идеи
* формулировки проблемы
* скоупа MVP
* ценообразования
* поиска первых клиентов
* маркетинга без лишнего шума
* разбора продукта через minimalist-подход
Каждый skill работает как отдельная slash-команда.
Идея сильная: не просто читать бизнес-книгу, а превращать её в исполняемые рабочие процессы для агента.
Полезно тем, кто хочет быстро проверить идею, собрать MVP и не утонуть в стартап-теории.
github.com/slavingia/skills
Sahil Lavingia упаковал идеи из The Minimalist Entrepreneur в набор команд для Claude Code.
По сути, это стартап-плейбук, который можно запускать прямо из рабочего окружения.
Внутри навыки для:
* поиска сообщества
* проверки идеи
* формулировки проблемы
* скоупа MVP
* ценообразования
* поиска первых клиентов
* маркетинга без лишнего шума
* разбора продукта через minimalist-подход
Каждый skill работает как отдельная slash-команда.
Идея сильная: не просто читать бизнес-книгу, а превращать её в исполняемые рабочие процессы для агента.
Полезно тем, кто хочет быстро проверить идею, собрать MVP и не утонуть в стартап-теории.
github.com/slavingia/skills
👍8🔥1🤔1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Компания вновь сдвинула сроки окончания промо-периода - теперь использовать Fable 5 без дополнительных списаний можно до 19 июля. До этой же даты будет действовать бонус, который на 50% увеличивает еженедельный лимит запросов в Claude Code.
Изначально акцию планировали завершить еще 7 июля, после чего дедлайн перенесли на 12-е число, а теперь добавили еще одну неделю.
Пользователи могут тратить на генерации в Fable 5 до половины еженедельной квоты. При исчерпании лимита потребуется переключиться на другие модели или включить оплату по факту потребления. Промо-условия не распространяются на API.
claude.com
Глава OpenAI теперь уверен, что актуальное поколение моделей создает больше рабочих мест, чем сокращает, а экономические последствия от внедрения ИИ оказались менее масштабными, чем он ожидал ранее.
Параллельно компания продолжает обсуждать долгосрочные меры борьбы с возможной технологической безработицей. Среди рабочих концепций - налог на автоматизацию, создание целевых госфондов и переход на четырехдневную рабочую неделю.
Sam Altman в сети Х
Пионер RL и лауреат премии Тьюринга открыл стартап Oak Lab для разработки автономных агентов. Цель проекта - создать непрерывно обучающуюся модель на 1 трлн параметров с планированием в реальном времени и энергопотреблением 20 Вт.
Oak Lab строится на базе концепции непрерывного RL. Вместо разового трейна на статических датасетах агенты будут познавать среду в процессе работы. Система должна самостоятельно формировать внутреннюю модель мира, генерировать варианты действий и оценивать их успешность.
Саттон называет современные методы глубокого обучения неэффективными. По его оценке, генеративный ИИ справляется с имитацией, но не умеет критически оценивать свои результаты, поэтому не годится для реальных открытий.
Richard Sutton в сети X
Южная Корея запустит бесплатный национальный ИИ до конца года. Власти выделят разработчикам кластер из 512 ускорителей NVIDIA B200, а со следующего года полностью возьмет на себя расходы на инференс для граждан.
В рамках проекта AI for All государство отберет двух-трех частных провайдеров, которые должны минимум на 50% работать на базе независимых корейских моделей. Локальные разработчики пока оценивают условия проекта, участие подтвердила только Kakao, местный ИТ-лидер.
Отбор компаний завершится к середине августа. Бета-тест системы запланирован на сентябрь, релиз - до конца года.
yna.co.kr
Smart Cellular Bricks - децентрализованные физические модули для сборки самовосстанавливающихся 3D-конструкций. Каждый блок выполняет легковесную модель NCA и обменивается данными с ближайшими соседями. Массив модулей улавливает структурные паттерны без обращения к заложенным в память шаблонам.
Агрегируя локальные состояния, кластер за 3 минуты определяет свою глобальную форму (например, стола или самолета). В тестах массив из почти 200 блоков успешно классифицировал форму даже при принудительном отключении части элементов.
Если дополнительно обучить систему поиску аномалий, модули смогут вычислять недостающие сегменты и управлять регенерацией конструкции из небольшого базового кластера. Метод ляжет в основу разработки смарт-материалов и реконфигурируемой робототехники. Статья опубликована в Nature, код - на Github.
sakana.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2👍1
Сбер открыл доступ к новым моделям распознавания речи — GigaAM Multilingual и GigaChat Audio
GigaAM Multilingual включает два компонента. Аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR.
Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ. Поэтому модель быстрее адаптируется к новым языкам и требует меньше данных для дообучения.
Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B.
Забирайте код и веса модели на Hugging Face и GitHub:
GigaAM Multilingual на Hugging Face
GigaAM Multilingual на GitHub
В свою очередь, GigaChat Audio — это большая языковая модель, которая объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог.
Её сильная сторона — работа с длинными записями. На аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3. При этом объём контекста составляет до двух часов.
Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni. А ещё распознаёт эмоции с точностью 90%+ по датасету Dusha.
Забирайте код и веса модели на Hugging Face:
GigaChat Audio на Hugging Face
GigaAM Multilingual включает два компонента. Аудиоэнкодер с самостоятельным обучением и многоязычную модель распознавания речи CTC ASR.
Аудиоэнкодер предварительно обучили на 2 млн часов речи на 70+ языках с фокусом на страны СНГ. Поэтому модель быстрее адаптируется к новым языкам и требует меньше данных для дообучения.
Многоязычную модель дообучили на 50 тысячах часов мультидоменной речи. Даже компактная версия с 240 млн параметров обгоняет популярные решения Whisper Large v3 и Omnilingual 1B.
Забирайте код и веса модели на Hugging Face и GitHub:
GigaAM Multilingual на Hugging Face
GigaAM Multilingual на GitHub
В свою очередь, GigaChat Audio — это большая языковая модель, которая объединяет возможности GigaAM Multilingual и GigaChat 3.1. Она распознаёт и переводит речь, классифицирует аудио и поддерживает диалог.
Её сильная сторона — работа с длинными записями. На аудио продолжительностью 20-60 минут показатель Intersection-over-Union локализации событий достигает 48.3. При этом объём контекста составляет до двух часов.
Кроме того, GigaChat Audio хорошо понимает русскую речь: 60.0 балла в бенчмарке RuBQ-Audio против 43.7 у Qwen3-Omni. А ещё распознаёт эмоции с точностью 90%+ по датасету Dusha.
Забирайте код и веса модели на Hugging Face:
GigaChat Audio на Hugging Face
👍4❤2🔥2
Ideogram v4 Fast, когда генерация картинок перестаёт быть “поставил и жди”
fal выкатили
Главная идея простая: меньше лишних проходов, 20 шагов генерации и никакого runtime CFG. То есть модель не гоняет отдельную negative-ветку на каждом шаге, а сразу работает через один условный проход.
Для пользователя это звучит скучно, но для продакшена разница большая: быстрее генерация, проще масштабирование, меньше боли с latency.
Особенно интересно, что это Ideogram - модель, которую любят за нормальную работу с текстом на изображениях. Постеры, баннеры, обложки, карточки, UI-моки — там, где Stable Diffusion-подобные модели часто превращают буквы в кашу, Ideogram обычно чувствует себя увереннее.
MOSS-VL-Realtime is open for testing and research. 🤗 Huggingface: https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
💻 Github: https://github.com/OpenMOSS/MOSS-VL
📖 Technical blog: https://openmoss.github.io/MOSS-VL
fal выкатили
ideogram-v4-fast на Hugging Face - ускоренную версию Ideogram 4, заточенную под быстрый FP4/NVFP4-инференс.Главная идея простая: меньше лишних проходов, 20 шагов генерации и никакого runtime CFG. То есть модель не гоняет отдельную negative-ветку на каждом шаге, а сразу работает через один условный проход.
Для пользователя это звучит скучно, но для продакшена разница большая: быстрее генерация, проще масштабирование, меньше боли с latency.
Особенно интересно, что это Ideogram - модель, которую любят за нормальную работу с текстом на изображениях. Постеры, баннеры, обложки, карточки, UI-моки — там, где Stable Diffusion-подобные модели часто превращают буквы в кашу, Ideogram обычно чувствует себя увереннее.
MOSS-VL-Realtime is open for testing and research. 🤗 Huggingface: https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime
💻 Github: https://github.com/OpenMOSS/MOSS-VL
📖 Technical blog: https://openmoss.github.io/MOSS-VL
👍3
Yandex AI Studio Series Summer Edition — с 16 по 30 июля пройдет событие для разработчиков, ML/ИИ-инженеров, продуктовых менеджеров и всех, кто создает продукты на базе ИИ.
Эксперты Яндекса расскажут, как проектировать агентные системы, выбирать подходящие инструменты для разных сценариев и масштабировать решения от первых экспериментов до корпоративного внедрения.
В программе — серия практических вебинаров, а 30 июля участников ждут:
— обзор новых возможностей и планов развития Yandex AI Studio;
— разбор создания ИИ-продукта без команды разработки — от идеи до запуска за два месяца;
— архитектура масштабируемого контакт-центра на базе ИИ;
— реальные кейсы применения ИИ-ассистентов в ритейле и на производстве.
Самых активных участников серии пригласят на закрытый офлайн-митап в Москве, где команда Yandex AI Studio поделится планами развития продукта, ответит на вопросы и вручит подарки.
Подключайтесь, чтобы разобраться в современных подходах к разработке ИИ-продуктов и применить их в собственных проектах.
Please open Telegram to view this post
VIEW IN TELEGRAM
👎5👍1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Долгожданная функция поиска по истории чатов, проектам и загруженным документам доступна в боковой панели веб-интерфейса и в мобильных приложениях для iOS и Android.
Поиск поддерживает фильтры по типам контента, а клик по результату в выдаче перенаправляет пользователя на конкретное сообщение в диалоге.
Обновление разворачивается глобально. Новая возможность доступна всем пользователям ChatGPT, включая бесплатную версию.
openai.com
Компания анонсировала бесплатную платформу Claude for Teachers для преподавателей школ США. В неё вошли модели, среда Claude Code и Cowork, где ИИ сам выполняет цепочки задач. Например, учитель один раз настраивает агента, и тот каждое утро проверяет тесты или собирает сводку по успеваемости класса.
Платформа поддерживает интеграцию с сервисами Canva Education и MagicSchool, позволяя встраивать Claude в уже готовые рабочие процессы. Anthropic обещает, что данные учителей и учеников не пойдут на обучение будущих моделей.
Заодно на GitHub выложили набор навыков для агентов и запустили курс по ИИ, не привязанный к продуктам какой-то одной компании. Программа продолжает вузовскую Claude for Education. Регистрация открыта до июня 2027 года.
anthropic.com
К 25-летию сервиса Google Images компания добавила генерацию картинок по текстовому запросу в поисковые сводки. За функцию отвечает генератор на базе Nano Banana.
Домашняя страница поиска по картинкам получила редизайн с механикой в стиле Pinterest. Интерфейс переведен на динамическую галерею с адаптивной алгоритмической лентой и возможностью сохранять изображения в тематические коллекции.
Развертывание генеративных функций в AI Overviews займет несколько недель. На старте опция доступна только на английском языке в регионах, где уже поддерживается создание изображений.
blog.google
Чипмэйкер ужесточил процесс одобрения для азиатских контрагентов из списка авторизованных покупателей, чтобы перекрыть серый экспорт оборудования в Китай.
После аудита число одобренных компаний в Сингапуре, Малайзии и Японии уменьшилось более чем на 50%. В новый "белый список" не попали многие новые облачные провайдеры-арендодатели GPU.
Компания перешла от проверки документов к физическим инспекциям дата-центров. Теперь Nvidia анализирует контракты и запрашивает информацию напрямую у конечных пользователей ускорителей.
ft.com
Стэнфордская лаборатория цифровой экономики опубликовала открытое письмо "We Must Act Now" о макроэкономических последствиях внедрения ИИ. Документ подписали более 200 ученых, 16 нобелевских лауреатов и представители Google, Anthropic и OpenAI.
Авторы прогнозируют, что в ближайшие 10 лет развитие ИИ спровоцирует трансформацию экономики, сопоставимую с исторической индустриализацией. Письмо призывает формировать новые институты для компенсации потери рабочих мест.
Лидеры ИИ-компаний указывают на нехватку метрик для измерения влияния ИИ на экономику - из-за этого конкретный план действий отсутствует.
Демис Хассабис, не подписавший письмо, прогнозирует появление AGI в перспективе 5 лет и сравнивает эффект с "десятикратной индустриализацией на десятикратной скорости".
stanford.edu
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤1
Кто-то разобрал Claude Code почти до винтика
Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.
Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.
https://github.com/justxor/Claudecourse/
learn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.
Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.
https://github.com/justxor/Claudecourse/
👍8❤4
TSMC снова показывает, кто реально зарабатывает на AI-буме.
Во втором квартале 2026 компания выдала почти идеальный отчёт:
* выручка: NT$1.27 трлн или около $40 млрд
* рост выручки: +36% год к году
* чистая прибыль: NT$706.6 млрд или около $22 млрд
* рост прибыли: +77% год к году
* новый рекорд по прибыли
* gross margin: 67.7%, выше прогноза
* результат выше консенсуса аналитиков примерно на 11.7%
Выручка пришла у верхней границы собственного прогноза TSMC: $39.0–40.2 млрд.
Причина всё та же: спрос на AI-чипы. NVIDIA, hyperscalers, кастомные ускорители, HBM-цепочки — всё это упирается в передовые фабрики.
CEO TSMC C.C. Wei сказал очень показательно:
> «Пройдёт много времени, прежде чем мы сможем удовлетворить спрос клиентов».
AI-бум может спорить о моделях, агентах и приложениях.
Деньги прямо сейчас забирают те, кто продаёт инфраструктуру: TSMC, NVIDIA и вся цепочка вокруг вычислений.
https://x.com/jukan05/status/2077630742788743292
Во втором квартале 2026 компания выдала почти идеальный отчёт:
* выручка: NT$1.27 трлн или около $40 млрд
* рост выручки: +36% год к году
* чистая прибыль: NT$706.6 млрд или около $22 млрд
* рост прибыли: +77% год к году
* новый рекорд по прибыли
* gross margin: 67.7%, выше прогноза
* результат выше консенсуса аналитиков примерно на 11.7%
Выручка пришла у верхней границы собственного прогноза TSMC: $39.0–40.2 млрд.
Причина всё та же: спрос на AI-чипы. NVIDIA, hyperscalers, кастомные ускорители, HBM-цепочки — всё это упирается в передовые фабрики.
CEO TSMC C.C. Wei сказал очень показательно:
> «Пройдёт много времени, прежде чем мы сможем удовлетворить спрос клиентов».
AI-бум может спорить о моделях, агентах и приложениях.
Деньги прямо сейчас забирают те, кто продаёт инфраструктуру: TSMC, NVIDIA и вся цепочка вокруг вычислений.
https://x.com/jukan05/status/2077630742788743292
❤4👍2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Гладиаторские бои будущего уже стартовали в Шэньчжэне? 🤖🔥
В Китае запустили Ultimate Robot Knockout Legend - лигу свободных боёв среди гуманоидных роботов.
Выглядит как смесь MMA, киберпанка и трейлера к «Терминатору».
Главный приз тоже не игрушечный: золотой чемпионский пояс стоимостью около $1.45 млн.
В Китае запустили Ultimate Robot Knockout Legend - лигу свободных боёв среди гуманоидных роботов.
Выглядит как смесь MMA, киберпанка и трейлера к «Терминатору».
Главный приз тоже не игрушечный: золотой чемпионский пояс стоимостью около $1.45 млн.
🔥7❤3👍2😁1
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
❤2👍2🔥2👎1