This media is not supported in your browser
VIEW IN TELEGRAM
Обычные autoregressive-модели генерируют токены по одному - качественно, но медленно. Diffusion-подходы могут генерировать целые блоки параллельно, но обычно теряют в качестве.
TwoTower разделяет эти две задачи.
Первая башня - замороженная context-модель, которая читает уже существующий текст и сохраняет возможности исходной autoregressive-модели.
Вторая - trainable denoiser, который параллельно восстанавливает следующий блок токенов и на каждом слое обращается к соответствующему слою context tower через cross-attention.
По данным авторов:
- до 2,42× выше throughput генерации
- сохраняется 98,7% качества исходной модели
- основа - 30B hybrid Mamba-Transformer MoE
- адаптация обучалась примерно на 2,1T токенов против 25T токенов исходного pretraining
При этом модель не обучали с нуля - TwoTower строится поверх уже существующей autoregressive-модели.
То есть можно сохранить сильную базовую модель, но заменить медленную генерацию по одному токену на параллельную генерацию блоками.
Код и веса открыты.
https://arxiv.org/pdf/2606.26493
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍10🔥6
Малайзия рассматривает чипы Huawei для ИИ-проекта на $494 млн
По данным Bloomberg, страна оценивает ускорители Ascend 910C для собственной ИИ-инфраструктуры, которая даст больше контроля над национальными данными.
Ранее издание сообщило о планах **DeepSeek использовать минимум 160 тысяч ускорителей Huawei** в дата-центре во Внутренней Монголии. Они предназначены для инференса, а обучение моделей останется на Nvidia.
Оба сообщения появились на фоне предупреждений США другим странам об использовании ИИ-чипов Huawei.
По данным Bloomberg, страна оценивает ускорители Ascend 910C для собственной ИИ-инфраструктуры, которая даст больше контроля над национальными данными.
Ранее издание сообщило о планах **DeepSeek использовать минимум 160 тысяч ускорителей Huawei** в дата-центре во Внутренней Монголии. Они предназначены для инференса, а обучение моделей останется на Nvidia.
Оба сообщения появились на фоне предупреждений США другим странам об использовании ИИ-чипов Huawei.
🔥10❤6👍5
⚡️ DeepSeek V4.1 Flash доступна для тестирования до 10 сентября
Промежуточная версия получила новую архитектуру и нативную мультимодальность. Разработчики заявляют улучшение качества ответов, более высокую скорость и снижение стоимости.
На опубликованном скриншоте теста с запросом «Привет»: 159,3 токена/с, 0,3 секунды на рассуждение и 0,8 секунды на весь ответ. Это единичный короткий тест, скорость на сложных задачах ещё предстоит оценить.
Как попробовать через API:
*
* Имя модели:
* Тарифы пока такие же, как у V4-Flash.
* Лимит - 20 одновременных запросов на аккаунт.
#DeepSeek #AI
Промежуточная версия получила новую архитектуру и нативную мультимодальность. Разработчики заявляют улучшение качества ответов, более высокую скорость и снижение стоимости.
На опубликованном скриншоте теста с запросом «Привет»: 159,3 токена/с, 0,3 секунды на рассуждение и 0,8 секунды на весь ответ. Это единичный короткий тест, скорость на сложных задачах ещё предстоит оценить.
Как попробовать через API:
*
base_url остаётся прежним.* Имя модели:
deepseek-v4.1-flash-expires-on-0910.* Тарифы пока такие же, как у V4-Flash.
* Лимит - 20 одновременных запросов на аккаунт.
#DeepSeek #AI
❤7🔥5👍3
Снижение цен OpenAI может осложнить IPO Anthropic
По данным The Information, после снижения цены Luna на 80% объём использования модели вырос примерно в 10–13 раз.
Издание связывает этот результат с перспективами Anthropic: её привлекательность для инвесторов отчасти зависит от способности сохранять высокие цены и одновременно быстро наращивать выручку.
Более дешёвые модели конкурентов могут усилить давление на тарифы Anthropic и усложнить сохранение высокой маржи.
https://www.theinformation.com/newsletters/the-briefing/price-cuts-may-rattle-anthropics-ipo-pitch
По данным The Information, после снижения цены Luna на 80% объём использования модели вырос примерно в 10–13 раз.
Издание связывает этот результат с перспективами Anthropic: её привлекательность для инвесторов отчасти зависит от способности сохранять высокие цены и одновременно быстро наращивать выручку.
Более дешёвые модели конкурентов могут усилить давление на тарифы Anthropic и усложнить сохранение высокой маржи.
https://www.theinformation.com/newsletters/the-briefing/price-cuts-may-rattle-anthropics-ipo-pitch
❤8👍4🔥4
151 торговая стратегия с формулами и кодом - бесплатная книга на 361 страницу
В 151 Trading Strategies Зура Какушадзе и Хуан Андрес Серур разбирают математические основы стратегий для акций, облигаций, опционов, фьючерсов, валют и криптовалют.
Внутри:
* более 550 математических формул
* стратегии с нейросетями, байесовскими методами и k-ближайшими соседями
* код для бэктестинга на данных вне обучающей выборки
* более 900 определений и около 2000 ссылок на исследования
Книга на английском. Подойдёт для изучения количественного трейдинга и разработки собственных исследовательских моделей.
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3247865
В 151 Trading Strategies Зура Какушадзе и Хуан Андрес Серур разбирают математические основы стратегий для акций, облигаций, опционов, фьючерсов, валют и криптовалют.
Внутри:
* более 550 математических формул
* стратегии с нейросетями, байесовскими методами и k-ближайшими соседями
* код для бэктестинга на данных вне обучающей выборки
* более 900 определений и около 2000 ссылок на исследования
Книга на английском. Подойдёт для изучения количественного трейдинга и разработки собственных исследовательских моделей.
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3247865
❤5👍4🔥4
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
👍4❤2🥰1🗿1
🚨 «Играют в рулетку с нашими жизнями»: исследователь ушёл из Anthropic из-за гонки ИИ
Джейкоб Коксон покинул компанию и опубликовал большой тред о рисках самоулучшающегося ИИ.
🔬 Последние три года он занимался предобучением моделей в OpenAI и Anthropic. По его оценке, ни одна из компаний не проявляет достаточной осторожности.
⏳ Коксон утверждает, что среди разработчиков передовых моделей есть люди, которые всерьёз допускают катастрофические последствия, вплоть до гибели человечества, уже в ближайшие годы.
🏁 По его словам, в Anthropic понимают риски, но продолжают разработку из опасения, что менее ответственная лаборатория первой создаст сверхмощный ИИ.
⚙️ Главная тревога исследователя - рекурсивное самоулучшение: ИИ начинает ускорять создание собственных преемников, а людям становится всё сложнее контролировать этот процесс.
Коксон опасается потери контроля уже к концу 2027 года. Это его прогноз, а не установленный срок появления сверхразума.
Джейкоб Коксон покинул компанию и опубликовал большой тред о рисках самоулучшающегося ИИ.
🔬 Последние три года он занимался предобучением моделей в OpenAI и Anthropic. По его оценке, ни одна из компаний не проявляет достаточной осторожности.
⏳ Коксон утверждает, что среди разработчиков передовых моделей есть люди, которые всерьёз допускают катастрофические последствия, вплоть до гибели человечества, уже в ближайшие годы.
🏁 По его словам, в Anthropic понимают риски, но продолжают разработку из опасения, что менее ответственная лаборатория первой создаст сверхмощный ИИ.
⚙️ Главная тревога исследователя - рекурсивное самоулучшение: ИИ начинает ускорять создание собственных преемников, а людям становится всё сложнее контролировать этот процесс.
Коксон опасается потери контроля уже к концу 2027 года. Это его прогноз, а не установленный срок появления сверхразума.
🔥13👍7🤪4🥰3😱3😁2😢2❤1🍾1
Tencent открыла AuK - универсальную модель для обработки аудио
AuK выполняет несколько задач через инструкции на естественном языке:
* синтез речи и клонирование голоса без примеров для обучения
* замена, добавление и удаление слов в записи
* изменение эмоции, высоты, скорости и громкости голоса
* удаление акцента и преобразование речи в шёпот
* переписывание текста песни с сохранением мелодии и голоса
* удаление шума и реверберации
* разделение спикеров
* извлечение вокала из музыки
Модель содержит 1,5 млрд параметров. Опубликованы веса и код под лицензией MIT, доступны CLI, Gradio и ComfyUI. По данным Tencent, AuK превосходит Qwen3-TTS в заявленных тестах.
Также выпущена AuK-Flash - дистиллированная версия, которой требуется всего четыре шага инференса. В одинаковых условиях она работает в 4,5 раза быстрее полной модели.
Важно: 1,5B - размер только основной модели. Эталонная конфигурация дополнительно загружает Qwen2.5-Omni-3B как мультимодальный энкодер и отдельный VAE. Запуск рассчитан на PyTorch + CUDA, поддержки llama.cpp и GGUF нет.
https://www.orcarouter.ai/blog/auk-open-weights-speech-explained
AuK выполняет несколько задач через инструкции на естественном языке:
* синтез речи и клонирование голоса без примеров для обучения
* замена, добавление и удаление слов в записи
* изменение эмоции, высоты, скорости и громкости голоса
* удаление акцента и преобразование речи в шёпот
* переписывание текста песни с сохранением мелодии и голоса
* удаление шума и реверберации
* разделение спикеров
* извлечение вокала из музыки
Модель содержит 1,5 млрд параметров. Опубликованы веса и код под лицензией MIT, доступны CLI, Gradio и ComfyUI. По данным Tencent, AuK превосходит Qwen3-TTS в заявленных тестах.
Также выпущена AuK-Flash - дистиллированная версия, которой требуется всего четыре шага инференса. В одинаковых условиях она работает в 4,5 раза быстрее полной модели.
Важно: 1,5B - размер только основной модели. Эталонная конфигурация дополнительно загружает Qwen2.5-Omni-3B как мультимодальный энкодер и отдельный VAE. Запуск рассчитан на PyTorch + CUDA, поддержки llama.cpp и GGUF нет.
https://www.orcarouter.ai/blog/auk-open-weights-speech-explained
❤6🔥4👍2
🚨 Слухи: OpenAI решила гипотезу Ходжа
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.
За решение каждой предусмотрена премия $1 млн.
Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.
Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.
Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/
🥱7👍5❤1🔥1
Линейка Institute of Foundation Models охватывает задачи от работы на устройствах до рассуждений, программирования и AI-агентов.
По заявлению IFM, для каждой модели публикуются веса, код обучения, конфигурации, данные или подробные рецепты их подготовки, промежуточные чекпоинты, логи и оценки качества. Материалы охватывают путь от предобучения до обучения рассуждениям и агентным задачам.
Основные детали:
* Около 20 трлн токенов на модель. В обучающей смеси - веб, код, математика, научные, многоязычные и синтетические данные.
* Около 17% корпуса содержат явные цепочки рассуждений. По данным IFM, при предобучении использовали примерно 10 трлн синтетических токенов.
* Более 100 млн уникальных задач подготовлены для постобучения. Открывается пайплайн SFT, объединения моделей, RL и специализированного обучения агентов.
* 36B-A4B активирует около 4 млрд параметров на токен. Архитектура Mixture-of-Value Attention переносит маршрутизацию экспертов в механизм внимания. По оценкам авторов, модель приближается к плотной 32B, обученной в сопоставимых условиях.
Для версий 0,9B, 3,7B и 7B IFM заявляет лучшие результаты в своих размерных категориях.
Также команда выпускает инфраструктуру обучения xLLM. Один из датасетов предобучения, TxT360-v2 объёмом 5,3 ТБ, опубликован на Hugging Face.
https://huggingface.co/datasets/IFM/TxT360-v2
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8🔥4👍3🤣1
Сбер представил GigaChat 3.5 Reasoning — флагманскую модель с режимом рассуждений
Новая версия умеет последовательно решать сложные задачи. Сначала разбирает их на этапы и выстраивает план. Затем проверяет промежуточные результаты и исправляет ошибки.
Ещё одна особенность релиза — экономный расход токенов. В среднем на математические расчёты здесь используется на 37% меньше токенов, чем у открытой ИИ-модели DeepSeek V4 Flash Preview.
По сравнению с моделью без режима рассуждений GigaChat 3.5 Reasoning заметно улучшила результаты бенчмарков. В IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85.
Модель доступна бесплатно по лицензии MIT на HuggingFace и GitVerse. Её можно интегрировать в собственные продукты.
Попробуйте обновлённый режим «Рассуждение» на giga.chat. Подробнее – в посте команды.
Новая версия умеет последовательно решать сложные задачи. Сначала разбирает их на этапы и выстраивает план. Затем проверяет промежуточные результаты и исправляет ошибки.
Ещё одна особенность релиза — экономный расход токенов. В среднем на математические расчёты здесь используется на 37% меньше токенов, чем у открытой ИИ-модели DeepSeek V4 Flash Preview.
По сравнению с моделью без режима рассуждений GigaChat 3.5 Reasoning заметно улучшила результаты бенчмарков. В IFBench показатель вырос с 44 до 77 баллов, в Natural Plan — с 64 до 80, а в Live Code Bench v6 — с 56 до 85.
Модель доступна бесплатно по лицензии MIT на HuggingFace и GitVerse. Её можно интегрировать в собственные продукты.
Попробуйте обновлённый режим «Рассуждение» на giga.chat. Подробнее – в посте команды.
🤣10👍8🔥3🥰1
🤖 У A2A появился официальный CLI
Теперь с A2A-агентами можно работать прямо из терминала:
- получать Agent Card
- отправлять сообщения
- стримить ответы и события
- создавать и отслеживать задачи
- управлять task lifecycle
- использовать CLI в скриптах и CI/CD
Пример:
Или со streaming:
Удобная штука для тестирования A2A-агентов без написания отдельного клиента.
GitHub:
https://github.com/a2aproject/a2a-cli
Теперь с A2A-агентами можно работать прямо из терминала:
- получать Agent Card
- отправлять сообщения
- стримить ответы и события
- создавать и отслеживать задачи
- управлять task lifecycle
- использовать CLI в скриптах и CI/CD
Пример:
a2a send -a https://agent.example.com "Hello"Или со streaming:
a2a send -a https://agent.example.com --stream "Summarize this document"Удобная штука для тестирования A2A-агентов без написания отдельного клиента.
GitHub:
https://github.com/a2aproject/a2a-cli
GitHub
GitHub - a2aproject/a2a-cli: The official command-line interface for interacting with A2A (Agent-to-Agent) compatible agents.
The official command-line interface for interacting with A2A (Agent-to-Agent) compatible agents. - a2aproject/a2a-cli
❤5👍3😁2