Forwarded from Trashchenkov
🧠 GigaChat 3.5 Reasoning
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.
Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.
Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.
При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.
Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.
Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.
После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.
По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
— SWE-bench Verified: 42,6 → 64,7;
— Terminal-Bench 2: 13,48 → 30,3;
— Natural Plan: 64 → 80,19.
На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.
📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»
У GigaChat появилась первая модель с полноценным рассуждением — GigaChat 3.5 Reasoning.
Как её делали?
Сначала был SFT: модель обучили на готовых примерах решений, в том числе для агентных сценариев. Это сформировало стартовый набор способов решения для последующего RL.
Дальше из одного SFT-чекпоинта независимо обучили шесть специализированных моделей через online RL: математика и естественные науки, код, агент для кода, универсальный агент, диалог и следование инструкциям.
При online RL модель сама генерирует несколько решений задачи, получает награды за их качество и учится на собственных свежих попытках. Так постепенно закрепляются полезные стратегии: перепроверить результат, вернуться после ошибки, попробовать другой путь. В GigaChat для этого использовали CISPO — алгоритм из работы про MiniMax-M1.
Для каждого эксперта настроили свою схему награды: математические ответы сверяли с эталоном, код запускали, патчи проверяли тестами, в агентных сценариях смотрели на конечное состояние среды, а диалог оценивали через LLM-судью.
Агентов учили отдельно. Code Agent работал с реальными репозиториями через
mini-SWE-agent: читал файлы, запускал команды, правил код и смотрел на результат. General Agent учился вызывать инструменты, работать с памятью и поиском и проходить многошаговые диалоги.
После RL шесть специализированных моделей свели в одну через on-policy distillation: итоговая модель сама генерировала решение, а соответствующий эксперт давал ей обучающий сигнал на каждом токене.
По метрикам прирост заметный относительно GigaChat 3.5 Instant. Например:
— SWE-bench Verified: 42,6 → 64,7;
— Terminal-Bench 2: 13,48 → 30,3;
— Natural Plan: 64 → 80,19.
На задачах AIME 2025/2026, HMMT и IMOAnswerBench новая модель в среднем использовала на 37% меньше токенов рассуждения, чем DeepSeek V4 Flash Preview.
📖 Подробная статья про обучение
⚖️ Веса на Hugging Face и GitVerse — лицензия MIT
🧪 Попробовать в вебе — режим «Рассуждение»
huggingface.co
GRPO Trainer · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
1❤🔥6⚡5🏆4👎1
"Красный день" для AI-индустрии: топ-менеджеры просят тормозить, рынок паникует 📉🤯
В воскресенье, 13 сентября, произошло нечто из ряда вон выходящее. Глава Anthropic Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором призвал замедлить темпы развития передовых AI-моделей из-за рисков безопасности.
Самое удивительное — его поддержали Сэм Альтман (OpenAI) и Илон Маск. Это редчайший случай единства среди обычно конкурирующих лидеров отрасли.
Амодеи предупредил, что в течение 6–12 месяцев рой AI-агентов может «захватить весь интернет» и нанести ущерб в сотни миллиардов долларов.Альтман заявил, что OpenAI не будет проводить IPO в 2026 году, сосредоточившись на безопасности.
Реакция рынка была мгновенной. В понедельник, 14 сентября, акции AI-компаний по всему миру резко обвалились. SoftBank потерял более 10%, пострадали Nvidia, Intel, ASML, SK Hynix. Reuters назвал это «самой серьёзной угрозой на сегодняшний день для миллиардов долларов, вложенных в эту индустрию».
При этом китайская государственная пресса назвала призывы Anthropic к замедлению развития AI элементом технологической борьбы с Китаем.
Пока неясно, чем закончится этот «тормозной путь», но одно очевидно: эпоха безудержного роста AI-хайпа, похоже, столкнулась с суровой реальностью
#AI #безопасность #рынок #Anthropic #OpenAI
В воскресенье, 13 сентября, произошло нечто из ряда вон выходящее. Глава Anthropic Дарио Амодеи опубликовал эссе «We Must Pace the Frontier», в котором призвал замедлить темпы развития передовых AI-моделей из-за рисков безопасности.
Самое удивительное — его поддержали Сэм Альтман (OpenAI) и Илон Маск. Это редчайший случай единства среди обычно конкурирующих лидеров отрасли.
Амодеи предупредил, что в течение 6–12 месяцев рой AI-агентов может «захватить весь интернет» и нанести ущерб в сотни миллиардов долларов.Альтман заявил, что OpenAI не будет проводить IPO в 2026 году, сосредоточившись на безопасности.
Реакция рынка была мгновенной. В понедельник, 14 сентября, акции AI-компаний по всему миру резко обвалились. SoftBank потерял более 10%, пострадали Nvidia, Intel, ASML, SK Hynix. Reuters назвал это «самой серьёзной угрозой на сегодняшний день для миллиардов долларов, вложенных в эту индустрию».
При этом китайская государственная пресса назвала призывы Anthropic к замедлению развития AI элементом технологической борьбы с Китаем.
Пока неясно, чем закончится этот «тормозной путь», но одно очевидно: эпоха безудержного роста AI-хайпа, похоже, столкнулась с суровой реальностью
#AI #безопасность #рынок #Anthropic #OpenAI
1🔥17❤🔥15😱8❤7
This media is not supported in your browser
VIEW IN TELEGRAM
Роботы строят роботов»: массовое производство запущено 🤖🏭
В Китае произошёл тектонический сдвиг в робототехнике. В Лючжоу официально запущен первый в мире завод по массовому производству человекоподобных роботов мощностью более 10 000 единиц в год!
Каждые 10 минут с конвейера сходит один готовый промышленный гуманоид. И да, это буквально «роботы делают роботов» — производство управляется цифровым «мозгом» и системами симуляции, а участие человека сведено к минимуму.
Это не единичный случай. Китайская XPENG тоже не отстаёт: её робот IRON (76 степеней свободы, три чипа Turing на 2250 TOPS) уже самостоятельно сошёл с конвейера 8 сентября. Массовый выпуск запланирован на конец этого года, а коммерческие поставки — на 2027-й.
Мы входим в эпоху, когда роботы перестают быть штучным товаром.
#роботехника
В Китае произошёл тектонический сдвиг в робототехнике. В Лючжоу официально запущен первый в мире завод по массовому производству человекоподобных роботов мощностью более 10 000 единиц в год!
Каждые 10 минут с конвейера сходит один готовый промышленный гуманоид. И да, это буквально «роботы делают роботов» — производство управляется цифровым «мозгом» и системами симуляции, а участие человека сведено к минимуму.
Это не единичный случай. Китайская XPENG тоже не отстаёт: её робот IRON (76 степеней свободы, три чипа Turing на 2250 TOPS) уже самостоятельно сошёл с конвейера 8 сентября. Массовый выпуск запланирован на конец этого года, а коммерческие поставки — на 2027-й.
Мы входим в эпоху, когда роботы перестают быть штучным товаром.
#роботехника
10🤔9🤯7🔥6
This media is not supported in your browser
VIEW IN TELEGRAM
Digit 5 научили работать рядом с людьми без защитной клетки
Agility Robotics показала новое поколение своего гуманоида Digit. Главный апгрейд здесь не скорость и не грузоподъёмность, а отдельная система безопасности для работы рядом с человеком.
Робот использует:
-бортовые камеры;
-датчики глубины;
-IMU;
-собственные AI-алгоритмы Agility для обнаружения людей и оценки опасного сближения.
Если человек оказывается слишком близко, Digit 5 может изменить движение, остановиться или перейти в безопасное положение.
Ключевой момент: за это отвечает отдельный safety-контроллер, независимый от основной системы управления. Agility также использует платформу NVIDIA IGX Thor + Halos for Robotics для safety-critical функций.
Из железа:
-поднимает до 22,7 кг;
-работает около 90 минут;
-заряжается за 9 минут.
То есть идея Digit 5 уже не в том, чтобы просто «уметь ходить», а в том, чтобы реально работать на складе или производстве в одной зоне с людьми.
Agility Robotics — Digit 5
Agility Robotics показала новое поколение своего гуманоида Digit. Главный апгрейд здесь не скорость и не грузоподъёмность, а отдельная система безопасности для работы рядом с человеком.
Робот использует:
-бортовые камеры;
-датчики глубины;
-IMU;
-собственные AI-алгоритмы Agility для обнаружения людей и оценки опасного сближения.
Если человек оказывается слишком близко, Digit 5 может изменить движение, остановиться или перейти в безопасное положение.
Ключевой момент: за это отвечает отдельный safety-контроллер, независимый от основной системы управления. Agility также использует платформу NVIDIA IGX Thor + Halos for Robotics для safety-critical функций.
Из железа:
-поднимает до 22,7 кг;
-работает около 90 минут;
-заряжается за 9 минут.
То есть идея Digit 5 уже не в том, чтобы просто «уметь ходить», а в том, чтобы реально работать на складе или производстве в одной зоне с людьми.
Agility Robotics — Digit 5
1❤19👍14🔥10
This media is not supported in your browser
VIEW IN TELEGRAM
Робот-рука взяла кирпичик LEGO: что под капотом
Потестила захват предметов на AdeeptTank Raspberry Pi. Рука — 4 степени свободы: плечо, локоть, кисть, захват. Для опускания и захвата работают три из них — плечо, локоть и захват; кисть отвечает за вращение. Каждый сустав — сервопривод на плате PCA9685 (I²C, адрес 0x5f).
Как управляется:
— серво понимает не «угол», а ширину импульса: 500 мкс = 0°, 2400 мкс = 180°, 50 Гц;
— в коде: servo.Servo(pca.channels[ch], min_pulse=500, max_pulse=2400).angle = 90.
Позу подбирала интерактивно — скрипт двигает сустав на 5° за команду и не пускает за безопасные пределы.
Следующий шаг — «чувство захвата» по току серво. Так работают промышленные захваты.
Степень свободы — одно движение.
Углы можно не подбирать руками, а считать. Зная длины звеньев и углы, положение клешни выводится по формуле: x = L₁cosθ₁ + L₂cos(θ₁+θ₂), аналогично y. А обратно — от точки к углам — идут через якобиан: матрицу «на сколько сдвинется клешня при малом повороте каждого сустава».
#роботетхника
Потестила захват предметов на AdeeptTank Raspberry Pi. Рука — 4 степени свободы: плечо, локоть, кисть, захват. Для опускания и захвата работают три из них — плечо, локоть и захват; кисть отвечает за вращение. Каждый сустав — сервопривод на плате PCA9685 (I²C, адрес 0x5f).
Как управляется:
— серво понимает не «угол», а ширину импульса: 500 мкс = 0°, 2400 мкс = 180°, 50 Гц;
— в коде: servo.Servo(pca.channels[ch], min_pulse=500, max_pulse=2400).angle = 90.
Позу подбирала интерактивно — скрипт двигает сустав на 5° за команду и не пускает за безопасные пределы.
Следующий шаг — «чувство захвата» по току серво. Так работают промышленные захваты.
Степень свободы — одно движение.
Углы можно не подбирать руками, а считать. Зная длины звеньев и углы, положение клешни выводится по формуле: x = L₁cosθ₁ + L₂cos(θ₁+θ₂), аналогично y. А обратно — от точки к углам — идут через якобиан: матрицу «на сколько сдвинется клешня при малом повороте каждого сустава».
#роботетхника
1❤🔥7⚡7🏆7🔥4
Forwarded from tldr_tany (Таня Савельева)
Вчера выступала на большой конфе в Парке Горького от Тинька по продуктам
Конфа была топ
Я спросила - сколько людей вайбкодило что-то?
Поднял руки почти весь зал
Второй вопрос - кто с этого что-то заработал
Подняло руки 2 человека - 1 из них мой гость
Это про то, почему нужен маркетинг, продажи и продукт
Конфа была топ
Я спросила - сколько людей вайбкодило что-то?
Поднял руки почти весь зал
Второй вопрос - кто с этого что-то заработал
Подняло руки 2 человека - 1 из них мой гость
Это про то, почему нужен маркетинг, продажи и продукт
1❤6🔥3
Давно читаю канал Тани Савельевой, интересно пишет про вайб кодинг и предпринимательство.
https://t.me/tldr_tany
https://t.me/tldr_tany
Telegram
tldr_tany (Таня Савельева)
Всем привет! Я Таня @tany_save, Forbes 30/30, мама Зоиньки, предприниматель с 2 экзитами, сейчас делаю 2 компании и интересуюсь будоражащим 🖤
не даю рекламу
не даю рекламу
1❤🔥4🤩4🔥3
Forwarded from A1intelligence — канал об искусственном интеллекте
This media is not supported in your browser
VIEW IN TELEGRAM
В Google Colab теперь можно бесплатно тренировать более 500 моделей — энтузиасты выпустили Unsloth Studio.
Unsloth Studio — это простой и удобный веб-интерфейс для обучения и тонкой настройки нейросетей без кода: поддерживается автоматическое создание синтетических датасетов, обучение занимает в 2 раза меньше времени и требует на 70% меньше VRAM на бесплатных GPU. Поддерживается работа как с готовыми, так и с кастомными датасетами.
Пробуем на Google Collab.
#полезныеинструменты #opensource
Unsloth Studio — это простой и удобный веб-интерфейс для обучения и тонкой настройки нейросетей без кода: поддерживается автоматическое создание синтетических датасетов, обучение занимает в 2 раза меньше времени и требует на 70% меньше VRAM на бесплатных GPU. Поддерживается работа как с готовыми, так и с кастомными датасетами.
Пробуем на Google Collab.
#полезныеинструменты #opensource
1🏆7🥰6🔥4
This media is not supported in your browser
VIEW IN TELEGRAM
В Шанхае прошли бои полноразмерных гуманоидов
На турнире URKL сражались гуманоиды EngineAI T800 ростом 173 см. У всех команд было одинаковое железо: до 29 степеней свободы, пиковый момент суставов до 450 Н·м, стереокамеры и LiDAR. Поэтому основная разница между бойцами — софт, настройки управления и стратегия.
Победил «Белый орёл», забрав дневную и вечернюю сессии. В финале показали и multi-robot бой: «Белый орёл» + «Золотая вспышка» против «Матадора».
Технически цикл выглядит так: perception → оценка 3D-позы и траектории противника → прогноз движения → выбор удара/уклонения → whole-body control. Внизу работает низколатентный контур, оценка внешних сил и компенсация баланса после ударов.
Движения T800 можно обучать через RL + whole-body tracking в Isaac Lab, а затем переносить policy на реального робота. В multi-agent режиме два T800 ещё и объединяют наблюдения, закрывают слепые зоны и динамически распределяют роли «сдерживать» / «атаковать». ([GitHub])
#робототехника
На турнире URKL сражались гуманоиды EngineAI T800 ростом 173 см. У всех команд было одинаковое железо: до 29 степеней свободы, пиковый момент суставов до 450 Н·м, стереокамеры и LiDAR. Поэтому основная разница между бойцами — софт, настройки управления и стратегия.
Победил «Белый орёл», забрав дневную и вечернюю сессии. В финале показали и multi-robot бой: «Белый орёл» + «Золотая вспышка» против «Матадора».
Технически цикл выглядит так: perception → оценка 3D-позы и траектории противника → прогноз движения → выбор удара/уклонения → whole-body control. Внизу работает низколатентный контур, оценка внешних сил и компенсация баланса после ударов.
Движения T800 можно обучать через RL + whole-body tracking в Isaac Lab, а затем переносить policy на реального робота. В multi-agent режиме два T800 ещё и объединяют наблюдения, закрывают слепые зоны и динамически распределяют роли «сдерживать» / «атаковать». ([GitHub])
#робототехника
1🔥22❤🔥13👍10❤4
Xiaomi выпустила MiMo-V2.6
Новая серия включает модели MiMo-V2.6 Pro и Flash. Они мультимодальные и рассчитаны на код, agentic-задачи, работу с GUI, изображениями и внешними инструментами.
Что интересно:
— контекст до 1 млн токенов;
— RL-обучение на ~750 тыс. trajectories;
— Pro вырос на DeepSWE v1.1 с 58,4 до 72,6 после RL;
— поддерживаются Computer Use, Blender/3D и управление роботом в симуляции;
— Xiaomi открыла не только веса, но и часть RL-кода, environments и agent harnesses.
Официальный релиз:
https://mimo.mi.com/docs/en-US/news/latest/v2-6
Hugging Face:
https://huggingface.co/XiaomiMiMo
Новая серия включает модели MiMo-V2.6 Pro и Flash. Они мультимодальные и рассчитаны на код, agentic-задачи, работу с GUI, изображениями и внешними инструментами.
Что интересно:
— контекст до 1 млн токенов;
— RL-обучение на ~750 тыс. trajectories;
— Pro вырос на DeepSWE v1.1 с 58,4 до 72,6 после RL;
— поддерживаются Computer Use, Blender/3D и управление роботом в симуляции;
— Xiaomi открыла не только веса, но и часть RL-кода, environments и agent harnesses.
Официальный релиз:
https://mimo.mi.com/docs/en-US/news/latest/v2-6
Hugging Face:
https://huggingface.co/XiaomiMiMo
Mi
Xiaomi MiMo-V2.6 Series: 3 New Models Officially Released
Flagship performance · Full modality · Built for professional workflows | Team Token Plan · Batch Inference (Batch API) now powered by V2.6 models.
1❤6🔥3👏3
🔥 Что реально изменилось за последние дни: GPT-6, Claude Opus 5.5, Xiaomi MiMo и грядущий Qwen 4
За последние пару дней вышло сразу несколько крупных AI-моделей. Я сравнила их не по сухим рейтингам, а по тому, что мне кажется важнее: код, агенты, контекст, скорость и сколько всё это стоит на практике.
🤖 OpenAI GPT-6 Sol / Luna
Здесь интереснее всего то, что OpenAI фактически спустила часть технологий GPT-6 Astra в более дешёвые модели. Sol и Luna обучались похожими методами и получили улучшения Astra в coding, computer use, factuality и agentic-задачах.
При этом API подешевел примерно вдвое:
Sol: $2 input /$10 output
Luna: $0.10 /$0.50 за 1M токенов
По бенчмарку DeepSWE 1.1:
Sol — 68.8%
Luna — 66.6%
То есть даже Luna уже залезает в область серьёзного coding-agent, хотя стоит копейки. Плюс OpenAI переработала prompt caching: cached input теперь может быть дешевле на 90%.
🧠 Claude Opus 5.5
Anthropic пошла немного другим путём: ставка на длинные автономные задачи и качество агента.
Цена: $4 /$20. Это на 20% ниже Opus 5, модель генерирует более чем на 30% быстрее, а типичная задача, по данным Anthropic, обходится примерно на 40% дешевле из-за меньшего количества токенов и шагов.
То есть Opus интересен не только тем, что «умнее». Он стал меньше ходить кругами и делать меньше tool calls для получения результата. Для больших codebase, рефакторинга и автономных агентов это может быть важнее цены одного токена.
🚀 Xiaomi MiMo-V2.6 Pro
Для меня это самый интересный релиз по соотношению характеристик и цены.
Что внутри:
1M context
128K max output
text + image + video + audio
tool calling
open weights
Цена: $0.435 input /$0.87 output.
На Artificial Analysis Intelligence Index Xiaomi указывает 46.32 — сейчас это один из самых сильных результатов среди open-weight моделей.
Но технически интереснее другое: Xiaomi сильно масштабировала RL на реальных agentic-задачах. Для Pro использовали около 750 тыс. trajectories, а DeepSWE v1.1 в процессе RL вырос с 58.4 до 72.6.
То есть open-weight модели начинают догонять закрытые уже не только масштабом pretraining — их серьёзно дожимают через agentic RL.
👀 И ещё важное — Qwen 4
Это уже официально: Alibaba сообщила, что Qwen 4 находится в обучении.
Причём компания уже показала направление развития: Qwen3.8-Max прогнали через месяц автоматического self-improvement — 33 итерации, после чего его Artificial Analysis score вырос с 40 до 45.
Дальше в roadmap — Qwen 4.5 и Qwen 5, где Alibaba говорит уже о масштабе 5–10 трлн параметров.
💡 Мой вывод после сравнения:
Claude Opus 5.5 — ставка на тяжёлые и длинные agentic-задачи.
GPT-6 Sol — сильный компромисс между frontier-возможностями и ценой.
GPT-6 Luna — особенно интересна для массовых агентов и большого числа вызовов.
MiMo V2.6 Pro — наиболее интересный open-weight релиз по цене/возможностям.
Какую модель вы бы протестировали? Делитесь в комментариях! 👇
За последние пару дней вышло сразу несколько крупных AI-моделей. Я сравнила их не по сухим рейтингам, а по тому, что мне кажется важнее: код, агенты, контекст, скорость и сколько всё это стоит на практике.
🤖 OpenAI GPT-6 Sol / Luna
Здесь интереснее всего то, что OpenAI фактически спустила часть технологий GPT-6 Astra в более дешёвые модели. Sol и Luna обучались похожими методами и получили улучшения Astra в coding, computer use, factuality и agentic-задачах.
При этом API подешевел примерно вдвое:
Sol: $2 input /$10 output
Luna: $0.10 /$0.50 за 1M токенов
По бенчмарку DeepSWE 1.1:
Sol — 68.8%
Luna — 66.6%
То есть даже Luna уже залезает в область серьёзного coding-agent, хотя стоит копейки. Плюс OpenAI переработала prompt caching: cached input теперь может быть дешевле на 90%.
🧠 Claude Opus 5.5
Anthropic пошла немного другим путём: ставка на длинные автономные задачи и качество агента.
Цена: $4 /$20. Это на 20% ниже Opus 5, модель генерирует более чем на 30% быстрее, а типичная задача, по данным Anthropic, обходится примерно на 40% дешевле из-за меньшего количества токенов и шагов.
То есть Opus интересен не только тем, что «умнее». Он стал меньше ходить кругами и делать меньше tool calls для получения результата. Для больших codebase, рефакторинга и автономных агентов это может быть важнее цены одного токена.
🚀 Xiaomi MiMo-V2.6 Pro
Для меня это самый интересный релиз по соотношению характеристик и цены.
Что внутри:
1M context
128K max output
text + image + video + audio
tool calling
open weights
Цена: $0.435 input /$0.87 output.
На Artificial Analysis Intelligence Index Xiaomi указывает 46.32 — сейчас это один из самых сильных результатов среди open-weight моделей.
Но технически интереснее другое: Xiaomi сильно масштабировала RL на реальных agentic-задачах. Для Pro использовали около 750 тыс. trajectories, а DeepSWE v1.1 в процессе RL вырос с 58.4 до 72.6.
То есть open-weight модели начинают догонять закрытые уже не только масштабом pretraining — их серьёзно дожимают через agentic RL.
👀 И ещё важное — Qwen 4
Это уже официально: Alibaba сообщила, что Qwen 4 находится в обучении.
Причём компания уже показала направление развития: Qwen3.8-Max прогнали через месяц автоматического self-improvement — 33 итерации, после чего его Artificial Analysis score вырос с 40 до 45.
Дальше в roadmap — Qwen 4.5 и Qwen 5, где Alibaba говорит уже о масштабе 5–10 трлн параметров.
💡 Мой вывод после сравнения:
Claude Opus 5.5 — ставка на тяжёлые и длинные agentic-задачи.
GPT-6 Sol — сильный компромисс между frontier-возможностями и ценой.
GPT-6 Luna — особенно интересна для массовых агентов и большого числа вызовов.
MiMo V2.6 Pro — наиболее интересный open-weight релиз по цене/возможностям.
Какую модель вы бы протестировали? Делитесь в комментариях! 👇
1❤24👏11🥰10🔥4🤩1
Alice AI Foundation: что Яндекс открыл вместе с весами модели
21 сентября Яндекс опубликовал AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонней LLM.
В модели 48 слоёв.
Часть вычислений выполняют MoE-слои (*mixture of experts*). Вместо одного большого блока в них работают множество небольших «экспертов». Для каждого фрагмента текста модель выбирает 10 из 512 и добавляет один общий. Так разные фрагменты проходят через разные части сети.
Для работы с контекстом чередуются два механизма внимания. Kimi Delta Attention сворачивает историю в состояние фиксированного размера, снижая расход памяти на длинных текстах. Полное внимание позволяет напрямую обращаться к предыдущим фрагментам. Заявленный предел контекста — 262 144 токена.
Это всё ещё базовая модель: финальную настройку на диалог она не проходила.
Модель получила 86,5 балла на WikiWebFacts против 83,2 у DeepSeek-V4-Flash-Base.
Источники: [модель ] · [отчёт Яндекса]
21 сентября Яндекс опубликовал AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонней LLM.
В модели 48 слоёв.
Часть вычислений выполняют MoE-слои (*mixture of experts*). Вместо одного большого блока в них работают множество небольших «экспертов». Для каждого фрагмента текста модель выбирает 10 из 512 и добавляет один общий. Так разные фрагменты проходят через разные части сети.
Для работы с контекстом чередуются два механизма внимания. Kimi Delta Attention сворачивает историю в состояние фиксированного размера, снижая расход памяти на длинных текстах. Полное внимание позволяет напрямую обращаться к предыдущим фрагментам. Заявленный предел контекста — 262 144 токена.
Это всё ещё базовая модель: финальную настройку на диалог она не проходила.
Модель получила 86,5 балла на WikiWebFacts против 83,2 у DeepSeek-V4-Flash-Base.
Источники: [модель ] · [отчёт Яндекса]
1👍5❤4🔥3