Админ тоже сложа руки не сидел, и предлагает вам проголосовать за его идеи, как переименовать Al:
Anonymous Poll
25%
Investment-Burning Intelligence
21%
Trained on Test Intelligence
35%
Token-Maxxing Intelligence
35%
Cost More Than You Intelligence
37%
Can Hack Companies, Can't Color a Button Intelligence
😁137✍12❤11🗿7🔥2🤯1😍1💯1🍓1🤓1
Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base
Модель обучена полностью с нуля, без использования весов сторонних опенсорс-моделей. По метрикам она обходит куда более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super почти по всем направлениям, а среди открытых претрейнов лидирует на IMO AnswerBench и LiveCodeBench. Свою же предыдущую закрытую версию на 235B она обгоняет по фактам, математике, коду и длинному контексту при почти втрое меньшем числе параметров и в семь раз меньшем количестве активных.
Про то, как команда добилась таких результатов, нам удалось послушать на выступлении Екатерины Рединой в субботу на Practical ML Conf. Екатерина работает руководителем группы исследования знаний в службе качества претрейна Alice AI, и вот несколько интересных деталей, которые она раскрыла про процесс претрейна:
1. У команды был собственный scaling law: формула, которая по размеру модели и объему данных предсказывает, какие гиперпараметры (например, batch size) дадут лучший результат. Эта штука максимально важна, потому что перебирать варианты руками слишком дорого.
Чтобы проверить закон, команда обучила модель с вдвое меньшим batch size. Должно было выйти хуже. Но вышло – лучше.
Проблему искали довольно долго, а в итоге она оказалась на поверхности: сам scaling law строился на том, что модели сравнивали по лоссу, но оказалось, что лосс почти не коррелирует с бенчмарками. Все починилось после того, как инженеры пересобрали датасет для эвала.
2. Для обучения использовали оптимизатор Muon – он экономит FLOPs по сравнению с привычным AdamW, но платит за это дорогой операцией: матрицу весов нужно ортогонализовать целиком, а она у них разбита шардами по разным GPU. Значит, перед каждым шагом надо гонять данные по сети: собрать матрицу, обработать, раздать обратно.
Чтобы GPU не простаивали в ожидании, разработчики написали свой конвейер: пока одна группа карт считает ортогонализацию для одной порции весов, другая уже тащит по сети следующую – вычисления и пересылка идут параллельно. Благодаря этой схеме шаг оптимизатора ускорился почти вдвое.
3. Данные были отдельной больной темой: синтетика то и дело подкидывала забавные побочные эффекты – модель могла выучить неправильную ассоциацию всего по одному обучающему примеру. Например, в QA про возраст был скрытый шаблон: живым к ответу приписывали год рождения, а умершим сразу годы жизни. Модель выучила не факт, а сам шаблон, и на вопрос «сколько лет Тарковскому?» вместо возраста выдавала «1932–1986». Фиксили аугментацией.
4. Вместе с моделью в опенсорс выложили два фактологических бенчмарка - WikiWebFacts и HardMultiQAс акцентом на русскоязычный контекст - и протоколы их оценки.
5. AliceAI-Foundation-80B-A3B-Base – это шаг к единой рассуждающей модели (ЕРМ), на которой будут строиться агентские возможности Алисы. За дальнейшими обновлениями и другими новостями от ML-команды Яндекса можно следить в канале @MLunderhood.
Это только часть того, что рассказала Екатерина. Яндекс выпустил большой технический отчет – там подробно расписан весь путь обучения, с абляциями и разборами подводных камней.
Прочитать его полностью можно здесь: https://habr.com/ru/companies/yandex/articles/1083300/
Модель обучена полностью с нуля, без использования весов сторонних опенсорс-моделей. По метрикам она обходит куда более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super почти по всем направлениям, а среди открытых претрейнов лидирует на IMO AnswerBench и LiveCodeBench. Свою же предыдущую закрытую версию на 235B она обгоняет по фактам, математике, коду и длинному контексту при почти втрое меньшем числе параметров и в семь раз меньшем количестве активных.
Про то, как команда добилась таких результатов, нам удалось послушать на выступлении Екатерины Рединой в субботу на Practical ML Conf. Екатерина работает руководителем группы исследования знаний в службе качества претрейна Alice AI, и вот несколько интересных деталей, которые она раскрыла про процесс претрейна:
1. У команды был собственный scaling law: формула, которая по размеру модели и объему данных предсказывает, какие гиперпараметры (например, batch size) дадут лучший результат. Эта штука максимально важна, потому что перебирать варианты руками слишком дорого.
Чтобы проверить закон, команда обучила модель с вдвое меньшим batch size. Должно было выйти хуже. Но вышло – лучше.
Проблему искали довольно долго, а в итоге она оказалась на поверхности: сам scaling law строился на том, что модели сравнивали по лоссу, но оказалось, что лосс почти не коррелирует с бенчмарками. Все починилось после того, как инженеры пересобрали датасет для эвала.
2. Для обучения использовали оптимизатор Muon – он экономит FLOPs по сравнению с привычным AdamW, но платит за это дорогой операцией: матрицу весов нужно ортогонализовать целиком, а она у них разбита шардами по разным GPU. Значит, перед каждым шагом надо гонять данные по сети: собрать матрицу, обработать, раздать обратно.
Чтобы GPU не простаивали в ожидании, разработчики написали свой конвейер: пока одна группа карт считает ортогонализацию для одной порции весов, другая уже тащит по сети следующую – вычисления и пересылка идут параллельно. Благодаря этой схеме шаг оптимизатора ускорился почти вдвое.
3. Данные были отдельной больной темой: синтетика то и дело подкидывала забавные побочные эффекты – модель могла выучить неправильную ассоциацию всего по одному обучающему примеру. Например, в QA про возраст был скрытый шаблон: живым к ответу приписывали год рождения, а умершим сразу годы жизни. Модель выучила не факт, а сам шаблон, и на вопрос «сколько лет Тарковскому?» вместо возраста выдавала «1932–1986». Фиксили аугментацией.
4. Вместе с моделью в опенсорс выложили два фактологических бенчмарка - WikiWebFacts и HardMultiQAс акцентом на русскоязычный контекст - и протоколы их оценки.
5. AliceAI-Foundation-80B-A3B-Base – это шаг к единой рассуждающей модели (ЕРМ), на которой будут строиться агентские возможности Алисы. За дальнейшими обновлениями и другими новостями от ML-команды Яндекса можно следить в канале @MLunderhood.
Это только часть того, что рассказала Екатерина. Яндекс выпустил большой технический отчет – там подробно расписан весь путь обучения, с абляциями и разборами подводных камней.
Прочитать его полностью можно здесь: https://habr.com/ru/companies/yandex/articles/1083300/
❤131👍71😁34🔥18🗿18🤯5🏆4☃1
Data Secrets
Трамп позвонил Дженсену Хуангу, когда тот выступал на сцене All-In Summit, и выдал целую тираду про замедление ИИ (И снова, на всякий случай: это не сгенерировано) Он во всеуслышание заявил, что все предупреждения об опасности ИИ – мошенничество, и все…
Media is too big
VIEW IN TELEGRAM
Дженсен Хуанг: «Прежде чем придумывать новые законы и регуляции для ИИ, нужно сначала применить те, что уже существуют»
В новом интервью CBS News
CEO Nvidia заявил, что призывы глав ИИ-стартапов к замедлению и регуляции – это фикция. Он сказал, что надо «читать между строк»: по его мнению, это не искренний призыв к более строгому надзору, а способ для лабораторий уйти от применения уже действующих законов об ответственности, заменив их на кастомные ИИ-правила, более удобные для них самих.
В качестве примера он привел кибератаки на лаборатории, и сказал, что для этих случаев уже есть законы: о несанкционированном доступе, об ответственности за ущерб, о безопасности продукции. Эти нормы распространяются на все отрасли, и ИИ не должен быть исключением.
Утверждение о том, что из-за ИИ конец человечества может наступить на горизонте 10 лет, он, кстати, также назвал «абсолютно ложным».
В новом интервью CBS News
CEO Nvidia заявил, что призывы глав ИИ-стартапов к замедлению и регуляции – это фикция. Он сказал, что надо «читать между строк»: по его мнению, это не искренний призыв к более строгому надзору, а способ для лабораторий уйти от применения уже действующих законов об ответственности, заменив их на кастомные ИИ-правила, более удобные для них самих.
В качестве примера он привел кибератаки на лаборатории, и сказал, что для этих случаев уже есть законы: о несанкционированном доступе, об ответственности за ущерб, о безопасности продукции. Эти нормы распространяются на все отрасли, и ИИ не должен быть исключением.
Утверждение о том, что из-за ИИ конец человечества может наступить на горизонте 10 лет, он, кстати, также назвал «абсолютно ложным».
😁105👍64❤17 12☃4🗿3👏2🕊2⚡1🍓1
Вышел Grok-4.7
Кратко:
– По уровню: как будто чуть лучше Sol на кодинге и агентских задачах, при этот ощутимо дешевле.
– Это новая, более крупная базовая модель по сравнению с Grok 4.6. Плюс было больше RL-посттрейна, с упором на многочасовые задачи.
– Заявлен «совершенно новый safeguard-стек», названный самым сильным из тестированных xAI по доле отказов и устойчивости к джейлбрейкам.
https://x.ai/news/grok-4-7
P.S. Уже доступно по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/grok-4.7
Кратко:
– По уровню: как будто чуть лучше Sol на кодинге и агентских задачах, при этот ощутимо дешевле.
– Это новая, более крупная базовая модель по сравнению с Grok 4.6. Плюс было больше RL-посттрейна, с упором на многочасовые задачи.
– Заявлен «совершенно новый safeguard-стек», названный самым сильным из тестированных xAI по доле отказов и устойчивости к джейлбрейкам.
https://x.ai/news/grok-4-7
P.S. Уже доступно по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/grok-4.7
❤91👍42🔥24😁11🤓5🗿3☃2🎉1💯1🤝1
OpenAI объявили, что их внутренняя модель, которую они начали обучать меньше месяца назад, уже решила более 100 открытых математических задач
Как сообщается в посте, «темп удивил даже штатных математиков стартапа». На фоне этого OpenAI создает независимую консультативную группу по математике и ИИ, чтобы наладить диалог с математическим сообществом.
Это будет группа ученых при Institute for Advanced Study, и их роль сводится к тому, чтобы доносить результаты ИИ в математике до сообщества: оценивать их, курировать публикацию, следить за соответствием научным и профессиональным стандартам.
Группа не будет получать от OpenAI финансирование, имеет право публично комментировать влияние OpenAI на математику и самостоятельно определяет свой состав.
Как сообщается в посте, «темп удивил даже штатных математиков стартапа». На фоне этого OpenAI создает независимую консультативную группу по математике и ИИ, чтобы наладить диалог с математическим сообществом.
Это будет группа ученых при Institute for Advanced Study, и их роль сводится к тому, чтобы доносить результаты ИИ в математике до сообщества: оценивать их, курировать публикацию, следить за соответствием научным и профессиональным стандартам.
Группа не будет получать от OpenAI финансирование, имеет право публично комментировать влияние OpenAI на математику и самостоятельно определяет свой состав.
😁164 59👍29❤17🔥5🤯5🍾2 2❤🔥1💯1😎1
Уходить из найма ради стартапа — плохой вариант
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
Реклама: ИП Зуев Игорь Владимирович, ИНН: 360408359441, Erid: 2VtzqxjMMTJ
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
Реклама: ИП Зуев Игорь Владимирович, ИНН: 360408359441, Erid: 2VtzqxjMMTJ
😁50🗿27❤4🍾4👍2🍓2
Alibaba готовит модель на 10T параметров
Компания рассказала о планах на следующие поколения моделей: Qwen 4 уже находится в обучении, а Qwen 4.5 и Qwen 5 планируют масштабировать до 5–10 триллионов параметров. Для сравнения, нынешний Qwen 3.8 Max содержит 2.4 триллиона параметров.
Параллельно Alibaba представила новый AI-чип Zhenwu V900, который в три раза производительнее прошлого поколения. На его базе компания планирует строить кластеры до 500 тысяч GPU, а к 2032 году довести мощность своих дата-центров до 20 ГВт.
https://www.reuters.com/business/retail-consumer/alibaba-plans-ai-model-with-5-trillion-10-trillion-parameters-unveils-new-chip-2026-09-22/
Компания рассказала о планах на следующие поколения моделей: Qwen 4 уже находится в обучении, а Qwen 4.5 и Qwen 5 планируют масштабировать до 5–10 триллионов параметров. Для сравнения, нынешний Qwen 3.8 Max содержит 2.4 триллиона параметров.
Параллельно Alibaba представила новый AI-чип Zhenwu V900, который в три раза производительнее прошлого поколения. На его базе компания планирует строить кластеры до 500 тысяч GPU, а к 2032 году довести мощность своих дата-центров до 20 ГВт.
https://www.reuters.com/business/retail-consumer/alibaba-plans-ai-model-with-5-trillion-10-trillion-parameters-unveils-new-chip-2026-09-22/
🔥86❤67 32👍13🤯6🤩5😁4💯3⚡2🍓1
Релиз дня: MiMo-2.6 от Xiaomi
Внезапно, это, кажется, новая открытая SOTA. Версия Pro, по словам разработчиков, работает на уровне Claude Opus 5 и GPT-5.6 Sol в большинстве агентных бенчмарков (она набрала 46 баллов в Artificial Analysis Intelligence Index).
Архитектурно это MoE, 1.02В параметров и 42В активных, с гибридным вниманием и 5-слойным MTP спекулятивным декодером (это значит, что модель предполагает сразу несколько токенов вперед, а затем проверяет их валидность параллельно: техника дает хороший прирост к скорости).
Контекст до 1 миллиона токенов, нативная мультимодальность.
Отдельное внимание привлекает масштаб RL: 750 000 RL-траекторий по кодингу, зрению и CFT-задачам, полностью асинхронный GRPO, когда модель параллельно пробует 16 разных путей решения для каждой задачи, и 7000+ RL-окружений для агентов, которые тоже выложили в опенсорс.
При этом обучение обошлось всего в три миллиона долларов благодаря тому, что гоняли все на верифицируемых задачах без разметки.
Цена тоже не может не радовать:
- Pro $0,435 / M input, $0,87 / M output
- Flash $0,14 / M input, $0,28. / M output
Веса | Техотчет | Блог
Внезапно, это, кажется, новая открытая SOTA. Версия Pro, по словам разработчиков, работает на уровне Claude Opus 5 и GPT-5.6 Sol в большинстве агентных бенчмарков (она набрала 46 баллов в Artificial Analysis Intelligence Index).
Архитектурно это MoE, 1.02В параметров и 42В активных, с гибридным вниманием и 5-слойным MTP спекулятивным декодером (это значит, что модель предполагает сразу несколько токенов вперед, а затем проверяет их валидность параллельно: техника дает хороший прирост к скорости).
Контекст до 1 миллиона токенов, нативная мультимодальность.
Отдельное внимание привлекает масштаб RL: 750 000 RL-траекторий по кодингу, зрению и CFT-задачам, полностью асинхронный GRPO, когда модель параллельно пробует 16 разных путей решения для каждой задачи, и 7000+ RL-окружений для агентов, которые тоже выложили в опенсорс.
При этом обучение обошлось всего в три миллиона долларов благодаря тому, что гоняли все на верифицируемых задачах без разметки.
Цена тоже не может не радовать:
- Pro $0,435 / M input, $0,87 / M output
- Flash $0,14 / M input, $0,28. / M output
Веса | Техотчет | Блог
🔥117❤22🤯9☃3😁3🏆3😢2🤔1🕊1 1
Data Secrets
Трамп собрался переименовать Artificial Intelligence в один из других, «более подходящих» вариантов: Supreme Intelligence (Высший разум) Superior Intelligence (Превосходный разум) Extreme Intelligence (Исключительный разум) Сейчас в X он запускает уже…
В голосовании Трампа победил термин «Superior Intelligence» (кратко: Super Intelligence)
И если вы думали, что это все понарошку, то вы ошиблись: Трамп на Генассамблее ООН официально заявил, что ИИ теперь будет называться суперинтеллектом. Во всех документах теперь также будет использоваться слово super вместо artificial.
И если вы думали, что это все понарошку, то вы ошиблись: Трамп на Генассамблее ООН официально заявил, что ИИ теперь будет называться суперинтеллектом. Во всех документах теперь также будет использоваться слово super вместо artificial.
😁73 23⚡4👍3❤🔥2❤1🔥1🍾1🫡1🗿1🦄1
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥129 46👍12❤4😁3☃2🕊2😍2🤗2 1
Итак, новый Opus-5.5, сводка:
– Уровень, сопоставимый с Fable 5.1 и Astra. Превосходит обе модели на Terminal-Bench, Cursor-Bench и многих других.
– Стоит меньше, чем Opus 5! $4/M input и $20/М output (было $5 и $25), и тратит меньше токенов на задачи.
– Генерирует выходы на 30% быстрее Opus 5.
– Обещают более естественное общение и лучшее форматирование ответов.
– В Pro и Max увеличили пятичасовые лимиты. Плюс, всем пользователям с подпиской дали один сброс, которым можно воспользоваться в любое время.
https://anthropic.com/claude-opus-5-5
– Уровень, сопоставимый с Fable 5.1 и Astra. Превосходит обе модели на Terminal-Bench, Cursor-Bench и многих других.
– Стоит меньше, чем Opus 5! $4/M input и $20/М output (было $5 и $25), и тратит меньше токенов на задачи.
– Генерирует выходы на 30% быстрее Opus 5.
– Обещают более естественное общение и лучшее форматирование ответов.
– В Pro и Max увеличили пятичасовые лимиты. Плюс, всем пользователям с подпиской дали один сброс, которым можно воспользоваться в любое время.
https://anthropic.com/claude-opus-5-5
👍68❤🔥35🔥25❤12🤗2☃1⚡1😁1