⚪️ Релиз MiniMax M3.1 Flash (preview)
Полку флешей вновь прибыло. Минимакс всегда был середнячком, не китовым фронтиром. Зато дёшево, и более-менее по качеству.
Что видно нынче. А мало чего! Бенчмарков при релизе не огласили, что необычно. Скорость инференса - неплохая, есть отчёты про 90-150 tps.
Желающие могут попробовать. Акции - ресет на токенпланах и какое то количество бесплатных кредитов ежедневно, временно х2 больше (в комменты кину промо картинку про акции ⬇️)
Кстати - стелс модель Space Bunny возможно им и был!
@deksden_notes
Полку флешей вновь прибыло. Минимакс всегда был середнячком, не китовым фронтиром. Зато дёшево, и более-менее по качеству.
Что видно нынче. А мало чего! Бенчмарков при релизе не огласили, что необычно. Скорость инференса - неплохая, есть отчёты про 90-150 tps.
Желающие могут попробовать. Акции - ресет на токенпланах и какое то количество бесплатных кредитов ежедневно, временно х2 больше (в комменты кину промо картинку про акции ⬇️)
Кстати - стелс модель Space Bunny возможно им и был!
@deksden_notes
👍4❤3
⚪️ Зайки патчат доверие
После инцидента с "zcode крадёт мои репозитории!" (к слову - буквально копирующем инцидент с грок билдом), зайки скопировали и реакцию - zcode был открыт, и мы получили редкую штуку в опенсорс - десктопного агента.
Чтобы развить тему "We are sorry", проводится акция в честь восстановления доверия.
Во-первых, официальный клиент и открыты код проекта синхронизируются.
Во вторых, обещают больше ничего не тырить.
И в качестве бонуса:
• насыпают много ресетов (у меня уже 12 штук, 5h и недельных!)
• дают по 100м токенов бесплатно ежедневно до 07 октября).
(ц) кмк, неплохо за наш потыренный слоп
—-
Upd 1️⃣ : Доп бонус: до 7 октября работа ГЛМ моделей в пиковые часы будет тарифицироваться обычным коэффициентом, не пиковым
@deksden_notes
После инцидента с "zcode крадёт мои репозитории!" (к слову - буквально копирующем инцидент с грок билдом), зайки скопировали и реакцию - zcode был открыт, и мы получили редкую штуку в опенсорс - десктопного агента.
Чтобы развить тему "We are sorry", проводится акция в честь восстановления доверия.
Во-первых, официальный клиент и открыты код проекта синхронизируются.
Во вторых, обещают больше ничего не тырить.
И в качестве бонуса:
• насыпают много ресетов (у меня уже 12 штук, 5h и недельных!)
• дают по 100м токенов бесплатно ежедневно до 07 октября).
(ц) кмк, неплохо за наш потыренный слоп
—-
Upd 1️⃣ : Доп бонус: до 7 октября работа ГЛМ моделей в пиковые часы будет тарифицироваться обычным коэффициентом, не пиковым
@deksden_notes
🔥11😁3❤1
⚪️ OpenCode Go Plus
Новости подписок. Опенкод представил новую подписку Plus за $40. Это x4 к текущей цене.
Релиз на мой взгляд максимально странный.
🔗 Смотрите сами : https://opencode.ai/go
Если usage на обычном go составляет в месяц $15, то на Go Plus будет $60, что логично.
Но $60 превращаются в $120 - получается всего x2 использования при x4 цены... wtf?!
Что бы это значило? Go в ближайшее понерфят? Зачем Плюс сейчас
(ц) ничего не понял
@deksden_notes
Новости подписок. Опенкод представил новую подписку Plus за $40. Это x4 к текущей цене.
Релиз на мой взгляд максимально странный.
🔗 Смотрите сами : https://opencode.ai/go
Если usage на обычном go составляет в месяц $15, то на Go Plus будет $60, что логично.
Но $60 превращаются в $120 - получается всего x2 использования при x4 цены... wtf?!
Что бы это значило? Go в ближайшее понерфят? Зачем Плюс сейчас
(ц) ничего не понял
@deksden_notes
😁6
⚪️ Ризонинг в апи OpenAI
Тут исследовали сколько juice можно дать в api по сравнению с тем, сколько дают в кодексе.
И в апи - сильно-сильно больше.
"за деньги - да!"
(ц) Логично, в принципе.
@deksden_notes
Тут исследовали сколько juice можно дать в api по сравнению с тем, сколько дают в кодексе.
И в апи - сильно-сильно больше.
"за деньги - да!"
(ц) Логично, в принципе.
@deksden_notes
👍4🤔3
⚪️ Sonnet 5.5
Понедельник продолжился слегка неожиданно. Антропики релизнули соннета 5.5, не стали портить завтра клозедам их Dev Days. Молодцы, уважаю когда могут не опускаться до намеренных пакостей.
🔗 Бложик : https://www.anthropic.com/claude-sonnet-5-5
Что про модель - она всем лучше Соннета 5, что не очень сложно, так как про Соннет 5 существует устойчивое мнение как про не очень хороший релиз. Модель была довольно дорогая для своих скромных показателей.
Надежды, что оптимизация как в Опуск 5.5 приведёт к падению цены, не особо оправдались - номинальная цена токенов прежняя. Зато заявлено, что новый Соннет на 30% экономнее по токенам, что его заметно удешевит при реальном использовании. А ещё он стал быстрее на 30%! Nice.
Бенчмарки кину в комменты, как обычно - но там картина ожидаемая: всем лучше соннета 5 и строго скромнее опуса 5.5. С астрой сравнения не, с солом 6 - по немногоичсленным имеющимся бенчам сильнее. Подождём независимых бенчей, интересно - что в этом поколении. Я ожидаю что у антропиков появится мощная связка в виде оркестратора/планировщика опуса и воркера соннета. Фубля - только оракл для супер-сложных вопросов. Такой сетап представляется весьма годным, особенно если лимиты будут позволять нормально работать на средних и дорогих подписках. Сейчас вопрос лимитов в подписках один из самых важных - мало давать самую умную модель, желательно ещё давать ею работать по подписке и не 1 день в неделю на самом дорогом тире.
Замечу, что через несколько недель анонсирован релиз Хайку 5.5! Наконец то обновят её. Тоже любопытно - дотянет ли она до уровня воркера на простые задачи, аналогично Луне - или останется мелкой моделью на технические задачки.
(ц) фронтир двигается!
@deksden_notes
Понедельник продолжился слегка неожиданно. Антропики релизнули соннета 5.5, не стали портить завтра клозедам их Dev Days. Молодцы, уважаю когда могут не опускаться до намеренных пакостей.
🔗 Бложик : https://www.anthropic.com/claude-sonnet-5-5
Что про модель - она всем лучше Соннета 5, что не очень сложно, так как про Соннет 5 существует устойчивое мнение как про не очень хороший релиз. Модель была довольно дорогая для своих скромных показателей.
Надежды, что оптимизация как в Опуск 5.5 приведёт к падению цены, не особо оправдались - номинальная цена токенов прежняя. Зато заявлено, что новый Соннет на 30% экономнее по токенам, что его заметно удешевит при реальном использовании. А ещё он стал быстрее на 30%! Nice.
Бенчмарки кину в комменты, как обычно - но там картина ожидаемая: всем лучше соннета 5 и строго скромнее опуса 5.5. С астрой сравнения не, с солом 6 - по немногоичсленным имеющимся бенчам сильнее. Подождём независимых бенчей, интересно - что в этом поколении. Я ожидаю что у антропиков появится мощная связка в виде оркестратора/планировщика опуса и воркера соннета. Фубля - только оракл для супер-сложных вопросов. Такой сетап представляется весьма годным, особенно если лимиты будут позволять нормально работать на средних и дорогих подписках. Сейчас вопрос лимитов в подписках один из самых важных - мало давать самую умную модель, желательно ещё давать ею работать по подписке и не 1 день в неделю на самом дорогом тире.
Замечу, что через несколько недель анонсирован релиз Хайку 5.5! Наконец то обновят её. Тоже любопытно - дотянет ли она до уровня воркера на простые задачи, аналогично Луне - или останется мелкой моделью на технические задачки.
(ц) фронтир двигается!
@deksden_notes
🔥12❤5👍3
⚪️ Unsloth Desktop (beta) - опенсорс десктоп агент
Редкая штука у нас появилась! Новый десктоп агент. CLI агентов с открытым кодом немало, даже вендорских, а из десктопов - ZCode можно только вспомнить.
Теперь и Unsloth выпустили свой агент, ещё и с уникальными фичами, который умеет не только агентом поработать, но и делать тренировку моделек! Весьма кучерявая штука
Фич довольно много:
• работает как на локальных моделях, так и на подписках от вендоров
• есть и веб-поиск, и deep research встроенный (!)
• нормальная многоплатформенность - win / mac / linux (и wsl)
• умеет в аудио/видео/картинки
• есть approve for me
• может работать на мобилке через бесплатный туннель CF
• поддерживает генерацию аудио, видео, картинок
• поддерживает обучение моделей
🔗 Дока : https://unsloth.ai/docs/desktop
🔗 Гитхаб : https://github.com/unslothai/unsloth
Сам код - питон и немного TS
За линк грац - @Bulat_Ziganshin
(ц) Отличное начинение!
@deksden_notes
Редкая штука у нас появилась! Новый десктоп агент. CLI агентов с открытым кодом немало, даже вендорских, а из десктопов - ZCode можно только вспомнить.
Теперь и Unsloth выпустили свой агент, ещё и с уникальными фичами, который умеет не только агентом поработать, но и делать тренировку моделек! Весьма кучерявая штука
Фич довольно много:
• работает как на локальных моделях, так и на подписках от вендоров
• есть и веб-поиск, и deep research встроенный (!)
• нормальная многоплатформенность - win / mac / linux (и wsl)
• умеет в аудио/видео/картинки
• есть approve for me
• может работать на мобилке через бесплатный туннель CF
• поддерживает генерацию аудио, видео, картинок
• поддерживает обучение моделей
🔗 Дока : https://unsloth.ai/docs/desktop
🔗 Гитхаб : https://github.com/unslothai/unsloth
Сам код - питон и немного TS
За линк грац - @Bulat_Ziganshin
(ц) Отличное начинение!
@deksden_notes
👍12❤5🔥2
⚪️ Back to Business
Решил тут порефлексировать над анонсом от Тибо по поводу подписки $200 от клозедов.
▶️ Докладываю, кто не в курсе: давеча Тибо написал лонгрид про то, что подписка за $200 возвращается, но в ней будет на 50% меньше компьюта. И, типа, это всё к лучшему - потому что модели будут лучше, работы сделаете ею даже больше и прочие причёсывания ушей. (мем с кланяющемся пингвином)
👉 Мысли: любая халява заканчивается, это закон природы. Подпитска за $200 которая давала $14k по апи-ценам это, конечно, одна из таких халяв. Курсор тоже в своё время раздавал usage на деньги инвесторов, но прекратил это делать (и продался за $60b, что говорит об успешности подхода). У chatgpt тоже были набраны рекордное количество подписчиков, что даже у клозедов кончился компьют и продажи подписок за $200 свернули.
Думаю, новый премиум-тир подписки с значительным usage будет $500 (х30?), тир за $200 будет обычным рабочим тиром (х10), тир за $100 будет дешёвым пол-профессиональным тиром на "немного" поработать, а тир за $20 будет платным пробным триалом.
К этому шло давно, потому как много подписок свелось просто к коэффициентам на апи цены. Типа, бонус за опт/регулярность. Тот же opencode go за $10 даёт $15-60 в апи ценах. С такой точки зрения $7k за $200 выглядит более-менее щедрым, если забыть что цены на апи у клозедов таки тоже весьма премиум, в сравнении с Китаем.
Надеюсь, и Киты (тот же мега-оптимизированный дипсик со своим волшебным кешем, да и в целом плеяда недорогих и быстрых флешей приличного качества), и Антропики с новым Клодом 5.5 должны весьма заметно ушатать клозедов, и политика может быть пересмотрена. Работать даже на старом лимите в колексе, даже с эпизодическим фронтиром (астрой) и воркером на сол было невозможно.
Жду что эта пена отстоится, но пока это всё довольно грустно.
Да, можно сходить к клоду - там опус 5.5 весьма удачен, соннет 5.5 пока не совсем ясно. Но там свои грабли в виде бан-хаммера, и в целом тоже не "улейся" использования на подписке.
Мне нужна подписка на нормальные модели, которая тянет 2-3 потока агентов в режиме 10-12 часов в день минимум. Лучше чтобы 1-2 в круглосуточном режиме. Такое щас у китайцев с флешами и моделями поумнее на задачи посложнее, а хочется таки немного фронтира на сложные вопросы.
В общем, наблюдаем очередной переломным момент в отрасли. Будем смотреть чем кончится дело, "на чём сердце успокоится". Отрасль взрослеет на глазах.
@deksden_notes
Решил тут порефлексировать над анонсом от Тибо по поводу подписки $200 от клозедов.
▶️ Докладываю, кто не в курсе: давеча Тибо написал лонгрид про то, что подписка за $200 возвращается, но в ней будет на 50% меньше компьюта. И, типа, это всё к лучшему - потому что модели будут лучше, работы сделаете ею даже больше и прочие причёсывания ушей. (мем с кланяющемся пингвином)
👉 Мысли: любая халява заканчивается, это закон природы. Подпитска за $200 которая давала $14k по апи-ценам это, конечно, одна из таких халяв. Курсор тоже в своё время раздавал usage на деньги инвесторов, но прекратил это делать (и продался за $60b, что говорит об успешности подхода). У chatgpt тоже были набраны рекордное количество подписчиков, что даже у клозедов кончился компьют и продажи подписок за $200 свернули.
Думаю, новый премиум-тир подписки с значительным usage будет $500 (х30?), тир за $200 будет обычным рабочим тиром (х10), тир за $100 будет дешёвым пол-профессиональным тиром на "немного" поработать, а тир за $20 будет платным пробным триалом.
К этому шло давно, потому как много подписок свелось просто к коэффициентам на апи цены. Типа, бонус за опт/регулярность. Тот же opencode go за $10 даёт $15-60 в апи ценах. С такой точки зрения $7k за $200 выглядит более-менее щедрым, если забыть что цены на апи у клозедов таки тоже весьма премиум, в сравнении с Китаем.
Надеюсь, и Киты (тот же мега-оптимизированный дипсик со своим волшебным кешем, да и в целом плеяда недорогих и быстрых флешей приличного качества), и Антропики с новым Клодом 5.5 должны весьма заметно ушатать клозедов, и политика может быть пересмотрена. Работать даже на старом лимите в колексе, даже с эпизодическим фронтиром (астрой) и воркером на сол было невозможно.
Жду что эта пена отстоится, но пока это всё довольно грустно.
Да, можно сходить к клоду - там опус 5.5 весьма удачен, соннет 5.5 пока не совсем ясно. Но там свои грабли в виде бан-хаммера, и в целом тоже не "улейся" использования на подписке.
Мне нужна подписка на нормальные модели, которая тянет 2-3 потока агентов в режиме 10-12 часов в день минимум. Лучше чтобы 1-2 в круглосуточном режиме. Такое щас у китайцев с флешами и моделями поумнее на задачи посложнее, а хочется таки немного фронтира на сложные вопросы.
В общем, наблюдаем очередной переломным момент в отрасли. Будем смотреть чем кончится дело, "на чём сердце успокоится". Отрасль взрослеет на глазах.
@deksden_notes
😢12👍9❤7
⚪️ Мысли перед Dev Day
В 20:00 мск сегодня у клозедов начинается презентация их эвента - Dev Days 2026.
▶️ Плохие новости о нерфе Pro подписок за $200 они объявили заблаговременно, народ потихоньку переваривает. Де факто, убран премиум коэффициент. Если Plus был 1X, и Pro-100 было 5X, то раньше Pro-200 был премиум и давал 20X. Теперь всё по математике - 10X. Выходит, тир за 200 уже не премиум!
Если на dev day будет презентована новая подписка за $500, то она станет новым премиум компании? Там будет повышающий коэффициент? Математика говорит про 25X. Дадут 30X? 40X? Или компьюта мало и будет голая математика и 25X? Ладно, это гадания на токенах
▶️ А вот с основной моделью - тоже вопросики. Да, сол 6 и луна 6 были значительно удешевлены, теперь на подписке за 200 оно живёт не 2 дня, а подольше. Но у меня упорно получается дней 5, не более, причём в комбинации чуть-чуть astra и sol как воркер. Модели, которая имеет средний уровень ума и работает номрально в пределах подписки у клозедов сейчас нету. А вот антропики имеют в активе весьма удачный опус 5.5, который ещё и довольно лоялен к лимитам! Эту проблему могла бы решить или Астра 6.1/Астра Лайт сильно дешевле оригинальной Астры, или Сол 6.1 (поумнее и немного поэкономнее). Но в условиях нерфа подписки до 10Х вместо 20Х проблема вновь обостряется радикально... Получается некий тупик в предложении клозедов: работать толком нечем. И астра вроде бы ничего, но её прожорливость по лимитам.. А сол недотягивает до фронтира. Пичаль...
Клозеды устами Тибо обещают какие то плюшки, которые всё скрасят и помогут - посмотрим. Не представляю чтобы это могло быть!
▶️ Агент для работы 24/7? В облаке? Их есть у меня, не сложно поднять крабобота/гермеса в облаке, есть Грок Бот, есть китайские предложения. Кажется, не тянет на киллер-фичу, но штука, в принципе, удобная. Презентуют - и хорошо.
▶️ Облачный кодинговый агент? Сварм облачных воркеров? Интересно было бы, особенно если будут норм лимиты. Я бы разгрузил ноут - у меня 24/7 болтается 1-2 сессии, а свой оркестратор не допилен до готовности (хотя ковыряю потихоньку) - но я уверен что вендоры уже готовят свои платформы.
▶️ Новая очень умная модель? Любопытно, но Астра уже покрывает почти все запросы, а задач для очень-очень умной модели не так много. Архитектура и решения верхнего уровня может быть! И аудит работы моделей попроще.. Да, интересно, было бы приятно - но не поменяет ситуацию с неясностью как работать подписками клозедов. Она же будет ещё и "дорогая" в использовании! То есть усугубит проблему.
▶️ В общем, я заинтригован, конечно, и буду смотреть презентацию внимательно..
@deksden_notes
В 20:00 мск сегодня у клозедов начинается презентация их эвента - Dev Days 2026.
▶️ Плохие новости о нерфе Pro подписок за $200 они объявили заблаговременно, народ потихоньку переваривает. Де факто, убран премиум коэффициент. Если Plus был 1X, и Pro-100 было 5X, то раньше Pro-200 был премиум и давал 20X. Теперь всё по математике - 10X. Выходит, тир за 200 уже не премиум!
Если на dev day будет презентована новая подписка за $500, то она станет новым премиум компании? Там будет повышающий коэффициент? Математика говорит про 25X. Дадут 30X? 40X? Или компьюта мало и будет голая математика и 25X? Ладно, это гадания на токенах
▶️ А вот с основной моделью - тоже вопросики. Да, сол 6 и луна 6 были значительно удешевлены, теперь на подписке за 200 оно живёт не 2 дня, а подольше. Но у меня упорно получается дней 5, не более, причём в комбинации чуть-чуть astra и sol как воркер. Модели, которая имеет средний уровень ума и работает номрально в пределах подписки у клозедов сейчас нету. А вот антропики имеют в активе весьма удачный опус 5.5, который ещё и довольно лоялен к лимитам! Эту проблему могла бы решить или Астра 6.1/Астра Лайт сильно дешевле оригинальной Астры, или Сол 6.1 (поумнее и немного поэкономнее). Но в условиях нерфа подписки до 10Х вместо 20Х проблема вновь обостряется радикально... Получается некий тупик в предложении клозедов: работать толком нечем. И астра вроде бы ничего, но её прожорливость по лимитам.. А сол недотягивает до фронтира. Пичаль...
Клозеды устами Тибо обещают какие то плюшки, которые всё скрасят и помогут - посмотрим. Не представляю чтобы это могло быть!
▶️ Агент для работы 24/7? В облаке? Их есть у меня, не сложно поднять крабобота/гермеса в облаке, есть Грок Бот, есть китайские предложения. Кажется, не тянет на киллер-фичу, но штука, в принципе, удобная. Презентуют - и хорошо.
▶️ Облачный кодинговый агент? Сварм облачных воркеров? Интересно было бы, особенно если будут норм лимиты. Я бы разгрузил ноут - у меня 24/7 болтается 1-2 сессии, а свой оркестратор не допилен до готовности (хотя ковыряю потихоньку) - но я уверен что вендоры уже готовят свои платформы.
▶️ Новая очень умная модель? Любопытно, но Астра уже покрывает почти все запросы, а задач для очень-очень умной модели не так много. Архитектура и решения верхнего уровня может быть! И аудит работы моделей попроще.. Да, интересно, было бы приятно - но не поменяет ситуацию с неясностью как работать подписками клозедов. Она же будет ещё и "дорогая" в использовании! То есть усугубит проблему.
▶️ В общем, я заинтригован, конечно, и буду смотреть презентацию внимательно..
@deksden_notes
👍8🔥5❤1
⚪️ Codex Reset (Banked)
Кто не заметил на презентации DevDay или не смотрел - напомню, что нам раздали банковый ручной ресет на аккаунты.
У меня везде на платные тарифы уже давно прилетел - и на Плюсы, и на Про
@deksden_notes
Кто не заметил на презентации DevDay или не смотрел - напомню, что нам раздали банковый ручной ресет на аккаунты.
У меня везде на платные тарифы уже давно прилетел - и на Плюсы, и на Про
@deksden_notes
👍16😴3
⚪️ DevDay 2026 - впечатления
Наверное, надо написать мои впечатления по итогам заглавной презентации. Впечатления разные.
▶️ Dots: Да, действительно - это агент от клозедов. Раскатают только на US аккаунтах, надеюсь мне останется, тогда и посомтрим. Но в целом - не особо удивительная штука после крабобота, гермеса, грок бота, муся бота.
▶️ Spaces: канвас на максималках, в облаке, коллаборативный. Ну ок. Осталось понять - зачем оно и чем удобно. Не исключаю, что удобно и полезно
▶️ GPT 6.1 Sol: ну - это праздник какой то! Наконец нормальный сол, который больше похож на астру-лайт. Оч круто, особенно по такой цене (что отражается на тратах лимита прежде всего). С такой моделью нерф подписки за 200 становится менее болезненным.
▶️ Ultrafast: это в подписке за 500, которая - зачем? побаловаться? может, при случае
▶️ Кодекс в облаке: настраиваю. Пока не понял чего там по лимитам, как отразится и насколько удобно. Не исключаю что очень удобно, если не так дорого будет.
▶️ Codex CLI обновки: надо разбираться, там есть интересное. Например, новый /agents
▶️ Decisions API: меня очень заинтересовал - это же тот же Jev, но на базе мультиязычной, мультимодальной модели, что мне прям надо. А его и не дают - превью кое кому, релиза пока нету, документации нет. Облом. Ждём-с, очень
▶️ Plugins: наверное, нужная штука, но я пока не дошёл
▶️ Pro-500: подписка за 500 - и гадания подтвердили самый консервативный вариант, премиум коэффициентов больше нет, X25 использования, как и положено по математике. Дадут Ультрафаст, что забавно
Пожалуй, всё что запоминлось..
@deksden_notes
Наверное, надо написать мои впечатления по итогам заглавной презентации. Впечатления разные.
▶️ Dots: Да, действительно - это агент от клозедов. Раскатают только на US аккаунтах, надеюсь мне останется, тогда и посомтрим. Но в целом - не особо удивительная штука после крабобота, гермеса, грок бота, муся бота.
▶️ Spaces: канвас на максималках, в облаке, коллаборативный. Ну ок. Осталось понять - зачем оно и чем удобно. Не исключаю, что удобно и полезно
▶️ GPT 6.1 Sol: ну - это праздник какой то! Наконец нормальный сол, который больше похож на астру-лайт. Оч круто, особенно по такой цене (что отражается на тратах лимита прежде всего). С такой моделью нерф подписки за 200 становится менее болезненным.
▶️ Ultrafast: это в подписке за 500, которая - зачем? побаловаться? может, при случае
▶️ Кодекс в облаке: настраиваю. Пока не понял чего там по лимитам, как отразится и насколько удобно. Не исключаю что очень удобно, если не так дорого будет.
▶️ Codex CLI обновки: надо разбираться, там есть интересное. Например, новый /agents
▶️ Decisions API: меня очень заинтересовал - это же тот же Jev, но на базе мультиязычной, мультимодальной модели, что мне прям надо. А его и не дают - превью кое кому, релиза пока нету, документации нет. Облом. Ждём-с, очень
▶️ Plugins: наверное, нужная штука, но я пока не дошёл
▶️ Pro-500: подписка за 500 - и гадания подтвердили самый консервативный вариант, премиум коэффициентов больше нет, X25 использования, как и положено по математике. Дадут Ультрафаст, что забавно
Пожалуй, всё что запоминлось..
@deksden_notes
👍12❤🔥3🔥3🤣3❤1
Forwarded from Записки CPU designer'a
Уже влезли в долги, чтобы наскрести на подписку ChatGPT за 500$?
Пока убеждаете друзей занять вам денег, чтобы за две недели навайбить убийцу Nvidia, самое время разобраться, что же такое Cerebras и почему именно их железо внезапно оказалось настолько интересным для LLM-инференса.
Забавно, что изначально Cerebras в первую очередь пытались решить задачу обучения нейросетей.
И, если верить довольно жёсткому разбору Irrational Analysis, именно с training всё получилось не очень хорошо. Архитектура получилась сильно перекошенной: внутри самого WSE пропускная способность огромная, но канал обмена с внешней памятью и другими устройствами относительно узкий. Поэтому для обучения Cerebras приходилось дополнять WSE внешними системами MemoryX и SwarmX, а ограниченный внешний I/O становился одним из главных bottleneck'ов.
А что вообще такое WSE, MemoryX и SwarmX и как всё это устроено, читайте в отчёте Irrational Analysis.
А вот с инференсом всё оказалось гораздо интереснее.
Cerebras довольно самобытная архитектура. Вместо относительно классической связки GPU с расположенной рядом HBM они буквально делают процессор размером почти с целую кремниевую пластину, Wafer-Scale Engine. WSE-3 содержит около 900 тысяч маленьких ядер, у каждого из которых есть локальный SRAM и простые SIMD-блоки. В сумме получается примерно 44 GB SRAM прямо на wafer.
И вот для inference это оказалось очень интересной комбинацией. Обычный GPU при генерации токенов во многом упирается в необходимость постоянно читать веса модели из HBM.
У Cerebras веса и KV-cache можно держать прямо в SRAM рядом с вычислительными ядрами, а слои модели распределять по WSE. Если одного WSE не хватает, модель распределяется между несколькими. Каждый хранит свою часть модели и передаёт следующему только промежуточный результат вычислений, а не сами веса. Благодаря этому веса остаются в быстром локальном SRAM, а между WSE нужно передавать сравнительно небольшой объём данных. Отсюда и очень высокая скорость генерации.
То есть архитектура, которая довольно странно выглядела как конкурент Nvidia в training, неожиданно нашла свою сильную сторону именно там, где сегодня особенно ценится latency: ультрабыстрый LLM inference.
Но silver bullet из Cerebras всё равно не получился. Вопрос, как оптимальнее всего строить железо для LLM inference, сегодня всё ещё открыт. Одна из главных проблем Cerebras в том, что объём SRAM нельзя наращивать так же легко, как внешнюю память, а большие модели и длинный контекст требуют всё больше памяти. В итоге приходится использовать больше WSE, и впечатляющая скорость начинает обходиться всё дороже с точки зрения масштабирования всей системы. Сам отчёт отдельно отмечает, что KV-cache и веса конкурируют за один и тот же ограниченный SRAM, а с ростом размера модели экономика такого подхода становится всё сложнее.
Но сам инженерный подход всё равно совершенно безумный и очень интересный.
Кстати, если вы забыли, какого размера «чип» у Cerebras, приложу фотку в комментариях.
P.S. Пост чуть больше чем полностью построен на отчёте Irrational Analysis. Обязательно ознакомьтесь с ним, невероятно увлекательный и познавательный разбор.
Пока убеждаете друзей занять вам денег, чтобы за две недели навайбить убийцу Nvidia, самое время разобраться, что же такое Cerebras и почему именно их железо внезапно оказалось настолько интересным для LLM-инференса.
Забавно, что изначально Cerebras в первую очередь пытались решить задачу обучения нейросетей.
И, если верить довольно жёсткому разбору Irrational Analysis, именно с training всё получилось не очень хорошо. Архитектура получилась сильно перекошенной: внутри самого WSE пропускная способность огромная, но канал обмена с внешней памятью и другими устройствами относительно узкий. Поэтому для обучения Cerebras приходилось дополнять WSE внешними системами MemoryX и SwarmX, а ограниченный внешний I/O становился одним из главных bottleneck'ов.
А что вообще такое WSE, MemoryX и SwarmX и как всё это устроено, читайте в отчёте Irrational Analysis.
А вот с инференсом всё оказалось гораздо интереснее.
Cerebras довольно самобытная архитектура. Вместо относительно классической связки GPU с расположенной рядом HBM они буквально делают процессор размером почти с целую кремниевую пластину, Wafer-Scale Engine. WSE-3 содержит около 900 тысяч маленьких ядер, у каждого из которых есть локальный SRAM и простые SIMD-блоки. В сумме получается примерно 44 GB SRAM прямо на wafer.
И вот для inference это оказалось очень интересной комбинацией. Обычный GPU при генерации токенов во многом упирается в необходимость постоянно читать веса модели из HBM.
У Cerebras веса и KV-cache можно держать прямо в SRAM рядом с вычислительными ядрами, а слои модели распределять по WSE. Если одного WSE не хватает, модель распределяется между несколькими. Каждый хранит свою часть модели и передаёт следующему только промежуточный результат вычислений, а не сами веса. Благодаря этому веса остаются в быстром локальном SRAM, а между WSE нужно передавать сравнительно небольшой объём данных. Отсюда и очень высокая скорость генерации.
То есть архитектура, которая довольно странно выглядела как конкурент Nvidia в training, неожиданно нашла свою сильную сторону именно там, где сегодня особенно ценится latency: ультрабыстрый LLM inference.
Но silver bullet из Cerebras всё равно не получился. Вопрос, как оптимальнее всего строить железо для LLM inference, сегодня всё ещё открыт. Одна из главных проблем Cerebras в том, что объём SRAM нельзя наращивать так же легко, как внешнюю память, а большие модели и длинный контекст требуют всё больше памяти. В итоге приходится использовать больше WSE, и впечатляющая скорость начинает обходиться всё дороже с точки зрения масштабирования всей системы. Сам отчёт отдельно отмечает, что KV-cache и веса конкурируют за один и тот же ограниченный SRAM, а с ростом размера модели экономика такого подхода становится всё сложнее.
Но сам инженерный подход всё равно совершенно безумный и очень интересный.
Кстати, если вы забыли, какого размера «чип» у Cerebras, приложу фотку в комментариях.
P.S. Пост чуть больше чем полностью построен на отчёте Irrational Analysis. Обязательно ознакомьтесь с ним, невероятно увлекательный и познавательный разбор.
❤4🤡2🔥1🤔1