А еще в процессе этих фиксов и ревью меня окончательно выбесил GPT 5.6, что Terra, что Sol. Делаю хай лвл план с Sol High, делаю имплементацию по плану на Terra, делаю код ревью с GLM - находит два критикала, штук пяток P2, и с десяток незначительных P3. Race condition починен криво, считай не починен, для миграции данных которую мы запланировали (чтобы не делать весь синк с нуля, мигрируем все файлы из вики в новые индексы с новой метадатой) Terra вообще не подготовила ни-хе-ра.
Хоть в описании багов из ревью и написано как их чинить, запускаю Sol, пусть уже починит нормально. Чинит. Делаю ревью конкретно эти двух новых коммитов - опять 8 штук P2 и с десяток P3 конкретно в этой имплементации от Sol. Ну нахер, опять по кругу. И модельки за эту особо не большую имплементацию сьели $40 токенов (деньги не мои, но все равно жалко😅) Свитчнулся на новый DS Flash, допилил эти два коммита, сделал остальные 15 мелких ишуев, провел второй раунд код ревью с GLM - все ок, буквально одна желтая и пару синих issues осталось.
И я не думаю что это когнитивное искажение, мне реально кажется что с тех пор как я перешел на модели OpenAI я реально очень часто стал переделывать фичи, ишуи в код ревью сыпятся как из ведра. Модели слишком самоуверены, они вот реально никогда не спросят "а что ты хотел на самом деле? а как мы будем делать здесь, вот есть такие варианты?", много и долго думают, принимают решения сами, по итогу с очень умным видом пилят какую-то херню.
Ну и бесят сабагаенты, эти новые openai модельки запускают сабагентов на каждый чих, и когда я говорю Sol "разберись как работает этот сервис/модуль", я хочу чтобы именно Сол сам разобрался, а не запустил мелкую модель в фоне и потом просто перепечатал результат.
Не, я уважаю GPT 5.6, реально огромная работа, в отличии от 5.4-5.5 они хоть научились разговаривать и писать доки нормальным техническим человеческим языком, пользуйтесь на здоровье 👍 Но я ухожу на новый DeepSeek Flash🌡 Ну и GLM конечно.
ЗЫ Sol пока оставляю для дебагинга реально сложных обьемных багов (типа моей прошлой проблемы, когда надо проверить код нескольких сервисов, реальные деплои в кубере, собрать статистику что сьело бюджет, когда и как это произошло), в этом плане модель очень дотошная. И наверное все же оставлю для первого написания SDD спек и планов. Дальше обязательно /review-requirements и /review-design только с GLM. Сол в начале может сильно так наоверинжинерить, но при этом покрыть все даже не очевидные кейсы, а с GLM потом в процессе ревью уже можно довести все спеки в человеческий вид.
Хоть в описании багов из ревью и написано как их чинить, запускаю Sol, пусть уже починит нормально. Чинит. Делаю ревью конкретно эти двух новых коммитов - опять 8 штук P2 и с десяток P3 конкретно в этой имплементации от Sol. Ну нахер, опять по кругу. И модельки за эту особо не большую имплементацию сьели $40 токенов (деньги не мои, но все равно жалко😅) Свитчнулся на новый DS Flash, допилил эти два коммита, сделал остальные 15 мелких ишуев, провел второй раунд код ревью с GLM - все ок, буквально одна желтая и пару синих issues осталось.
И я не думаю что это когнитивное искажение, мне реально кажется что с тех пор как я перешел на модели OpenAI я реально очень часто стал переделывать фичи, ишуи в код ревью сыпятся как из ведра. Модели слишком самоуверены, они вот реально никогда не спросят "а что ты хотел на самом деле? а как мы будем делать здесь, вот есть такие варианты?", много и долго думают, принимают решения сами, по итогу с очень умным видом пилят какую-то херню.
Ну и бесят сабагаенты, эти новые openai модельки запускают сабагентов на каждый чих, и когда я говорю Sol "разберись как работает этот сервис/модуль", я хочу чтобы именно Сол сам разобрался, а не запустил мелкую модель в фоне и потом просто перепечатал результат.
Не, я уважаю GPT 5.6, реально огромная работа, в отличии от 5.4-5.5 они хоть научились разговаривать и писать доки нормальным техническим человеческим языком, пользуйтесь на здоровье 👍 Но я ухожу на новый DeepSeek Flash
ЗЫ Sol пока оставляю для дебагинга реально сложных обьемных багов (типа моей прошлой проблемы, когда надо проверить код нескольких сервисов, реальные деплои в кубере, собрать статистику что сьело бюджет, когда и как это произошло), в этом плане модель очень дотошная. И наверное все же оставлю для первого написания SDD спек и планов. Дальше обязательно /review-requirements и /review-design только с GLM. Сол в начале может сильно так наоверинжинерить, но при этом покрыть все даже не очевидные кейсы, а с GLM потом в процессе ревью уже можно довести все спеки в человеческий вид.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
А вот огонь фича заезжает в Github - Stacked pull requests. Возможность разбивать большой PR на пачку отдельных бранчей+sub-PR, ревьювать все по отдельности, а мержить все вместе через merge queue. Как я понял от сорс бранча сначала создаешь новый бранч который является bottom нового стака. Дальше от этого стака можно ветвить сколько угодно бранчей, которые все обьединятся в один Stack PR. Никаких мержей/ребейза ориджина, когда тебе надо смержить несколько PR по очереди. Никакого нытья про то, кто будет ревьювать +-10к пул реквест.🤗
И мне кажется что эта фича - просто гениальна в свой простоте и четко вписывается в сценарии агентской разработки🧠 Вобщем надеюсь будет не только в Enterprise, ну и Gitlab поскорее бы ее скопировал 😁
И мне кажется что эта фича - просто гениальна в свой простоте и четко вписывается в сценарии агентской разработки
Please open Telegram to view this post
VIEW IN TELEGRAM
The GitHub Blog
Stacked pull requests are now in public preview - GitHub Changelog
Stacked pull requests break large changes into small, reviewable pull requests. They’re an ordered series of pull requests that each represent focused layers of your change. With stacks, you can…
Опять пост "старческого брюзжания" про модели 😅 Отказался от нового DS Flash 😁 Конечно пост тренинг там гениальный, когда такая мелкая и быстрая модель так хорошо гоняет техничские вопросы и так качественно ориентируется в консоли. И я верю бенчам, явно на эти бенчи модель специально натаскивали. Но реальная работа - это не бенчи, и в реальных задач флеш хоть и хорош, но я совсем не вижу разницы по сравнению с прошлой Pro-Preview. Но в одном разница есть, это качество языка аутпутов и структурирование текстов. И в этом Pro как более крупная модель побеждает и это видно невооруженным глазом. Так как, то, как модель тебе пишет ответы и насколько ее ответы понятны - это очень важный пункт для качественной работы, я вернулся на прошлую Pro.
Такие дела. Ждем новую прошку с таким же крутым кодинг пост тренингом🌡
Такие дела. Ждем новую прошку с таким же крутым кодинг пост тренингом
Please open Telegram to view this post
VIEW IN TELEGRAM
Я тут просто в ах*е от самоуверенности Sol. Решил сделать новую фичу для своего слак ассистента, запустил для Sol Medium /new-requirement команду из AI-Devkit для сбора данных по требованиям, модель задала буквально пару самых простых вопроса, и дальше сидит пидалит доки. И тут рапортует - доки сделала, сама провела все ревью, и /review-requrements и /review-design, все у меня сделано круто, так что можем начинать имплементировать код. 🤯
Первый раз вижу такое, там четко в команде задано, что юзер отдельно проводит ревью, а тут сама написала, сама заревьювила, сама сказала "я молодец, все сделала четко" 🤣
Первый раз вижу такое, там четко в команде задано, что юзер отдельно проводит ревью, а тут сама написала, сама заревьювила, сама сказала "я молодец, все сделала четко" 🤣
Готовлюсь к Claude Architect сертификации (при всей моей нелюбви к Антропикам серт получить то надо 😅 и для компании и для своего CV). Нарыл в интернете pdf-ки с моком экзамена (Developer и Architect Foundation), загнал в LLM, прошел мок на 95%, показался весьма легким.
А вот нашел еще один сайт, который предлагает бесплатные материалы для подготовки и единый мок экзамен для проверки знаний в целом. Вот он мне показался реально сильно сложнее, сдал на 72%. Ну теперь вижу свои гэпы и понимаю что подтянуть. Вобщем если думаете готовиться тоже, максимально рекомендую этот сайтик👍
Моки в pdf выложу в коментах
А вот нашел еще один сайт, который предлагает бесплатные материалы для подготовки и единый мок экзамен для проверки знаний в целом. Вот он мне показался реально сильно сложнее, сдал на 72%. Ну теперь вижу свои гэпы и понимаю что подтянуть. Вобщем если думаете готовиться тоже, максимально рекомендую этот сайтик
Моки в pdf выложу в коментах
Please open Telegram to view this post
VIEW IN TELEGRAM
Claudecertificationguide
Claude Certification Guide — Free Mock Exams & Study Guides
Free mock exams and study guides for Anthropic's Claude certifications. 30 lessons, 250+ practice questions, no sign-up.
Всем привет! Сохраняйте в закладки для саморазвития 🌡
23 основных концепта System Design. Написано подробно, живым языком и увлекательно, с диаграммами, не занудно. Подойдет как для подгтовки к собесам, так и углубить свои знания по некоторым темам.
https://x.com/system_monarch/status/2084233289016238343
23 основных концепта System Design. Написано подробно, живым языком и увлекательно, с диаграммами, не занудно. Подойдет как для подгтовки к собесам, так и углубить свои знания по некоторым темам.
https://x.com/system_monarch/status/2084233289016238343
Please open Telegram to view this post
VIEW IN TELEGRAM
X (formerly Twitter)
Puneet Patwari (@system_monarch) on X
I'm a Principal engineer & I passed system design rounds of Amazon, Atlassian, Walmart, Saleforce, and Deliveroo.
Trust me, learning system is not hard. Start from these fundamental concepts:
…
Trust me, learning system is not hard. Start from these fundamental concepts:
…
DeepSeek заявил, что собирается, причем сильно, поднять цены на свой API. Сразу пошли рассказы, про то что инфиренс у них был максимально субсидирован, вплоть до поддержки компартии КНР 🙂 И что халява закаончилась. Но дело не в субсидиях, а тупо в популярности. Создатель опенкод вчера написал, что им удалось выдать цену на DeepSeek такую же как у оригинального провайдера даже на арендованых GPU. То есть стоимость инфиринса сейчас вполне честная. Но в следствии популярности китайцы решили расширять свою инфраструктуру и забить капитальные расходы в стоимость апи. Но есть два тейка:
* Вряд ли цена уйдет в космос до уровня штатов. Все таки есть огромное число независимых GPU и инфиренс провайдеров, которые гоняют у себя открытый код дипсика и им выгодно делать цену ниже, с другой стороны если офф провайдер поднимется все внешние инфиренсы тоже поднимутся, но не сильно и цена где-то сбалансирует по середине. На уровне закрытых моделей она точно не станет.
* Представьте сколько бабла гребут ОпенАИ и Антропик продавая свои продукты в тридорого?😄 Ладно Альтман хоть Луну по честной цене стал отдавать, а у Антропиков вообще ничего святого 😁
* Вряд ли цена уйдет в космос до уровня штатов. Все таки есть огромное число независимых GPU и инфиренс провайдеров, которые гоняют у себя открытый код дипсика и им выгодно делать цену ниже, с другой стороны если офф провайдер поднимется все внешние инфиренсы тоже поднимутся, но не сильно и цена где-то сбалансирует по середине. На уровне закрытых моделей она точно не станет.
* Представьте сколько бабла гребут ОпенАИ и Антропик продавая свои продукты в тридорого?
Please open Telegram to view this post
VIEW IN TELEGRAM
X (formerly Twitter)
dax (@thdxr) on X
on the upcoming deepseek price increase
we've been able to reproduce their current prices even on rented GPUs
so this likely isn't because they're "losing money" it's traffic shaping because they are overloaded
we've been able to reproduce their current prices even on rented GPUs
so this likely isn't because they're "losing money" it's traffic shaping because they are overloaded
Forwarded from Denis Sexy IT 🤖
Посмотрел свои траты в Codex – почти 40 миллиардов токенов за все время, это почти 40 тысяч долларов трат
Подписка 200$, в моем случае, выгоднее чем API цены в ~30 раз. И это без учета трат на обычный ChatGPT с Pro моделью и тп
Безумные времена👍
Подписка 200$, в моем случае, выгоднее чем API цены в ~30 раз. И это без учета трат на обычный ChatGPT с Pro моделью и тп
Безумные времена
Please open Telegram to view this post
VIEW IN TELEGRAM
^ Ну вот стоимость инфиренса на своем собственном железе OpenAI, считай, в 30 раз дешевле стоимости АПИ. Ладно не в 30, все же они диверсифируют. Когда есть пользователи, которые тратят больше подписки, есть большая когорта пользователей, которые тратят меньше. Денис явно из тех, кто тратит все максимально. Так что считай, что цены на топовые модели в АПИ по сравнению с реальной ценой компьюта это плюс 2 000% прибыли. 🙈
Ramp, крупный штатовский финтех и один из топовых AI адоптеров выпустили собственный бенчмарк - Ramp SWE-bench.
Построен на базе 80 их собственных продуктовых задач. Реальные таски из финтех разработки, от тикета с задачей до готового PR, условия максимально приближены к реальности. И чем крут этот бенч - он закрытый. То есть задачи почти гарантированно не попадают в обучающие данные.
GLM предсказуемо (для меня 😎) оказался крут по качеству, опережая весь опенсорс, кроме Kimi K3. Sol High 83.3% решённых задач, у GLM - 82.1%. И это выше чем Terra High, Opus 4.8 Xhigh, Sonnet 5.
Офигенный результат🔥 Но при таком качестве модель оказалась сильно дорогой. На уровне 5 Опуса, сильно дороже даже чем Sol. Адский токен кансампшн GLM, про который многие пишут - реальность. Отсюда вывод, GLM, как я и писал не раз, одна из лучших моделей для тех ресерча, планинга, ревью. Но желательно использовать их субсидированные подписки, чем прямую стоимость апи.
Классный результат показал Kimi K2.7, с 80.8% и относительно дешёвой стоимостью.
Qwen 3.7 в глубокой ж. Жаль что нету в бенче новой 3.8
DeepSeek Flash new - легенда😎 с 79% и 12 центов за задачу, самая дешёвая из эффективных моделей. Но если цена, как обещают, вырастит в 4 раза - дипсик конкретно так проиграет OpenAI.
А модели от Альтмана меня в этом бенче удивили, при дорогой цене за токен у Terra и Sol они показывают очень эффективную стоимость за задачу. Все модели GPT5.6 реально круто конкурирует с опенсорсом даже в вопросе цены, это новость 🫠
Читаем про бенч и смотрим таблички здесь
Построен на базе 80 их собственных продуктовых задач. Реальные таски из финтех разработки, от тикета с задачей до готового PR, условия максимально приближены к реальности. И чем крут этот бенч - он закрытый. То есть задачи почти гарантированно не попадают в обучающие данные.
GLM предсказуемо (для меня 😎) оказался крут по качеству, опережая весь опенсорс, кроме Kimi K3. Sol High 83.3% решённых задач, у GLM - 82.1%. И это выше чем Terra High, Opus 4.8 Xhigh, Sonnet 5.
Офигенный результат
Классный результат показал Kimi K2.7, с 80.8% и относительно дешёвой стоимостью.
Qwen 3.7 в глубокой ж. Жаль что нету в бенче новой 3.8
DeepSeek Flash new - легенда
А модели от Альтмана меня в этом бенче удивили, при дорогой цене за токен у Terra и Sol они показывают очень эффективную стоимость за задачу. Все модели GPT5.6 реально круто конкурирует с опенсорсом даже в вопросе цены, это новость 🫠
Читаем про бенч и смотрим таблички здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
Думаю вы слышали нашумевшую историю про взлом Hugging Face агентами OpenAI. После этого OpenAI сделали доклад на секьюрити конфе в штатах как это происходило. Была подробная статья в Wired, но за пейволом. Сейчас Денис выложил подробности этого доклада, почитайте, интересно!
Telegram
Denis Sexy IT 🤖
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри…
Тренды в AI enabled DevOps на текущий момент 🧠 :
- Runtime shields. Агенты находят новые уязвимости гораздо быстрее, чем работает стандартный on-demand сканинг и патчинг для устранения этих уязвимостей. Процесс сломан. Real-time сканеры на базе eBPF в теории могут защитить системы до полноценного патчинга.
- Automated verification engineer (AVE). Новая роль на стыке QA и DevOps, закрывающая бич нынешнего процесса разработки - ревью сгенерированного кода. Работа на уровне выше, чем автотесты - разработка test-harness. Связь детерминированных тулов и агент ревью, работа с confidence и severity, интеграция с observability метриками. Вот один из примеров готового фреймворка.
- Temporal fakes. Хаос инжинеринг на стероидах. Мокаем внешние системы, которые не просто отдают статические данные, а эмулируют реальный жизненный цикл внешних депенданси. Сейчас с AI агентами подобные test layers стали куда как проще в разработке.
- Durable agent workflows. Естественная эволюция агентных систем, когда они переходят от банальных скриптов к полноценным сервисам и требуют классческого reliability. Durable execution (смотрите Temporal и Golem), progress persistence, resume-after-failure, обсервабилити для tool execution и decision tracking.
- Runtime shields. Агенты находят новые уязвимости гораздо быстрее, чем работает стандартный on-demand сканинг и патчинг для устранения этих уязвимостей. Процесс сломан. Real-time сканеры на базе eBPF в теории могут защитить системы до полноценного патчинга.
- Automated verification engineer (AVE). Новая роль на стыке QA и DevOps, закрывающая бич нынешнего процесса разработки - ревью сгенерированного кода. Работа на уровне выше, чем автотесты - разработка test-harness. Связь детерминированных тулов и агент ревью, работа с confidence и severity, интеграция с observability метриками. Вот один из примеров готового фреймворка.
- Temporal fakes. Хаос инжинеринг на стероидах. Мокаем внешние системы, которые не просто отдают статические данные, а эмулируют реальный жизненный цикл внешних депенданси. Сейчас с AI агентами подобные test layers стали куда как проще в разработке.
- Durable agent workflows. Естественная эволюция агентных систем, когда они переходят от банальных скриптов к полноценным сервисам и требуют классческого reliability. Durable execution (смотрите Temporal и Golem), progress persistence, resume-after-failure, обсервабилити для tool execution и decision tracking.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Хинт дня 👍 Давно его уже использую, удобно когда работаешь в консоли, чтобы не запускать каждый раз tui.
~/.bashrc
Ну и дальше просто
~/.bashrc
alias oo="opencode run -m opencode/deepseek-v4-flash-free"
Ну и дальше просто
oo "ask a question here?"Ура 🎉 Красивая ачивка для CV 🌡 😎
Теперь точно нужно не лениться и написать статью по их курсу подготовки FDE, там реально много полезного было)
https://www.credential.net/0660a1e9-bc5f-48c1-a539-56a84b646791#acc.HoEJdzbF
Теперь точно нужно не лениться и написать статью по их курсу подготовки FDE, там реально много полезного было)
https://www.credential.net/0660a1e9-bc5f-48c1-a539-56a84b646791#acc.HoEJdzbF
Please open Telegram to view this post
VIEW IN TELEGRAM
Credential.net
Cursor AI Forward Deployed Engineer Accreditation • Eugene Burachevskiy • Cursor
Home of digital credentials
🔥4
Доброго утра, коллеги!☕️
X-AI разродился релизами, новая топовая модель Grok 4.6. И если у вас есть подпсика на Курсор, то ближайшую неделю модель отдают с 50% скидкой, нормальный вариант затестить (но блин 256к контекста, ну несерьезно прям😅). А так же мультагентная тула для дженерик офисных задач - Grok Bot, про который возможно напишу позже👍
X-AI разродился релизами, новая топовая модель Grok 4.6. И если у вас есть подпсика на Курсор, то ближайшую неделю модель отдают с 50% скидкой, нормальный вариант затестить (но блин 256к контекста, ну несерьезно прям😅). А так же мультагентная тула для дженерик офисных задач - Grok Bot, про который возможно напишу позже
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Сегодня уже плотно работаю с новым DeepSeek V4 Pro🐳 . Задачи обьемные, делаю PoC для миграции нашего продукта из dind в k8s native агентов. Работает по уже готовым спекам - код пишет хорошо, за задачами следит. На код ревью ГЛМ+Сол потом находят конечно много issues, но подозреваю что связано с довольно сложным кодом. Исправляет все правильно. Пока ощущение - что просто отличная модель для кодинга в OpenCode, по стабильности вот на голову выше прошлого дипсик. 🧠
Дальше посмотрим как будет работать с деплоями, траблшутингом, ну и в систем дизайне/доках как нибудь попробую тоже.👍
PS Ну и к слову, харнес доступен уже тоже
Дальше посмотрим как будет работать с деплоями, траблшутингом, ну и в систем дизайне/доках как нибудь попробую тоже.
PS Ну и к слову, харнес доступен уже тоже
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Неделя топовых релизов 🔥
Потестил Grok 4.6 в Курсоре. Не запускал Cursor агентов уже наверное пару месяцев 😁 Использовал его просто как vsкод, файлы смотреть)) Корпоративная подписка просто простаивала... Но вот вышел новый грок и решил посмотреть как он. Слушайте - неплох. Вполне верю в бенчи, которые показывают что Grok 4.6 теперь SOTA и догоняет Sol и Fable. Запустил финальную фазу своего k8s native PoC - devops wiring: апдейты для хелм темплейтов, вальюсов, скриптов, документации, новые секреты, энв вариаблы, вобщем вся конфигурация k8s native pod генератора вместо старого dind. Ну и отработало отлично. Код ревью с Sol нашло только один критикал и 8 медиум. Что круто, прошлые фазы сделанные новым DeepSeek Pro такой же код ревью находил по 5-7 критикалов и 10-15 медиум.
Вобщем модель крутая🧠 . Но вот сам Cursor - тормозящая лагающая гуевина, с которой после консольных харнесов работать, особенно на моем экране ноута, неудобно от слова совсем. Все таки я совсем отвык от GUI агентов. Когда выйдет в фул релиз opencode 2 - попробую их линукс десктоп апп, так как он будет интегрирован с тем же сервером что и консольный клиент. Но чисто как замену vscode смотреть файлы. Агенты продолжу гонять как обычно - куча вкладок в консоли) А если вы любите гуи - попробуйте Zcode. По незаивсимым тестам - крутой харнесс, кеш хит там вообще запредельный👍.
Что еще? Google🔋 выпустила Flash 3.7 Мне кажется они рубят фишку. Что огромные SOTA модели - это больше вопрос престижа. А 80% реальной работы делается моделями поменьше. И новый флеш со своей $0.375/$1.875 за лям токенов выдающий перфоманс уровня Sonet 5 - это огонь модель. По цене в 7 раз дешевле Сонета. Если у вас есть корпоративные ограничения на китайские модели, новый гугловый флеш - отличный выбор, особенно для работы с репортами, тех дигестами, документами и экстракцией итд итп. Я уже перевожу свои рабочие и пет проекты на нее👍 , как будет делать код ревью в пайплайнах - тоже посмотрим.
Ну и есть еще одна новость, очень крутая, но которая появилась сегодня очень тихо, без помпы...
Потестил Grok 4.6 в Курсоре. Не запускал Cursor агентов уже наверное пару месяцев 😁 Использовал его просто как vsкод, файлы смотреть)) Корпоративная подписка просто простаивала... Но вот вышел новый грок и решил посмотреть как он. Слушайте - неплох. Вполне верю в бенчи, которые показывают что Grok 4.6 теперь SOTA и догоняет Sol и Fable. Запустил финальную фазу своего k8s native PoC - devops wiring: апдейты для хелм темплейтов, вальюсов, скриптов, документации, новые секреты, энв вариаблы, вобщем вся конфигурация k8s native pod генератора вместо старого dind. Ну и отработало отлично. Код ревью с Sol нашло только один критикал и 8 медиум. Что круто, прошлые фазы сделанные новым DeepSeek Pro такой же код ревью находил по 5-7 критикалов и 10-15 медиум.
Вобщем модель крутая
Что еще? Google
Ну и есть еще одна новость, очень крутая, но которая появилась сегодня очень тихо, без помпы...
Please open Telegram to view this post
VIEW IN TELEGRAM
И вот она! GLM 5.3! Уже в OpenCode Go. Огромнейший прирост по всем бенчмаркам и реальный кандидат на лучшую open source модель. Вот за этот релиз я сегодня даже пивка выпью😅🍺, очень-очень рад 🔥😎🫰
Добавлю - модель на 743B параметров. Считай в 4 раза меньше Kimi 3 и в 10 раз меньше Fable. Но бенчмарки офигенные. Ребята сделали ставку на качественный посттренинг, как и DeepSeek. И результат заслуживает уважения.🔥 Также эта модель максимально заточена на cyber security. Теперь код-ревью реально выйдет на новый уровень💯
Добавлю - модель на 743B параметров. Считай в 4 раза меньше Kimi 3 и в 10 раз меньше Fable. Но бенчмарки офигенные. Ребята сделали ставку на качественный посттренинг, как и DeepSeek. И результат заслуживает уважения.🔥 Также эта модель максимально заточена на cyber security. Теперь код-ревью реально выйдет на новый уровень
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
GLM 5.3 Evaluation ⚠️
Конечно же решил начать работать с новой GLM. На Zai подписке модель пока что слабо юзабельна. Задержки перед выполнением, медленно, иногда агент просто виснет и не продолжает работу. Ладно, все же день релиза, да и Lite план запросы явно не в приоритете. Запустил на OpenCode Go. Тут уже все идет без лагов и остановок. Но меня сразу насторожило, что модель на разных даже вроде не сложных промптах уходит в очень и очень длинные рассуждения😟. Совсем не как у 5.2. Что натолкнуло на мысль как о медленной скорости, так и на прожорливость в плане токенов.
Но догадки догадками, надо сделать нормальный эвалюейшн, хотя бы на одной серьезной задаче🌡 . Решено сравнить с Grok 4.6. Задача - критическая ишуя найденная на код ревью Sol-ом, связанная с тем, как оркестратор в нашем софте управляет новым жизненным циклом k8s сендбоксов, в которых крутятся наши исполняемые агенты. Если не вдаваться в подробности и описать в одно предложение, то:
Новая сессия в OpenCode, GLM 5.3 Max. В контексте AGENTS.md проекта и инфраструктуры, дизайн и тасклист спеки текущей фичи, ну и описания ишуи которую нужно пофиксить. После выполнения прогоняю еще раз Sol ревью уже чисто по фиксу, смотрю результат, все ресетаю, и запускаю с нуля с таким же контекстом в Cursor на Grok 4.6 Extra High.
GLM реально ну очень долго пидалит эту ишую. В меня аж закрадываются сомнения, что у модели на релизе есть какие-то проблемы.🤷♂️ Но результат готов, +280/ -60 строк в 22 файлах. Время выполнения 25 минут. 5 миллионов токенов. Sol по этому результату находит 2 критических и 2 medium проблемы. Фикс есть, но не полный, надо дорабатывать. Думаю что все, GLM обосрался 😭
Прогоняю все в Grok - и тут меня ждет удивление 🙂Результат получаем вот совсем такой же. Плюс минус те же строки и файлы. 14 минут скорость выполнения. Здесь конечно большое преимущество. 7 миллионов токенов потрачено! И все таки несмотря на долгий и муторный ризонинг у GLM на реальном потреблении токенов он не сильно сказался 🤗 Прогоняю через Sol - находит РОВНО те же самые 2 критикал и 2 медиум 😂 Проверил на отдельной новой сессии насколько эти находки актуальны, может Сол тупит? Но да, актуальны, требуют фикса, и GLM и новый Grok недоработали на одном и том же месте.
Вердикт - каких-то больших проблем у GLM нет. Модель работает, вполне на уровне других современных релизов. Продолжаю работу дальше, будем проверять как GLM 5.3 справляется с архитектурой и код ревью, а на следующей неделе будет большой тест на тему cybersecurity, буду проводить полный аудит нашего проекта.👍
Конечно же решил начать работать с новой GLM. На Zai подписке модель пока что слабо юзабельна. Задержки перед выполнением, медленно, иногда агент просто виснет и не продолжает работу. Ладно, все же день релиза, да и Lite план запросы явно не в приоритете. Запустил на OpenCode Go. Тут уже все идет без лагов и остановок. Но меня сразу насторожило, что модель на разных даже вроде не сложных промптах уходит в очень и очень длинные рассуждения😟. Совсем не как у 5.2. Что натолкнуло на мысль как о медленной скорости, так и на прожорливость в плане токенов.
Но догадки догадками, надо сделать нормальный эвалюейшн, хотя бы на одной серьезной задаче
The Kubernetes runtime defines outcome labels, retention policies, orphan cleanup, and shutdown draining, but these features are not connected to the production supervisor lifecycle. Failed pods are deleted without retention, while supervisor crashes can leave active orphaned pods indefinitely.
Новая сессия в OpenCode, GLM 5.3 Max. В контексте AGENTS.md проекта и инфраструктуры, дизайн и тасклист спеки текущей фичи, ну и описания ишуи которую нужно пофиксить. После выполнения прогоняю еще раз Sol ревью уже чисто по фиксу, смотрю результат, все ресетаю, и запускаю с нуля с таким же контекстом в Cursor на Grok 4.6 Extra High.
GLM реально ну очень долго пидалит эту ишую. В меня аж закрадываются сомнения, что у модели на релизе есть какие-то проблемы.
Прогоняю все в Grok - и тут меня ждет удивление 🙂Результат получаем вот совсем такой же. Плюс минус те же строки и файлы. 14 минут скорость выполнения. Здесь конечно большое преимущество. 7 миллионов токенов потрачено! И все таки несмотря на долгий и муторный ризонинг у GLM на реальном потреблении токенов он не сильно сказался 🤗 Прогоняю через Sol - находит РОВНО те же самые 2 критикал и 2 медиум 😂 Проверил на отдельной новой сессии насколько эти находки актуальны, может Сол тупит? Но да, актуальны, требуют фикса, и GLM и новый Grok недоработали на одном и том же месте.
Вердикт - каких-то больших проблем у GLM нет. Модель работает, вполне на уровне других современных релизов. Продолжаю работу дальше, будем проверять как GLM 5.3 справляется с архитектурой и код ревью, а на следующей неделе будет большой тест на тему cybersecurity, буду проводить полный аудит нашего проекта.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4