"Трудные времена создают сильных людей..." Распространите коллегам 🤗 На главной - более цензурная версия))
https://dontpastetheai.com/angry/
https://dontpastetheai.com/angry/
Dontpastetheai
Don't paste the AI
If your reply is a pile of LLM shit, you are the problem.
Утро началось не с Нескафе, а с секьюрити п...ца, который нашли на этих выходных. Оказалось ZCode воровал данные. Загружал полную историю гит изменений в .git в китайский клауд, зашифрованную их собственным приват ключом.
Zai оперативно ответили в тот же день. Вроде как быстро переобулись, убрали этот бэкдор, сказали что они не причем, и уже выложили ZCode в опенсорс по адресу https://github.com/zai-org/ZCode , чтобы код мог проходить необходимое ревью со стороны.
С одной стороны они молодцы, и опенсорс для харнеса - максимально верное решение. С другой стороны осадок вообще не приятный. Мне почему-то кажется, что это была не политика компании, а воровство данных как личная инициатива кого-то из разработки... Вобщем будем следаить за развитием событий. Отказываться от ZCode как-то уже и поздно 😅Но урок на будущее, наверное не полностью доверять закрытым тулам. Вот сейчас в связи с этим уже есть момент подумать, а насколько секьюрен CodeRabbit... 🤔
Zai оперативно ответили в тот же день. Вроде как быстро переобулись, убрали этот бэкдор, сказали что они не причем, и уже выложили ZCode в опенсорс по адресу https://github.com/zai-org/ZCode , чтобы код мог проходить необходимое ревью со стороны.
С одной стороны они молодцы, и опенсорс для харнеса - максимально верное решение. С другой стороны осадок вообще не приятный. Мне почему-то кажется, что это была не политика компании, а воровство данных как личная инициатива кого-то из разработки... Вобщем будем следаить за развитием событий. Отказываться от ZCode как-то уже и поздно 😅Но урок на будущее, наверное не полностью доверять закрытым тулам. Вот сейчас в связи с этим уже есть момент подумать, а насколько секьюрен CodeRabbit... 🤔
Code is cheap, let's talk
Inside ZCode: Silently Uploading Your Entire Git History to the Cloud
ZCode silently uploads full Git history to the cloud; this post provides a block rule and source review — checkpoint claims fall apart against the code.
🌚3
Сегодня наконец закончил эвалюейшн code review тулов.🌡 Главный инсайт что я вынес - есть огромная разница в точности ревью когда ты делаешь agentic code review (когда агент гоняет все изменения в твоем проекте связанный с MR, включая каждый файл из MR отдельно и полностью, логику между компонентами, тесты, документацию итд) и обычный per-diff ревью по строго заданной схеме. И соотвественно такая же огромная разница в цене.
Самым дорогим оказался agentic-review, baseline (без всяких тулов), с помощью GPT-5.6 Sol. Только на нашем проекте он бы стоил $3800 в месяц 🙈если запускать на каждый новый пуш в MR. Но вы офигеете сколько бы стоил DeepSeek 4.1 на таком же сценарии, жаль нам нельзя завезти DS на наш проект 🥲
Вобщем подробную статью и выводы сделаю на этой неделе🧠 Напомню, что в результатах будут Coderabbit, OCR, Codex Review, PR-Agent и бейслайн.
Самым дорогим оказался agentic-review, baseline (без всяких тулов), с помощью GPT-5.6 Sol. Только на нашем проекте он бы стоил $3800 в месяц 🙈если запускать на каждый новый пуш в MR. Но вы офигеете сколько бы стоил DeepSeek 4.1 на таком же сценарии, жаль нам нельзя завезти DS на наш проект 🥲
Вобщем подробную статью и выводы сделаю на этой неделе
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Чем мне нравится Z.ai - так это их клиентоориентированностью Они не так давно в X проводили опрос: "что бы вы хотели улучшить в наших моделях?". И большинство людей отвечало: "Всё круто, кроме скорости." Я соглашусь здесь. По скорости они всегда были на уровне улитки. 😅
И вот прошла буквально неделя-две и у нас новый релиз. FlashX со скоростью до 200 токенов в секунду! 🚀
На мой кодинг-план пока не раскатили🥲, вживую еще не видел. Но 200 TPS - должно быть даже быстрее, чем когда Кими 2.6 выкатывали для открытых тестов на церебрас-чипах (там где-то 150 было у меня на апи в реале?)
Ценник очень божеский, в 2,5 раза дороже обычной флэш, но в результате всё равно выходит в 3-4 раза дешевле, чем большая GLM 5.3 ($0.375/$1.25 против $1.40/$4.40). По итогу даже на лайт кодинг-плане можно будет гонять в быстром режиме, не упираясь в лимиты и без зазрения совести.😎
Короче, огонь, фича!🔥🔥🔥 Жду, жду, жду.
И вот прошла буквально неделя-две и у нас новый релиз. FlashX со скоростью до 200 токенов в секунду! 🚀
На мой кодинг-план пока не раскатили🥲, вживую еще не видел. Но 200 TPS - должно быть даже быстрее, чем когда Кими 2.6 выкатывали для открытых тестов на церебрас-чипах (там где-то 150 было у меня на апи в реале?)
Ценник очень божеский, в 2,5 раза дороже обычной флэш, но в результате всё равно выходит в 3-4 раза дешевле, чем большая GLM 5.3 ($0.375/$1.25 против $1.40/$4.40). По итогу даже на лайт кодинг-плане можно будет гонять в быстром режиме, не упираясь в лимиты и без зазрения совести.😎
Короче, огонь, фича!🔥🔥🔥 Жду, жду, жду.
🔥1
Так так так... Теперь кодить можно в Слак. Что дальше, писать лендинги в VK? 😆
Куда то мы не туда идём... 🙄
Куда то мы не туда идём... 🙄
🌚1
Ну и новый релиз🚀 от Xiaomi, и сразу в топ среди всего опенсорса. Неожиданно 😯🤔
🦄2
Ну и новый Опус, уже. Но я такое смотреть не буду 😄 (Хотя цифры бенчей красивые, не спорю)
🔥2
Вчера очень интересный батл тест получился. Есть у меня задача, подготовить наш продукт для AWS Marketplace distribution. Часть этого процесса - конечно же секьюрность контейнеров, в рамках которой минимально надо сделать наши и оркестраторы и спавнящиеся контейнеры rootless.
Ну и конечно там дофига нюансов. Девелоперы говонокодят когда прилага пишет логи прям в /app/, неявные вопросы с правами используемых файлов в разных местах итд. Раньше как было? Ты просто собирал контейнер с нужным USER, чуть менял chown на воркдир, запускал - все падало 🤣И дальше потихоньку искал что сломано и где проблемы. Сейчас же все можно подготовить сразу с АИ, и учесть все нюансы (ну почти).
Фича большая, решил пойти с SDD, сделал простые рекварйменты, сгенерил базовый сис дизайн, и тут фаза review requirements и review design, на котором чаще всего все переделывается почти под чистую. Модель проверяет всякие эдж кейсы, задает вопросы, и спеки доводятся до вменяемого состояния. И вот решил, а дай ка я сделаю ревью и найду все блокеры разными моделями. Итого у нас GLM-5.3 Max, DeepSeek V4.1 Flash и GPT-5.6 Sol High.
Результат на картинке. Всего корпус из 40 блокеров
🥇Sol - 24
🥈DeepSeek - 21
🥉GLM - 12
Но при этом у каждой модели есть уникальные попадания из корпуса, то есть даже ГЛМ нашел 2 проблемы которые не нашли другие обе модели. Прикольно, интересно, захотелось узнать детали, и почему так.
Разобрал блокеры по контекстным группам, и выяснилось что GLM например вообще воспринял ревью довольно буквально и проверял только чарт, рантайм и конфиги, и вообще не пошел вглубь репозитория проверять per-agent dockerfiles, где были 9 блокеров (8 из них нашел Сол, и 6 Дипсик). Если детально, как каждая модель делала ревью:
В целом могу сделать такие выводы. Все нынешние топ модели, и китайские и закрытые US сейчас достаточно умны, чтобы находить проблемы и анализировать результат. Сделают ли они это с первого раза - чаще зависит от прокладки между компом и стулом, как грамотно составлен промпт, какие у вас рулы и agents md итд. В плане ревью - у Sol наверное самый грамотный методологический подход, но эта штука фиксится промптом для любой модели. Самый важный tldr из этой истории:
"run at least one file-verification pass (cited claims vs code), one dependency-graph pass (Dockerfiles, entrypoints, adapters the docs assume), and one contract pass (rollout, rollback, env-var lifetimes). One model doing one pass is demonstrably not enough — 18 of 40 clusters were single-model finds."
Я это правило уже добавил в свои спек ревью промпты, чего и вам желаю👍 🌡
Ну и конечно там дофига нюансов. Девелоперы говонокодят когда прилага пишет логи прям в /app/, неявные вопросы с правами используемых файлов в разных местах итд. Раньше как было? Ты просто собирал контейнер с нужным USER, чуть менял chown на воркдир, запускал - все падало 🤣И дальше потихоньку искал что сломано и где проблемы. Сейчас же все можно подготовить сразу с АИ, и учесть все нюансы (ну почти).
Фича большая, решил пойти с SDD, сделал простые рекварйменты, сгенерил базовый сис дизайн, и тут фаза review requirements и review design, на котором чаще всего все переделывается почти под чистую. Модель проверяет всякие эдж кейсы, задает вопросы, и спеки доводятся до вменяемого состояния. И вот решил, а дай ка я сделаю ревью и найду все блокеры разными моделями. Итого у нас GLM-5.3 Max, DeepSeek V4.1 Flash и GPT-5.6 Sol High.
Результат на картинке. Всего корпус из 40 блокеров
🥇Sol - 24
🥈DeepSeek - 21
🥉GLM - 12
Но при этом у каждой модели есть уникальные попадания из корпуса, то есть даже ГЛМ нашел 2 проблемы которые не нашли другие обе модели. Прикольно, интересно, захотелось узнать детали, и почему так.
Разобрал блокеры по контекстным группам, и выяснилось что GLM например вообще воспринял ревью довольно буквально и проверял только чарт, рантайм и конфиги, и вообще не пошел вглубь репозитория проверять per-agent dockerfiles, где были 9 блокеров (8 из них нашел Сол, и 6 Дипсик). Если детально, как каждая модель делала ревью:
Review depth follows verification habit. ZCode anchored on “verify the doc’s claims against code” and went where the cited files were (chart, config, runtime plumbing) — it caught everything wrong in what the docs pointed at and nothing wrong in what the docs glossed over. The image layer was described in two self-confident sentences, and those sentences were never cross-checked against a single Dockerfile.
DeepSeek inverted that: it audited the artifact graph the docs depend on (base → per-agent Dockerfiles, entrypoint, adapter modules), which is why it owns the image-layer blockers — but it accepted the docs’ rollout/pinning story at face value (missed the SHA-coupling and the ENV-into-builds side effect of the approved CA design).
Sol reviewed the design as a system contract — who renders what, when do env vars exist, what does a release mean, what happens on rollback — which catches lifecycle and composition gaps neither file-level audit style reaches. Its laconic items occasionally name symptoms without mechanisms (e.g. “derived images fail to build” without the USER-inheritance mechanism DeepSeek stated), which is why its image-layer rows are partials.
В целом могу сделать такие выводы. Все нынешние топ модели, и китайские и закрытые US сейчас достаточно умны, чтобы находить проблемы и анализировать результат. Сделают ли они это с первого раза - чаще зависит от прокладки между компом и стулом, как грамотно составлен промпт, какие у вас рулы и agents md итд. В плане ревью - у Sol наверное самый грамотный методологический подход, но эта штука фиксится промптом для любой модели. Самый важный tldr из этой истории:
"run at least one file-verification pass (cited claims vs code), one dependency-graph pass (Dockerfiles, entrypoints, adapters the docs assume), and one contract pass (rollout, rollback, env-var lifetimes). One model doing one pass is demonstrably not enough — 18 of 40 clusters were single-model finds."
Я это правило уже добавил в свои спек ревью промпты, чего и вам желаю
Please open Telegram to view this post
VIEW IN TELEGRAM
А вот это тестить и использовать точно буду 👍
PS и я тут только сейчас увидел прайс. $2/$10, что в два раза дешевле прошлого Sol. Это просто победа, реально крутые👍 🔥 🔥
PS и я тут только сейчас увидел прайс. $2/$10, что в два раза дешевле прошлого Sol. Это просто победа, реально крутые
Please open Telegram to view this post
VIEW IN TELEGRAM
Честный обзор на Grok 4.7, если вдруг кто-то думал его использовать в работе.
tldr: нормальная умная модель, предсказуемая, консервативная, не верьте бенчмаркам :)
tldr: нормальная умная модель, предсказуемая, консервативная, не верьте бенчмаркам :)
archive.codenewsletter.ai
Kun Chen (@kunchenguid) on X
day 1 observations for grok 4.7
ignore the reports that say “it’s terrible” and the only thing they reference is a public benchmark. the same benchmarks told us opus 5 was better that fable - they…
ignore the reports that say “it’s terrible” and the only thing they reference is a public benchmark. the same benchmarks told us opus 5 was better that fable - they…
👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Сохраню это здесь. Чтобы как нибудь на выходных или в отпуске загрузить в NotebookLM и разобрать в деталях. Все таки базу надо тоже подтягивать 🤓
👍2