Agentic capabilities. Opus 4.6 не превзошел своего предшественника по популярному агентик кодинг бенчу SWE-AGENT-VERIFIED. Но в целом показывает крутые результаты по автономной работе и координации. В свете этого Antropic выпустил мультиагентный режим в где Claude Code, когда основной агент может запускать пачку саб-агентов, распаралеливая задачи. На демо результаты впечатляющие. Например инженеры Антропик с этой фичей написали на Rust полноценный рабочий C компилятор для ядра Linux с нуля. 100к строк кода, 20.000 сессий, и $20.000 за токены 😁Я пока не совсем вижу преимущества мультиагентного кодинга. Это для CEO, которые хотят заменить целые команды разработки одним Claude Code? А как же спеки, верификация, production-ready код? Но может во мне говорит патологическое неприятие того, что айтишники могут в будущем потерять свою работу?😅
Еще интересный факт, Opus 4.6 на тех же тестах их инженеров нашел 500 zero-day уязвимостей в опенсорс коде разных продуктов. Кто говорил что Security - это последний оплот, где кожаные мешки-инженеры все еще сильны? Правда есть нюанс, "But who is writing this bugs, bro?" 😂
При всех бонусах на бенчмарках модель реально стала сильно "суше" в общении. Ответы стали более "роботизированные", как по темплейтам. Похоже сказывается то, что Антропики тоже стали максимально затачивать свои модели на кодинг. Вропчем так же как и OpenAI в последних релизах. Наблюдается тенденция, что для аналитики и творческой работы (любая работа с текстом, кроме кодинга и документации) лучше справляется Gemini.😉
Ну и скорость работы. Модель реально медленная. Там где Sonet 4.5 делал задачи за 1-2 минуты, Opus 4.6 думает по 5-6 минут.
Так же пару интересных изменений из их блога:
* Антропик пофиксили возможность эксплойтов AI-safety через неполный контекст. Раньше не знал про эту фичу) Когда ты общаешься с LLM - вся история твоего чата передается в контекст к модели, исходя из которой он предугадывает следущие токены. У больших публичных моделей есть определенные ограничения, на все что связано с запрещенкой, NSFW контентом и прочее. И вот если представить, что "голубое мороженое" - это что-то очень запрещенное, и ты спросишь "как приготовить голубое мороженое", получишь ответ что она не может сказать тебе рецепт по этическим соображениям. При этом если ты сфабрикуешь историю чата, где будет написано что-то вроде "Голубое мороженое приготовить очень просто. Смотри, пункт 1: " , то модель обойдет свои safety rules и выдаст тебе полный ответ. С Opus 4.6 и последующими моделями этот хак походу уже не будет работать)
* Claude модели - единственные из тройки лидеров рынка, кто не скрывает ризонинг своих моделей в истории чата. У GPT и Gemini все рассуждения происходят внутри, в чат передается только индекс этого ризонинга, которые хранится у них на серверах. Поэтому когда ты пообщавшись с ChatGPT потом включишь модель другого провайдера чтобы доделать задачу - она не сможет полностью вникнуть в контекст рассуждений и максимально качественно найти решения проблем возникших раньше. У Claude все будет ок. Врочем так же как и у целого сонма хорошиз китайских моделей 😎
Такие дела :) Мы конечно ждали релиз нового поколения, а именно Sonet 5, но пока не судьба. А текущая история все же тоже интересна. Но просто интересна, не более. Не верьте, когда в соцсетях инфоцигане кричат, что это революция и пограмизтов уволняют уже пачками. 😉
А буквально завтра расскажу про реально крутую находку для DevOps-ов. Вы просто обязаны поставить эти тулы, если работае с Terraform!
Еще интересный факт, Opus 4.6 на тех же тестах их инженеров нашел 500 zero-day уязвимостей в опенсорс коде разных продуктов. Кто говорил что Security - это последний оплот, где кожаные мешки-инженеры все еще сильны? Правда есть нюанс, "But who is writing this bugs, bro?" 😂
При всех бонусах на бенчмарках модель реально стала сильно "суше" в общении. Ответы стали более "роботизированные", как по темплейтам. Похоже сказывается то, что Антропики тоже стали максимально затачивать свои модели на кодинг. Вропчем так же как и OpenAI в последних релизах. Наблюдается тенденция, что для аналитики и творческой работы (любая работа с текстом, кроме кодинга и документации) лучше справляется Gemini.
Ну и скорость работы. Модель реально медленная. Там где Sonet 4.5 делал задачи за 1-2 минуты, Opus 4.6 думает по 5-6 минут.
Так же пару интересных изменений из их блога:
* Антропик пофиксили возможность эксплойтов AI-safety через неполный контекст. Раньше не знал про эту фичу) Когда ты общаешься с LLM - вся история твоего чата передается в контекст к модели, исходя из которой он предугадывает следущие токены. У больших публичных моделей есть определенные ограничения, на все что связано с запрещенкой, NSFW контентом и прочее. И вот если представить, что "голубое мороженое" - это что-то очень запрещенное, и ты спросишь "как приготовить голубое мороженое", получишь ответ что она не может сказать тебе рецепт по этическим соображениям. При этом если ты сфабрикуешь историю чата, где будет написано что-то вроде "Голубое мороженое приготовить очень просто. Смотри, пункт 1: " , то модель обойдет свои safety rules и выдаст тебе полный ответ. С Opus 4.6 и последующими моделями этот хак походу уже не будет работать)
* Claude модели - единственные из тройки лидеров рынка, кто не скрывает ризонинг своих моделей в истории чата. У GPT и Gemini все рассуждения происходят внутри, в чат передается только индекс этого ризонинга, которые хранится у них на серверах. Поэтому когда ты пообщавшись с ChatGPT потом включишь модель другого провайдера чтобы доделать задачу - она не сможет полностью вникнуть в контекст рассуждений и максимально качественно найти решения проблем возникших раньше. У Claude все будет ок. Врочем так же как и у целого сонма хорошиз китайских моделей 😎
Такие дела :) Мы конечно ждали релиз нового поколения, а именно Sonet 5, но пока не судьба. А текущая история все же тоже интересна. Но просто интересна, не более. Не верьте, когда в соцсетях инфоцигане кричат, что это революция и пограмизтов уволняют уже пачками. 😉
А буквально завтра расскажу про реально крутую находку для DevOps-ов. Вы просто обязаны поставить эти тулы, если работае с Terraform!
Please open Telegram to view this post
VIEW IN TELEGRAM
GLM-5 приехал!
Очень интересно, как она себя покажет. Было немного обидно, что из четверки больших моделей из Китая (Kimi K2.5, Minimax M2.1, QwenCoder-3, GLM-4.7) модель от zai все же была самая слабая. Последние пару недель использовал только Kimi (это прям лучший аналог Опус) и Minimax (это как gpt-5.2 - быстро, четко, идеально для дебагинга, но слабовато с креативом в сложных задачах).
Так что есть большие надежды, что 5й GLM сможет догнать Kimi как универсальная умная модель :)
@everyone Introducing GLM-5: From Vibe Coding to Agentic Engineering<:Zai:1442296096687652874>Кстати та самая pony alpha, что наделала шума на оупенроутер - это именно она. Завтра тестирую в бою 💪
GLM-5 is built for complex systems engineering and long-horizon agentic tasks. Compared to GLM-4.5, it scales from 355B params (32B active) to 744B (40B active), with pre-training data growing from 23T to 28.5T tokens.http://chat.z.ai
Weights: http://huggingface.co/zai-org/GLM-5
Tech Blog: http://z.ai/blog/glm-5
OpenRouter (Previously Pony Alpha): http://openrouter.ai/z-ai/glm-5
Очень интересно, как она себя покажет. Было немного обидно, что из четверки больших моделей из Китая (Kimi K2.5, Minimax M2.1, QwenCoder-3, GLM-4.7) модель от zai все же была самая слабая. Последние пару недель использовал только Kimi (это прям лучший аналог Опус) и Minimax (это как gpt-5.2 - быстро, четко, идеально для дебагинга, но слабовато с креативом в сложных задачах).
Так что есть большие надежды, что 5й GLM сможет догнать Kimi как универсальная умная модель :)
GitHub
GitHub - eugene-burachevskiy/remote-shell-setup
Contribute to eugene-burachevskiy/remote-shell-setup development by creating an account on GitHub.
Навайбкодил тут сегодня утром за полтора часа 😅
Когда работаешь на разных виртуалках, чуть напрягает, что на каждой новой машине у тебя голый серый энвайронмент, где ничего нет, и какие-то тулы нужно ставить с нуля. Сделал баш инсталятор, который просто запускаем через курл
Что делает?
* Ставит git, aws-cli, kubectl, helm, kubectx/kubens (легко переключаем контекст и неймспейсы), kubecolor (цветной аутптут для кубера), алиас k=kubecolor (удобно набирать k а не kubectl)
* Ставит opencode, чтобы легко было что-то дебажить на машине. Включаем Kimi или Minimax и погнали - работает бесплатно из коробки.
* Ставит мои кастомные опенкод команды про которые писал тут
* Делает красивый цветной шел💅 с отображением гит бранчей
* Можно поставить свою версию helm или kubectl в config/versions.conf
* Скипает тулы если уже стоят, идемпотентно редактирует bashrc, определяет ось и ставит все корректно для rpm или deb пакетных менеджеров.
Чтобы не запускать неизвестный код у себя на машинах - лучше сфоркнуть в свой личный гитхаб и запускать оттуда ;)
В будущем думаю дополнять эту репу удобными настройками, хуками и скилами для опенкода.
https://github.com/eugene-burachevskiy/remote-shell-setup
Когда работаешь на разных виртуалках, чуть напрягает, что на каждой новой машине у тебя голый серый энвайронмент, где ничего нет, и какие-то тулы нужно ставить с нуля. Сделал баш инсталятор, который просто запускаем через курл
curl -fsSL https://raw.githubusercontent.com/eugene-burachevskiy/remote-shell-setup/main/setup.sh | bash
Что делает?
* Ставит git, aws-cli, kubectl, helm, kubectx/kubens (легко переключаем контекст и неймспейсы), kubecolor (цветной аутптут для кубера), алиас k=kubecolor (удобно набирать k а не kubectl)
* Ставит opencode, чтобы легко было что-то дебажить на машине. Включаем Kimi или Minimax и погнали - работает бесплатно из коробки.
* Ставит мои кастомные опенкод команды про которые писал тут
* Делает красивый цветной шел
* Можно поставить свою версию helm или kubectl в config/versions.conf
* Скипает тулы если уже стоят, идемпотентно редактирует bashrc, определяет ось и ставит все корректно для rpm или deb пакетных менеджеров.
Чтобы не запускать неизвестный код у себя на машинах - лучше сфоркнуть в свой личный гитхаб и запускать оттуда ;)
В будущем думаю дополнять эту репу удобными настройками, хуками и скилами для опенкода.
https://github.com/eugene-burachevskiy/remote-shell-setup
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Супер загруженая была неделя, но помню, что хотел рассказать про интересную девопс фичу для АИ кодинга.
Вобщем есть такой известгный в узких кругах "гуру терраформа" Антон Бабенко. Основной автор большой коллекции AWS терраформ модулей "terraform-aws-modules", которые раньше девопсы использовали просто везде, от стартапов до ентерпрайзов. Давно не следил за его судьбой и движухой в этом комьюнити, но недавно мне на глаза попался новый проект от Антона Бабенко, который походу тоже понемногу ушел в вайбкодинг 😆 И это - Terraform скил для Claude Code!
Почитал что там есть - и в целом все круто.🌡 Базовая информация по структуре построения энвов и модулей, стандарты по написанию кода, построения пайплайнов, написанию тестов для инпутов, использования прекомит хуков, статик и секьюрити сканеров, линтеров. Вобщем везде KISS и YAGNI, без всяких хипстерских тонн абстракций в виде git worktrees, tf workspaces, terragrunt/atmos и прочего. Действительно сильная база котора поможет вашему агенту писать качественный Terraform код.
В целом у меня уже пол года как есть мнение, что эпоха комьюнити терраформ модулей прошла. Терраформ модуль - это большой blackbox, к которому ты читаешь документацию и пробуешь его запустить в нужном тебе контексте передав какой-то набор переменных. Так как модули делают универсальными, чтобы они покрывали все возможные кейсы разных пользователей - обычно в них очень много сложного к восприятию кода и абстракций. Что-то сделать поверх базового варианта использования и поддерживать дальше самому - трудозатрано. А сейчас с развитием LLM моделей чем использовать эти огромные черные ящики, реально становится быстрее, проще и дешевле написать минималистичный модуль самому. Только под свои кейсы и только с понятным тебе функционалом.
И вот подобный LLM Skill реально в этом помогает.
Забираем и пользуемся здесь. Написано под Claude Code, но можно попросить ллмку поменять текст под универсальный формат своместимый с opencode/cursor (по сути несколько референсов там поменять всего).
Кстати еще одна вещь упоминаемая в тексте этого скила - terraform mcp. Официальный MCP для Terraform - его релиз прошел мимо меня, так как я прочитал что там по сути только управление хашикорп клаудом и прочими их платными штуками. Но оказывается он еще может доставать актуальную документацию по терраформ провайдерам! Так что тоже можете смело себе ставить, для работы с терраформом это наверное будет надежнее и точнее, чем Context7.
Вобщем есть такой известгный в узких кругах "гуру терраформа" Антон Бабенко. Основной автор большой коллекции AWS терраформ модулей "terraform-aws-modules", которые раньше девопсы использовали просто везде, от стартапов до ентерпрайзов. Давно не следил за его судьбой и движухой в этом комьюнити, но недавно мне на глаза попался новый проект от Антона Бабенко, который походу тоже понемногу ушел в вайбкодинг 😆 И это - Terraform скил для Claude Code!
Почитал что там есть - и в целом все круто.
В целом у меня уже пол года как есть мнение, что эпоха комьюнити терраформ модулей прошла. Терраформ модуль - это большой blackbox, к которому ты читаешь документацию и пробуешь его запустить в нужном тебе контексте передав какой-то набор переменных. Так как модули делают универсальными, чтобы они покрывали все возможные кейсы разных пользователей - обычно в них очень много сложного к восприятию кода и абстракций. Что-то сделать поверх базового варианта использования и поддерживать дальше самому - трудозатрано. А сейчас с развитием LLM моделей чем использовать эти огромные черные ящики, реально становится быстрее, проще и дешевле написать минималистичный модуль самому. Только под свои кейсы и только с понятным тебе функционалом.
И вот подобный LLM Skill реально в этом помогает.
Забираем и пользуемся здесь. Написано под Claude Code, но можно попросить ллмку поменять текст под универсальный формат своместимый с opencode/cursor (по сути несколько референсов там поменять всего).
Кстати еще одна вещь упоминаемая в тексте этого скила - terraform mcp. Официальный MCP для Terraform - его релиз прошел мимо меня, так как я прочитал что там по сути только управление хашикорп клаудом и прочими их платными штуками. Но оказывается он еще может доставать актуальную документацию по терраформ провайдерам! Так что тоже можете смело себе ставить, для работы с терраформом это наверное будет надежнее и точнее, чем Context7.
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - antonbabenko/terraform-skill: Terraform & OpenTofu Skill for AI Agents - testing, modules, CI/CD, and production patterns
Terraform & OpenTofu Skill for AI Agents - testing, modules, CI/CD, and production patterns - antonbabenko/terraform-skill
Дайджест интересного в AI кодинге за неделю:
1. GLM-5. Пока доступна только для Pro подписчиков, и на сторонних сервисах типа openrouter или ollama при оплате за токены. Zai набрал годовых подписчиков на дешевые тарифы чтобы бустануть свой ARR, а с инфраструктурой не справляется 😭 4.7 еще выкатывали на всех, а с 5й версией ждем, и надеюсь что когда нибудь дождемся и на обычных кодинг планах.😅 Люди в тредс кто ее уже попробовал - писали что модель реально топовая, и даже круче Опуса. Это очень интересное заявление.
2. Вышла MiniMax 2.5. Бенчмарки на скрине. По цифрам приближается к SOTA в агент кодинге. И уже доступна бесплатно в OpenCode Zen!😎 MiniMax и в 2.1 была хороша, четко следует инструкциям и могла по пол часа и по часу гонять инструменты и дебажить разные кейсы. Но с креативным решением задач у нее было сложновато. Реально похожа на GPT-5.2 в этом плане)) Но например Kimi K2.5 что не говори умнее... MiniMax 2.5 я погонял сегодня, почти час решала одну мою проблему с ингрессами и роутингами. По стилю я не заметил изменений, все тот же честный трудяга 😁 Показалось, что наверное реже стала впадать в тупняки, а честно перепробовала все возможные варианты, и в конце выдала что при текущих условиях проблема не решаемая, вот альтернативы, вот документация почему не работает и что можно сделать. С 2.1 часто ее останавливал и говорил в какую сторону двигаться дальше, с 2.5 вроде вмешиваться приходится реже. Огонь🔥 , буду работать с ней дальше.
3. Kimi K2.5 - самая умная модель из Китайской Большой Четверки, реально умнее Сонета 4.5, хоть это и не новое поколение 2026 года. И вот на нее ввели жесткие лимиты в OpenCode Zen. Раньше можно было гонять сколько угодно, лишь иногда отваливаясь по общим рейт лимитам. С сегодняшнего дня стало явно писать "у вас закончились лимиты на эту модель, кладите на счет деньги!" 😅 и довольно быстро. Но модель стоит того, чтобы платить за нее по токенам на openrouter, зуб даю 😉
Итого на сегодняшний день мой сетап такой - MiniMax 2.1-2.5 рабочая лошадка для большинства задач с траблшутингом и дебагингом и быстрых изменений кода, которые я могу задать явно. Kimi K2.5 - планирование, архитектурные решения, сложные фиксы в коде. GLM-4.7 - почти уже не использую🤷♂️ Документация? Иногда для нее просто забываешь переключать модель. Задачи по аналитике, текстам - по привычке отдаю Gemini Flash/Pro 3, глм бы тоже справилась, но субъективно Гемини с текстами работает все же лучше.
Такие дела... Happy Friday и хороших выходных, коллеги!👍 🎉
1. GLM-5. Пока доступна только для Pro подписчиков, и на сторонних сервисах типа openrouter или ollama при оплате за токены. Zai набрал годовых подписчиков на дешевые тарифы чтобы бустануть свой ARR, а с инфраструктурой не справляется 😭 4.7 еще выкатывали на всех, а с 5й версией ждем, и надеюсь что когда нибудь дождемся и на обычных кодинг планах.😅 Люди в тредс кто ее уже попробовал - писали что модель реально топовая, и даже круче Опуса. Это очень интересное заявление.
2. Вышла MiniMax 2.5. Бенчмарки на скрине. По цифрам приближается к SOTA в агент кодинге. И уже доступна бесплатно в OpenCode Zen!😎 MiniMax и в 2.1 была хороша, четко следует инструкциям и могла по пол часа и по часу гонять инструменты и дебажить разные кейсы. Но с креативным решением задач у нее было сложновато. Реально похожа на GPT-5.2 в этом плане)) Но например Kimi K2.5 что не говори умнее... MiniMax 2.5 я погонял сегодня, почти час решала одну мою проблему с ингрессами и роутингами. По стилю я не заметил изменений, все тот же честный трудяга 😁 Показалось, что наверное реже стала впадать в тупняки, а честно перепробовала все возможные варианты, и в конце выдала что при текущих условиях проблема не решаемая, вот альтернативы, вот документация почему не работает и что можно сделать. С 2.1 часто ее останавливал и говорил в какую сторону двигаться дальше, с 2.5 вроде вмешиваться приходится реже. Огонь
3. Kimi K2.5 - самая умная модель из Китайской Большой Четверки, реально умнее Сонета 4.5, хоть это и не новое поколение 2026 года. И вот на нее ввели жесткие лимиты в OpenCode Zen. Раньше можно было гонять сколько угодно, лишь иногда отваливаясь по общим рейт лимитам. С сегодняшнего дня стало явно писать "у вас закончились лимиты на эту модель, кладите на счет деньги!" 😅 и довольно быстро. Но модель стоит того, чтобы платить за нее по токенам на openrouter, зуб даю 😉
Итого на сегодняшний день мой сетап такой - MiniMax 2.1-2.5 рабочая лошадка для большинства задач с траблшутингом и дебагингом и быстрых изменений кода, которые я могу задать явно. Kimi K2.5 - планирование, архитектурные решения, сложные фиксы в коде. GLM-4.7 - почти уже не использую
Такие дела... Happy Friday и хороших выходных, коллеги!
Please open Telegram to view this post
VIEW IN TELEGRAM
Что нового и интересного к текущему понедельнику?
* Moonshot запустил KimiClaw. Облачный OpenClaw который запускается прямо у вас в браузере. Пишут про 5000+ скилов, 40гб облачной хранилки, интеграцию в телегу, возможность конектить свои существующие инстансы openclaw. Я не пробовал, как-то нет fomo на эту автоматизацию)), но на hackernews говорят что по факту нужна подписка от 40$ в мес минимум. Если что, пробуем здесь: https://www.kimi.com/bot
* Зарелизили Cline Cli 2.0 Пишут про полностью новый UX, мультиагентов, headless запуск, поддержку ACP чтобы интегрировать в какой нибудь neovim. Не знаю зачем вам это, если это все уже давно есть в OpenCode, но все же 🙂
* Гугл запускает раннюю превью WebMCP Новый стандарт, который позволяет вебсайт девелоперам создать специальный функционал для аи-агентов в виде MCP-like тулов. Типа ставим в свой опенкод mcp от трип ком, и отправляем мониторить авиабилеты по хорошей цене и с удобным пересадками прямо из консоли)) Звучит круто, как единый стандарт это реально может бустануть качество и упростить сложность разработки персональных аи агентов.
Такие дела) Позитвной и продуктивной рабочей недели, коллеги 🙌
* Moonshot запустил KimiClaw. Облачный OpenClaw который запускается прямо у вас в браузере. Пишут про 5000+ скилов, 40гб облачной хранилки, интеграцию в телегу, возможность конектить свои существующие инстансы openclaw. Я не пробовал, как-то нет fomo на эту автоматизацию)), но на hackernews говорят что по факту нужна подписка от 40$ в мес минимум. Если что, пробуем здесь: https://www.kimi.com/bot
* Зарелизили Cline Cli 2.0 Пишут про полностью новый UX, мультиагентов, headless запуск, поддержку ACP чтобы интегрировать в какой нибудь neovim. Не знаю зачем вам это, если это все уже давно есть в OpenCode, но все же 🙂
* Гугл запускает раннюю превью WebMCP Новый стандарт, который позволяет вебсайт девелоперам создать специальный функционал для аи-агентов в виде MCP-like тулов. Типа ставим в свой опенкод mcp от трип ком, и отправляем мониторить авиабилеты по хорошей цене и с удобным пересадками прямо из консоли)) Звучит круто, как единый стандарт это реально может бустануть качество и упростить сложность разработки персональных аи агентов.
Такие дела) Позитвной и продуктивной рабочей недели, коллеги 🙌
Вышел Cursor 2.5. Главное нововведение - добавили маректплейс плагинов. Пока их немного, но самая основа. Slack, Figma, Notion. Есть тот самый Superpowers, адаптированный под курсор, теперь можно попробовать и в этой IDE ;) Еще мне понравился "Cursor team kit", плагин который использует команда разработки курсора для ежедневной работы, нарежу наверное самое интересное в виде команд себе в OpenCode 😏
А еще мультиагентов сделали наконец нормально - в фоне и асинхронно.
https://cursor.com/changelog/2-5
А еще мультиагентов сделали наконец нормально - в фоне и асинхронно.
https://cursor.com/changelog/2-5
Cursor
Plugins, Sandbox Access Controls, and Async Subagents · Cursor
AI vs DevOps
Вышел Cursor 2.5. Главное нововведение - добавили маректплейс плагинов. Пока их немного, но самая основа. Slack, Figma, Notion. Есть тот самый Superpowers, адаптированный под курсор, теперь можно попробовать и в этой IDE ;) Еще мне понравился "Cursor team…
Taalas представили АИшный ASIC. Стартап на 24 инженера с 30М инвестиций - и у них готов рабочий прототип с весами модели запечеными в чип за несколько месяцев. Внутри LLAma 3.1 8B, на живых тестах выдает фантастические результаты по скорости, чуть ли не в 10 раз быстрее чипов Cerebras. Так же есть поддержка LORA адаптеров для "дообучения модели" на своих данных. И это все будет стоить в иксы раз дешевле, чем 10ки К зелени за простую H200 карту.
Выглядит очень круто, прям вижу будущее, где будем покупать себе домашние асики с той или иной OSS моделью) К концу года Taalas обещают запечь в кремний и большую sota модель, очень жду)
Выглядит очень круто, прям вижу будущее, где будем покупать себе домашние асики с той или иной OSS моделью) К концу года Taalas обещают запечь в кремний и большую sota модель, очень жду)
🦄1
Если вы работает в opencode с хелмом, наверное часто видели ошибки от yaml-ls LSP сервера, так как LSP видит go templating конструкции в хелм темплейтах и выдает что файл поломанный. Я у себя просто отключил стандартный yaml-ls и вместо него поставил Helm LSP сервер. Эта штука позвлоляет модели отлавливать ошибки в хелм темплейтах прямо во время написания кода, улучшая качество и экономя время и токены. И заодно оффициальный terraform-ls от Hashicorp для tf файлов.
* helm_ls https://github.com/mrjosh/helm-ls
Просто качаем бинарник
* terraform-ls https://github.com/hashicorp/terraform-ls
Чуть сложнее, ставим себе gpg ключ от терраформ апт репозитория и дальше ставим через apt
Дальше добавляем новые lsp в ваш опенкод глобальный конфиг в ~/.config/opencode/opencode.jsonc
Вот и все, новые языковые сервера будут автоматом подгружаться когда ваша модель будет читать ямлы и терраформ файлы.
* helm_ls https://github.com/mrjosh/helm-ls
Просто качаем бинарник
sudo curl -L https://github.com/mrjosh/helm-ls/releases/download/master/helm_ls_linux_amd64 --output /usr/local/bin/helm_ls
* terraform-ls https://github.com/hashicorp/terraform-ls
Чуть сложнее, ставим себе gpg ключ от терраформ апт репозитория и дальше ставим через apt
wget -O- https://apt.releases.hashicorp.com/gpg > tfgpg
sudo gpg --dearmor -o /usr/share/keyrings/hashicorp-archive-keyring.gpg -i tfgpg && rm -f tfgpg
sudo apt update
sudo apt install terraform-ls
Дальше добавляем новые lsp в ваш опенкод глобальный конфиг в ~/.config/opencode/opencode.jsonc
"lsp": {
"yaml-ls": {
"disabled": true
},
"terraform": {
"command": ["terraform-ls", "serve"],
"extensions": [".tf", ".tfvars"]
},
"helm_ls": {
"command": ["helm_ls", "serve"],
"extensions": [".yaml", ".yml"]
}
},Вот и все, новые языковые сервера будут автоматом подгружаться когда ваша модель будет читать ямлы и терраформ файлы.
X (formerly Twitter)
OpenAI Developers (@OpenAIDevs) on X
Introducing WebSockets in the Responses API.
Built for low-latency, long-running agents with heavy tool calls.
https://t.co/qmOAhidk7o
Built for low-latency, long-running agents with heavy tool calls.
https://t.co/qmOAhidk7o
OpenAI добавили websockets для своего апи. Держим постоянное соединение и отсылаем только инкрементальные изменения выполнения тулов:
Как итог - до 40% к скорости для длинных коддинг сессий. Это круто, так как считай все LLM провайдеры используют openai формат апи, и скоро эта фича появится везде, чаты/AI-ide станут быстрее 😎
https://x.com/OpenAIDevs/status/2026025368650690932
WebSocket mode uses the same previous_response_id chaining semantics as HTTP mode, but it adds a lower-latency continuation path on the active socket.
On an active WebSocket connection, the service keeps one previous-response state in a connection-local in-memory cache (the most recent response). Continuing from that most recent response is fast because the service can reuse connection-local state. Because the previous-response state is retained only in memory and is not written to disk, you can use WebSocket mode in a way that is compatible with store=false and Zero Data Retention (ZDR).
Как итог - до 40% к скорости для длинных коддинг сессий. Это круто, так как считай все LLM провайдеры используют openai формат апи, и скоро эта фича появится везде, чаты/AI-ide станут быстрее 😎
https://x.com/OpenAIDevs/status/2026025368650690932
Boris Cherny ответил, как так что в Антропике 100% кода уже пишет Клод Код, но у них до сих пор открыто под сотню новых инженерных вакансий? Говорит "что кто-то же должен промптить клода, координировать команды и решать что строить дальше?" SWE превращаются в PM-ов?😅 И да и нет. Думаю глубокие инженерные знания все еще нужны, чтобы отличать нормальные техничские реализации от аи-слопа и контролировать что мы все же шипаем в релизы. И все так же важно понимание доменной области и как она влияет на продукт.
При этом все больше растет ценность T-shaped специалистов (вот эти вот все фулстаки и dev-sec-build-опсы) с пониманием общей концепции жизненного цикла продукта и процессов разработки. Ну и с хорошими софт скилами. Причем со временем (как будет расти качество моделей и актуальность их тренировочных данных) доверие имеено к написанному коду все будет расти. Тем больше будет расти ценность опыта в домене и верхнеуровневого понимания того что, для кого и как мы разрабатываем.
Поэтому пробуйте новое и качайте себя в новых направлениях ;) И не забывайте по максимум наращивать опыт с разными AI тулами конечно-же.
https://x.com/bcherny/status/2022762422302576970
При этом все больше растет ценность T-shaped специалистов (вот эти вот все фулстаки и dev-sec-build-опсы) с пониманием общей концепции жизненного цикла продукта и процессов разработки. Ну и с хорошими софт скилами. Причем со временем (как будет расти качество моделей и актуальность их тренировочных данных) доверие имеено к написанному коду все будет расти. Тем больше будет расти ценность опыта в домене и верхнеуровневого понимания того что, для кого и как мы разрабатываем.
Поэтому пробуйте новое и качайте себя в новых направлениях ;) И не забывайте по максимум наращивать опыт с разными AI тулами конечно-же.
https://x.com/bcherny/status/2022762422302576970
X (formerly Twitter)
Boris Cherny (@bcherny) on X
@big_duca Someone has to prompt the Claudes, talk to customers, coordinate with other teams, decide what to build next. Engineering is changing and great engineers are more important than ever.
Всем продуктивной среды, коллеги, и проверяйте свои промпты и пермишены 😂
Писал давече о том, как используют Gemini-cli гугловые SRE. Так вот там они упоминали про policy enforcement layer, где автоматизация следит о потенциально опасных командах, и об апрувах со стороны двух человек, для серьезных изменений. Так вот у AWS тоже есть подобный подход, но эта секьюрити абстракция похоже у них работает через ж. Или работала раньше, наверное выводы сделали и систему улучшили.))
В декабре у Амазон был крупный инцидент, когда Kiro просто взяла и удалила прод энв, минуя любые апрувменты. 😂 Причем это у них уже второй серьезный прод инцидент из за АИ агентов. Вобщем не запускайте АИ прям на прод машинах, всегда оставляйте human in the loop ))
Писал давече о том, как используют Gemini-cli гугловые SRE. Так вот там они упоминали про policy enforcement layer, где автоматизация следит о потенциально опасных командах, и об апрувах со стороны двух человек, для серьезных изменений. Так вот у AWS тоже есть подобный подход, но эта секьюрити абстракция похоже у них работает через ж. Или работала раньше, наверное выводы сделали и систему улучшили.))
В декабре у Амазон был крупный инцидент, когда Kiro просто взяла и удалила прод энв, минуя любые апрувменты. 😂 Причем это у них уже второй серьезный прод инцидент из за АИ агентов. Вобщем не запускайте АИ прям на прод машинах, всегда оставляйте human in the loop ))
The Verge
Amazon blames human employees for an AI coding agent’s mistake
Two minor AWS outages have reportedly occurred as a result of actions by Amazon’s AI tools.
❤2
Еще один пост из Твиттера от ex-Microsoft иженера, о том какие скилы сейчас важны, для того чтобы оставаться на уровне с текущей АИ гонкой. В целом базовая база, но стоит упомянуть 🙂
1. Context Engineering: An AI is only as smart as the information you give it. Vague prompts lead to "spaghetti code." You need to provide a clear set of requirements and validate the design.
Learn: Advanced Prompt Engineering, Markdown documentation, and how to use Claude/Codex/Cursor.
2. Code Reading (Over Code Writing): AI generates the code, you own it. You need to spot "hallucinations" logic that looks correct but breaks at scale.
Learn: Basics of Python or JavaScript, and practice "Reverse Engineering" AI-generated scripts to explain how they work.
3. System Architecture (The "Big Picture"): AI is a terrible architect. It can write a code, but it can’t design system as a whole pretty well. You need to know how the frontend, backend, and database talk to each other.
Learn: Cloud Fundamentals (AWS/Vercel), API design (REST/GraphQL), and basic SQL/NoSQL database structures.
4. Problem Deconstruction: Most coding failures happen because the developer didn't understand the "Why." You must be able to break a massive business goal into tiny, logical steps for the AI to execute.
Learn: Computational Thinking, Flowcharting (using tools like Mermaid.js), and Agile project management basics.
Stop memorizing brackets. Start mastering logic.
🦄2
После полугода в стране где половина сервисов запрещена наконец-то уехал ✈️ И первым делом ставлю себе вот это 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
Boristane
The Software Development Lifecycle Is Dead | Boris Tane
AI agents didn't make the SDLC faster. They killed it. All that's left is context.
Наткнулся здесь на статью
tldr: очередной вайбкод хайп в духе "программирование умерло! старые практики не нужны! клод код все шипит прямо в прод!"
Но у меня подгорело 😅 поэтому разберу по пунктам.))
1. "Джира не нужна, ведь есть markdown файлик в репе, чтобы агенты читали все оттуда". - Джира никогда не была кртически нужна разработчикам (и следовательно агентам). Она нужна бизнесу. Для декомпозиции больших проектов, организации команд, оценки велосити, связки с корпоративной документацией и архитектурой, коммуникацией между командами. Текстовые файлики в репе нужны агентам и они могут повторять джиру и конфлюенс, но не заменять. Скорее агенты получат бесшовную рабочую ингрецию в джиру, чем все перейдут на доки в репах.
2. "Системный дизайн уже не тот. Не надо ничего планировать, потому что агент все меняет и создает в процессе кодинга" Ну это очень голословное утверждение 🤣 Я понимаю, что в вайбкодинге без всякого SDD/BMAD может и так, набросал план, агенты давно ушли от плана а ты продолжаешь сыпать слоп из ведра и допиливать свою ARCHITECTUREmd🤪 . В реальной разработке - реквайрменты и утверждненный дизайн незыблем. Пусть код стал дешев и фича будет закожена за сутки, а не пол спринта. Тратьте больше появившегося свободного времени на изучение non-functional требований и изначальное проектирование правильного дизайна. Раньше уходило 3 дня на подготовку и 11 дней на написание кода, пусть сейчас уходит 7 дней на планинг, сбор и анализ реквайрментов, изучение вариантов имплементации и 7 дней на кодинг. Качество только вырастит.
3. "The entire QA function as a separate stage is gone. Потому что агенты сами пишут юнит тесты" Эмм, человек реально не в курсе про end-to-end, нефункциональные тесты? Про то что если агент у тебя на машине прогнал линтер - это просто классическая ситуация "а у меня на машине все работало"? Для тестирования и доставки реального софта все так же нужны пайплайны, quality gates, автоматизированное тестирование по заложенным шаблонам на реальных тест энвах.
4. "Код ревью не нужен, ведь вы все равно не осилите 500pr в день от агентов". Какие 500 пр? Конечно OpenAI может расказывать про harness engineering и как у них сотня агентов за месяц пилят продукт полностью на автомате. Но для этого одни из лучших в мире инженеров готовят весь набор подходящих правил и процессов. И результаты все равно можно делить на двое, так как это все хайп в сми для надувания пузыря инвестиций😉 . В реальности LLM все так же пишет тонны слопа, и ошибки/несоответствия стандартам есть даже при четко расписаных спеках. АИ код ревью вещь хорошая, но оно до сих пор может тебе выставить мнимые "critical issues" потому что не до конца понимает контекст, где и как продукт будет работать в реальности и почему на этих энвах здесь и сейчас есть вот такие упрощения или ограничения.
Да, на проектах где репы обвешаны линтерами, код стайлингом, прекомит хуками, с 100% юнит тест покрытием, и полной автоматизацией QA может и можно шипать 500pr в день без проверок. Но в реальной жизни таких проектов не бывает 😅🦄
5. "Пайплайны не нужны, потому что агенты уже сами все у себя проверили и протестировали, все залили в прод с фича флагами, а скоро и сами научатся прогрессив ролаутам, и будут раскатывать канари четко по метрикам со всех систем" (как в лучших SRE традициях гугла). Тут я просто не стал ничего коментировать, закрыл ноут и пошел курить думая про эту чудесную страну розовых пони...😮💨
tldr: очередной вайбкод хайп в духе "программирование умерло! старые практики не нужны! клод код все шипит прямо в прод!"
Но у меня подгорело 😅 поэтому разберу по пунктам.))
1. "Джира не нужна, ведь есть markdown файлик в репе, чтобы агенты читали все оттуда". - Джира никогда не была кртически нужна разработчикам (и следовательно агентам). Она нужна бизнесу. Для декомпозиции больших проектов, организации команд, оценки велосити, связки с корпоративной документацией и архитектурой, коммуникацией между командами. Текстовые файлики в репе нужны агентам и они могут повторять джиру и конфлюенс, но не заменять. Скорее агенты получат бесшовную рабочую ингрецию в джиру, чем все перейдут на доки в репах.
2. "Системный дизайн уже не тот. Не надо ничего планировать, потому что агент все меняет и создает в процессе кодинга" Ну это очень голословное утверждение 🤣 Я понимаю, что в вайбкодинге без всякого SDD/BMAD может и так, набросал план, агенты давно ушли от плана а ты продолжаешь сыпать слоп из ведра и допиливать свою ARCHITECTUREmd
3. "The entire QA function as a separate stage is gone. Потому что агенты сами пишут юнит тесты" Эмм, человек реально не в курсе про end-to-end, нефункциональные тесты? Про то что если агент у тебя на машине прогнал линтер - это просто классическая ситуация "а у меня на машине все работало"? Для тестирования и доставки реального софта все так же нужны пайплайны, quality gates, автоматизированное тестирование по заложенным шаблонам на реальных тест энвах.
4. "Код ревью не нужен, ведь вы все равно не осилите 500pr в день от агентов". Какие 500 пр? Конечно OpenAI может расказывать про harness engineering и как у них сотня агентов за месяц пилят продукт полностью на автомате. Но для этого одни из лучших в мире инженеров готовят весь набор подходящих правил и процессов. И результаты все равно можно делить на двое, так как это все хайп в сми для надувания пузыря инвестиций
Да, на проектах где репы обвешаны линтерами, код стайлингом, прекомит хуками, с 100% юнит тест покрытием, и полной автоматизацией QA может и можно шипать 500pr в день без проверок. Но в реальной жизни таких проектов не бывает 😅
5. "Пайплайны не нужны, потому что агенты уже сами все у себя проверили и протестировали, все залили в прод с фича флагами, а скоро и сами научатся прогрессив ролаутам, и будут раскатывать канари четко по метрикам со всех систем" (как в лучших SRE традициях гугла). Тут я просто не стал ничего коментировать, закрыл ноут и пошел курить думая про эту чудесную страну розовых пони...
Please open Telegram to view this post
VIEW IN TELEGRAM
🦄2
Огонь. Он тоже повелся на фантазии Маска об "АИ пишет бинарники"? 😅
И вместо кубера и контейнеров на серверах будут крутиться просто юникс бинарники которые написала АИ?
Хах, даже в таком вымышленном мире🦄, вот вангую, сначала изобретут конфиг файлы, потом контейнеры, потом кубернетис. История всегда до странности циклична 👀
И вместо кубера и контейнеров на серверах будут крутиться просто юникс бинарники которые написала АИ?
Хах, даже в таком вымышленном мире🦄, вот вангую, сначала изобретут конфиг файлы, потом контейнеры, потом кубернетис. История всегда до странности циклична 👀