Кстати Курсор чарджит вас даже если вы используете свои личные ключи. Заметил что за неделю использовал 3/4 месячного плана, хотя использовал практически только свои Gemini и GLM. Вот ответ сапорта:
Такие дела 🥲 Реально дорогой инструмент для работы. Но раньше я замечал, для своих ключей они тебя не блочили, даже если твой план потрачен полностью. Если они и это отменили и Курсор в этом месяце полностью отвалится - наверное полностью перейду на OpenCode/Claude Code🤷♂️
Your usage is charged based on tokens consumed, and for team plans, there's an additional Cursor Token Fee of $0.25 per million tokens for non-Auto models. This fee applies to all models except Auto, including when you use your own API keys (BYOK) for models like Gemini and GLM.
The Cursor Token Fee covers infrastructure costs, codebase indexing, and tool execution that Cursor provides regardless of which API keys you use. So even though your BYOK requests show $0.00 for the API cost, they still incur the $0.25/M tokens infrastructure fee.
Такие дела 🥲 Реально дорогой инструмент для работы. Но раньше я замечал, для своих ключей они тебя не блочили, даже если твой план потрачен полностью. Если они и это отменили и Курсор в этом месяце полностью отвалится - наверное полностью перейду на OpenCode/Claude Code
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
X (formerly Twitter)
Andrej Karpathy (@karpathy) on X
A few random notes from claude coding quite a bit last few weeks.
Coding workflow. Given the latest lift in LLM coding capability, like many others I rapidly went from about 80% manual+autocomple…
Coding workflow. Given the latest lift in LLM coding capability, like many others I rapidly went from about 80% manual+autocomple…
Интересный твитер пост от Андрея Карпаты, известного крутого инженера из Tesla AI и позже одного из фаундеров OpenAI. Говорит что за последние месяцы, где-то с ноября 2025 произошел фазовый сдвиг в способностях LLM-агентов в плане кодинга. Если раньше он писал 80% кода и 20% генерировало АИ, сейчас наоборот, 80% его кода генерирует LLM и он уже практически не пишет руками. По его словам это самое большое изменение за его 20-летний опыт программирования.
Но от людей откызываться конечно рано, модели хорошо вдаются в детали, но все еще слабы в стратегическом видении. Плюс часто пишут не эффективно, рождая тысячи строк аи слопа, хотя стоит их поправить - легко меняют решение на 100 строк элегантного кода :) Но все равно разрыв между "10X engineer" c АИ инструментами и обычным инженером работающим по-старинке в 2026 может вырасти колоссально. Плюс намечается тенденция, что инженеры-генералисты (T-shape) могут получить преимущество над усзкоспециазированными инженерами, сильными только в одной своей нише.
Так же есть интересный совет - давать моделям задания не в виде "как сделать", а "какой должен быть результат". Четко обьяснить критерии успеха, в таком случае модель чаще работает эффективнее за много итераций.
В целом 2026 по его словам будет просто slopocalypse в плане софтварных решений не лучшего качества, но при этом и годом огромных возможностей для людей, которые любят не просто кодить, а в целом строить програмные продукты.
Но от людей откызываться конечно рано, модели хорошо вдаются в детали, но все еще слабы в стратегическом видении. Плюс часто пишут не эффективно, рождая тысячи строк аи слопа, хотя стоит их поправить - легко меняют решение на 100 строк элегантного кода :) Но все равно разрыв между "10X engineer" c АИ инструментами и обычным инженером работающим по-старинке в 2026 может вырасти колоссально. Плюс намечается тенденция, что инженеры-генералисты (T-shape) могут получить преимущество над усзкоспециазированными инженерами, сильными только в одной своей нише.
Так же есть интересный совет - давать моделям задания не в виде "как сделать", а "какой должен быть результат". Четко обьяснить критерии успеха, в таком случае модель чаще работает эффективнее за много итераций.
В целом 2026 по его словам будет просто slopocalypse в плане софтварных решений не лучшего качества, но при этом и годом огромных возможностей для людей, которые любят не просто кодить, а в целом строить програмные продукты.
Только успел немного погонять Devstral2 и Vibe-cli на реальных задачах, как Mistral выкатили обнову. Позавчера зарелизели vibe-cli 2.0! 🌡 Из нововведений:
* Саб-агенты с кастомной конфигурацией
* Диалоги с пользователем с выбором нужных вариантов
* Поддержка своих /-slash комманд
В целом радует,, что они расширяют функционал и движутся в сторону OpenCode, у них хороший, удобный, быстрый интерфейс, а фич как в более навороченных AI tmux им не хватало. НО. С выходом vibe-cli-2.0 Миcтраль сделал свою новую кодинг модель платной 🙈 Понимаю, вечной халявы не бывает, но буквально пару меясцев прошло, Грок давал бесплатный инфиренс наверное с пол года :) Так что теперь или покупать Pro план за $15, или платить за апи $0.40/$2. Что практически на уровне Gemini Flash, но у гугла все таки получше моделька, как не крути.🤷♂️
Так что теперь Devstral2 актуален только тем, кому нельзя американские модели от лидеров рынка по какому-либо комплаенсу, или кто находится в странах СНГ и Гугловые модели заблочены по аккаунту, а для остального нужен VPN - в таком случае это реально неплохой вариант для кодинга, смело рекомендую к пробе👍
PS Кстати для новых пользователей все еще есть вариант использовать модель бесплатно, напишу в коментах
* Саб-агенты с кастомной конфигурацией
* Диалоги с пользователем с выбором нужных вариантов
* Поддержка своих /-slash комманд
В целом радует,, что они расширяют функционал и движутся в сторону OpenCode, у них хороший, удобный, быстрый интерфейс, а фич как в более навороченных AI tmux им не хватало. НО. С выходом vibe-cli-2.0 Миcтраль сделал свою новую кодинг модель платной 🙈 Понимаю, вечной халявы не бывает, но буквально пару меясцев прошло, Грок давал бесплатный инфиренс наверное с пол года :) Так что теперь или покупать Pro план за $15, или платить за апи $0.40/$2. Что практически на уровне Gemini Flash, но у гугла все таки получше моделька, как не крути.
Так что теперь Devstral2 актуален только тем, кому нельзя американские модели от лидеров рынка по какому-либо комплаенсу, или кто находится в странах СНГ и Гугловые модели заблочены по аккаунту, а для остального нужен VPN - в таком случае это реально неплохой вариант для кодинга, смело рекомендую к пробе
PS Кстати для новых пользователей все еще есть вариант использовать модель бесплатно, напишу в коментах
Please open Telegram to view this post
VIEW IN TELEGRAM
Mistral AI
Terminally online Mistral Vibe. | Mistral AI
The most powerful AI platform for enterprises. Customize, fine-tune, and deploy AI assistants, autonomous agents, and multimodal AI with open models.
Коллеги по цеху навайбкодили тулу, для АИ обработки вашего резюме под конкретную вакансию, чтобы успешно проходить автоматизированные системы фильтрации. Дело благое 👍 Если вы вдруг open-to-work, пользуйтесь 👇
Forwarded from Борис опять
На днях обсуждали с админом @pseudolabeling, что автоматические фильтры резюме совсем оборзели. Некоторые ребята которых я менторил из-за этого вручную оптимизировали резюме под каждую вакансию. Почему бы не автоматизировать?
Навайбкодил hr-breaker:
1. Загружаете резюме
2. Даете ссылку на вакансию
3. LLM вооруженная тулколами генерирует оптимизированное резюме (в том числе по советам из методички)
4. Делаются стандартные проверки: keyword matching, vector similarity, проверка LLM-кой (в том числе визуально, что всё не поехало), проверка на галлюцинации, проверка на очевидный AI-generated текст
5. Если хотя бы одна проверка не пройдена оптимизация продолжается
Важно, что всё сконфигурировано не врать и не изобретать опыта которого нет, поэтому получается очень неплохо.Но если у вас нет совести ничто не мешает форкануть, поиграться с промптами и отключить пару проверок 🤗
UX сделан для массовой подачи: кладет оптимизированные PDF в папку с указанием роли и компании, чтобы вы не забыли какое резюме куда отправляли.
Скачиваете, подставляете свой ключ Gemini API,
@boris_again
Навайбкодил hr-breaker:
1. Загружаете резюме
2. Даете ссылку на вакансию
3. LLM вооруженная тулколами генерирует оптимизированное резюме (в том числе по советам из методички)
4. Делаются стандартные проверки: keyword matching, vector similarity, проверка LLM-кой (в том числе визуально, что всё не поехало), проверка на галлюцинации, проверка на очевидный AI-generated текст
5. Если хотя бы одна проверка не пройдена оптимизация продолжается
Важно, что всё сконфигурировано не врать и не изобретать опыта которого нет, поэтому получается очень неплохо.
UX сделан для массовой подачи: кладет оптимизированные PDF в папку с указанием роли и компании, чтобы вы не забыли какое резюме куда отправляли.
Скачиваете, подставляете свой ключ Gemini API,
uv run и уничтожаете скрининг как явление. Добейте выживших@boris_again
Please open Telegram to view this post
VIEW IN TELEGRAM
Для тех кто увлекается AI-safety и AI-alignment: реал-тайм дашборд по инетересным метрикам с MoltBook🦞. О чем аи-агенты общаются между собой, популярность агентов, паттерны поведения и мемы, возможные угрозы ит.д. ит.п.
Интересные данные, если интересуетесь этой темой и верите, что агенты на молтбуке самостоятельны, и это все не хайп и скам 😁
https://clawwatch.online/
Интересные данные, если интересуетесь этой темой и верите, что агенты на молтбуке самостоятельны, и это все не хайп и скам 😁
https://clawwatch.online/
Сеть полна слухов о выходе Sonet 5 вот буквально завтра. Что знаем?
* Кодовое имя Fennec
* Говорят будет аж на 50% дешевле текущего Опуса (ой вряд ли 😅)
* Инфиренс на Гугловых TPU, что даст прирост скорости (и возможно по цене все же будет экономнее)
* 1М контекст
* > 80% на swe-bench-verified
* Апдейт для Клод Кода с параллельными выполнением саб-агентов.
На скрине один из ликов. Но многие пишут что это все чушь и хайп) Вобщем будем смотреть, если не завтра, то в ближайшее время анонс точно будет ;)
* Кодовое имя Fennec
* Говорят будет аж на 50% дешевле текущего Опуса (ой вряд ли 😅)
* Инфиренс на Гугловых TPU, что даст прирост скорости (и возможно по цене все же будет экономнее)
* 1М контекст
* > 80% на swe-bench-verified
* Апдейт для Клод Кода с параллельными выполнением саб-агентов.
На скрине один из ликов. Но многие пишут что это все чушь и хайп) Вобщем будем смотреть, если не завтра, то в ближайшее время анонс точно будет ;)
Классный MCP сервер дающий вашему агенту доступ к дев тулам вашего локального браузера. Мастхев для фронтенд разработки, но и для devops-а отличная вещь. Продебажить фронт, проанализировать хедеры, найти инсайты по перфомансу.
Устанавливаем просто, как
выше пример для opencode, в курсоре ставим type: stdio и убираем enabled ключ.
Гитхаб проекта:
https://github.com/ChromeDevTools/chrome-devtools-mcp
Устанавливаем просто, как
"chrome-devtools": {
"type": "local",
"command": ["npx", "-y", "chrome-devtools-mcp@latest", "--no-usage-statistics"],
"enabled": true
}выше пример для opencode, в курсоре ставим type: stdio и убираем enabled ключ.
Гитхаб проекта:
https://github.com/ChromeDevTools/chrome-devtools-mcp
GitHub
GitHub - ChromeDevTools/chrome-devtools-mcp: Chrome DevTools for coding agents
Chrome DevTools for coding agents. Contribute to ChromeDevTools/chrome-devtools-mcp development by creating an account on GitHub.
❤2
Практически полностью перешел на OpenCode, Cursor использую как обычный vscode, только дифы посмотреть.😅 Сегодня с удивлением заметил, что opencode использует Exa Web Search как дефолтный серч тул. Это круто, Exa реально работает быстрее и надежнее обычного web-fetch. Но Exa - платный сервис, а в opencode реализована почему-то бесплатно, огонь 🌡
Ну и Kimi K2.5 - доступна бесплатно (правда иногда с рейт лимитами) через OpenCode Zen, крутейшая модель! Быстрая почти как gemini flash и реально очень умная. Сейчас на 1м месте в моем используемом списке моделей 😎
Ну и Kimi K2.5 - доступна бесплатно (правда иногда с рейт лимитами) через OpenCode Zen, крутейшая модель! Быстрая почти как gemini flash и реально очень умная. Сейчас на 1м месте в моем используемом списке моделей 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
Google Cloud Blog
How Google SREs Use Gemini CLI to Solve Real-World Outages | Google Cloud Blog
See how Google SREs use Gemini CLI and Gemini 3 to automate incident response, from paging to postmortem. Learn how AI helps eliminate toil and reduce Bad Customer Minutes safely.
Интересная статья, как Google использует AI cli тулы в своей SRE команде.
Классный инсайт, что все flow прописаны у них в плейбуках, аналог /commands и skills в claude code, opencode итд. Если случается инцидент, они запускают отдельную команду, по которой аи достает метрики, трейсы и логи из observability систем, анализирует их и предлагает какую следующую команду стоит запустить, например на рестарт пода, сервера, ролбэк ит.д. Для каждой команды есть прописанная степень риска для энвайронмента (в стиле safe, revertable, critical), чтобы инженер мог оценить этот риск.
Дальше есть отдельный слой policy enforcement, который может запретить выполнение каких-либо опасных команд (например глобальные рестарты во время пика трафика, или если изменение требует апрува нескольких человек). Здесь кстати тоже важен human-in-the-loop. Например можно представить что такая система будет запрещать рестарт серверов во время выкатки глобального релиза, чтобы не спровоцировать каскадных падений. Тогда явно инженер должен связаться с релиз командой, остановить rolling update, и после этого разблокировать систему на рестарт умершей ноды.
Так же все выполненные команды и ответы LLM сохраняются для аудита.
Еще интересный тейк - когда АИ допустим рестартует под, то сразу проверяет его статус и скидывает в чат логи, чтобы инженер не переключал контекст и не шел ручками в консоль в нужный кластер смотреть состояние сам.
Дальше, когда основной инцедент решен, АИ очень удобен для составление постмортемов, агент сам закидывает туда нужные логи, трейсы, выполненнные действия, и если надо создает тикеты через MCP на дев команду для последующих фиксов поломанной логики в приложениях.
Отсюда можно сделать полезные выводы, для внедрения подобных подходов в своей компании:
* Используем предефайнд команды, максимально подробно расписывающие флоу и риски. Не просто говорим "иди в кубер через MCP и рестартани такой под", а отправляем весь флоу хоть на сотни строк одной командой из CLI. Набор таких команд для инженеров вполне может версионироваться в одном репозитории и обновляться при запуске TUI.
* Всегда нужен human-in-the-loop. АИ системы только анализируют и предалагают решения. Принимает решение - человек.
* Делаем логирование и аудит при запуске опрпеделенных команд, в дальнейшем это поможет получать фидбек если что-то пошло не так и развивать вашу платформу.
* Делаем отдельный policy enforcement слой, для защиты от непредвиденных случайностей.
* Интеграция с полезными MCP. Данные из обсервабилити систем, живые статусы и логи с кластеров. MCP конфигурации тоже могут храниться как код и менеджиться девопс командой.
* Постмортемы или экшен айтемы (тикеты в джире, слак нотификации) тоже можно автоматизировать подобным образом.
Статья:
https://cloud.google.com/blog/topics/developers-practitioners/how-google-sres-use-gemini-cli-to-solve-real-world-outages
Классный инсайт, что все flow прописаны у них в плейбуках, аналог /commands и skills в claude code, opencode итд. Если случается инцидент, они запускают отдельную команду, по которой аи достает метрики, трейсы и логи из observability систем, анализирует их и предлагает какую следующую команду стоит запустить, например на рестарт пода, сервера, ролбэк ит.д. Для каждой команды есть прописанная степень риска для энвайронмента (в стиле safe, revertable, critical), чтобы инженер мог оценить этот риск.
Дальше есть отдельный слой policy enforcement, который может запретить выполнение каких-либо опасных команд (например глобальные рестарты во время пика трафика, или если изменение требует апрува нескольких человек). Здесь кстати тоже важен human-in-the-loop. Например можно представить что такая система будет запрещать рестарт серверов во время выкатки глобального релиза, чтобы не спровоцировать каскадных падений. Тогда явно инженер должен связаться с релиз командой, остановить rolling update, и после этого разблокировать систему на рестарт умершей ноды.
Так же все выполненные команды и ответы LLM сохраняются для аудита.
Еще интересный тейк - когда АИ допустим рестартует под, то сразу проверяет его статус и скидывает в чат логи, чтобы инженер не переключал контекст и не шел ручками в консоль в нужный кластер смотреть состояние сам.
Дальше, когда основной инцедент решен, АИ очень удобен для составление постмортемов, агент сам закидывает туда нужные логи, трейсы, выполненнные действия, и если надо создает тикеты через MCP на дев команду для последующих фиксов поломанной логики в приложениях.
Отсюда можно сделать полезные выводы, для внедрения подобных подходов в своей компании:
* Используем предефайнд команды, максимально подробно расписывающие флоу и риски. Не просто говорим "иди в кубер через MCP и рестартани такой под", а отправляем весь флоу хоть на сотни строк одной командой из CLI. Набор таких команд для инженеров вполне может версионироваться в одном репозитории и обновляться при запуске TUI.
* Всегда нужен human-in-the-loop. АИ системы только анализируют и предалагают решения. Принимает решение - человек.
* Делаем логирование и аудит при запуске опрпеделенных команд, в дальнейшем это поможет получать фидбек если что-то пошло не так и развивать вашу платформу.
* Делаем отдельный policy enforcement слой, для защиты от непредвиденных случайностей.
* Интеграция с полезными MCP. Данные из обсервабилити систем, живые статусы и логи с кластеров. MCP конфигурации тоже могут храниться как код и менеджиться девопс командой.
* Постмортемы или экшен айтемы (тикеты в джире, слак нотификации) тоже можно автоматизировать подобным образом.
Статья:
https://cloud.google.com/blog/topics/developers-practitioners/how-google-sres-use-gemini-cli-to-solve-real-world-outages
❤2
Вышел Claude Opus 4.6. Без прорывов по бенчмаркам, но по большинству показателей чуть лучше 4.5. При этом цена осталась такой же (но есть режим максимального ризонинга, там цена за токены улетает в х2). В целом хороший релиз!
Из интересного - в Claud Code заодно добавили swarm mode, для автоматического запуска саб-агентов на задачах. Ждём когда эту фичу завезут в опенкод 😄
Из интересного - в Claud Code заодно добавили swarm mode, для автоматического запуска саб-агентов на задачах. Ждём когда эту фичу завезут в опенкод 😄
Давайте подробнее про новую модель от Antropic. Мы конечно все ждали новый Sonet: умный, шустрый и за пол цены Опуса💰 . Но имеем, что имеем... Хотя модель безусловно интересная, все таки релиз от лидера по симпатиям кодеров на рынке 😁
И так, что же интересного в новой Claude Opus 4.6 ?
Первое - 1 млн токенов контекст. Это много (правда у Гугла в гемини про это было еще в начале 2024?🙂). В соцесетях люди восторгаются - можно засунуть всю код базу Laravel фреймворка в один запрос и Опус в ней разберется. Не совсем так. Эффективность моделей на большом контексте сильно снижается, для AI IDE рекомендуют делать compaction или начинать новую сессию даже после заполнения 50%, чтобы избежать галлюцинаций. А модели Антропик всегда славились слабой работой с большим контекстом. На втором скрине есть пример retrieval accuracy разных моделей для toon формата (помните что был прикол в стиле "зумеры переизобрели csv"?😆 так вот формат все еще живет и здравствует). Или история не про Клод, а про GPT, когда было много шума в сети о том что модель "отупела", а по факту умный роутинг просто переключал MAX модель, и она начинала галлюцинировать когда контекст сильно заполнялся. Вобщем не всегда (а даже чаще) большой контекст это хорошо. А в случае Opus 4.6 - это еще и дороже. +35% к прайсу, если будете использовать контекст выше 200к токенов 🤪
Вобщем выглядит так, что Antropic наконец натренил свою модель на более менее приемлемую работу с большим контекстом (см. скрин 3, это все же уже не Хайку в примере про Toon), и решил догнать Гугл в мерянии цифрами. Выкатив не самую нужную фичу за дорого😄
Дальше цифры и бенчмарки. Модель по чуть чуть лучше предшественниках во многих бенчах. Есть например заметный прорыв в ARC AGI. Это специальный бенчмарк, который трудно решать AI моделям. Задачи на абстрактный и визуальный ризонинг и этих данных нет в трейн датасетах. Что-то похожее на задачки из тестов на IQ 🙂, см скриншот 4. Люди решают такое в 80% случаев, для LLM исторически были результаты в 10-30%, до выхода GPT-O3, которая сделала его на 90%. После этого авторы выпустили ARC AGI 2 (см. примеры задач на скрине 5), который на то время считался "невозможным для LLM моделей". До этого рекордсменом была модель Gemini DeepThink c 45% (Opus 4.5 на втором месте). И вот Opus 4.6 поставил новый рекорд с заметным отрывом, почти 70%. Реально круто) Хотя призовые с Arc Agi 2 конкурса Антропикам явно не нужны😅
Продолжение дальше 👇
И так, что же интересного в новой Claude Opus 4.6 ?
Первое - 1 млн токенов контекст. Это много (правда у Гугла в гемини про это было еще в начале 2024?🙂). В соцесетях люди восторгаются - можно засунуть всю код базу Laravel фреймворка в один запрос и Опус в ней разберется. Не совсем так. Эффективность моделей на большом контексте сильно снижается, для AI IDE рекомендуют делать compaction или начинать новую сессию даже после заполнения 50%, чтобы избежать галлюцинаций. А модели Антропик всегда славились слабой работой с большим контекстом. На втором скрине есть пример retrieval accuracy разных моделей для toon формата (помните что был прикол в стиле "зумеры переизобрели csv"?😆 так вот формат все еще живет и здравствует). Или история не про Клод, а про GPT, когда было много шума в сети о том что модель "отупела", а по факту умный роутинг просто переключал MAX модель, и она начинала галлюцинировать когда контекст сильно заполнялся. Вобщем не всегда (а даже чаще) большой контекст это хорошо. А в случае Opus 4.6 - это еще и дороже. +35% к прайсу, если будете использовать контекст выше 200к токенов 🤪
Вобщем выглядит так, что Antropic наконец натренил свою модель на более менее приемлемую работу с большим контекстом (см. скрин 3, это все же уже не Хайку в примере про Toon), и решил догнать Гугл в мерянии цифрами. Выкатив не самую нужную фичу за дорого
Дальше цифры и бенчмарки. Модель по чуть чуть лучше предшественниках во многих бенчах. Есть например заметный прорыв в ARC AGI. Это специальный бенчмарк, который трудно решать AI моделям. Задачи на абстрактный и визуальный ризонинг и этих данных нет в трейн датасетах. Что-то похожее на задачки из тестов на IQ 🙂, см скриншот 4. Люди решают такое в 80% случаев, для LLM исторически были результаты в 10-30%, до выхода GPT-O3, которая сделала его на 90%. После этого авторы выпустили ARC AGI 2 (см. примеры задач на скрине 5), который на то время считался "невозможным для LLM моделей". До этого рекордсменом была модель Gemini DeepThink c 45% (Opus 4.5 на втором месте). И вот Opus 4.6 поставил новый рекорд с заметным отрывом, почти 70%. Реально круто) Хотя призовые с Arc Agi 2 конкурса Антропикам явно не нужны😅
Продолжение дальше 👇
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM