У нас в компании будет хакатон. Как же мне блять повезло попасть в команду с двумя пм-ами, один из которых ебать вайбкодер 😖
Побрейнштормили идеи. Решили делать корпоративного слак помошника, который собирает все файло с гуглдрайва проекта и может рассказывать людям про спринты, календарь, митинги, прочие доки. С моей стороны так же интеграция с гитлабом, для поста истории разработки за неделю, новые мердж реквесты итд.
Один пассажир просто молчит всю дорогу, но ладно. Сегодня пишу:
Давайте обсуждать архитектуру, вот мой пропоузал - микросервисы, separation of concerns, апка с ботом, апка thin api для вопросов/ответов, llm backend для обработки, redis между ними, и sync сервис для файлов с гугла. Будем использовать новую модную идею Андрюхи Карпатого с LLM Wiki. Синк сервис загружает все с драйва, бекенд в отдельном ране c помощью LLM переводит все в маркдаун текст, викифицурет, добавляет в индекс и оперейшнс лог. Дальше поиск по данным идет за миллисекунды, и без всякого RAG.
Тот который вайбкодер - да зачем архитектура? Я уже все написал вечером в прошлую пятницу 🤪
- ???? 🗿🗿🗿
- ну вот, смотри в слаке, бот общается отвечает на сообщения, я просто pydantic-ai заюзал и все, вот репо
- слушай, а как твой бот читает файлы хотя бы, вообще не вижу в коде
- ну он пока не может, но я сделаю
- говорю слушай, по архитектуре нам нужен готовый агент фреймворк, чтобы все тулы работали из коробки, чтобы нам не надо было писать с нуля и дебажить все тул взаимодействия. чтобы легко добавлять mcp, скилы...
Вот как скил добавить у тебя?
- Эм, добавить нельзя, надо кодить. Но ты можешь сказать боту "создай скил" и он сам создаст
- Ебать 🗿🗿 Слушай, скил для чтения пдф официальный от комьюнти, там туева хуча питон скриптов, он проверенный и протестированный. В моем случае мы используем верифицированные рабочие скилы...
- Да ладно, можно просто попросить создать все, прямо в чате.
- Блять 🗿🗿 у тебя там монолит. в одной апе и слак бот, и ллм запросы, и работа с гуглом. И supabase... Как это скейлится вообще?? Зачем база вообще??
- Ты не понимаешь, supabase офигенная тема, все используют. Вот опус мне говорит что на 5-10 чатов нормально скейлится, по 3 секунды на запрос к гуглу. ну 50 чатов уже сложнее будет. Но мне кажется охуенный вариант, уже все готово, зачем что-то писать теперь с нуля? Давай составим список за-против чем мое решение хорошее или плохое? И вообще зачем LLM Wiki, я штуку как у Карпатого придумал за месяц до него, вот смотри, json индекс файл называется
- Бляяяяяяя...... 🤦♂️🤦♂️🤦♂️
=======================
Короче охуел я знатно. Решили что каждый разработает свое решение и проведем A/B тесты... Пожелайте удачи 🥹
...А третий пассажир так и молчит 🫥
Побрейнштормили идеи. Решили делать корпоративного слак помошника, который собирает все файло с гуглдрайва проекта и может рассказывать людям про спринты, календарь, митинги, прочие доки. С моей стороны так же интеграция с гитлабом, для поста истории разработки за неделю, новые мердж реквесты итд.
Один пассажир просто молчит всю дорогу, но ладно. Сегодня пишу:
Давайте обсуждать архитектуру, вот мой пропоузал - микросервисы, separation of concerns, апка с ботом, апка thin api для вопросов/ответов, llm backend для обработки, redis между ними, и sync сервис для файлов с гугла. Будем использовать новую модную идею Андрюхи Карпатого с LLM Wiki. Синк сервис загружает все с драйва, бекенд в отдельном ране c помощью LLM переводит все в маркдаун текст, викифицурет, добавляет в индекс и оперейшнс лог. Дальше поиск по данным идет за миллисекунды, и без всякого RAG.
Тот который вайбкодер - да зачем архитектура? Я уже все написал вечером в прошлую пятницу 🤪
- ???? 🗿🗿🗿
- ну вот, смотри в слаке, бот общается отвечает на сообщения, я просто pydantic-ai заюзал и все, вот репо
- слушай, а как твой бот читает файлы хотя бы, вообще не вижу в коде
- ну он пока не может, но я сделаю
- говорю слушай, по архитектуре нам нужен готовый агент фреймворк, чтобы все тулы работали из коробки, чтобы нам не надо было писать с нуля и дебажить все тул взаимодействия. чтобы легко добавлять mcp, скилы...
Вот как скил добавить у тебя?
- Эм, добавить нельзя, надо кодить. Но ты можешь сказать боту "создай скил" и он сам создаст
- Ебать 🗿🗿 Слушай, скил для чтения пдф официальный от комьюнти, там туева хуча питон скриптов, он проверенный и протестированный. В моем случае мы используем верифицированные рабочие скилы...
- Да ладно, можно просто попросить создать все, прямо в чате.
- Блять 🗿🗿 у тебя там монолит. в одной апе и слак бот, и ллм запросы, и работа с гуглом. И supabase... Как это скейлится вообще?? Зачем база вообще??
- Ты не понимаешь, supabase офигенная тема, все используют. Вот опус мне говорит что на 5-10 чатов нормально скейлится, по 3 секунды на запрос к гуглу. ну 50 чатов уже сложнее будет. Но мне кажется охуенный вариант, уже все готово, зачем что-то писать теперь с нуля? Давай составим список за-против чем мое решение хорошее или плохое? И вообще зачем LLM Wiki, я штуку как у Карпатого придумал за месяц до него, вот смотри, json индекс файл называется
- Бляяяяяяя...... 🤦♂️🤦♂️🤦♂️
=======================
Короче охуел я знатно. Решили что каждый разработает свое решение и проведем A/B тесты... Пожелайте удачи 🥹
...А третий пассажир так и молчит 🫥
❤4🗿4🌚1
Хочу порекомендовать классную тулу для OpenCode: Dynamic Context Pruning.
Автоматическое сжатие контекста сессий для опенкода, выполненное как плагин. Подобные проекты часто реализуются как прокси между IDE и LLM провайдером, что требует более сложной настройки как самого прокси так и своих IDE, чтобы отправлять через них трафик. Здесь же это просто плагин, который добавляется в опенкод одной командой, и мы получаем скил который агент использует самостоятельно, каждый раз когда видит что контекстное окно начинает забиваться.
Принцип действия - суммаризация аутпута моделей в менее важной истории диалога. Похоже на обычный /compaction, но не всего диалога, а только тех учасков которые модель выбирает сама. Так же есть дедупликация вывода тулов для одинаковых кусков аутпута, чистка мусора из сообщений об ошибках (когда оставляется только причина ошибки, но не весь стактрейс).
Использую уже несколько дней, и пока доволен. Моментов чтобы модель начинала тупеть и тупить, потому что пропал какой-то важный кусок контекста пока не замечено. Сжимает данные реально хорошо, за проход из скажем 50-60% остается 30. Раньше за день работы над какой-то фичей приходилось раза 3 вручную запускать компакт где-то на 60-70% контекста, и копировать руками саммари в новую сессию, начиная новый чат. Сейчас же все стабильно держится на приемлимых для работы цифрах. Вот пример статсов с одной моей сегодняшней сессии:
Вобщем если вы OpenCode heavy user - максимально рекомендую🌡
Автоматическое сжатие контекста сессий для опенкода, выполненное как плагин. Подобные проекты часто реализуются как прокси между IDE и LLM провайдером, что требует более сложной настройки как самого прокси так и своих IDE, чтобы отправлять через них трафик. Здесь же это просто плагин, который добавляется в опенкод одной командой, и мы получаем скил который агент использует самостоятельно, каждый раз когда видит что контекстное окно начинает забиваться.
Принцип действия - суммаризация аутпута моделей в менее важной истории диалога. Похоже на обычный /compaction, но не всего диалога, а только тех учасков которые модель выбирает сама. Так же есть дедупликация вывода тулов для одинаковых кусков аутпута, чистка мусора из сообщений об ошибках (когда оставляется только причина ошибки, но не весь стактрейс).
Использую уже несколько дней, и пока доволен. Моментов чтобы модель начинала тупеть и тупить, потому что пропал какой-то важный кусок контекста пока не замечено. Сжимает данные реально хорошо, за проход из скажем 50-60% остается 30. Раньше за день работы над какой-то фичей приходилось раза 3 вручную запускать компакт где-то на 60-70% контекста, и копировать руками саммари в новую сессию, начиная новый чат. Сейчас же все стабильно держится на приемлимых для работы цифрах. Вот пример статсов с одной моей сегодняшней сессии:
╭───────────────────────────────────────────────────────────╮
│ DCP Context Analysis │
╰───────────────────────────────────────────────────────────╯
Session Context Breakdown:
────────────────────────────────────────────────────────────
System 34.2% │██████████ │ 43.5K tokens
User 5.3% │▓▓ │ 6.8K tokens
Assistant 13.0% │▒▒▒▒ │ 16.5K tokens
Tools (132) 47.6% │░░░░░░░░░░░░░░ │ 60.6K tokens
────────────────────────────────────────────────────────────
Summary:
Pruned: 190 tools, 149 messages (~157.2K tokens)
Current context: ~127.4K tokens
Without DCP: ~284.6K tokens
Вобщем если вы OpenCode heavy user - максимально рекомендую
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - Opencode-DCP/opencode-dynamic-context-pruning: Dynamic context pruning plugin for OpenCode - intelligently manages conversation…
Dynamic context pruning plugin for OpenCode - intelligently manages conversation context to optimize token usage - Opencode-DCP/opencode-dynamic-context-pruning
🔥4
У нас в компании участникам хакатона раздали корпоративные ChatGPT аки без лимитов. Я давно не использовал модели "большой тройки", так что сразу же зарядил аккаунт в OpenCode и пошел тестить GPT 5.4 Xhigh. И... сказать честно разочарован. 🤔
Во-первых на его ризонинг больно смотреть 😂 как он сомневается каждый раз готовя ответ и додумывая а может надо что-то сделать еще?
Во-вторых мне совсем не нравится стилистика его речи в аутпутах: все очень односложно, информация неудобно структурированна для чтения и восприятия. В дизайне фич - склонен оверинжинирить, из разряда а давай вообще перепишим весь апи контракт аи бекенда, добавив туда штук пять новых полей, вместо того чтобы просто передавать запрос с сервиса в промте. В остальном нуу, не предлагает ничего более инновационного чем GLM, GLM даже местами более интересные фичи подсказывал.
Я конечно еще не смотрел на написания кода, но код по спеке любая модель пишет, и Kimi и GLM, да даже минимакс может написать сносно, если спека хорошая и с примерами алгоритмов и сложных моментов.
Так что даже не знаю как там люди с этими sota моделями живут и за что деньги платят.🤷♂️ Мне вот гэпэтой как-то даже не хочется пользоваться, даже не смотря на то что халява! 🙈
...На скрине ответ на вопрос по скейлу сервиса, на одном от GLM-5.1 на другом от ChatGPT
Во-первых на его ризонинг больно смотреть 😂 как он сомневается каждый раз готовя ответ и додумывая а может надо что-то сделать еще?
Во-вторых мне совсем не нравится стилистика его речи в аутпутах: все очень односложно, информация неудобно структурированна для чтения и восприятия. В дизайне фич - склонен оверинжинирить, из разряда а давай вообще перепишим весь апи контракт аи бекенда, добавив туда штук пять новых полей, вместо того чтобы просто передавать запрос с сервиса в промте. В остальном нуу, не предлагает ничего более инновационного чем GLM, GLM даже местами более интересные фичи подсказывал.
Я конечно еще не смотрел на написания кода, но код по спеке любая модель пишет, и Kimi и GLM, да даже минимакс может написать сносно, если спека хорошая и с примерами алгоритмов и сложных моментов.
Так что даже не знаю как там люди с этими sota моделями живут и за что деньги платят.🤷♂️ Мне вот гэпэтой как-то даже не хочется пользоваться, даже не смотря на то что халява! 🙈
...На скрине ответ на вопрос по скейлу сервиса, на одном от GLM-5.1 на другом от ChatGPT
А вот и топовый подгончик появился 🌡 Kimi K2.6 релизнулась сразу в open source и уже доступна на разных подписках, например в OpenCode Go.
Moonshot особо отмечает long agentic runs capabilities, когда модель за 13 часов автономной работы успешно отрефакторила опенсорсный торговый движок на 4000 строк изменений кода, улучшив перфоманс движка более чем на 100%. А так же state of the art работу с мультимодалкой, в частности для разработки фронтенд дизайнов.
На большинстве бенчей K2.6 выдает цифры выше Opus 4.6 и GPT 5.4. И хоть и не дотягивает до последнего Opus 4.7, но прогресс у опенсорса за последние месяцы все равно колоссальный😮 .
Как по мне, Kimi - это топовая рабочая лошадка🦾. И с выходом 4.6 Kimi опять можно использовать для абсолютно всех задач, не переключаясь на GLM, GPT и иже с ними))
Вобщем максимально рекомендую вам потестить эту модель, разочарованы не останетесь😎
Moonshot особо отмечает long agentic runs capabilities, когда модель за 13 часов автономной работы успешно отрефакторила опенсорсный торговый движок на 4000 строк изменений кода, улучшив перфоманс движка более чем на 100%. А так же state of the art работу с мультимодалкой, в частности для разработки фронтенд дизайнов.
На большинстве бенчей K2.6 выдает цифры выше Opus 4.6 и GPT 5.4. И хоть и не дотягивает до последнего Opus 4.7, но прогресс у опенсорса за последние месяцы все равно колоссальный
Как по мне, Kimi - это топовая рабочая лошадка🦾. И с выходом 4.6 Kimi опять можно использовать для абсолютно всех задач, не переключаясь на GLM, GPT и иже с ними))
Вобщем максимально рекомендую вам потестить эту модель, разочарованы не останетесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Пересмотрел сегодня этот видос. Ну просто жиза жизовая.. 😅
https://youtu.be/xE9W9Ghe4Jk?si=3V16CLbEHDRyVkIM
https://youtu.be/xE9W9Ghe4Jk?si=3V16CLbEHDRyVkIM
YouTube
Shipping a button in 2026…
Shipping a button in the age of cloud, vibe coding, JS frameworks.
T3
T4
#programming
#javascript
#humor
T3
T4
#programming
#javascript
#humor
Вышла ожидаемая многими DeepSeek V4. Отличные цифры всех бенчей, модель во многом обгоняет предыдущее поколение топовых моделей от OpenAI/Anthropic/Google. Но лично для меня этот скрин - еще один повод порадоваться, насколько же хороша Kimi от моих любимчиков Moonshot AI 😎
В целом теперь можно уверенно резюмировать, что китайские опенсорс модели реально догнали большую тройку и играют с ними в одной лиге. При наличии же санкций у Китая и отсутствия такого миллиардного инвестирования в АИ компании как в Штатах - мне кажется что китайские инженеры реально гениальны🧠 .
Вобщем модель уже доступна в чате и у провайдеров, два варианта Flash и Pro, $0.14/$0.28 per mil token Flash, как у DeepSeek V2 и $1.74/$3.48 у Pro.
Эта весна реально богата на новые классные релизы👍
В целом теперь можно уверенно резюмировать, что китайские опенсорс модели реально догнали большую тройку и играют с ними в одной лиге. При наличии же санкций у Китая и отсутствия такого миллиардного инвестирования в АИ компании как в Штатах - мне кажется что китайские инженеры реально гениальны
Вобщем модель уже доступна в чате и у провайдеров, два варианта Flash и Pro, $0.14/$0.28 per mil token Flash, как у DeepSeek V2 и $1.74/$3.48 у Pro.
Эта весна реально богата на новые классные релизы
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Напомню еще раз про фичу, о которой я писал пару месяцев назад, и которая уже настолько плотно и плавно вошла в мои рабочие процессы, что даже не знаю как без такого теперь жить ⭐️ Речь про нотификации из опенкода в телегу.
Это максимально удобно! Во-первых всегда моментально замечаешь готовую работу, когда у тебя несколько агентов в разных вкладках. Во-вторых - это не привязанность к лаптопу. Результаты работы можно почитать и поревьювать когда вышел покурить, делаешь чай, поехал на обед. Постоянно остаешься в процессе и не выпадаешь из работы, когда отошел от компа.
Скрипт в статье я основательно доработал (я про ts скрипт для opencode, для курсора там какая-то фигня, даже не пробовал ее чинить, так как уже давно не юзаю курсор), теперь он без ошибок на спец символах, нормально обрезает длинные ответы по максимуму длины телеграм сообщений, работает как часы. Вобщем пробуйте, ставьте себе, максимально удобно! 😉
Из того что я бы хотел доработать - нормальное markdown форматирование в ответах. И конечно хотелось бы двустороннюю связь, но для этого уже нужен полноценный open/mini claw бот, тунели, заморочки с шифрованием, дофига делов... Ну и идея для продукта интересная кстати. Если бы вышел андройд клиент со встроенным шифрованым тунелем чисто для управления opencode/kilocode/cline и пр. - я бы не глядя платил $5-10 баксов в месяц за такю подписку 🤔
Это максимально удобно! Во-первых всегда моментально замечаешь готовую работу, когда у тебя несколько агентов в разных вкладках. Во-вторых - это не привязанность к лаптопу. Результаты работы можно почитать и поревьювать когда вышел покурить, делаешь чай, поехал на обед. Постоянно остаешься в процессе и не выпадаешь из работы, когда отошел от компа.
Скрипт в статье я основательно доработал (я про ts скрипт для opencode, для курсора там какая-то фигня, даже не пробовал ее чинить, так как уже давно не юзаю курсор), теперь он без ошибок на спец символах, нормально обрезает длинные ответы по максимуму длины телеграм сообщений, работает как часы. Вобщем пробуйте, ставьте себе, максимально удобно! 😉
Из того что я бы хотел доработать - нормальное markdown форматирование в ответах. И конечно хотелось бы двустороннюю связь, но для этого уже нужен полноценный open/mini claw бот, тунели, заморочки с шифрованием, дофига делов... Ну и идея для продукта интересная кстати. Если бы вышел андройд клиент со встроенным шифрованым тунелем чисто для управления opencode/kilocode/cline и пр. - я бы не глядя платил $5-10 баксов в месяц за такю подписку 🤔
Please open Telegram to view this post
VIEW IN TELEGRAM
Апдейт по GLM-5.1 Coding Plan⚠️ За последнюю неделю Zai реально подтянулись в плане качества инфиренса. 5-turbo просто летает, 5.1 работает не медленее опуса/гэпэтэ. Пробовал в Cursor - на удивление еще быстрее чем в OpenCode. В скорости я сейчас реально не вижу большой разницы c Kimi, а в качестве они где-то на уровне. Kimi чуть дешевле по токенам и хорошо себя ведет на длинных задачах и субагентах, GLM хорош когда надо углубиться в сложные задачи.
Но раньше я гонял GLM на оупенроутере и Go подпсике, сейчас же спокойно им пользуюсь считай бесплатно на Zai Coding Plan, и вообще не вижу ошибок, торзмозов и дисконектов.
Плюс раньше GLM брали x2 реквестов в пиковые часы для топовой модели, сейчас же это правило отменили, явно они очень хорошо наростили обьем своего компьюта.
С 1 мая Zai так же меняет стоимость и условия своих подписок (для новых пользователей, старые закончат свои планы на прежних условиях), не знаю что там будет, но если будут хорошие цены и скидки на годовые пакеты - я рекомендую взять, даже Lite план.👍
Вобщем начиная с ноября 2025, когда я купил годовый Coding Plan, сейчас я в первый раз откровенно могу порекомендовать эту подписку, она реально стала хороша, и по скорости-стабильности, и по GLM-5-turbo/GLM-5.1 моделям, можно использовать для любых задач и с высоким уровнем качества.🌡 😮 👍
Но раньше я гонял GLM на оупенроутере и Go подпсике, сейчас же спокойно им пользуюсь считай бесплатно на Zai Coding Plan, и вообще не вижу ошибок, торзмозов и дисконектов.
Плюс раньше GLM брали x2 реквестов в пиковые часы для топовой модели, сейчас же это правило отменили, явно они очень хорошо наростили обьем своего компьюта.
С 1 мая Zai так же меняет стоимость и условия своих подписок (для новых пользователей, старые закончат свои планы на прежних условиях), не знаю что там будет, но если будут хорошие цены и скидки на годовые пакеты - я рекомендую взять, даже Lite план.
Вобщем начиная с ноября 2025, когда я купил годовый Coding Plan, сейчас я в первый раз откровенно могу порекомендовать эту подписку, она реально стала хороша, и по скорости-стабильности, и по GLM-5-turbo/GLM-5.1 моделям, можно использовать для любых задач и с высоким уровнем качества.
Please open Telegram to view this post
VIEW IN TELEGRAM