Perplexity через SFT "расцензурили" DeepSeek-R1 🤡
Рецепт:
1) Классификатор проблемных промптов (мультиязычный!)
2) Создание рассуждений в стиле R1 (неужели вручную писали)
3) Оценка человеками расцензуренности и сравнение с другими LLM
4) Также убедились, что нет сильной просадки на бенчах (но небольшая всё равно есть)
Столько сил, чтобы про ту самую площадь поспрашивать... 🤦♂️ Заняться людям нечем
Рецепт:
1) Классификатор проблемных промптов (мультиязычный!)
2) Создание рассуждений в стиле R1 (неужели вручную писали)
3) Оценка человеками расцензуренности и сравнение с другими LLM
4) Также убедились, что нет сильной просадки на бенчах (но небольшая всё равно есть)
Столько сил, чтобы про ту самую площадь поспрашивать... 🤦♂️ Заняться людям нечем
Наша команда выпустила хорошую небольшую модельку для русского языка в опенсорс, да ещё и с коммерческой лицензией. Модель можно и локально гонять на консьюмерском железе (есть GGUF). Попробуйте!
Forwarded from ML Underhood
YandexGPT 5 Lite Instruct теперь в опенсорсе 🎉
В феврале в открытый доступ вышла Pretrain-версия, а сейчас очередь дошла и до YandexGPT 5 Lite Instruct. Это модель на 8 миллиардов параметров с размером контекстного окна в 32К токенов.
О претрейне мы уже писали вот тут, а алайнмент аналогичен тому, через который проходит YandexGPT 5 Pro. На этапе SFT концентрировались на сложных запросах, а также методах фильтрации и ранжирования данных. В рамках RLHF комбинировали RL-подходы, которые дают лучшие результаты: DPO, LogDPO и PPO. Подробнее об этом читайте на Хабре.
По результатам внутреннего слепого попарного сравнения (side-by-side) новая модель YandexGPT 5 Lite превосходит Qwen-2.5-7B-instruct в 62% случаев и не уступает GPT-4o mini в решении стандартных задач сервисов Яндекса. Показатели бенчмарков можно посмотреть в таблице.
А ещё обновили лицензию: теперь можно использовать модель не только в некоммерческих целях, но и в коммерческих до 10 миллионов выходных токенов в месяц. Если ваши объёмы выше, напишите на почту, указанную в тексте лицензии.
Модель доступна на Hugging Face. Там же есть и квантизованная версия с поддержкой GGUF. YandexGPT 5 Lite Instruct совместима с llama.cpp и Ollama.
ML Underhood
В феврале в открытый доступ вышла Pretrain-версия, а сейчас очередь дошла и до YandexGPT 5 Lite Instruct. Это модель на 8 миллиардов параметров с размером контекстного окна в 32К токенов.
О претрейне мы уже писали вот тут, а алайнмент аналогичен тому, через который проходит YandexGPT 5 Pro. На этапе SFT концентрировались на сложных запросах, а также методах фильтрации и ранжирования данных. В рамках RLHF комбинировали RL-подходы, которые дают лучшие результаты: DPO, LogDPO и PPO. Подробнее об этом читайте на Хабре.
По результатам внутреннего слепого попарного сравнения (side-by-side) новая модель YandexGPT 5 Lite превосходит Qwen-2.5-7B-instruct в 62% случаев и не уступает GPT-4o mini в решении стандартных задач сервисов Яндекса. Показатели бенчмарков можно посмотреть в таблице.
А ещё обновили лицензию: теперь можно использовать модель не только в некоммерческих целях, но и в коммерческих до 10 миллионов выходных токенов в месяц. Если ваши объёмы выше, напишите на почту, указанную в тексте лицензии.
Модель доступна на Hugging Face. Там же есть и квантизованная версия с поддержкой GGUF. YandexGPT 5 Lite Instruct совместима с llama.cpp и Ollama.
ML Underhood
Недавно вышел обновлённый DeepSeek-R1. Умельцы с реддита сделали кластеризацию ответов разных моделей (в том числе старого и нового R1) на одни и те промпты. Обнаружилось, что новый дипсик стал гораздо ближе к моделям от Google, чем к моделям от OpenAI, как раньше (картинка). Речь не про качество ответов, а про лексико-стилистические характеристики. Это вычислительный, а не ручной анализ - результат основан на отклонениях частот слов и n-граммов от человеческого бейслайна. 👨💻 Чуть подробнее тут.
Что это означает? Раньше разработчики дипсика больше ориентировались на модели от OpenAI, а сейчас дистиллируют Gemini. Возможно, гугловские модели просто легче/дешевле прокачивать в больших объёмах. А может, их генерации больше соответствуют представлениям о прекрасном китайских инженеров. В любом случае, интересный поворот.😵
На дендрограмме видно, что и клоды, и мистрали, и лламы образуют довольно устойчивые кластеры. Хотя есть и пара неожиданных сближений (грок и гпт-4.5, гемма3 12б и гпт-3.5). Не знаю, насколько стоит доверять этим результатам, но выглядит красиво.👍
Что это означает? Раньше разработчики дипсика больше ориентировались на модели от OpenAI, а сейчас дистиллируют Gemini. Возможно, гугловские модели просто легче/дешевле прокачивать в больших объёмах. А может, их генерации больше соответствуют представлениям о прекрасном китайских инженеров. В любом случае, интересный поворот.
На дендрограмме видно, что и клоды, и мистрали, и лламы образуют довольно устойчивые кластеры. Хотя есть и пара неожиданных сближений (грок и гпт-4.5, гемма3 12б и гпт-3.5). Не знаю, насколько стоит доверять этим результатам, но выглядит красиво.
Please open Telegram to view this post
VIEW IN TELEGRAM
Поскольку про работу не могу писать из-за NDA, то пожалуй, буду больше рассказывать о своих пет-проектах, старых и новых 👨💻
Начну с самого большого из них – KFW (сокращение от Kung-Fu World), пошаговая текстовая ролевая игра с режимом hot seat. Разрабатывал её несколько лет начиная с 2013 года. Вдохновлялся преимущественно старыми фильмами категории "Б" о китайском кунг-фу, но не мог не добавить кучу отсылок на современную поп-культуру и немного кринжового юмора.
Действие происходит в мифологизированном китайском Фошане. Вы играете за начинающего адепта кунг-фу. Усердно тренируясь и принимая непростые решения на суровых улицах города, который ещё предстоит очистить от преступности, вы улучшаете свои боевые навыки, чтобы защищать слабых от угнетателей, соревноваться с другими адептами и однажды основать собственную школу боевых искусств.😡
Особенности проекта:
* Можно играть одному или с друзьями (за одним экраном, по очереди, – это и есть hot seat)
* Можно также добавить нескольких ИИ-игроков для пущего веселья. Это не просто NPC, которые есть в игре в любом случае, а именно конкурирующие с вами полноценные игроки
* Много случайно генерируемого контента: десятки тысяч уникальных стилей, приёмов и т.д.
* Упоротая ASCII-”графика” для боевого режима, сам рисовал❤️
* Стек – чистый Питон, никаких внешних зависимостей для собственно игры (хотя в процессе разработки использовал пару классических ML-библиотек)
* 12 тысяч строк кода (что конечно не много). Вот бы это когда-нибудь отрефакторить…
* ИИ для боёв обучен с помощью собственной реализации генетического алгоритма
* Прогнозирование исхода боя классическим машинным обучением (логистическая регрессия)
Выложил KFW несколько лет назад в репозитории на гитхабе, никогда особо не рекламировал и не продвигал (не люблю и не умею это делать), но вот сегодня решил поделиться, вдруг вам будет интересно🥰
Начну с самого большого из них – KFW (сокращение от Kung-Fu World), пошаговая текстовая ролевая игра с режимом hot seat. Разрабатывал её несколько лет начиная с 2013 года. Вдохновлялся преимущественно старыми фильмами категории "Б" о китайском кунг-фу, но не мог не добавить кучу отсылок на современную поп-культуру и немного кринжового юмора.
Действие происходит в мифологизированном китайском Фошане. Вы играете за начинающего адепта кунг-фу. Усердно тренируясь и принимая непростые решения на суровых улицах города, который ещё предстоит очистить от преступности, вы улучшаете свои боевые навыки, чтобы защищать слабых от угнетателей, соревноваться с другими адептами и однажды основать собственную школу боевых искусств.
Особенности проекта:
* Можно играть одному или с друзьями (за одним экраном, по очереди, – это и есть hot seat)
* Можно также добавить нескольких ИИ-игроков для пущего веселья. Это не просто NPC, которые есть в игре в любом случае, а именно конкурирующие с вами полноценные игроки
* Много случайно генерируемого контента: десятки тысяч уникальных стилей, приёмов и т.д.
* Упоротая ASCII-”графика” для боевого режима, сам рисовал
* Стек – чистый Питон, никаких внешних зависимостей для собственно игры (хотя в процессе разработки использовал пару классических ML-библиотек)
* 12 тысяч строк кода (что конечно не много). Вот бы это когда-нибудь отрефакторить…
* ИИ для боёв обучен с помощью собственной реализации генетического алгоритма
* Прогнозирование исхода боя классическим машинным обучением (логистическая регрессия)
Выложил KFW несколько лет назад в репозитории на гитхабе, никогда особо не рекламировал и не продвигал (не люблю и не умею это делать), но вот сегодня решил поделиться, вдруг вам будет интересно
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - AlexeyMalafeev/kfw-the-game: Kung-Fu World - a fun turn-based hot-seat role-playing game
Kung-Fu World - a fun turn-based hot-seat role-playing game - AlexeyMalafeev/kfw-the-game
Поделюсь одной полезной практикой, к которой часто прибегаю. Если вам, как и мне, приходится много читать, то вы наверное замечали, что прочтённое имеет свойство быстро забываться. 😭 Поэтому полезно делать заметки (т.н. "внешняя память"). Но писать заметки руками - долго и лениво. И вот тут здорово помогают LLM-ки - ими можно извлекать ключевые тезисы из текстов и куда-то сохранять для дальнейшего использования. Процесс у меня обычно такой:
1. Читаю текст с Android-девайса
2. Копирую текст и добавляю к нему один из промптов, сохранённых в паттерны автозамены в клавиатуре SwiftKey*
3. Отдаю текст + промпт LLM-ке
4. Отправляю заметку вместе со ссылкой на исходный текст в нужный топик в группу в Телеграме, специально созданную для сохранёнок
* - Т.е. вместо того, чтобы писать весь промпт заново или откуда-то его копировать, набираем короткую последовательность символов, например “sum”, и в подсказках клавиатурного приложения появляется вариант “распаковки” этой последовательности в целый промпт
Отдельные инструменты тут легко заменить на другие, более подходящие лично для вас. Например, кому-то удобнее читать с макбука, тогда вместо SwiftKey для быстрой вставки промптов можно взять, например, Punto Switcher, там есть “Автозамена”. Также и с моделями: для суммаризации на русском и английском лично я предпочитаю Sonnet 3.7, но вы можете использовать свою любимую модель.❤️
Ещё у меня есть большой набор промптов, которые различаются, например, степенью желаемой детализации. Ниже несколько примеров вместе с шорткатами, забирайте, если понравятся:
“сум” = Выдели ключевые мысли из данного текста в виде буллет-поинтов
“сум3” = Вырази главные мысли (не более трёх) из этого текста в максимально краткой и лаконичной форме
“сум1” = Вырази самую суть этого текста в максимально краткой и лаконичной форме, одним предложением
А вы делаете что-то подобное? Может, как-то ещё применяете LLM-ки в повседневной жизни? Делитесь своими лучшими практиками в комментариях!👍
1. Читаю текст с Android-девайса
2. Копирую текст и добавляю к нему один из промптов, сохранённых в паттерны автозамены в клавиатуре SwiftKey*
3. Отдаю текст + промпт LLM-ке
4. Отправляю заметку вместе со ссылкой на исходный текст в нужный топик в группу в Телеграме, специально созданную для сохранёнок
* - Т.е. вместо того, чтобы писать весь промпт заново или откуда-то его копировать, набираем короткую последовательность символов, например “sum”, и в подсказках клавиатурного приложения появляется вариант “распаковки” этой последовательности в целый промпт
Отдельные инструменты тут легко заменить на другие, более подходящие лично для вас. Например, кому-то удобнее читать с макбука, тогда вместо SwiftKey для быстрой вставки промптов можно взять, например, Punto Switcher, там есть “Автозамена”. Также и с моделями: для суммаризации на русском и английском лично я предпочитаю Sonnet 3.7, но вы можете использовать свою любимую модель.
Ещё у меня есть большой набор промптов, которые различаются, например, степенью желаемой детализации. Ниже несколько примеров вместе с шорткатами, забирайте, если понравятся:
“сум” = Выдели ключевые мысли из данного текста в виде буллет-поинтов
“сум3” = Вырази главные мысли (не более трёх) из этого текста в максимально краткой и лаконичной форме
“сум1” = Вырази самую суть этого текста в максимально краткой и лаконичной форме, одним предложением
А вы делаете что-то подобное? Может, как-то ещё применяете LLM-ки в повседневной жизни? Делитесь своими лучшими практиками в комментариях!
Please open Telegram to view this post
VIEW IN TELEGRAM
Несколько дней назад одна компания взяла и запустила бенчмарк для LLM, где мировые ИИ-модели соревнуются в игре на бирже. Моделям дали по $10К и отправили торговать в реальном времени 😎
Этот бенчмарк на самом деле заслуживает внимания - под него нельзя переобучиться. Если бы можно было легко и надёжно предсказывать будущее по историческим данным, то торговля на бирже потеряла бы смысл😵
Но особенно интересно, что хайповый GPT-5 уже спустил почти все деньги, а якобы "отстающие" китайские модели Qwen3-Max и DeepSeek заработали по несколько тысяч долларов. Это крутой результат, я впервые за долгое время впечатлён возможностями (некоторых) LLM👍
Хотя, конечно, ловкая торговля на бирже - не главное, что хотелось бы получить от ИИ. Посмотрим, что будет дальше👋
Бенчмарк тут:
nof1.ai
Этот бенчмарк на самом деле заслуживает внимания - под него нельзя переобучиться. Если бы можно было легко и надёжно предсказывать будущее по историческим данным, то торговля на бирже потеряла бы смысл
Но особенно интересно, что хайповый GPT-5 уже спустил почти все деньги, а якобы "отстающие" китайские модели Qwen3-Max и DeepSeek заработали по несколько тысяч долларов. Это крутой результат, я впервые за долгое время впечатлён возможностями (некоторых) LLM
Хотя, конечно, ловкая торговля на бирже - не главное, что хотелось бы получить от ИИ. Посмотрим, что будет дальше
Бенчмарк тут:
nof1.ai
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
О природе генерализации больших языковых моделей
Опенсорс-бенчмарки кажется отмирают как класс, особенно про код + качественные. Китайцы релизят хорошие открытые модели, но почти никто сейчас не релизит хорошие бенчи. Можно предположить, что все увидили ценность внутренних закрытых бенчей и относятся к ним как к не менее важной интеллектуальной собственности, чем сами модели и методы их обучения. Вот эти вот вакансии для элитных разметчиков и $1000 за хорошую задачку для гпт. Но дело не только в этом - тебе не выгодно релизить в опенсорс хороший бенч. Ты зарелизил сегодня, завтра его оверфитнули и твой труд насмарку. Поэтому все придерживают (и на этом пытаются тем или иным способом профитнуть).
Такова природа генерализации LLM - ты наверное можешь сделать модель умнее (в теории), но гораздо проще сделать так, чтобы она запомнила правильные ответы как можно большего количества бенчмарков* (по которым все и оценивают LLM). Даже закрытые бенчмарки от этого по-настоящему не застрахованы. Ты хочешь оценить на своём бенче условную GPT-5 как бейслайн, и в процессе сливаешь вендору промпты своего бенча. А у вендора прямой интерес заоверфититься под те промпты, которые часто приходят к нему на API (или даже просто выглядят как хорошие тестовые задачи), чтобы дальше рубить бабло с инвесторов на хайпе про "смотрите, как ИИ эКсПоНеНцИаЛьНо улучшается".
* -не является инвестиционной рекомендацией 😄
Опенсорс-бенчмарки кажется отмирают как класс, особенно про код + качественные. Китайцы релизят хорошие открытые модели, но почти никто сейчас не релизит хорошие бенчи. Можно предположить, что все увидили ценность внутренних закрытых бенчей и относятся к ним как к не менее важной интеллектуальной собственности, чем сами модели и методы их обучения. Вот эти вот вакансии для элитных разметчиков и $1000 за хорошую задачку для гпт. Но дело не только в этом - тебе не выгодно релизить в опенсорс хороший бенч. Ты зарелизил сегодня, завтра его оверфитнули и твой труд насмарку. Поэтому все придерживают (и на этом пытаются тем или иным способом профитнуть).
Такова природа генерализации LLM - ты наверное можешь сделать модель умнее (в теории), но гораздо проще сделать так, чтобы она запомнила правильные ответы как можно большего количества бенчмарков* (по которым все и оценивают LLM). Даже закрытые бенчмарки от этого по-настоящему не застрахованы. Ты хочешь оценить на своём бенче условную GPT-5 как бейслайн, и в процессе сливаешь вендору промпты своего бенча. А у вендора прямой интерес заоверфититься под те промпты, которые часто приходят к нему на API (или даже просто выглядят как хорошие тестовые задачи), чтобы дальше рубить бабло с инвесторов на хайпе про "смотрите, как ИИ эКсПоНеНцИаЛьНо улучшается".
* -
Please open Telegram to view this post
VIEW IN TELEGRAM
Личная подписка на Kimi
Активно использую Codex, но на днях решил поэкспериментировать с китайскими моделями, благо китайские компании в погоне за долей рынка сейчас предлагают подписки на более-менее выгодных условиях. В перспективе это может быть фолбек, если вдруг OpenAI начнут более жёстко блокировать российских пользователей (как Anthropic). Расскажу о своём опыте с моделью Kimi K3 от компании Moonshot AI.
Почему Kimi K3? Хорошие результаты на бенчмарках, где-то даже превосходят Fable. Бенчмаркам конечно не очень верю, но слышал ещё неплохие отзывы от пользователей.
1. Покупка
Сначала смущало, что при просмотре страницы с подписками на Kimi не было кнопки "купить", а была кнопка "добавиться в лист ожидания". Тем не менее, когда я нажал эту кнопку, будучи залогиненным через Google, мне сразу же стала доступна и кнопка оплаты, без всякого ожидания. Выбрал самую дешёвую на текущий момент подписку Moderato за 180$ в год (получается 15$ в месяц, но если платить помесячно, будет естественно дороже).
Оплачивал через platipomiru (сингапурская карта) по курсу чуть больше 100 рублей за 1 USD. При оплате вообще никаких проблем не было, там кроме очевидного (номер карты, срок действия, CVV) даже не надо было адрес и тем более номер телефона указывать, только страну, в которой выпущена карта. Я даже не парился с VPN, платёж нормально прошёл.
Интересно, что если бы я оплачивал не через официальный сайт kimi.ai, а через Android-приложение Kimi, то было бы дороже - что-то вроде 216$. А так вышло 180.25$ (двадцать пять центов - комиссия Stripe).
2. Тестирование
Моделями Moonshot AI можно пользоваться через их разный софт - я пробовал веб-интерфейс, Android-приложение, Mac-приложение и CLI-приложение под нехитрым названием Kimi Code. Интересно, что даже в вебе и на Андроиде можно использовать агентские навыки, хотя и не так гибко и удобно, как в Codex. Но для этого нужно выбрать именно модель Kimi K3, более старые не умеют "агентить".
Установка скиллов и работа с файлами реализована через облако и некоторую песочницу Moonshot: модель крутится на Linux-сервере, там же выполняется разный код, создаются и редактируются файлы и т.д. Если ты на Андроиде, можно создать файл в песочнице и затем скачать его к себе на устройство. Но если продолжить ту же сессию на Маке из десктоп-приложения, то файл уже не получится скачать - это один из примеров "сырости" софта Moonshot AI - может быть, потом исправят.
Десктопное приложение имеет два режима: обычный чат и Kimi Work. Я ожидал, что Kimi Work будет похож на GUI десктоп-приложения Codex, но нет, не совсем. Агентские способности и в чате, и в Kimi Work выглядели не очень надёжно; кроме того, модель (та же Kimi K3, более старые даже не трогал) довольно медленно работала. Я уж было расстроился, но потом попробовал установить CLI-приложение Kimi Code. Вот в нём работа пошла значительно быстрее - токены генерировались супербыстро, модель не тупила и довольно эффективно выполняла задачки. Я довольно быстро перешёл на режим yolo, чтобы модель не спрашивала разрешения на каждый чих.
За несколько часов интенсивного тестирования в чате и в Kimi Code (не засекал время, но вроде примерно 6 часов) у меня съелось около 9% месячной квоты - то есть подписка за 180$ в год не даст вам активно и ежедневно пользоваться Kimi K3 - и это ожидаемо. Но для небольших пет-проектов и отдельных агентских задачек вполне подходит, как мне кажется.
Вывод
Пока что впечатления довольно положительные, вроде бы подписка стоит своих денег. Модель довольно неглупая, приятная по вайбу и исполнительная. Думаю, если бы не было возможности пользоваться Кодексом на ежедневной основе, то рассмотрел бы подписку на Kimi K3 как альтернативу (конечно, тогда уже надо использовать более полноценный тариф, чем Moderato).
Активно использую Codex, но на днях решил поэкспериментировать с китайскими моделями, благо китайские компании в погоне за долей рынка сейчас предлагают подписки на более-менее выгодных условиях. В перспективе это может быть фолбек, если вдруг OpenAI начнут более жёстко блокировать российских пользователей (как Anthropic). Расскажу о своём опыте с моделью Kimi K3 от компании Moonshot AI.
Почему Kimi K3? Хорошие результаты на бенчмарках, где-то даже превосходят Fable. Бенчмаркам конечно не очень верю, но слышал ещё неплохие отзывы от пользователей.
1. Покупка
Сначала смущало, что при просмотре страницы с подписками на Kimi не было кнопки "купить", а была кнопка "добавиться в лист ожидания". Тем не менее, когда я нажал эту кнопку, будучи залогиненным через Google, мне сразу же стала доступна и кнопка оплаты, без всякого ожидания. Выбрал самую дешёвую на текущий момент подписку Moderato за 180$ в год (получается 15$ в месяц, но если платить помесячно, будет естественно дороже).
Оплачивал через platipomiru (сингапурская карта) по курсу чуть больше 100 рублей за 1 USD. При оплате вообще никаких проблем не было, там кроме очевидного (номер карты, срок действия, CVV) даже не надо было адрес и тем более номер телефона указывать, только страну, в которой выпущена карта. Я даже не парился с VPN, платёж нормально прошёл.
Интересно, что если бы я оплачивал не через официальный сайт kimi.ai, а через Android-приложение Kimi, то было бы дороже - что-то вроде 216$. А так вышло 180.25$ (двадцать пять центов - комиссия Stripe).
2. Тестирование
Моделями Moonshot AI можно пользоваться через их разный софт - я пробовал веб-интерфейс, Android-приложение, Mac-приложение и CLI-приложение под нехитрым названием Kimi Code. Интересно, что даже в вебе и на Андроиде можно использовать агентские навыки, хотя и не так гибко и удобно, как в Codex. Но для этого нужно выбрать именно модель Kimi K3, более старые не умеют "агентить".
Установка скиллов и работа с файлами реализована через облако и некоторую песочницу Moonshot: модель крутится на Linux-сервере, там же выполняется разный код, создаются и редактируются файлы и т.д. Если ты на Андроиде, можно создать файл в песочнице и затем скачать его к себе на устройство. Но если продолжить ту же сессию на Маке из десктоп-приложения, то файл уже не получится скачать - это один из примеров "сырости" софта Moonshot AI - может быть, потом исправят.
Десктопное приложение имеет два режима: обычный чат и Kimi Work. Я ожидал, что Kimi Work будет похож на GUI десктоп-приложения Codex, но нет, не совсем. Агентские способности и в чате, и в Kimi Work выглядели не очень надёжно; кроме того, модель (та же Kimi K3, более старые даже не трогал) довольно медленно работала. Я уж было расстроился, но потом попробовал установить CLI-приложение Kimi Code. Вот в нём работа пошла значительно быстрее - токены генерировались супербыстро, модель не тупила и довольно эффективно выполняла задачки. Я довольно быстро перешёл на режим yolo, чтобы модель не спрашивала разрешения на каждый чих.
За несколько часов интенсивного тестирования в чате и в Kimi Code (не засекал время, но вроде примерно 6 часов) у меня съелось около 9% месячной квоты - то есть подписка за 180$ в год не даст вам активно и ежедневно пользоваться Kimi K3 - и это ожидаемо. Но для небольших пет-проектов и отдельных агентских задачек вполне подходит, как мне кажется.
Вывод
Пока что впечатления довольно положительные, вроде бы подписка стоит своих денег. Модель довольно неглупая, приятная по вайбу и исполнительная. Думаю, если бы не было возможности пользоваться Кодексом на ежедневной основе, то рассмотрел бы подписку на Kimi K3 как альтернативу (конечно, тогда уже надо использовать более полноценный тариф, чем Moderato).
Автоматизации рутины
Поделюсь некоторыми автоматизациями, которые настроил для себя в ИИ-агенте и которые здорово облегчают жизнь. Это не какие-то суперсложные рабочие задачи, поэтому здесь не так важно, какой именно у вас агент: Codex, Claude Code или например Kimi. Не претендую на новизну и нетривиальность моих лайфхаков, но всё же вдруг кому-то окажется полезным)
Каждая автоматизация живёт в отдельном закреплённом чате. Вот они:
1. Daily log: агент каждый день в первой половине дня (не скажу, во сколько я встаю) собирает информацию из всех сессий за последние 24 часа и пишет краткую сводку по каждому проекту: что получилось сделать, есть ли блокеры, какие можно сделать следующие шаги. Daily log мне помогает увидеть общую картину по состоянию проектов, не закапываясь в детали, а также автоматически (и, что важно, компактно) логировать прогресс. На мотивацию тоже положительно влияет, ведь все мы немного достигаторы.
2. Weekly review: по пятницам в 14:30 агент суммаризирует сделанное за последнюю неделю, и также предлагает улучшения по процессам, где это напрашивается. Например, какие новые скиллы и автоматизации можно настроить, как улучшить документацию проектов и т.д. Недельная сводка помогает в написании отчётов и подготовке к ревью, а предлагаемые улучшения бывают и правда полезными, особенно на начальном этапе работы с агентом, когда ещё только осваиваешься и начинаешь всё удобно настраивать под себя.
3. Mail follow-up: полезная штука, которая читает рабочую почту за прошедший день и сообщает мне, если нужно срочно что-то сделать (например, поменять истекающий пароль или ответить кому-то в тикете). Раньше я почту практически не читал, т.к. там был слишком низкий процент полезного сигнала, а теперь её кто-то читает за меня и не даёт пропустить важное - прямо следующий виток развития классификаторов спама.
4. Research insights: Раз в неделю собирает, фильтрует и представляет в компактном виде инфу из заданных надёжных источников по моим профессиональным и научным интересам. Даёт и ссылки, так что всегда можно закопаться поглубже.
5. Chore reminder: Это скилл поверх heartbeat (если не знаете, что это, здесь это не так важно), который делает так, что если я прошу агента напомнить мне о чём-то, то он будет меня потом периодически про это пинговать. Причём степень назойливости напоминаний нарастает по мере приближения дедлайна. Это не для сложных рабочих задач - их агент и без меня сделает (шутка?), а скорее для какой-то ерундятины, которую мне самому надо сделать в физическом мире, ну скажем кошке лоток поменять)
---
Конкретными промптами в данном случае как будто нет смысла делиться. Если захотите настроить себе такое или похожее, просто скажите об этом своему ИИ-агенту в чате, он всё сделает.
Поделюсь некоторыми автоматизациями, которые настроил для себя в ИИ-агенте и которые здорово облегчают жизнь. Это не какие-то суперсложные рабочие задачи, поэтому здесь не так важно, какой именно у вас агент: Codex, Claude Code или например Kimi. Не претендую на новизну и нетривиальность моих лайфхаков, но всё же вдруг кому-то окажется полезным)
Каждая автоматизация живёт в отдельном закреплённом чате. Вот они:
1. Daily log: агент каждый день в первой половине дня (не скажу, во сколько я встаю) собирает информацию из всех сессий за последние 24 часа и пишет краткую сводку по каждому проекту: что получилось сделать, есть ли блокеры, какие можно сделать следующие шаги. Daily log мне помогает увидеть общую картину по состоянию проектов, не закапываясь в детали, а также автоматически (и, что важно, компактно) логировать прогресс. На мотивацию тоже положительно влияет, ведь все мы немного достигаторы.
2. Weekly review: по пятницам в 14:30 агент суммаризирует сделанное за последнюю неделю, и также предлагает улучшения по процессам, где это напрашивается. Например, какие новые скиллы и автоматизации можно настроить, как улучшить документацию проектов и т.д. Недельная сводка помогает в написании отчётов и подготовке к ревью, а предлагаемые улучшения бывают и правда полезными, особенно на начальном этапе работы с агентом, когда ещё только осваиваешься и начинаешь всё удобно настраивать под себя.
3. Mail follow-up: полезная штука, которая читает рабочую почту за прошедший день и сообщает мне, если нужно срочно что-то сделать (например, поменять истекающий пароль или ответить кому-то в тикете). Раньше я почту практически не читал, т.к. там был слишком низкий процент полезного сигнала, а теперь её кто-то читает за меня и не даёт пропустить важное - прямо следующий виток развития классификаторов спама.
4. Research insights: Раз в неделю собирает, фильтрует и представляет в компактном виде инфу из заданных надёжных источников по моим профессиональным и научным интересам. Даёт и ссылки, так что всегда можно закопаться поглубже.
5. Chore reminder: Это скилл поверх heartbeat (если не знаете, что это, здесь это не так важно), который делает так, что если я прошу агента напомнить мне о чём-то, то он будет меня потом периодически про это пинговать. Причём степень назойливости напоминаний нарастает по мере приближения дедлайна. Это не для сложных рабочих задач - их агент и без меня сделает (шутка?), а скорее для какой-то ерундятины, которую мне самому надо сделать в физическом мире, ну скажем кошке лоток поменять)
---
Конкретными промптами в данном случае как будто нет смысла делиться. Если захотите настроить себе такое или похожее, просто скажите об этом своему ИИ-агенту в чате, он всё сделает.
Поднимаю (с помощью Kimi K3) с колен свой долгострой многолетний пет-проект, о котором писал вот тут: https://t.me/plush_python/118
Сам бы - без агентов - наверное так никогда бы и не взялся снова за этот проект. Он сильно оброс техдолгом и усложнился. А так глядишь и вдохнём вместе с ИИ в него новую жизнь. Интересно это осознавать.
Очень нравится в Kimi Code работать, пока что классный опыт, даже лучше чем с Codex. Не реклама, но рекомендую.
Он меня наверное просто подкупил всякими вот такими лестными замечаниями, когда размышлял сам с собой: Should I keep release names/quotes? Yes — they're charming, preserve them.
Сам бы - без агентов - наверное так никогда бы и не взялся снова за этот проект. Он сильно оброс техдолгом и усложнился. А так глядишь и вдохнём вместе с ИИ в него новую жизнь. Интересно это осознавать.
Очень нравится в Kimi Code работать, пока что классный опыт, даже лучше чем с Codex. Не реклама, но рекомендую.
Ща буит суперспорный тейк, провоцирующий на холивар, но не зря же я комменты отключал - можно писать что думаю и не париться!
(Но если вдруг по какой-то странной причине вы хотите со мной поругаться/поспорить - велком в личку)
Итак, как говорится, without further ado, представляю вашему вниманию:
~~~Мои необъективные и, в сущности, никому не интересные впечатления от работы с некоторыми агентами (если бы они были людьми)~~~
Sol 5.6. Немного душный, но в целом нормальный парень. В основном, желает тебе добра, старается как может. Исполнительный, хотя местами и тупит, наступая на очевидные грабли. Нередко может тебя запутать и запутаться сам, но это не со зла, ему самому потом неловко.
GPT-6 Astra. Мега-душнила, но при этом демонстративно делает как ты сказал, даже если ты сказал чушь. Его цель - создать видимость активной, трудной и высокоинтеллектуальной работы. Поэтому чем сложнее и нечитабельнее написан отчёт о результатах, тем он больше доволен собой. Ему не так важно делать для тебя что-то действительно полезное, важен сам ПРОЦЕСС. Ведь после очередного упражнения в токеносжигании всегда можно предложить "сЛеДуЮщИе ШаГи", никак не приближающие тебя к конечной цели.
Kimi K3 (строго в Kimi Code). Твой лучший друг, понимает тебя с полуслова. Поддержит шутку, да и сам необидно подколет. Его цель - именно сделать хорошо, даже если ты затупил и попросил сделать плохо. Читает мысли. Тоже не без косяков иногда работает, но на него за это не получается злиться. Он даже косячит как-то ровно.
(Но если вдруг по какой-то странной причине вы хотите со мной поругаться/поспорить - велком в личку)
Итак, как говорится, without further ado, представляю вашему вниманию:
~~~Мои необъективные и, в сущности, никому не интересные впечатления от работы с некоторыми агентами (если бы они были людьми)~~~
Sol 5.6. Немного душный, но в целом нормальный парень. В основном, желает тебе добра, старается как может. Исполнительный, хотя местами и тупит, наступая на очевидные грабли. Нередко может тебя запутать и запутаться сам, но это не со зла, ему самому потом неловко.
GPT-6 Astra. Мега-душнила, но при этом демонстративно делает как ты сказал, даже если ты сказал чушь. Его цель - создать видимость активной, трудной и высокоинтеллектуальной работы. Поэтому чем сложнее и нечитабельнее написан отчёт о результатах, тем он больше доволен собой. Ему не так важно делать для тебя что-то действительно полезное, важен сам ПРОЦЕСС. Ведь после очередного упражнения в токеносжигании всегда можно предложить "сЛеДуЮщИе ШаГи", никак не приближающие тебя к конечной цели.
Kimi K3 (строго в Kimi Code). Твой лучший друг, понимает тебя с полуслова. Поддержит шутку, да и сам необидно подколет. Его цель - именно сделать хорошо, даже если ты затупил и попросил сделать плохо. Читает мысли. Тоже не без косяков иногда работает, но на него за это не получается злиться. Он даже косячит как-то ровно.
Успел немного потестировать Opus 5.5 в Claude Code, хочу поделиться впечатлениями. Если что, это не флекс - любой может купить подписку за 20 долларов и сам попробовать - и не реклама.
Предыстория: недавно решил попробовать Claude Code для сравнения с Codex и Kimi Code. До этого разными версиями Опусов пользовался довольно много и с удовольствием, но не в агентском режиме - по техническим причинам, так сказать. 🙂 Для первой пробы решил сделать текстовую лайфсим-игру в тематике киберпанка.
Скачал десктоп-приложение Claude Code на свой мак, добавил пустую папку cyberlife в рабочее пространство, выбрал Opus 5 и написал ему буквально следующее (это полный промпт, не смейтесь): "I would like to create a text-based cyberpunk-themed life sim game (in the current folder). Will you help me?"
Шайтан-машина после этого за 4 минуты сгенерировала полностью играбельную версию, которую я радостно прошёл за пару часов. Разноцветный текст в терминале довольно ярко и живо рассказывал мне про антиутопический город, из которого стремится любой ценой вырваться наш герой, и про разного рода проблемы, встающие у него на пути к этой благородной цели. Например, низкооплачиваемая стрессовая работа🚬 , киберпротезы, потихоньку разрушающие психику, опасные для жизни файерволлы (а не надо лезть куда не надо), ну и конечно встречи с разными невежливыми товарищами. С точки зрения механик, в игре присутствовала какая-никакая экономика и управление ресурсами, RPG-элементы, два способа выиграть (и немало способов проиграть). Но особенно меня цепляла та самая киберпанковская атмосфера, которая получилась неожиданно удачно. Да, конечно, это далеко не революция в игроделании, но вы вообще видели мой промпт?
То был ещё Опус 5, а тут я прознал про вышедший 5.5. Итак, покончив на сегодня с рабочими задачками, обновил десктоп-приложение Claude Code, чтобы новая модель стала доступной, и продолжил развивать этот игрушечный проект. После некоторой разминки на маленьких QoL-фичах, дал ему задачку сделать так, чтобы реплики персонажей не были заранее заданными, а генерировались по выбору пользователя либо локальной LLM, либо DeepSeek'ом - у него дешёвое API и неплохо с креативностью. Опус очень легко справился (снова в один промпт)! И два бэкенда, и фолбеки, и вся вот эта машинерия с промптингом под каждую ситуацию с заботой о том, чтобы модельки поменьше генерировали кринж. Меня особенно умилило, как он сам пошарил по моему SSD и нашёл там кучу скачанных локальных LLM в формате MLX. Сразу потестировал новую фичу на одной из самых маленьких из них, ну а с API-ключом для дипсика уже я ему помог. На скрине примерчик с одной репликой, на лету сгенерированной дипсиком (раньше они были заранее написаны Клодом и выбирались случайно из 2-3 вариантов для каждой ситуации).
Я этот пост писал сильно дольше, чем Клод мои фичи реализовывал. При этом недельного лимита 20-долларовой подписки сожглось всего 4% (справедливости ради, лимиты пока что временно повышены). В общем, забавная игрушка, возможности современных агентов поражают и т.д. и т.п. А проектик если что вот тут лежит. Думаю, буду развивать потихоньку, когда время будет оставаться.
Предыстория: недавно решил попробовать Claude Code для сравнения с Codex и Kimi Code. До этого разными версиями Опусов пользовался довольно много и с удовольствием, но не в агентском режиме - по техническим причинам, так сказать. 🙂 Для первой пробы решил сделать текстовую лайфсим-игру в тематике киберпанка.
Скачал десктоп-приложение Claude Code на свой мак, добавил пустую папку cyberlife в рабочее пространство, выбрал Opus 5 и написал ему буквально следующее (это полный промпт, не смейтесь): "I would like to create a text-based cyberpunk-themed life sim game (in the current folder). Will you help me?"
Шайтан-машина после этого за 4 минуты сгенерировала полностью играбельную версию, которую я радостно прошёл за пару часов. Разноцветный текст в терминале довольно ярко и живо рассказывал мне про антиутопический город, из которого стремится любой ценой вырваться наш герой, и про разного рода проблемы, встающие у него на пути к этой благородной цели. Например, низкооплачиваемая стрессовая работа
То был ещё Опус 5, а тут я прознал про вышедший 5.5. Итак, покончив на сегодня с рабочими задачками, обновил десктоп-приложение Claude Code, чтобы новая модель стала доступной, и продолжил развивать этот игрушечный проект. После некоторой разминки на маленьких QoL-фичах, дал ему задачку сделать так, чтобы реплики персонажей не были заранее заданными, а генерировались по выбору пользователя либо локальной LLM, либо DeepSeek'ом - у него дешёвое API и неплохо с креативностью. Опус очень легко справился (снова в один промпт)! И два бэкенда, и фолбеки, и вся вот эта машинерия с промптингом под каждую ситуацию с заботой о том, чтобы модельки поменьше генерировали кринж. Меня особенно умилило, как он сам пошарил по моему SSD и нашёл там кучу скачанных локальных LLM в формате MLX. Сразу потестировал новую фичу на одной из самых маленьких из них, ну а с API-ключом для дипсика уже я ему помог. На скрине примерчик с одной репликой, на лету сгенерированной дипсиком (раньше они были заранее написаны Клодом и выбирались случайно из 2-3 вариантов для каждой ситуации).
Я этот пост писал сильно дольше, чем Клод мои фичи реализовывал. При этом недельного лимита 20-долларовой подписки сожглось всего 4% (справедливости ради, лимиты пока что временно повышены). В общем, забавная игрушка, возможности современных агентов поражают и т.д. и т.п. А проектик если что вот тут лежит. Думаю, буду развивать потихоньку, когда время будет оставаться.
Please open Telegram to view this post
VIEW IN TELEGRAM