Заметил, что многие пользователи Claude Code в терминале не знают, что его status bar можно наполнять полезной информацией через команду
Например, можно добавить % используемого контекста, стоимость сессии, информацию из гита. Доступных данных достаточно много.
Я себе поставил 1в1 пример из документации (см. скриншот) и радостно забыл о команде
/statusline + промпт с информацией, которую вы хотите там видеть. Например, можно добавить % используемого контекста, стоимость сессии, информацию из гита. Доступных данных достаточно много.
Я себе поставил 1в1 пример из документации (см. скриншот) и радостно забыл о команде
/cost.👍15🔥6❤4
Клод теперь умеет в телеграм.
Кажется, процесс воспроизведения функционала OpenClaw успешно завершен.
Видимо пора возобновлять подписку антропиков.
Кажется, процесс воспроизведения функционала OpenClaw успешно завершен.
Видимо пора возобновлять подписку антропиков.
Claude Code Docs
Push events into a running session with channels - Claude Code Docs
Use channels to push messages, alerts, and webhooks into your Claude Code session from an MCP server. Forward CI results, chat messages, and monitoring events so Claude can react while you're away.
❤8🔥5👍2👀1
Для заметок я использую Obsidian.
Два главных преимущества перед Notion для меня:
1. Использование стандартных .md файлов вместо непонятных блоков Notion
2. Удобные ссылки, с потощью которых очень удобно быстро связывать разные заметки в единую сеть информации
После того как настроил у себя OpenClaw, я выдал ему доступ к хранилищу и велел вести там лог всего, что у нас с агентом происходит. Кажется, что получилось неплохо.
Как оно работает:
• Есть папка Inbox, куда во время всех взаимодействий складируются заметки
• Раз в день запускается CRON джоба, которая сортирует заметки из инбокса и распределяет их по правильным папкам
• Есть отдельные папки для проектов, базы знаний, ежедневных заметок и т.п.
• В проектах - внутренняя структура с задачами, саммари, списком принятых решений и т.д.
• Все это завязано на внутренних ссылках, + добавлены автоматически генерящиеся странички с навигацией
Я сделал репозиторий, в который добавил копию своего хранилища (естественно, без данных), а также инструкцию для агента, как ему настроить все это дело с нуля (промпты, CRON и т.д.).
Пользуйтесь на здоровье. Будут идеи, что улучшить - делайте PR-ы, буду рад допилить систему вместе.
P.S. Ну и звездочки ставьте на репе если вдруг понравилось - буду в будущем дополнять другими своими сетапами
Два главных преимущества перед Notion для меня:
1. Использование стандартных .md файлов вместо непонятных блоков Notion
2. Удобные ссылки, с потощью которых очень удобно быстро связывать разные заметки в единую сеть информации
После того как настроил у себя OpenClaw, я выдал ему доступ к хранилищу и велел вести там лог всего, что у нас с агентом происходит. Кажется, что получилось неплохо.
Как оно работает:
• Есть папка Inbox, куда во время всех взаимодействий складируются заметки
• Раз в день запускается CRON джоба, которая сортирует заметки из инбокса и распределяет их по правильным папкам
• Есть отдельные папки для проектов, базы знаний, ежедневных заметок и т.п.
• В проектах - внутренняя структура с задачами, саммари, списком принятых решений и т.д.
• Все это завязано на внутренних ссылках, + добавлены автоматически генерящиеся странички с навигацией
Я сделал репозиторий, в который добавил копию своего хранилища (естественно, без данных), а также инструкцию для агента, как ему настроить все это дело с нуля (промпты, CRON и т.д.).
Пользуйтесь на здоровье. Будут идеи, что улучшить - делайте PR-ы, буду рад допилить систему вместе.
P.S. Ну и звездочки ставьте на репе если вдруг понравилось - буду в будущем дополнять другими своими сетапами
Obsidian
Obsidian - Sharpen your thinking
The free and flexible app for your private thoughts.
👍20🔥9❤🔥8
Если вы, как и я, используете LiteLLM для обращения к моделькам - рекомендую прочитать вот эту страничку.
В одну из последних версий (1.82.7+) затесался вредоносный код, который сливает пользовательские данные (ключи, переменные окружения и еще куча всего) - надо быстренько откатиться и провести ротацию ключей.
Мне повезло, что я свою версию заблаговременно запинил, но в целом ситуация не очень - такие вот синергии приносят вайбкодинг с опенсорсом.
В одну из последних версий (1.82.7+) затесался вредоносный код, который сливает пользовательские данные (ключи, переменные окружения и еще куча всего) - надо быстренько откатиться и провести ротацию ключей.
Мне повезло, что я свою версию заблаговременно запинил, но в целом ситуация не очень - такие вот синергии приносят вайбкодинг с опенсорсом.
GitHub
[Security]: CRITICAL: Malicious litellm_init.pth in litellm 1.82.8 — credential stealer · Issue #24512 · BerriAI/litellm
[LITELLM TEAM] - For updates from the team, please see: #24518 [Security]: CRITICAL: Malicious litellm_init.pth in litellm 1.82.8 PyPI package — credential stealer Summary The litellm==1.82.8 wheel...
👍6❤3
Несколько подзабил я на этот канал - постараюсь исправляться.
В последнее время часто попадаются жалобы на то, что Опус стал глупее, не справляется с простейшими задачами, отстает от GPT-Codex, и так далее.
Такие комментарии встречаются постоянно со всеми моделями и без какой-либо подтверждающей их фактуры, но в случае с Клодом их частота, кажется, радикально подскачила после одного из обновлений, которое сбросило дефолтный уровень рассуждений (`/effort`) на medium.
Как можно попробовать исправить?
Два варианта:
1. --effort max как параметр при запуске клода (ну или через команду /effort внутри сессии)
2.
Имхо, как правило даже очевидного переключения уровня усилий оказывается достаточно для восстановления привычного уровня нашей любимой модельки.
Ну а чтобы все это дело вручную не прописывать на каждом запуске сессии - можно сделать alias в терминале, например:
или
(здесь я еще передаю
В последнее время часто попадаются жалобы на то, что Опус стал глупее, не справляется с простейшими задачами, отстает от GPT-Codex, и так далее.
Такие комментарии встречаются постоянно со всеми моделями и без какой-либо подтверждающей их фактуры, но в случае с Клодом их частота, кажется, радикально подскачила после одного из обновлений, которое сбросило дефолтный уровень рассуждений (`/effort`) на medium.
Как можно попробовать исправить?
Два варианта:
1. --effort max как параметр при запуске клода (ну или через команду /effort внутри сессии)
2.
CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 - отключает адаптивный бюджет для рассуждений. Вместе с ним нужно передавать еще MAX_THINKING_TOKENS=XXX для ручной настройки бюджета на рассуждения.Имхо, как правило даже очевидного переключения уровня усилий оказывается достаточно для восстановления привычного уровня нашей любимой модельки.
Ну а чтобы все это дело вручную не прописывать на каждом запуске сессии - можно сделать alias в терминале, например:
echo 'alias maxyolo="claude --dangerously-skip-permissions --effort max"' >> ~/.zshrc
или
echo 'alias maxyolo="CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 MAX_THINKING_TOKENS=120000 claude --dangerously-skip-permissions "' >> ~/.zshrc
(здесь я еще передаю
--dangerously-skip-permissions - уберите, если пока доверяете ему меньше, чем я)😁9❤7🔥1
Gemini обзавелась приложенькой на мак (всего через 2 года после GPT).
Интересно, как быстро начнут копировать функционал OpenClaw/Anthropic для удаленного управления маком - был бы повод вернуться на любимого ассистента (хотя баги в iOS они до сих пор не починили).
Интересно, как быстро начнут копировать функционал OpenClaw/Anthropic для удаленного управления маком - был бы повод вернуться на любимого ассистента (хотя баги в iOS они до сих пор не починили).
Gemini
Gemini for macOS – native AI assistant and Mac automation
Elevate your desktop workflow with Gemini for macOS. Built for automating tasks with Gemini Spark and faster help with screen context for the task at hand.
👍5❤2😱1
Последние дни я тестировал Opus 4.7, но пока что откатился обратно на 4.6.
В плане качества написания кода вау-эффекта у меня не случилось. Это не обязательно значит, что 4.7 не улучшился, — скорее, для моих задач просто хватает 4.6. При этом на arena.ai 4.6 и 4.7 по рейтингам очень близки — находятся внутри доверительных интервалов друг друга. В некоторых сферах (следование инструкциям, сложные промпты, математика и т. д.) 4.6 по точечной оценке даже опережает 4.7.
Что заметно изменилось, так это стоимость использования модели. Хотя цена за млн токенов осталась $5/$25:
1. Обновился токенайзер. Теперь текст, переданный модели или сгенерированный ею, будет занимать примерно на треть больше токенов, а значит, и тратить на треть больше бюджета.
• Это подтверждают сами Anthropic.
• Вот небольшое исследование на эту тему.
• Вот анализ анонимных запросов.
• Я запустил несколько относительно сложных промптов, требующих рассуждений и использования субагентов: 4.7 оказался на них дороже 4.6 на 45%, сгенерировав при этом идентичные по смыслу ответы.
2. Opus стал задавать больше вопросов пользователю, причем, кажется, зачастую ненужных и имеющих очевидные ответы. По этой теме попался интересный пост:
При всем этом, если использовать 4.7 на AWS Bedrock, постоянно случаются задержки запросов — кажется, пока не успели выделить должные мощности.
В общем, кажется, что для большинства пользователей 4.7 пока что будет способом отдать больше денег Anthropic. Посмотрим, как пойдет его развитие дальше и как он поведет себя на более сложных и долгоиграющих задачах.
В плане качества написания кода вау-эффекта у меня не случилось. Это не обязательно значит, что 4.7 не улучшился, — скорее, для моих задач просто хватает 4.6. При этом на arena.ai 4.6 и 4.7 по рейтингам очень близки — находятся внутри доверительных интервалов друг друга. В некоторых сферах (следование инструкциям, сложные промпты, математика и т. д.) 4.6 по точечной оценке даже опережает 4.7.
Что заметно изменилось, так это стоимость использования модели. Хотя цена за млн токенов осталась $5/$25:
1. Обновился токенайзер. Теперь текст, переданный модели или сгенерированный ею, будет занимать примерно на треть больше токенов, а значит, и тратить на треть больше бюджета.
• Это подтверждают сами Anthropic.
• Вот небольшое исследование на эту тему.
• Вот анализ анонимных запросов.
• Я запустил несколько относительно сложных промптов, требующих рассуждений и использования субагентов: 4.7 оказался на них дороже 4.6 на 45%, сгенерировав при этом идентичные по смыслу ответы.
2. Opus стал задавать больше вопросов пользователю, причем, кажется, зачастую ненужных и имеющих очевидные ответы. По этой теме попался интересный пост:
4.6 felt smart. 4.7 is honest. What looks like less intelligence is 4.7 refusing to guess.
При всем этом, если использовать 4.7 на AWS Bedrock, постоянно случаются задержки запросов — кажется, пока не успели выделить должные мощности.
В общем, кажется, что для большинства пользователей 4.7 пока что будет способом отдать больше денег Anthropic. Посмотрим, как пойдет его развитие дальше и как он поведет себя на более сложных и долгоиграющих задачах.
Arena AI: The Official AI Ranking & LLM Leaderboard
Chat, compare, vote for the world's best AI models. Join the community shaping the public leaderboard for LLMs, image, and code models through real-world evaluation.
👍8❤4😁1
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь».
В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы Новой Гвинеи, племена Австралии и т.д.
Во-первых, книга безумно интересная и невероятно глубокая в своем анализе — боюсь даже представить, сколько времени автору понадобилось для сбора всей фактуры. А он писал ее в 90-е, когда не то что ChatGPT, а даже интернета в его текущем виде не было.
Во-вторых, в ней упоминается тезис, который мне самому приходил на ум каждый раз, когда я слышал утверждения о неспособности языковых моделей изобрести что-либо новое:
То есть новые изобретения — это не что-то, что возникает в вакууме, а плод рекомбинации уже существующих технологий, материалов и идей, который затем проходит через фильтр актуальности и пользы для общества.
Если принять этот взгляд, то способность к инновации — это не обязательно мистическая способность “создать из ничего”. Скорее, это способность производить новые комбинации и проверять, какие из них действительно работают.
Кажется, что ЛЛМки уже неплохо справляются с первой частью — рекомбинацией. Они умеют быстро соединять существующие идеи, подходы и паттерны, хотя часто делают это с меньшими отклонениями от уже существующих эталонов, чем человеческий автор.
А вот успешность второй части — отбора — зависит не только от самой модели, но и от среды вокруг нее: есть ли в конкретной сфере возможность быстро и достаточно объективно оценить плодотворность ее продукта.
Например, сомневаюсь, что в сфере искусств — литературы, живописи, кино — ЛЛМ без участия человека сможет в ближайшем будущем создать что-то действительно стоящее. Если ЛЛМ напишет тысячу книг, нужно, чтобы человечество их прочитало, оценило и оставило в библиотеках действительно стоящие из них.
Можно измерять продажи, дочитывания, лайки, отзывы и премии, но это все равно плохие прокси для художественной ценности. Там нет быстрой и стабильной функции потерь, которая позволила бы автоматически отбирать “лучшие” произведения без участия человеческой аудитории.
В написании кода же — кажется, наиболее успешной на текущий день для ЛЛМ-ок сфере — обратная связь намного дешевле и формальнее. Есть тесты, типы, линтеры, бенчмарки, профилирование, метрики продакшена: завелось или нет, сколько времени выполняется функция, сколько памяти потребляет и т.д.
То есть можно написать энное число версий кода и достаточно безболезненно отфильтровать из них успешные итерации. К тому же, в каждом языке программирования есть понятный набор базовых сущностей, из которых собирается любой код: классы, списки, функции и т.д.
В естественных науках тоже работают над тем, чтобы выстроить связь между выводами ЛЛМ и их эффективностью в реальном мире. Вот статья, где модели давали проектировать эксперименты, передавать их в автоматизированную физическую лабораторию, собирать результаты и автономно планировать следующие итерации.
Таким образом, как и в любой задаче машинного обучения (и, в целом, в любой жизненной задаче) — все сводится к подбору метрики, по которой оценивать результат, и функции потерь.
Ну а дальше — итерации, ошибки и победы.
В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы Новой Гвинеи, племена Австралии и т.д.
Во-первых, книга безумно интересная и невероятно глубокая в своем анализе — боюсь даже представить, сколько времени автору понадобилось для сбора всей фактуры. А он писал ее в 90-е, когда не то что ChatGPT, а даже интернета в его текущем виде не было.
Во-вторых, в ней упоминается тезис, который мне самому приходил на ум каждый раз, когда я слышал утверждения о неспособности языковых моделей изобрести что-либо новое:
Технологии развиваются накопительно, а не через одиночные подвиги гениев
...
Новые технологии и материалы дают возможность получать новые технологии, комбинируя уже имеющиеся элементы
-перевод ChatGPT
То есть новые изобретения — это не что-то, что возникает в вакууме, а плод рекомбинации уже существующих технологий, материалов и идей, который затем проходит через фильтр актуальности и пользы для общества.
Если принять этот взгляд, то способность к инновации — это не обязательно мистическая способность “создать из ничего”. Скорее, это способность производить новые комбинации и проверять, какие из них действительно работают.
Кажется, что ЛЛМки уже неплохо справляются с первой частью — рекомбинацией. Они умеют быстро соединять существующие идеи, подходы и паттерны, хотя часто делают это с меньшими отклонениями от уже существующих эталонов, чем человеческий автор.
А вот успешность второй части — отбора — зависит не только от самой модели, но и от среды вокруг нее: есть ли в конкретной сфере возможность быстро и достаточно объективно оценить плодотворность ее продукта.
Например, сомневаюсь, что в сфере искусств — литературы, живописи, кино — ЛЛМ без участия человека сможет в ближайшем будущем создать что-то действительно стоящее. Если ЛЛМ напишет тысячу книг, нужно, чтобы человечество их прочитало, оценило и оставило в библиотеках действительно стоящие из них.
Можно измерять продажи, дочитывания, лайки, отзывы и премии, но это все равно плохие прокси для художественной ценности. Там нет быстрой и стабильной функции потерь, которая позволила бы автоматически отбирать “лучшие” произведения без участия человеческой аудитории.
В написании кода же — кажется, наиболее успешной на текущий день для ЛЛМ-ок сфере — обратная связь намного дешевле и формальнее. Есть тесты, типы, линтеры, бенчмарки, профилирование, метрики продакшена: завелось или нет, сколько времени выполняется функция, сколько памяти потребляет и т.д.
То есть можно написать энное число версий кода и достаточно безболезненно отфильтровать из них успешные итерации. К тому же, в каждом языке программирования есть понятный набор базовых сущностей, из которых собирается любой код: классы, списки, функции и т.д.
В естественных науках тоже работают над тем, чтобы выстроить связь между выводами ЛЛМ и их эффективностью в реальном мире. Вот статья, где модели давали проектировать эксперименты, передавать их в автоматизированную физическую лабораторию, собирать результаты и автономно планировать следующие итерации.
Таким образом, как и в любой задаче машинного обучения (и, в целом, в любой жизненной задаче) — все сводится к подбору метрики, по которой оценивать результат, и функции потерь.
Ну а дальше — итерации, ошибки и победы.
👍18❤11🔥4
Наткнулся на прикольный инструмент от Microsoft - Тренер для AI-инженеров.
Тулза сканирует историю сессий по используемым агентам (Codex, Claude Code etc.) и рисует красивый дэшборд с анализом качества взаимодействия с ЛЛМ.
Из прикольного:
1️⃣ Анализирует частоту антипаттернов в четырех категориях - качество промптов, гигиена сессий, ревью рекомендаций модели, использование инструментов. У меня например все неплохо с промптами и инструментами, а вот внимательнее вычитывать рекомендации ЛЛМ-ки не помешало бы
2️⃣ Дает рекомендации по созданию кастомных скиллов. Сессии анализируются на предмет повторяющихся задач - дальше под них либо предлагается существующий community skill, либо генерится новый.
3️⃣ Собирает кучу красивой и интересной статистики - как распределяется время по проектам, в какие часы выполняется больше работы
4️⃣ Генерит упражнения для саморазвития - на улучшение качества .md файлов и обнаружение ИИ-слопа.
Часть функционала пока сыровата и у меня не завелась, но, учитывая то, как много не-технарей начинает нынче вайб-кодить - инструмент может в итоге оказаться супер-полезным. У нас в конторе по крайней мере постараюсь распространить.
Тулза сканирует историю сессий по используемым агентам (Codex, Claude Code etc.) и рисует красивый дэшборд с анализом качества взаимодействия с ЛЛМ.
Из прикольного:
1️⃣ Анализирует частоту антипаттернов в четырех категориях - качество промптов, гигиена сессий, ревью рекомендаций модели, использование инструментов. У меня например все неплохо с промптами и инструментами, а вот внимательнее вычитывать рекомендации ЛЛМ-ки не помешало бы
2️⃣ Дает рекомендации по созданию кастомных скиллов. Сессии анализируются на предмет повторяющихся задач - дальше под них либо предлагается существующий community skill, либо генерится новый.
3️⃣ Собирает кучу красивой и интересной статистики - как распределяется время по проектам, в какие часы выполняется больше работы
4️⃣ Генерит упражнения для саморазвития - на улучшение качества .md файлов и обнаружение ИИ-слопа.
Часть функционала пока сыровата и у меня не завелась, но, учитывая то, как много не-технарей начинает нынче вайб-кодить - инструмент может в итоге оказаться супер-полезным. У нас в конторе по крайней мере постараюсь распространить.
🔥9❤6👍5
DS с завода
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь». В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы…
Беру свои слова назад - умеют ЛЛМ-ки в искусство.
Один из проектов у меня называется Хеймдалль - агент для ревью пулл-реквестов.
Некоторое время назад заонбордили его в юбилейный сотый репозиторий. Я по этому поводу сказал Кодексу сгенерировать мне иллюстрацию для корпоративного блога, чтобы написать радостный пост.
Я ушел пить кофе, а когда вернулся - обнаружил, что забыл передать модельке ключ для генерации картинок. Но модельку это не остановило, и она накидала вот этот вот арт с помощью питона и библиотеки PIL. То есть вместо генерации картинок она генерировала квадратики и треугольники, и потом расставляла их так чтобы вышла вот такая красота.
Лично я считаю, что это - проявление феноменальной изобретательности и не ожидаю в обозримом будущем увидеть что-то более милое.
Один из проектов у меня называется Хеймдалль - агент для ревью пулл-реквестов.
Некоторое время назад заонбордили его в юбилейный сотый репозиторий. Я по этому поводу сказал Кодексу сгенерировать мне иллюстрацию для корпоративного блога, чтобы написать радостный пост.
Я ушел пить кофе, а когда вернулся - обнаружил, что забыл передать модельке ключ для генерации картинок. Но модельку это не остановило, и она накидала вот этот вот арт с помощью питона и библиотеки PIL. То есть вместо генерации картинок она генерировала квадратики и треугольники, и потом расставляла их так чтобы вышла вот такая красота.
Лично я считаю, что это - проявление феноменальной изобретательности и не ожидаю в обозримом будущем увидеть что-то более милое.
👍8🔥6❤2😁2
Forwarded from Сиолошная
Новый опус: https://www.anthropic.com/news/claude-opus-4-8
1) цена та же
2) сделали гранулярную разбивку длины рассуждений, как у ChatGPT
3) fast режим, ускоряющий генерацию в 2.5 раза, теперь в 3 раза дешевле, чем для предыдущих моделей. Получается было в 6 раз дороже, сейчас в 2 — надо брать.
4) «Одним из наиболее заметных улучшений в Opus 4.8 является его честность» — модель будет врать поменьше (наверное)
5) «Мы планируем выпустить новый класс моделей с ещё более высоким уровнем интеллекта, чем у Opus» — ждём «в ближайшие недели»
1) цена та же
2) сделали гранулярную разбивку длины рассуждений, как у ChatGPT
3) fast режим, ускоряющий генерацию в 2.5 раза, теперь в 3 раза дешевле, чем для предыдущих моделей. Получается было в 6 раз дороже, сейчас в 2 — надо брать.
4) «Одним из наиболее заметных улучшений в Opus 4.8 является его честность» — модель будет врать поменьше (наверное)
5) «Мы планируем выпустить новый класс моделей с ещё более высоким уровнем интеллекта, чем у Opus» — ждём «в ближайшие недели»
👍8❤3