DS с завода
766 subscribers
24 photos
5 files
37 links
Про аналитику, DS и ML простыми словами.
Download Telegram
Заметил, что многие пользователи Claude Code в терминале не знают, что его status bar можно наполнять полезной информацией через команду /statusline + промпт с информацией, которую вы хотите там видеть.

Например, можно добавить % используемого контекста, стоимость сессии, информацию из гита. Доступных данных достаточно много.

Я себе поставил 1в1 пример из документации (см. скриншот) и радостно забыл о команде /cost.
👍15🔥64
Клод теперь умеет в телеграм.

Кажется, процесс воспроизведения функционала OpenClaw успешно завершен.

Видимо пора возобновлять подписку антропиков.
8🔥5👍2👀1
Для заметок я использую Obsidian.

Два главных преимущества перед Notion для меня:
1. Использование стандартных .md файлов вместо непонятных блоков Notion
2. Удобные ссылки, с потощью которых очень удобно быстро связывать разные заметки в единую сеть информации

После того как настроил у себя OpenClaw, я выдал ему доступ к хранилищу и велел вести там лог всего, что у нас с агентом происходит. Кажется, что получилось неплохо.

Как оно работает:
• Есть папка Inbox, куда во время всех взаимодействий складируются заметки
• Раз в день запускается CRON джоба, которая сортирует заметки из инбокса и распределяет их по правильным папкам
• Есть отдельные папки для проектов, базы знаний, ежедневных заметок и т.п.
• В проектах - внутренняя структура с задачами, саммари, списком принятых решений и т.д.
• Все это завязано на внутренних ссылках, + добавлены автоматически генерящиеся странички с навигацией

Я сделал репозиторий, в который добавил копию своего хранилища (естественно, без данных), а также инструкцию для агента, как ему настроить все это дело с нуля (промпты, CRON и т.д.).

Пользуйтесь на здоровье. Будут идеи, что улучшить - делайте PR-ы, буду рад допилить систему вместе.

P.S. Ну и звездочки ставьте на репе если вдруг понравилось - буду в будущем дополнять другими своими сетапами
👍20🔥9❤‍🔥8
Есть ощущение, что codex в моем openclaw постепенно подходит к стадии проф выгорания.
😁13
Если вы, как и я, используете LiteLLM для обращения к моделькам - рекомендую прочитать вот эту страничку.

В одну из последних версий (1.82.7+) затесался вредоносный код, который сливает пользовательские данные (ключи, переменные окружения и еще куча всего) - надо быстренько откатиться и провести ротацию ключей.

Мне повезло, что я свою версию заблаговременно запинил, но в целом ситуация не очень - такие вот синергии приносят вайбкодинг с опенсорсом.
👍63
Несколько подзабил я на этот канал - постараюсь исправляться.

В последнее время часто попадаются жалобы на то, что Опус стал глупее, не справляется с простейшими задачами, отстает от GPT-Codex, и так далее.

Такие комментарии встречаются постоянно со всеми моделями и без какой-либо подтверждающей их фактуры, но в случае с Клодом их частота, кажется, радикально подскачила после одного из обновлений, которое сбросило дефолтный уровень рассуждений (`/effort`) на medium.

Как можно попробовать исправить?
Два варианта:
1. --effort max как параметр при запуске клода (ну или через команду /effort внутри сессии)
2. CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 - отключает адаптивный бюджет для рассуждений. Вместе с ним нужно передавать еще MAX_THINKING_TOKENS=XXX для ручной настройки бюджета на рассуждения.

Имхо, как правило даже очевидного переключения уровня усилий оказывается достаточно для восстановления привычного уровня нашей любимой модельки.

Ну а чтобы все это дело вручную не прописывать на каждом запуске сессии - можно сделать alias в терминале, например:


echo 'alias maxyolo="claude --dangerously-skip-permissions --effort max"' >> ~/.zshrc


или


echo 'alias maxyolo="CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 MAX_THINKING_TOKENS=120000 claude --dangerously-skip-permissions "' >> ~/.zshrc


(здесь я еще передаю --dangerously-skip-permissions - уберите, если пока доверяете ему меньше, чем я)
😁97🔥1
Gemini обзавелась приложенькой на мак (всего через 2 года после GPT).
Интересно, как быстро начнут копировать функционал OpenClaw/Anthropic для удаленного управления маком - был бы повод вернуться на любимого ассистента (хотя баги в iOS они до сих пор не починили).
👍52😱1
Последние дни я тестировал Opus 4.7, но пока что откатился обратно на 4.6.

В плане качества написания кода вау-эффекта у меня не случилось. Это не обязательно значит, что 4.7 не улучшился, — скорее, для моих задач просто хватает 4.6. При этом на arena.ai 4.6 и 4.7 по рейтингам очень близки — находятся внутри доверительных интервалов друг друга. В некоторых сферах (следование инструкциям, сложные промпты, математика и т. д.) 4.6 по точечной оценке даже опережает 4.7.

Что заметно изменилось, так это стоимость использования модели. Хотя цена за млн токенов осталась $5/$25:

1. Обновился токенайзер. Теперь текст, переданный модели или сгенерированный ею, будет занимать примерно на треть больше токенов, а значит, и тратить на треть больше бюджета.
• Это подтверждают сами Anthropic.
• Вот небольшое исследование на эту тему.
• Вот анализ анонимных запросов.
• Я запустил несколько относительно сложных промптов, требующих рассуждений и использования субагентов: 4.7 оказался на них дороже 4.6 на 45%, сгенерировав при этом идентичные по смыслу ответы.

2. Opus стал задавать больше вопросов пользователю, причем, кажется, зачастую ненужных и имеющих очевидные ответы. По этой теме попался интересный пост:
4.6 felt smart. 4.7 is honest. What looks like less intelligence is 4.7 refusing to guess.


При всем этом, если использовать 4.7 на AWS Bedrock, постоянно случаются задержки запросов — кажется, пока не успели выделить должные мощности.

В общем, кажется, что для большинства пользователей 4.7 пока что будет способом отдать больше денег Anthropic. Посмотрим, как пойдет его развитие дальше и как он поведет себя на более сложных и долгоиграющих задачах.
👍84😁1
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь».

В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы Новой Гвинеи, племена Австралии и т.д.

Во-первых, книга безумно интересная и невероятно глубокая в своем анализе — боюсь даже представить, сколько времени автору понадобилось для сбора всей фактуры. А он писал ее в 90-е, когда не то что ChatGPT, а даже интернета в его текущем виде не было.

Во-вторых, в ней упоминается тезис, который мне самому приходил на ум каждый раз, когда я слышал утверждения о неспособности языковых моделей изобрести что-либо новое:

Технологии развиваются накопительно, а не через одиночные подвиги гениев
...
Новые технологии и материалы дают возможность получать новые технологии, комбинируя уже имеющиеся элементы

-перевод ChatGPT


То есть новые изобретения — это не что-то, что возникает в вакууме, а плод рекомбинации уже существующих технологий, материалов и идей, который затем проходит через фильтр актуальности и пользы для общества.

Если принять этот взгляд, то способность к инновации — это не обязательно мистическая способность “создать из ничего”. Скорее, это способность производить новые комбинации и проверять, какие из них действительно работают.

Кажется, что ЛЛМки уже неплохо справляются с первой частью — рекомбинацией. Они умеют быстро соединять существующие идеи, подходы и паттерны, хотя часто делают это с меньшими отклонениями от уже существующих эталонов, чем человеческий автор.

А вот успешность второй части — отбора — зависит не только от самой модели, но и от среды вокруг нее: есть ли в конкретной сфере возможность быстро и достаточно объективно оценить плодотворность ее продукта.

Например, сомневаюсь, что в сфере искусств — литературы, живописи, кино — ЛЛМ без участия человека сможет в ближайшем будущем создать что-то действительно стоящее. Если ЛЛМ напишет тысячу книг, нужно, чтобы человечество их прочитало, оценило и оставило в библиотеках действительно стоящие из них.

Можно измерять продажи, дочитывания, лайки, отзывы и премии, но это все равно плохие прокси для художественной ценности. Там нет быстрой и стабильной функции потерь, которая позволила бы автоматически отбирать “лучшие” произведения без участия человеческой аудитории.

В написании кода же — кажется, наиболее успешной на текущий день для ЛЛМ-ок сфере — обратная связь намного дешевле и формальнее. Есть тесты, типы, линтеры, бенчмарки, профилирование, метрики продакшена: завелось или нет, сколько времени выполняется функция, сколько памяти потребляет и т.д.

То есть можно написать энное число версий кода и достаточно безболезненно отфильтровать из них успешные итерации. К тому же, в каждом языке программирования есть понятный набор базовых сущностей, из которых собирается любой код: классы, списки, функции и т.д.

В естественных науках тоже работают над тем, чтобы выстроить связь между выводами ЛЛМ и их эффективностью в реальном мире. Вот статья, где модели давали проектировать эксперименты, передавать их в автоматизированную физическую лабораторию, собирать результаты и автономно планировать следующие итерации.

Таким образом, как и в любой задаче машинного обучения (и, в целом, в любой жизненной задаче) — все сводится к подбору метрики, по которой оценивать результат, и функции потерь.

Ну а дальше — итерации, ошибки и победы.
👍1811🔥4
Наткнулся на прикольный инструмент от Microsoft - Тренер для AI-инженеров.

Тулза сканирует историю сессий по используемым агентам (Codex, Claude Code etc.) и рисует красивый дэшборд с анализом качества взаимодействия с ЛЛМ.

Из прикольного:

1️⃣ Анализирует частоту антипаттернов в четырех категориях - качество промптов, гигиена сессий, ревью рекомендаций модели, использование инструментов. У меня например все неплохо с промптами и инструментами, а вот внимательнее вычитывать рекомендации ЛЛМ-ки не помешало бы

2️⃣ Дает рекомендации по созданию кастомных скиллов. Сессии анализируются на предмет повторяющихся задач - дальше под них либо предлагается существующий community skill, либо генерится новый.

3️⃣ Собирает кучу красивой и интересной статистики - как распределяется время по проектам, в какие часы выполняется больше работы

4️⃣ Генерит упражнения для саморазвития - на улучшение качества .md файлов и обнаружение ИИ-слопа.

Часть функционала пока сыровата и у меня не завелась, но, учитывая то, как много не-технарей начинает нынче вайб-кодить - инструмент может в итоге оказаться супер-полезным. У нас в конторе по крайней мере постараюсь распространить.
🔥96👍5
DS с завода
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь». В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы…
Беру свои слова назад - умеют ЛЛМ-ки в искусство.

Один из проектов у меня называется Хеймдалль - агент для ревью пулл-реквестов.
Некоторое время назад заонбордили его в юбилейный сотый репозиторий. Я по этому поводу сказал Кодексу сгенерировать мне иллюстрацию для корпоративного блога, чтобы написать радостный пост.

Я ушел пить кофе, а когда вернулся - обнаружил, что забыл передать модельке ключ для генерации картинок. Но модельку это не остановило, и она накидала вот этот вот арт с помощью питона и библиотеки PIL. То есть вместо генерации картинок она генерировала квадратики и треугольники, и потом расставляла их так чтобы вышла вот такая красота.

Лично я считаю, что это - проявление феноменальной изобретательности и не ожидаю в обозримом будущем увидеть что-то более милое.
👍8🔥62😁2
Forwarded from Сиолошная
Новый опус: https://www.anthropic.com/news/claude-opus-4-8

1) цена та же
2) сделали гранулярную разбивку длины рассуждений, как у ChatGPT
3) fast режим, ускоряющий генерацию в 2.5 раза, теперь в 3 раза дешевле, чем для предыдущих моделей. Получается было в 6 раз дороже, сейчас в 2 — надо брать.
4) «Одним из наиболее заметных улучшений в Opus 4.8 является его честность» — модель будет врать поменьше (наверное)
5) «Мы планируем выпустить новый класс моделей с ещё более высоким уровнем интеллекта, чем у Opus» — ждём «в ближайшие недели»
👍83