DS с завода
766 subscribers
24 photos
5 files
37 links
Про аналитику, DS и ML простыми словами.
Download Telegram
Forwarded from Сиолошная
OpenAI отвечают симметрично: https://openai.com/index/introducing-gpt-5-3-codex/

(модель уже есть в Codex App)

Метрик показали меньше, зато:

> The Codex team used early versions to debug its own training, manage its own deployment, and diagnose test results and evaluations—our team was blown away by how much Codex was able to accelerate its own development.

>we are also now running GPT‑5.3-Codex 25% faster for Codex users,

И на первой картинке вы можете увидеть, что токенов теперь тратится ещё меньше — поэтому задачи в среднем будут решаться быстрее.
3👍2🔥2
Claude дарит $50 на работу с Opus 4.6.
Чтобы заклеймить - нужно зайти по ссылке и жамкнуть claim.

Работает, скорее всего, только на платных подписках, но скажите если на фри-тире тоже появляется.

UPD: На бесплатных подписках не работает - нужна Pro/Max подписка, купленная до начала акции (4 февраля)
10🙏4🔥2
И вдогонку еще одна новость для вайбкодеров

В Xcode появилась нативная поддержка Codex/Claude и MCP - больше не нужно держать параллельно открытыми терминалы и IDE. Выглядит красиво.

Интересно как скоро научат их тестировать приложения во встроенном симуляторе - мне кажется, это сейчас основной блокер на пути автономной агентской разработки на iOS.
10🔥6
Наткнулся на одновременно мемное и полезное расширение для Claude, Codex, Antigravity и других агентов - PeonPing.

Добавляет озвучку к агенту в виде реплик орка из Варкрафта, инженера из TF2, Хеллдайвера или еще 40 персонажей на выбор. Поможет избежать простои если вы, как и я, часто работаете одновременно с агентами и не видите их запросов на аппрувы, а давать им полную свободу через --dangerously-skip-permissions пока что не хотите.
🔥16😁93
DS с завода
Адаптировал агента чтобы ревьюить пайплайны, крутящиеся у нас на Databricks - получилось с первого раза (тут должно быть мемное видео). Пока что прогнал на маленьком тестовом пайплайне - без особых улучшений, но с чувством гордости от работающего батута.…
В моем процессе оптимизации пайплайнов единственный этап, который до сих пор приходилось проходить самостоятельно - это тормошение Дата Инженеров, которые не торопятся внедрять предложенные мною изменения.

Решил исправить это досадное недоразумение и подключить Клоду возможность постить от моего имени сообщения. К моему удивлению, нормального MCP для этой задачи, который работал бы из коробки найти не удалось - пришлось навайбкодить свой. Клод полчасика пофурчал и выдал вот такую штуку.

Позволяет агентам подключаться к офисной почте, календарю и MS Teams - все через стандартные Azure-овские инструменты. Постить будет от вашего имени, так что используйте на свой страх и риск.
6🔥4👍3🤣1💊1
Получился большой перерыв в постах — буду исправлять (благо темы есть).

Начну с OpenClaw. Что это такое, большинство уже, вероятно, знает, а остальным не составит труда нагуглить. Вкратце — это агент, который работает на вашем компьютере, может общаться с вами через мессенджеры и с переменным успехом выполнять практически любые действия в системе.

Во мне довольно долго боролись паранойя и желание потрогать новые технологии — в итоге паранойя проиграла.

Вот так сейчас выглядят основные элементы моего сетапа:

Железо: старый MBP на M1.
Модель: gpt-5.3-codex через 20-долларовую подписку к GPT. Как ни странно, для лёгкого ежедневного взаимодействия хватает — пока ни разу не упирался в лимиты, сверх подписки ничего не оплачивал.
Основные инструменты:
MCP и CLI Obsidian — инструмент для хранения заметок, который я использую вместо Notion (кстати, структуру хранилища выстроил сам агент).
DuckDuckGo MCP — для бесплатного поиска.
Google Places API — для поиска по картам.

Что получилось сделать:

1. С одной команды поднять и настроить в облаке сервер с VPN, UI и профилями пользователей, а затем второй командой его снести.
2. Разгрести несколько папок на компьютере, которые планомерно захламлялись последние лет 5.
3. По одной команде собрать список инструкторов по подготовке к экзамену на водительские права в нужном мне центре, проверить по сайтам, кто из них ездит на механике, сколько стоит обучение и какие требования предъявляются к ученику. На выходе — топ-3 оптимальных для меня варианта.
4. Провести ресёрч, найти хорошую зубную пасту для песеля и добавить её в корзину на Amazon (правда, пока без моего залогиненного аккаунта — такое давать ему всё ещё боюсь).
5. Сделать несколько мелких PR в небольших проектах.

Необычным опытом оказалось отправлять и принимать задачи во время полёта — у British Airways есть бесплатный Wi-Fi для мессенджеров, что оказалось весьма удобно.

В целом ощущение весьма положительное. Давать доступ к почте, финансовым транзакциям, умному дому и т. д. я пока не планирую (всё-таки слышали мы о весёлых казусах), но и без этого пользы немало — хотя бы благодаря доступу к своему компьютеру из любой точки. Благодаря этому получилось закрыть ряд мелких задач, которые до этого прокрастинировались неделями.

В общем - осторожно пользоваться точно буду, вероятно, постепенно расширяя полномочия агента, пока он в какой-то момент не пожертвует все мои деньги церкви Молта.
10🔥7👍3
Очередная новость из мира вайб-кодинга, которая каким-то образом проходила мимо меня последние две недели.

Некий Сэмми скучал дома и решил в качестве эксперимента подключить контроллер от PS5 к своему роботу-пылесосу DJI Romo. Как любой уважающий себя современный инженер, разбираться с подключением он не стал и поручил это Клоду. Клод попыхтел-попыхтел и отчитался, что работа выполнена — Сэмми теперь может управлять своим пылесосом.

Своим и ещё примерно семью тысячами чужих.

В процессе выяснилось, что подключение к облаку DJI устроено так, что один валидный токен от своего устройства мог давать доступ к чужим: управлению, карте дома, телеметрии и видео/аудио с камер и микрофонов. По заявлению DJI, это была ошибка проверки прав в MQTT-коммуникации между устройством и сервером (видимо, сервер проверял только наличие валидного токена, а не то, для какого устройства этот токен выдан). Так что история, скорее, не про хакерские способности Клода, а про уровень надёжности всех этих ваших умных домов.

Сэмми оперативно сообщил об этом в DJI (а заодно и паре журналистов) — дыру, как утверждают, сразу закрыли.

Сэмми-то молодец и уязвимостью во вред не воспользовался, но интересно, сколько таких случаев будет в ближайшие месяцы и годы, когда “повезёт” людям менее обременённым моралью. Вспоминается цитата из “Дозоров” Лукьяненко:
— Если все люди станут магами… Сегодня тебе в трамвае нахамят, а завтра — испепелят на месте. Сегодня неприятному соседу дверь гвоздиком поцарапают или анонимку в налоговую напишут, а завтра порчу напустят или кровь высосут.


Ну а на свой собственный пылесос я теперь, конечно, с опаской поглядывать буду.
🔥7😁6👍43
Небольшой лайфак как повысить эффективность кодинга у OpenClaw

Вместо того чтобы говорить ему сделать Х в репозитории Y, я говорю ему запускать сессию Codex CLI и выступать не исполнителем, а заказчиком. То есть Openclaw сам не кодит, а только промптит в Сodex CLI.

Профит:
1. Не раздуваем контекст основного агента
2. Даем GPT модельке пользоваться инструментами из интерфейса, под который она изначально заточена

Все это заворачиваем в SKILL, добавляем всякие доп инструкции (в каких ветках работать, как тестировать и т.д.). Получается вполне рабочий инструмент, через который удаленно внедрять небольшие фиксы в пет-проектах.

Полный текст скилла (разумеется, вместо Codex можно использовать Claude или другие аналоги):
---
name: codex-interactive-defaults
description: Standard launch and delivery policy for interactive Codex CLI sessions in OpenClaw. Use whenever running Codex interactively (single task or multi-turn coding), to keep output compact, force GPT-5.4 with high reasoning effort, and default repository work to dedicated branch plus final PR.
---

# Codex Interactive Defaults

## Launch Policy (Always Apply)

For every **interactive** Codex run, launch Codex with this baseline:

```bash
codex --no-alt-screen --model gpt-5.4 \
-c model_reasoning_effort="high" \
-c hide_agent_reasoning=true \
-c model_reasoning_summary="none" \
-c model_verbosity="low"
```

## Required Constraints

- Pin model to `gpt-5.4` by default.
- Set `model_reasoning_effort="high"` by default (highest documented effort level).
- Override model/reasoning only when the user explicitly asks for a different setup.
- Keep `pty:true` when starting Codex from OpenClaw `exec`.

## Git Workflow Defaults (Branch + PR)

For repository-backed coding tasks, use this as default workflow unless the user explicitly says otherwise:

1. Create/switch to a dedicated branch **before** implementing changes.
2. Do not implement changes directly on `main`/`master`.
3. Implement and commit changes on that branch.
4. Push branch and open a PR.
5. Report the PR URL in the final update.

If branch push/PR creation is blocked by missing remote/auth/permissions, still complete branch + commits and report the exact next commands needed to open the PR.

## Prompting Rule (Mandatory)

When sending a coding prompt to Codex for repository-backed work, explicitly include both instructions below in the prompt text:

1. **Start on a new branch first** (create/switch branch before any edits).
2. **Finish with a PR** (push branch and return PR URL, or provide exact next commands if PR cannot be opened automatically).

Use explicit wording in the prompt (do not assume defaults are enough). Example phrase to include:

- "Before making any code changes, create and switch to a new branch for this task. Do not work on main/master. After implementing, push the branch and open a PR, then return the PR URL."

## OpenClaw Execution Pattern

1. Prepare working directory (often temp + `git init` for scratch work).
2. For repo-backed tasks, create/switch to a dedicated working branch.
3. Start interactive Codex with `pty:true` and the baseline flags above.
4. Use `process` actions (`submit`, `paste`, `send-keys`) for follow-up turns.
5. Finish with pushed branch + PR when repository context allows.
6. Kill/exit session when task is finished.

## Command Templates

### Start session in target directory

```bash
# via OpenClaw exec tool
command: codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
pty: true
workdir: <target-dir>
background: true
```

### Start temp scratch session

```bash
TMPDIR=$(mktemp -d /tmp/codex-demo-XXXXXX)
cd "$TMPDIR"
git init -q
codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
```
👍8🔥3
Anthropic запустили code review через своих агентов - берут $15-25 за пулл реквест.

Забавно что я похожую штуку раскатил у нас в компании через CI/CD пайплайны и Codex CLI.

Прикрутил сегодня к ней нормальное логгирование числа запросов - буду репортить сейвинги относительно Антропика. Надеюсь на ROI около 100.
😁143👍2
Заметил, что многие пользователи Claude Code в терминале не знают, что его status bar можно наполнять полезной информацией через команду /statusline + промпт с информацией, которую вы хотите там видеть.

Например, можно добавить % используемого контекста, стоимость сессии, информацию из гита. Доступных данных достаточно много.

Я себе поставил 1в1 пример из документации (см. скриншот) и радостно забыл о команде /cost.
👍15🔥64
Клод теперь умеет в телеграм.

Кажется, процесс воспроизведения функционала OpenClaw успешно завершен.

Видимо пора возобновлять подписку антропиков.
8🔥5👍2👀1
Для заметок я использую Obsidian.

Два главных преимущества перед Notion для меня:
1. Использование стандартных .md файлов вместо непонятных блоков Notion
2. Удобные ссылки, с потощью которых очень удобно быстро связывать разные заметки в единую сеть информации

После того как настроил у себя OpenClaw, я выдал ему доступ к хранилищу и велел вести там лог всего, что у нас с агентом происходит. Кажется, что получилось неплохо.

Как оно работает:
• Есть папка Inbox, куда во время всех взаимодействий складируются заметки
• Раз в день запускается CRON джоба, которая сортирует заметки из инбокса и распределяет их по правильным папкам
• Есть отдельные папки для проектов, базы знаний, ежедневных заметок и т.п.
• В проектах - внутренняя структура с задачами, саммари, списком принятых решений и т.д.
• Все это завязано на внутренних ссылках, + добавлены автоматически генерящиеся странички с навигацией

Я сделал репозиторий, в который добавил копию своего хранилища (естественно, без данных), а также инструкцию для агента, как ему настроить все это дело с нуля (промпты, CRON и т.д.).

Пользуйтесь на здоровье. Будут идеи, что улучшить - делайте PR-ы, буду рад допилить систему вместе.

P.S. Ну и звездочки ставьте на репе если вдруг понравилось - буду в будущем дополнять другими своими сетапами
👍20🔥9❤‍🔥8
Есть ощущение, что codex в моем openclaw постепенно подходит к стадии проф выгорания.
😁13
Если вы, как и я, используете LiteLLM для обращения к моделькам - рекомендую прочитать вот эту страничку.

В одну из последних версий (1.82.7+) затесался вредоносный код, который сливает пользовательские данные (ключи, переменные окружения и еще куча всего) - надо быстренько откатиться и провести ротацию ключей.

Мне повезло, что я свою версию заблаговременно запинил, но в целом ситуация не очень - такие вот синергии приносят вайбкодинг с опенсорсом.
👍63
Несколько подзабил я на этот канал - постараюсь исправляться.

В последнее время часто попадаются жалобы на то, что Опус стал глупее, не справляется с простейшими задачами, отстает от GPT-Codex, и так далее.

Такие комментарии встречаются постоянно со всеми моделями и без какой-либо подтверждающей их фактуры, но в случае с Клодом их частота, кажется, радикально подскачила после одного из обновлений, которое сбросило дефолтный уровень рассуждений (`/effort`) на medium.

Как можно попробовать исправить?
Два варианта:
1. --effort max как параметр при запуске клода (ну или через команду /effort внутри сессии)
2. CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 - отключает адаптивный бюджет для рассуждений. Вместе с ним нужно передавать еще MAX_THINKING_TOKENS=XXX для ручной настройки бюджета на рассуждения.

Имхо, как правило даже очевидного переключения уровня усилий оказывается достаточно для восстановления привычного уровня нашей любимой модельки.

Ну а чтобы все это дело вручную не прописывать на каждом запуске сессии - можно сделать alias в терминале, например:


echo 'alias maxyolo="claude --dangerously-skip-permissions --effort max"' >> ~/.zshrc


или


echo 'alias maxyolo="CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 MAX_THINKING_TOKENS=120000 claude --dangerously-skip-permissions "' >> ~/.zshrc


(здесь я еще передаю --dangerously-skip-permissions - уберите, если пока доверяете ему меньше, чем я)
😁97🔥1
Gemini обзавелась приложенькой на мак (всего через 2 года после GPT).
Интересно, как быстро начнут копировать функционал OpenClaw/Anthropic для удаленного управления маком - был бы повод вернуться на любимого ассистента (хотя баги в iOS они до сих пор не починили).
👍52😱1
Последние дни я тестировал Opus 4.7, но пока что откатился обратно на 4.6.

В плане качества написания кода вау-эффекта у меня не случилось. Это не обязательно значит, что 4.7 не улучшился, — скорее, для моих задач просто хватает 4.6. При этом на arena.ai 4.6 и 4.7 по рейтингам очень близки — находятся внутри доверительных интервалов друг друга. В некоторых сферах (следование инструкциям, сложные промпты, математика и т. д.) 4.6 по точечной оценке даже опережает 4.7.

Что заметно изменилось, так это стоимость использования модели. Хотя цена за млн токенов осталась $5/$25:

1. Обновился токенайзер. Теперь текст, переданный модели или сгенерированный ею, будет занимать примерно на треть больше токенов, а значит, и тратить на треть больше бюджета.
• Это подтверждают сами Anthropic.
• Вот небольшое исследование на эту тему.
• Вот анализ анонимных запросов.
• Я запустил несколько относительно сложных промптов, требующих рассуждений и использования субагентов: 4.7 оказался на них дороже 4.6 на 45%, сгенерировав при этом идентичные по смыслу ответы.

2. Opus стал задавать больше вопросов пользователю, причем, кажется, зачастую ненужных и имеющих очевидные ответы. По этой теме попался интересный пост:
4.6 felt smart. 4.7 is honest. What looks like less intelligence is 4.7 refusing to guess.


При всем этом, если использовать 4.7 на AWS Bedrock, постоянно случаются задержки запросов — кажется, пока не успели выделить должные мощности.

В общем, кажется, что для большинства пользователей 4.7 пока что будет способом отдать больше денег Anthropic. Посмотрим, как пойдет его развитие дальше и как он поведет себя на более сложных и долгоиграющих задачах.
👍84😁1
За сборкой очередного набора лего наконец дослушал книгу Даймонда «Ружья, микробы и сталь».

В книге Даймонд анализирует, почему одни общества — в первую очередь европейские — смогли занять настолько более доминирующее положение в мире, чем другие: народы Новой Гвинеи, племена Австралии и т.д.

Во-первых, книга безумно интересная и невероятно глубокая в своем анализе — боюсь даже представить, сколько времени автору понадобилось для сбора всей фактуры. А он писал ее в 90-е, когда не то что ChatGPT, а даже интернета в его текущем виде не было.

Во-вторых, в ней упоминается тезис, который мне самому приходил на ум каждый раз, когда я слышал утверждения о неспособности языковых моделей изобрести что-либо новое:

Технологии развиваются накопительно, а не через одиночные подвиги гениев
...
Новые технологии и материалы дают возможность получать новые технологии, комбинируя уже имеющиеся элементы

-перевод ChatGPT


То есть новые изобретения — это не что-то, что возникает в вакууме, а плод рекомбинации уже существующих технологий, материалов и идей, который затем проходит через фильтр актуальности и пользы для общества.

Если принять этот взгляд, то способность к инновации — это не обязательно мистическая способность “создать из ничего”. Скорее, это способность производить новые комбинации и проверять, какие из них действительно работают.

Кажется, что ЛЛМки уже неплохо справляются с первой частью — рекомбинацией. Они умеют быстро соединять существующие идеи, подходы и паттерны, хотя часто делают это с меньшими отклонениями от уже существующих эталонов, чем человеческий автор.

А вот успешность второй части — отбора — зависит не только от самой модели, но и от среды вокруг нее: есть ли в конкретной сфере возможность быстро и достаточно объективно оценить плодотворность ее продукта.

Например, сомневаюсь, что в сфере искусств — литературы, живописи, кино — ЛЛМ без участия человека сможет в ближайшем будущем создать что-то действительно стоящее. Если ЛЛМ напишет тысячу книг, нужно, чтобы человечество их прочитало, оценило и оставило в библиотеках действительно стоящие из них.

Можно измерять продажи, дочитывания, лайки, отзывы и премии, но это все равно плохие прокси для художественной ценности. Там нет быстрой и стабильной функции потерь, которая позволила бы автоматически отбирать “лучшие” произведения без участия человеческой аудитории.

В написании кода же — кажется, наиболее успешной на текущий день для ЛЛМ-ок сфере — обратная связь намного дешевле и формальнее. Есть тесты, типы, линтеры, бенчмарки, профилирование, метрики продакшена: завелось или нет, сколько времени выполняется функция, сколько памяти потребляет и т.д.

То есть можно написать энное число версий кода и достаточно безболезненно отфильтровать из них успешные итерации. К тому же, в каждом языке программирования есть понятный набор базовых сущностей, из которых собирается любой код: классы, списки, функции и т.д.

В естественных науках тоже работают над тем, чтобы выстроить связь между выводами ЛЛМ и их эффективностью в реальном мире. Вот статья, где модели давали проектировать эксперименты, передавать их в автоматизированную физическую лабораторию, собирать результаты и автономно планировать следующие итерации.

Таким образом, как и в любой задаче машинного обучения (и, в целом, в любой жизненной задаче) — все сводится к подбору метрики, по которой оценивать результат, и функции потерь.

Ну а дальше — итерации, ошибки и победы.
👍1811🔥4