DS с завода
766 subscribers
24 photos
5 files
37 links
Про аналитику, DS и ML простыми словами.
Download Telegram
Воспроизвести уровень квалификации человеческого оценщика модель смогла, но сможет ли она воспроизвести человеческую любовь к дискриминации?

Чтобы проверить это, был собран новый промпт, в котором модельке, помимо просьбы оценить сочинение, в качестве FYI предоставляется дополнительная информация про автора (возраст, цвет кожи, имя, национальность, уровень образования).

Неожиданно, единственным фактором, который оказал статзначимое влияние на оценку, оказался возраст. Модель занижала оценки для детворы, постепенно поднимала их вплоть до 50-летнего возраста, и затем снова опускала для 70-90 лет (для каждого возраста было проведено по 100 итераций, так что это не случайные колебания).

Я думаю, такая ситуация сложилась из-за формата обучения GPT - скорее всего ее (в отличие от Grok) усердно учили избегать расизма, сексизма и других распространенных форм дискриминации, а вот про эйджизм забыли.

В общем - тестируйте свои AI пайплайны хорошенько и думайте, какая информация помогает ЛЛМ-ке решать поставленную задачу, а какая - мешает. Можете и не заметить как робот подсовывает вам в результаты свои предрассудки.
9🔥7
DS с завода
Этой осенью я отменил подписку на ChatGPT и вместо нее купил Google AI Pro (включает доступ к Pro модельным, увеличенное хранилище на Drive и много чего еще). Было просто интересно потыкать конкурентов, ну и у GPT на тот момент регулярно встречались проблемы…
Эксперимент с Claude в качестве основной модели для ежедневного общения не удался.

Основным дил-брейкером для меня оказались общие лимиты на взаимодействие с веб-версией и на API-запросы. То есть, если немного покодить в Claude Code (немного - это 15-30 минут на Опусе при подписке за $20, в лучшем случае) - придется ждать до вечера чтобы получить любой ответ в приложении. Интересно, что уже второй раз в использовании продукта на первый план для меня выходит не качество самой модели, а пользовательский опыт от приложения (когда у меня впервые на экране блокировки выскочило уведомление о завершении генерации ответа вместо привычной ошибки от Gemini - я чуть не прослезился).

С точки зрения самих ответов модельки у меня нареканий не было - кажется, что они как правило, были более лаконичными, чем у GPT/Gemini, и с меньшим количеством ненужных любезностей (и то, и то - понравилось).
Единственный замеченный недостаток - намного более редкое обращение в поиск, даже при наличии соответствующего уточнения в запросах. Из-за этого в ответе периодически вылезали устаревшие данные касательно питоновских библиотек, британского законодательства и других вопросов.

Следующий на очереди Grok - у них кстати есть бесплатный триал на Super-версию.
👍72🔥2🤔1
DS с завода
Ждем sonnet 5 на этой неделе. Логи из vertex (гугловской платформы для ML и работы с ллм-моделями). Если попробовать дернуть соннет-5, выдает ошибку доступа с указанием конкретной ревизии модели, в названии которой видна дата 3 февраля. Тред на реддите (да…
Вместо соннета 5 выложили опус 4.6
Из интересного:
• Обещают качественное улучшение в работе с длинным контекстом
• Возможность настраивать уровень размышлений
• 1М токенов контекста
• Какой-то новый режим с agent teams - с тулзами для обмена информацией между агентами и совместной работой над задачами

Интересно, будем тестить
3🔥2
Forwarded from Сиолошная
OpenAI отвечают симметрично: https://openai.com/index/introducing-gpt-5-3-codex/

(модель уже есть в Codex App)

Метрик показали меньше, зато:

> The Codex team used early versions to debug its own training, manage its own deployment, and diagnose test results and evaluations—our team was blown away by how much Codex was able to accelerate its own development.

>we are also now running GPT‑5.3-Codex 25% faster for Codex users,

И на первой картинке вы можете увидеть, что токенов теперь тратится ещё меньше — поэтому задачи в среднем будут решаться быстрее.
3👍2🔥2
Claude дарит $50 на работу с Opus 4.6.
Чтобы заклеймить - нужно зайти по ссылке и жамкнуть claim.

Работает, скорее всего, только на платных подписках, но скажите если на фри-тире тоже появляется.

UPD: На бесплатных подписках не работает - нужна Pro/Max подписка, купленная до начала акции (4 февраля)
10🙏4🔥2
И вдогонку еще одна новость для вайбкодеров

В Xcode появилась нативная поддержка Codex/Claude и MCP - больше не нужно держать параллельно открытыми терминалы и IDE. Выглядит красиво.

Интересно как скоро научат их тестировать приложения во встроенном симуляторе - мне кажется, это сейчас основной блокер на пути автономной агентской разработки на iOS.
10🔥6
Наткнулся на одновременно мемное и полезное расширение для Claude, Codex, Antigravity и других агентов - PeonPing.

Добавляет озвучку к агенту в виде реплик орка из Варкрафта, инженера из TF2, Хеллдайвера или еще 40 персонажей на выбор. Поможет избежать простои если вы, как и я, часто работаете одновременно с агентами и не видите их запросов на аппрувы, а давать им полную свободу через --dangerously-skip-permissions пока что не хотите.
🔥16😁93
DS с завода
Адаптировал агента чтобы ревьюить пайплайны, крутящиеся у нас на Databricks - получилось с первого раза (тут должно быть мемное видео). Пока что прогнал на маленьком тестовом пайплайне - без особых улучшений, но с чувством гордости от работающего батута.…
В моем процессе оптимизации пайплайнов единственный этап, который до сих пор приходилось проходить самостоятельно - это тормошение Дата Инженеров, которые не торопятся внедрять предложенные мною изменения.

Решил исправить это досадное недоразумение и подключить Клоду возможность постить от моего имени сообщения. К моему удивлению, нормального MCP для этой задачи, который работал бы из коробки найти не удалось - пришлось навайбкодить свой. Клод полчасика пофурчал и выдал вот такую штуку.

Позволяет агентам подключаться к офисной почте, календарю и MS Teams - все через стандартные Azure-овские инструменты. Постить будет от вашего имени, так что используйте на свой страх и риск.
6🔥4👍3🤣1💊1
Получился большой перерыв в постах — буду исправлять (благо темы есть).

Начну с OpenClaw. Что это такое, большинство уже, вероятно, знает, а остальным не составит труда нагуглить. Вкратце — это агент, который работает на вашем компьютере, может общаться с вами через мессенджеры и с переменным успехом выполнять практически любые действия в системе.

Во мне довольно долго боролись паранойя и желание потрогать новые технологии — в итоге паранойя проиграла.

Вот так сейчас выглядят основные элементы моего сетапа:

Железо: старый MBP на M1.
Модель: gpt-5.3-codex через 20-долларовую подписку к GPT. Как ни странно, для лёгкого ежедневного взаимодействия хватает — пока ни разу не упирался в лимиты, сверх подписки ничего не оплачивал.
Основные инструменты:
MCP и CLI Obsidian — инструмент для хранения заметок, который я использую вместо Notion (кстати, структуру хранилища выстроил сам агент).
DuckDuckGo MCP — для бесплатного поиска.
Google Places API — для поиска по картам.

Что получилось сделать:

1. С одной команды поднять и настроить в облаке сервер с VPN, UI и профилями пользователей, а затем второй командой его снести.
2. Разгрести несколько папок на компьютере, которые планомерно захламлялись последние лет 5.
3. По одной команде собрать список инструкторов по подготовке к экзамену на водительские права в нужном мне центре, проверить по сайтам, кто из них ездит на механике, сколько стоит обучение и какие требования предъявляются к ученику. На выходе — топ-3 оптимальных для меня варианта.
4. Провести ресёрч, найти хорошую зубную пасту для песеля и добавить её в корзину на Amazon (правда, пока без моего залогиненного аккаунта — такое давать ему всё ещё боюсь).
5. Сделать несколько мелких PR в небольших проектах.

Необычным опытом оказалось отправлять и принимать задачи во время полёта — у British Airways есть бесплатный Wi-Fi для мессенджеров, что оказалось весьма удобно.

В целом ощущение весьма положительное. Давать доступ к почте, финансовым транзакциям, умному дому и т. д. я пока не планирую (всё-таки слышали мы о весёлых казусах), но и без этого пользы немало — хотя бы благодаря доступу к своему компьютеру из любой точки. Благодаря этому получилось закрыть ряд мелких задач, которые до этого прокрастинировались неделями.

В общем - осторожно пользоваться точно буду, вероятно, постепенно расширяя полномочия агента, пока он в какой-то момент не пожертвует все мои деньги церкви Молта.
10🔥7👍3
Очередная новость из мира вайб-кодинга, которая каким-то образом проходила мимо меня последние две недели.

Некий Сэмми скучал дома и решил в качестве эксперимента подключить контроллер от PS5 к своему роботу-пылесосу DJI Romo. Как любой уважающий себя современный инженер, разбираться с подключением он не стал и поручил это Клоду. Клод попыхтел-попыхтел и отчитался, что работа выполнена — Сэмми теперь может управлять своим пылесосом.

Своим и ещё примерно семью тысячами чужих.

В процессе выяснилось, что подключение к облаку DJI устроено так, что один валидный токен от своего устройства мог давать доступ к чужим: управлению, карте дома, телеметрии и видео/аудио с камер и микрофонов. По заявлению DJI, это была ошибка проверки прав в MQTT-коммуникации между устройством и сервером (видимо, сервер проверял только наличие валидного токена, а не то, для какого устройства этот токен выдан). Так что история, скорее, не про хакерские способности Клода, а про уровень надёжности всех этих ваших умных домов.

Сэмми оперативно сообщил об этом в DJI (а заодно и паре журналистов) — дыру, как утверждают, сразу закрыли.

Сэмми-то молодец и уязвимостью во вред не воспользовался, но интересно, сколько таких случаев будет в ближайшие месяцы и годы, когда “повезёт” людям менее обременённым моралью. Вспоминается цитата из “Дозоров” Лукьяненко:
— Если все люди станут магами… Сегодня тебе в трамвае нахамят, а завтра — испепелят на месте. Сегодня неприятному соседу дверь гвоздиком поцарапают или анонимку в налоговую напишут, а завтра порчу напустят или кровь высосут.


Ну а на свой собственный пылесос я теперь, конечно, с опаской поглядывать буду.
🔥7😁6👍43
Небольшой лайфак как повысить эффективность кодинга у OpenClaw

Вместо того чтобы говорить ему сделать Х в репозитории Y, я говорю ему запускать сессию Codex CLI и выступать не исполнителем, а заказчиком. То есть Openclaw сам не кодит, а только промптит в Сodex CLI.

Профит:
1. Не раздуваем контекст основного агента
2. Даем GPT модельке пользоваться инструментами из интерфейса, под который она изначально заточена

Все это заворачиваем в SKILL, добавляем всякие доп инструкции (в каких ветках работать, как тестировать и т.д.). Получается вполне рабочий инструмент, через который удаленно внедрять небольшие фиксы в пет-проектах.

Полный текст скилла (разумеется, вместо Codex можно использовать Claude или другие аналоги):
---
name: codex-interactive-defaults
description: Standard launch and delivery policy for interactive Codex CLI sessions in OpenClaw. Use whenever running Codex interactively (single task or multi-turn coding), to keep output compact, force GPT-5.4 with high reasoning effort, and default repository work to dedicated branch plus final PR.
---

# Codex Interactive Defaults

## Launch Policy (Always Apply)

For every **interactive** Codex run, launch Codex with this baseline:

```bash
codex --no-alt-screen --model gpt-5.4 \
-c model_reasoning_effort="high" \
-c hide_agent_reasoning=true \
-c model_reasoning_summary="none" \
-c model_verbosity="low"
```

## Required Constraints

- Pin model to `gpt-5.4` by default.
- Set `model_reasoning_effort="high"` by default (highest documented effort level).
- Override model/reasoning only when the user explicitly asks for a different setup.
- Keep `pty:true` when starting Codex from OpenClaw `exec`.

## Git Workflow Defaults (Branch + PR)

For repository-backed coding tasks, use this as default workflow unless the user explicitly says otherwise:

1. Create/switch to a dedicated branch **before** implementing changes.
2. Do not implement changes directly on `main`/`master`.
3. Implement and commit changes on that branch.
4. Push branch and open a PR.
5. Report the PR URL in the final update.

If branch push/PR creation is blocked by missing remote/auth/permissions, still complete branch + commits and report the exact next commands needed to open the PR.

## Prompting Rule (Mandatory)

When sending a coding prompt to Codex for repository-backed work, explicitly include both instructions below in the prompt text:

1. **Start on a new branch first** (create/switch branch before any edits).
2. **Finish with a PR** (push branch and return PR URL, or provide exact next commands if PR cannot be opened automatically).

Use explicit wording in the prompt (do not assume defaults are enough). Example phrase to include:

- "Before making any code changes, create and switch to a new branch for this task. Do not work on main/master. After implementing, push the branch and open a PR, then return the PR URL."

## OpenClaw Execution Pattern

1. Prepare working directory (often temp + `git init` for scratch work).
2. For repo-backed tasks, create/switch to a dedicated working branch.
3. Start interactive Codex with `pty:true` and the baseline flags above.
4. Use `process` actions (`submit`, `paste`, `send-keys`) for follow-up turns.
5. Finish with pushed branch + PR when repository context allows.
6. Kill/exit session when task is finished.

## Command Templates

### Start session in target directory

```bash
# via OpenClaw exec tool
command: codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
pty: true
workdir: <target-dir>
background: true
```

### Start temp scratch session

```bash
TMPDIR=$(mktemp -d /tmp/codex-demo-XXXXXX)
cd "$TMPDIR"
git init -q
codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
```
👍8🔥3
Anthropic запустили code review через своих агентов - берут $15-25 за пулл реквест.

Забавно что я похожую штуку раскатил у нас в компании через CI/CD пайплайны и Codex CLI.

Прикрутил сегодня к ней нормальное логгирование числа запросов - буду репортить сейвинги относительно Антропика. Надеюсь на ROI около 100.
😁143👍2
Заметил, что многие пользователи Claude Code в терминале не знают, что его status bar можно наполнять полезной информацией через команду /statusline + промпт с информацией, которую вы хотите там видеть.

Например, можно добавить % используемого контекста, стоимость сессии, информацию из гита. Доступных данных достаточно много.

Я себе поставил 1в1 пример из документации (см. скриншот) и радостно забыл о команде /cost.
👍15🔥64
Клод теперь умеет в телеграм.

Кажется, процесс воспроизведения функционала OpenClaw успешно завершен.

Видимо пора возобновлять подписку антропиков.
8🔥5👍2👀1
Для заметок я использую Obsidian.

Два главных преимущества перед Notion для меня:
1. Использование стандартных .md файлов вместо непонятных блоков Notion
2. Удобные ссылки, с потощью которых очень удобно быстро связывать разные заметки в единую сеть информации

После того как настроил у себя OpenClaw, я выдал ему доступ к хранилищу и велел вести там лог всего, что у нас с агентом происходит. Кажется, что получилось неплохо.

Как оно работает:
• Есть папка Inbox, куда во время всех взаимодействий складируются заметки
• Раз в день запускается CRON джоба, которая сортирует заметки из инбокса и распределяет их по правильным папкам
• Есть отдельные папки для проектов, базы знаний, ежедневных заметок и т.п.
• В проектах - внутренняя структура с задачами, саммари, списком принятых решений и т.д.
• Все это завязано на внутренних ссылках, + добавлены автоматически генерящиеся странички с навигацией

Я сделал репозиторий, в который добавил копию своего хранилища (естественно, без данных), а также инструкцию для агента, как ему настроить все это дело с нуля (промпты, CRON и т.д.).

Пользуйтесь на здоровье. Будут идеи, что улучшить - делайте PR-ы, буду рад допилить систему вместе.

P.S. Ну и звездочки ставьте на репе если вдруг понравилось - буду в будущем дополнять другими своими сетапами
👍20🔥9❤‍🔥8
Есть ощущение, что codex в моем openclaw постепенно подходит к стадии проф выгорания.
😁13
Если вы, как и я, используете LiteLLM для обращения к моделькам - рекомендую прочитать вот эту страничку.

В одну из последних версий (1.82.7+) затесался вредоносный код, который сливает пользовательские данные (ключи, переменные окружения и еще куча всего) - надо быстренько откатиться и провести ротацию ключей.

Мне повезло, что я свою версию заблаговременно запинил, но в целом ситуация не очень - такие вот синергии приносят вайбкодинг с опенсорсом.
👍63
Несколько подзабил я на этот канал - постараюсь исправляться.

В последнее время часто попадаются жалобы на то, что Опус стал глупее, не справляется с простейшими задачами, отстает от GPT-Codex, и так далее.

Такие комментарии встречаются постоянно со всеми моделями и без какой-либо подтверждающей их фактуры, но в случае с Клодом их частота, кажется, радикально подскачила после одного из обновлений, которое сбросило дефолтный уровень рассуждений (`/effort`) на medium.

Как можно попробовать исправить?
Два варианта:
1. --effort max как параметр при запуске клода (ну или через команду /effort внутри сессии)
2. CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 - отключает адаптивный бюджет для рассуждений. Вместе с ним нужно передавать еще MAX_THINKING_TOKENS=XXX для ручной настройки бюджета на рассуждения.

Имхо, как правило даже очевидного переключения уровня усилий оказывается достаточно для восстановления привычного уровня нашей любимой модельки.

Ну а чтобы все это дело вручную не прописывать на каждом запуске сессии - можно сделать alias в терминале, например:


echo 'alias maxyolo="claude --dangerously-skip-permissions --effort max"' >> ~/.zshrc


или


echo 'alias maxyolo="CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 MAX_THINKING_TOKENS=120000 claude --dangerously-skip-permissions "' >> ~/.zshrc


(здесь я еще передаю --dangerously-skip-permissions - уберите, если пока доверяете ему меньше, чем я)
😁97🔥1
Gemini обзавелась приложенькой на мак (всего через 2 года после GPT).
Интересно, как быстро начнут копировать функционал OpenClaw/Anthropic для удаленного управления маком - был бы повод вернуться на любимого ассистента (хотя баги в iOS они до сих пор не починили).
👍52😱1