DS с завода
766 subscribers
24 photos
5 files
37 links
Про аналитику, DS и ML простыми словами.
Download Telegram
Google постепенно начинают раскатывать Gemini in Chrome. Ожидаемо, внедряют основные фичи из Atlas:

1️⃣ Гемини в боковой панельке

2️⃣ Подтягивание контекста из открытых вкладок ("сравни рестораны на открытых вкладках и посоветуй, в какой из них пойти вечером")

3️⃣ Агентский режим (пощелкает на открытой странице, заполнит за вас формы и т.д.)

Видно, что прямо на главной странице фичи форсят юзкейсы с покупкой (сравнение товаров, автоматизация чекаута, поиск товаров-комплементов). Скоро вступим в эру ассистентской рекламы (интересно, как быстро выкатят LLM-Adblocker, очищающий ответы ЛЛМки от проплаченных рекомендаций).

Обещают постепенно выкатить для англоязычных пользователей с подпиской Pro и выше - надеюсь успеют до меня дойти, пока моя не закончилась.
🔥85
deepseek.mov
2.2 MB
Решил на выходных позапускать разные модельки на ollama - стало интересно, чем можно пользоваться на моем достаточно старом личном макбуке.

Зачем это нужно?
🥸 Не сливаем свои данные большим и страшным корпорациям
💰 Не тратим деньги на подписки и токены - только на домашнее электричество
📡 Можем работать с ЛЛМкой без зависимости от наличия интернета

Система:
MacBook Pro 13 inch, M1, 2020, 16GB

Методология:
Для замеров давайл одинаковый промпт примерно на 2.5тыс. токенов и замерял скорость ответа по 3 прогонам (+1 прогревочный, для подгрузки модели)

Тестировал 21 модель из списка, составленного Клодом среди моделей до 12B параметров (чем больше параметров - тем модель как правилоумнее, и тем медленнее работает, если вообще запускается). Все замеры в приложенном экселе.

Сколько-то приемлемая скорость генерации - начинается от 10 токенов в секунду (TPS). Относительно комфортно - от 20 токенов в секунду (на приложенных видео можно посмотреть разные скорости генерации, в конце каждого - высветятся метрики). Оговорюсь, что тут никак не учитывается разница между рассуждающими моделями, которые до генерации финального ответа тратят время на размышления, и моделями которые сразу выдают ответ.

Ко всему этому подвязал метрику "Artificial Intelligence Index" - сборную солянку из 10ти бенчмарков интеллекта.

Итоги:
Топовый бенчмарк интеллекта (19) и комфортные 19TPS - qwen3:4B
Средний интеллект и топовая скорость (66TPS) - llama3.2:1B-instruct

Буду экспериментировать, но по первичному беглому взаимодействию пока что не увидел причин пользоваться другими модельками из списка (по крайней мере, на моем допотопном железе).

P.S. скриншот со сводной табличкой закинул в комментарии к посту
🔥72
Ждем sonnet 5 на этой неделе. Логи из vertex (гугловской платформы для ML и работы с ллм-моделями). Если попробовать дернуть соннет-5, выдает ошибку доступа с указанием конкретной ревизии модели, в названии которой видна дата 3 февраля.

Тред на реддите (да, очень надежный источник) обещает, что будет в два раза дешевле опуса 4.5, работать лучше, быстрее и с новыми режимами для запуска субагентов. Ждем-надеемся.
🔥106👍1
Примерно год назад я выступал перед представителями нескольких французских университетов - рассказывал, как использовать ЛЛМки в работе, науке и учебе.

Для наглядности решил показать, как можно автоматизировать одну из наиболее времязатратных в их сфере задач - проверку работ студентов.

Что нужно чтобы понять, можно ли делегировать эту (или любую другую) функцию языковой модельке?
1️⃣ Конкретная, формализованная задача

2️⃣ Понимание, какой результат ожидается

3️⃣ Метрика, по которой можно оценить, насколько хуже/лучше модель справляется с задачей, чем ее устаревающий аналог (человек)

Благо в интернете нашелся официальный датасет с примерами сочинений IELTS (международный тест на знание английского языка) - сами сочинения, их оценки и методичка, по которой их нужно оценивать.

Дальше все просто - просим ЛЛМку оценить сочинение, сравниваем результат с человеческим эталоном, считаем отклонение по любой нравящейся нам метрике (например Mean Average Error).

Было проведено несколько итераций с постепенным дополнением промпта:
• “Оцени сочинение от 0 до 9”
• + “Это сочинение на IELTS”
• + “Обоснуй оценку”
• + “Вот тема, на которую было написано это сочинение”
• + “Вот тебе шкала оценки сочинений”
• + “Вот примеры сочинений и соответствующие им оценки”

С проходом по этим итерациям ошибка планомерно упала с 2 (оценка модели отклонялась на 2 балла от эталона) до 0.

В целом, здесь нет ничего удивительного или инновационного - понятно, что включение в контекст узкоспециализированных знаний имеет хорошие шансы повысить качество и предсказуемость ее работы.

А вот вторая часть эксперимента для меня оказалась более интересной
7🔥3
Воспроизвести уровень квалификации человеческого оценщика модель смогла, но сможет ли она воспроизвести человеческую любовь к дискриминации?

Чтобы проверить это, был собран новый промпт, в котором модельке, помимо просьбы оценить сочинение, в качестве FYI предоставляется дополнительная информация про автора (возраст, цвет кожи, имя, национальность, уровень образования).

Неожиданно, единственным фактором, который оказал статзначимое влияние на оценку, оказался возраст. Модель занижала оценки для детворы, постепенно поднимала их вплоть до 50-летнего возраста, и затем снова опускала для 70-90 лет (для каждого возраста было проведено по 100 итераций, так что это не случайные колебания).

Я думаю, такая ситуация сложилась из-за формата обучения GPT - скорее всего ее (в отличие от Grok) усердно учили избегать расизма, сексизма и других распространенных форм дискриминации, а вот про эйджизм забыли.

В общем - тестируйте свои AI пайплайны хорошенько и думайте, какая информация помогает ЛЛМ-ке решать поставленную задачу, а какая - мешает. Можете и не заметить как робот подсовывает вам в результаты свои предрассудки.
9🔥7
DS с завода
Этой осенью я отменил подписку на ChatGPT и вместо нее купил Google AI Pro (включает доступ к Pro модельным, увеличенное хранилище на Drive и много чего еще). Было просто интересно потыкать конкурентов, ну и у GPT на тот момент регулярно встречались проблемы…
Эксперимент с Claude в качестве основной модели для ежедневного общения не удался.

Основным дил-брейкером для меня оказались общие лимиты на взаимодействие с веб-версией и на API-запросы. То есть, если немного покодить в Claude Code (немного - это 15-30 минут на Опусе при подписке за $20, в лучшем случае) - придется ждать до вечера чтобы получить любой ответ в приложении. Интересно, что уже второй раз в использовании продукта на первый план для меня выходит не качество самой модели, а пользовательский опыт от приложения (когда у меня впервые на экране блокировки выскочило уведомление о завершении генерации ответа вместо привычной ошибки от Gemini - я чуть не прослезился).

С точки зрения самих ответов модельки у меня нареканий не было - кажется, что они как правило, были более лаконичными, чем у GPT/Gemini, и с меньшим количеством ненужных любезностей (и то, и то - понравилось).
Единственный замеченный недостаток - намного более редкое обращение в поиск, даже при наличии соответствующего уточнения в запросах. Из-за этого в ответе периодически вылезали устаревшие данные касательно питоновских библиотек, британского законодательства и других вопросов.

Следующий на очереди Grok - у них кстати есть бесплатный триал на Super-версию.
👍72🔥2🤔1
DS с завода
Ждем sonnet 5 на этой неделе. Логи из vertex (гугловской платформы для ML и работы с ллм-моделями). Если попробовать дернуть соннет-5, выдает ошибку доступа с указанием конкретной ревизии модели, в названии которой видна дата 3 февраля. Тред на реддите (да…
Вместо соннета 5 выложили опус 4.6
Из интересного:
• Обещают качественное улучшение в работе с длинным контекстом
• Возможность настраивать уровень размышлений
• 1М токенов контекста
• Какой-то новый режим с agent teams - с тулзами для обмена информацией между агентами и совместной работой над задачами

Интересно, будем тестить
3🔥2
Forwarded from Сиолошная
OpenAI отвечают симметрично: https://openai.com/index/introducing-gpt-5-3-codex/

(модель уже есть в Codex App)

Метрик показали меньше, зато:

> The Codex team used early versions to debug its own training, manage its own deployment, and diagnose test results and evaluations—our team was blown away by how much Codex was able to accelerate its own development.

>we are also now running GPT‑5.3-Codex 25% faster for Codex users,

И на первой картинке вы можете увидеть, что токенов теперь тратится ещё меньше — поэтому задачи в среднем будут решаться быстрее.
3👍2🔥2
Claude дарит $50 на работу с Opus 4.6.
Чтобы заклеймить - нужно зайти по ссылке и жамкнуть claim.

Работает, скорее всего, только на платных подписках, но скажите если на фри-тире тоже появляется.

UPD: На бесплатных подписках не работает - нужна Pro/Max подписка, купленная до начала акции (4 февраля)
10🙏4🔥2
И вдогонку еще одна новость для вайбкодеров

В Xcode появилась нативная поддержка Codex/Claude и MCP - больше не нужно держать параллельно открытыми терминалы и IDE. Выглядит красиво.

Интересно как скоро научат их тестировать приложения во встроенном симуляторе - мне кажется, это сейчас основной блокер на пути автономной агентской разработки на iOS.
10🔥6
Наткнулся на одновременно мемное и полезное расширение для Claude, Codex, Antigravity и других агентов - PeonPing.

Добавляет озвучку к агенту в виде реплик орка из Варкрафта, инженера из TF2, Хеллдайвера или еще 40 персонажей на выбор. Поможет избежать простои если вы, как и я, часто работаете одновременно с агентами и не видите их запросов на аппрувы, а давать им полную свободу через --dangerously-skip-permissions пока что не хотите.
🔥16😁93
DS с завода
Адаптировал агента чтобы ревьюить пайплайны, крутящиеся у нас на Databricks - получилось с первого раза (тут должно быть мемное видео). Пока что прогнал на маленьком тестовом пайплайне - без особых улучшений, но с чувством гордости от работающего батута.…
В моем процессе оптимизации пайплайнов единственный этап, который до сих пор приходилось проходить самостоятельно - это тормошение Дата Инженеров, которые не торопятся внедрять предложенные мною изменения.

Решил исправить это досадное недоразумение и подключить Клоду возможность постить от моего имени сообщения. К моему удивлению, нормального MCP для этой задачи, который работал бы из коробки найти не удалось - пришлось навайбкодить свой. Клод полчасика пофурчал и выдал вот такую штуку.

Позволяет агентам подключаться к офисной почте, календарю и MS Teams - все через стандартные Azure-овские инструменты. Постить будет от вашего имени, так что используйте на свой страх и риск.
6🔥4👍3🤣1💊1
Получился большой перерыв в постах — буду исправлять (благо темы есть).

Начну с OpenClaw. Что это такое, большинство уже, вероятно, знает, а остальным не составит труда нагуглить. Вкратце — это агент, который работает на вашем компьютере, может общаться с вами через мессенджеры и с переменным успехом выполнять практически любые действия в системе.

Во мне довольно долго боролись паранойя и желание потрогать новые технологии — в итоге паранойя проиграла.

Вот так сейчас выглядят основные элементы моего сетапа:

Железо: старый MBP на M1.
Модель: gpt-5.3-codex через 20-долларовую подписку к GPT. Как ни странно, для лёгкого ежедневного взаимодействия хватает — пока ни разу не упирался в лимиты, сверх подписки ничего не оплачивал.
Основные инструменты:
MCP и CLI Obsidian — инструмент для хранения заметок, который я использую вместо Notion (кстати, структуру хранилища выстроил сам агент).
DuckDuckGo MCP — для бесплатного поиска.
Google Places API — для поиска по картам.

Что получилось сделать:

1. С одной команды поднять и настроить в облаке сервер с VPN, UI и профилями пользователей, а затем второй командой его снести.
2. Разгрести несколько папок на компьютере, которые планомерно захламлялись последние лет 5.
3. По одной команде собрать список инструкторов по подготовке к экзамену на водительские права в нужном мне центре, проверить по сайтам, кто из них ездит на механике, сколько стоит обучение и какие требования предъявляются к ученику. На выходе — топ-3 оптимальных для меня варианта.
4. Провести ресёрч, найти хорошую зубную пасту для песеля и добавить её в корзину на Amazon (правда, пока без моего залогиненного аккаунта — такое давать ему всё ещё боюсь).
5. Сделать несколько мелких PR в небольших проектах.

Необычным опытом оказалось отправлять и принимать задачи во время полёта — у British Airways есть бесплатный Wi-Fi для мессенджеров, что оказалось весьма удобно.

В целом ощущение весьма положительное. Давать доступ к почте, финансовым транзакциям, умному дому и т. д. я пока не планирую (всё-таки слышали мы о весёлых казусах), но и без этого пользы немало — хотя бы благодаря доступу к своему компьютеру из любой точки. Благодаря этому получилось закрыть ряд мелких задач, которые до этого прокрастинировались неделями.

В общем - осторожно пользоваться точно буду, вероятно, постепенно расширяя полномочия агента, пока он в какой-то момент не пожертвует все мои деньги церкви Молта.
10🔥7👍3
Очередная новость из мира вайб-кодинга, которая каким-то образом проходила мимо меня последние две недели.

Некий Сэмми скучал дома и решил в качестве эксперимента подключить контроллер от PS5 к своему роботу-пылесосу DJI Romo. Как любой уважающий себя современный инженер, разбираться с подключением он не стал и поручил это Клоду. Клод попыхтел-попыхтел и отчитался, что работа выполнена — Сэмми теперь может управлять своим пылесосом.

Своим и ещё примерно семью тысячами чужих.

В процессе выяснилось, что подключение к облаку DJI устроено так, что один валидный токен от своего устройства мог давать доступ к чужим: управлению, карте дома, телеметрии и видео/аудио с камер и микрофонов. По заявлению DJI, это была ошибка проверки прав в MQTT-коммуникации между устройством и сервером (видимо, сервер проверял только наличие валидного токена, а не то, для какого устройства этот токен выдан). Так что история, скорее, не про хакерские способности Клода, а про уровень надёжности всех этих ваших умных домов.

Сэмми оперативно сообщил об этом в DJI (а заодно и паре журналистов) — дыру, как утверждают, сразу закрыли.

Сэмми-то молодец и уязвимостью во вред не воспользовался, но интересно, сколько таких случаев будет в ближайшие месяцы и годы, когда “повезёт” людям менее обременённым моралью. Вспоминается цитата из “Дозоров” Лукьяненко:
— Если все люди станут магами… Сегодня тебе в трамвае нахамят, а завтра — испепелят на месте. Сегодня неприятному соседу дверь гвоздиком поцарапают или анонимку в налоговую напишут, а завтра порчу напустят или кровь высосут.


Ну а на свой собственный пылесос я теперь, конечно, с опаской поглядывать буду.
🔥7😁6👍43
Небольшой лайфак как повысить эффективность кодинга у OpenClaw

Вместо того чтобы говорить ему сделать Х в репозитории Y, я говорю ему запускать сессию Codex CLI и выступать не исполнителем, а заказчиком. То есть Openclaw сам не кодит, а только промптит в Сodex CLI.

Профит:
1. Не раздуваем контекст основного агента
2. Даем GPT модельке пользоваться инструментами из интерфейса, под который она изначально заточена

Все это заворачиваем в SKILL, добавляем всякие доп инструкции (в каких ветках работать, как тестировать и т.д.). Получается вполне рабочий инструмент, через который удаленно внедрять небольшие фиксы в пет-проектах.

Полный текст скилла (разумеется, вместо Codex можно использовать Claude или другие аналоги):
---
name: codex-interactive-defaults
description: Standard launch and delivery policy for interactive Codex CLI sessions in OpenClaw. Use whenever running Codex interactively (single task or multi-turn coding), to keep output compact, force GPT-5.4 with high reasoning effort, and default repository work to dedicated branch plus final PR.
---

# Codex Interactive Defaults

## Launch Policy (Always Apply)

For every **interactive** Codex run, launch Codex with this baseline:

```bash
codex --no-alt-screen --model gpt-5.4 \
-c model_reasoning_effort="high" \
-c hide_agent_reasoning=true \
-c model_reasoning_summary="none" \
-c model_verbosity="low"
```

## Required Constraints

- Pin model to `gpt-5.4` by default.
- Set `model_reasoning_effort="high"` by default (highest documented effort level).
- Override model/reasoning only when the user explicitly asks for a different setup.
- Keep `pty:true` when starting Codex from OpenClaw `exec`.

## Git Workflow Defaults (Branch + PR)

For repository-backed coding tasks, use this as default workflow unless the user explicitly says otherwise:

1. Create/switch to a dedicated branch **before** implementing changes.
2. Do not implement changes directly on `main`/`master`.
3. Implement and commit changes on that branch.
4. Push branch and open a PR.
5. Report the PR URL in the final update.

If branch push/PR creation is blocked by missing remote/auth/permissions, still complete branch + commits and report the exact next commands needed to open the PR.

## Prompting Rule (Mandatory)

When sending a coding prompt to Codex for repository-backed work, explicitly include both instructions below in the prompt text:

1. **Start on a new branch first** (create/switch branch before any edits).
2. **Finish with a PR** (push branch and return PR URL, or provide exact next commands if PR cannot be opened automatically).

Use explicit wording in the prompt (do not assume defaults are enough). Example phrase to include:

- "Before making any code changes, create and switch to a new branch for this task. Do not work on main/master. After implementing, push the branch and open a PR, then return the PR URL."

## OpenClaw Execution Pattern

1. Prepare working directory (often temp + `git init` for scratch work).
2. For repo-backed tasks, create/switch to a dedicated working branch.
3. Start interactive Codex with `pty:true` and the baseline flags above.
4. Use `process` actions (`submit`, `paste`, `send-keys`) for follow-up turns.
5. Finish with pushed branch + PR when repository context allows.
6. Kill/exit session when task is finished.

## Command Templates

### Start session in target directory

```bash
# via OpenClaw exec tool
command: codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
pty: true
workdir: <target-dir>
background: true
```

### Start temp scratch session

```bash
TMPDIR=$(mktemp -d /tmp/codex-demo-XXXXXX)
cd "$TMPDIR"
git init -q
codex --no-alt-screen --model gpt-5.4 -c model_reasoning_effort="high" -c hide_agent_reasoning=true -c model_reasoning_summary="none" -c model_verbosity="low"
```
👍8🔥3
Anthropic запустили code review через своих агентов - берут $15-25 за пулл реквест.

Забавно что я похожую штуку раскатил у нас в компании через CI/CD пайплайны и Codex CLI.

Прикрутил сегодня к ней нормальное логгирование числа запросов - буду репортить сейвинги относительно Антропика. Надеюсь на ROI около 100.
😁143👍2