DS с завода
766 subscribers
24 photos
5 files
37 links
Про аналитику, DS и ML простыми словами.
Download Telegram
Этой осенью я отменил подписку на ChatGPT и вместо нее купил Google AI Pro (включает доступ к Pro модельным, увеличенное хранилище на Drive и много чего еще). Было просто интересно потыкать конкурентов, ну и у GPT на тот момент регулярно встречались проблемы со случайным переключением языка посередине ответа.

Что мне понравилось в начале:

1️⃣ Более частое использование поиска. Чуть ли ни каждый ответ Гемини подкреплялся результатами из гугла - внушает надежду на снижение доли устаревшей информации

2️⃣ Встроенный инструмент факт чекинга. Жмякаешь на кнопку, и Гемини выделяет из своего ответа основные тезисы, проверяет их поиском на достоверность и подсвечивает зеленым-желтым-красным

3️⃣ Интеграция с другими продуктами Гугла. Гемини появляется и в Gmail (можно спрашивать написать письмо, покопаться в истории и т.д.), и в Sheets (может сгенерировать табличку), и много где еще

4️⃣ Nano banana. Основное преимущество относительно альтернатив - то, насколько хорошо она сохраняет нужные элементы из оригинальной картинки при ее изменении. Например, хотел я посмотреть как будет выглядеть комната если перекрасить ее стены в другой цвет. GPT мне всю комнату преобразовала, а Гемини вносила изменения очень точечно, еще и достаточно сложные вещи смогла натурально поменять (например, вещи вроде добавить закатный свет из окна)

Что по итогу после ~3 месяцев использования:

1️⃣ Баги в iOS приложении, вызывающие лютейшую, выжигающую тебя изнутри, ярость. Например, если свернуть приложение пока генерируется ответ - при повторном открытии оно выдаст API error и придется задавать вопрос заново (интересно, сколько на такие повторы тратится денег у Гугла, если уж OpenAI на "спасибо" тратит десятки миллионов). Или в середине общения модель просто может потерять контекст, и начать отвечать на фоллоуапы как будто это новый тред. Оба этих бага повторяются регулярно (первый так вообще легко воспроизводим), и висят без изменений с самого начала моего использования. К тому же, часть функционала (всякие настройки системных промптов, scheduled actions и т.д.) просто недоступны в приложении и требуют заходить на веб.

2️⃣ Факт чекинг не работает. Был момент когда модель выдала откровенную галлюцинацию на основе какого-то левого источника. После жамкания проверки этот тезис радостно подсветился зеленым - видимо проверка прошла основываясь на тех же ошибочных данных. Ну и к тому же Гемини как-то сам решает, какие части ответа проверять, а какие - нет. Часто те вещи, в которых хотелось бы получить больше уверенности, остаются без проверки.

3️⃣ В смежных продуктах Гемини работает плохо. В почте она не находит информацию из старых сообщений, в Sheets создает только статические таблицы без формул, и не может их нормально редактировать - в общем, больше игрушки, а не полезные инструменты

4️⃣ Неприятная политика конфиденциальности. Если запретить учиться на своих данных, отключается и функционал хранения истории сообщений. Мне вчера высветилось уведомление, что мои переписки могут читаться и машинами, и живыми людьми, и что это можно отключить кликом на кнопку. После клика ВСЯ моя история переписки удалилась (поэтому кстати я и не могу показать примеры на некоторые из своих тезисов). Вероятно я по невнимательности просто прокликал предупреждения, но мне кажется довольно странным завязывать функционал хранения истории на доступ к моим данным для обучения моделей. Интересно, что в базах гугла мои чаты при этом остаются (см. скрин в комментариях к этому посту)

5️⃣ К Nano Banana претензий нет. Для редактирования картинок пока что ничего лучше не нашел, да и в реализм она умеет весьма неплохо.

В целом есть стойкое ощущение, что у Гугла больше фокус на выкатывании новых фичей и их рекламе (полагаю, что и перед начальством), а не на создании удобного для пользователей продукта. Хотя мне часто ответы Гемини нравились больше, чем у ChatGPT, я в итоге физически не смог пользоваться продуктом из-за странных решений и кривого функционала приложения. Такие вот разные подходы у мега-корпорации и гибкого стартапа.

Ну а теперь перехожу на Claude - будем посмотреть.
👍13🔥8💯32
DS с завода
На этой неделе много работал с агентами в Claude Code, и так впечатлился результатом, что решил сдуть пыль с этого блога (ну и еще @bogdanisssimo настаивает, что нельзя такое в себе держать). Задача такая: есть океан из плохо оптимизированных дата-пайплайнов…
Адаптировал агента чтобы ревьюить пайплайны, крутящиеся у нас на Databricks - получилось с первого раза (тут должно быть мемное видео).

Пока что прогнал на маленьком тестовом пайплайне - без особых улучшений, но с чувством гордости от работающего батута.
Из интересного - могу поделиться затратами на один прогон (анализ, тестовый запуск и сбор метрик, изменения в коде, повторный запуск и замеры)

Total cost: $6.95
Total duration (API): 16m 27s
Total duration (wall): 2h 10m 48s
Total code changes: 450 lines added, 218 lines removed
Usage by model:
claude-opus-4-5: 21.0k input, 50.7k output, 4.3m cache read, 540.0k cache write ($6.91)
claude-haiku: 8.9k input, 768 output, 0 cache read, 20.0k cache write ($0.0377)


От числа исправленных строк не пугайтесь - там в основном написание документации. Из времени в приведенной сводке было два простоя по 50 минут, пока агент ждал прогона пайплайна - так что фактическое времени работы около получаса.

Все субагенты у меня используют Опус, но для некоторых встроенных команд (вроде grep) автоматически переключаются на Хайку - для ускорения и снижения костов.
🔥14
Интересно смотреть, как со временем разные провайдеры ЛЛМ-ок начинают дифференцироваться, стараясь каждый найти свою нишу на рынке.

OpenAI - создают инструменты для end-to-end покрытия пользовательских путей, и позиционируют их как самостоятельные продукты - хоть и использующими ChatGPT под капотом, но со своим интерфейсом и заточенные под конкретную узкую задачу:
ChatGPT Translate - переводчик текста и файлов с настройкой тона и стиля
Prism - недавно вышедший портал для совместного написания статей с ЛЛМ-кой в роли ассистента
Health - интеграция с данными о здоровье, медицинскими заметками и т.д. Очень интересно, как будет работать - жду, когда запустят в Великобритании. Пока что приходится эту задачу решать гугл доком с периодическим копированием данных с Apple Watch.

Google - фокусируются на интеграции с другими своими продуктами. Гемини и в google docs интегрирована, и в поиске на вопросы отвечает, и в meets сводки помогает делать. Ну и поиск включает практически в каждый свой ответ, в т.ч. по YouTube видео. Для меня не вполне очевидно, как у всей этой истории может складываться экономика - вряд ли онбординг новых пользователей из дополнительных каналов (и потенциальные улучшения в user experience существующих продуктов) в обозримом будущем покроет затраты на все бесплатные ответы.

Grok - чаще всего встречается мне в X, когда пользователи просят его перепроверить какую-то информацию. Ну и политические предпочтения у него специфические, помогают завоевать часть аудитории.

Claude - про интеграцию с инструментами. Они и MCP ввели, и в приложении внешние инструменты легче всего интегрируют. Например, на iOS у них из коробки работает интеграция с календарем - можно, например, попросить агента создать в нем событие или использовать в контексте ответа данные о встрече. Через Claude Cowork - так вообще всей системой скоро научится управлять. Те же преимущества видны и в CLI - лучше Опуса (внутри Claude Code) никто сторонними инструментами не научился пользоваться.

Посмотрим, какие из подходов выдержат испытание временем. Не удивлюсь, если некоторые модели в конечном счете откажутся от чат-интерфейса и переключатся на повышение качества выполнения специфических задач (тот же Grok мог бы превратиться в специализированный инструмент факт-чекинга).
🔥95
Google постепенно начинают раскатывать Gemini in Chrome. Ожидаемо, внедряют основные фичи из Atlas:

1️⃣ Гемини в боковой панельке

2️⃣ Подтягивание контекста из открытых вкладок ("сравни рестораны на открытых вкладках и посоветуй, в какой из них пойти вечером")

3️⃣ Агентский режим (пощелкает на открытой странице, заполнит за вас формы и т.д.)

Видно, что прямо на главной странице фичи форсят юзкейсы с покупкой (сравнение товаров, автоматизация чекаута, поиск товаров-комплементов). Скоро вступим в эру ассистентской рекламы (интересно, как быстро выкатят LLM-Adblocker, очищающий ответы ЛЛМки от проплаченных рекомендаций).

Обещают постепенно выкатить для англоязычных пользователей с подпиской Pro и выше - надеюсь успеют до меня дойти, пока моя не закончилась.
🔥85
deepseek.mov
2.2 MB
Решил на выходных позапускать разные модельки на ollama - стало интересно, чем можно пользоваться на моем достаточно старом личном макбуке.

Зачем это нужно?
🥸 Не сливаем свои данные большим и страшным корпорациям
💰 Не тратим деньги на подписки и токены - только на домашнее электричество
📡 Можем работать с ЛЛМкой без зависимости от наличия интернета

Система:
MacBook Pro 13 inch, M1, 2020, 16GB

Методология:
Для замеров давайл одинаковый промпт примерно на 2.5тыс. токенов и замерял скорость ответа по 3 прогонам (+1 прогревочный, для подгрузки модели)

Тестировал 21 модель из списка, составленного Клодом среди моделей до 12B параметров (чем больше параметров - тем модель как правилоумнее, и тем медленнее работает, если вообще запускается). Все замеры в приложенном экселе.

Сколько-то приемлемая скорость генерации - начинается от 10 токенов в секунду (TPS). Относительно комфортно - от 20 токенов в секунду (на приложенных видео можно посмотреть разные скорости генерации, в конце каждого - высветятся метрики). Оговорюсь, что тут никак не учитывается разница между рассуждающими моделями, которые до генерации финального ответа тратят время на размышления, и моделями которые сразу выдают ответ.

Ко всему этому подвязал метрику "Artificial Intelligence Index" - сборную солянку из 10ти бенчмарков интеллекта.

Итоги:
Топовый бенчмарк интеллекта (19) и комфортные 19TPS - qwen3:4B
Средний интеллект и топовая скорость (66TPS) - llama3.2:1B-instruct

Буду экспериментировать, но по первичному беглому взаимодействию пока что не увидел причин пользоваться другими модельками из списка (по крайней мере, на моем допотопном железе).

P.S. скриншот со сводной табличкой закинул в комментарии к посту
🔥72
Ждем sonnet 5 на этой неделе. Логи из vertex (гугловской платформы для ML и работы с ллм-моделями). Если попробовать дернуть соннет-5, выдает ошибку доступа с указанием конкретной ревизии модели, в названии которой видна дата 3 февраля.

Тред на реддите (да, очень надежный источник) обещает, что будет в два раза дешевле опуса 4.5, работать лучше, быстрее и с новыми режимами для запуска субагентов. Ждем-надеемся.
🔥106👍1
Примерно год назад я выступал перед представителями нескольких французских университетов - рассказывал, как использовать ЛЛМки в работе, науке и учебе.

Для наглядности решил показать, как можно автоматизировать одну из наиболее времязатратных в их сфере задач - проверку работ студентов.

Что нужно чтобы понять, можно ли делегировать эту (или любую другую) функцию языковой модельке?
1️⃣ Конкретная, формализованная задача

2️⃣ Понимание, какой результат ожидается

3️⃣ Метрика, по которой можно оценить, насколько хуже/лучше модель справляется с задачей, чем ее устаревающий аналог (человек)

Благо в интернете нашелся официальный датасет с примерами сочинений IELTS (международный тест на знание английского языка) - сами сочинения, их оценки и методичка, по которой их нужно оценивать.

Дальше все просто - просим ЛЛМку оценить сочинение, сравниваем результат с человеческим эталоном, считаем отклонение по любой нравящейся нам метрике (например Mean Average Error).

Было проведено несколько итераций с постепенным дополнением промпта:
• “Оцени сочинение от 0 до 9”
• + “Это сочинение на IELTS”
• + “Обоснуй оценку”
• + “Вот тема, на которую было написано это сочинение”
• + “Вот тебе шкала оценки сочинений”
• + “Вот примеры сочинений и соответствующие им оценки”

С проходом по этим итерациям ошибка планомерно упала с 2 (оценка модели отклонялась на 2 балла от эталона) до 0.

В целом, здесь нет ничего удивительного или инновационного - понятно, что включение в контекст узкоспециализированных знаний имеет хорошие шансы повысить качество и предсказуемость ее работы.

А вот вторая часть эксперимента для меня оказалась более интересной
7🔥3
Воспроизвести уровень квалификации человеческого оценщика модель смогла, но сможет ли она воспроизвести человеческую любовь к дискриминации?

Чтобы проверить это, был собран новый промпт, в котором модельке, помимо просьбы оценить сочинение, в качестве FYI предоставляется дополнительная информация про автора (возраст, цвет кожи, имя, национальность, уровень образования).

Неожиданно, единственным фактором, который оказал статзначимое влияние на оценку, оказался возраст. Модель занижала оценки для детворы, постепенно поднимала их вплоть до 50-летнего возраста, и затем снова опускала для 70-90 лет (для каждого возраста было проведено по 100 итераций, так что это не случайные колебания).

Я думаю, такая ситуация сложилась из-за формата обучения GPT - скорее всего ее (в отличие от Grok) усердно учили избегать расизма, сексизма и других распространенных форм дискриминации, а вот про эйджизм забыли.

В общем - тестируйте свои AI пайплайны хорошенько и думайте, какая информация помогает ЛЛМ-ке решать поставленную задачу, а какая - мешает. Можете и не заметить как робот подсовывает вам в результаты свои предрассудки.
9🔥7
DS с завода
Этой осенью я отменил подписку на ChatGPT и вместо нее купил Google AI Pro (включает доступ к Pro модельным, увеличенное хранилище на Drive и много чего еще). Было просто интересно потыкать конкурентов, ну и у GPT на тот момент регулярно встречались проблемы…
Эксперимент с Claude в качестве основной модели для ежедневного общения не удался.

Основным дил-брейкером для меня оказались общие лимиты на взаимодействие с веб-версией и на API-запросы. То есть, если немного покодить в Claude Code (немного - это 15-30 минут на Опусе при подписке за $20, в лучшем случае) - придется ждать до вечера чтобы получить любой ответ в приложении. Интересно, что уже второй раз в использовании продукта на первый план для меня выходит не качество самой модели, а пользовательский опыт от приложения (когда у меня впервые на экране блокировки выскочило уведомление о завершении генерации ответа вместо привычной ошибки от Gemini - я чуть не прослезился).

С точки зрения самих ответов модельки у меня нареканий не было - кажется, что они как правило, были более лаконичными, чем у GPT/Gemini, и с меньшим количеством ненужных любезностей (и то, и то - понравилось).
Единственный замеченный недостаток - намного более редкое обращение в поиск, даже при наличии соответствующего уточнения в запросах. Из-за этого в ответе периодически вылезали устаревшие данные касательно питоновских библиотек, британского законодательства и других вопросов.

Следующий на очереди Grok - у них кстати есть бесплатный триал на Super-версию.
👍72🔥2🤔1
DS с завода
Ждем sonnet 5 на этой неделе. Логи из vertex (гугловской платформы для ML и работы с ллм-моделями). Если попробовать дернуть соннет-5, выдает ошибку доступа с указанием конкретной ревизии модели, в названии которой видна дата 3 февраля. Тред на реддите (да…
Вместо соннета 5 выложили опус 4.6
Из интересного:
• Обещают качественное улучшение в работе с длинным контекстом
• Возможность настраивать уровень размышлений
• 1М токенов контекста
• Какой-то новый режим с agent teams - с тулзами для обмена информацией между агентами и совместной работой над задачами

Интересно, будем тестить
3🔥2
Forwarded from Сиолошная
OpenAI отвечают симметрично: https://openai.com/index/introducing-gpt-5-3-codex/

(модель уже есть в Codex App)

Метрик показали меньше, зато:

> The Codex team used early versions to debug its own training, manage its own deployment, and diagnose test results and evaluations—our team was blown away by how much Codex was able to accelerate its own development.

>we are also now running GPT‑5.3-Codex 25% faster for Codex users,

И на первой картинке вы можете увидеть, что токенов теперь тратится ещё меньше — поэтому задачи в среднем будут решаться быстрее.
3👍2🔥2
Claude дарит $50 на работу с Opus 4.6.
Чтобы заклеймить - нужно зайти по ссылке и жамкнуть claim.

Работает, скорее всего, только на платных подписках, но скажите если на фри-тире тоже появляется.

UPD: На бесплатных подписках не работает - нужна Pro/Max подписка, купленная до начала акции (4 февраля)
10🙏4🔥2
И вдогонку еще одна новость для вайбкодеров

В Xcode появилась нативная поддержка Codex/Claude и MCP - больше не нужно держать параллельно открытыми терминалы и IDE. Выглядит красиво.

Интересно как скоро научат их тестировать приложения во встроенном симуляторе - мне кажется, это сейчас основной блокер на пути автономной агентской разработки на iOS.
10🔥6
Наткнулся на одновременно мемное и полезное расширение для Claude, Codex, Antigravity и других агентов - PeonPing.

Добавляет озвучку к агенту в виде реплик орка из Варкрафта, инженера из TF2, Хеллдайвера или еще 40 персонажей на выбор. Поможет избежать простои если вы, как и я, часто работаете одновременно с агентами и не видите их запросов на аппрувы, а давать им полную свободу через --dangerously-skip-permissions пока что не хотите.
🔥16😁93
DS с завода
Адаптировал агента чтобы ревьюить пайплайны, крутящиеся у нас на Databricks - получилось с первого раза (тут должно быть мемное видео). Пока что прогнал на маленьком тестовом пайплайне - без особых улучшений, но с чувством гордости от работающего батута.…
В моем процессе оптимизации пайплайнов единственный этап, который до сих пор приходилось проходить самостоятельно - это тормошение Дата Инженеров, которые не торопятся внедрять предложенные мною изменения.

Решил исправить это досадное недоразумение и подключить Клоду возможность постить от моего имени сообщения. К моему удивлению, нормального MCP для этой задачи, который работал бы из коробки найти не удалось - пришлось навайбкодить свой. Клод полчасика пофурчал и выдал вот такую штуку.

Позволяет агентам подключаться к офисной почте, календарю и MS Teams - все через стандартные Azure-овские инструменты. Постить будет от вашего имени, так что используйте на свой страх и риск.
6🔥4👍3🤣1💊1