AI Makes Me Hate
564 subscribers
78 photos
10 videos
4 files
84 links
AI systems engineer и скептический практик, который проверяет и внедряет AI на реальных задачах разработки
Download Telegram
Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвели

Недавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.

Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.

Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.

И иногда агенты неожиданно тупо ломались:

- Claude раз за разом пытался захардкодить три видимые тестовые скважины, хотя на сабмите Kaggle подменяет их скрытым датасетом. Пришлось заводить отдельное правило и заставлять проверять его каждый раз.
- Codex решил, что несколько сложных сэмплов "плохие", и выкинул их из OOF. Локально стало красивее, а при мерже с тимейтами выяснилось, что у меня не хватает строк.
- Claude любил запускать "быстрый дешёвый smoke run", после которого идея объявляется нерабочей, хотя эксперимент имел мало общего с тем, что я хотел.
- неправильные выводы записывались в память и влияли на следующие эксперименты, приходилось чистить руками.
- Opus 4.6 выполнял инструкции надёжнее, чем 4.8 и 5.0: дал пять задач - сделает пять, а более новые версии иногда брали одну-две и игнорировали остальное.

Главный вывод: агент оптимизирует ту метрику, которую видит. Приватный лидерборд он оптимизировать не может, поэтому работает через прокси - локальный CV, паблик, время выполнения или просто "выглядит ли задача сделанной". И очень способный агент может стать очень хорош в оптимизации чего-то, что слабо связано с тем, что тебе нужно.

Ещё показательно: победители переформулировали задачу - вместо построчной регрессии 2D alignment и декодирование связного пути через всю скважину. Агенты отлично искали итеративные улучшения имеющихся идей, но не могли придумать что-то принципиально новое.

Так что агенты не отменяют экспертизу. Они её усиливают: если ты в теме, то можешь проверить много идей; если просто просишь агентов работать за тебя - они уйдут в неправильном направлении быстрее, чем ты сам.

Блог
Medium
Ycombinator

#ai #kaggle
5
Forwarded from iOS Makes Me Hate
Shopify возвращается с React Native обратно на натив из-за аи-агентов

уже пару лет были предсказания что кроссплатформа стала бессполезной из-за аи. Что писать код на обоих платформах стало проще с нормальным агентом и харнессом.

Вот и shopify делятся в статье почему отказываются от реакт нейтива и переходят обратно на натив:
1️⃣ два приложения больше не обязательно означает в два раза больше работы
2️⃣ они строят разработку вокруг агентов и думают об общих архитектурах, механизмах и тп
3️⃣ цитата "мы строим harness, внутри которого AI физически сложно протащить плохой код дальше"

Они проектируют приложение не только для пользователей и разработчиков, но и так, чтобы агент мог наблюдать систему, воздействовать на нее и самостоятельно проверять результат.

Че думаем? Ставьте лайк если топ новость 🖤

или пишите коммент почему утопия
6👍3
AI Makes Me Hate
ну все, теперь и тут легенда
продолжаю завоевывать ачивки
😁6
OpenAI отменили подписку за 200$... Как хорошо что я успел взять. Или это прогрев гоев?
😁53
codex-subscription-guide.pdf
5.6 MB
Все чаще вопросы "а как купить подписки если нет номера телефона/впн/карты и тп?".

Решил подсуетиться и собрал гайд на 30 слайдов и > 50 ссылок как пользоваться купить кодекс:
• виртуальные карты и покупки онлайн
• виртуальные телефоны и аренда
• оплата через мтс и банки
• покупка карт из узбекистана, казахстана, армении и тп с доставкой в квартиру
• где выгодней всего брать подписки
• рабочий VPN
• частые причины банов аккаунтов
• в чем отличие подписки App Store от других
• многое другое

Ставьте лайк и пишите в комменты чего не хватает
9
Forwarded from CodeCamp
OpenAI выпустила гайд по скиллам и промптам для GPT-6 Astra!

Astra стала самостоятельнее, поэтому старые огромные промпты и раздутые скиллы теперь могут только мешать. OpenAI советует убирать лишнее, давать документацию по необходимости и чётко описывать конечный результат.

Пользуемся 👌
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
AI как экзокостюм разработчика: ссылки к докладу

АГЕНТЫ И HARNESS

Anthropic: Demystifying Evals for AI Agents - https://www.anthropic.com/engineering/demystifying-evals-for-ai-agents

Pi Agent Harness - https://github.com/earendil-works/pi

Agent Squad: оркестратор для iOS - https://github.com/2FastLabs/agent-squad


SKILLS И ПРОЦЕСС РАЗРАБОТКИ

Superpowers - https://github.com/obra/superpowers

Skill Conductor - https://github.com/smixs/skill-conductor

OpenAI: переосмысление skills и промптов для GPT-6 Astra - https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra


КОНТЕКСТ, ПАМЯТЬ И БАЗА ЗНАНИЙ

Cline - https://cline.bot/

Cline Memory Bank - https://docs.cline.bot/best-practices/memory-bank

Synozur: модель зрелости управления знаниями - https://www.synozur.com/models/knowledge-management-maturity-model

TOON: компактный формат структурированных данных - https://toonformat.dev/


ИНСТРУМЕНТЫ И ЭФФЕКТИВНОСТЬ

MCP vs CLI: сравнение расхода токенов - https://afrozeamjad.com/writing/mcp-vs-cli-token-benchmark/

Видео к теме «Почему агенты тормозят в больших кодовых базах?» - https://www.youtube.com/watch?v=LyjG7-lq8UE


ТЕСТИРОВАНИЕ И ПРОВЕРКА РЕЗУЛЬТАТА

Callstack Agent Device - https://github.com/callstack/agent-device

Google Artemis - https://github.com/google/artemis

Storybook: AI Best Practices - https://storybook.js.org/docs/ai/best-practices


КЕЙСЫ КОМПАНИЙ

Shopify: Back to Native - https://shopify.engineering/back-to-native

Публикация Яндекса из раздела «Экзо-команды на рынке» - https://t.me/yandex/5421

Microsoft .NET: кейс Doggie Bus - https://dotnet.microsoft.com/en-us/platform/customers/doggie-bus


КНИГИ И КАНАЛЫ

Материалы о детерминизме и AI - https://t.me/iosmmcresources/142

DX-Ray: сайт автора Claude Code for Developer Experience - https://dx-ray.com/
🔥7👍1
впервые закончил недельную подписку на 200$ за два дня просидев на астре в effort ultra + fast. Честно, чет пока ничего не заметил невероятного
На подлодке было много вопросов. После доклада мы еще на час остались на неофициальную часть. Уже без записи, где я старался честно отвечать на всякие вопросы.

Два главных: какие навыки обесцениваются и как теперь получать повышения?

1️⃣ Про навыки. На мой взгляд, дешевеет не инженерная экспертиза, а работа, которую раньше приходилось делать руками: писать типовой код, вспоминать десятки команд, собирать окружение по разрозненным инструкциям. Умение быстро все это проделать перестает быть таким сильным преимуществом.

Но понять, что нужно сделать, где агент ошибся и как доказать, что результат правильный, по-прежнему работа инженера.

Если ты не понимаешь нативную платформу, контракт и поведение виджета, агент может очень убедительно мигрировать его неправильно. Зеленый блилд тут не спасет.

Поэтому мой доклад не про "теперь можно ничего не знать". Он про то, как упаковать знания и опыт команды в инструменты, скиллы и проверки, чтобы не применять их каждый раз вручную.

2️⃣ Про повышения. Во первых, я не карьерный консультант. Да и те, кто в 90% себя ими называются, не работают в карьерной лестнице.

Но мне кажется, принцип почти не изменился. Раньше мы приходили с BDUI, кроссплатформой, модульностью и автоматизацией тестирования. Теперь тоже самое, но с AI. "я внедрил технологию/сжег токены/снейрослопил 100 фич" само по себе еще не объясняет, за что тебя повышать.

Сильнее обычно звучит другое. Команда быстрее начинает разработку, тратит меньше времени на повторяющуюся работу, выпускает изменения с меньшим количеством переделок.

И ты можешь показать, что изменилось и какой вклад в это внес.

Поэтому я бы начинал не с поиска применения AI, а с дорогой проблемы команды. Обсуждал с руководителем, какой результат действительно важен и как он связан с ожиданиями от следующего уровня. Это не гарантия повышения. Остаются бюджет, квоты, приоритеты и субъективность перформанс-ревью. Но появляется какой-то конкретный разговор.
👍10
Forwarded from AI Projects (Vladimir Ivanov)
Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля. Это на деле серьёзный удар всей стратегии Сбера по продвижению GigaChat в «закрытые контуры», которая вся крутится вокруг утверждения в духе: злые враги наверняка при обучении модели заложили в LLM зловредного агента, он, получив сигнал врагов, проснётся и захватит власть в России через правительственные системы. Правда, почему-то в таких мантрах коллеги GigaChat использовали дистилляцию Gemini и ChatGPT, как я уже отмечал по работе Anthropic — дистилляция тоже скрыто передаёт предпочтения учителя, типа либеральных взглядов. Яндекс ранее использовал Qwen для инициализации весов. Получается, в рамках маркетинга Сбера, что правительственного ИИ-агента в России контролирует Трамп, то это лучше, чем Си Цзиньпин. Вот в этом я не уверен. Однако на многих чиновников «суверенное обучение» всё равно производило впечатление, и Яндекс решил разрушить вообще фундамент стратегии продвижения конкурента в госсектор. И надо сказать, что судя по бенчам и архитектуре, Яндексу это уже удалось.

Для начала Яндекс и Сбер стали копировать довольно передовые архитектуры китайцев на гибридах GPT и Delta State, благо что у китайцев всё открытое. Однако Яндекс стал копировать архитектуру Kimi K3 прямо с их Kimi Delta State, что значительно превосходит архитектуру Сбера. Это таки фронтир, который с Fable сражается на равных. Правда, для Яндекса и Сбера проблема в неожиданном асимметричном архитектурном ответе DeepSeek V4.1 Flash, который отказался от модного гибрида и вместо этого фактически переосмыслил понятие трансформера и предложил GPT, где половина слоёв нейросети формирует понимание контекста, а вторая половина совместно ими пользуется — Causal Encoder-Decoder (CED). Фактически CED в нише worker-агентов уже порвал всех на тряпки: в шлюзе Vercel, как я публиковал их статистику ранее, даже американцы более 50% инференса (вообще по всем моделям!) заказывают у DeepSeek. Иными словами, Яндекс и Сбер, побежав копировать «мейнстрим» китайцев, возможно, зашли в технологический тупик, если CED продолжит лидировать как архитектура во Flash-моделях.

Ну да ладно, забавнее совсем другое. Я стал сравнивать, какой же «Истинно Православный ИИ» лучше по бенчмаркам. Всё же даже Президенту России надо выбрать себе агента. Тут оказалось, что поскольку у Яндекса и Сбера не получается, чтобы бенчмарки были хороши везде, то они публикуют только те, где результаты нормальные. В результате получается анекдот, что бенчей много, а сравнить AliceAI-Foundation-80B-A3B-Base и GigaChat3.5-432B-A28B-Reasoning можно только по LiveCodeBench и IMO AnswerBench. Однако после этого русский ИИ-цирк стал ещё веселей.

Вообще-то Сбер раструбил на весь интернет, что у него там теперь взрослый Reinforcement Learning и даже CoT, теперь Reasoning даже есть. Яндекс опубликовал Base-модель, где только обучение по корпусу, классически для Base не ведётся SFT обычно и совсем не ведётся Reinforcement Learning. Однако базовая (!) модель Яндекса оказалась сильнее модели Сбера (на больших весах, с CoT, RL и дистилляцией из Gemini/ChatGPT) в математических задачах — IMO AnswerBench.

По качеству первичной генерации кода на Python модели практически равны в LiveCodeBench.

Давайте прямо скажем, это катастрофа для Сбербанка в госсекторе. Довольно хорошо видно, что GigaChat имеет настолько слабое RL-обучение, что даже не может перебить Base-модель у Yandex. Модель Яндекса меньше и требует меньше ресурса GPU (сразу же на гостендере убивает Сбер просто по цене оборудования). Аргумент Сбера, что у него «истинно православное обучение с нуля», уничтожен Яндексом, т.к. они тоже обучаются теперь с нуля.

На самом деле Грефу уже давно пора делать оргвыводы в команде GigaChat, если он не хочет, чтобы Яндекс его выдавил даже из госсектора. Безусловно, коллеги имеют право не согласится с моими выводами и написать в комментах это.

https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
https://huggingface.co/ai-sage/GigaChat3.5-432B-A28B-Reasoning
1
Популярные скиллы и их адопшен

Сейчас я много работаю над харнессом и тп. И одна из главных задач это делать то, чем действительно будут пользоваться, а не складывать наработки в стол.

Это крутой опыт. Ты становишься продуктовым инженером для других инженеров. Твой продукт не спускают сверху как обязательный инструмент от платформенной команды. Его выбирают, только если он оказывается полезнее и удобнее альтернатив.

Я часто смотрю, кто и как активно пользуется нашими скиллами. В общей сумме у нас уже их 40. Кол-во не значит качество. Но пока у скиллов для BDUI самый высокий адопшен.

Чуть позже расскажу про самые полезные и популярные. Какие задачи они решают и почему прижились.