Исаев Василий - заметки про it, python и ai
38 subscribers
21 photos
2 files
16 links
Download Telegram
Перед началом эксперимента мне казалось, что результат будет примерно одинаковым или чуть лучше у маленьких моделей с высоким уровнем рассуждений, но на моих задачах получилось довольно неожиданно.

Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.

Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.

Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.

Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.

Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
1🤔4❤1
Описал интересный кейс с работы - когда разработка пошла как будто с конца в начало - все началось не с требований а с навайбкоженного сервиса который потом пришлось приводить в порядок

https://habr.com/ru/articles/1076140/

p.s. моя первая статья на хабре - поддержите up-ами 🙈
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥7
openai дропнули астру https://openai.com/index/gpt-6-astra/

p.s. вчера ночью/вечером погонял на каких то сложных проектах с кодом - пока разницу не увидел с sol от слова совсем, будем посмотреть
😁4🥴1
pydantic выпустил свой фреймворк для агентов - обещан рилтайм, ембеддинги, все типизированное(а не как в langchain) и ваще легко просто молодежно
постараюсь сделать обзорчик в ближайшее время - по quickstart пока нравится

https://pydantic.dev/docs/ai/overview/
2🔥6
Открыл для себя написание статей через надиктовывание в чатгпт - почитал бенчи/подписки и собрал все вместе в новой статье на хабре - го читать!

https://habr.com/ru/articles/1081060/
1🤔3👍2🍌1
I am going to sleep. You have 8 hours to code and launch a profitable B2B AI SaaS app that will earn me millions of dollars. Make no mistake. Take your time. Don’t ask anything - just do it.
64🔥6❤2❤‍🔥1
Тут неожиданно приехала пачка любопытных новостей
Исследователь Jacob Coxon ушёл из Anthropic, заявив, что компания и OpenAI слишком быстро движутся к самоулучшающемуся ИИ и рискуют безопасностью человечества - выглядит немного странно - немного отдаёт PR-ходом.
Дарио Амодеи призвал замедлить развитие передовых моделей. Предлагает независимых проверяющих внутри лабораторий и согласованные ограничения для крупных ИИ-игроков, чтобы безопасность успевала за возможностями ИИ - в свете последних успехов OpenAI тоже есть сомнения в искренности.
Сэм Альтман исключил IPO OpenAI в 2026 году, сославшись на вопросы безопасности ИИ - по интернету уже гуляет гипотеза, что IPO = раскрытие финансов, с которыми у OpenAI может быть не всё так гладко (моя статья частично про это).
Трамп выступил против замедления: США должны сохранить преимущество перед Китаем, потому что «кто победит в ИИ, тот победит во всём остальном» - как ни странно - кажется самым «искренним», если можно так сказать - типа «не знаю чё там у вас за дела - ничего тормозить не будем, боремся за господство с Китаем» - вполне в его духе.
Я активно работаю с Astra и какого-то AGI на практике пока не вижу от слова совсем - галлюцинации/600 тестов проходят, но не ловят баги/удаление/затирание error-логов при запросе фиксить ошибки - всё на месте. Бенчи Astra, где они всех на голову выше, - на практике пока не особо чувствуются, а учитывая недавний хайп с тем, что Fable отменили из-за угроз человечеству, - а на практике опять же никакого вау-эффекта в комьюнити не обнаружилось, а также «голливудская» история про рой агентов, взломавший что-то там, и алармизм в отношении «роя» агентов (интересно, во сколько встанет этот рой с текущими ценами по API на те же Fable) - учитывая сокращающееся отставание открытых моделей, звучащие очень странно, - короче, похоже это всё на какой-то набор маркетинговых и финансовых трюков, чем на AGI.
51🔥6
Сегодня в 19-00 проведу воркшоп для ВШМ где читаю курс по агентам
поразгоняем про типичные проблемы доведения агентов до прода
52❤8
Яндекс выложили веса большой АлисыAi -
https://kod.ru/yandex-alice-ai-foundation
видимо ответ Грефу не его пассаж - посмотрим на независимые бенчи и разборы, пока только новость от самого Яндекса
53👍4
пу пу пу
52😁73⚡2
шутка про то что дешевле нанять джуна начинает выходить из под контроля...

https://www.kucoin.com/news/flash/openai-rumored-to-launch-500-chatgpt-pro-max-tier
51😨5
Запускаю сoding agents contest

В двух словах:
Оценивается харнес (все запускается на DeepSeek V4.1 Flash).

В лидербордах для примера:
— Популярные кодинг-агенты
— Мой демо-агент с курса
— Чебупелька

🎁 Из призов:
1. Три коллекционных подарка в Telegram (подробнее)
2. Промокоды на скидку -40% на любую программу ШВМ или SHAD Helper.
Можно выбрать любую программу: от создания AI-агентов до подготовки к поступлению в ШАД.
За деталями: @academic_guidance_shvm

⚙️ По самим агентам:
Буду отсматривать вручную. Можно допиливать опенсорс, можно делать с нуля — можно почти что угодно, кроме copy-paste 1-в-1.

🔗 Ссылка: https://planerverse.ru/

всем удачи!
1🔥7