Три недели как тыкаю max-подписку chatgpt - начинал с sol с high/ultra ризонинга, теперь добрался до Terra и даже до Luna - и для большинства задачи вполне хватает их с средним ризонингом
дальше пошел смотреть бенчи/цены/траты по токенам - и ничего особо мне это не дало, какую модельку то выбрать для маленького бага? а для сложного маленького бага? а для простого бага но в котором нужно проследить очень длинный трейс?
по этому решил забилить свой небольшой бенч - дать реальные задачи разным моделям с разным ризонингом и сравнить - качество и цену
дальше пошел смотреть бенчи/цены/траты по токенам - и ничего особо мне это не дало, какую модельку то выбрать для маленького бага? а для сложного маленького бага? а для простого бага но в котором нужно проследить очень длинный трейс?
по этому решил забилить свой небольшой бенч - дать реальные задачи разным моделям с разным ризонингом и сравнить - качество и цену
👨💻6
Кто сильнее на реальных задачах?
Anonymous Poll
22%
🧠 Маленькая моделька с большим ризонингом
11%
💪 Большая моделька с минимальным ризонингом
67%
Зависит от задачи
Перед началом эксперимента мне казалось, что результат будет примерно одинаковым или чуть лучше у маленьких моделей с высоким уровнем рассуждений, но на моих задачах получилось довольно неожиданно.
Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.
Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.
Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.
Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.
Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.
Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.
Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.
Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.
Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
1🤔4❤1
Описал интересный кейс с работы - когда разработка пошла как будто с конца в начало - все началось не с требований а с навайбкоженного сервиса который потом пришлось приводить в порядок
https://habr.com/ru/articles/1076140/
p.s. моя первая статья на хабре - поддержите up-ами🙈
https://habr.com/ru/articles/1076140/
p.s. моя первая статья на хабре - поддержите up-ами
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥6
openai дропнули астру https://openai.com/index/gpt-6-astra/
p.s. вчера ночью/вечером погонял на каких то сложных проектах с кодом - пока разницу не увидел с sol от слова совсем, будем посмотреть
p.s. вчера ночью/вечером погонял на каких то сложных проектах с кодом - пока разницу не увидел с sol от слова совсем, будем посмотреть
😁3🥴1
Наконец-то ИИ всех заменил!
…Но пока только по бенчам.
Пробую себя в видеоконтенте - собрал краткие новости уходящей недели про ИИ.
https://youtu.be/6-5AEvhlSZc
…Но пока только по бенчам.
Пробую себя в видеоконтенте - собрал краткие новости уходящей недели про ИИ.
https://youtu.be/6-5AEvhlSZc
YouTube
GPT‑6 Astra — убийца Fable? Попробовал в работе | Новости ИИ
GPT‑6 Astra — убийца Fable или очередной громкий релиз? Попробовал Astra в своих задачах разработки: пока без вау-эффекта. В этом выпуске — новые модели, сбои AI-сервисов, Qwen, компьютеры для локальных LLM и российское регулирование ИИ.
Больше контента…
Больше контента…
5🔥8
pydantic выпустил свой фреймворк для агентов - обещан рилтайм, ембеддинги, все типизированное(пример langchain) и ваще легко просто молодежно
постараюсь сделать обзорчик в ближайшее время - по quickstart пока нравится
https://pydantic.dev/docs/ai/overview/
постараюсь сделать обзорчик в ближайшее время - по quickstart пока нравится
https://pydantic.dev/docs/ai/overview/
2🔥5
Открыл для себя написание статей через надиктовывание в чатгпт - почитал бенчи/подписки и собрал все вместе в новой статье на хабре - го читать!
https://habr.com/ru/articles/1081060/
https://habr.com/ru/articles/1081060/
🤔2👍1👎1