Перед началом эксперимента мне казалось, что результат будет примерно одинаковым или чуть лучше у маленьких моделей с высоким уровнем рассуждений, но на моих задачах получилось довольно неожиданно.
Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.
Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.
Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.
Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.
Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
Кейс 1: внести небольшие правки в код. Качество одинаковое, но Terra закончила задачу за 54 секунды, а Luna за 134 секунды. Terra использовала 111k токенов, а Luna 211k.
Кейс 2: большая задача по изменению бизнес-логики в среднем сервисе. Terra High 6,83/10, Sol Low 9,50/10. Sol Low оказался качественнее, быстрее и потратил в 2,5 раза меньше токенов.
Кейс 3: большая задача. Написать большой сервис, включая Bluetooth-логику и математику. По качеству результаты оказались довольно близкими, но Luna даже не стала запускать рантайм. Luna High 5,70/10, Sol Medium 6,63/10.
Какой тут можно сделать вывод?
Похоже, что небольшие модели имеют смысл только с low/medium уровнем рассуждений. Всё-таки лучше взять модель побольше, но с меньшим уровнем рассуждений. Она работает быстрее и дешевле.
Также есть вопросы к передовым моделям, например, к Soul 5.6 Ultra. Возникает ощущение, что они чуть лучше показывают себя на бенчмарках, а в реальных задачах не дают настолько большого прироста пользы. Но это уже тема отдельного поста.
1🤔4❤1
Описал интересный кейс с работы - когда разработка пошла как будто с конца в начало - все началось не с требований а с навайбкоженного сервиса который потом пришлось приводить в порядок
https://habr.com/ru/articles/1076140/
p.s. моя первая статья на хабре - поддержите up-ами🙈
https://habr.com/ru/articles/1076140/
p.s. моя первая статья на хабре - поддержите up-ами
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥7
openai дропнули астру https://openai.com/index/gpt-6-astra/
p.s. вчера ночью/вечером погонял на каких то сложных проектах с кодом - пока разницу не увидел с sol от слова совсем, будем посмотреть
p.s. вчера ночью/вечером погонял на каких то сложных проектах с кодом - пока разницу не увидел с sol от слова совсем, будем посмотреть
😁4🥴1
Наконец-то ИИ всех заменил!
…Но пока только по бенчам.
Пробую себя в видеоконтенте - собрал краткие новости уходящей недели про ИИ.
https://youtu.be/6-5AEvhlSZc
…Но пока только по бенчам.
Пробую себя в видеоконтенте - собрал краткие новости уходящей недели про ИИ.
https://youtu.be/6-5AEvhlSZc
YouTube
GPT‑6 Astra — убийца Fable? Попробовал в работе | Новости ИИ
GPT‑6 Astra — убийца Fable или очередной громкий релиз? Попробовал Astra в своих задачах разработки: пока без вау-эффекта. В этом выпуске — новые модели, сбои AI-сервисов, Qwen, компьютеры для локальных LLM и российское регулирование ИИ.
Больше контента…
Больше контента…
5🔥9
pydantic выпустил свой фреймворк для агентов - обещан рилтайм, ембеддинги, все типизированное(а не как в langchain) и ваще легко просто молодежно
постараюсь сделать обзорчик в ближайшее время - по quickstart пока нравится
https://pydantic.dev/docs/ai/overview/
постараюсь сделать обзорчик в ближайшее время - по quickstart пока нравится
https://pydantic.dev/docs/ai/overview/
2🔥6
Открыл для себя написание статей через надиктовывание в чатгпт - почитал бенчи/подписки и собрал все вместе в новой статье на хабре - го читать!
https://habr.com/ru/articles/1081060/
https://habr.com/ru/articles/1081060/
1🤔3👍2🍌1
Тут неожиданно приехала пачка любопытных новостей
Исследователь Jacob Coxon ушёл из Anthropic, заявив, что компания и OpenAI слишком быстро движутся к самоулучшающемуся ИИ и рискуют безопасностью человечества - выглядит немного странно - немного отдаёт PR-ходом.
Дарио Амодеи призвал замедлить развитие передовых моделей. Предлагает независимых проверяющих внутри лабораторий и согласованные ограничения для крупных ИИ-игроков, чтобы безопасность успевала за возможностями ИИ - в свете последних успехов OpenAI тоже есть сомнения в искренности.
Сэм Альтман исключил IPO OpenAI в 2026 году, сославшись на вопросы безопасности ИИ - по интернету уже гуляет гипотеза, что IPO = раскрытие финансов, с которыми у OpenAI может быть не всё так гладко (моя статья частично про это).
Трамп выступил против замедления: США должны сохранить преимущество перед Китаем, потому что «кто победит в ИИ, тот победит во всём остальном» - как ни странно - кажется самым «искренним», если можно так сказать - типа «не знаю чё там у вас за дела - ничего тормозить не будем, боремся за господство с Китаем» - вполне в его духе.
Я активно работаю с Astra и какого-то AGI на практике пока не вижу от слова совсем - галлюцинации/600 тестов проходят, но не ловят баги/удаление/затирание error-логов при запросе фиксить ошибки - всё на месте. Бенчи Astra, где они всех на голову выше, - на практике пока не особо чувствуются, а учитывая недавний хайп с тем, что Fable отменили из-за угроз человечеству, - а на практике опять же никакого вау-эффекта в комьюнити не обнаружилось, а также «голливудская» история про рой агентов, взломавший что-то там, и алармизм в отношении «роя» агентов (интересно, во сколько встанет этот рой с текущими ценами по API на те же Fable) - учитывая сокращающееся отставание открытых моделей, звучащие очень странно, - короче, похоже это всё на какой-то набор маркетинговых и финансовых трюков, чем на AGI.
Исследователь Jacob Coxon ушёл из Anthropic, заявив, что компания и OpenAI слишком быстро движутся к самоулучшающемуся ИИ и рискуют безопасностью человечества - выглядит немного странно - немного отдаёт PR-ходом.
Дарио Амодеи призвал замедлить развитие передовых моделей. Предлагает независимых проверяющих внутри лабораторий и согласованные ограничения для крупных ИИ-игроков, чтобы безопасность успевала за возможностями ИИ - в свете последних успехов OpenAI тоже есть сомнения в искренности.
Сэм Альтман исключил IPO OpenAI в 2026 году, сославшись на вопросы безопасности ИИ - по интернету уже гуляет гипотеза, что IPO = раскрытие финансов, с которыми у OpenAI может быть не всё так гладко (моя статья частично про это).
Трамп выступил против замедления: США должны сохранить преимущество перед Китаем, потому что «кто победит в ИИ, тот победит во всём остальном» - как ни странно - кажется самым «искренним», если можно так сказать - типа «не знаю чё там у вас за дела - ничего тормозить не будем, боремся за господство с Китаем» - вполне в его духе.
Я активно работаю с Astra и какого-то AGI на практике пока не вижу от слова совсем - галлюцинации/600 тестов проходят, но не ловят баги/удаление/затирание error-логов при запросе фиксить ошибки - всё на месте. Бенчи Astra, где они всех на голову выше, - на практике пока не особо чувствуются, а учитывая недавний хайп с тем, что Fable отменили из-за угроз человечеству, - а на практике опять же никакого вау-эффекта в комьюнити не обнаружилось, а также «голливудская» история про рой агентов, взломавший что-то там, и алармизм в отношении «роя» агентов (интересно, во сколько встанет этот рой с текущими ценами по API на те же Fable) - учитывая сокращающееся отставание открытых моделей, звучащие очень странно, - короче, похоже это всё на какой-то набор маркетинговых и финансовых трюков, чем на AGI.
AP News
Anthropic researcher resigns with warning about the dangers of AI development
An Anthropic researcher is resigning over concerns about irresponsible development of artificial intelligence.
51🔥6
Сегодня в 19-00 проведу воркшоп для ВШМ где читаю курс по агентам
поразгоняем про типичные проблемы доведения агентов до прода
поразгоняем про типичные проблемы доведения агентов до прода
52❤8
Яндекс выложили веса большой АлисыAi -
https://kod.ru/yandex-alice-ai-foundation
видимо ответ Грефу не его пассаж - посмотрим на независимые бенчи и разборы, пока только новость от самого Яндекса
https://kod.ru/yandex-alice-ai-foundation
видимо ответ Грефу не его пассаж - посмотрим на независимые бенчи и разборы, пока только новость от самого Яндекса
53👍4
шутка про то что дешевле нанять джуна начинает выходить из под контроля...
https://www.kucoin.com/news/flash/openai-rumored-to-launch-500-chatgpt-pro-max-tier
https://www.kucoin.com/news/flash/openai-rumored-to-launch-500-chatgpt-pro-max-tier
51😨5
Запускаю сoding agents contest
В двух словах:
Оценивается харнес (все запускается на DeepSeek V4.1 Flash).
В лидербордах для примера:
— Популярные кодинг-агенты
— Мой демо-агент с курса
— Чебупелька
🎁 Из призов:
1. Три коллекционных подарка в Telegram (подробнее)
2. Промокоды на скидку -40% на любую программу ШВМ или SHAD Helper.
Можно выбрать любую программу: от создания AI-агентов до подготовки к поступлению в ШАД.
За деталями: @academic_guidance_shvm
⚙️ По самим агентам:
Буду отсматривать вручную. Можно допиливать опенсорс, можно делать с нуля — можно почти что угодно, кроме copy-paste 1-в-1.
🔗 Ссылка: https://planerverse.ru/
всем удачи!
В двух словах:
Оценивается харнес (все запускается на DeepSeek V4.1 Flash).
В лидербордах для примера:
— Популярные кодинг-агенты
— Мой демо-агент с курса
— Чебупелька
🎁 Из призов:
1. Три коллекционных подарка в Telegram (подробнее)
2. Промокоды на скидку -40% на любую программу ШВМ или SHAD Helper.
Можно выбрать любую программу: от создания AI-агентов до подготовки к поступлению в ШАД.
За деталями: @academic_guidance_shvm
⚙️ По самим агентам:
Буду отсматривать вручную. Можно допиливать опенсорс, можно делать с нуля — можно почти что угодно, кроме copy-paste 1-в-1.
🔗 Ссылка: https://planerverse.ru/
всем удачи!
1🔥7