"Подумай довше" не завжди означає "зроби краще"
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
❤10👍5🤔2
Forwarded from KRUHLYK 🇺🇦 Чат
От тому я постійно і наголошую: не робіть всі ваші задачі на опусі чи на інших флагманських моделях. Вивчіть їх можливості спершу і визначте в яких сценаріях вашої роботи і в яких задачах варто їх застосувати.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
👍10💯7🌚1
Маю надію всі в порядку після ночі. Мене врятує тільки бідон кави сьогодні. Як ви?
❤19🤝2👌1
Пʼятниця, 8:11.
Дивлюсь на список задач.
Список задач дивиться на мене.
Поки нічия.
Памʼятаємо про заборону деплоїти сьогодні!
Дивлюсь на список задач.
Список задач дивиться на мене.
Поки нічия.
Памʼятаємо про заборону деплоїти сьогодні!
🤣18🔥2💯2👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Зі святом, моя рідна Батьківщино!
Горда, сильна, мудра і незламна!
Зі святом, українці, переможемо! 💙💛
Горда, сильна, мудра і незламна!
Зі святом, українці, переможемо! 💙💛
❤55🔥5🥰2
Forwarded from den the dev
🎧 Як я шукав загублений навушник з Claude
Дружина загубила вдома один навушник AirPods і поїхала у відпустку.
Він привʼязаний до її FindMy, тож попілікати ним не вийде - дружина вже поїхала.
Що я зробив? Попросив агента (цього разу Claude) написати утиліту, яка сканує Bluetooth діапазон, видає список усіх пристроїв: шкала з силою сигналу, приблизна відстань, ідентифікатор та можливе імʼя.
Мої пристрої відразу позначив сірими, найбільш підозрілі пристрої попросив підсвітити жовтим (пристрої епл мають характерний код в ідентифікаторів).
Походив по кімнатах з маком і знайшов цього засранця у кишені шортів серед одягу 😁
Дружина загубила вдома один навушник AirPods і поїхала у відпустку.
Він привʼязаний до її FindMy, тож попілікати ним не вийде - дружина вже поїхала.
Що я зробив? Попросив агента (цього разу Claude) написати утиліту, яка сканує Bluetooth діапазон, видає список усіх пристроїв: шкала з силою сигналу, приблизна відстань, ідентифікатор та можливе імʼя.
Мої пристрої відразу позначив сірими, найбільш підозрілі пристрої попросив підсвітити жовтим (пристрої епл мають характерний код в ідентифікаторів).
Походив по кімнатах з маком і знайшов цього засранця у кишені шортів серед одягу 😁
👏41🔥12😁7❤6🤓3