KRUHLYK 🇺🇦
1.33K subscribers
867 photos
88 videos
7 files
356 links
Download Telegram
Чекали Gemini 3.5 Pro? Ну чекайте далі. Скоріше за все ви побачите Gemini 4, ніж оновлену прошку.

А поки насолоджуйтесь релізом чергової флешки😅 Gemini 3.7 Flash.

Ціна залишилася попередньою ($0.75 in / $3.75 out за 1M), але продуктивність суттєво зросла.

Основне:
* AA Intelligence Index: 56 (проти 52 у 3.6)

Кодинг та термінал:
* FrontierCode 1.1: 43.6% | DeepSWE v1.1: 65.3%
* Code Arena: 1588 Elo | Terminal-bench 2.1: 85.8% | Terminal-bench 3.0: 14.9%

Агенти та ПК:
* AutomationBench: 30.4% | OSWorld-2.0: 47.9% | Agent's Last Exam: 26.3%

Аналітика, legal та PDF:
* GDPVal-AA v2: 1525 Elo | Harvey LAB-AA: 90.7%
* GDP.pdf: 34.0% | HLE-Verified: 53.6%

Мультимодальність та контекст:
* CharXiv: 84.5% (88.7% з tools) | LVBench: 85.4%
* GDM-MRCR v2 (128k avg): 97.0%

Наука:
* BioMysteryBench: 87.1% (solvable) / 43.5% (difficult) | LABBench2: 82.1%

Головний буст — кодинг, термінальні агенти та довгий контекст за ті самі гроші.
🔥6😁4👍1
Що по каві, народ? З пʼятницею!
👍9❤2🤷‍♀1
А тим часом DeepSeek викотили власний харнес — DeepSeek Harness.

Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже 36 78к зірок на гітхабі.

Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.

Чотири режими з коробки:

Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів

Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.

Спробувати:
npx @deepseek-ai/dsh web

Web UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.

А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.

Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.

Іронічна деталь: у корені репозиторію DeepSeek лежить CLAUDE.md 🤪

https://github.com/deepseek-ai/deepseek-harness

Хтось уже встиг помацати?
❤4😁4
Forwarded from KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
😁21🤣7❤1👀1
Прошу клод код виконати задачу в декілька агентів.

Тим часом клод код:
😁24🤣6💯4❤1
Господи, яке ж дно від тих, хто навіть не це робив, а затверджував в друк і виготовлення реклами🤦‍♂️🤦‍♂️🤦‍♂️

Slop Life дизайнери більше не потрібні
😁44🤣1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4
«…літр кофє і рулєт», якщо розумієте про що я 🫠
Ета новий дєнь в епаааам.

Щось на ностальгію потягнуло сьогодні.
Раночку всім і приємного початку тижня!
😁15
This media is not supported in your browser
VIEW IN TELEGRAM
💯7🤔2💊1
This media is not supported in your browser
VIEW IN TELEGRAM
💊2
This media is not supported in your browser
VIEW IN TELEGRAM
👍4💊1
This media is not supported in your browser
VIEW IN TELEGRAM
👍4💊1
This media is not supported in your browser
VIEW IN TELEGRAM
👍3💊1
"Подумай довше" не завжди означає "зроби краще"

Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.

Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.

Що там насправді відбувається

Модель не витрачає зайвий бюджет розумно. Вона:

- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно

Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.

Те саме і в агентних задачах

На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.

І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.

Чому це не просто цікавинка

Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.

Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.

А у вас таке ловилось на high effort? Діліться в коментах.
❤10👍5🤔2
Forwarded from KRUHLYK 🇺🇦 Чат
От тому я постійно і наголошую: не робіть всі ваші задачі на опусі чи на інших флагманських моделях. Вивчіть їх можливості спершу і визначте в яких сценаріях вашої роботи і в яких задачах варто їх застосувати.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
👍10💯7🌚1
Маю надію всі в порядку після ночі. Мене врятує тільки бідон кави сьогодні. Як ви?
❤19🤝2👌1
Поки агенти працюють…
🔥24👏1😁1
Отак станом на сьогодні я уявляю тих програмістів, які кажуть, що з презирством ставляться до шішки і писатисуть код виключно руками.

Вибачте 🙈

ПиСи: це він у 1986 році чекає поки винайдуть порнхаб
😁19❤5💩1
Курвісімо. В 2 рази зростання ціни. Як вам такий мув?🫠
💔27💩4🤮1