KRUHLYK 🇺🇦
1.33K subscribers
867 photos
88 videos
7 files
356 links
Download Telegram
А тим часом DeepSeek викотили власний харнес — DeepSeek Harness.

Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже 36 78к зірок на гітхабі.

Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.

Чотири режими з коробки:

Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів

Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.

Спробувати:
npx @deepseek-ai/dsh web

Web UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.

А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.

Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.

Іронічна деталь: у корені репозиторію DeepSeek лежить CLAUDE.md 🤪

https://github.com/deepseek-ai/deepseek-harness

Хтось уже встиг помацати?
❤4😁4
Forwarded from KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
😁21🤣7❤1👀1
Прошу клод код виконати задачу в декілька агентів.

Тим часом клод код:
😁24🤣6💯4❤1
Господи, яке ж дно від тих, хто навіть не це робив, а затверджував в друк і виготовлення реклами🤦‍♂️🤦‍♂️🤦‍♂️

Slop Life дизайнери більше не потрібні
😁44🤣1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4
«…літр кофє і рулєт», якщо розумієте про що я 🫠
Ета новий дєнь в епаааам.

Щось на ностальгію потягнуло сьогодні.
Раночку всім і приємного початку тижня!
😁15
This media is not supported in your browser
VIEW IN TELEGRAM
💯7🤔2💊1
This media is not supported in your browser
VIEW IN TELEGRAM
💊2
This media is not supported in your browser
VIEW IN TELEGRAM
👍4💊1
This media is not supported in your browser
VIEW IN TELEGRAM
👍4💊1
This media is not supported in your browser
VIEW IN TELEGRAM
👍3💊1
"Подумай довше" не завжди означає "зроби краще"

Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.

Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.

Що там насправді відбувається

Модель не витрачає зайвий бюджет розумно. Вона:

- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно

Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.

Те саме і в агентних задачах

На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.

І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.

Чому це не просто цікавинка

Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.

Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.

А у вас таке ловилось на high effort? Діліться в коментах.
❤10👍5🤔2
Forwarded from KRUHLYK 🇺🇦 Чат
От тому я постійно і наголошую: не робіть всі ваші задачі на опусі чи на інших флагманських моделях. Вивчіть їх можливості спершу і визначте в яких сценаріях вашої роботи і в яких задачах варто їх застосувати.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
👍10💯7🌚1
Маю надію всі в порядку після ночі. Мене врятує тільки бідон кави сьогодні. Як ви?
❤19🤝2👌1
Поки агенти працюють…
🔥24👏1😁1
Отак станом на сьогодні я уявляю тих програмістів, які кажуть, що з презирством ставляться до шішки і писатисуть код виключно руками.

Вибачте 🙈

ПиСи: це він у 1986 році чекає поки винайдуть порнхаб
😁19❤5💩1
Курвісімо. В 2 рази зростання ціни. Як вам такий мув?🫠
💔27💩4🤮1
Пʼятниця, 8:11.
Дивлюсь на список задач.
Список задач дивиться на мене.
Поки нічия.

Памʼятаємо про заборону деплоїти сьогодні!
🤣18🔥2💯2👍1
This media is not supported in your browser
VIEW IN TELEGRAM
👍9