А тим часом DeepSeek викотили власний харнес — DeepSeek Harness.
Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже36 78к зірок на гітхабі.
Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.
Чотири режими з коробки:
Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів
Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.
Спробувати:
Web UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.
А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.
Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.
Іронічна деталь: у корені репозиторію DeepSeek лежить
https://github.com/deepseek-ai/deepseek-harness
Хтось уже встиг помацати?
Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже
Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.
Чотири режими з коробки:
Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів
Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.
Спробувати:
npx @deepseek-ai/dsh webWeb UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.
А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.
Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.
Іронічна деталь: у корені репозиторію DeepSeek лежить
CLAUDE.md 🤪https://github.com/deepseek-ai/deepseek-harness
Хтось уже встиг помацати?
GitHub
GitHub - deepseek-ai/deepseek-harness: DeepSeek Harness: Everything is a Plugin.
DeepSeek Harness: Everything is a Plugin. Contribute to deepseek-ai/deepseek-harness development by creating an account on GitHub.
❤4😁4
Forwarded from KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
😁21🤣7❤1👀1
KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
Дякую, клод! Краще більше нічого не роби...
🤣20😁5❤1
"Подумай довше" не завжди означає "зроби краще"
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
❤10👍5🤔2
Forwarded from KRUHLYK 🇺🇦 Чат
От тому я постійно і наголошую: не робіть всі ваші задачі на опусі чи на інших флагманських моделях. Вивчіть їх можливості спершу і визначте в яких сценаріях вашої роботи і в яких задачах варто їх застосувати.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
👍10💯7🌚1
Маю надію всі в порядку після ночі. Мене врятує тільки бідон кави сьогодні. Як ви?
❤19🤝2👌1
Пʼятниця, 8:11.
Дивлюсь на список задач.
Список задач дивиться на мене.
Поки нічия.
Памʼятаємо про заборону деплоїти сьогодні!
Дивлюсь на список задач.
Список задач дивиться на мене.
Поки нічия.
Памʼятаємо про заборону деплоїти сьогодні!
🤣18🔥2💯2👍1