Forwarded from Anton
⚡️Писати дипломні через Claude тепер майже неможливо: зʼявилися в текстах невидимі водяні знаки
Anthropic з 2 серпня почала впроваджувати невидиме маркування текстів, створених Claude. Людина його не побачить, але спеціальні системи зможуть це визначити.
Зображення та файли також отримуватимуть C2PA-метадані про походження.
Телеграмна служба новин | Підписатися
Anthropic з 2 серпня почала впроваджувати невидиме маркування текстів, створених Claude. Людина його не побачить, але спеціальні системи зможуть це визначити.
Зображення та файли також отримуватимуть C2PA-метадані про походження.
Телеграмна служба новин | Підписатися
🥴10🤔7🔥4
Чекали Gemini 3.5 Pro? Ну чекайте далі. Скоріше за все ви побачите Gemini 4, ніж оновлену прошку.
А поки насолоджуйтесь релізом чергової флешки😅 Gemini 3.7 Flash.
Ціна залишилася попередньою ($0.75 in / $3.75 out за 1M), але продуктивність суттєво зросла.
Основне:
* AA Intelligence Index: 56 (проти 52 у 3.6)
Кодинг та термінал:
* FrontierCode 1.1: 43.6% | DeepSWE v1.1: 65.3%
* Code Arena: 1588 Elo | Terminal-bench 2.1: 85.8% | Terminal-bench 3.0: 14.9%
Агенти та ПК:
* AutomationBench: 30.4% | OSWorld-2.0: 47.9% | Agent's Last Exam: 26.3%
Аналітика, legal та PDF:
* GDPVal-AA v2: 1525 Elo | Harvey LAB-AA: 90.7%
* GDP.pdf: 34.0% | HLE-Verified: 53.6%
Мультимодальність та контекст:
* CharXiv: 84.5% (88.7% з tools) | LVBench: 85.4%
* GDM-MRCR v2 (128k avg): 97.0%
Наука:
* BioMysteryBench: 87.1% (solvable) / 43.5% (difficult) | LABBench2: 82.1%
Головний буст — кодинг, термінальні агенти та довгий контекст за ті самі гроші.
А поки насолоджуйтесь релізом чергової флешки😅 Gemini 3.7 Flash.
Ціна залишилася попередньою ($0.75 in / $3.75 out за 1M), але продуктивність суттєво зросла.
Основне:
* AA Intelligence Index: 56 (проти 52 у 3.6)
Кодинг та термінал:
* FrontierCode 1.1: 43.6% | DeepSWE v1.1: 65.3%
* Code Arena: 1588 Elo | Terminal-bench 2.1: 85.8% | Terminal-bench 3.0: 14.9%
Агенти та ПК:
* AutomationBench: 30.4% | OSWorld-2.0: 47.9% | Agent's Last Exam: 26.3%
Аналітика, legal та PDF:
* GDPVal-AA v2: 1525 Elo | Harvey LAB-AA: 90.7%
* GDP.pdf: 34.0% | HLE-Verified: 53.6%
Мультимодальність та контекст:
* CharXiv: 84.5% (88.7% з tools) | LVBench: 85.4%
* GDM-MRCR v2 (128k avg): 97.0%
Наука:
* BioMysteryBench: 87.1% (solvable) / 43.5% (difficult) | LABBench2: 82.1%
Головний буст — кодинг, термінальні агенти та довгий контекст за ті самі гроші.
🔥6😁4👍1
А тим часом DeepSeek викотили власний харнес — DeepSeek Harness.
Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже36 78к зірок на гітхабі.
Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.
Чотири режими з коробки:
Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів
Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.
Спробувати:
Web UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.
А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.
Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.
Іронічна деталь: у корені репозиторію DeepSeek лежить
https://github.com/deepseek-ai/deepseek-harness
Хтось уже встиг помацати?
Відкрили код вчора, разом із релізом V4-Pro. Ліцензія MIT, версія 0.1. За добу вже
Головна ідея одним рядком: усе — це плагін. І не тільки моделі з інструментами, а взагалі все — реєстр тулів, лог сесії і навіть сам agent loop. Привілейованого ядра там просто немає, будь-що міняється конфігом без форку. Під капотом ядро Cordis.
Чотири режими з коробки:
Standard — повний тулсет: файли, shell, пошук, skills, планування, субагенти
Code — інструменти віддаються моделі через SDK, і вона пише одну TypeScript-програму замість серії викликів
Minimal — тільки bash + str_replace_editor, для бенчмарків
Creator — інспекція рантайму і збірка власних пресетів
Ще одна річ, яка мені зайшла — append-only лог сесії. Все, що бачила модель (системний промпт, reasoning, виклики тулів, ін'єкції контексту), реконструюється з одного потоку подій. Resume, fork, пошук і replay працюють поверх нього.
Спробувати:
npx @deepseek-ai/dsh webWeb UI підніметься на 127.0.0.1:3080, з залежностей — тільки Node.js. Ключ до речі не обов'язково дипсіковський, підтримуються OpenAI-сумісні ендпоінти.
А тепер тверезо. Це developer preview, у README капсом написано, що сумісність ламатимуть. Формат сесій — версія 0 без жодних обіцянок. TUI як у Claude Code немає, тільки веб і headless для CI. Тобто погратись — так, тягнути в бойовий проєкт — зарано.
Але сама ідея нормальна: це спроба стандартизувати шар під агентом і зробити його vendor-neutral. llm-адаптер там такий самий плагін, як усе решта.
Іронічна деталь: у корені репозиторію DeepSeek лежить
CLAUDE.md 🤪https://github.com/deepseek-ai/deepseek-harness
Хтось уже встиг помацати?
GitHub
GitHub - deepseek-ai/deepseek-harness: DeepSeek Harness: Everything is a Plugin.
DeepSeek Harness: Everything is a Plugin. Contribute to deepseek-ai/deepseek-harness development by creating an account on GitHub.
❤4😁4
Forwarded from KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
😁21🤣7❤1👀1
KRUHLYK 🇺🇦 Чат
Доречі про Тянанмень і Вінні Пуха. Ніколи, чуєте НІКОЛИ не просіть клода щось малювати. На прохання намалювати Вінні Поха та Похтачка в стилі діснеєвського мульта малює таке.
Дякую, клод! Краще більше нічого не роби...
🤣20😁5❤1
"Подумай довше" не завжди означає "зроби краще"
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
Логіка ніби очевидна: більше reasoning effort — краща відповідь. Так і рекламують. І в більшості задач це правда працює.
Але є дослідження FutureSearch, де топові моделі прогнали через Deep Research Bench на різних рівнях effort. Результат неприємний: у трьох моделей з чотирьох high effort дав такий самий або гірший результат, ніж low. При цьому в рази дорожче.
Що там насправді відбувається
Модель не витрачає зайвий бюджет розумно. Вона:
- починає сумніватись у вже правильній відповіді
- тягне з собою дедалі маячніші джерела
- застережує там, де і так все очевидно
Простими словами: чим довше вона думає, тим більше знаходить приводів собі не довіряти.
Те саме і в агентних задачах
На SWE-bench помітили той самий патерн у reasoning-моделей: замість того щоб перевірити щось на практиці, модель нескінченно розмірковує. Або починає робити зайві дії "про всяк випадок". Або занадто рано здається, вирішивши, що задача нерозв'язна.
І це сильніше саме у моделей з великим бюджетом мислення, а не у звичайних.
Чому це не просто цікавинка
Якщо ганяєте агентів у роботі — точно бачили, як модель на максимальному thinking раптом починає перевіряти нешкідливий код так, ніби там підступ. Тепер є пояснення чому.
Висновок простий: максимальний effort не дорівнює максимальна якість. Іноді розумніше — це коротше.
А у вас таке ловилось на high effort? Діліться в коментах.
❤10👍5🤔2
Forwarded from KRUHLYK 🇺🇦 Чат
От тому я постійно і наголошую: не робіть всі ваші задачі на опусі чи на інших флагманських моделях. Вивчіть їх можливості спершу і визначте в яких сценаріях вашої роботи і в яких задачах варто їх застосувати.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
Скоріше за все в переважній більшості вашої роботи впорається умовний сонет.
👍10💯7🌚1