Forwarded from Machine learning Interview
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.
По опубликованным результатам прирост местами очень серьёзный:
* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5
В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.
https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
Здесь только маленькая проблема - все цифры идут от автора скилла. А так, любопытно, конечно
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Если вы часто отлаживаете UI-анимации, и ловите проблему когда OCR клода не может понять что именно не так
Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:
1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом
В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
Установить: terminal-browser.com
Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)
@tips_ai #tools
Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:
1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом
В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
- Агент и человек работает в одной и той же среде: агент управляет через команды а человек видит это в реальном времени
- Внутри полноценный Chromium, а не кастрированный текстовый браузер
Установить: terminal-browser.com
Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)
@tips_ai #tools
Qwen3.8 стал хитом, и под него тут же появилась нецензурированная версия, о ней много кто писал, но есть и другие интересные варианты - например, ускоренная модель, которая выдает а пару раз больше токенов..
inco.ai
DFlash 2: Keep Drafting Parallel
DFlash 2 is the successor to our widely deployed parallel drafter: close to 3× the speed of autoregressive decoding, with the same output. Drafters for Qwen3.8-27B and Meta's Muse Glimmer are out today.
Я тут как раз пытался пересадить скрипт по подготовки презентаций с Клода на DeepSeek, да еще и его харнесс. Но было не особо, так как писать презентации он мог, а видеть - нет. Как Бетховен.
Так что, то, что у Дипсика появилось зрение - очень даже кстати.
https://t.me/dealerAI/1903
Так что, то, что у Дипсика появилось зрение - очень даже кстати.
https://t.me/dealerAI/1903
Telegram
Dealer.AI
DeepSeek выпустил мультимодальную модель для агентов. 🪨
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность…
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность…
Кто бы это мог быть?
Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..
Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...
Вернусь пробежки, потестирую
https://t.me/vibecoding_tg/3719
Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..
Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...
Вернусь пробежки, потестирую
https://t.me/vibecoding_tg/3719
Telegram
Вайб-кодинг
В OpenCode и OpenRouter появилась загадочная новая ИИ-модель: Ox Alpha 👍
Ее уже прогнали через 10 задач DeepSWE, и она набрала больше 80% против 65% у Fable и 52% у GPT-5.6 Sol.
Модель предлагает контекстное окно на 1 млн токенов, мультимодальные возможности…
Ее уже прогнали через 10 задач DeepSWE, и она набрала больше 80% против 65% у Fable и 52% у GPT-5.6 Sol.
Модель предлагает контекстное окно на 1 млн токенов, мультимодальные возможности…
Ну что, надо попробовать?
https://t.me/vibecoding_tg/3726
PS поставил, пашет нормально. про силу модели, правда, пока сказать тяжело
Говорят, это новая GLM-5.X, даром что 5.3 только что обновилась
https://t.me/vibecoding_tg/3726
PS поставил, пашет нормально. про силу модели, правда, пока сказать тяжело
Говорят, это новая GLM-5.X, даром что 5.3 только что обновилась
Telegram
Вайб-кодинг
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной…
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной…
Кстати, если захотите задешево попрограммировать - есть моделька от Меты - Спарк 1.2, которую можно гонять по $0,2 за выходящий токен (по цене DeepSeek Flash). Нюанс один - все данные отдаются Мета для обучения. В общем, не жалко - кого только можно обучить на таких данных? )) Разве что вайбкодера..
https://openrouter.ai/meta/muse-spark-1.2-contributor
Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..
Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
https://openrouter.ai/meta/muse-spark-1.2-contributor
Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..
Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
openrouter.ai
Muse Spark 1.2 Contributor - API Pricing & Providers
Muse Spark 1.2 contributor tier is a reasoning model from Meta designed for developers who want to start building at an even lower cost. $0.10 per million input tokens, $0.20 per million output tokens. 1,048,576 token context window.
DeepSeek Pro может и хорошая модель, и харнесс интересный, но на уровне МАХ размышляет она бесконечно. 20 мин на две реплики, там, где Клод справляется за минутку, это, конечно, кого угодно из себя вывести может. Для тех, кто никуда не торопится
PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..
PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..
Попробовал в Клоде команду /doctor - сделал вывод, что харнесы для поддержания своих скриптов в порядке, чистка памяти и пр. как отдельный скилл не нужны - надо просто раз в неделю запускать доктора и все будет хорошо.
very vibe coding
Кто бы это мог быть? Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней.. Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит... Вернусь пробежки, потестирую…
Чудес не бывает. Новая моделька, которая бесплатно лежит на опенроутере, работает, но есть впечатление, что это маленькая модель. Условно, GLM Flash. На фронтир не тянет и далеко. С другой стороны, дареному коню в зубы не смотрят, есть задачки и для таких моделей…
Дипсик использовать можно и нужно, даже когда есть подписка на Клода или ГПТ. С одной оговоркой - все что можно, гоняйте на DeepSeek Flash. Модель неплоха и радикально дешевле про версии
https://t.me/vibecoding_tg/3734
https://t.me/vibecoding_tg/3734
Telegram
Вайб-кодинг
DeepSeek снова меняет цены на API — теперь по выходным весь день будут действовать сниженные тарифы.
DeepSeek объявила, что с 23 августа правила тарификации в пиковые и непиковые часы будут изменены.
По субботам и воскресеньям пиковые и непиковые периоды…
DeepSeek объявила, что с 23 августа правила тарификации в пиковые и непиковые часы будут изменены.
По субботам и воскресеньям пиковые и непиковые периоды…
very vibe coding
Чудес не бывает. Новая моделька, которая бесплатно лежит на опенроутере, работает, но есть впечатление, что это маленькая модель. Условно, GLM Flash. На фронтир не тянет и далеко. С другой стороны, дареному коню в зубы не смотрят, есть задачки и для таких…
Ну да, все больше свидетельств, что бесплатная модель в опенроутере - GLM 5.3 Flash. Конечно, ни с каким Sol она не конкурирует. Главный конкурент DeepSeek V4 Flash. Думаю, именно это заставило Дипсик мальца сбросить цены.
Эти модели интересны тем, что на них можно посадить несложные рутинные задачи или такие вещи как построение онтологий и графов. Маленькие модели не справляются, большие - дорого.
У меня сейчас подписка на GLM за $60 - в принципе, GLM 5.3 нормальная модель, использую ее, но токенов маловато - OpenAI щедрее, их подписка в этом плане самая большая. Думал снизить лимит до $20, но посмотрю на флэш и там буду решать.
PS. Использую разные модели для проверки друг друга - нравится мне эта тема, разные нейронки находят разные ошибки
Эти модели интересны тем, что на них можно посадить несложные рутинные задачи или такие вещи как построение онтологий и графов. Маленькие модели не справляются, большие - дорого.
У меня сейчас подписка на GLM за $60 - в принципе, GLM 5.3 нормальная модель, использую ее, но токенов маловато - OpenAI щедрее, их подписка в этом плане самая большая. Думал снизить лимит до $20, но посмотрю на флэш и там буду решать.
PS. Использую разные модели для проверки друг друга - нравится мне эта тема, разные нейронки находят разные ошибки
Завтра вечером сбросят лимиты Кодекса, так что можно сегодня гонять gpt на максималках
В твиттере уже какое-то время прогревается история про модель SubQ, которая обещает решить проблему квадратичного масштабирования контекста, а значит, помимо длинны конекста, еще и скорости и цены токенов. Сейчас открыли запись на тестирование модели. И если это действительно прорыв, думаю, скоро мы все об этом услышим. Это может быть действительно геймченжером
very vibe coding
Завтра вечером сбросят лимиты Кодекса, так что можно сегодня гонять gpt на максималках
Сбросили, как и обещали ))
Пошел слушок, что новый мак мини запустят в сентябре. У Apple были планы в младшую версию ставить М6 - это интересно, но самое интересное для меня, сколько будут стоить большие версии, на которых можно гонять Qwen 3.8 27B и DeepSeek v4 Flash..
Видимо, скоро нас ждет Haiku 5 и еще одна новая модель. С хайку давно пора что-то делать, да и Соннет вышел совсем неудачным - вместо дешевых моделей Антропика я использую GLM, DeepSeek или GPT Luna.
Если интересуетесь разговорными агентами, например, для организации службы поддержки, посмотрите на Grok Voice Think Fast 2.0 - видимо, это новая SOTA
И, кстати, все в восторге от Grok Bot - скоро начнется его массовое копирование на других платформах
И, кстати, все в восторге от Grok Bot - скоро начнется его массовое копирование на других платформах
x.ai
Introducing Grok Voice Think Fast 2.0
Introducing our most capable speech-to-speech voice model.
В продолжение поста про Grok bot..
Официально он работает только на подписке за 200 баксов.
https://t.me/vibecoding_tg/3742
Официально он работает только на подписке за 200 баксов.
https://t.me/vibecoding_tg/3742
Telegram
Вайб-кодинг
Мем дня: Grok Bot случайно полностью стал открытым. 🤣
После истории с утечкой Claude Code я уже думал, что абсурднее быть не может. Но на днях, разработчик обнаружил, что официальный релиз Grok Bot 0.18.0 вышел вместе с картами исходного кода.
Он прошёл…
После истории с утечкой Claude Code я уже думал, что абсурднее быть не может. Но на днях, разработчик обнаружил, что официальный релиз Grok Bot 0.18.0 вышел вместе с картами исходного кода.
Он прошёл…