very vibe coding
117 subscribers
460 photos
126 videos
13 files
974 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Только стоило написать про Claude code и дизайн, как появился официальный скилл по дизайну от Антропика
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Кино-адаптация побега роботов с серверов OpenAI
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели

К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.

По опубликованным результатам прирост местами очень серьёзный:

* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5

В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.

https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
Здесь только маленькая проблема - все цифры идут от автора скилла. А так, любопытно, конечно
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Если вы часто отлаживаете UI-анимации, и ловите проблему когда OCR клода не может понять что именно не так

Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:

1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом

В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
- Агент и человек работает в одной и той же среде: агент управляет через команды а человек видит это в реальном времени
- Внутри полноценный Chromium, а не кастрированный текстовый браузер


Установить: terminal-browser.com

Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)

@tips_ai #tools
Qwen3.8 стал хитом, и под него тут же появилась нецензурированная версия, о ней много кто писал, но есть и другие интересные варианты - например, ускоренная модель, которая выдает а пару раз больше токенов..
Я тут как раз пытался пересадить скрипт по подготовки презентаций с Клода на DeepSeek, да еще и его харнесс. Но было не особо, так как писать презентации он мог, а видеть - нет. Как Бетховен.

Так что, то, что у Дипсика появилось зрение - очень даже кстати.

https://t.me/dealerAI/1903
Кто бы это мог быть?

Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..

Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...

Вернусь пробежки, потестирую

https://t.me/vibecoding_tg/3719
Кстати, если захотите задешево попрограммировать - есть моделька от Меты - Спарк 1.2, которую можно гонять по $0,2 за выходящий токен (по цене DeepSeek Flash). Нюанс один - все данные отдаются Мета для обучения. В общем, не жалко - кого только можно обучить на таких данных? )) Разве что вайбкодера..

https://openrouter.ai/meta/muse-spark-1.2-contributor

Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..

Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
DeepSeek Pro может и хорошая модель, и харнесс интересный, но на уровне МАХ размышляет она бесконечно. 20 мин на две реплики, там, где Клод справляется за минутку, это, конечно, кого угодно из себя вывести может. Для тех, кто никуда не торопится

PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..
Попробовал в Клоде команду /doctor - сделал вывод, что харнесы для поддержания своих скриптов в порядке, чистка памяти и пр. как отдельный скилл не нужны - надо просто раз в неделю запускать доктора и все будет хорошо.
very vibe coding
Кто бы это мог быть? Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней.. Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит... Вернусь пробежки, потестирую…
Чудес не бывает. Новая моделька, которая бесплатно лежит на опенроутере, работает, но есть впечатление, что это маленькая модель. Условно, GLM Flash. На фронтир не тянет и далеко. С другой стороны, дареному коню в зубы не смотрят, есть задачки и для таких моделей…
very vibe coding
Чудес не бывает. Новая моделька, которая бесплатно лежит на опенроутере, работает, но есть впечатление, что это маленькая модель. Условно, GLM Flash. На фронтир не тянет и далеко. С другой стороны, дареному коню в зубы не смотрят, есть задачки и для таких…
Ну да, все больше свидетельств, что бесплатная модель в опенроутере - GLM 5.3 Flash. Конечно, ни с каким Sol она не конкурирует. Главный конкурент DeepSeek V4 Flash. Думаю, именно это заставило Дипсик мальца сбросить цены.

Эти модели интересны тем, что на них можно посадить несложные рутинные задачи или такие вещи как построение онтологий и графов. Маленькие модели не справляются, большие - дорого.

У меня сейчас подписка на GLM за $60 - в принципе, GLM 5.3 нормальная модель, использую ее, но токенов маловато - OpenAI щедрее, их подписка в этом плане самая большая. Думал снизить лимит до $20, но посмотрю на флэш и там буду решать.

PS. Использую разные модели для проверки друг друга - нравится мне эта тема, разные нейронки находят разные ошибки
Завтра вечером сбросят лимиты Кодекса, так что можно сегодня гонять gpt на максималках
В твиттере уже какое-то время прогревается история про модель SubQ, которая обещает решить проблему квадратичного масштабирования контекста, а значит, помимо длинны конекста, еще и скорости и цены токенов. Сейчас открыли запись на тестирование модели. И если это действительно прорыв, думаю, скоро мы все об этом услышим. Это может быть действительно геймченжером
Пошел слушок, что новый мак мини запустят в сентябре. У Apple были планы в младшую версию ставить М6 - это интересно, но самое интересное для меня, сколько будут стоить большие версии, на которых можно гонять Qwen 3.8 27B и DeepSeek v4 Flash..