very vibe coding
117 subscribers
460 photos
126 videos
13 files
975 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Смешно. Кому нужна Google 3.7 Flash, которая стоит больше DeepSeek V4 Pro, и кто о ней вообще вспомнит через полгода…

Я пользовался flash полгода назад, но это было до DeepSeek… сейчас это просто лишено смысла

https://t.me/ai_machinelearning_big_data/10703
GLM-5.3 вышла. Не только лучше 5.2, но и лучше Kimi K3. Потестим
Google банит пользователей из России по информации об их эккаунте, поэтому и впн не помогает. Можно, конечно, новые эккаунты создавать, но оно надо? Лично я для себя тоже Google забанил, с начала лета. Нисколечко не страдаю..

https://t.me/data_analysis_ml/5600
В течение двух часов выйдет Qwen 3.8 27B - лучшая модель, которую можно запустить на базовом Mac Studio или мощной прошке. Это я авансом, но сильно сомневаться не приходится, конкурентов не сказать, чтобы было много..
🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы.

Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:

• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling

Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.

sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.

MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.

Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.

А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.

То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.

https://github.com/deepseek-ai/deepseek-harness
Интересная история - Антропик выпустил приложение Дизайн для рисования презентаций, я вроде как его освоил, но по привычке продолжал работать с Клод-кодом. И там тоже стали выходить нормальные презентации - я думал поначалу, что это дизайн был подключен, но нет, это разные продукты.

Суть в том, что дизайн рисует в html - и дальше либо вы используете pdf либо будет не самый простой перевод в паверпойнт. А клод-код кодирует презентацию на питоне сразу в паверпойнте. Поэтому если надо быстрее, красивее и пдф - норм, берите дизайн. Или если надо какую-то новую сложную мульку нарисовать. Если надо редактируемую презентацию - идите срузу в код.

Сделайте свой скилл для презентаций. Дайте примеры. Будете экономить время на ошибках. Потребует, конечно, какого-то времени - у меня сейчас кода 5 тыс. строк, но оно стоит того.
Только стоило написать про Claude code и дизайн, как появился официальный скилл по дизайну от Антропика
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Кино-адаптация побега роботов с серверов OpenAI
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели

К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use.

По опубликованным результатам прирост местами очень серьёзный:

* Terminal Bench: 87.9 → 90.1
* NL2Repo: 61.5 → 73.4
* CyberGym: 83.3 → 86.8
* DeepSWE: 62.7 → 72.0
* Toolathlon: 74.1 → 79.5

В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8.

https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
Здесь только маленькая проблема - все цифры идут от автора скилла. А так, любопытно, конечно
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Если вы часто отлаживаете UI-анимации, и ловите проблему когда OCR клода не может понять что именно не так

Попробуйте поюзать terminal-browser, вернее его функцию Agent Recordings для создания визуального баг-репорта:

1/ Она записывает содержимое открытой вкладки
2/ Запись открывается в покадровом редакторе
3/ Ты находишь кадр с багом
4/ С помощью стрелок и коментов показываешь агенту что не так
5/ На выходе получается папка с видео, кадрами, аннотациями и JSON-манифестом

В остальном это такой же обычный браузер как и в любом IDE, только в терминале:
- Агент и человек работает в одной и той же среде: агент управляет через команды а человек видит это в реальном времени
- Внутри полноценный Chromium, а не кастрированный текстовый браузер


Установить: terminal-browser.com

Пока работает только на macOS & Linux и нужен терминал с поддержкой картинок (например ghostty или cmux)

@tips_ai #tools
Qwen3.8 стал хитом, и под него тут же появилась нецензурированная версия, о ней много кто писал, но есть и другие интересные варианты - например, ускоренная модель, которая выдает а пару раз больше токенов..
Я тут как раз пытался пересадить скрипт по подготовки презентаций с Клода на DeepSeek, да еще и его харнесс. Но было не особо, так как писать презентации он мог, а видеть - нет. Как Бетховен.

Так что, то, что у Дипсика появилось зрение - очень даже кстати.

https://t.me/dealerAI/1903
Кто бы это мог быть?

Я как раз высадил лимиты Клода (сколько ни заливай бабок, все на лимите сидишь), гпт тоже наполовину опустошил - а впреди еще 5 дней..

Ну и кстати, у Клода это типа на 50% увеличенный до 31 августа лимит...

Вернусь пробежки, потестирую

https://t.me/vibecoding_tg/3719
Кстати, если захотите задешево попрограммировать - есть моделька от Меты - Спарк 1.2, которую можно гонять по $0,2 за выходящий токен (по цене DeepSeek Flash). Нюанс один - все данные отдаются Мета для обучения. В общем, не жалко - кого только можно обучить на таких данных? )) Разве что вайбкодера..

https://openrouter.ai/meta/muse-spark-1.2-contributor

Любопытно, что Qwen3.8 27B стоит в инференсе 3 доллара - и вот этого я не понимаю, тот же DeepSeek Flash, который почти в 10 раз больше размером стоит в 10 раз дешевле. Какая-то странная экономика..

Ну а в экономику ИИ лучше всего раскрывают в этом видосике. Порадовали..
DeepSeek Pro может и хорошая модель, и харнесс интересный, но на уровне МАХ размышляет она бесконечно. 20 мин на две реплики, там, где Клод справляется за минутку, это, конечно, кого угодно из себя вывести может. Для тех, кто никуда не торопится

PS. Попросил решить проблему в настройках DeepSeek Harness - 3 вопроса, 40 минут - 1,17$. Проблема не решена. Спасибо, больше не надо..