very vibe coding
121 subscribers
463 photos
126 videos
13 files
990 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
⚡️ NVIDIA раздает жирнейший набор API - почти сотка нейросетей бесплатно

Без лишнего шума: открыли доступ к 95+ моделям сразу. Внутри всё, что сейчас в топе - DeepSeek, Kimi, Mistral, Qwen, Flux, Whisper, GLM и ещё пачка инструментов под любые задачи.

Можно собирать свои продукты без вложений: озвучка, чат-боты, липсинк, генерация видео, дизайн. Всё через API, без костылей и с нормальным качеством.

Самое интересное - выкатили доступ к своим моделям. Обязательно попробуй Nemotron: отлично режет шум и вытягивает звук даже с плохого микрофона.
Забирай, пока не прикрыли.

https://build.nvidia.com/models

#NVIDIA

🎯Полезные Мл-ресурсы 🚀 Max

@data_analysis_ml
В Claude Code добавили Routines - способ превратить разовые команды в повторяемые сценарии.

Теперь вместо ручного управления ты задаёшь поведение:
Claude сам выполняет цепочки действий под задачу.

По сути это не промпты, а воспроизводимые workflow внутри Claude Code

Что это даёт:

- автоматизация типовых задач
- меньше ручного контроля
- стабильный результат от запуска к запуску
- экономия времени на рутине

Ты один раз описываешь, как работать.
дальше Claude просто повторяет это как систему.

code.claude.com/docs/en/routines

🎯Полезные Мл-ресурсы 🚀 Max

@data_analysis_ml
Forwarded from эйай ньюз
ERNIE Image — новый открытый text2image генератор от Baidu

Довольно компактная 8B моделька довольно успешно соревнуется с заметно большим Qwen Image на бенчах, а также обходит Z-image по бенчам.

УДИВИТЕЛЬНО хорошо рендерит текст, для своего размера и разрешения (1MP).

Архитектурно это single stream MM-DiT. ERNIE Image кидает токены текста и патчи изображения в один общий трансформер с самого начала — никаких параллельных веток (как у Flux), все веса общие. Это проще и компактнее, при этом качество сопоставимое. Архитектурно похоже на Z-image, но проще.

Из интересных нюансов — авторы затюнили 3B LLM для перефразирования промптов юзеров, что заметно улучшает результаты, но модель можно запускать и без него. Вместе с обычными весами выпускают Turbo версию, которой нужно всего 8 шагов для генерации.

Модель запускается на 24GB VRAM, ещё и веса под Apache 2.0 (делать можно что угодно).

Го тестить, я уже поднял ее на своей H200 и модель действительно хороша!

На H200 из коробки 8 шагов генерит за 11 сек.


Демо
Блогпост
Веса
Код

@ai_newz
Когда-то я пользовался Claude Desktop, потом перешел на терминал, дальше поставил Ghostty, затем cmux (на котором сижу сейчас). Видимо, скоро надо будет возвращаться к Claude Desktop, и судя по темпу, который набрал Антропик, надолго

https://t.me/aiwizards/423
Кстати, в телеграмме Claude работает, нормально. Может подключиться к текущим сессиям tmux (если кто еще не пробовал - это прикольная фича, запускаешь ее на удаленном компе, отключаешься, подключаешься, она в фоне работает), настроил голосовые сообщения через Sber salute, подключу на выходных к своим базам - может и не так прикольно, как OpenClaw, но более контролируемо..
Forwarded from Machinelearning
⭐️ Google DeepMind представил Gemini 3.1 Flash TTS - свою самую управляемую модель генерации речи

Главная фишка - Audio Tags.


Это текстовые команды прямо в промпте, которыми можно управлять стилем голоса, подачей и темпом речи. По сути, вы режиссируете озвучку через текст.

Что ещё важно:
— Более естественное звучание речи
— Поддержка 70+ языков (русский, японский, немецкий и др.)
— Все выходные аудио маркируются SynthID (цифровой водяной знак, чтобы отличить синтезированную речь от настоящей)

На бенчмарке Artificial Analysis TTS Arena модель заняла 2-е место с Elo-рейтингом 1211 - сразу за Inworld TTS 1.5 Max (1215) и выше ElevenLabs v3 (1179).

Где попробовать:
→ Рreview через Gemini API и Google AI Studio
→ Бизнесу -а Vertex AI
→ Всем пользователям - скоро появится в Google Vids

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/

@ai_machinelearning_big_data

#google `#tts
У нас новый лидер по генерации видео - Happy Horse от Alibaba. Пока доступа нет, только тесты проходит..
Google сделал приложение Gemini для macOS. Интересно, есть ли там что-то, чего нет в Claude Desktop? Посмотрим..
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ В Telegram завезли агентов, которые создают других ботов

Павел Дуров сообщил, что теперь в Telegram можно развернуть бота-агента буквально в пару кликов

Агент может сам создавать новых ботов и управлять ими от вашего имени

Похоже, фича не случайная, её явно готовили под экосистему вроде OpenClaw

Ранее разработчик OpenClaw говорил, что с ним связалась команда Telegram и предложила помощь с интеграцией

Если это так, Telegram превращается не просто в мессенджер
а в платформу для запуска AI-агентов с доступом к миллионам пользователей

https://t.me/durov/490

🎯Полезные Мл-ресурсы

@data_analysis_ml
Forwarded from Data Secrets
Вся ваша вечерняя новостная лента в одном скрине

Opus 4.7 – это нечто. Он прекрасен, это другой взгляд на все привычное, что у нас было. Новый стандарт, несомненный знак новой эры.

(Я его еще не попробовал)
Вчера вечером Антропик раскатал Claude Opus 4.7, обнулил недельные лимиты. Гоняю модель на своих задачках и пока не вижу никакой разницы с 4.6 (с тем что было, пожалуй, те, кто говорят о том, что Опус 4.6 в последние недели потупел скорее правы).Но здесь само название говорит, что это эволюция, а не революция. Так что пока про улучшения - верю на слово.

А вот лимиты в последнее время стали улетать ну сильно быстрее. Проблемка…

PS по тому, что пишут в Х, лучше оставаться на 4.6, если не на 4.5. Судя по всему, оптимизации по снижению расходов в модели куда больше, чем оптимизации по повышению эффективности..
Вчера на занятии меня спросили, что я использую для интерфейсного дизайна, я решил поделиться этим набором тут.

Оркестратором всей истории выступают Claude Code и Codex. Честно скажу, для разных задач они «звучат» немного по-разному. С точки зрения дизайна и композиции, Claude Code, безусловно, лучше. Но Codex с необходимыми скиллами очень хорошо справляется с копирайтингом, написанием текстов для интерфейсов и вообще работе с текстом.

Из того, что вокруг:

Перво-наперво, это pencil.dev + Figma, оба через плагины (оба через CLI). Отмечу, что с недавнего времени Figma дала возможность не просто «считывать дизайн», но и создавать его. Про MCP и там, и там, забыли.

https://impeccable.style/ — Как написано на сайте самих ребят: «Teaches you AI Design». Если очень кратко, то это набор скиллов, которые позволяют расширить возможности агентных сред и расширять их до возможности проводить практически полный дизайн-процесс.

https://github.com/microsoft/playwright-cli — Это незаменимая вещь, браузер, управляемый агентной средой. Все, что было создано, спроектировано и должно быть проверено визуально, делается через Playwright CLI.

Из основного это всё. Дополнительно:

https://github.com/obra/superpowers — Про этих ребят я уже писал выше. Это швейцарский нож номер один в моем арсенале. Используется для планирования, визуального проектирования интерфейсов, исполнения планов, подведения итогов.

https://github.com/VoltAgent/awesome-design-md — Наборы готовых стилей крупных компаний. Не призываю использовать один в один, но как референсы дизайн-систем вполне себе подойдет.

https://designlang.vercel.app/ — Экстрактор дизайн-системы из любых ресурсов. Натравливаешь его на какой-нибудь сайт, в итоге получаешь структурированный набор дизайн-паттернов и дизайн-систему. Пока сыроват, но ребята очень активно его допиливают.

https://mobbin.com/ — Традиционный король референсов по дизайну. Тут собрано около 600 тысяч разных скринов, элементов, интерфейсных сценариев и паттернов. Можно использовать как источник вдохновения или анализировать для своих собственных продуктов. У меня есть свой собственный скилл для Claude Code, который работает с Mobbin и умеет искать и, при необходимости, извлекать необходимые запчасти для дизайна: маленькие и большие.

Больше никаких секретов не осталось…
У Claude 4.7 новый токенайзер, с более мелкими токенами. Что это значит? - подписка тратится в полтора раза быстрее, чем у 4.6.

Пожалуй, для долгих задач буду ставить старую модель.
Подключил к Claude code в виде плагина Codex (GPT-5.4), теперь когда мне Клод что-то напланирует, прошу его согласовать все с GPT-5.4. Получается согласовать не всегда, в последний раз они прошли 5 итераций, прежде чем согласились.

Полезная штука для поиска фантазий и ошибок. Пожалуй, зашью такой loop себе как обязательный при планировании и исполнении
🔥2❤1
Но вообще, с новым Клодом я способен пятичасовой лимит токенов высадить за час. Да и с откатом на 4.6 все не сильно лучше. Халтурит Антропик…
Говорят, GPT-5.4 Pro (доступен только на высоких тарифах) стали обновлять и он чудо как хорош. Кладет Opus 4.7 на лопатки. Ждем официальных объявлений.

И что-то никак не дождемся DeepSeek 4… до конца апреля еще ждем?