very vibe coding
121 subscribers
463 photos
126 videos
13 files
990 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Когда-то я пользовался Claude Desktop, потом перешел на терминал, дальше поставил Ghostty, затем cmux (на котором сижу сейчас). Видимо, скоро надо будет возвращаться к Claude Desktop, и судя по темпу, который набрал Антропик, надолго

https://t.me/aiwizards/423
Кстати, в телеграмме Claude работает, нормально. Может подключиться к текущим сессиям tmux (если кто еще не пробовал - это прикольная фича, запускаешь ее на удаленном компе, отключаешься, подключаешься, она в фоне работает), настроил голосовые сообщения через Sber salute, подключу на выходных к своим базам - может и не так прикольно, как OpenClaw, но более контролируемо..
Forwarded from Machinelearning
⭐️ Google DeepMind представил Gemini 3.1 Flash TTS - свою самую управляемую модель генерации речи

Главная фишка - Audio Tags.


Это текстовые команды прямо в промпте, которыми можно управлять стилем голоса, подачей и темпом речи. По сути, вы режиссируете озвучку через текст.

Что ещё важно:
— Более естественное звучание речи
— Поддержка 70+ языков (русский, японский, немецкий и др.)
— Все выходные аудио маркируются SynthID (цифровой водяной знак, чтобы отличить синтезированную речь от настоящей)

На бенчмарке Artificial Analysis TTS Arena модель заняла 2-е место с Elo-рейтингом 1211 - сразу за Inworld TTS 1.5 Max (1215) и выше ElevenLabs v3 (1179).

Где попробовать:
→ Рreview через Gemini API и Google AI Studio
→ Бизнесу -а Vertex AI
→ Всем пользователям - скоро появится в Google Vids

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-tts/

@ai_machinelearning_big_data

#google `#tts
У нас новый лидер по генерации видео - Happy Horse от Alibaba. Пока доступа нет, только тесты проходит..
Google сделал приложение Gemini для macOS. Интересно, есть ли там что-то, чего нет в Claude Desktop? Посмотрим..
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ В Telegram завезли агентов, которые создают других ботов

Павел Дуров сообщил, что теперь в Telegram можно развернуть бота-агента буквально в пару кликов

Агент может сам создавать новых ботов и управлять ими от вашего имени

Похоже, фича не случайная, её явно готовили под экосистему вроде OpenClaw

Ранее разработчик OpenClaw говорил, что с ним связалась команда Telegram и предложила помощь с интеграцией

Если это так, Telegram превращается не просто в мессенджер
а в платформу для запуска AI-агентов с доступом к миллионам пользователей

https://t.me/durov/490

🎯Полезные Мл-ресурсы

@data_analysis_ml
Forwarded from Data Secrets
Вся ваша вечерняя новостная лента в одном скрине

Opus 4.7 – это нечто. Он прекрасен, это другой взгляд на все привычное, что у нас было. Новый стандарт, несомненный знак новой эры.

(Я его еще не попробовал)
Вчера вечером Антропик раскатал Claude Opus 4.7, обнулил недельные лимиты. Гоняю модель на своих задачках и пока не вижу никакой разницы с 4.6 (с тем что было, пожалуй, те, кто говорят о том, что Опус 4.6 в последние недели потупел скорее правы).Но здесь само название говорит, что это эволюция, а не революция. Так что пока про улучшения - верю на слово.

А вот лимиты в последнее время стали улетать ну сильно быстрее. Проблемка…

PS по тому, что пишут в Х, лучше оставаться на 4.6, если не на 4.5. Судя по всему, оптимизации по снижению расходов в модели куда больше, чем оптимизации по повышению эффективности..
Вчера на занятии меня спросили, что я использую для интерфейсного дизайна, я решил поделиться этим набором тут.

Оркестратором всей истории выступают Claude Code и Codex. Честно скажу, для разных задач они «звучат» немного по-разному. С точки зрения дизайна и композиции, Claude Code, безусловно, лучше. Но Codex с необходимыми скиллами очень хорошо справляется с копирайтингом, написанием текстов для интерфейсов и вообще работе с текстом.

Из того, что вокруг:

Перво-наперво, это pencil.dev + Figma, оба через плагины (оба через CLI). Отмечу, что с недавнего времени Figma дала возможность не просто «считывать дизайн», но и создавать его. Про MCP и там, и там, забыли.

https://impeccable.style/ — Как написано на сайте самих ребят: «Teaches you AI Design». Если очень кратко, то это набор скиллов, которые позволяют расширить возможности агентных сред и расширять их до возможности проводить практически полный дизайн-процесс.

https://github.com/microsoft/playwright-cli — Это незаменимая вещь, браузер, управляемый агентной средой. Все, что было создано, спроектировано и должно быть проверено визуально, делается через Playwright CLI.

Из основного это всё. Дополнительно:

https://github.com/obra/superpowers — Про этих ребят я уже писал выше. Это швейцарский нож номер один в моем арсенале. Используется для планирования, визуального проектирования интерфейсов, исполнения планов, подведения итогов.

https://github.com/VoltAgent/awesome-design-md — Наборы готовых стилей крупных компаний. Не призываю использовать один в один, но как референсы дизайн-систем вполне себе подойдет.

https://designlang.vercel.app/ — Экстрактор дизайн-системы из любых ресурсов. Натравливаешь его на какой-нибудь сайт, в итоге получаешь структурированный набор дизайн-паттернов и дизайн-систему. Пока сыроват, но ребята очень активно его допиливают.

https://mobbin.com/ — Традиционный король референсов по дизайну. Тут собрано около 600 тысяч разных скринов, элементов, интерфейсных сценариев и паттернов. Можно использовать как источник вдохновения или анализировать для своих собственных продуктов. У меня есть свой собственный скилл для Claude Code, который работает с Mobbin и умеет искать и, при необходимости, извлекать необходимые запчасти для дизайна: маленькие и большие.

Больше никаких секретов не осталось…
У Claude 4.7 новый токенайзер, с более мелкими токенами. Что это значит? - подписка тратится в полтора раза быстрее, чем у 4.6.

Пожалуй, для долгих задач буду ставить старую модель.
Подключил к Claude code в виде плагина Codex (GPT-5.4), теперь когда мне Клод что-то напланирует, прошу его согласовать все с GPT-5.4. Получается согласовать не всегда, в последний раз они прошли 5 итераций, прежде чем согласились.

Полезная штука для поиска фантазий и ошибок. Пожалуй, зашью такой loop себе как обязательный при планировании и исполнении
🔥2❤1
Но вообще, с новым Клодом я способен пятичасовой лимит токенов высадить за час. Да и с откатом на 4.6 все не сильно лучше. Халтурит Антропик…
Говорят, GPT-5.4 Pro (доступен только на высоких тарифах) стали обновлять и он чудо как хорош. Кладет Opus 4.7 на лопатки. Ждем официальных объявлений.

И что-то никак не дождемся DeepSeek 4… до конца апреля еще ждем?
Тренды GitHub за неделю — github.com/trending?since=weekly.

Агенты и самоэволюция:
1. forrestchang/andrej-karpathy-skills — CLAUDE.md по наблюдениям Карпаты про типовые ошибки LLM при кодировании. 45.4k. github.com/forrestchang/andrej-karpathy-skills
2. NousResearch/hermes-agent — агент, который растёт вместе с пользователем. Python, 38.2k. github.com/NousResearch/hermes-agent
3. EvoMap/evolver — движок самоэволюции из EvoMap, Genome Evolution Protocol. JS, 3.4k. github.com/EvoMap/evolver
4. lsdefine/GenericAgent — самоэволюционирующий агент, отращивает дерево навыков из 3.3k строк ядра. Python, 3.5k. github.com/lsdefine/GenericAgent
5. multica-ai/multica — open-source платформа управления агентами. TS, 7.8k. github.com/multica-ai/multica

Память и навыки для Claude Code:
6. thedotmack/claude-mem — плагин Claude Code, захватывает сессии и автоматически подмешивает контекст в будущие. TS, 14.6k. github.com/thedotmack/claude-mem
7. addyosmani/agent-skills — production-набор skills от Эдди Османи. Shell, 4.6k. github.com/addyosmani/agent-skills
8. SimoneAvogadro/android-reverse-engineering-skill — skill для реверса Android-приложений. Shell, 1.9k. github.com/SimoneAvogadro/android-reverse-engineering-skill

Документы и мультимодальность:
9. microsoft/markitdown — конвертация любых файлов и документов в Markdown. Python, 9k. github.com/microsoft/markitdown
10. BasedHardware/omi — AI, который видит экран и слушает разговоры. Dart, 2.9k. github.com/BasedHardware/omi

Речь:
11. jamiepine/voicebox — open-source студия синтеза голоса. TS, 5.7k. github.com/jamiepine/voicebox
12. OpenBMB/VoxCPM — многоязычный синтезатор речи VoxCPM2. Python, 4.1k. github.com/OpenBMB/VoxCPM

Обучение и ниши:
13. Lordog/dive-into-llms — курс по работе с LLM. Jupyter, 5.5k. github.com/Lordog/dive-into-llms
14. shiyu-coder/Kronos — foundation-модель для языка финансовых рынков. Python, 4.5k. github.com/shiyu-coder/Kronos
15. virattt/ai-hedge-fund — симулятор AI-хедж-фонда. Python, 4.5k. github.com/virattt/ai-hedge-fund

Наблюдения недели:
— Волна саморазвивающихся агентов (Hermes, Evolver, GenericAgent) и платформ управления (Multica).
— Отдельный пласт — skills и memory для Claude Code (claude-mem, agent-skills, karpathy-skills).
— Речь и мультимодальность подтягиваются одновременно (VoxCPM, Voicebox, Omi).
🔥1
Это мой Клод в телеграмме присылает.. Познавательно
👍2
Media is too big
VIEW IN TELEGRAM
Hola, эврибади! Вот запись митапа, который мы проводили в пятницу по теме OME (One Man Enterprise).

Кратко что это: OME — это новая форма бизнеса, где владелец работает архитектором внутри цифрового и физического миров: проектирует систему, контракты с агентами, точки эскалации, резервные маршруты.

Часы владельца не входят в стоимость. Клиент платит только за
результат, который воспроизводимо выдаёт система.

00:00 Что сломалось в старой экономике
02:48 Сигналы: микро-команды против корпораций
06:33 Архитектор: куда переехал дефицит ценности
12:01 One Man Enterprise — определение и критерии
16:41 5 форм одиночных бизнесов, что продаёт OME
20:13 Архитектура системы: владелец, агенты, артефакты, резервы
28:36 Software on Demand и мультиагентные команды
31:55 Не оптимизируй хаос. Теория ограничений Голдратта
36:43 Кому OME подходит, кому нет, тест из 9 вопросов
42:01 Первые шаги и план на 90 дней
45:59 Книги для фундамента и book-to-skill
50:22 Сценарии будущего и срочность
58:55 Возможности открыты — итог и куда вкладывать силы дальше

Книги, упомянутые в выступлении (есть ссылки на Озон, найдите наиболее удобные варианты):

• Донелла Медоуз. Азбука системного мышления (Thinking in Systems)
• Павел Безручко. Практики регулярного менеджмента
• Элад Гилл. High Growth Handbook
• Джеймс Стейнер. Карьера Software Engineering Manager
• Уильям Детмер. Теория ограничений Голдратта
• Элияху Голдратт. Цель / Цель 2
Forwarded from Data Secrets
Исследователь из Google написал статью о том, почему ИИ никогда не сможет обладать сознанием

Он утверждает, что ни при какой мощности моделей, ни через 10, ни через 100 лет, в них не сможет зародиться сознание. ИИ может только идеально имитировать сознание.

Причина – в логической ошибке, которую автор обозвал Abstraction Fallacy (ошибка абстракции). Сейчас, в основном, считается, что если система ведет себя разумно, значит при достаточной сложности она может стать сознательной. Но это заблуждение, и вот краткий пересказ, почему ⬇️

Дело в том, что сознание – это физическое явление, а вычисления (ИИ) – это лишь его описание. В статье приводится хорошая аналогия с картой и реальными территориями. Сколь бы точна не была карта, из нее никогда не возникнет земли.

Вычисления работают так: есть физическое состояние (ток, напряжение, состояние транзистора и тд) и есть абстрактное состояние – смыслы, которые мы закладываем в физику. Человек (mapmaker) задает между этими двумя состояниями соответствие (mapping), которого не существует в природе самого по себе.

Без этого соответствия вычисления невозможны в принципе. То есть для ИИ смысл всегда приходит извне, система его не переживает, как реальный опыт. Компьютер, сколь бы "умным" он не был, не оперирует смыслами – он оперирует физикой, которую мы интерпретируем как смыслы.

Ждать сознания от алгоритма – все равно что ждать, что формула гравитации начнет притягивать объекты.


Наконец-то кто-то это сформулировал
deepmind.google/research/publications/231971/
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
Moonshot обновили Kimi до версии 2.6

Модель теперь куда сильнее в длинных кодинг задачах, а на бенчах обгоняет Composer 2 от Cursor (который основан на K2.5). Кроме этого компания продолжает инвестировать в рои агентов — K2.6 тренировали использовать вплоть до 300 субагентов параллельно, другие команды не фокусируются на этом настолько сильно (а зря). Ну и говорят что модель теперь лучше работает с OpenClaw и прочими подобными агентами.

Веса
Блогпост

@ai_newz