very vibe coding
122 subscribers
463 photos
126 videos
13 files
997 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Новый протокол для взаимодействия агентов - АСР (agent communication protocol). Разработан, как я понял, ребятами из IBM, за него вписался Эндрю Нг.

Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
Утро понедельника - никаких сколь-нибудь интересных новостей нет..

Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Сегодня у меня противоречивый опыт с Claude code был. Опять возился с пробрасыванием портов, доменам и пр. - по итогу все получилось (правда, на каком-то этапе пришлось спрашивать Gemini и Opus, которые дали хороший совет, и, как ни странно, одинаковый).

Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Долго ставился домен для работы с n8n - на мак мини работает локально, но из интернета не виден. В конце концов, вернул мак мини на место - подключил по эзернету к роутеру, переписал локальные порты, вроде все норм - не работает. После 20 мин обсуждений нашли программулину (очередной впн), которая создала какой-то прокси, который все портит, даже когда не работает. Убил ее, сразу все заработало везде. Все-таки настройка сетей - штука сложная. Но решаемая. Не то чтобы я чему-то сильно научился, просто смирился и сижу с Клодом все это фиксю
Microsoft VibeVoice 1.5B - Новая Text-To-Speech модель 🎙️

⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )

Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.

🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура

🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования

🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)

📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B

Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
🚀 ElevenLabs запустила Eleven v3 (alpha) API - это модель Text-to-Speech для асинхронных задач

🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки

💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками

🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен

🔗 Полезные ссылки:
Официальная документация API:
https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app

🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы

#ElevenLabs #ElevenV3 #API #TextToSpeech
Как вам новые форматы постов? Или вся эта мишура - лишняя?
Вот чем наши исследователи отличаются, скажем, от китайских? Те что-то сделали, на гитхабе или хаггинфейсе выложили, собирают пиар. Наши отчитались в ТАСС - никаких ссылок, разве что пиарщикам Сбера просмотров добавили. Да, еще и по телеграмму просмотров наберут - цель достигнута
Оно и правда, все пошли на поляну работы с браузерами. И проблема взлома ИИ моделек очень серьезная. Скажу по своему опыту - модели только и делают, что читают в твоем компе то, что им нужно и не нужно. Легко читают секреты. Теперь еще все помнят. И взять у них эту информацию можно просто хорошо попросив. Эта просьба зашивается в коды страницы, на которую идет агент, и все раскрывается. perplexity так уже поломали.

Поэтому первый совет - озаботьтесь хранением секретов. Я перестал использовать свои пароли кроме нескольких особых случаев, когда не доверяю даже машине. Остальное генерит и хранит bitwarden - не очень хочу доверять секреты ни Apple, ни Google. Раньше пользовался опенсорсным и проверенным браузером brave, поиском duckduckgo, но это выше моих сил.

Пожалуй, займусь секретами более плотно - чуть позже расскажу, как это работает на моем сервере
Forwarded from Data Secrets
Вышла Gemini 2.5 Flash Image

Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.

Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.

Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.

Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).

Ну короче, новый SOTA ИИ-фотошоп, расходимся

Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
MiniCPM-V 4.5 🚀

Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱

Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков

🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5

@data_analysis_ml
эйай ньюз
xAI наконец-то релизнули веса Grok 2 Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых…
Утренние новости

- Qwen научился читать веб-страницы (теперь ждем, когда научится там писать :);

- NVIDEA релизнула Nemotron Nano 9b - SOTA среди моделей такого размера, но по тестам обгоняет и большие модели - например, все модели Meta. Для локальных устройств очень интересно;

- новая модель InternVL 3.5 в 32 разных размерах и вариантах. Зачем она и чем так хороша, пока не понял;

- ссылка на Wan 2.2 от Qwen для генерации видео по аудио. Опенсорс, размер небольшой, можно качать ));

- Google признался в авторстве нано-бананы, теперь заходим через aistudio, но доступ есть и для платных пользователей hagging face, причем там должны быть неплохие лимиты;

- Claude дает первым пользователям доступ к плагину для браузера. Оно интересно, но ресурсы будет выжирать моментально. Вчера задал вопрос Opus, после того, как Sonnet в Claude code начал ходить по кругу - один поиск в интернете, и моя сессия закончилась. Без плана Мах с браузером даже не пытайтесь;

- Google запускает синхронный перевод на мобильных устройствах. Ай, молодцы!
С утра возимся с Клодом: "сначала откатлю изменения...". Все-таки русский язык сложный не только для детей ))
😁1💯1
Forwarded from Blog Hanzo
привет! пока я отдыхаю,
незаметно для многих прошел
Agentic AI summit

там реально топовые знания по LLM агентам

конечно!
я уже собрал для вас самые вкусные выступления в одном видео

Agentic AI summit, august 2025. The best lectures of all

русская сокращенная версия будет завтра
👏1
Курсы по RAG на стероидах на графах от топ-менеджера Neo4j (лидирующий пакет, на котором строятся модели). Конечно, от Эндрю Нг