very vibe coding
122 subscribers
463 photos
126 videos
13 files
998 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Утренние новости:
- на выходных генерация 3 видео с Veo3 (это - топ модель) бесплатна;
- Mistral выпустил Mistral medium 3.1, обновил LeChat и Codestal;
- Новые модельки по созданию видео Ray 2 и Runway Gen 4;
- и генерация изображений Lucid Origin от LeonardoAI;
- хотите локальный DeepSeek V3.1? 2 Mac Ultra - и он у вас с 14 токенами в секунду;
- любопытный универсальный коннектор любой LLM с любым МСР сервером
На неделе проапгрейдил свой NAS для хранения бэкапов - теперь там 4 винчестера на 4ТБ каждый, с учетом защиты от отказа одного из них, доступно 11ТБ. Буду использовать для бэкапов, так как с этими агентами риск потерять код, данные и пр. практически гарантирован. Не то, чтобы я рекомендую использовать такие хранилища (я реально смог с этим работать только когда ИИ появился - до этого лень было разбираться), но то, что надо бэкапы делать - абсолютно точно.

Долго сомневался, но заказал себе еще пару мак мини в минимальной комплектации - буду делать кластер с 48Мб памяти для работы с локальными моделями (доступно будет едва ли 40, но сейчас и этого достаточно для множества интересных моделек). Пару недель жду доставки из Китая, потом расскажу об эксперименте ))
💅2
Бесплатный китайский аналог Cursor, как я понимаю, с основном работает на Qwen, но, как пишут, использует еще чуть ли не Sonnet 3.7. Не проверял, но тоже пишут, что зарегистрироваться и запустить проблема - видимо, много бесплатно не бывает. Как по мне, дождусь своих машинок, поставлю Qwen Coder 30b, и можно не переживать обо всех этих внешних ресурсах. Знаю, что и этот путь будет тернист, но душа лежит к кастомным решениям…
✍1
Вот я все жду, когда нейронки научатся переводить язык животных - вроде бы не должно быть нерешаемых проблем, но что-то новостей не вижу. Разве что про дельфинов писали…
Forwarded from эйай ньюз
xAI наконец-то релизнули веса Grok 2

Хоть Grok 2 и безнадёжно устарел, веса все равно представляют интерес и показывают что компания не забыла про опенсорс. Ну и это хороший пример другим компаниям — круто было бы иметь в публичном доступе веса депрекейтнутых моделей, той же GPT 4.5 или Claude 3 Opus (его депрекейтят в октябре).

https://huggingface.co/xai-org/grok-2

@ai_newz
Утренние новости:
- вышла новая моделька Ovis для распознавания сканов и пр. - на 2 и 9 миллиардов параметров, опенсорс;
- Google удвоил лимиты на бесплатную генерацию видео до 6 штук. Работает только сегодня - кто хочет попробовать, спешите! Кстати, видео - со звуком. У меня, правда, так толком и не получилось погенерировать - с моими фотографиями отказывается, промпту что-то сгенерила - но это черный экран, скачать нельзя, забил возиться;
- веса в grok 2.5 выложили в опенсорс, Маск обещает выложить grok 3 через полгода;
- Hunyuan3D-2.1 переводит изображения в 3D. Опенсорс;
- gpt-5 обрезает промпты длиннее 49k - имейте ввиду, если пишите такое..
❤‍🔥1💅1
Новый протокол для взаимодействия агентов - АСР (agent communication protocol). Разработан, как я понял, ребятами из IBM, за него вписался Эндрю Нг.

Все мы помним, что есть протокол А2А от Google, но не скажу, что он стал таким же успешным, как МСР у Anthropic, так что почему бы не посоревноваться
Утро понедельника - никаких сколь-нибудь интересных новостей нет..

Зато вчера посмотрел краем глаза обучающий курс из прошлого поста, и очень заинтересовало не столько то, как в нем пишут клиента и сервер для агента, сколько то, как за 3 мин написали RAG, используя CrewAI. Пересмотрю еще раз попозже..
Сегодня у меня противоречивый опыт с Claude code был. Опять возился с пробрасыванием портов, доменам и пр. - по итогу все получилось (правда, на каком-то этапе пришлось спрашивать Gemini и Opus, которые дали хороший совет, и, как ни странно, одинаковый).

Но был и эпик фейл. И в настройках Claude code в системном промпте прописал создание файла окружения с конфигурацией и паролями отдельно, чтобы первый можно было передавать модели для работы, а второй - она бы не смотрела ни при каких обстоятельствах. Смотрит, зараза, и не парится. Извиняется потом, правда, когда ее за этим застукаешь. Придется как-то более жестко ограничения выставлять. И так во всем. Чему за это время научился - так это тому, что с нейронками никакая паранойя не будет лишней..
Долго ставился домен для работы с n8n - на мак мини работает локально, но из интернета не виден. В конце концов, вернул мак мини на место - подключил по эзернету к роутеру, переписал локальные порты, вроде все норм - не работает. После 20 мин обсуждений нашли программулину (очередной впн), которая создала какой-то прокси, который все портит, даже когда не работает. Убил ее, сразу все заработало везде. Все-таки настройка сетей - штука сложная. Но решаемая. Не то чтобы я чему-то сильно научился, просто смирился и сижу с Клодом все это фиксю
Microsoft VibeVoice 1.5B - Новая Text-To-Speech модель 🎙️

⚠️ ВНИМАНИЕ: Русский язык НЕ поддерживается! Дальше можно не читать )

Microsoft Research только что выпустил VibeVoice 1.5B — open-source модель преобразования текста в речь.

🔥 Основные возможности:
• 90 минут аудио — может генерировать до 90 минут непрерывной речи
• 4 спикера одновременно — поддержка мультиспикерных диалогов
• Только английский и китайский — модель обучена исключительно на этих языках
• MIT лицензия — полностью открытый исходный код
• 1.5B параметров — компактная, но мощная архитектура

🚫 Ограничения:
❌ Русский язык официально не поддерживается
❌ Попытки использования других языков могут давать неразборчивые результаты
❌ Только для исследовательских целей
❌ Не рекомендуется для коммерческого использования

🛠️ Технические особенности:
• Основа: Qwen2.5-1.5B LLM • Инновационные акустические и семантические токенизаторы • Диффузионная архитектура для высококачественного аудио • Поддержка кросс-языкового синтеза (английский → китайский)

📋 Где найти:
• GitHub: microsoft/VibeVoice
• Hugging Face: microsoft/VibeVoice-1.5B

Вот так всегда - поскребешь новенький Майкрософт, а под красивой оберткой - китаец
🚀 ElevenLabs запустила Eleven v3 (alpha) API - это модель Text-to-Speech для асинхронных задач

🔥 Ключевые возможности:
• Режим диалога с неограниченным количеством спикеров Создавайте сложные беседы с множеством персонажей одним запросом
• Поддержка 70+ языков, включая русский Максимальное покрытие для глобальных проектов
• Улучшенный контроль голоса и эмоций с [audio tags] Используйте теги [excited], [whispers], [sighs] для точной передачи эмоций
• Оптимизация для асинхронных задач Идеально подходит для больших объемов контента и фоновой обработки

💡 Практические применения:
• Подкасты и аудиокниги Автоматическое создание диалогов между персонажами
• Озвучка видео и презентаций Множественные спикеры без смены голосовых моделей
• Образовательный контент Интерактивные уроки с диалогами на разных языках
• Игровая индустрия Генерация реплик NPC с эмоциональными оттенками

🌍 Русский язык:
• Полная поддержка русского языка Включая эмоциональные теги и диалоговый режим
• Естественная интонация ИИ понимает контекст и передает нужные эмоции
• Совместимость с кириллицей Корректная обработка русских текстов и имен

🔗 Полезные ссылки:
Официальная документация API:
https://elevenlabs.io/docs
Главная страница: https://elevenlabs.io
Блог с обновлениями: https://elevenlabs.io/blog
Попробовать бесплатно: https://elevenlabs.io/app

🛠 Для разработчиков:
• Alpha версия доступна в API Интеграция через REST API с полной документацией
• Бесплатное тестирование 10,000 символов в месяц для знакомства с возможностями
• SDK для популярных языков Python, JavaScript, и другие платформы

#ElevenLabs #ElevenV3 #API #TextToSpeech
Как вам новые форматы постов? Или вся эта мишура - лишняя?
Вот чем наши исследователи отличаются, скажем, от китайских? Те что-то сделали, на гитхабе или хаггинфейсе выложили, собирают пиар. Наши отчитались в ТАСС - никаких ссылок, разве что пиарщикам Сбера просмотров добавили. Да, еще и по телеграмму просмотров наберут - цель достигнута
Оно и правда, все пошли на поляну работы с браузерами. И проблема взлома ИИ моделек очень серьезная. Скажу по своему опыту - модели только и делают, что читают в твоем компе то, что им нужно и не нужно. Легко читают секреты. Теперь еще все помнят. И взять у них эту информацию можно просто хорошо попросив. Эта просьба зашивается в коды страницы, на которую идет агент, и все раскрывается. perplexity так уже поломали.

Поэтому первый совет - озаботьтесь хранением секретов. Я перестал использовать свои пароли кроме нескольких особых случаев, когда не доверяю даже машине. Остальное генерит и хранит bitwarden - не очень хочу доверять секреты ни Apple, ни Google. Раньше пользовался опенсорсным и проверенным браузером brave, поиском duckduckgo, но это выше моих сил.

Пожалуй, займусь секретами более плотно - чуть позже расскажу, как это работает на моем сервере
Forwarded from Data Secrets
Вышла Gemini 2.5 Flash Image

Причем, уверены, многим из вас модель уже знакома под другим именем: nano-banana. Она всю неделю хайповала в X. В целом, не было секретом, что это моделька от Google (их топы прямо скажем недвусмысленно намекали). Сегодня наконец-то мы дождались официального релиза.

Итак, это модель для генерации и редактирования изображений. И если генерацией уже никого не удивить, то способности Gemini к эдиту действительно заслуживают внимания.

Отлично держит айдентику персонажа и консистентность картинки в целом. На вход можно давать и текст, и картинки: перенос стиля работает, судя по примерам, очень прилично.

Еще из интересного: пишут, что модель может рассуждать. То есть не просто генерирует в тупую, а руководствуется общей логикой мира, которую черпает из знаний Gemini 2.5 Flash. Например, может самостоятельно понять, что должно происходить на следующем кадре сценария (см пример 3).

Ну короче, новый SOTA ИИ-фотошоп, расходимся

Блогпост
– Попробовать можно в AI Studio (стоит 39$ за тысячу изображений, в целом человечно)
MiniCPM-V 4.5 🚀

Свежий релиз от OpenBMB — мультимодальная модель, которая умеет понимать картинки, несколько изображений подряд и даже видео. Главное: запуск возможен прямо на телефоне 📱

Что внутри:
✨ Достигает SOTA результатов в задачах vision+language
✨ 96× сжатие видеотокенов → можно анализировать длинные ролики с высоким FPS
✨ Два режима работы: быстрые ответы (Fast) или глубокие рассуждения (Deep)
✨ Мощный OCR для документов
✨ Поддержка более чем 30 языков

🔗 Подробнее: https://huggingface.co/openbmb/MiniCPM-V-4_5

@data_analysis_ml