very vibe coding
122 subscribers
463 photos
126 videos
13 files
996 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
🌟 ACE-Step v1.5: обновление локального генератора музыки.

Ace Studio в коллабе со StepFun обновили генератор музыки ACE-Step до версии 1.5.

Порог входа уронили до минимума: младшая модель требует меньше 6 ГБ видеопамяти, а, в зависимости от настроек think mode, генерация может занять от 2 до 10 секунд - это уже уровень коммерческих решений.

Разработчики собрали гибрид из языковой модели, которая превращает промпт в чертеж композиции: расписывает структуру, придумывает лирику и метаданные и DiT, который отвечает за звук. Логическое ядро всей этой системы базируется на Qwen3.

ACE-Step v1.5 может генерировать треки длиной от 10 секунд до 10 минут, причем до 8 штук одновременно. В базе больше 1000 инструментов, а тексты песен система понимает на 50 языках.

Авторы подготовили целый набор моделей под разный объем VRAM:

🟢Меньше 6 ГБ: без LM-модуля, работает только звуковой движок.

🟢6–12 ГБ: облегченная версия LM (0.6B).

🟢16 ГБ и выше: полноценная модель на 4 млрд. параметров, которая лучше всего понимает контекст и выдает максимум качества.

При запуске, ACE-Step v1.5 автоматически выбирает подходящую под железо модель и параметры. Подробную информацию по конфигурациям можно найти тут.

ACE-Step умеет гораздо больше, чем просто превращать текст в мелодию. Можно дать ей пример аудио, чтобы скопировать стиль, делать каверы, исправлять куски уже готовых треков или генерировать аккомпанемент к вокалу.


Самая интересная функция - возможность создавать LoRA. Чтобы скормить модели свой стиль, достаточно всего 8 треков. На 30-й серии RTX с 12 ГБ памяти этот процесс займет около часа.

С деплоем все в порядке, разработчики подготовили портабельную сборку, а для ComfyUI уже написали все необходимые ноды и воркфлоу.


📌Лицензирование:  MIT License.


🟡Страница проекта
🟡Модель
🟡Arxiv
🟡Demo
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Text2Music #AceStudio #StepFun
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
О, битва гигантов - вышел Claude Opus 4.6 и тут же Codex 5.3 от OpenAI. Обычные пользователи могут этого не оценить - обе модели, прежде всего, для программирования. Честно говоря, из них мне нравятся... обе.

Я пользуюсь Claude code в основном, хотя Codex почти также хорош. Решающий фактор - то, что Антропик сделал тарифы на 20, 100 и 200 баксов, а OpenAI - за 20 и 200.

Модели за 20 баксов мне уже мало, а за 200 - жаба душит. Поэтому взял за 100, а произошло это когда Антропик выкатил Опус 4.5 и снизил цену в 3 раза (хотя ChatGPT дешевле Опуса).

Кстати, о деньгах я не пожалел - теперь высадить подписочные токены очень тяжело я тупо могу работать с лучшей моделью нон-стоп.

Чистая победа маркетологов. Но был бы тариф у OpenAI за 100, взял бы и его - 2 модели прикольно использовать.

Так что прекрасные новости, модели и были лучшими (Джемини нервно курит в сторонке), а теперь будут еще круче. Супер
Привет, друзья! Вчера в ночи вышли две новые модели: у Anthropic вышел Opus 4.6 с 1М токенов, а у OpenAi — Codex 5.3.

Из статьи Anthropic следует, что на сегодняшний день Opus 4.6 — самая интеллектуальная модель, доступная широкой общественности.

Судя по их тестам, всё классно, но нужно, разумеется, потестировать в деле. Context Rot никто не отменял, к сожалению.

Помните концепцию «Standing on the shoulders of giants»? Мы строим продукты, которые базируются на постоянно растущем уровне интеллекта и становятся «умнее» без нашего участия. Ух…

Всё начало этой недели я был в командировке, поэтому ничего не писал, но есть пара моментов, которые я посмотрел и попробовал, хочу поделиться. Вдруг, есть время на выходных, либо вы уже настолько поглощены новинками Agent Coding, что вместо основной работы занимаетесь экспериментами и этого ещё никто не заметил :)

1. AutoForge (https://github.com/AutoForgeAI/autoforge) — проект нашего товарища Leon Van Zyl, раньше назывался Autocoder. Это практически автономная среда для кодирования, которая умеет разбивать проект на фичи и параллельно их создавать, попутно тестируя и проверяя функциональность. Мы с ребятами уже пару-тройку недель её терзаем, обычно флоу работы такой: ты создаешь 80% проекта через AutoForge, а потом остальные 20% добиваешь в Windsurf / Claude Code CLI. Вещица убойная, особенно для несложных задач. Идеально для PoC.

2. Sandboxed.sh (https://github.com/Th0rgal/sandboxed.sh) — окестратор для AI-coding-агентов, позволяет запускать, контролировать и мониторить AI-агентов (Claude Code, OpenCode, Amp, Codex) в изолированных окружениях (Docker). Если страшно запускать агентов на своей машине или хочется развернуть где-нибудь в облаке, это прекрасный продукт. Пока в активной стадии разработки, постоянно за ними слежу, ребята очень интересные. На базе Sandboxed можно создать автономную фабрику агентного кодирования, которая будет разворачиваться и работать в нужных окружениях практически с нулевыми затратами на настройку и запуск.

3. Claude-mem (https://github.com/thedotmack/claude-mem) — система постоянной памяти для агентного кодирования. Пользовался ею последний месяц. Фактически, она пытается решить задачу бесконечного контекста для моделей, у которых этот контекст ограничен + очень эффективно инициализирует сессии новых агентов, передавая им контекст проекта. Если вы знакомы с феноменом Context Rot, то это палочка-выручалочка. По моим ощущениям, повышает качество и точность работы процентов на 10-15 в большинстве сценариев.

Happy Coding!
Начал было писать себе прогу для работы с нейронками голосом, чтобы меньше печатать, но тут увидел пост с рекламой готовой программы Handy, и решил не тратить время на свою - установил, работает хорошо. Очень симпатичный интерфейс, не хватает только удобного выбора моделей.

Модель для распознавания голоса выбирайте whisper large (немного качественнее) или whisper turbo (побыстрее). Для работы с нейронками качества достаточно (они понимают текст с ошибками). Для других применений есть возможность настроить использование дополнительной нейронки для облагораживания надиектованного текста в экспериментальных возможностях.

В общем, готов рекомендовать, хорошая штука. Попробую ее еще переписать на сберовский Salut, который специализируется на русской речи, посмотрим, что получится
very vibe coding
Начал было писать себе прогу для работы с нейронками голосом, чтобы меньше печатать, но тут увидел пост с рекламой готовой программы Handy, и решил не тратить время на свою - установил, работает хорошо. Очень симпатичный интерфейс, не хватает только удобного…
В продолжение поста - whisper все-таки русский распознает с ошибками, а лучшая модель в этом плане - отечественная GigaAM. Думал переписать программу сам для использования отечественной нейронки, но на GitHub это уже следали за нас. Ниже нужная ссылка

https://github.com/Servideus/Handy-GigaAM/releases/tag/app-v0.7.3

Попросите Claude code или Codeх (ну или Gemini CLI) установить все за вас - нейронки, работающие в терминале, прекрасно с этим справляются. А если они еще у вас не установлены - ставьте скорее и ваша жизнь скоро изменится
Forwarded from Tips AI | IT & AI
Китайский Seedance 2.0 ещё не вышел официально, но многим уже дали ранний доступ.

Посмотрите что получается — я давно не удивлялся, последний раз так было с Veo 3.

1080p, генерация видео сразу со звуком, липсинк на 8 языках.

Модель принимает текст, картинки, видео и аудио одновременно, можно комбинировать в одном запросе.

Будет доступно в CapCut, а вот тут больше примеров.

@tips_ai #news
GitHub выпустил гайд для программирования агентов, работающих с GitHub, на человеческом языке. Формат может стать удачным
Еще интересная штука с просторов GitHub - с помощью реверс-инжиниринга умельцы нашли скрытый сокет в Claude code, который позволяет подключать другие интерфейсы.

Здесь не столько сам интерфейс любопытен, сколько возможность построить собственный интерфейс для Клода..

https://github.com/The-Vibe-Company/companion
🎙 Textream — бесплатный телепромптер для macOS

И еще одна любопытная штука - телесуфлер для macOS. Для тех, кто должен что-то читать на камеру - никому кроме вас не видно, следит за текстом, должно работать на русском.

Открытое приложение, которое подсвечивает текст скрипта в реальном времени по мере того, как вы говорите. Распознавание речи — локальное, на устройстве, без облака.

Что умеет:
• Dynamic Island-оверлей поверх всех окон — видите только вы
• Три режима: отслеживание голоса, автопрокрутка, прокрутка по голосу
• Поддержка десятков языков, включая русский
• Вывод на внешний экран или iPad через Sidecar
• Шрифты: Sans, Serif, Mono, OpenDyslexic
• Весит 913 КБ

Установка:
brew install f/textream/textream

Требуется macOS 15 Sequoia.

GitHub: github.com/f/textream
Сайт: textream.fka.dev
⚡️ Deep Research без интернета? Теперь это возможно.

OpenResearcher — это полностью офлайн-пайплайн для генерации длинных исследовательских траекторий (100+ шагов), которые имитируют реальный процесс работы агента в интернете:
search → open → find → анализ → вывод.

И всё это:
- без API поиска
- без ограничений по rate limit
- без нестабильности результатов
- полностью воспроизводимо

Что под капотом:

- GPT-OSS-120B генерирует исследовательские цепочки
- Локальный поисковик + корпус 10 трлн токенов
- 15 млн документов FineWeb
- 10 000 «золотых» отобранных источников
- Явные примитивы браузинга (поиск, открытие, извлечение), а не просто retrieve-and-read
- Reject sampling — сохраняются только успешные длинные траектории

Почему это важно?

Главная проблема обучения research-агентов — длинные цепочки действий.
Обычные датасеты короткие и не учат модель думать на горизонте десятков шагов.

Здесь результат впечатляет:

SFT на этих траекториях повышает точность модели Nemotron-3-Nano-30B-A3B
с 20.8% → 54.8% на BrowseComp-Plus
(+34% абсолютного прироста)

Что это значит для индустрии:

- Deep-research агентов можно обучать без дорогих онлайн-запросов
- Появляется воспроизводимое обучение tool-use
- Можно масштабировать генерацию «мышления через действия»
- Это шаг к стабильным автономным исследовательским AI

Открытое релизнули всё:

- Код, поисковик и рецепт корпуса
- ~96K длинных исследовательских траекторий
- Логи оценки
- Обученные модели
- Онлайн-демо

GitHub: https://github.com/TIGER-AI-Lab/OpenResearcher
Models & Data: https://huggingface.co/collections/TIGER-Lab/openresearcher
Demo: https://huggingface.co/spaces/OpenResearcher/OpenResearcher
Eval logs: https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Eval-Logs
Forwarded from Machinelearning
🎨 Qwen-Image-2.0 - новое поколение генерации изображений Qwen моделей

Alibaba представили Qwen-Image-2.0 - модель, которая выводит генерацию визуала на уровень дизайнерских инструментов. Теперь ИИ не просто рисует картинки, а умеет создавать полноценные слайды, постеры и визуалы с аккуратной типографикой и высоким качеством деталей.

Что умеет модель:
- Написал абзац → получил готовый слайд
- Описал сцену → получил фотореалистичное изображение в 2K
- Добавил текст → он отображается корректно, без «ломаных» букв (русский поддерживает, но работает кривовато)

Ключевые улучшения:
- Профессиональная типографика - поддержка длинных промптов до 1K токенов для презентаций, постеров и комиксов
- Нативное разрешение 2K с высокой детализацией
- Точное и стабильное отображение текста
- Единый режим генерации и редактирования изображений
- Облегчённая архитектура — быстрее инференс и ниже стоимость

Попробовать: https://chat.qwen.ai/?inputFeature=t2i
Подробнее: https://qwen.ai/blog?id=qwen-image-2.0

@ai_machinelearning_big_data

#qwen
Почитайте про skills от человека, который сделал самый популярный репозиторий с ними в сети. Это может принести очень много пользы и радикально изменить то, как вы работаете с моделью, и что получаете на выходе
Для любителей Obsidian (а я с третьего захода стал поклонником программы - это такой опенсорсный Notion) плагин для работы через терминал. Дополнительное удобство для агентов

https://x.com/obsdmd/status/2021241386268233897?s=46
Еще одна любопытная программа - «концентрированная текстовая память». Не RAG, просто суммаризация только важного в тексте. Любопытно

https://x.com/mastra/status/2021280193273336131?s=46
Forwarded from Machinelearning
⚡️ ZAI релизнули GLM-5.

Zhipu AI выкатила в своем он-лайн сервисе chat.z.ai новую языковую модель GLM-5.

Официальных спецификаций на данный момент нету, но по слухам, масштаб и эффективность нового флагмана удвоены, а контекстное окно достигает 200 тыс. токенов.

Первые пользователи отмечают неплохие способности модели в написании кода и логическом выводе.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from эйай ньюз
🔥Курс по Deep Learning (Fall 2024) от MIT доступен онлайн!

Один из лекторов - Phillip Isola, чень крутой ресерчер в Computer Vision. Олды помнят его легендарный CycleGAN (2017).

Выложили и слайды, и доп материалы, и видео лекций, и домашки (можете по-честному их выполнить и отправить на проверку в Claude Code :))

Очень качественный базовый курс. Если хотите разобраться в Deep Learning немного глубже промптов, то очень рекомендую к просмотру!

Курс целиком можно скачать тут:
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/video_galleries/lecture-videos/

P.S. Еще один хрестоматийный курс по DL - это Стенфордский CS231 от Карпатого.

#ликбез
@ai_newz