Forwarded from Piper.my — оркестратор нейросетей
В чём Харли поедет на задание?
Piper подобрал несколько луков:
👕 Повседневный прикид
👗 Золотистое платье
🐈⬛ Чёрная кошка
👩🏻⚕️ Костюм горничной
👮♀️ Униформа пилота
🏮 Кимоно цвета сакуры
Выбирайте из 40+ готовых стилей или создайте свой. Доступно API.
Проявите свой талант стилиста в Фабрике одежды👙
🛠 Piper.my
Piper подобрал несколько луков:
👕 Повседневный прикид
👗 Золотистое платье
🐈⬛ Чёрная кошка
👩🏻⚕️ Костюм горничной
👮♀️ Униформа пилота
🏮 Кимоно цвета сакуры
Выбирайте из 40+ готовых стилей или создайте свой. Доступно API.
Проявите свой талант стилиста в Фабрике одежды
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8🔥7👍3🗿2🤔1
Forwarded from Nerual Dreming и нейросети
Друзья, всем привет!
На этой неделе Gemini обновили Pro-модель, Codex получил апгрейд и открылся для GPT Plus, Sora встроили в Bing, ElevenLabs завезли эмоции, а Cursor привлёк 900 млн. Ну и куда без фильма про OpenAI с Юрой Борисовым
Вот лишь часть из множества новостей, которые ждут вас в полном дайджесте:
🙎♂️ Higgsfield Speak — генерация реалистичных говорящих аватаров. 16 сцен, фокус на эмоциях и естественных движениях.
😎 SnapChat AI — запускает AR-маски на своей генеративной модели. Енот, лиса, весенние цветы — и всё это под AI.
И это только часть! В полном дайджесте вас ждут все подробности, ссылки на источники и еще больше интересных новостей 👇
Какая новость удивила больше всего? Лично меня — история с фильмом про OpenAI и то, как нейросети уже распознают геолокацию по комменту
Ставьте лайк и поделитесь мнением в комментариях, ваша обратная связь очень помогает дайджестам выходить в топ!
Всех обнял, Илья Nerual Dreming и команда
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10🔥9👍5⚡1
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Ссылка на оригинальный релиз: https://huggingface.co/spaces/fishaudio/openaudio-s1-mini
Репакер: #NerualDreming
Дата обновления: 15 июня 2025
Версия: 1.0
Категории: #TTS, #voicecloning, #AIaudio
Платформа: #Windows
Язык: RU, EN
Место на диске: 11 ГБ
Системные требования: NVIDIA GPU с не менее 6 ГБ VRAM
Совместимость: #Nvidia
OpenAudio S1 Mini — это значительный шаг вперед по сравнению с ее предшественницей, Fish Speech 1.5. Главное преимущество модели — превосходная выразительность и естественность звучания, которые достигаются за счет совершенного управления эмоциональными оттенками с помощью специальных маркеров. Будучи «дистиллированной» версией более крупной модели, она предлагает передовые возможности в значительно более легком и ресурсоэффективном пакете, что делает ее доступной для широкого круга пользователей.
🟣 Превосходная выразительность: Управляйте эмоциями и тоном с помощью более 50 маркеров.🟣 Высокое качество звука: Благодаря обучению с подкреплением на основе отзывов человека (RLHF), модель генерирует более естественное и приятное звучание.🟣 Клонирование голоса: Возможность клонировать любой голос по короткому аудиофрагменту (10-30 секунд).🟣 Встроенная библиотека голосов: Пак из более чем 50 готовых русскоязычных и англоязычных голосов.🟣 Оптимизация для русского языка: Настройки по умолчанию адаптированы для качественного синтеза русской речи.🟣 Эффективность: Легковесная модель (0.5 млрд параметров) потребляет меньше ресурсов, чем ее предшественники.🟣 Высокие позиции в бенчмарках TTS-Arena.
Для управления интонацией просто добавьте нужный маркер в скобках в ту часть текста, где должна измениться эмоция. Модель поймет эту команду и сгенерирует речь с соответствующим оттенком.
Эмоциональные маркеры:
(angry) (sad) (disdainful) (excited) (surprised) (satisfied) (unhappy) (anxious) (hysterical) (delighted) (scared) (worried) (indifferent) (upset) (impatient) (nervous) (guilty) (scornful) (frustrated) (depressed) (panicked) (furious) (empathetic) (embarrassed) (reluctant) (disgusted) (keen) (moved) (proud) (relaxed) (grateful) (confident) (interested) (curious) (confused) (joyful) (disapproving) (negative) (denying) (astonished) (serious) (sarcastic) (conciliative) (comforting) (sincere) (sneering) (hesitating) (yielding) (painful) (awkward) (amused)
Тональные маркеры:
(in a hurry tone) (shouting) (screaming) (whispering) (soft tone)
Специальные маркеры:
(laughing) (chuckling) (sobbing) (crying loudly) (sighing) (panting) (groaning) (crowd laughing) (background laughter) (audience laughing)
⚠️ По моему мнению для русского языка не подходит! Коверкает ударения, но попробуйте на других языках. Модель поддерживает: English (en), Chinese (zh), Japanese (ja), German (de), French (fr), Spanish (es), Korean (ko), Arabic (ar), Russian (ru), Dutch (nl), Italian (it), Polish (pl), Portuguese (pt)
⁍ Скачайте полный 7z-архив с моделями и окружением.
⁍ Распакуйте архив в удобное место с помощью 7-Zip.
⁍ Для запуска русской версии запустите файл run_ru.bat.
⁍ Для запуска английской версии запустите файл run_en.bat.
⁍ Интерфейс приложения автоматически откроется в вашем браузере.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍56🔥18❤12👀5
Forwarded from НЕЙРО-СКЛАД ● Модели и LoRa для FLUX и SD, WAN, Hunyuan
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Ядерный апгрейд для WAN: FusionX — видео в два раза быстрее и краше! 🔥
Название модели: Wan2.1_14B_FusionX
Ссылка на модель: https://civitai.com/models/1651125?modelVersionId=1868891
Тип модели: #Checkpoint #Merge
Количество скачиваний: 8.8k+
Дата загрузки: 6 июня 2025
Базовая модель: Wan Video 14B t2v
Теги: #merge, #wan, #i2v, #t2v, #wan14b, #video, #cinematic, #animation, #speed
Описание модели | Комментарий разработчика:
Важные настройки:
🤖 НЕЙРО-СКЛАД — всё, что нужно, для твоей нейронки!
Название модели: Wan2.1_14B_FusionX
Ссылка на модель: https://civitai.com/models/1651125?modelVersionId=1868891
Тип модели: #Checkpoint #Merge
Количество скачиваний: 8.8k+
Дата загрузки: 6 июня 2025
Базовая модель: Wan Video 14B t2v
Теги: #merge, #wan, #i2v, #t2v, #wan14b, #video, #cinematic, #animation, #speed
Описание модели | Комментарий разработчика:
Это мощный чекпоинт, созданный слиянием базовой модели WAN 2.1 14B и нескольких передовых моделей (CausVid, AccVideo, MoviiGen1.1). Результат — значительное улучшение качества движения, плавности сцены и детализации, сопоставимое с закрытыми коммерческими аналогами.
Главное преимущество — ускорение рендеринга до 50% по сравнению с базовой моделью, особенно при включении SageAttn. Модель отлично подходит для генерации как из текста, так и из изображения, и полностью совместима с VACE. Автор также выпустил LoRA-версию для тех, кто предпочитает гибкость и контроль.
Помимо основной Text2Video модели, на странице доступны и другие версии: отдельная для Image2Video, а также квантованные GGUF-варианты для экономии VRAM.
Идеальный выбор, чтобы быстро создавать качественные и выразительные кинематографичные ролики.
Важные настройки:
Модель не требует триггерных слов, но для качественного результата критически важны следующие параметры:
CGF должен быть установлен на 1.
Shift: Для разрешения 1024x576 начинайте с 1, для 1080x720 — с 2. Для большего реализма используйте низкие значения, для стилизации — более высокие (3-9).
Шаги: 8–10 шагов для оптимального качества.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👏19❤11👍11🔥5😱1
Как я случайно нашел Strudel и научил нейросеть писать процедурную музыку 🔊
Друзья, всем привет! Сегодня хочу рассказать вам про штуку, которая буквально взорвала мне голову. А называется она Strudel — и это движок для программирования музыки.
Как значит было дело. Сидел я, как обычно, никого не трогал, починял примус... и появилась у меня идея сделать небольшую игру-платформер. Задумка была в том, чтобы она была процедурно-генерируемой, причем я хотел, чтобы все уровни генерировались через большую языковую модель (LLM).
Как оказалось позже, идея была провальной, потому что LLM не очень хорошо понимает расстояние, и я сделал процедурную генерацию просто на скриптах.
И всё вроде бы хорошо, но единственная проблема, с которой я столкнулся, — это создание музыки. Вставлять музыку в base64 — это какая-то жесть. Подключать MP3, MIDI и так далее — тоже не прикольно, когда у тебя игра с претензией на процедурность. Тут я вспомнил про музыку из кейгенов, но оказалось, что и чиптюн не встроить просто так на веб страницу. В итоге я остановился на какой-то очень простой версии из нескольких нот и отложил это до лучших времен.
Но не тут-то было! Буквально на то же утро в телеграм-канале я увидел пост про Strudel. И, естественно, не мог не заинтересоваться, потому что он делал именно то, что я искал и не смог реализовать сам!
Что такое Strudel и почему это так круто?🎸
Strudel — это, по сути, порт языка Tidal Cycles на JavaScript. Вам это ни о чем не говорит как и мне. Он позволяет процедурно генерировать музыку прямо в браузере.
☑️ Это легкое и лаконичное решение. Буквально подключается к странице одной строкой.
☑️ Код для музыки занимает всего ничего. Можно писать сложные композиции очень компактно.
☑️ Идеально для процедурной генерации! Можно менять параметры мелодии на лету, создавая уникальные треки.
☑️ Это бесплатный проект с открытым исходным кодом.
Посмотреть и попробовать можно здесь: https://strudel.cc/
И это невероятно крутой инструмент, потому что сфера его применения ограничена только вашей фантазией. Можно медитативно «вайбкодить» в реальном времени, подбирая грувы. Можно встраивать его в свои веб-приложения или игры для создания адаптивного саундтрека.
Собираем своего музыкального ассистента🤖
Конечно же, я решил скормить всю документацию нейросети.
Первым делом мне помог парсер, который я накидал на Python с помощью Gemini, чтобы вытащить всю документацию с сайта Strudel.
Этой документации оказалось немало, поэтому я разделил ее на 5 равномерных файлов, чтобы их было удобнее передавать в большую языковую модель.
Написал системный промпт, и... вуаля! Я получил генератор треков, который теперь по текстовому запросу может генерировать мне музыку для Strudel.
И да, я уже это протестировал. Я действительно сделал небольшую мелодию и встроил её в ту самую игру, про которую говорил в самом начале. Это работает, и это классно!
Более того, в такого ассистента теперь можно складывать существующие треки, например, табулатуры и аккорды известных песен. Примеры тоже выложил в ветке чата.
Вот так, например, звучит классический хаус-бит:
Стильный басслайн:
Легендарный ритм Queen:
Или синтезаторный эксперимент с Wavetable:
В общем, Strudel — это невероятно мощная и гибкая песочница для звуковых экспериментов. Это очень крутой инструмент, который открывает массу возможностей как для разработчиков, так и для музыкантов-энтузиастов.
Так что не стесняйтесь, делитесь в нашем чате своими примерами и мелодиями.
Если вам Штрудель понравится так же как и нам, то мы обязательно напишем статейку на Хабр, с руководством по использованию.
💬 Обсудить в чате | ⭐️ Поддержать канал
👾 НЕЙРО-СОФТ — Делаем нейросети доступнее.
Друзья, всем привет! Сегодня хочу рассказать вам про штуку, которая буквально взорвала мне голову. А называется она Strudel — и это движок для программирования музыки.
Как значит было дело. Сидел я, как обычно, никого не трогал, починял примус... и появилась у меня идея сделать небольшую игру-платформер. Задумка была в том, чтобы она была процедурно-генерируемой, причем я хотел, чтобы все уровни генерировались через большую языковую модель (LLM).
Как оказалось позже, идея была провальной, потому что LLM не очень хорошо понимает расстояние, и я сделал процедурную генерацию просто на скриптах.
И всё вроде бы хорошо, но единственная проблема, с которой я столкнулся, — это создание музыки. Вставлять музыку в base64 — это какая-то жесть. Подключать MP3, MIDI и так далее — тоже не прикольно, когда у тебя игра с претензией на процедурность. Тут я вспомнил про музыку из кейгенов, но оказалось, что и чиптюн не встроить просто так на веб страницу. В итоге я остановился на какой-то очень простой версии из нескольких нот и отложил это до лучших времен.
Но не тут-то было! Буквально на то же утро в телеграм-канале я увидел пост про Strudel. И, естественно, не мог не заинтересоваться, потому что он делал именно то, что я искал и не смог реализовать сам!
Что такое Strudel и почему это так круто?
Strudel — это, по сути, порт языка Tidal Cycles на JavaScript. Вам это ни о чем не говорит как и мне. Он позволяет процедурно генерировать музыку прямо в браузере.
Посмотреть и попробовать можно здесь: https://strudel.cc/
И это невероятно крутой инструмент, потому что сфера его применения ограничена только вашей фантазией. Можно медитативно «вайбкодить» в реальном времени, подбирая грувы. Можно встраивать его в свои веб-приложения или игры для создания адаптивного саундтрека.
Собираем своего музыкального ассистента
Конечно же, я решил скормить всю документацию нейросети.
Первым делом мне помог парсер, который я накидал на Python с помощью Gemini, чтобы вытащить всю документацию с сайта Strudel.
Этой документации оказалось немало, поэтому я разделил ее на 5 равномерных файлов, чтобы их было удобнее передавать в большую языковую модель.
Написал системный промпт, и... вуаля! Я получил генератор треков, который теперь по текстовому запросу может генерировать мне музыку для Strudel.
И да, я уже это протестировал. Я действительно сделал небольшую мелодию и встроил её в ту самую игру, про которую говорил в самом начале. Это работает, и это классно!
Более того, в такого ассистента теперь можно складывать существующие треки, например, табулатуры и аккорды известных песен. Примеры тоже выложил в ветке чата.
Вот так, например, звучит классический хаус-бит:
sound("bd*4, [- cp]*2, [- hh]*4").bank("RolandTR909")Стильный басслайн:
note("<[c2 c3]*4 [bb1 bb2]*4 [f2 f3]*4 [eb2 eb3]*4>")
.sound("gm_synth_bass_1")
.lpf(800)Легендарный ритм Queen:
sound("bd*2 cp").bank("RolandTR707").cpm(81/2)Или синтезаторный эксперимент с Wavetable:
samples('github:bubobubobubobubo/dough-waveforms')
note("c2*8").s("wt_dbass").n(run(8))
.lpf(perlin.range(100,1000).slow(8))
.lpenv(-3).lpa(.1).room(.5).fast(2)В общем, Strudel — это невероятно мощная и гибкая песочница для звуковых экспериментов. Это очень крутой инструмент, который открывает массу возможностей как для разработчиков, так и для музыкантов-энтузиастов.
Так что не стесняйтесь, делитесь в нашем чате своими примерами и мелодиями.
Если вам Штрудель понравится так же как и нам, то мы обязательно напишем статейку на Хабр, с руководством по использованию.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍20🔥13❤10❤🔥2👏2
Привет, друзья! Пока мы все следили за гигантами из США, компания MiniMax из Китая тихо выкатила новую open-source модель M1 с невероятным контекстным окном в 1 миллион токенов и очень сильными показателями в тестах на рассуждение, порой обходя даже DeepSeek!
Но самое крутое — это не просто модель. На ее базе они выпустили ИИ-Агента, способного выполнять сложнейшие задачи, включая создание полноценных сайтов по вашим документам!
Мы решили устроить настоящую битву! Мы дали агенту тот же самый текст и то же самое ТЗ (техническое задание), которое в свое время получил наш дизайнер для создания нашего сайта.
Вот сайт, который сделал человек:
А вот что за 10 минут собрал AI из тех же материалов:
Наши выводы:
Работает! Агент действительно собрал работающий сайт, что уже круто.
Есть косяки. Не обошлось без проблем: оказалось, что длинные PDF-документы он парсит с трудом.
Лайфхак: Для лучшего результата рекомендуем подавать данные в формате .txt.
В целом, результат очень впечатляет для полностью автономной работы!
Ссылки, чтобы попробовать самим:
Попробовать Агента: https://agent.minimax.io/
Модели на HuggingFace: https://huggingface.co/collections/MiniMaxAI/minimax-m1-68502ad9634ec0eeac8cf094
Код модели на GitHub: https://github.com/MiniMax-AI/MiniMax-M1
Модель M1 полностью открыта, а вот будет ли доступен исходный код самого Агента — пока неясно. Будем посмотреть!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍20🔥9❤5⚡1😁1