РЕПАКИ И ПОРТАТИВКИ ПОЛЕЗНЫХ НЕЙРОСЕТЕЙ ● НЕЙРОСОФТ
14K subscribers
373 photos
267 videos
3 files
322 links
Делаем нейросети удобными и доступными.

Made by @Neuro_Cartel
Download Telegram
В чём Харли поедет на задание?

Piper подобрал несколько луков:

👕 Повседневный прикид
👗 Золотистое платье
🐈‍⬛ Чёрная кошка
👩🏻‍⚕️ Костюм горничной
👮‍♀️ Униформа пилота
🏮 Кимоно цвета сакуры

Выбирайте из 40+ готовых стилей или создайте свой. Доступно API.

Проявите свой талант стилиста в Фабрике одежды 👙

🛠 Piper.my
Please open Telegram to view this post
VIEW IN TELEGRAM
8🔥7👍3🗿2🤔1
Минутка интеллектуального юмора.

👾 НЕЙРО-СОФТ - Делаем нейросети доступнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁34👍7🔥2🤔2🗿2
Forwarded from Nerual Dreming и нейросети
🚀 Нейро-дайджест: ключевые события мира AI за 1-ю неделю июня 2025!

Друзья, всем привет! 👋 Горячий нейро-дайджест уже здесь!
На этой неделе Gemini обновили Pro-модель, Codex получил апгрейд и открылся для GPT Plus, Sora встроили в Bing, ElevenLabs завезли эмоции, а Cursor привлёк 900 млн. Ну и куда без фильма про OpenAI с Юрой Борисовым 🔥

Вот лишь часть из множества новостей, которые ждут вас в полном дайджесте:

🧠 Gemini 2.5 Pro — новая гибридная модель от Google, которая обходит ChatGPT o3 по бенчмаркам. Управление «бюджетом раздумий», больше логики и меньше мусора в коде.

📱 Codex от OpenAI — теперь доступен для подписчиков GPT Plus. Слушает голос, читает интернет и не спамит пулл-реквестами. Почти как живой девелопер.

🤖 Claude Code — ответ от Anthropic: версия Claude 4 Sonnet теперь доступна для кодинга в CLI. Идеален для локальной разработки без чата.

🖥 Cursor 1.0 — выкатили релиз и привлекли \$900 млн. Добавили память, поддержку Jupyter и взяли лида моделей у Midjourney.

🫦 HunyuanVideo-Avatar от Tencent — опенсорс-липсинк нового поколения: оживляет фото, делает пение, эмоции, котов-рэперов и команду говорящих героев.

🎬 HeyGen AI Studio — теперь полный контроль: голос, стиль, эмоции, сцены, субтитры и фоновые треки. Идеален для обучающих и рекламных видео.

🙎‍♂️ Higgsfield Speak — генерация реалистичных говорящих аватаров. 16 сцен, фокус на эмоциях и естественных движениях.

📱 AI-боты в WhatsApp — теперь можно делать своих ассистентов с характерами. Meta тестит AI Studio прямо в мессенджере.

😎 SnapChat AI — запускает AR-маски на своей генеративной модели. Енот, лиса, весенние цветы — и всё это под AI.

📸 Bing + Sora — Microsoft встраивает генератор видео прямо в поисковик. 10 бесплатных генераций и ролики по описанию — уже доступно.

🎤 Fish Audio OpenAudio S1 — нейросеть для речи с эмоциями, шёпотом и криками. Можно клонировать голос и управлять интонациями.

🧬 ElevenLabs v3 — альфа-версия умеет понимать эмоции и делать диалоги. 10 000 бесплатных кредитов и 80% скидка до конца июня.

📺 ИИ вычисляет местоположение по комментарию на YouTube — новая жуть, но реально работает.

📺 Фильм про OpenAI — Эндрю Гарфилд и Юра Борисов сыграют в истории про Сэма Альтмана.

🌌 Маск снова обещает Марс — теперь говорит, что первые роботы улетят уже до 2030 года.

🤖 GigaChat в космосе — Роскосмос запускает свою нейросеть на МКС.

И это только часть! В полном дайджесте вас ждут все подробности, ссылки на источники и еще больше интересных новостей 👇

📝 ЧИТАТЬ НА ХАБРЕ

📝 ЧИТАТЬ НА ПИКАБУ

📝 ЧИТАТЬ НА DTF

📝 ЧИТАТЬ НА VC.RU

🌞 ЧИТАТЬ НА ZAVTRA.IO

Какая новость удивила больше всего? Лично меня — история с фильмом про OpenAI и то, как нейросети уже распознают геолокацию по комменту 🤯

Ставьте лайк и поделитесь мнением в комментариях, ваша обратная связь очень помогает дайджестам выходить в топ! 👍

Всех обнял, Илья Nerual Dreming и команда ❤️
Please open Telegram to view this post
VIEW IN TELEGRAM
10🔥9👍51
Казалось бы одно и тоже, но есть один нюанс...

👾 НЕЙРО-СОФТ - Делаем нейросети доступнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁37🤔4👍3😱2💯2
🐟 Fish OpenAudio S1 Mini ● Синтез речи и клонирование голоса ● RU+EN ● Portable by Nerual Dreming

Ссылка на оригинальный релиз: https://huggingface.co/spaces/fishaudio/openaudio-s1-mini
Репакер: #NerualDreming
Дата обновления: 15 июня 2025
Версия: 1.0
Категории: #TTS, #voicecloning, #AIaudio
Платформа: #Windows
Язык: RU, EN
Место на диске: 11 ГБ
Системные требования: NVIDIA GPU с не менее 6 ГБ VRAM
Совместимость: #Nvidia

🖥 Описание софта:
OpenAudio S1 Mini — это значительный шаг вперед по сравнению с ее предшественницей, Fish Speech 1.5. Главное преимущество модели — превосходная выразительность и естественность звучания, которые достигаются за счет совершенного управления эмоциональными оттенками с помощью специальных маркеров. Будучи «дистиллированной» версией более крупной модели, она предлагает передовые возможности в значительно более легком и ресурсоэффективном пакете, что делает ее доступной для широкого круга пользователей.


😬 Основные возможности OpenAudio S1 Mini:
🟣 Превосходная выразительность: Управляйте эмоциями и тоном с помощью более 50 маркеров.
🟣 Высокое качество звука: Благодаря обучению с подкреплением на основе отзывов человека (RLHF), модель генерирует более естественное и приятное звучание.
🟣 Клонирование голоса: Возможность клонировать любой голос по короткому аудиофрагменту (10-30 секунд).
🟣 Встроенная библиотека голосов: Пак из более чем 50 готовых русскоязычных и англоязычных голосов.
🟣 Оптимизация для русского языка: Настройки по умолчанию адаптированы для качественного синтеза русской речи.
🟣 Эффективность: Легковесная модель (0.5 млрд параметров) потребляет меньше ресурсов, чем ее предшественники.
🟣 Высокие позиции в бенчмарках TTS-Arena.


💡 Как использовать маркеры эмоций:
Для управления интонацией просто добавьте нужный маркер в скобках в ту часть текста, где должна измениться эмоция. Модель поймет эту команду и сгенерирует речь с соответствующим оттенком.
Эмоциональные маркеры:
(angry) (sad) (disdainful) (excited) (surprised) (satisfied) (unhappy) (anxious) (hysterical) (delighted) (scared) (worried) (indifferent) (upset) (impatient) (nervous) (guilty) (scornful) (frustrated) (depressed) (panicked) (furious) (empathetic) (embarrassed) (reluctant) (disgusted) (keen) (moved) (proud) (relaxed) (grateful) (confident) (interested) (curious) (confused) (joyful) (disapproving) (negative) (denying) (astonished) (serious) (sarcastic) (conciliative) (comforting) (sincere) (sneering) (hesitating) (yielding) (painful) (awkward) (amused)

Тональные маркеры:
(in a hurry tone) (shouting) (screaming) (whispering) (soft tone)

Специальные маркеры:
(laughing) (chuckling) (sobbing) (crying loudly) (sighing) (panting) (groaning) (crowd laughing) (background laughter) (audience laughing)

⚠️ По моему мнению для русского языка не подходит! Коверкает ударения, но попробуйте на других языках. Модель поддерживает: English (en), Chinese (zh), Japanese (ja), German (de), French (fr), Spanish (es), Korean (ko), Arabic (ar), Russian (ru), Dutch (nl), Italian (it), Polish (pl), Portuguese (pt)


💿 Установка и запуск:
⁍ Скачайте полный 7z-архив с моделями и окружением.
⁍ Распакуйте архив в удобное место с помощью 7-Zip.
⁍ Для запуска русской версии запустите файл run_ru.bat.
⁍ Для запуска английской версии запустите файл run_en.bat.
⁍ Интерфейс приложения автоматически откроется в вашем браузере.

➡️ Скачать архиватор 7z

➡️ Скачать OpenAudio S1 Mini Portable — полный архив 7z с окружением и моделью

💬 Обсудить в чате | ⭐️ Поддержать канал

👾 НЕЙРО-СОФТ — Делаем нейросети доступнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍56🔥1812👀5
Ядерный апгрейд для WAN: FusionX — видео в два раза быстрее и краше! 🔥

Название модели: Wan2.1_14B_FusionX

Ссылка на модель: https://civitai.com/models/1651125?modelVersionId=1868891

Тип модели: #Checkpoint #Merge

Количество скачиваний: 8.8k+

Дата загрузки: 6 июня 2025

Базовая модель: Wan Video 14B t2v

Теги: #merge, #wan, #i2v, #t2v, #wan14b, #video, #cinematic, #animation, #speed

Описание модели | Комментарий разработчика:
Это мощный чекпоинт, созданный слиянием базовой модели WAN 2.1 14B и нескольких передовых моделей (CausVid, AccVideo, MoviiGen1.1). Результат — значительное улучшение качества движения, плавности сцены и детализации, сопоставимое с закрытыми коммерческими аналогами.

Главное преимущество — ускорение рендеринга до 50% по сравнению с базовой моделью, особенно при включении SageAttn. Модель отлично подходит для генерации как из текста, так и из изображения, и полностью совместима с VACE. Автор также выпустил LoRA-версию для тех, кто предпочитает гибкость и контроль.

Помимо основной Text2Video модели, на странице доступны и другие версии: отдельная для Image2Video, а также квантованные GGUF-варианты для экономии VRAM.

Идеальный выбор, чтобы быстро создавать качественные и выразительные кинематографичные ролики.


Важные настройки:
Модель не требует триггерных слов, но для качественного результата критически важны следующие параметры:

CGF должен быть установлен на 1.
Shift: Для разрешения 1024x576 начинайте с 1, для 1080x720 — с 2. Для большего реализма используйте низкие значения, для стилизации — более высокие (3-9).
Шаги: 8–10 шагов для оптимального качества.


🤖 НЕЙРО-СКЛАД — всё, что нужно, для твоей нейронки!
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👏1911👍11🔥5😱1
Как я случайно нашел Strudel и научил нейросеть писать процедурную музыку 🔊

Друзья, всем привет! Сегодня хочу рассказать вам про штуку, которая буквально взорвала мне голову. А называется она Strudel — и это движок для программирования музыки.

Как значит было дело. Сидел я, как обычно, никого не трогал, починял примус... и появилась у меня идея сделать небольшую игру-платформер. Задумка была в том, чтобы она была процедурно-генерируемой, причем я хотел, чтобы все уровни генерировались через большую языковую модель (LLM).

Как оказалось позже, идея была провальной, потому что LLM не очень хорошо понимает расстояние, и я сделал процедурную генерацию просто на скриптах.

И всё вроде бы хорошо, но единственная проблема, с которой я столкнулся, — это создание музыки. Вставлять музыку в base64 — это какая-то жесть. Подключать MP3, MIDI и так далее — тоже не прикольно, когда у тебя игра с претензией на процедурность. Тут я вспомнил про музыку из кейгенов, но оказалось, что и чиптюн не встроить просто так на веб страницу. В итоге я остановился на какой-то очень простой версии из нескольких нот и отложил это до лучших времен.

Но не тут-то было! Буквально на то же утро в телеграм-канале я увидел пост про Strudel. И, естественно, не мог не заинтересоваться, потому что он делал именно то, что я искал и не смог реализовать сам!

Что такое Strudel и почему это так круто?
🎸
Strudel — это, по сути, порт языка Tidal Cycles на JavaScript. Вам это ни о чем не говорит как и мне. Он позволяет процедурно генерировать музыку прямо в браузере.

☑️Это легкое и лаконичное решение. Буквально подключается к странице одной строкой.
☑️Код для музыки занимает всего ничего. Можно писать сложные композиции очень компактно.
☑️Идеально для процедурной генерации! Можно менять параметры мелодии на лету, создавая уникальные треки.
☑️Это бесплатный проект с открытым исходным кодом.

Посмотреть и попробовать можно здесь: https://strudel.cc/

И это невероятно крутой инструмент, потому что сфера его применения ограничена только вашей фантазией. Можно медитативно «вайбкодить» в реальном времени, подбирая грувы. Можно встраивать его в свои веб-приложения или игры для создания адаптивного саундтрека.

Собираем своего музыкального ассистента 🤖
Конечно же, я решил скормить всю документацию нейросети.

Первым делом мне помог парсер, который я накидал на Python с помощью Gemini, чтобы вытащить всю документацию с сайта Strudel.
Этой документации оказалось немало, поэтому я разделил ее на 5 равномерных файлов, чтобы их было удобнее передавать в большую языковую модель.
Написал системный промпт, и... вуаля! Я получил генератор треков, который теперь по текстовому запросу может генерировать мне музыку для Strudel.

И да, я уже это протестировал. Я действительно сделал небольшую мелодию и встроил её в ту самую игру, про которую говорил в самом начале. Это работает, и это классно!

Более того, в такого ассистента теперь можно складывать существующие треки, например, табулатуры и аккорды известных песен. Примеры тоже выложил в ветке чата.

Вот так, например, звучит классический хаус-бит:
sound("bd*4, [- cp]*2, [- hh]*4").bank("RolandTR909")

Стильный басслайн:
note("<[c2 c3]*4 [bb1 bb2]*4 [f2 f3]*4 [eb2 eb3]*4>")
.sound("gm_synth_bass_1")
.lpf(800)

Легендарный ритм Queen:
sound("bd*2 cp").bank("RolandTR707").cpm(81/2)

Или синтезаторный эксперимент с Wavetable:
samples('github:bubobubobubobubo/dough-waveforms')
note("c2*8").s("wt_dbass").n(run(8))
.lpf(perlin.range(100,1000).slow(8))
.lpenv(-3).lpa(.1).room(.5).fast(2)


В общем, Strudel — это невероятно мощная и гибкая песочница для звуковых экспериментов. Это очень крутой инструмент, который открывает массу возможностей как для разработчиков, так и для музыкантов-энтузиастов.

Так что не стесняйтесь, делитесь в нашем чате своими примерами и мелодиями.

Если вам Штрудель понравится так же как и нам, то мы обязательно напишем статейку на Хабр, с руководством по использованию.

💬 Обсудить в чате | ⭐️ Поддержать канал

👾 НЕЙРО-СОФТ — Делаем нейросети доступнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍20🔥1310❤‍🔥2👏2
🥳 Китайцы снова удивляют: MiniMax выкатили M1 — открытую модель-миллионник, которая уделывает Deepseek!

Привет, друзья! Пока мы все следили за гигантами из США, компания MiniMax из Китая тихо выкатила новую open-source модель M1 с невероятным контекстным окном в 1 миллион токенов и очень сильными показателями в тестах на рассуждение, порой обходя даже DeepSeek!

Но самое крутое — это не просто модель. На ее базе они выпустили ИИ-Агента, способного выполнять сложнейшие задачи, включая создание полноценных сайтов по вашим документам!

😊 Агент против Дизайнера: Наш эксперимент

Мы решили устроить настоящую битву! Мы дали агенту тот же самый текст и то же самое ТЗ (техническое задание), которое в свое время получил наш дизайнер для создания нашего сайта.

Вот сайт, который сделал человек:
➡️ https://piper.my/

А вот что за 10 минут собрал AI из тех же материалов:
➡️ https://dappzamm8k.space.minimax.io/

Наши выводы:
Работает! Агент действительно собрал работающий сайт, что уже круто.
Есть косяки. Не обошлось без проблем: оказалось, что длинные PDF-документы он парсит с трудом.
Лайфхак: Для лучшего результата рекомендуем подавать данные в формате .txt.
В целом, результат очень впечатляет для полностью автономной работы!

Ссылки, чтобы попробовать самим:
Попробовать Агента: https://agent.minimax.io/
Модели на HuggingFace: https://huggingface.co/collections/MiniMaxAI/minimax-m1-68502ad9634ec0eeac8cf094
Код модели на GitHub: https://github.com/MiniMax-AI/MiniMax-M1

Модель M1 полностью открыта, а вот будет ли доступен исходный код самого Агента — пока неясно. Будем посмотреть!

💬 Обсудить в чате | ⭐️ Поддержать канал

👾 НЕЙРО-СОФТ — Делаем нейросети доступнее.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍20🔥951😁1