This media is not supported in your browser
VIEW IN TELEGRAM
#humor
но и всерьез #оффтоп
Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.
Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.
Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо
Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты
Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал
Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
но и всерьез #оффтоп
Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.
Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.
Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо
Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты
Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал
Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
😁16👍4❤2💯2🫡1
Релизнули веса / код реконструктора 3D-поверхности из нескольких фото Surflo
Гитхаб
HF
#gaussian #3dreconstruction #image2scene
VK | MAX
Гитхаб
HF
#gaussian #3dreconstruction #image2scene
VK | MAX
Telegram
Нейронавт | Нейросети в творчестве
Surflo
Реконструкция 3D-поверхности из нескольких фото. Справляется с передним и задним планом, держит согласованность видов.
• строит облако точек, конвертирует в сетку
• работает с любым числом фото - размер скрытого состояния не растёт
• даёт разное…
Реконструкция 3D-поверхности из нескольких фото. Справляется с передним и задним планом, держит согласованность видов.
• строит облако точек, конвертирует в сетку
• работает с любым числом фото - размер скрытого состояния не растёт
• даёт разное…
👍11
This media is not supported in your browser
VIEW IN TELEGRAM
YuE2
Опенсорная генерация музыки, обновка
по качеству догоняет Suno v5, но локально, редактируемо и с нотами
- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM
- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)
Гитхаб
HF
Comfyui спасибо @m_franz
#musicediting #text2music #text2midi #midi2music
VK | MAX
Опенсорная генерация музыки, обновка
по качеству догоняет Suno v5, но локально, редактируемо и с нотами
- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM
- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)
Гитхаб
HF
Comfyui спасибо @m_franz
#musicediting #text2music #text2midi #midi2music
VK | MAX
🔥21👍5
ComfyUI-VOSR2
Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций
- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none
- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L
ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную
Спасибо @m_franz
#comfyui #upscale
VK | MAX
Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций
- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none
- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L
ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную
Спасибо @m_franz
#comfyui #upscale
VK | MAX
👍14❤3
Comfy Agent Beta: VFX, Marketing & E-Commerce Workflows
Запись стрима на канале Comfy Org про Comfy Agent
Записаться в бетатест
#comfyui #agent #stream #tutorial
VK | MAX
Запись стрима на канале Comfy Org про Comfy Agent
Записаться в бетатест
#comfyui #agent #stream #tutorial
VK | MAX
YouTube
Comfy Agent Beta: VFX, Marketing & E-Commerce Workflows
Comfy Agent is entering beta, and we're opening the door! Join us live as the team behind it walks through what the agent actually does on the canvas and the story of how it got built.
Comfy Agent doesn't sit off to the side handing you instructions. It…
Comfy Agent doesn't sit off to the side handing you instructions. It…
👍5
Marigold V2
Оценка глубины по одному изображению, переработанная версия Marigold
Превращает DiT в инструмент оценки глубины. Выглядит многообещающе
- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты
- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом
Гитхаб
HF
Демо
#image2depth #image2normals #image2pbr
Оценка глубины по одному изображению, переработанная версия Marigold
Превращает DiT в инструмент оценки глубины. Выглядит многообещающе
- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты
- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом
Гитхаб
HF
Демо
#image2depth #image2normals #image2pbr
👍7❤3🔥2
Накопилось по #minimaxH3 - часть 21
и можно полдня о нем не писать
civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose
github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов
github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting
huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai
huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху
fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen
civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
и можно полдня о нем не писать
civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose
github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов
github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting
huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai
huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху
fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen
civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
👍8❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Programmable World Model (Alaya Lab)
Программируемая модель мира
Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.
- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию
Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке
Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами
Гитхаб ждем
#world
Программируемая модель мира
Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.
- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию
Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке
Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами
Гитхаб ждем
#world
👍8❤1
Пока вы рендерили, ИИ-мир сдвинулся четыре раза 👇
🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс
Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.
Минута утром с «Синапсом», и вы в курсе раньше коллег.
👉 Не пропускать
#промо
VK | MAX
🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс
Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.
Минута утром с «Синапсом», и вы в курсе раньше коллег.
👉 Не пропускать
#промо
VK | MAX
🍌5😁2🥴2🔥1🌚1
FLUX Video Edit
Редактирование видео по текстовой инструкции от BFL
12 типов правок из коробки
- Удаление, добавление и замена объектов в кадре
- Смена декораций и персонажа, пересказ диалога и перевод реплик на другой язык
- Рестайлинг всего клипа
- Правки комбинируются: несколько инструкций в одном промпте
- Длина, кадрирование, камера, тайминг и аудио наследуются от источника
- До 15 секунд на вход, до 50 МБ (URL или base64)
- Разрешение следует за источником, все что больше 720p понижается до 720p 🤩
- $0.03 за секунду: 10-секундный клип — $0.30
- Аудио сохраняется, если промпт не просит его поменять
- Не умеет: маски, image-референсы, растяжку клипа
- Результаты выдают пиксель-оверлей для сравнения до/после
Плейграунд - платно
Fal.ai - тоже
#videoediting #fluxVE
Редактирование видео по текстовой инструкции от BFL
12 типов правок из коробки
- Удаление, добавление и замена объектов в кадре
- Смена декораций и персонажа, пересказ диалога и перевод реплик на другой язык
- Рестайлинг всего клипа
- Правки комбинируются: несколько инструкций в одном промпте
- Длина, кадрирование, камера, тайминг и аудио наследуются от источника
- До 15 секунд на вход, до 50 МБ (URL или base64)
- Разрешение следует за источником, все что больше 720p понижается до 720p 🤩
- $0.03 за секунду: 10-секундный клип — $0.30
- Аудио сохраняется, если промпт не просит его поменять
- Не умеет: маски, image-референсы, растяжку клипа
- Результаты выдают пиксель-оверлей для сравнения до/после
Плейграунд - платно
Fal.ai - тоже
#videoediting #fluxVE
🔥4👍3
Media is too big
VIEW IN TELEGRAM
SuperSplat Editor 3.0
Полная перепись редактора гауссиан на WebGPU. Крупнейший релиз за год: главное - сцены больше, меньше RAM
- Рендер полностью на GPU
- Stochastic Alpha: при работе сплаты рендерятся без сортировки, после остановки честный сортированный кадр
- Spherical Brush: кисть следует за поверхностью, выбор по глубине и границам
- Цветокоррекция выделения: tint, температура, насыщенность, яркость, прозрачность
- новый формат проектов
Тут все бесплатно и локально в браузере и это хорошо.
На днях узнал что PostShot больше не дает бесплатный экспорт сцен. А LichtFeld бесплатен только если вы сами скомпилируете исходники. Все меньше инструментов где бесплатно можно нарулить сцену на материалах которые под NDA
#gaussian #webgpu
Полная перепись редактора гауссиан на WebGPU. Крупнейший релиз за год: главное - сцены больше, меньше RAM
- Рендер полностью на GPU
- Stochastic Alpha: при работе сплаты рендерятся без сортировки, после остановки честный сортированный кадр
- Spherical Brush: кисть следует за поверхностью, выбор по глубине и границам
- Цветокоррекция выделения: tint, температура, насыщенность, яркость, прозрачность
- новый формат проектов
Тут все бесплатно и локально в браузере и это хорошо.
На днях узнал что PostShot больше не дает бесплатный экспорт сцен. А LichtFeld бесплатен только если вы сами скомпилируете исходники. Все меньше инструментов где бесплатно можно нарулить сцену на материалах которые под NDA
#gaussian #webgpu
👍9
#MiniMaxMusic
MiniMax Music Prompt Studio
Простое приложение: даешь аудиофайл, получаешь готовый промпт для MiniMax Music и текст песни в похожем вайбе
———
MiniMax Music Production Toolkit for ComfyUI
Полный конвейер производства песни внутри #ComfyUI: идея → структурированный промпт → генерация в Music 3 → восстановление аудио (Declip, FlashSR, HF shimmer repair) → подготовка релиза (LUFS, true-peak) → обложка FLUX.2 → размеченный FLAC/MP3 + JSON с параметрами
- 239 жанровых шаблонов промптов
- Локальный #GGUF LLM для капшена, текста, названия и обложки — без облака
- Custom Mode для своих промптов
- 11 встроенных профилей системных промптов в v2.1
- Отдельная лаборатория улучшения аудио
Галерея
#comfyui #musicediting
MiniMax Music Prompt Studio
Простое приложение: даешь аудиофайл, получаешь готовый промпт для MiniMax Music и текст песни в похожем вайбе
———
MiniMax Music Production Toolkit for ComfyUI
Полный конвейер производства песни внутри #ComfyUI: идея → структурированный промпт → генерация в Music 3 → восстановление аудио (Declip, FlashSR, HF shimmer repair) → подготовка релиза (LUFS, true-peak) → обложка FLUX.2 → размеченный FLAC/MP3 + JSON с параметрами
- 239 жанровых шаблонов промптов
- Локальный #GGUF LLM для капшена, текста, названия и обложки — без облака
- Custom Mode для своих промптов
- 11 встроенных профилей системных промптов в v2.1
- Отдельная лаборатория улучшения аудио
Галерея
#comfyui #musicediting
❤8👍6🥴2