DeepSeek V4.1 Flash
Раньше в приложении надо было вручную переключаться между быстрым, экспертным и режимом с картинками. Теперь это один нативно мультимодальный флагман: обычный диалог, анализ изображений и сложные рассуждения
- Нативно мультимодальная: текст, изображения, рассуждения - один и тот же вход
- V4 Pro отключается 14 сентября (перенесли с более ранней даты)
- После этого V4-запросы автоматически идут на V4.1 Flash по цене Flash пока не выйдет V4.1 Pro
#flagship #multimodal
VK | MAX
Раньше в приложении надо было вручную переключаться между быстрым, экспертным и режимом с картинками. Теперь это один нативно мультимодальный флагман: обычный диалог, анализ изображений и сложные рассуждения
- Нативно мультимодальная: текст, изображения, рассуждения - один и тот же вход
- V4 Pro отключается 14 сентября (перенесли с более ранней даты)
- После этого V4-запросы автоматически идут на V4.1 Flash по цене Flash пока не выйдет V4.1 Pro
#flagship #multimodal
VK | MAX
🔥9👍5
This media is not supported in your browser
VIEW IN TELEGRAM
AuK (Tencent Hunyuan)
Универсальная модель речи: генерация, редактирование, очистка и разделение
Все через указания естественным языком
- Клонирование голоса: текст + референс голоса
- Instruct TTS: голос по описанию без референса
- Редактирование содержимого: заменил/вставил/удалил слова, переписал слова в песне с сохранением мелодии
- Акустика: питч, скорость, громкость
- Паралингвистика: эмоция, тембр, убирает акцент, дыхание/смех/кашель, обычная речь - шепот
- Очистка и разделение: улучшение речи, разделение говорящих, извлечение вокала из микса, выделение цели по сказанному
- 1.5B, MIT
- AuK-Flash: 4 шага, в 4.5x быстрее
Русский не заявлен, но текстовый энкодер - мультиязыный Qwen2.5-Omni-3B, так что пробуйте
Гитхаб
HF
Демо
ComfyUI Спасибо @m_franz
#tts #voiceclonihng #voicedesign #alm #demix #audioseparation
Универсальная модель речи: генерация, редактирование, очистка и разделение
Все через указания естественным языком
- Клонирование голоса: текст + референс голоса
- Instruct TTS: голос по описанию без референса
- Редактирование содержимого: заменил/вставил/удалил слова, переписал слова в песне с сохранением мелодии
- Акустика: питч, скорость, громкость
- Паралингвистика: эмоция, тембр, убирает акцент, дыхание/смех/кашель, обычная речь - шепот
- Очистка и разделение: улучшение речи, разделение говорящих, извлечение вокала из микса, выделение цели по сказанному
- 1.5B, MIT
- AuK-Flash: 4 шага, в 4.5x быстрее
Русский не заявлен, но текстовый энкодер - мультиязыный Qwen2.5-Omni-3B, так что пробуйте
Гитхаб
HF
Демо
ComfyUI Спасибо @m_franz
#tts #voiceclonihng #voicedesign #alm #demix #audioseparation
👍10🔥3
Uno (IFM + Cerebras)
Способ ускорить большую языковую модель не теряя ни капли качества. Обычные модели пишут текст по одному слову за раз. Uno учит модель предсказывать целыми блоками параллельно как будто она печатает сразу по несколько слов, а не по одному
У модели два набора мозгов: один отвечает за качество и делает все как раньше, второй легкий и быстрый, догадывается какие слова идут подряд. Вместе они выдают ровно тот же результат что и оригинал но в разы быстрее.
Существующие ускорители (DFlash, Eagle3) требуют вторую отдельную черновую модель - это лишняя память и сложность. Uno обходится без нее - все встроено в одну модель. Меньше веса, меньше памяти, проще запускать.
В результате до 3 раз быстрее базовой модели. При этом модель на 8B параметров обходит по качеству диффузионного гиганта на 26B и проприетарный Mercury 2
Гитхаб
HF
#optimization
Способ ускорить большую языковую модель не теряя ни капли качества. Обычные модели пишут текст по одному слову за раз. Uno учит модель предсказывать целыми блоками параллельно как будто она печатает сразу по несколько слов, а не по одному
У модели два набора мозгов: один отвечает за качество и делает все как раньше, второй легкий и быстрый, догадывается какие слова идут подряд. Вместе они выдают ровно тот же результат что и оригинал но в разы быстрее.
Существующие ускорители (DFlash, Eagle3) требуют вторую отдельную черновую модель - это лишняя память и сложность. Uno обходится без нее - все встроено в одну модель. Меньше веса, меньше памяти, проще запускать.
В результате до 3 раз быстрее базовой модели. При этом модель на 8B параметров обходит по качеству диффузионного гиганта на 26B и проприетарный Mercury 2
Гитхаб
HF
#optimization
🔥5👍4🤔2❤1
This media is not supported in your browser
VIEW IN TELEGRAM
#humor
но и всерьез #оффтоп
Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.
Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.
Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо
Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты
Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал
Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
но и всерьез #оффтоп
Как например я налепил этот слоп-дубляж. Дай, думаю, сделаю дубляж для подписчиков, не все же понимают басурманскую речь. Пошел искать автоматические дубляторы. На самых лучших бесплатные токены кончились - смотрю что есть в опенсорсе. Ну есть несколько хороших.
Тыкнул в Пинокио тот что судя по всему должен быть хорошим - час установки - ошибка. Не заводится.
Тыкнул другой. Час установки - завелся. Хороший UI, есть подходящий функциолнал. Транскрибация, перевод, озвучание - есть на выбор бесплатные варианты и с ключиками API. Ключиков нет у меня и жалко. Потыкал транскрибацию - из бесплатного whisper, а он уже устарел и справляется не то чтобы хорошо
Ну ладно, думаю, поправлю руками. Начинаю править руками и это сущий адъ - ибо смешаны реплики персонажей и их надо резать заново - а говорящих всего двое. Потом править текст ибо слова слоп оно не знает и разговаривает на "вы" хотя тут уместно на "ты". Потратил еще полчаса и дошел только до 30 секунд. И все это ради смешного ролика на 2 минуты
Плюнул и залил в ютуб, дождался пока всем известный браузер сделает свой дубляж и подложил его дорожку. А совсем кривую фразу просто вырезал
Куча возни нужна чтобы просто дублировать НЕЙРОНКАМИ 2-минутный ролик. Просто кошмар как я однажды вручную дублировал целую полуторачасовую документалку - убил на это полностью 12 дней зимних каникул. А потом ее перезалил себе другой канал и поднял больше просмотров
😁16👍4❤2💯2🫡1
Релизнули веса / код реконструктора 3D-поверхности из нескольких фото Surflo
Гитхаб
HF
#gaussian #3dreconstruction #image2scene
VK | MAX
Гитхаб
HF
#gaussian #3dreconstruction #image2scene
VK | MAX
Telegram
Нейронавт | Нейросети в творчестве
Surflo
Реконструкция 3D-поверхности из нескольких фото. Справляется с передним и задним планом, держит согласованность видов.
• строит облако точек, конвертирует в сетку
• работает с любым числом фото - размер скрытого состояния не растёт
• даёт разное…
Реконструкция 3D-поверхности из нескольких фото. Справляется с передним и задним планом, держит согласованность видов.
• строит облако точек, конвертирует в сетку
• работает с любым числом фото - размер скрытого состояния не растёт
• даёт разное…
👍11
This media is not supported in your browser
VIEW IN TELEGRAM
YuE2
Опенсорная генерация музыки, обновка
по качеству догоняет Suno v5, но локально, редактируемо и с нотами
- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM
- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)
Гитхаб
HF
Comfyui спасибо @m_franz
#musicediting #text2music #text2midi #midi2music
VK | MAX
Опенсорная генерация музыки, обновка
по качеству догоняет Suno v5, но локально, редактируемо и с нотами
- Модель сначала пишет редактируемую партитуру (мелодия + аккорды), а потом по ней генерирует аудио. Партитуру можно править
- Есть редактирование через агента
- Cover: загрузил песню → транскрибировал в ноты с SheetSage2 → написал новый стиль → получил кавер
- 3.6 минуты песни за 71 секунду на RTX 4090, 24 ГБ VRAM
- 3B, лицензия CC BY-NC 4.0 (некоммерческая)
- Сопутствующие открытые модели: MERT2 (музыкальные эмбеддинги, SOTA в 14/15 метрик MARBLE), SheetSage2 (транскрипция аудио в ноты, SOTA в 10/13 метрик), WildSongBench (бенчмарк)
Гитхаб
HF
Comfyui спасибо @m_franz
#musicediting #text2music #text2midi #midi2music
VK | MAX
🔥21👍5
ComfyUI-VOSR2
Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций
- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none
- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L
ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную
Спасибо @m_franz
#comfyui #upscale
VK | MAX
Обертка VOSR 2.0 для ComfyUI - апскейл изображений в один шаг. 1.4B параметров, один forward пасс без итераций
- До 16x обучена, стабильно ~4x
- Модели докачиваются сами при первом запуске (~7 ГБ)
- Пакетная обработка: каждый кадр батча со своим сидом
- Тайлинг для больших изображений: до 512 px без тайлов, дальше — тайлы 512, для VAE — 1024
- Цветовая пост-обработка: wavelet / adain / none
- 1.4B: LightningDiT + Qwen-Image 2D VAE + DINOv2-L
ВАЖНО: тилинг не опционален выше 512 px — модель обучена нативно на 512, без тайлов качество деградирует. Дефолты ноды выключают тилинг, так что на больших картинках их надо ставить вручную
Спасибо @m_franz
#comfyui #upscale
VK | MAX
👍14❤3
Comfy Agent Beta: VFX, Marketing & E-Commerce Workflows
Запись стрима на канале Comfy Org про Comfy Agent
Записаться в бетатест
#comfyui #agent #stream #tutorial
VK | MAX
Запись стрима на канале Comfy Org про Comfy Agent
Записаться в бетатест
#comfyui #agent #stream #tutorial
VK | MAX
YouTube
Comfy Agent Beta: VFX, Marketing & E-Commerce Workflows
Comfy Agent is entering beta, and we're opening the door! Join us live as the team behind it walks through what the agent actually does on the canvas and the story of how it got built.
Comfy Agent doesn't sit off to the side handing you instructions. It…
Comfy Agent doesn't sit off to the side handing you instructions. It…
👍5
Marigold V2
Оценка глубины по одному изображению, переработанная версия Marigold
Превращает DiT в инструмент оценки глубины. Выглядит многообещающе
- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты
- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом
Гитхаб
HF
Демо
#image2depth #image2normals #image2pbr
Оценка глубины по одному изображению, переработанная версия Marigold
Превращает DiT в инструмент оценки глубины. Выглядит многообещающе
- Глубина в один шаг: дистилляция из многошаговой flow-matching модели, с квантованием опционально
- Решает проблему размытия: шерсть, листья, тонкие края — то, что раньше размазывалось, теперь резкое
- Обобщается на непохожие данные
- Не только глубина: те же приемы дают #SOTA на оценке нормалей и разложении изображения на компоненты
- Два ключевых приtма: выравнивание внутренних представлений с семантикой + двухстадийный финтюн с Sinkhorn-лоссом
Гитхаб
HF
Демо
#image2depth #image2normals #image2pbr
👍7❤3🔥2
Накопилось по #minimaxH3 - часть 21
и можно полдня о нем не писать
civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose
github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов
github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting
huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai
huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху
fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen
civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
и можно полдня о нем не писать
civitai.com/models/2920872/minimax-h3-fun-control-in-comfyui-or-depth-and-pose-video - вф Fun #ControlNet - depth и pose
github.com/ukr8b3g-cmyk/ComfyUI-H3-Continuum - сэмплер для длинных роликов
github.com/lj350201364/MiniMaxH3_Single_Dancer_Prompt_Skill - #skill : промпт танца по рефу #prompting
huggingface.co/geocine/minimax-video-prompt-enhancer-2.6b-gguf - #GGUF 2.6B для рерайта промптов, в Jan.ai
huggingface.co/HardGravy2/Minimax_H3_FLF_HardGravy_6_Step_Turbo_Merge - новый 6-шаговый турбо-мерж + #realism #LoRA сверху
fal.ai/models/minimax/h3-max/multi-angle/image-to-video - #i2v с "точным контролем движения камеры" на fal.ai Спасибо @Endorpheen
civitai.red/models/2881362/minimax-seed-hunter-workflow-latent-upscaler-seamless-video-continuation-speedups - #workflow : латентный #upscale , бесшовное продолжение видео, ускорение - многократно рекомендован @DracoLockhard
👍8❤2
This media is not supported in your browser
VIEW IN TELEGRAM
Programmable World Model (Alaya Lab)
Программируемая модель мира
Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.
- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию
Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке
Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами
Гитхаб ждем
#world
Программируемая модель мира
Состояние мира существует отдельно от картинки как код, а не как тень в истории кадров. Раньше видеомодель сама хранила все неявно: объект ушел из кадра - забыла, правила не выражались. Теперь мир - это явные данные, а видео просто их рисует.
- Агент пишет правила мира кодом: где объекты, как двигаются, какие события происходят
- Движок состояний следит за сущностями даже за кадром — повернул камеру, а они на месте
- Детерминированный компилятор превращает состояние в управляющие сигналы для видеогенератора — модель не «вспоминает» мир, а рендерит его
- Мир описывается по одному референсу и тексту — VLM-агент собирает всю спецификацию
Результат: объекты не забываются, правила исполняются точно, 897 кадров без распада, разные миры на одном движке
Прошли по кругу и вернулись к 3D моделированию, но с лишними шагами
Гитхаб ждем
#world
👍8❤1
Пока вы рендерили, ИИ-мир сдвинулся четыре раза 👇
🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс
Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.
Минута утром с «Синапсом», и вы в курсе раньше коллег.
👉 Не пропускать
#промо
VK | MAX
🎮 GPT-6 Astra сама прошла Portal за 23 ч 43 мин — без единой подсказки, за $200 подписки вместо $570 по API
🤖 OpenAI: на один день сотрудника уже приходится 3,1 дня работы агентов, по $600 в день на API
🚗 Alibaba выложила Qwen-Drive 1.0 в открытый доступ: автопилот и ассистент в одной модели на 4B
🇨🇭 Швейцария снимает госслужащих и армию с Microsoft 365 и переводит на опенсорс
Каждое из этого меняет то, чем вы пользуетесь и за что платите. Завтра будет ещё четыре.
Минута утром с «Синапсом», и вы в курсе раньше коллег.
👉 Не пропускать
#промо
VK | MAX
🍌5😁2🥴2🔥1🌚1