Метаверсище и ИИще
51.3K subscribers
6.46K photos
5.21K videos
48 files
7.52K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
PanoWorld.

Интересный пример использования Qwen-Edit.

Он преобразует двухмерные планы этажей для всего дома в фотореалистичные, согласованные виртуальные туры по этому дому. Утверждается, что структура дома сохраняется при передвижении.
Виртуальный тур по дому, которого еше нет. Для недвиги и риелторов самое то.
Под капотом гауссианы, на сайте много примеров:
https://jjrcn.github.io/PanoWorld-project-home/
Код должен быть, но его пока нет.

@cgevent
🔥35👍113
This media is not supported in your browser
VIEW IN TELEGRAM
WavFlow: Audio Generation in Waveform Space

Интересная работа от Метачки. Это Foley - генерация звука по видео (и по тексту).
Тут примечательно то, что генерация происходит напрямую в "звуковом" пространстве (в пространстве waveform) и не используется никакого VAE и сжатия в латентное пространство. Это аналог генераторов картинок, которые работают напрямую в пиксельном пространстве без VAE.

Утверждается, что работает быстрее и не хуже.

На сайте много примеров, код есть:
https://facebookresearch.github.io/WavFlow/#demos

Если вам надо переозвучить свои видео - вариант.

@cgevent
👍26🔥84👎4
This media is not supported in your browser
VIEW IN TELEGRAM
У Black Forrest Lab немного странный апдейт.

Им бы давно пора бахнуть Flux.3, а они выпускают удалятор объектов.
Причем удялятор требует ручной грубой маски.

Я копнул глубже, там под капотом Flux.2 Klein 9B

Причем доступно это, только по API и в виде их демо на сайте.

Веса Flux.2 Klein 9B не обновлялись с февраля, хотя они пишут "FLUX is now trained to erase and reconstruct as one task at the model level."

Демо тут:
https://flux-tools.bfl.ai/erase

Я попробовал и у меня вообще не отработало.

Попробуйте, может у вас получится.

Подробнее тут:
https://docs.bfl.ai/flux_erase

В то время как Банана умеет то же самое без масок, а Омни вообще удаляет объекты с видео, такой чахлый релиз выглядит ну очень странно.

@cgevent
9😁5🔥3👍2🙏1
Любопытно, что в твитторе одного из разработчиков Krea.ai появился такой пост:

Планы:
1. Постоянные улучшения и новые возможности в K2.
2. Выпуск версии с открытым исходным кодом.
3. Технический отчет и блоги разработчиков.
4. На личном уровне — мои размышления до и после обучения, которыми я хочу поделиться в своих статьях.
5. Возможно, специальная модель аниме.

Интересно, он какой опенсорсной модели идет речь?

"Теперь, когда мы заслужили право обучать более амбициозные (и БОЛЬШИЕ) модели, нужно сначала научиться ходить, прежде чем начинать бегать. Думаю, мы уже научились ходить, и теперь, по-моему, мы готовы начать бегать."

Интригует.

@cgevent
17🔥8👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Еще один пример World Knowledge у Gemini Omni Flash

Ей не надо прописывать каждый шаг, достаточно сформулировать концепцию видео.
Она сама находит теорию, описания объектов и деталей, визуализирует их, добавляет текст.
Образование не будет прежним.

P.S. Режиссура образовательных роликов - это сторителлинг другого рода. Драки и погони не нужны. Нужны концепции. Их есть внутри.

@cgevent
🔥62👍1611
Forwarded from Neural Shit
This media is not supported in your browser
VIEW IN TELEGRAM
Как тебе такое, Илон Маск?
😁125🔥21👎63
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Рекламный ролик

Автор: Stasy Smith

Забрел в Беханс клиент с заказом: серия забавных рекламных роликов для компании-производителя ЖБИ. Собственно, на этом ТЗ закончилось... :) Заказ мечты, очевидно.

Из предложенных идей утвердили историю с маскотом: железобетонный блок Олег, который спасает ситуации на стройках. Во второй серии к нему присоединились в качестве постоянных участников Прораб и двое рабочих - Геннадий и Константин, очень уж они клиентам понравились. На каждый ролик - примерно неделя работы (вместе с прокрастинацией, другими проектами и правками).

Сценарий - из головы (кроме второй серии, та - чистый плагиат), ключи - НаноБанана и ГПТ-имедж, анимация - Клинг, Грок, Сора. Начиная с третьего ролика, Сиданс. Звук - Илеванлабз, Суно и бесплатные коллекции. Всё клепалось в одно жало, так как проект скорее не коммерческий, а ламповый - повеселить партнеров, разбавить рассылку прайс-листов.

Сейчас есть четыре серии примерно по минуте каждая, можно посмотреть тут https://www.youtube.com/@neuralSmith/shorts

@cgevent
👎75😁39👍15🔥3😱3
Video Upscaler vCube от ByteDance

На входе разрешение 480p, 720p или 1080p - на выходе до 2K или 4K с частотой кадров до 60 кадров в секунду.

Пишут, что это идеальное дополнение для Seedance.

Никакого опенсорса, только API.

Есть на Fal.ai:

https://fal.ai/models/fal-ai/bytedance-upscaler/upscale/video
Upscaling to 1080p costs $0.0072/s, 2K costs $0.0144/s, and 4K costs $0.0288/s, at a 30fps rate. Processing at 60fps doubles the cost for any resolution. Processing in pro mode makes the price 10 times of the normal price ($0.072/s, $0.144/s, $0.288/s for 1080p,2K, 4K at 30fps respectively, at 60fps these prices are further doubled.)

То есть PRO-mode в ДЕСЯЯТЬ раз дороже.

Есть на replicate:
https://replicate.com/bytedance/video-upscaler
Цены расписаны более понятно.

Есть пресеты для описания того, что происхлдит в сцене, для более точного попадания в upscale.

@cgevent
👍14👎92😁1
Удивительно, конечно, на что идут стартапы, чтобы поднять денег.

Переводчиков с кошачьего и собачьего мы насмотрелись года 4 назад, когда все пытались тренировать LLM на всем подряд.

Понятно, что ничего не взлетело. Чтобы тренировать такой переводчик, надо "спросить" тварь, а что у нее сейчас в башке. Ну или распознать. И, боюсь, так называемые зоопсихологи не очень могут тут помочь.

Ну и вообще, понятие "языка" для животных весьма неопределено.

Тем не менее, вы можете прямо щас потратить 118 долларов на переводчик с псиного.

Китайский стартап Meng Xiaoyi выпустил ошейник для домашних животных с искусственным интеллектом под названием «PettiChat», утверждая, что он способен переводить звуки и эмоции собак и кошек на человеческий язык с точностью до 95%. ДЕВЯНОСТО ПЯТЬ, КАРЛ!

Сообщается, что гаджет использует микрофоны, датчики движения и модель искусственного интеллекта Qwen от Alibaba для анализа поведения и голосовых паттернов домашних животных. Компания заявляет, что ошейник стоимостью 118 долларов уже получил более 10 000 предзаказов до своего официального выпуска.

Особенно доставляет, что это Qwen - он видать особенно хорошо натренирован на мяуканье и лае.

https://www.odditycentral.com/animals/controversial-ai-powered-pet-translator-boasts-a-95-accurracy-rate.html

@cgevent
😁299🔥4
Тут твитторчанский просто исприподвзрывается новостью, от том, что теперь вы можете покупать крипту прямо в chatGPT.

Попробуйте в поиске "MoonPay is now live on ChatGPT".

Уже целый статьи написаны, о том какой это прорыв. И что Moonpay совершает революцию.

Короче, чтобы понять, что происходит, достаточно найти в chatGPT AppStore это несчастное приложение и посмотреть на скрин. Вот оно:
https://chatgpt.com/apps/moonpay/asdk_app_6a07aa9c220c8191bbdefade1b2629fc

Из него следует, что кинув промпт "хачу купить битка на 1 доллар" пользователь получает прямую ссылку на moonpay. Кликнув по которой он покидает chatGPT навсегда.

Более того, если попытаться установить его, оно вам расскажет, про все, что связано с платежами, кошельками, юрисдикциями и KYC будет происходить на стороне moonpay.

Ситуация с AppStore по-прежнему напоминает мне ситуацию с плагинами для chatGPT: все подряд используют каталог для рекламы своих сервисов и увода трафика на свои сайты.

Moonpay хорошо пропиарился на лого OpenAI - всесь твиттор забит этой новостью.

В общем, нет, вы не можете ничего оплатить криптой внутри chatGPT.

@cgevent
😁254🔥4
Нейрорендер и нейрокомпоз в Gemini Omni

Собрал пару примеров, которые меня сильно впечатляют.

С кувшином - это настольно просто и элегантно, что видится этакий редактор шейдеров, который можно набрасывать на выбранные объекты и получать лукдев для готового материала. Прозрачный шейдер доставляет особо.

С медведем - это прям метакомпоз. И ведь пыль летит как надо и фон вроде не плывет.

Но с поездом - это прям вишенка. Поглядите до конца, он длинный. Сороконожка прекрасна, конечно.

Композ не будет прежним.

@cgevent
🔥6815👍5😱4😁3👎1
House of David - ИИ-инструменты.

Я помню еще на семинарах в матвеевском были холивары - "а это был в максе сделано", "а это только в майке можно".

Потом некоторое время существовала легенда "моделинг в максе, анимация в майке, эффекты к худини, рендеринг в рендермане".

Сейчас у нас тут похожие холивары случаются "Омни - говно, Сиденский - круче, Ранвей - отстой, Клинг - еще норм".

Принес вам два материала про постпродакшен "Дома Давида". Один про использование Клинга, а другой про использование Runway.

Там рассказано, что в кино уже пользуют ИИ в хвост и в гриву. Причем как для сокращения бюджета, так и для расширения рамок креативности. Там к сожалению нет деталей про апскейл и битность цвета, но я сейчас вот о чем.

Вся эта видеогенерация вползает в постпродакшен прямо сейчас, и не будет "лучшего" генератора или апскейлера.
Разные команды одной компании могут использовать разные тулы и выбор может определяться даже личными предпочтениями лидов.

Пока у нас вырисовываются смешные пайпланы (по аналогии с макс-майя-худини) - сиденс для драк, омни для композа и редактирования, клинг для лиц(например)).

Но все это будет меняться каждые три месяца. И все будут использовать всё.

Я реально себя чувствую как в начале нулевых, когда версии майки и рендермана выходили каждые полгода и приводили в восторг юзербазу новыми фичами.

https://youtu.be/atldP-5oKUY

https://runwayml.com/customers/how-house-of-david-used-runway-to-become-amazons-latest-hit-series

@cgevent
👍496🔥2
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

Голубь 2. Короткометражный фильм.

Автор: Анатолий Гейко

Ну что ж, прошлой осенью, как только появилась банана, я собрал первый экспериментальный игровой короткий метр "Голубь", который уже выставлялся на прожарку. После участия в фестивалях и положительных отзывов о фильме, я принял решение продолжить историю и таким образом родилась вторая часть фильма. Голубь 2. Короткометражный фильм.
Теперь быстро о производстве.
Персонажи проработаны через банану. Генерация видео: сиденс 2.0 и немного клинг 3.0.
Из важного. Я категорически не хотел липсинга из вео, как в первом фильме, поэтому искал решение с голосом на русском языке, т.к. сиденс не умеет, да и там нельзя это контролировать. В итоге голоса главного персонажа и наблюдателя сделал в элевен лабс и добавлены в сиденс в генерацию с изображением персонажей. В тот момент ещё сиденс сильно ругался на лица, поэтому приходилось сетку на лица использовать.
Саунддизайн из генераций сразу с видео. Музыка суно.
Апскейл в топаз.
Монтаж в премьер про.
Общее время на создание: две недели с перерывами.
И да, информация в начале фильма изучена и основана на исследованиях.
Бюджет: не знаю, но около 2-3 тыс токенов в синткс.

Так же, фильм можете посмотреть на ЮТУБ и РУТУБ

@cgevent
👍39👎186🔥6
Новый генератор картинок от Микрософта. С кодом

Microsoft Lens:
Base datasets Lens-800M
3.8B DIT with 48-block MMDiT
FLUX.2 VAE
TE ~GPT-OSS 20B
Base resolution 1440×1440
4step Lens-turbo without and 50 steps Lens-Base with CFG

Главный плюс - она очень быстрая. Ну и опенсорсная.

На этом плюсы как-то приподзаканчиваются.

Она еще как-то затаскивает абстрактные картинки, концепты, узоры. Но сыпится на людях.
Но самое удивительное, что у нее практически нет цензуры. Даже на уровне демо.
Правда ее видение анатомии вселяет священный ужас (не открывайте картинку ни в коем случае).

Демо тут:
https://huggingface.co/spaces/multimodalart/lens

Модели:
https://huggingface.co/microsoft/Lens
https://huggingface.co/microsoft/Lens-Turbo
https://huggingface.co/microsoft/Lens-Base

Код:
https://github.com/microsoft/Lens

Комфи:
https://huggingface.co/Comfy-Org/Lens

@cgevent
😱31😁298👍4👎4