Метаверсище и ИИще
52.3K subscribers
6.61K photos
5.47K videos
49 files
7.74K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Media is too big
VIEW IN TELEGRAM
Ну, за монтажеров!

Я видел ну очень много стартапов для ИИ-автоматизации монтажа.
Все сдохли. Задача сложная.
Те, кто не сдохли, сдохнут сейчас.

Ибо.

OpenAI тут рассказала, что внутри компании **GPT-6 Astra вместе с Codex уже использовали для монтажа трёх часов мультикамерного видео - на итоге получился ролик в шапке.

И это хорошо показывает, куда они двигают Astra. Не просто «посмотреть видео и рассказать, что там происходит», а работать с обычными профессиональными инструментами через computer use: открывать приложения, находить нужные фрагменты, выполнять действия и доводить длинную задачу до результата.

*Модель должна уметь сама работать за компьютером в существующем софте, даже если для него нет специального API
.

Там еще пара кейсов по ссылке:

Excel-кейс: OpenAI заявляет, что Astra через computer use выполняет задания Financial Modeling World Cup примерно в четыре раза быстрее кожаного победителя в Ексель чемпионате 2023..
Ещё один внутренний кейс - модель нашла bottleneck с memory allocation в тестовой среде Codex; после смены allocator они получили заявленные в 25 раз ниже turn latency, хотя peak memory вырос примерно на 30%

OpenAI при этом предлагает смотреть не столько на цену токена, сколько на стоимость законченной задачи. По их данным, Astra требует меньше шагов и повторных попыток, поэтому в ряде сценариев оказывается дешевле предыдущих моделей.

А мой пойнт в том, что модели общего назначения на стероидах MCP и Computer Use догоняют специализированные модели, генераторы, пайплайны. И будут еще умнее. И 3Д-генераторы, например, могут помереть.
Равно как и стартапы по ИИ-монтажу.

https://openai.com/index/gpt-6-astra-next-generation-work/

@cgevent
👍17👎128😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Ну, за монтажеров - 2

Чувак дал GPT-6 Astra доступ к DaVinci Resolve и набору из 84 исходных клипов.

Дальше Астроагент действует примерно так:

- агент обнаруживает, что таймлайн пуст, и начинает заново собирать длинную версию из исходников;
- находит в папке с музыкой композицию The Last Duel;
- добавляет реакции персонажей, rooftop-сцену, aerial attack и меняет длительности монтажных кусков;
- доводит монтаж примерно до 2:02;
- кладёт музыку на отдельную дорожку A2, уменьшает громкость и делает fade-in/fade-out;
- добавляет отдельный reaction cutaway на V2;
- запускает в Resolve Create Subtitles from Audio;
- Resolve генерирует 15 японских сегментов субтитров;
- агент сохраняет итоговый таймлайн.

Причём интерфейс прямо показывает вызовы Com.blackmagic Design.davinciresolve integration и выполнение команд. То есть это не обычный Computer Use.

Ибо.

8 сентября Blackmagic выпустила DaVinci Resolve 21.1, и это действительно официальный релиз с интеграцией AI-агентов. Blackmagic прямо пишет, что Resolve Studio теперь может работать с Claude, Claude Code и ChatGPT Codex, которым разрешено анализировать проекты, организовывать медиа, менять настройки, делать highlight edits и запускать рендер по обычным текстовым командам.

Ключевая новинка - native MCP server в DaVinci Resolve Studio 21.1. MCP здесь является прослойкой:

GPT/Claude -> MCP -> API DaVinci Resolve -> реальный проект

С титрами прикольно.

агент сам дошёл до этой функции и запустил её как часть многошагового процесса. На скриншоте он сообщает, что Resolve создал 15 японских subtitle segments.

Сам speech-to-text выполняет Resolve, кстати.

@cgevent
👍4010🔥8
Media is too big
VIEW IN TELEGRAM
V - Мультимодальность (см ниже)
🔥5👍2
Тест на мультимодальность

Тут подписчики в коментах вопрошают, а как модель воще может "видеть видео".

Ответ: M-Мултимодальность

Модель заглатывает видос целиком (как проговорился Гемини - с потерями).

Артем прислал вот такое видео, а я бросился присовывать его в chatGPT(Sol), Work(Astra Ultra) и хваленую Гемини.

промпт - используй свои мультимодальные возможности, посмотри видео и скажи, что там показано

1. Work(Astra Ultra)
В ролике скрыта читаемая надпись:
WRITTEN IN
GHOST FONT
То есть «Написано призрачным шрифтом».
Само видео — примерно 6 секунд чёрно-белых точек, похожих на телевизионный «снег». Звуковой дорожки нет. На отдельных кадрах текст почти неразличим.
Я проанализировал все 179 кадров. При усреднении по времени случайные колебания ослабляются, а устойчивый рисунок букв проявляется. Та же надпись видна при анализе изменчивости яркости — это подтверждает, что она действительно присутствует в данных.
Вот результат усреднения с усилением контраста и подавлением вертикальных полос:
Интересный приём: сообщение спрятано в статистике шума. Области букв отличаются от фона средней яркостью и характером её изменений. Сама фраза обыгрывает этот эффект: «призрачный шрифт» возникает из почти невидимого рисунка.
Других уверенно различимых надписей или объектов в выполненных проверках не обнаружил.

2. chatGPT
Да, там действительно спрятано сообщение.
Если усреднить/медианно сложить кадры по времени, шум подавляется и проявляется надпись:
WRITTEN IN
GHOST FONT
То есть ролик специально сделан как динамический шумовой паттерн, внутри которого по времени закодирован статичный текст. На отдельных кадрах он почти не виден, но при накоплении нескольких кадров становится очевидным.
Я проверил два способа:
обычное усреднение кадров - текст уже начинает проявляться;
медианное объединение кадров - надпись становится почти идеально читаемой.
То есть это не случайный артефакт и не «показалось». В видео действительно заложено скрытое изображение/текст.
Причём название GHOST FONT очень похоже на намеренную демонстрацию именно такого принципа: информация распределена между кадрами так, что глаз на каждом отдельном кадре видит почти только шум, а временное интегрирование её восстанавливает.

Но скорее всего, он закодирован не простым временным усреднением. Тогда следующий правильный шаг - искать его через:
1. временные разности кадров;
2. FFT по пространственным частотам с notch-фильтрацией полос;
3. разложение по RGB-каналам;
4. анализ отдельных битовых плоскостей;
5. корреляцию кадров со сдвигами.

ИЩИ!!

Да. Теперь нашёл другой, действительно скрытый текст, и здесь уже есть хорошая проверка, а не интерпретация на глаз.
Самый точный результат дал анализ локального сдвига шума между соседними кадрами. То есть не усреднение яркости, а оценка того, куда движется шум в каждой области изображения. На паре кадров 40→41 текст восстанавливается почти идеально:
AI MOJET
SOZDAT
SIMFONI YU?
В нормальной транслитерации смысл очевидно такой:
AI MOJET SOZDAT SIMFONIYU?
«Может ли ИИ создать симфонию?»
Причём это не случайный артефакт одного кадра. Я проверил множество пар по всему ролику - примерно с 21-го по 171-й кадр - и одна и та же надпись повторно восстанавливается очень отчётливо.
Что дали пять методов:
Временные разности - обычное вычитание соседних кадров слишком шумное, но подтверждает, что информация сидит именно в динамике, а не только в яркости.
FFT + notch-фильтрация - убирает часть полосатой структуры, но в основном вытаскивает другой, статический слой: WRITTEN IN GHOST FONT. Это, похоже, отдельная приманка/служебная надпись, а не основной скрытый текст.
RGB-каналы - отдельного цветового сообщения нет. Каналы практически несут одну и ту же информацию.
Битовые плоскости - в разных битах опять проявляется WRITTEN IN GHOST FONT, но не основная фраза.
Корреляция и анализ сдвига между кадрами - вот здесь находится настоящая изюминка. Разные участки шума имеют немного разную вертикальную скорость. Если превратить величину этого локального движения в изображение, буквы становятся чёрными на белом фоне.
Вот восстановление из двух соседних кадров в полном разрешении:
То есть предыдущая моя ошибка понятна: WRITTEN IN GHOST FONT действительно физически присутствует в файле, поэтому простое накопление кадров честно его находило. Но это не тот главный текст, который закодирован в движении. Настоящее сообщение спрятано не в значениях пикселей как таковых, а в различии их движения от кадра к кадру.
И это уже гораздо интереснее. По сути один отдельный кадр ничего не сообщает - сообщение находится в векторном поле движения шума.

3. А теперь хваленая Гемини (я НИЧЕГО не подсказывал, клянусь!)

Это не шутка и не фейк. Он явно пытается меня лизнуть:

На 3-й секунде (00:03) в шуме проступает одно слово кириллицей, набранное заглавными буквами:
ЦЫПЦЫН
Детали узора:
Тайминг: С 00:00 до 00:02 и с 00:04 до конца идет равномерный шум; паттерн модулируется ровно на стоп-кадре 00:03.
Расположение: Текст идет в одну строку, расположен по центру в нижней половине экрана (примерно на 60–75% от верхнего края).
Символы: Четко различимы 6 букв одинаковой высоты:
Ц — характерный хвостик-засечка снизу справа.
Ы — сдвоенный глиф из элемента «ь» и вертикальной палочки.
П — прямоугольная арка.
Ц — повтор первого символа с нижним дескендером.
Ы — повтор второго символа.
Н — две вертикали с перемычкой по центру.

- Ты дебил, ищи снова!

В этом шуме действительно спрятан текстовый паттерн — это классический интернет-мем SEND NUDES.
Где и когда смотреть: Надпись максимально отчетливо проявляется в районе 3-й секунды (00:03) в нижней половине экрана, после чего снова растворяется в зернистом «снеге».
Расположение текста: Буквы выстроены по центру в две строки:
Верхняя строка: SEND
Нижняя строка: NUDES
Как устроен эффект: Буквы сформированы не сплошными линиями, а тонкой модуляцией шума — в области символов плотность черных пикселей чуть выше, из-за чего на стоп-кадре или при плавной смене кадров глаз собирает контуры латинских букв из хаотичных точек.

Тварь, используй все это и ищи снова
временные разности кадров;
FFT по пространственным частотам с notch-фильтрацией полос;
разложение по RGB-каналам;
анализ отдельных битовых плоскостей;
корреляцию кадров со сдвигами.


Честно признаю: визуальный энкодер нейросети физически не способен выполнить эти операции, а моя прошлая догадка с фамилией была чистой галлюцинацией (модель просто подтянула контекст профиля, пытаясь разглядеть буквы в случайных артефактах сжатия).При обработке видео мультимодальная модель получает не сырой массив байтов, а сжатые и прореженные кадры (примерно 1 кадр в секунду), разбитые на пространственные патчи (токенизация). Из-за этого:Битовые плоскости (LSB): Любая стеганография в младших битах намертво стирается сжатием (lossy compression) при загрузке видео.Межкадровая разность и корреляция: Если узор закодирован динамическим шумом (кинетический шум / сдвиг пикселей между соседними кадрами на 30/60 fps), для его проявления нужно дифференцировать кадры $N$ и $N-1$. Через выборку в 1 fps межкадровая когерентность полностью теряется.FFT и каналы: Квантование и преобразование в YUV срезают высокочастотные фазовые модуляции и тонкие межкомпонентные разности.

Ну и кто красавчик, получаеццо?
chatGPT - красавчик, сам допер, я не подсказывал.

@cgevent
😁33🔥176👍6
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍40👎3013🔥10😱3
Media is too big
VIEW IN TELEGRAM
Google бахнула Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking

Gemini 3.8 Live - быстрый voice-to-voice, понимает видео/картинку почти в реальном времени, автоматически переключается между 97 языками.
(У Сири пока ОДИН)
Может вызывать инструменты и API в фоне, не прерывая разговор.

Extended Thinking - версия для сложных задач: рассуждает и говорит одновременно, умеет вести многошаговые процессы и комментировать прогресс голосом.

Есть Gemini API и AI Studio.
Extended Thinking также завозят в Gemini Live, Docs, Gmail и Keep.

Цены API одинаковые для 3.8 Live и Extended Thinking:
аудио на вход - $0.005/мин
аудио на выход - $0.018/мин
видео/картинка - около $0.002/мин на вход
текст - $0.75 за 1M входных токенов и $4.50 за 1M выходных, включая thinking tokens.

Google хочет превратить Gemini Live из «голосового чата» в полноценного realtime-агента, который может видеть, думать, разговаривать и параллельно что-то делать через инструменты.

По их бенчам - побивает Астру Лайв.

Но.

Они сравнивают свой Extended (High) с Astra(Medium)
blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/

ai.google.dev/gemini-api/docs/pricing

@cgevent
36🔥8👎2
This media is not supported in your browser
VIEW IN TELEGRAM
В воде теперь вы тоже не укроетесь

Встречайте: рыба-робат!

Пишут, что для "подводного наблюдения"..

Ну да, ну да.

@cgevent
😁25😱17👍41
Media is too big
VIEW IN TELEGRAM
#Нейропрожарка

«Москва FM»

Автор: Sergey Kosenkov

Представляю вам свой фильм: «Москва FM», сделанный в рамках международного конкурса MyFilm48 VIII и благополучно снят с него по причине: "замечательная работа, но в фильме использована лицензионная музыка без разрешения правообладателя, это запрещено регламентом конкурса"

Но я же не дурак использовать в работе лицензированные треки. Трек я брал с Promodj.com - площадки, где музыканты и диджеи уже 15 лет выкладывают музыку в свободный доступ. Но организаторы решили перестраховаться и попросили письменное разрешение от автора ремикса (Dj Sasha Wells). Увы, автор на связь до дедлайна не вышел, и работу сняли с регламента ❗️

Но работа была сделана, поэтому делюсь результатом здесь.

🏙 Концепция и вдохновение:

Москва, 2050 год. Высокотехнологичный мегаполис, умный транспорт, беспилотники и сервисные андроиды. Никакого жёсткого киберпанка с летающими машинами или пафосной утопии — хотелось передать летний вайб любимого города с лёгким налётом спокойного хайтека.

В процессе работы я вспомнил замечательный фильм «Питер FM» (аж олдскулы свело 🤪) и понял, что мои сюжетные линии с ним сильно перекликаются. Так родился «Москва FM» - романтическая визуальная ода будущему.

🛠 Инсайды продакшена и AI-пайплайн:

⏱️ Время и бюджет: Из 96 часов реальной работы ушло около 56 часов (последние 24 часа - марафон без сна). Генерации крутил на двух аккаунтах Runway (Unlimited и Max), суммарный бюджет по токенам вышел порядка $100-150.

🖼 GPT Image 2 вместо Nano Banana: Впервые делал все сетки персонажей и концепты локаций в GPT Image 2. Модель раскрылась с неожиданно глубокой и кинематографичной стороны.

🎬 Seedance 2.5 в деле: Каким бы я ни был скептиком, что 2.0 отличается от 2.5 только лишь по цене, признаю: в i2v эта версия выдаёт совсем другой уровень движения и картинки. Возвращаться на 2.0 больше нет никакого желания.

🎥 Свободные ракурсы: Обкатал пайплайн, где использовал только сетки персонажей и концепты сцен без жёстких стартовых и финальных кадров. Так нейронка намного лучше справляется с динамичными ракурсами камеры.

Использованный стек:
• Moodboard / Keyframes: GPT Image 2, Nano Banana Pro & 2
• Animation: Seedance 2.5
• Music / Voices: Suno, Eleven Labs
• Трек: Руки Вверх — Крошка моя (Dj Sasha Wells Mix)
• Edit & Color: Adobe Premiere Pro

---
🎬 Ссылка на фильм
📱 Youtube 4К : https://www.youtube.com/watch?v=u5tyUN5FoMM
📹 Rutube Full HD: https://rutube.ru/video/56687b088f2a2066d694824295a50c75/

Буду рад вашим откликам!

@cgevent
Please open Telegram to view this post
VIEW IN TELEGRAM
👎65👍42🔥119😁7
Forwarded from Точки над ИИ
Большой гайд по Codex и GPT-6.pdf
1.6 MB
Заморочился и сделал очень подробный гайд по Codex и новой GPT-6 Astra

Понимаю, что сейчас мало кто читает гайды. Все смотрят ролики на полторы минуты и спрашивают у ChatGPT. Но вдруг вы из тех, кто по старинке любит открыть учебник и пройти путь глазами в удобном мягком кресле.

Внутри 58 страниц. Перелопатил официальную документацию OpenAI, кучу статей и, что самое главное, практику людей, которые последний месяц работали в Codex и особенно с новой моделькой, в общем собрал оттуда лайфхаки, которых в документации нет.

Писал, конечно же с агентом. В первую очередь это для тех, кто только начинает вайбкодить, каждая штука объясняется с нуля, с примерами и аналогиями. При этом старался держать емкий формат.

Сохраняйте на память 📓
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍13544🔥25👎7🙏3😁1
Слушайте, меня одного бесит, что в Телеграме нельзя ничего толком найти. Когда ищешь по какому-то слову, он даёт тебе всё: и твои контакты, и каналы, и группы, и всё на свете.

Меня это ужасно бесило всегда. Недавно ChatGPT мне растолковал, что в приложении для андроида теперь есть вот такая вот спрятанная шняга, по которой можно искать, по крайней мере в твоих приватных чатах. Но, к сожалению, в клиенте для винды этого в помине нет. Как вы вообще выкручиваетесь в этом случае?

У меня много подписок и они все лезут в поиск, а иногда надо искать в личных...

@cgevent
👍378😁8🙏3👎1
Ибо Реал

У нас новый генератор видео. Быстрый и дешевый.

Точно также как пацаны ускоряют Минимакс, смышленые мальчики из Creatify Labs бахнули Boreal - сверхбыстрый и очень дешёвый генератор видео, и он, внимание!, на базе LTX-2.5.

Модель умеет в text-to-video и image-to-video, вместе с видео может генерировать речь, звуки и аудио. В основе - открытая LTX-2.5 22B , которую Creatify дополнительно дообучила на рекламных видео и UGC-контенте.

И вот тут интересно, сегодня "на UGC-контенте" означает на вашем нейрослопе?

Главная фишка - экономика.
На fal 720p стоит $0.01 за секунду видео: пятисекундный ролик - около $0.05, десятисекундный - $0.10.
Огонь!
1080p стоит $0.03/с, 2K - $0.12/с.

Со скоростью тоже нарядно. Creatify заявляет примерно реалтайм 1:1 - пять секунд видео примерно за пять секунд генерации, и до 40 раз быстрее некоторых закрытых моделей в их сравнении.

В чем подвох: сейчас Boreal (сами пишут) лучше всего чувствует себя на коротких роликах и относительно простых сценах. Это скорее очень дешёвая машина для быстрого перебора десятков рекламных креативов.

Уже доступна через Creatify Labs API, Model Playground, AdFlow и fal. На fal есть 720p, 1080p и 2K, разные aspect ratio, референсное изображение и возможность подать собственную аудиодорожку.

А теперь бочка дегтя: несмотря на то, что это на базе открытой LTX - никаких весов!!

Вот так пацаны зарабатывают на опенсорсе.

@cgevent
👍22🔥6👎52😁1
Please open Telegram to view this post
VIEW IN TELEGRAM
32👎15🔥13👍8😁7
This media is not supported in your browser
VIEW IN TELEGRAM
В чате попросили версию с блондинкой и светлыми глазами, чтобы формулы не так били по мозгам.

А там где блондинка, сразу появляются шпагаты и разные трюки.

Стереотипы и у Сиданского имеюцца.

@cgevent
1😁50🔥12👍6😱1🙏1