Метаверсище и ИИще
51.3K subscribers
6.46K photos
5.21K videos
48 files
7.51K links
Это не новости, это персональный экспертный взгляд на то, как развивается индустрия ИИ, графики, метаверса, крипты, нейротехнологий и в каком направлении катится все это безобразие.
Для связи: @SergTsyp
Download Telegram
Wan Streamer обновился до 0.2

Версия v0.2 выходит за рамки крупных планов с говорящими лицами и предлагает более насыщенные и привязанные к сцене диалоги в среднем плане: мимика, взгляд, жесты рук и контекст сцены остаются четко различимыми во время разговора в режиме реального времени.

Прокачали немного разрешение и качество. 640×368, 25 FPS.

Писал про него тут:
https://t.me/cgevent/15997
Это экспериментальная модель Alibaba Wan Team для РЕАЛТАМОВОГО общения с AI-аватаром: она одновременно “видит”, “слышит”, “думает”, говорит и генерирует видео в режиме стрима.

Ответочка Runway Characters

https://wan-streamer.com/v0.2/
https://tongyilab.substack.com/p/wan-streamer-a-native-streaming-model

Про код - ни слова.

Диалоги смешные, особенно с псиной.

Можно в зум теперь являться барбосом.

@cgevent
🔥2110
A humanoid is a computer whose API is its hands

(API для робатов - это их руки)

Мне нравится такой мессадж.
NEO’s Hands от 1X - это супер руки для робатов.

25 степеней свободы, причем с копированием человеческой анатомии, а не просто круговые шарниры.
"Кожа" с датчиками, отслеживающими давление, проскальзывание и тд.

Система сухожилий! От предплечья к запястью.

В общем эти руки не для скуки.

Ну, за массажистов!

Гляньте сюда:

https://www.1x.tech/discover/neos-hands

@cgevent
128🔥18👍7😁4😱1
Мускриптор: Audio To MIDI

Kyutai(да, те самые, с реалтаймовым голосом) вместе с MireloAI выпустили MuScriptor - открытую модель, которая превращает готовую песню в набор отдельных MIDI-партий. Она умеет «услышать» барабаны, бас, клавиши, вокал и другие инструменты прямо из финального микса, Без Исходных Дорожек.

Еще раз - в отдельные MIDI-дорожки для разных инструментов. Причем ей не нужны исходные мультитреки - она работает прямо с финальным сведенным миксом.

Демо: https://muscriptor.kyutai.org/

Код: https://github.com/muscriptor/muscriptor

Папира: https://arxiv.org/abs/2607.08168

Пинокия: https://pinokio.co/apps/github-com-cocktailpeanut-muscriptor-pinokio

А теперь представим: берем трек из Суны, разбиваем на МИДИ, суваем в Суну. Аранжировщики, чо.

Для Гиков:

MuScriptor обучали в три этапа. Главная проблема музыкальной транскрипции в том, что почти не существует больших наборов данных, где готовая песня идеально размечена по нотам и инструментам. Поэтому сначала исследователи использовали около **1,45 млн MIDI-файлов**, в которых вся эта информация уже содержится.

Из каждого MIDI во время обучения автоматически создавались десятки вариантов звучания: менялись инструменты, темп, тональность и громкость, после чего композиция **озвучивалась с помощью более 250 различных виртуальных наборов инструментов**. Благодаря этому одна и та же мелодия каждый раз звучала по-новому, а модель училась распознавать музыку в самых разных вариантах исполнения.

Но синтетическая музыка слишком отличается от реальных записей. Поэтому второй этап — дообучение на **170 тысячах настоящих треков** (более 11 тысяч часов аудио). Перед этим MIDI автоматически синхронизировали с живым исполнением, чтобы ноты максимально точно совпадали с записью.

В основе MuScriptor лежит Transformer, который получает спектрограмму аудио и генерирует последовательность MIDI-событий: определяет, какие ноты звучат, когда они начинаются и заканчиваются, а также каким инструментам принадлежат. Модель также может учитывать заранее известный список инструментов в композиции, что заметно снижает количество ошибок.

Финальная настройка выполнялась с помощью reinforcement learning на 300 тщательно проверенных композициях. Вместо оценки отдельных нот модель училась максимизировать качество всей транскрипции целиком. Именно сочетание масштабного обучения на синтетической музыке, большого объема реальных записей и RL позволило MuScriptor добиться высокой точности на сложных коммерческих треках.



@cgevent
2🔥54👍95🙏2
Forwarded from эйай ньюз
Anthropic продлили доступ к Fable 5 ещё на неделю

Кроме этого продлили увеличение лимитов на 50% на ту же неделю. Вот что конкуренция животворящая делает. Интересно, сколько ещё раз они будут проворачивать этот трюк.

@ai_newz
😁56🔥13👍62
Forwarded from Psy Eyes
This media is not supported in your browser
VIEW IN TELEGRAM
Pinokio: вышла версия v8 этого софта для упрощённой установки AI-приложений. Можно из Explore как поставить популярные типа Comfy, WanGP, итд, так и создать свои приложения/плагины в Сreate с помощью языковых моделей.

Что нового:

* Ускорена работа и отзывчивость.

* Переделан и упрощен интерфейс. Отдельные вкладки для чекпоинтов, вспомогательных инструментов, скилов, итд, где можно установить недостающее.

* Отдельная кнопка для расшаривания доступа к Pinokio по локальной сети. А в настройках конкретных приложений можно включить доступ из интернета через Сloudflare.

* На вкладке Autolaunch можно задать какие приложения в каком порядке должны запускаться при включении Pinokio. Также теперь можно одно приложение сделать зависимостью для другого, а Pinokio будет оркестратором. Пригодится, например, при автоматизации пайплайна, где первым должен запускаться комфи с конкретным ворфлоу и его генерации должны подгружаться в другие прилы.

* Если где-то возникает ошибка, её можно скормить нейронке через Ask AI или спросить сообщество. С Hermes и локальными моделями это пока ещё не работает — только облачными Сlaude, Codex, Antigravity.

* Монитор загрузки CPU, GPU, RAM, свободного места.

* Теперь Pinokio имеет полностью открытую лицензию, свободную для коммерческого использования.

Cайт
Гитхаб
YouTube
👍397👎1
Война сбросов лимитов.

Конкуренция ~ это прям прекрасно.

ОпенАЙ убрали пятичасовые лимиты.

Добавляют сброс баланса и ещё много чего.

@cgevent
🙏6921👍14😱4🔥2👎1
Media is too big
VIEW IN TELEGRAM
Если вы не в курсе, то Эппле судится с OpenAI

Они обвиняют компанию в использовании коммерческих секретов для создания собственного устройства. По версии Apple, бывшие сотрудники не просто перешли к конкуренту, а прихватили с собой внутренние документы и инженерные наработки, которые могли помочь OpenAI срезать годы разработки. Если это подтвердится, речь идет уже не о привычном переманивании талантов, а о вполне классическом промышленном шпионаже.

OpenAI, разумеется, всё отрицает. Но сам факт такого иска показывает, насколько высоки ставки в гонке за «следующий iPhone эпохи ИИ». Еще вчера Apple и OpenAI рассказывали со сцены о сотрудничестве и интеграции ChatGPT в Apple Intelligence, а сегодня хлещутся в суде.

https://9to5mac.com/2026/07/10/apple-sues-openai-trade-secret-theft/

Это Kling 3.0

@cgevent
😁61🔥95
This media is not supported in your browser
VIEW IN TELEGRAM
Токеномика: как заставить GPT-5.6 Sol работать внутри Claude Code

Option 1, the official plugin:
/plugin marketplace add openai/codex-plugin-cc
/plugin install codex@openai-codex
/reload-plugins, then /codex:setup

Это открывает /codex:review, /codex:adversarial-review and /codex:rescue. Claude пишет, GPT критикует.

Option 2, the proxy. One alias makes Sol your main model:


alias claudex=‘CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 claude –model gpt-5.6-sol’

Bonus: Claude Code lets you set subagent model and effort yourself.

Сорс

@cgevent
🔥30😁6😱31
Держите немного утечек и примеров из Seedance 2.5

Пока никакого доступа на Jimeng нет.

Раскатали доступ небольшому количеству китайских (и, возможно, корпоративных) пользователей.

Завтра, 14 июля, не релиз на Китай, а более широкий rollout на китайскую бета-аудиторию.

Пока только 720р и 30 секунд. Про 1080 и 4К ничего не слышно и не видно.

Ну и поглядите на пример с кухней.

Никаких склеек.

P.S. Все наверное уже привыкли. А у меня до сих пор бровь дергается - представьте, что вам надо вкомпозить огонь на сковородку - сколько возни с лайтингом на окружающих предметах. А тут все "само"...

@cgevent
👍38🔥31😱13👎94😁3