Forwarded from Светлый Уголок | ии
Desktop 2026.07.18 - 14.39.37.05.webm
63.8 MB
Squid Game 1 shot
ByteDance представила Seed Audio 1.0.
Аудиомодель, которая генерирует целую звуковую сцену одним промптом: голоса, музыку и эффекты. Заточена под озвучку, аудиокниги, подкасты и дубляж.
* Дамы и господа, сразу ложка дёгтя: с русским у модели всё плохо, мы уже проверили. Так же плохо, как у Seedance 2.5, и это до сих пор не исправили. Возможно, данных для обучения на русском у них просто нет: у всех их моделей с ним беда.
⚪️ Вся сцена за один проход. Мультиперсонажные диалоги с эмоциями, музыка и SFX в одном аудио, без мультитрекового монтажа. Голоса остаются консистентными на длинной записи.
⚪️ Тайминг реплик с точностью до 100 мс. Прямо в промпте задаётся длительность трека и момент входа каждой реплики. Подходит для дубляжа и озвучки с жёстким хронометражем.
⚪️ 20+ языков. Английский, китайский, японский, корейский, испанский, немецкий, французский, тайский и другие. Голос персонажа переносится между языками с сохранением тембра.
⚪️ Клонирование голоса по референсам. До трёх аудиоклипов подключаются к промпту как @Audio1, @Audio2, @Audio3. Вместо аудио можно дать картинку с описанием персонажа.
Карточка модели
Цена: около $0.15-0.19 / минута.
Лимит: 2 минуты аудио за генерацию, промпт до 3000 знаков
❗️ Примечание: официальный прайс BytePlus показывает только в консоли.
Источник РЕН ТВ.
Аудиомодель, которая генерирует целую звуковую сцену одним промптом: голоса, музыку и эффекты. Заточена под озвучку, аудиокниги, подкасты и дубляж.
* Дамы и господа, сразу ложка дёгтя: с русским у модели всё плохо, мы уже проверили. Так же плохо, как у Seedance 2.5, и это до сих пор не исправили. Возможно, данных для обучения на русском у них просто нет: у всех их моделей с ним беда.
Карточка модели
Цена: около $0.15-0.19 / минута.
Лимит: 2 минуты аудио за генерацию, промпт до 3000 знаков
Модель я в соло уже протестировал:
Это что-то классное. Промпт пишите только на английском: русский промпт она толком не понимает и инструкции из него выполнять не будет. Зато на английском можно расписать голоса, характеры персонажей, тайминги и звуки, и она соберёт всё строго по промпту: музыку, реплики, эффекты. Нейросетевого призвука почти нет, и это радует, но иногда он всё же проскакивает.
Кстати на превью модель ещё смотрела видео и генерировала аудио под него, в публичную версию эту функцию пока не добавили.
Источник РЕН ТВ.
Please open Telegram to view this post
VIEW IN TELEGRAM
Bytedance
Seed News - ByteDance Seed Team
From Speech to Audio Creation | Introducing the Seed Audio 1.0 Audio Creation Model
Forwarded from Светлый Уголок | ии
Кстати, модель до сих пор уверенно отвечает, что её отсечка знаний — март 2026 года. Но сама она ничего не знает из этого.
Нам так и не удалось выяснить, что с ней. Либо её не доучили, либо она просто галлюцинирует и не хочет признавать, что в неё заложены такие знания.
В общем-то, если это так и они всё-ещё это не исправили, то в обновлении по итогу смысла то нет.
Нам так и не удалось выяснить, что с ней. Либо её не доучили, либо она просто галлюцинирует и не хочет признавать, что в неё заложены такие знания.
В общем-то, если это так и они всё-ещё это не исправили, то в обновлении по итогу смысла то нет.
Forwarded from Светлый Уголок | ии
Хахаха. Эх... Сказочники гуглы.
https://console.cloud.google.com/agent-platform/studio/multimodal?model=gemini-3.6-flash
Модель уже есть в селекторе Vertex.
https://console.cloud.google.com/agent-platform/studio/multimodal?model=gemini-3.6-flash
Модель уже есть в селекторе Vertex.
Forwarded from Светлый Уголок | ии
Please open Telegram to view this post
VIEW IN TELEGRAM
* Дату подтвердила сама Arena.ai: обещают показать 4.6 у себя на следующей неделе. В таких вещах Арене мы доверяем больше, чем анонсам Маска, так что 7 число это не СЛУХ*.
Советуем ожидать расширение контекста до 1М. В Grok 4.5 мы его не получили, хотя обещали ведь. Также был замечен режим xhigh, его стоит ждать в 4.6.
Grok 4.7, по словам Маска, должен выйти к концу августа. Изменения там серьёзнее:
Обещаний у Маска всегда больше, чем поставленного. 1М контекста в 4.5 тоже обещали. Поэтому и по 4.6, и по 4.7 смотрим на факт СЛУХОВ* релиза, а не на анонсы. Илон уже задолбал!
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New models on Arena:
• gemini-3.5-pro (input: text; output: text, web)
• gemini-3.5-pro (input: text; output: text, web)
Forwarded from watcharena
✏️ Name updates
gemini-3.5-pro ➡️ gemini-3.5-flash
publicName:gemini-3.5-pro ➡️ gemini-3.5-flash
displayName:gemini-3.5-pro ➡️ gemini-3.5-flash
organization:null ➡️ google
gemini-3.5-pro ➡️ gemini-3.5-flash
019fb6ba-031f-7e6b-ac0b-33dc6569bbc4publicName:
displayName:
organization:
👎1