Источник КодХаб
6.3K subscribers
822 photos
81 videos
865 links
⚡️Заявки принимаем моментально

Подборка AI-инструментов на любой вкус и цвет

Сотрудничество: @cmd_dark, @CMD_Vega

Ютуб: https://www.youtube.com/@ih_codee
ТикТок: https://www.tiktok.com/@ih_code
Download Telegram
🎬 Google Vids стал бесплатным для всех пользователей

📌 Google расширила доступ к своему инструменту для создания видео — Vids теперь доступен всем без платной подписки. Ранее функция была ограничена подписчиками Google Workspace и специализированных AI-планов, но теперь базовый редактор с шаблонами и стоковыми ресурсами открыт бесплатно.

📲 Инструмент предоставляет интерфейс, похожий на Google Slides, и позволяет:
🟢Создавать видеопрезентации с помощью шаблонов (how-to, документальные форматы и др.),
🟢Загружать файлы с диска, записывать себя или экран,
🟢Добавлять текст, изображения, звук и эффекты,
🟢Экспортировать видео в MP4 и делиться ими через ссылку.


Среди новых AI-функций, доступных пользователям Pro, Workspace и AI-планов:
🟢Преобразование изображения в 8-секундное видео при помощи модели Veo 3,
🟢Автоматическое удаление слов-паразитов и пауз (transcript trim),
🟢Использование AI-аватаров (12 вариантов) с синхронизацией губ,
🟢Планы по добавлению шумоподавления, фильтров и форматирования видео (вертикальное, горизонтальное, квадратное).


📌 Google также запустил обучающую серию Vids on Vids на YouTube, чтобы показать, как пользоваться инструментом на практике, с примерами создания сторибордов, анимаций и переходов.

🔗 Попробовать: Google Vids
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👏1
This media is not supported in your browser
VIEW IN TELEGRAM
⭐️ Lipsync-2-Pro — дипфейки голливудского уровня прямо в браузере

📌 Lipsync-2-Pro от Sync Labs — это AI-инструмент для профессионального синхронного движения губ, который работает через браузер и API, без ручной настройки.
🟢Студийное качество в минуту, а не недели: модель синхронизирует речь с видео максимально естественно, сохраняя уникальные особенности голоса и лица, включая бороду, веснушки и грим благодаря диффузионной суперрезолюции.
🟢Поддержка 4K видео и любые форматы: работает с живыми съемками, 3D-анимацией и AI-генерацией — железный инструмент для современных видеокреаторов.
🟢Доступность и гибкость: доступен в студийном и API интерфейсах. Требуется план Scale или выше для API, а в Studio доступ открыт для всех, плата только за использование.


🔗 Где можно попробовать? Все модели, включая lipsync-2-pro, доступны для тестирования по ссылке
Please open Telegram to view this post
VIEW IN TELEGRAM
2
OpenAI объявила Realtime API с моделью gpt-realtime — готово к боевому применению

OpenAI завершила бета-тестирование Realtime API и запустила его в продакшен, а также представила новую модель gpt-real‌time, которая значительно улучшила качество и скорость голосового взаимодействия. Модель обрабатывает речь напрямую — от ввода до вывода — в одном потоке, что устраняет задержки и сохраняет эмоциональную окраску голоса. В арсенале появились два новых выразительных голоса — Cedar и Marin, а существующие — обновлены. К API добавились возможности: поддержка изображений, SIP-звонки, подключение внешних инструментов через MCP и сохранение повторно используемых промтов.

Технически модель показывает впечатляющие результаты:
82.8% на Big Bench Audio (ранее — 65.6%)
30.5% на MultiChallenge (против 20.6%)
66.5% на ComplexFuncBench (против 49.7%)


Эта технология открывает новые возможности: голосовые колл-центры с естественным диалогом, голосовые помощники в медицине, интеграции с CRM, голосовые интерфейсы в автомобилях, обмен изображениями с голосовым комментарием и сценки в реальном времени.

📎 Подробнее: Realtime API
2🔥2
🌐 Framer AI: автопилот для создания сайтов с помощью текстовых подсказок

📌 Framer представляет набор AI-инструментов для веб-дизайна, которые облегчают путь от идеи до запуска сайта. Среди новинок — Wireframer для быстрой генерации макета по текстовому запросу, Workshop для создания компонентов в стиле вашего дизайна и Vector для настройки векторной графики и иконок. Добавили также Advanced Analytics — метрики и A/B-тестирование в один клик. И всё это сразу доступно без ограничений.

📌 Framer теперь превращает текст в лендинг за секунды — достаточно описать, что нужно, и AI подберёт палитру, иконки, типографику, даже сгенерирует копирайт. Кроме того, можно применять AI-плагины: перевод сайта одним кликом, перепись текста, генерация изображений — и всё на базе GPT, Anthropic и Gemini.

📌 Framer AI идеально подойдёт стартаперам, дизайнерам и тем, кто хочет сделать сайт быстро и красиво без кодинга. Благодаря plug-and-play AI-плагинам создавать мультиязычные сайты, оптимизировать контент и обновлять дизайн стало действительно удобнее и быстрее.

🔗 Попробовать: Framer AI
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3👍21
✍️ Rytr — ваш AI-ассистент для текстов

📌 Rytr — это AI-инструмент для автоматического написания текстов: от блогов и маркетинговых постов до email-рассылок и описаний товаров. Он помогает сэкономить время и находить креативную подачу, действуя как персональный копирайтер.

📌 Он предлагает более 40 сценариев использования — от генерации CTA и SEO-заголовков до постов в соцсетях и описаний продуктов. Есть встроенные функции для редактирования текста, проверки грамматики, антиплагиата и даже простого визуального редактора.

🤪 Rytr поддерживает работу на 30+ языках, включая русский, и предлагает 20+ тонов письма для кастомизации стиля. В бесплатном тарифе доступно 10 000 символов в месяц, дальше — безлимитный и полный доступ к языкам и шаблонам от $9/месяц.

🔗 Попробовать: Rytr
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1
🖥 Fast Deep Coder — прорыв в мире AI-кодинга

Fast Deep Coder от NinjaTech AI и Cerebras Systems — это инструмент нового поколения, который сокращает цикл «план → код → тест» с привычных 10–15 минут до всего 1–2 минуты, ускоряя разработку до 5–10 раз. Он работает на базе модели Qwen3-480B, ускоренной с помощью инфраструктуры Cerebras, и запускается в облаке SuperNinja — отдельной виртуальной машине с логами, тестами и интеграцией с GitHub.

🧑‍💻 На тестах по стандарту SWE-Bench Fast Deep Coder набрал 69,6 %, превзойдя Gemini 2.5 Pro (63,2 %) и почти сравнявшись с Sonnet 3.7 (70,3 %). Уникальная скорость выполнения не отнимает точность — итерации стали быстрее, а код остаётся качественным.

🧑‍💻 Это решение особенно пригодится тем, кто ценит максимальную производительность в кодинге — разработчикам, стартапам и enterprise-командам. Благодаря прозрачному и воспроизводимому процессу, постоянному контексту и мощной среде, Fast Deep Coder действительно меняет правила AI-разработки на 2025 год.

🔗 Попробовать: Fast Deep Coder
Please open Telegram to view this post
VIEW IN TELEGRAM
1
🔵 Hunyuan3D от Tencent: 3D-модель из картинки за 25 секунд

📌 2-ступенчатый пайплайн: сначала Hunyuan3D-DiT создаёт геометрию по картинке, затем Hunyuan3D-Paint наносит текстуры — модель выходит детализированной и готовой к использованию. Результат за 10–25  секунд, в зависимости от версии (Turbo — быстрее).

📈 Дерзкий прогресс перед другими
🟢 Hunyuan3D 2.0 показывает лучшие показатели geometric accuracy, FID и CLIP-score — превосходит доступные аналоги.
🟢 "Turbo" модели выдают результат всего за 30 секунд — они выгодно обгоняют конкурентов.
🟢 Открытый исходник на GitHub: есть предобученные модели, код, описания и даже Blender-addon.
🟢 Модели адаптированы под Gradio, ComfyUI и даже Windows-инсталлер — все удобно для разработчиков и дизайнеров.


🔍 Что внутри?
🟢 Hunyuan3D-DiT: Генерирует неокрашенный меш (геометрию) из одной картинки
🟢 Hunyuan3D-Paint: Накладывает текстуры высокого разрешения (PBR, цвет, рельеф)
🟢 Версии Turbo & Mini: Ускоренные модели с меньшим количеством параметров и VRAM


📌 Возможности
🟢GLB, OBJ, FBX экспорт, PBR-текстуры, готовые meshes для VR/AR/игр
🟢Поддержка мультивида в 2.1/2.5 — можно качать детализацию, если есть несколько ракурсов.


🔗 Репозиторий на GitHub
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🌐 Bolt.new — браузерная AI-платформа для быстрой генерации, редактирования и деплоя веб-приложений (React, Next.js, Node.js и др.) прямо из чата, без локальной настройки.

📌 Особенности:
🟢Web IDE + AI в одном окне
🟢Управление файлами, npm, CI/CD
🟢Быстрый деплой через Netlify, Supabase и др.


⚙️ Архитектура и параметры:
🟢Основан на WebContainers (бэкенд работает в браузере)
🟢Использует собственный агент + LLM (через API)
🟢Поддержка JS/TS, React, Vue, Node.js, API-роутов
🟢Хранение кода в Bolt FS, экспорт в GitHub


👍 Преимущества:
🟢Старт за 1 минуту, без установки
🟢Полный стек, даже бэкенд в браузере
🟢Отлично подходит для MVP и демо


🔗 Попробовать: Bolt.new
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
🔵 Napkin AI — когда мысли становятся картинками

📌 У тебя есть идея, концепт или просто абзац текста — а хочется, чтобы это выглядело как презентация, инфографика или понятная схема? Napkin AI превращает слова в визуал. Прямо в браузере. Без дизайнеров, фигм и шрифтовой боли.

📌 Что это вообще такое?
Napkin — это веб-сервис, который превращает текст в визуальные слайды, инфографику, mind map'ы или диаграммы. Выглядит как если бы Google Docs, Miro и PowerPoint слились в одного удобного нейро-монстра.

✍️ Как работает:
🟢Вводишь идею, описание, план или даже просто поток мыслей
🟢Нажимаешь одну кнопку
🟢Получаешь чистую визуалку, где всё логично, красиво и структурировано


📊 Что именно можно получить:
🟢Инфографику по своему тексту
🟢Слайды в минималистичном или корпоративном стиле
🟢Умные карты, диаграммы, схемы
🟢Экспорт в PDF / PPT / PNG / SVG
🟢Возможность редактировать всё: от цвета до иконок


🌍 Поддержка 50+ языков
👥 Совместная работа с коллегами
🔗 Можно делиться, комментировать, собирать фидбек прямо в проекте

⚠️ Минусы
🟢Иногда выходит скучновато или не в тему — всё равно править придётся
🟢Но как заготовка или старт — топ


🔗 Попробовать можно тут: Napkin AI
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2🔥2
🔵 LLPlayer — видео-плеер с AI-субтитрами для языкового обучения

📌 Описание:
LLPlayer — это open-source плеер для Windows, созданный специально для тех, кто учит язык. Он отображает две дорожки субтитров одновременно и использует AI—Whisper от OpenAI для автоматической генерации текста и перевода в реальном времени.

🎯 Основные фишки:
🟢Двойные субтитры: показ двух языков сразу, с гибкими настройками размера и положения.
🟢AI-субтитры: Whisper (whisper.cpp или faster-whisper) понимает до 100 языков и работает на CUDA/Vulkan/OpenVINO для ускорения.
🟢Реальный перевод: перевод в 134 языках через Google, DeepL, Ollama, OpenAI, Claude с учетом контекста.
🟢OCR-тексты: распознаёт bitmap‑субтитры с помощью Tesseract или MS OCR.
🟢Поиск слов и панель субтитров: клик — и слово всплывает с переводом; можно искать внутри субтитров.
🟢Поддержка онлайн-видео: через yt-dlp плеер показывает видео с YouTube и сразу vчит субтитры/перевод.


⚙️ Технические детали:
🟢Написан на C#/WPF, открыт под GPL‑3.0.
🟢Бесплатный и работает локально — никакие серверы не лезут в твои субтитры.
🟢Версия 0.2.2 (май 2025) добавила поддержку LLM‑переводов (Qwen3, DeepSeek), интерфейсные улучшения и поиск по субтитрам.
🟢На VideoHelp плеер хвалят как нишевый и ценный инструмент для изучения языков.


🔗 Попробовать: LLPlayer
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥21
Genspark AI — ИИ-агент для автопродакшна видео на русском языке

Genspark AI теперь умеет монтировать видео по запросу — и поддерживает русский язык. Бесплатная версия даёт до 100 кредитов в день (обычно хватает на один ролик), а для продвинутых задач доступны платные подписки от $25 в месяц.

Что умеет Genspark в плане видео:
обрабатывает видео дольше часа или сразу несколько трансляций (например, спортивные матчи),
выбирает ключевые моменты и автоматически генерирует монтаж,
создаёт расшифровку и накладывает субтитры (включая на русском, английском, японском),
находит и вырезает нужный фрагмент по текстовому запросу без таймкодов,
позволяет сэкономить часы рутины — в примере из интервью с Сэмом Альтманом сделал 10-минутную выжимку за пару минут.


Genspark Super Agent — это целая экосистема нейронных сетей (включая ChatGPT, DeepSeek, Kling и другие) под капотом, которая умеет длину видео анализировать, фрагменты монтировать и субтитры генерировать автоматически.

📎 Попробовать: Genspark AI
🔥2
🔵 OpenHands — платформа для AI-ассистентов, которые кодят вместо вас
OpenHands (ранее OpenDevin) — open-source фреймворк, который превращает LLM-модель в полноценного AI-инженера: редактирует код, запускает команды, работает с вебом и API, берёт примеры с StackOverflow. Всё — локально, конфиденциально и бесплатно.

📌 Почему это может быть интересно:
- Автономные агенты: могут модифицировать репозиторий, выполнять terminal-команды, браузить документацию и вызывать API.
- Быстрый старт: запускается через Docker за пару команд или работает headless в CLI режиме.
- Работает с любыми LLM: Claude 3.5 Sonnet, OpenAI GPT, Mistral и др. работают превосходно в тандеме с OpenHands.


⚙️ Техническая мощность и производительность:
- Результаты benchmark’ов: агент OpenHands CodeAct 2.1 закрывает более 50 % задач на SWE‑Bench и 41,7 % на SWE‑Bench Lite.
- OpenHands‑Versa — универсальный агент для code-editing, web browsing и multi-modal задач, улучшает результаты SWE‑Bench Multimodal и GAIA на 9+ баллов.


⁉️ Ограничения и нюансы:
- Некоторые пользователи сообщают о сложностях с установкой через Docker и проблемах с повторением операций при сложных проектах (agents могут застревать в loop'ах).
- Лучше подходит для небольших и средних репозиториев — на больших проектах возможны сбои и контекстные ограничения.


🔗 Попробовать: OpenHands
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
🔥 DeepL Agent — универсальный корпоративный AI, который понимает и действует

📌 DeepL Agent — это автономный AI-помощник от DeepL, который умеет взаимодействовать с вашими приложениями, анализировать данные, создавать таблицы, отправлять письма и локализовать продукты — и всё это по обычным текстовым инструкциям. Он фактически управляет компьютером как вы: печатает, кликает и работает через браузер и мышь.

📌 Благодаря опыту DeepL в задачах переводов и обработке языка, новый агент сочетает в себе точность, безопасность и гибкость. Он уже проходит закрытое бета-тестирование для избранных корпоративных клиентов, а полноценный запуск ожидается в ближайшие месяцы по подписке.

🔢 Главные фичи:
🟢Автоматизация рутинных бизнес-задач (финансы, маркетинг, локализация, поддержка и др.) повышает продуктивность и освобождает время для важных решений
🟢Встроенные механизмы безопасности: контроль над действиями, возможность остановки в любой момент и человек в цикле (human-in-the-loop) обеспечивают надёжность и прозрачность


🔗 Попробовать: DeepL Agent
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
🖥 ClickUpгибкая и масштабируемая платформа для управления проектами

ℹ️ ClickUp объединяет задачи, чаты, доски, документы и таблицы в одном рабочем пространстве, обеспечивая высокую кастомизацию под разные сценарии. Особенно полезны настраиваемые представления и автоматизация — выстраиваете процессы, где каждый шаг работает сам.

🔍 ИИ-ассистент платформы (ClickUp Brain) помогает планировать проекты без лишних усилий: он генерирует повестки, автоматом превращает встречи в задачи и заметки, создаёт планы и резюме на основе входящих данных. Очень удобно, когда нужно быстро подготовить обзоры или отчёты после совещания.

🛒 ClickUp предлагает бесплатный план, достаточный для старта — с неограниченным числом пользователей и базовыми инструментами. Для расширенной работы доступен Unlimited-план от ~$10 в месяц за пользователя (около $10 при помесячной оплате или $7 при годовой подписке), подойдёт для небольших команд.

🔗 Подробнее: ClickUp
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
🌐 Mirage: Новый стандарт в AI-коротких видео

📌 Mirage — это не просто ребрендинг платформы Captions. Это обновлённый стартап, переориентированный на создание фундаментальных multimodal AI-моделей для вертикальных видео: TikTok, Reels и Shorts. Компания привлекла более $100 млн инвестиций и оценивается в $500 млн — значительный шаг за рамки обычных инструментов для авторов контента.

ℹ️ Что умеет Mirage Studio?
🟢Автоматическая генерация видео из аудио: отправляете аудиофайл или текст, AI создаёт полноценный ролик — включая аватары, фон и мимику. Можно загрузить селфи и получить видео с собственным виртуальным "я", без использования актёров или стоков.
🟢Платформа позиционируется как лидер среди разработчиков AI-решений, не полагаясь на voice-cloning, lip-sync или шаблонные материалы. Mirage генерирует всё с нуля, делая процесс максимально оригинальным и масштабируемым.


🧑‍💻 Mirage понимает, что реалистичные AI-видео несут риск deepfake. Компания уже внедрила технологические меры — модерацию, защиту от несанкционированного использования чужих лиц и требует согласия, где это необходимо. Mirage более того, призывает к развитию медиаграмотности наряду с технологиями.

🔗 Попробовать: Mirage
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥21
🔥 Midjourney запускает Style Explorer V1 — визуальный браузер стилей в прямом эфире

📌 Midjourney представил Style Explorer V1, инновацию, которая меняет способ работы с визуальным стилем. Это интерактивный инструмент в веб-интерфейсе Explore → Styles, где вы можете:
🟢Просматривать галерею миниатюр — каждый показывает результат вашего промта с уникальным кодом стиля (sref).
🟢Наводите курсор — сразу видите, как каждый стиль изменит ваш изображение.
🟢С помощью кнопки "Try Style" единственным кликом применяете стиль к вашему текущему промту.
🟢Сохраняйте понравившиеся стили в избранное — удобно возвращаться к любимым эффектам.
🟢Воспользуйтесь fuzzy-поиском: вбейте «photographic» или «anime», и инструмент сам найдёт подходящий стиль.


📌 Style Explorer V1 — это как музыкальный плеер, но для визуального вайба: листаете, пробуете, сохраняете, а не записываете коды вручную. Отличный способ исследовать мир визуальных настроек Midjourney.

🔗 Попробовать: Style Explorer V1
Please open Telegram to view this post
VIEW IN TELEGRAM
🌐 Alibaba представила Qwen3-Max-Preview (Instruct): флагман с триллионом параметров

📌 Qwen3-Max-Preview — это крупнейшая на сегодня языковая модель от Alibaba с более чем триллионом параметров. Она появилась 5 сентября 2025 года и теперь доступна через веб-чата Qwen, API Alibaba Cloud, OpenRouter и AnyCoder на Hugging Face.

📌 Модель выделяется выдающейся производительностью. Внутренние бенчмарки показывают, что Qwen3-Max-Preview превосходит предыдущую топ-модель Qwen3-235B и конкурирует наравне с лучшими на рынке: Claude Opus 4 и DeepSeek-V3.1 по таким задачам, как программирование, решение математических задач и логика.

📌 Кроме того, Qwen3-Max-Preview поддерживает гигантский контекст — до 262 144 токенов — что позволяет обрабатывать широкие документы и коды без потери контекста.

🔗 Попробовать: Qwen3-Max-Preview (Instruct)
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
🌐 Daisy — единое окно для всех топовых LLM

📌 Daisy — это не просто чат-бот, а полноценный AI-сервис, который объединяет в одном интерфейсе разные языковые модели и мультимодальные инструменты. Пользователь видит привычный чат, но внутри работает сложная архитектура: модели подключаются по задаче, есть маршрутизация запросов, модуль распознавания документов, генерации изображений и семантического поиска.

📌 Основная фишка — можно работать с GPT, Claude, Gemini, Grok, DeepSeek и другими, в одном окне, без переключения между сервисами. Например, собрать план статьи с одной моделью, подтянуть фактуру через поиск с другой, затем вызвать генерацию кода, картинки и подзакрыть всё вторым промтом — всё в одном диалоге.

📌 Под капотом Daisy — связка маршрутизатора запросов, собственного контент-фильтра, модулей авторизации и тарификации, и логики fallback-планов: если нужно — запрос уходит на другую модель или на внутреннюю ручную обработку. Такой подход позволяет строить сложные AI-пайплайны в одном UI и гибко масштабировать под любые сценарии.

🔗 Попробовать: Daisy
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2
💻 Apertus — швейцарский open-source LLM

ℹ️ Apertus — это полностью открытая языковая модель, разработанная EPFL, ETH Zurich и Швейцарским национальным суперкомпьютерным центром (CSCS) в рамках Swiss AI Initiative. Название с латиницы переводится как «открытый» — и модель оправдывает своё имя: полностью прозрачная архитектура, данные и рецепты обучения доступны сообществу.

🧑‍💻 Apertus выпускается в двух вариантах: небольшой (8 B параметров) для локального или исследовательского использования, и крупной (70 B) — для коммерческих приложений и систем. Обучена на 15 трлн токенов данных, поддерживает более 1 800 языков, включая мало представленные: швейцарский диалект немецкого, ратороманский и др.

🖥 Модель ориентирована на прозрачность и доверие: при её обучении соблюдались правила GDPR, швейцарского авторского права и EU AI Act. Использовались только данные из публичного домена и сайты, которые явно не возражали против включения в тренинг (opt-out).

ℹ️ Попробовать: Apertus
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍2
🔵 Recon AI — инструмент от Protect AI для автоматического red teaming LLM-систем. Использует более 450 сценариев атак (jailbreak, prompt injection и др.) для тестирования безопасности AI-приложений. Поддерживает кастомные атаки, экспортирует отчёты (CSV, JSON) и интегрируется с OWASP LLM, CVSS и другими стандартами.

🎯 Особенности:
🟢450+ встроенных атак (prompt injection, jailbreak и др.)
🟢Поддержка кастомных payload’ов
🟢Экспорт отчётов (JSON, CSV)
🟢Интеграция с OWASP LLM и CVSS


⚙️ Архитектура и параметры:
🟢AI-агент с движком атак
🟢Работает через CLI и API
🟢Контекстное и семантическое тестирование
🟢Поддерживает ручной и автоматический режим


👍 Преимущества:
🟢Ускоряет поиск уязвимостей
🟢Интегрируется в DevSecOps
🟢Гибкий, настраиваемый подход


🔗 Попробовать: Recon AI
Please open Telegram to view this post
VIEW IN TELEGRAM
2
🌐 Droplet3D — генерация 3D из видео и текста

ℹ️ Droplet3D — новый генеративный 3D-модельный фреймворк, который учится на огромном видео-датасете Droplet3D-4M с четырьмя миллионами 3D-объектов и плотными текстовыми описаниями вида под разными углами. Суть идеи: использовать видео как источник пространственной информации и "commonsense priors" — движения камер и объектов дают естественные ориенти­ры для создания реалистичных 3D-форм.

📌 Модель поддерживает вход как в виде текста, так и в виде изображения, выравнивает перспективу входного вида, генерирует мультивью siri surround-view изображения (85 кадров 360°) и из этого строит либо Gaussian splatting 3D-сцену, либо текстурированную сетку — всё в open-source.

🔗 Все компоненты открыты: датасет, код, архитектура и веса модели доступны на Hugging Face, GitHub и сайте проекта.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2