Источник КодХаб
6.3K subscribers
822 photos
81 videos
865 links
⚡️Заявки принимаем моментально

Подборка AI-инструментов на любой вкус и цвет

Сотрудничество: @cmd_dark, @CMD_Vega

Ютуб: https://www.youtube.com/@ih_codee
ТикТок: https://www.tiktok.com/@ih_code
Download Telegram
⭐️ DeepSeek Janus-Pro — универсальный мультимодальный смысловой генератор

📌 DeepSeek представила Janus-Pro — новую версию своей мультимодальной серии Janus, объединяющую понимание изображений и их генерацию. Модель ориентирована на задачи, где нужно одновременно распознавать визуальный контент и создавать новый по текстовому описанию.

📌 Версии Janus-Pro представлены в 1B и 7B параметров. В версии 7B заметно выше точность при генерации, особенно по сложным промтам, а также улучшения в стабильности и согласованности изображения. У модели декомпозирован визуальный энкодер, что позволяет раздельно обрабатывать задачи визуального понимания и генерации.

⭐️ По бенчмаркам Janus-Pro-7B превосходит DALL-E 3 и Stable Diffusion по GenEval и DPG-Bench в задачах text-to-image и плотных (dense) промтов. Модель уже доступна на Hugging Face: deepseek-ai/Janus-Pro-7B, с возможностью использования для генерации изображений, анализа изображений и мультимодальных задач.

📎 Попробовать: DeepSeek Janus-Pro
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍3🔥2
⚡️ SmolVLM-256M / SmolVLM-500M — крошечные, но мощные VLM от Hugging Face

📌 SmolVLM-256M и 500M — новые компактные мультимодальные модели от Hugging Face, способные понимать текст + изображения при крайне скромных ресурсах. Даже 256-миллионная версия требует меньше 1 ГБ VRAM, и всё же показывает результаты, которые раньше добивались лишь модели в десятки раз больше.

📌 Они отлично справляются с задачами вроде описания картинок, визуальных вопросов — “что здесь на фото?”, “что написано на скане?”, анализ диаграмм и простых документов. Версия 500M «Instruct» более устойчива к промтам и лучше следует инструкциям, так что её проще использовать прямо “из коробки”.

👨‍💻 Эти модели актуальны для создателей веб-сервисов, мобильных приложений, адептов on-device ИИ, которым нужны VLM-возможности без облака и без мощного железа. Если нужно описывать изображения, помогать с OCR, строить визуальную аналитику — SmolVLM-256M и 500M могут стать отличным выбором.

🔗 Попробовать: SmolVLM-256M & SmolVLM-500M
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
🔍 Gamma 3.0 — эволюция визуального сторителлинга

📌 Gamma представила версию 3.0, в которой инструмент презентаций превратился в полноценную платформу визуальных историй. Она работает не просто как сборка слайдов, а как партнёр-дизайнер: вы вводите идею, добавляете контент — ссылки, скриншоты, тезисы — а Gamma Agent сразу предлагает стили, визуальные диаграммы, оформление, и может переработать весь музыкальный тон дизайна по команде.

📌 В числе нововведений — API автоматизации, которое позволяет интегрировать Gamma в рабочие процессы: например, автоматически превращать CRM-данные в презентации, делать отчёты, визуализировать исследования. Также расширились шаблоны, темы, диаграммы и функции для команд — брендинг, совместная работа, единый стиль.

ℹ️ Gamma 3.0 сохраняет бесплатный уровень: при регистрации даётся набор кредитов, с которым можно попробовать Agent, создавать презентации, документы, сайты, экспорт в разные форматы. Платные подписки дают больше возможностей, снятие ограничений, приоритетный доступ и расширенные возможности дизайна.

🔗 Попробовать: Gamma 3.0
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
🐈 SpikingBrain1.0 — эффективная альтернатива трансформерам

📌 SpikingBrain1.0 — это новая модель от Китайской академии наук, которая использует вдохновение из нейробиологии, чтобы решить одну из главных проблем современных больших языковых моделей: огромные требования к вычислениям и памяти при обработке длинных контекстов. Вместо классического “глобального внимания”, SpikingBrain применяет localized attention и “спайкинг-нейроны” (event-driven вычисления), которые отвечают только тогда, когда нужно — экономя ресурсы.

📌Модель доступна в двух вариантах: SpikingBrain-7B и SpikingBrain-76B. Одна из ключевых заявленных фич — скорость: на ультра-длинных контекстах SpikingBrain1.0 утверждает, что может быть 25-100× быстрее традиционных трансформеров по времени до первого токена (Time to First Token), особенно когда нужно обработать большие объёмы текста. Кроме того, модель обучается на значительно меньшем объёме данных по сравнению с аналогами (менее 2% от объёмов, которые часто используются) и работает на китайском железе MetaX вместо Nvidia-GPU.

🔗 Попробовать: SpikingBrain1.0
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2🔥2
🖱 Lucy Edit Dev — видео-редактор по промту, теперь с открытыми весами

📌 Lucy Edit Dev от Decart AI — это open-source модель, основанная на Wan 2.2 (версия 5B), которая позволяет редактировать любые видео по описанию. Нужно изменить одежду, фон, добавить эффект — просто пишешь, что ты хочешь, загружаешь ролик, и модель применит изменения ко всему видео.

🖥 Она доступна на Hugging Face под именем decart-ai/Lucy-Edit-Dev вместе с весами и примерами использования. Можно запускать локально либо через интерфейс Decart AI, а также через Fal.ai, где Lucy Edit Dev доступен для “Video to Video” трансформаций.

ℹ️ Для работы нужна видеокарта с минимум ~8 ГБ памяти — модель достаточно тяжёлая из-за видеоданных и Wan 2.2 архитектуры. Онлайн-версия позволяет попробовать изменить видео сразу в браузере, без установки.

🔗 Попробовать: Lucy Edit Dev
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1🔥1
⚡️ SAIL-VL2 — новый SOTA в мультимодальных моделях

📌 SAIL-VL2 — новая модель от Douyin / ByteDance совместно с LV-NUS Lab, которая сочетает обработку изображений и текстовых задач в одном модуле. Она представлена в версиях около 2B и 8B параметров, и показывает отличные результаты не только на простых задачах вроде описания изображений, но и в сложной логике, OCR, анализе диаграмм и документации.

🔑Ключевая сила SAIL-VL2 — её “thinking-fusion” архитектура + продуманная предварительная обработка данных: модель обучалась на огромном датасете с качественной фильтрацией, включающем задания с изображениями, текстами, документами и видео. Это позволяет ей сохранять детали визуальных объектов, точно отвечать на вопросы по контенту и справляться с визуально-текстовыми задачами, где другие VLM-модели часто “спотыкаются”.

🖥 SAIL-VL2 уже доступна на Hugging Face (са­мые лёгкие модели), что позволяет тестировать её локально или через облачные сервисы. Это отличный выбор, если нужно работать с визуальным содержанием (картинки, сканы, диаграммы) и вести диалог с AI о том, что на изображении, без огромных ресурсов.

🔗 Попробовать: SAIL-VL2
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1
🎨 Lexica Art — не просто генератор, а мастерская визуальной идеи

📌 Lexica Art сочетает в себе мощный генератор изображений и огромную галерею готовых AI-картинок, где видно не просто результат, а весь путь: промт, параметры, seed. Это позволяет не просто брать “красивые картинки”, а учиться видеть, почему они выглядят так, как выглядят — полезно и для новичков, и для профи.

📌 Интерфейс Lexica Art удобен: можно сразу видеть примеры работ в нужном стиле, нажав на галерею, изучить параметры генерации, скопировать промт и адаптировать под свою задачу. Генерация работает прямо в браузере, промты легко изменить, и почти нет барьеров входа — нет сложных настроек, всё визуально и понятно.

ℹ️ Lexica Art особенно хороша для тех, кто делает визуальный контент — маркетологи, дизайнеры, художники, создатели соцсети. Если нужен быстрый поиск вдохновения, подбор стиля или визуализация идеи — Lexica ускорит этот процесс. Плюс полезно в обучении, когда хочется понять, как детали промта влияют на итог: цвета, композиция, стилизация — всё видно.

🔗 Попробовать: Lexica Art
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2👍1
🍿 VoxDeck — интерактивные и динамичные презентации с помощью ИИ

📌 VoxDeck — это AI-сервис, который превращает простые идеи или документы в визуально убедительные презентации: двигающиеся обложки, 3D-диаграммы, аватары, готовые шаблоны. Всё, что требуется — описать тему, добавить детали, и VoxDeck создаёт дизайн, структуру слайдов и визуальную подачу.

🔑 Бесплатный план даёт лимит на количество слайдов/cлайдов-блоков на проект, а также кредиты, позволяющие начать экспериментировать без вложений. Платные тарифы расширяют возможности: больше слайдов за раз, приоритетный доступ к эффектам, возможность использования 3D-элементов, настройки шаблонов и аватаров.

🖥 VoxDeck особенно полезен тем, кто хочет быстро и без дизайнера подготовить презентацию, учебный материал или маркетинговую презентацию — визуально богатую, с движением, интерактивностью, которая удерживает внимание.

🔗 Попробовать: VoxDeck
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🌐 Learn Your Way (Google) — нейросеть для быстрого освоения любых тем из PDF

📌 Загружаете PDF и получаете адаптивный текст под ваш интерес, проверки понимания, видео и аудиоурок, а также ментальную карту

📌 Что делает:
🟢Текст объясняет тему через примеры, которые вы выбираете (игры, спорт и т.д.)
🟢Каждый абзац сопровождается коротким тестом для проверки понимания
🟢Генерирует видеопрезентацию и аудиоурок по содержимому
🟢Строит ментальную карту: от общих понятий к деталям


🔗 Попробовать: Learn Your Way
Please open Telegram to view this post
VIEW IN TELEGRAM
🎥 Runway — облачная платформа для генерации и редактирования видео с использованием искусственного интеллекта.

🛠 Ключевые функции
🟢Text-to-Video — генерация видео по текстовому описанию
🟢Motion Brush — анимация отдельных элементов на изображении
🟢Inpainting — удаление и замена объектов в видео.


Сервис подходит для создания рекламных роликов, контента для социальных сетей, презентаций и креативных проектов.
Поддерживает экспорт без водяных знаков в платных тарифах.

📊 Тарифы:
🟢Free — базовые функции, ограничение по кредитам и хранилищу.
🟢Standard — от $12/мес, расширенные лимиты и доступ к дополнительным моделям.
🟢Pro — от $28/мес, максимальные ресурсы и функционал.


🔗 Попробовать: Runway
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ SGS-1 — первая нейросеть для генерации 3D-моделей в CAD

📌 Инженеры получили по-настоящему революционный инструмент: нейросеть SGS-1 умеет превращать обычные чертежи в полноценные 3D-модели. Достаточно загрузить схему — и система автоматически создаст объёмную модель, которую можно использовать для проектирования или дальнейшей доработки.

📌 Главное преимущество в том, что модель редактируется не только вручную в AutoCAD или других CAD-программах, но и с помощью текстовых подсказок. Это позволяет быстро менять детали, корректировать элементы и тестировать разные варианты без долгой ручной работы.

👨‍💻 Инструмент полностью бесплатный и уже доступен онлайн. Попробовать SGS-1 можно прямо сейчас на Hugging Face.

🔗 Попробовать: SGS-1
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1
⭐️ Astrocade — вайб-кодинг игр с помощью ИИ

📌 В 2025 году платформа Astrocade стала настоящим открытием для геймдев-сообщества: теперь создать игру можно без знания кода. Всё, что нужно — описать свою идею словами, а встроенные ИИ-агенты соберут прототип с готовой графикой, интерфейсом и базовой логикой. Такой подход получил название вайб-кодинг, потому что вместо сложных строк кода вы задаёте настроение и атмосферу будущего проекта.

📌 Astrocade умеет работать не только с текстовыми промптами, но и с референсами: можно загрузить картинку, чтобы система уловила нужный визуальный стиль. После генерации игры доступны правки — от базовых механик и параметров движения до целой структуры уровней. Благодаря командной работе ИИ-модулей результат получается гармоничным: стиль графики, интерфейс и логика органично дополняют друг друга.

🖥 На платформе уже есть большая библиотека игр, созданных другими пользователями: от аркадных платформеров до визуальных новелл. Можно взять готовый проект за основу, переработать его под себя и получить уникальный результат.

🔗 Попробовать: Astrocade
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2👍1
🏞 Ray3 — новый уровень генерации видео от Luma AI

📌 Luma AI представила модель Ray3, которая поднимает планку качества для генеративного видео. Она умеет создавать ролики в разрешении 1080p с 16-bit HDR продолжительностью от 5 до 9 секунд, сохраняя при этом высокую детализацию и кинематографический стиль. Главное отличие Ray3 — это способность учитывать не только текстовые промпты, но и визуальные подсказки.

📌 Пользователь может прямо на кадре нарисовать стрелки или сделать обводку, чтобы задать движение объектов или направление камеры. Такая система позволяет контролировать динамику сцены и добиваться реалистичной симуляции физики, света и анимации. Благодаря этому ролики выглядят естественно и впечатляют глубиной изображения, будто сняты на профессиональную камеру.

⭐️ Попробовать Ray3 можно уже сейчас в бесплатном тесте через сервис Dream Machine. Это отличный шанс оценить, насколько мощно новая модель сочетает возможности генерации и редактирования видео в одном инструменте.

🔗 Попробовать: Ray3
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥3
📢 MiMo-Audio — новая речь от Xiaomi в мире LLM

📌 Xiaomi представила MiMo-Audio — продвинутую модель для генерации и понимания речи. Она обучена на колоссальном датасете — более 100 миллионов часов аудио, что позволило ей научиться обрабатывать голосовые запросы максимально точно и гибко. В основе лежит уникальная схема токенизации, которая делает работу модели более быстрой и экономной.

📌 Обучение MiMo-Audio проходит в два этапа: сначала модель занимается реконструкцией звука, а затем — генерацией речи. Такой подход обеспечивает естественное звучание и высокую разборчивость аудио, что выводит её в один ряд с топовыми системами. В бенчмарках Xiaomi отмечает, что MiMo-Audio показывает результаты, сопоставимые с Gemini 2.5 Flash от Google, что делает её одним из самых сильных игроков в сегменте speech-to-speech и speech-to-text моделей.

🖥 Модель уже доступна исследователям и разработчикам: исходники и веса можно найти на GitHub и HuggingFace. Это открывает простор для экспериментов — от голосовых ассистентов до систем генерации аудио-контента нового поколения.

🔗 Попробовать: MiMo-Audio
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
🔬 Tongyi Deep Research — китайский ИИ-агент для автономных исследований

Alibaba представила Tongyi Deep Research — бесплатного исследовательского ИИ-агента с открытым кодом. Его ключевая особенность — архитектура mixture of experts: у модели есть 30 млрд параметров, но для каждого запроса используется только около 3 млрд. В итоге получается баланс мощности и скорости — как у гиганта, но с эффективностью компактной модели.

📌 В отличие от обычных чат-ботов, Tongyi умеет работать как настоящий исследователь: он разбивает сложные задачи на подэтапы, сам ищет информацию в интернете, сопоставляет данные из множества источников и выдает отчет с цитатами. Всё это в итерационном режиме, что позволяет делать глубокие обзоры и анализ. То, на что у человека уйдет час, агент выполняет за три минуты. На бенчмарках он обходит даже платные сервисы для веб-браузинга и долгосрочных исследований.

📑 Сфера применения огромна — от контент-маркетинга и бизнес-аналитики до академических обзоров и стратегической разведки. Модель уже доступна на GitHub и HuggingFace: полная версия требует GPU с 24 ГБ VRAM, а облегченная работает и на 8 ГБ. Китайцы называют Tongyi “моментом DeepSeek” для ИИ-агентов — шагом, когда корпоративные технологии становятся открытыми и бесплатными, создавая давление на весь мировой рынок.

🔗 Попробовать: Tongyi Deep Research
Please open Telegram to view this post
VIEW IN TELEGRAM
4🔥2
🔥 Suno v5 — новое дыхание музыки на базе ИИ

📌 Команда Suno только что анонсировала версию v5, теперь доступную для пользователей с планом Pro и Premier. Эта версия обещает более иммерсивное аудио, натуральные голоса и расширенный контроль над композицией — всё, чтобы генеративная музыка звучала ближе к настоящей.

📌 Что важно, Suno v5 улучшает способность смешивать музыкальные жанры и добавляет гибкость кастомизации: метатеги теперь можно применять к целым частям песни, а не прописывать перед каждой строчкой. Пользователи уже делятся примерами: вокал звучит выразительнее, атмосфера треков — пластичнее.

Хотя скидок «25% при переходе» прямо не упоминают в официальных источниках, обновление действительно доступно в бета-версии на официальном сайте Suno.

🔗 Попробовать: Suno v5
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1
⚡️ VARCO-VISION-2.0-1.7B — легкая мультимодальная модель от NCSOFT

📌 Модель VARCO-VISION-2.0-1.7B — это облегчённая версия флагманской системы NCSOFT, нацеленная на задачи визуального понимания и текстового взаимодействия. Она способна обрабатывать несколько изображений одновременно, извлекать текст с их пространственными границами (layout-aware OCR) и отвечать на вопросы по визуальному контенту, при этом оставаясь компактной и пригодной для запусков на устройствах с ограниченными ресурсами.

📌 Одним из ключевых усилений VARCO-VISION-2.0 по сравнению с предыдущей версией является улучшенное понимание корейского языка и культурного контекста, более точная генерация текстов и расширенная способность работать с многокадровыми и комплексными изображениями, такими как схемы, таблицы и макеты. Также реализована оптимизация, благодаря которой модель может работать на локальных устройствах — это делает её пригодной не только для облака, но и для приложений с ограниченными ресурсами.

🔗 Попробовать: VARCO-VISION-2.0-1.7B
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥1
📄 SmolDocling-256M — мини-модель с большими амбициями

📌 SmolDocling — это vision-language модель всего на 256 миллионов параметров, разработанная IBM и Hugging Face, которая призвана преобразовывать изображения страниц документов в структурированные форматы с сохранением макета и элементов. Она использует формат DocTags — разметку, в которой каждый элемент страницы (текст, таблицы, формулы, изображения, код) сопровождается геометрической привязкой и типом.

📌 Важное преимущество SmolDocling — это обработка целой страницы “одним заходом”, без необходимости разбивать её на фрагменты вручную. Она умеет распознавать кодовые блоки, математические формулы, таблицы и графики, сохраняя пространственные связи между элементами. На A100 средняя скорость обработки одной страницы — около 0,35 секунды.

🔗 Попробовать: SmolDocling-256M
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥1
🖥 OmChat v2.0 13B — новый шаг в мультимодальном диалоге

📌 На Hugging Face появился OmChat v2.0 13B (single beta) от OMLab — модель с архитектурой, ориентированной на совместную работу с изображениями и текстом. Она идет под лицензией Apache-2.0 и содержит полный набор кода: от конфигурации и токенизатора до модулей для обработки изображений (image_processing_omchat.py), внимания и генерации.

📌 Модель весит около 26.4 ГБ и предоставлена в виде шести safetensors-файлов. Пользователи могут видеть исходные параметры и код модели — модификация и интеграция доступна прямо из репозитория.

🔗 Попробовать: OmChat v2.0 13B
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1
😶 MindOmni — как модель «видит» и думает над изображениями

📌 MindOmni — это унифицированная мультимодальная модель, которая объединяет понимание изображений и генерацию визуального контента с навыками рассуждения. Она способна не просто описывать, что на картинке, но и рассуждать: делать пошаговые выводы, отвечать на сложные вопросы по сцене, редактировать изображение, сохраняя детали, и генерировать новую визуальную информацию с учётом логики композиции.

📌 Ключевой «фишкой» модели является алгоритм RGPO (Reasoning Generation Policy Optimization), который добавляет механизм обучения с подкреплением к этапам рассуждения. Благодаря этому MindOmni может лучше выстраивать цепочки рассуждений, делать логические выводы и отвечать на визуальные задачи, которые требуют “думать, а не угадывать”.

🔗 Попробовать: MindOmni
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1🔥1