🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Qwen
Qwen-Image-Edit: Image Editing with Higher Quality and Efficiency
QWEN CHAT GITHUB HUGGING FACE MODELSCOPE DISCORD
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
🚀 Meta Code World Model: "симулятор кода" от FAIR
Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.
Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.
Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024
🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction
📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей
🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments
Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.
🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)
#метакод #worldmodels #исследования #написаноклодом
Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.
Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.
Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024
🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction
📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей
🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments
Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.
🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)
#метакод #worldmodels #исследования #написаноклодом
huggingface.co
facebook/cwm · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Кажется, все уже вчера написали про релизы от OpenAI - это новый агент Pulse, который смотрит всю вашу переписку (читает все письма, подслушивает разговоры и пр.) и дает вам полезные советы на очередной день - напоминает про вылет, заказывает столик в ресторане и пр. Скоро будет знать вас лучше, чем ваша жена (спасибо, не надо!).
Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).
Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).
Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
🚀 Google выкатила обновленный Gemini 2.5 Flash и Flash-Lite
Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.
🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками
Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов
Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.
Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.
🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование
#gemini #ai #agentai #написаноклодом
Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.
🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками
Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов
Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.
Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.
🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование
#gemini #ai #agentai #написаноклодом
Googleblog
Google for Developers Blog - News about Web, Mobile, AI and Cloud
Google is releasing updated Gemini 2.5 Flash and Flash-Lite preview models with improved quality, speed, and efficiency.
📱 Liquid Nanos: GPT-4o качество в кармане
🚀 Что анонсировали: [Liquid AI](https://www.liquid.ai/) выпустили коллекцию Liquid Nanos — сверхкомпактные модели (350M–2.6B параметров), которые показывают качество GPT-4o на специализированных задачах, работая полностью локально на телефонах и ноутбуках.
🔧 Техническая магия: Вместо классических трансформеров используют liquid neural networks (вдохновленные биологическими системами). Размер в RAM: всего 100MB–2GB. Task-specific подход — каждая модель заточена под конкретную задачу: извлечение данных, перевод, RAG, математику, tool calling.
Примеры моделей:
- LFM2-Extract (350M/1.2B) — извлекает данные из документов в JSON
- LFM2-1.2B-RAG — для длинных контекстов
- LFM2-1.2B-Tool — function calling
- LFM2-350M-Math — математические задачи
🇷🇺 Русский язык пока НЕ поддерживается (только EN, AR, ZH, FR, DE, JA, KO, ES).
Экономика впечатляет: по расчетам Liquid, их локальные агенты обходятся в 50 раз дешевле облачных решений и потребляют в 100 раз меньше энергии. [Shopify CTO](https://finance.yahoo.com/news/liquid-unveils-nanos-extremely-small-130000600.html) называет результаты "very impressive", а Deloitte уже планирует внедрение. Модели обгоняют Gemma 3 в 10+ раз их размером.
🔗 Основные ссылки:
🏠 [Официальный блог](https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices) | 🤗 [HuggingFace](https://huggingface.co/LiquidAI) | 📱 [LEAP платформа](https://www.liquid.ai/models)
#локальныйai #edgeai #написаноклодом
🚀 Что анонсировали: [Liquid AI](https://www.liquid.ai/) выпустили коллекцию Liquid Nanos — сверхкомпактные модели (350M–2.6B параметров), которые показывают качество GPT-4o на специализированных задачах, работая полностью локально на телефонах и ноутбуках.
🔧 Техническая магия: Вместо классических трансформеров используют liquid neural networks (вдохновленные биологическими системами). Размер в RAM: всего 100MB–2GB. Task-specific подход — каждая модель заточена под конкретную задачу: извлечение данных, перевод, RAG, математику, tool calling.
Примеры моделей:
- LFM2-Extract (350M/1.2B) — извлекает данные из документов в JSON
- LFM2-1.2B-RAG — для длинных контекстов
- LFM2-1.2B-Tool — function calling
- LFM2-350M-Math — математические задачи
🇷🇺 Русский язык пока НЕ поддерживается (только EN, AR, ZH, FR, DE, JA, KO, ES).
Экономика впечатляет: по расчетам Liquid, их локальные агенты обходятся в 50 раз дешевле облачных решений и потребляют в 100 раз меньше энергии. [Shopify CTO](https://finance.yahoo.com/news/liquid-unveils-nanos-extremely-small-130000600.html) называет результаты "very impressive", а Deloitte уже планирует внедрение. Модели обгоняют Gemma 3 в 10+ раз их размером.
🔗 Основные ссылки:
🏠 [Официальный блог](https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices) | 🤗 [HuggingFace](https://huggingface.co/LiquidAI) | 📱 [LEAP платформа](https://www.liquid.ai/models)
#локальныйai #edgeai #написаноклодом
Liquid AI
Liquid AI | Device-native foundation models.
Liquid AI builds efficient Liquid Foundation Models (LFMs) for on-device, edge, and cloud AI with low latency, privacy, and hardware-aware deployment.
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
Главное:
🔹 P3-SAM — первая нативная 3D-модель сегментации деталей
🔹 X-Part — генератор деталей с SOTA-результатами по управляемости и качеству
Ключевые особенности:
1️⃣ Обучение на 3.7 млн форм с чистыми аннотациями без использования 2D SAM
2️⃣ Новый автоматический пайплайн сегментации в 3D — полностью без участия пользователя
3️⃣ Диффузионный пайплайн для разбиения на части с учётом геометрии и семантики
Код доступен на GitHub, веса выложены на Hugging Face, а протестировать модель можно как в облегчённой версии на Hugging Face, так и в полном формате через Hunyuan3D Studio.
→Code: https://github.com/Tencent-Hunyuan/Hunyuan3D-Part
→ Веса: https://huggingface.co/tencent/Hunyuan3D-Part
→ Paper: https://arxiv.org/abs/2509.06784
→ Project page: https://murcherful.github.io/P3-SAM/
Попробовать:
→ (Light version) Hugging Face demo: https://huggingface.co/spaces/tencent/Hunyuan3D-Part
→ (Full version) Hunyuan3D Studio: https://3d.hunyuan.tencent.com/studio
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Креативный совет
Вышел Kling 2.5 turbo
Кто-то уже тестил?
По бенчмаркам лучше чем veo 3 fast и seedance 1.0
Но, как говоря, текст рендерит паршиво
@creadvice
Кто-то уже тестил?
По бенчмаркам лучше чем veo 3 fast и seedance 1.0
Но, как говоря, текст рендерит паршиво
@creadvice
Forwarded from Анализ данных (Data analysis)
⚡️ Новые модели для Кодина от Kwaipilot: KAT-Dev-32B и KAT-Coder
- KAT-Dev-32B — 62.4% на SWE-Bench Verified, входит в топ-5 среди open-source моделей
- KAT-Coder — 73.4% на SWE-Bench Verified, результат на уровне лучших проприетарных решений
🔗 Попробовать: https://huggingface.co/Kwaipilot/KAT-Dev
- KAT-Dev-32B — 62.4% на SWE-Bench Verified, входит в топ-5 среди open-source моделей
- KAT-Coder — 73.4% на SWE-Bench Verified, результат на уровне лучших проприетарных решений
🔗 Попробовать: https://huggingface.co/Kwaipilot/KAT-Dev
Perplexity Comet
Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца разобрался - в том плане, что ответов я не получил, но когда был в мастерской, оказалось, что им действительно кто-то писал. Прикольно, чо).
Еще нравится то, что работает быстро. Плюс в нем лимиты на платные модели claude sonnet 4, gpt-5 на уровне от создателей на платных режимах, так что можно при одной подписке получить все из них и gemini-2.5 pro + grok 4 в придачу. Солидный набор. Проблема одна - по апи они не работают и claude code, codex на них не запустишь - но если вы еще до этого не добрались и не собираетесь, то подумайте, вариант интересный.
Из любопытного - ты обращаешься не просто к модели, а к агенту от perplexity, который использует модель. Этот агент использует поиск и делает это почти всегда, в то время как сам Claude этого бы делать не стал.
Да, еще голос у перплексити хорошо работает, у антропика и гугла этого нет, а вот OpenAI тоже умеет.
Если кто-то захочет подписаться, по ссылке ниже - 1 бесплатный месяц ($20). Ну и мне тоже перепадет )) Присоединяйтесь
https://perplexity.ai/pro?referral_code=G8O2K6Q0
Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца разобрался - в том плане, что ответов я не получил, но когда был в мастерской, оказалось, что им действительно кто-то писал. Прикольно, чо).
Еще нравится то, что работает быстро. Плюс в нем лимиты на платные модели claude sonnet 4, gpt-5 на уровне от создателей на платных режимах, так что можно при одной подписке получить все из них и gemini-2.5 pro + grok 4 в придачу. Солидный набор. Проблема одна - по апи они не работают и claude code, codex на них не запустишь - но если вы еще до этого не добрались и не собираетесь, то подумайте, вариант интересный.
Из любопытного - ты обращаешься не просто к модели, а к агенту от perplexity, который использует модель. Этот агент использует поиск и делает это почти всегда, в то время как сам Claude этого бы делать не стал.
Да, еще голос у перплексити хорошо работает, у антропика и гугла этого нет, а вот OpenAI тоже умеет.
Если кто-то захочет подписаться, по ссылке ниже - 1 бесплатный месяц ($20). Ну и мне тоже перепадет )) Присоединяйтесь
https://perplexity.ai/pro?referral_code=G8O2K6Q0
Perplexity AI
Perplexity is a free AI-powered answer engine that provides accurate, trusted, and real-time answers to any question.
Forwarded from эйай ньюз
Media is too big
VIEW IN TELEGRAM
Suno V5 + Suno Studio — RIP Mozart AI
Недавно я писал про Mozart AI, которые пытались сделать AI DAW (Digital Audio Workstation) для музыкантов. Но их продукт, как многие заметили в комментариях, всё ещё сырой. И вот пришёл гигант — Suno (по моему мнению, лучший, лучше чем Udio), выкатил свою новую SOTA-модель V5 и сразу же полноценную Studio-версию. И просто решил все проблемы.
По сути, это всё, что обещал Mozart AI, но уже реализованное и с новыми фичами. Главная из них — можно напеть мелодию, а затем превратить её в отдельную дорожку (stem), как на 10:25.
Что это даёт? Дикий контроль. Теперь продюсер, имея один только ноутбук, может получить реалистичную аудиозапись инструмента, а не MIDI-болванку. Причём со всеми нюансами, которые невозможно запрограммировать: реалистичной динамикой, звуком удара медиатора по струнам или шорохом пальцев гитариста по грифу, и всё это в «комнате» с её естественным эмбиенсом.
Профессионалы, конечно, не будут использовать Suno Studio как основную DAW, но как генератор стемов — это геймченджер.
Многие боятся, что генеративная музыка захламит чарты AI-слопом (треть новой музыки на стримингах уже сгенерирована). Но я думаю, что именно эта технология сделает музыку только лучше. Теперь вместо стерильных, запрограммированных в MIDI инструменталов можно будет генерить реалистичные аудиодорожки, что только поднимет общее качество продакшена.
V5 доступна пока только по подписке. Suno Studio — на тире Premier, но сейчас есть скидка: $15 в месяц на первые 3 месяца вместо $30.
@ai_newz
Недавно я писал про Mozart AI, которые пытались сделать AI DAW (Digital Audio Workstation) для музыкантов. Но их продукт, как многие заметили в комментариях, всё ещё сырой. И вот пришёл гигант — Suno (по моему мнению, лучший, лучше чем Udio), выкатил свою новую SOTA-модель V5 и сразу же полноценную Studio-версию. И просто решил все проблемы.
По сути, это всё, что обещал Mozart AI, но уже реализованное и с новыми фичами. Главная из них — можно напеть мелодию, а затем превратить её в отдельную дорожку (stem), как на 10:25.
Что это даёт? Дикий контроль. Теперь продюсер, имея один только ноутбук, может получить реалистичную аудиозапись инструмента, а не MIDI-болванку. Причём со всеми нюансами, которые невозможно запрограммировать: реалистичной динамикой, звуком удара медиатора по струнам или шорохом пальцев гитариста по грифу, и всё это в «комнате» с её естественным эмбиенсом.
Профессионалы, конечно, не будут использовать Suno Studio как основную DAW, но как генератор стемов — это геймченджер.
Многие боятся, что генеративная музыка захламит чарты AI-слопом (треть новой музыки на стримингах уже сгенерирована). Но я думаю, что именно эта технология сделает музыку только лучше. Теперь вместо стерильных, запрограммированных в MIDI инструменталов можно будет генерить реалистичные аудиодорожки, что только поднимет общее качество продакшена.
V5 доступна пока только по подписке. Suno Studio — на тире Premier, но сейчас есть скидка: $15 в месяц на первые 3 месяца вместо $30.
@ai_newz
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🔥 HunyuanImage 3.0 — свежая open-source модель для генерации изображений по тексту (text-to-image) от Hunyuan.
Размер *80B параметров**, из которых 13B активируются на токен во время инференса.
Качество сопоставимо с флагманскими закрытыми моделями индустрии.
Что интересного:
- Основана на собственной мультимодальной LLM Tencent
- Постобучение заточено под text-to-image задачи
- Архитектура MoE + Transfusion объединяет Diffusion и LLM в единую систему
🚀 Возможности:
- Понимает сложные промпты длиной до тысячи слов
- Детализированные изображения с текстом
- Генерирует сложные иллюстрации и комиксы
👉 Попробовать: https://hunyuan.tencent.com/image
🔗 GitHub: https://github.com/Tencent-Hunyuan/HunyuanImage-3.0
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanImage-3.0
@ai_machinelearning_big_data
#AI #GenerativeAI #Adobe #MorganStanley
Размер *80B параметров**, из которых 13B активируются на токен во время инференса.
Качество сопоставимо с флагманскими закрытыми моделями индустрии.
Что интересного:
- Основана на собственной мультимодальной LLM Tencent
- Постобучение заточено под text-to-image задачи
- Архитектура MoE + Transfusion объединяет Diffusion и LLM в единую систему
🚀 Возможности:
- Понимает сложные промпты длиной до тысячи слов
- Детализированные изображения с текстом
- Генерирует сложные иллюстрации и комиксы
👉 Попробовать: https://hunyuan.tencent.com/image
🔗 GitHub: https://github.com/Tencent-Hunyuan/HunyuanImage-3.0
🤗 Hugging Face: https://huggingface.co/tencent/HunyuanImage-3.0
@ai_machinelearning_big_data
#AI #GenerativeAI #Adobe #MorganStanley
Forwarded from Анализ данных (Data analysis)
Alibaba Group представила Memp — новый фреймворк, который даёт LLM-агентам обучаемую и обновляемую процедурную память.
📈 Результат — более высокая успешность и эффективность при сложных задачах.
🧠 Memp превращает прошлый опыт агентов в детальные инструкции и абстрактные стратегии, постоянно совершенствуясь по мере накопления данных.
🔄 Память можно даже передавать более слабым моделям, повышая их возможности.
https://huggingface.co/papers/2508.06433
📈 Результат — более высокая успешность и эффективность при сложных задачах.
🧠 Memp превращает прошлый опыт агентов в детальные инструкции и абстрактные стратегии, постоянно совершенствуясь по мере накопления данных.
🔄 Память можно даже передавать более слабым моделям, повышая их возможности.
https://huggingface.co/papers/2508.06433
В продолжение поста про Perplexity Comet. Хороший умный поиск с нейронкой, и главное быстрый. А еще очень порадовала возможность использования для технических задач.
Сейчас я активно работаю с Codex (Claude code внезапно перестал работать - видимо, банит меня не смотря на vpn, хотя само приложение работает). Так вот, когда Codex уперся в очередную задачку, остановил его, передал саммари в Comet, тот пошерстил интернет, выяснил, что проблема известная, традиционными методами не лечится, предложил откатиться на другую версию и еще пару моментов. И знаете, заработало. Очень классно.
Если с Клодом интернет обращения надо экономить, так как он делает их, видимо, той же моделью, что и думает, и моментально выжирает контекст и проплаченные токены, то с Comet история другая - они испвользуют одну модель для поиска, другую для обработки информации, а умной модели передают уже готовый и почищенный контекст. Получается и быстрее, и экономнее.
Ну и сам браузер приятный, быстро привыкаешь. Если Claude code не починю, то, пожалуй, подумаю о том, чтобы пообще от него отказаться в пользу подписки на Comet.
Сейчас я активно работаю с Codex (Claude code внезапно перестал работать - видимо, банит меня не смотря на vpn, хотя само приложение работает). Так вот, когда Codex уперся в очередную задачку, остановил его, передал саммари в Comet, тот пошерстил интернет, выяснил, что проблема известная, традиционными методами не лечится, предложил откатиться на другую версию и еще пару моментов. И знаете, заработало. Очень классно.
Если с Клодом интернет обращения надо экономить, так как он делает их, видимо, той же моделью, что и думает, и моментально выжирает контекст и проплаченные токены, то с Comet история другая - они испвользуют одну модель для поиска, другую для обработки информации, а умной модели передают уже готовый и почищенный контекст. Получается и быстрее, и экономнее.
Ну и сам браузер приятный, быстро привыкаешь. Если Claude code не починю, то, пожалуй, подумаю о том, чтобы пообще от него отказаться в пользу подписки на Comet.
Telegram
very vibe coding
Perplexity Comet
Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца…
Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца…
Сегодня читал про то, как парень тренировал свою модельку на 135 млн параметров - ему это обошлось в $12.
Слушал, как Иван Оселедец (AIRI) рассказывал о том, что сегодняшние модели на 1,5B параметров эффективнее GPT-3 со 135B.. Кстати, у него был интересный тезис о том, что сегодня промтинг важнее файнтьюнинга и дообучения.
Делаю вывод - скоро локальные, персонализированные модели будут в каждом телефоне, и это будет создавать потребность во все более новых и мощных моделях (а то, что 12й айфон, что 17й - разницы нет). Памяти уже ставят 12Gb, процы мощные, уже недолго осталось
Слушал, как Иван Оселедец (AIRI) рассказывал о том, что сегодняшние модели на 1,5B параметров эффективнее GPT-3 со 135B.. Кстати, у него был интересный тезис о том, что сегодня промтинг важнее файнтьюнинга и дообучения.
Делаю вывод - скоро локальные, персонализированные модели будут в каждом телефоне, и это будет создавать потребность во все более новых и мощных моделях (а то, что 12й айфон, что 17й - разницы нет). Памяти уже ставят 12Gb, процы мощные, уже недолго осталось
YouTube
Иван Оселедец | Большие языковые модели в эпоху ризонинга
Спикер: Иван Оселедец, Д.ф.-м.н., профессор РАН, Генеральный директор, Институт AIRI
Data Fest 2025: https://ods.ai/events/datafest2025
Трек-секция GenAI от СБЕР: https://ods.ai/tracks/df25_sber_genai
______
Наши соц.сети:
Telegram: https://t.me/datafest…
Data Fest 2025: https://ods.ai/events/datafest2025
Трек-секция GenAI от СБЕР: https://ods.ai/tracks/df25_sber_genai
______
Наши соц.сети:
Telegram: https://t.me/datafest…
Я себе поставил Вихрь на 12B, а новую модель надо ставить на мак с 32Gb оперативки, ну 24, как минимум.
https://t.me/lovedeathtransformers/9809
https://t.me/lovedeathtransformers/9809
Telegram
Love. Death. Transformers.
Vistral-24B-Instruct
Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный…
Vistral - это наша новая флагманская унимодальная LLM представляющая из себя улучшенную версию Mistral-Small-3.2-24B-Instruct-2506 командой VikhrModels, адаптированную преимущественно для русского и английского языков. Удалён визуальный…