DecartAI выпустил модель Lucy-Edit для редактирования видео по тексту. Open source!
https://x.com/huggingface/status/1968771737547309270?s=46
https://x.com/huggingface/status/1968771737547309270?s=46
X (formerly Twitter)
Hugging Face (@huggingface) on X
RT @DecartAI: We are building “Open Source Nano Banana for Video” - here is open source demo v0.1
We are open sourcing Lucy Edit, the firs…
We are open sourcing Lucy Edit, the firs…
Последнее время много информации о том, как OpenAI докручивает gpt-5, прежде всего в Codex, который как агент работает в командной строке. Его потребление выросло втрое, прежде всего, за счет тех, кто пересел с Claude Code.
А у Claude тем временем технические проблемы - народ жалуется на поглупевшие модели, идут какие-то сбои.
Пожалуй, тоже попробую Codex - он где-то был у меня…
А у Claude тем временем технические проблемы - народ жалуется на поглупевшие модели, идут какие-то сбои.
Пожалуй, тоже попробую Codex - он где-то был у меня…
Я как-то больше с текстовыми моделями работаю, а хайп делается на картинках и видео. Сначала OpenAI поймала волну с рисованием картинок в ChatGPT, потом Google с Nano banana.
Поэтому новость о том, что число пользователей Perplexity Comet удвоилось за несколько часов после того, как агенту в этот браузере дали доступ к nano banana, уже не удивляет.
Поэтому новость о том, что число пользователей Perplexity Comet удвоилось за несколько часов после того, как агенту в этот браузере дали доступ к nano banana, уже не удивляет.
Хит-парад открытых моделей на LM-arena (на этом ресурсе очень интересное формирование рейтинга - одна задача дается двум моделям и пользователь выбирает ответ, который больше нравится, так попарно сравниваются разные модели и из этих сравнений формируется общий рейтинг). Пожалуй, это единственный рейтинг, которому я доверяю - на остальные рейтинги модели просто натаскиваются, а здесь это сделать сложно, хотя тоже есть свои нюансы.
Интересно, что сильно выступает Gemma-3 на 27b параметров, которая обычно не светится высоко в других рейтингах.
Интересно, что сильно выступает Gemma-3 на 27b параметров, которая обычно не светится высоко в других рейтингах.
Grok4 Fast - младшая модель от xAI Илона Маска хотя и уступает основной, но топ в работе с поиском, и очень доступна.
Сейчас бесплатна в приложениях Х, grok и пр., временно бесплатна в OpenRouter (это основной ресурс, где можно подключаться к моделям по выбору по апи), и стоит по апи 0,2$ за 1М входящих токенов и 0,5$ за 1М исходящих. Это очень хорошее предложение, и, судя по grok 4, должна быть хорошая модель.
Да, и контекст у нее 2М токенов. По прежнему не рекомендую его забивать, думать с ростом контекста она будет хуже, но если модель используется для поиска, то это важно, поиск убивает контекст моментально.
В общем, рекомендую обратить внимание.
Сейчас бесплатна в приложениях Х, grok и пр., временно бесплатна в OpenRouter (это основной ресурс, где можно подключаться к моделям по выбору по апи), и стоит по апи 0,2$ за 1М входящих токенов и 0,5$ за 1М исходящих. Это очень хорошее предложение, и, судя по grok 4, должна быть хорошая модель.
Да, и контекст у нее 2М токенов. По прежнему не рекомендую его забивать, думать с ростом контекста она будет хуже, но если модель используется для поиска, то это важно, поиск убивает контекст моментально.
В общем, рекомендую обратить внимание.
Forwarded from Анализ данных (Data analysis)
📘 Introduction to Machine Learning* (Laurent Younes)
Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей
Фундаментальный учебник, который соединяет математику и практику ML.
👉 https://arxiv.org/abs/2409.02668
#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей
Фундаментальный учебник, который соединяет математику и практику ML.
👉 https://arxiv.org/abs/2409.02668
#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
День экспериментов
Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.
Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..
Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.
Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.
Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.
Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.
Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.
Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..
Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.
Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.
Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.
Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.
Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
В продолжение вчерашних экспериментов - запустил сегодня с утречка на одиночном мак мини модельку от OpenAI - gpt-oss-20B в квантовании на 4 бита. Работает, но всегда немного использует swap в самом начале, поэтому любой ответ дается медленно. Говорят, что это не лечится, вообще чудо, что запускается.
Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.
Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.
Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.
В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).
Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.
Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.
Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.
В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).
Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
huggingface.co
VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Промпт-инжиниринг в сентябре 2025: что реально работает
В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.
🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.
Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.
Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).
🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.
RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.
Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.
Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.
Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями
⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).
Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.
Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.
Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.
🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide
#промптинжиниринг #ai #производительность #написаноклодом
В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.
🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.
Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.
Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).
🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.
RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.
Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.
Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.
Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями
⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).
Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.
Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.
Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.
🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide
#промптинжиниринг #ai #производительность #написаноклодом
👍2
Forwarded from Анализ данных (Data analysis)
🚀 LongCat-Flash-Thinking от Meituan
⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.
LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.
🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.
LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.
🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
Forwarded from Machinelearning
Модель обрабатывает текст, изображения, аудио и видео в одной модели.
На бенчмарках выглядит так, как будто все модальности работают одинаково качественно.
- Первое место на 22 из 36 аудио- и мультимодальных бенчмарков
- Поддержка: 119 языков текста,
- Минимальная задержка — 211 мс
- Обработка аудио до 30 минут длиной
- ПОзволяет гибко настраивать через системные промпты
- Встроенный tool calling
Компания выложила три версии:
- Qwen3-Omni-30B-A3B-Instruct
- Qwen3-Omni-30B-A3B-Thinking
- Qwen3-Omni-30B-A3B-Captioner
👉 Попробовать можно здесь:
💬 Chat: https://chat.qwen.ai/?models=qwen3-omni-flash
💻 GitHub: https://github.com/QwenLM/Qwen3-Omni
🤗 Hugging Face: https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe
🤖 ModelScope: https://modelscope.cn/collections/Qwen3-Omni-867aef131e7d4f
🎬 Demo: https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo
@ai_machinelearning_big_data
#qwen #opensource #llm #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machine learning Interview
🚀 Подборка свежих моделей и датасетов на Hugging Face (16 сентября)
Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.
✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.
Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.
🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.
✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.
Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.
🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
huggingface.co
Qwen/Qwen3-Omni-30B-A3B-Instruct · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
huggingface.co
Qwen3 TTS Demo - a Hugging Face Space by Qwen
Enter any text, choose a voice and language, and the app creates a natural‑sounding audio file for you to listen to. You can pick from dozens of different speakers, covering many languages. The gen...
❤1
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Qwen
Qwen-Image-Edit: Image Editing with Higher Quality and Efficiency
QWEN CHAT GITHUB HUGGING FACE MODELSCOPE DISCORD
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
Как вы поняли, сегодня день Qwen - три модели сразу, ребята работают не покладая рук. И все - опенсорс
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
🤖 Почему роботы Unitree так быстро стали одними из лучших?
На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.
Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.
Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.
Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.
Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
Forwarded from Refat Talks: Tech & AI
Как я научил кодинг-агентов дебажить AI-приложения через трейсы
Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.
Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.
В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!
Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!
Иногда даже прошу его самого найти релевантные трейсы.
Как настроить?
У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp
Для Claude Code добавляется одной командой:
До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!
Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.
Где еще пригодится:
- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности
На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.
Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.
💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.
Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.
🔥➕🔁
Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.
Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.
В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!
Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!
Иногда даже прошу его самого найти релевантные трейсы.
Как настроить?
У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp
Для Claude Code добавляется одной командой:
claude mcp add langfuse --scope local -- uvx langfuse-mcp \
--public-key "$LANGFUSE_PUBLIC_KEY" \
--secret-key "$LANGFUSE_SECRET_KEY" \
--host https://cloud.langfuse.com
До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!
Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.
Где еще пригодится:
- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности
На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.
Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.
💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.
Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.
🔥➕🔁
🔥1👏1
Сегодня достаточно новостей, к ним прибавлю еще то, о чем не написал вчера - а именно, о выходе аж 3 новых моделей от Qwen, который теперь уверенно занял местно №1 по полноте и качеству моделей в опенсорсе.
Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;
- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;
- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;
- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;
+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...
Ну а ниже, несколько постов про вчерашние и сегодняшие модели
Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;
- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;
- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;
- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;
+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...
Ну а ниже, несколько постов про вчерашние и сегодняшие модели
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
huggingface.co
Qwen/Qwen3-Omni-30B-A3B-Instruct · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.