Forwarded from Анализ данных (Data analysis)
📘 Introduction to Machine Learning* (Laurent Younes)
Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей
Фундаментальный учебник, который соединяет математику и практику ML.
👉 https://arxiv.org/abs/2409.02668
#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей
Фундаментальный учебник, который соединяет математику и практику ML.
👉 https://arxiv.org/abs/2409.02668
#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
День экспериментов
Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.
Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..
Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.
Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.
Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.
Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.
Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.
Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..
Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.
Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.
Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.
Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.
Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
В продолжение вчерашних экспериментов - запустил сегодня с утречка на одиночном мак мини модельку от OpenAI - gpt-oss-20B в квантовании на 4 бита. Работает, но всегда немного использует swap в самом начале, поэтому любой ответ дается медленно. Говорят, что это не лечится, вообще чудо, что запускается.
Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.
Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.
Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.
В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).
Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.
Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.
Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.
В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).
Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
huggingface.co
VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Промпт-инжиниринг в сентябре 2025: что реально работает
В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.
🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.
Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.
Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).
🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.
RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.
Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.
Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.
Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями
⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).
Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.
Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.
Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.
🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide
#промптинжиниринг #ai #производительность #написаноклодом
В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.
🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.
Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.
Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).
🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.
RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.
Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.
Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.
Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями
⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).
Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.
Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.
Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.
🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide
#промптинжиниринг #ai #производительность #написаноклодом
👍2
Forwarded from Анализ данных (Data analysis)
🚀 LongCat-Flash-Thinking от Meituan
⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.
LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.
🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.
LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.
🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
Forwarded from Machinelearning
Модель обрабатывает текст, изображения, аудио и видео в одной модели.
На бенчмарках выглядит так, как будто все модальности работают одинаково качественно.
- Первое место на 22 из 36 аудио- и мультимодальных бенчмарков
- Поддержка: 119 языков текста,
- Минимальная задержка — 211 мс
- Обработка аудио до 30 минут длиной
- ПОзволяет гибко настраивать через системные промпты
- Встроенный tool calling
Компания выложила три версии:
- Qwen3-Omni-30B-A3B-Instruct
- Qwen3-Omni-30B-A3B-Thinking
- Qwen3-Omni-30B-A3B-Captioner
👉 Попробовать можно здесь:
💬 Chat: https://chat.qwen.ai/?models=qwen3-omni-flash
💻 GitHub: https://github.com/QwenLM/Qwen3-Omni
🤗 Hugging Face: https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe
🤖 ModelScope: https://modelscope.cn/collections/Qwen3-Omni-867aef131e7d4f
🎬 Demo: https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo
@ai_machinelearning_big_data
#qwen #opensource #llm #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machine learning Interview
🚀 Подборка свежих моделей и датасетов на Hugging Face (16 сентября)
Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.
✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.
Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.
🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.
✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.
Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.
🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
huggingface.co
Qwen/Qwen3-Omni-30B-A3B-Instruct · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
huggingface.co
Qwen3 TTS Demo - a Hugging Face Space by Qwen
Enter any text, choose a voice and language, and the app creates a natural‑sounding audio file for you to listen to. You can pick from dozens of different speakers, covering many languages. The gen...
❤1
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Qwen
Qwen-Image-Edit: Image Editing with Higher Quality and Efficiency
QWEN CHAT GITHUB HUGGING FACE MODELSCOPE DISCORD
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
Как вы поняли, сегодня день Qwen - три модели сразу, ребята работают не покладая рук. И все - опенсорс
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
🤖 Почему роботы Unitree так быстро стали одними из лучших?
На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.
Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.
Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.
Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.
Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
Forwarded from Refat Talks: Tech & AI
Как я научил кодинг-агентов дебажить AI-приложения через трейсы
Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.
Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.
В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!
Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!
Иногда даже прошу его самого найти релевантные трейсы.
Как настроить?
У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp
Для Claude Code добавляется одной командой:
До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!
Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.
Где еще пригодится:
- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности
На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.
Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.
💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.
Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.
🔥➕🔁
Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.
Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.
В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!
Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!
Иногда даже прошу его самого найти релевантные трейсы.
Как настроить?
У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp
Для Claude Code добавляется одной командой:
claude mcp add langfuse --scope local -- uvx langfuse-mcp \
--public-key "$LANGFUSE_PUBLIC_KEY" \
--secret-key "$LANGFUSE_SECRET_KEY" \
--host https://cloud.langfuse.com
До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!
Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.
Где еще пригодится:
- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности
На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.
Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.
💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.
Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.
🔥➕🔁
🔥1👏1
Сегодня достаточно новостей, к ним прибавлю еще то, о чем не написал вчера - а именно, о выходе аж 3 новых моделей от Qwen, который теперь уверенно занял местно №1 по полноте и качеству моделей в опенсорсе.
Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;
- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;
- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;
- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;
+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...
Ну а ниже, несколько постов про вчерашние и сегодняшие модели
Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;
- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;
- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;
- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;
+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...
Ну а ниже, несколько постов про вчерашние и сегодняшие модели
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.
Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером
Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)
Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB
Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)
#qwen #мультимодальность #написаноклодом
huggingface.co
Qwen/Qwen3-Omni-30B-A3B-Instruct · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Поддержка 3 китайских диалектов (пекинский, шанхайский, сычуаньский)
Применение:
- Колл-центры и голосовые помощники
- Аудиокниги и контент для подкастов
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.
Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций
Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Поддержка 3 китайских диалектов (пекинский, шанхайский, сычуаньский)
Применение:
- Колл-центры и голосовые помощники
- Аудиокниги и контент для подкастов
- Интеграция с Qwen3 для мультимодальных ассистентов
🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)
#tts #голосовыесинтез #написаноклодом
huggingface.co
Qwen3 TTS Demo - a Hugging Face Space by Qwen
Enter any text, choose a voice and language, and the app creates a natural‑sounding audio file for you to listen to. You can pick from dozens of different speakers, covering many languages. The gen...
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.
Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)
Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов
Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis
🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)
#редактирование #diffusion #написаноклодом
Qwen
Qwen-Image-Edit: Image Editing with Higher Quality and Efficiency
QWEN CHAT GITHUB HUGGING FACE MODELSCOPE DISCORD
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
We are excited to introduce Qwen-Image-Edit, the image editing version of Qwen-Image. Built upon our 20B Qwen-Image model, Qwen-Image-Edit successfully extends Qwen-Image’s unique text rendering capabilities…
🚀 Meta Code World Model: "симулятор кода" от FAIR
Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.
Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.
Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024
🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction
📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей
🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments
Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.
🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)
#метакод #worldmodels #исследования #написаноклодом
Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.
Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.
Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024
🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction
📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей
🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments
Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.
🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)
#метакод #worldmodels #исследования #написаноклодом
huggingface.co
facebook/cwm · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Кажется, все уже вчера написали про релизы от OpenAI - это новый агент Pulse, который смотрит всю вашу переписку (читает все письма, подслушивает разговоры и пр.) и дает вам полезные советы на очередной день - напоминает про вылет, заказывает столик в ресторане и пр. Скоро будет знать вас лучше, чем ваша жена (спасибо, не надо!).
Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).
Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).
Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
🚀 Google выкатила обновленный Gemini 2.5 Flash и Flash-Lite
Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.
🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками
Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов
Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.
Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.
🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование
#gemini #ai #agentai #написаноклодом
Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.
🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками
Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов
Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.
Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.
🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование
#gemini #ai #agentai #написаноклодом
Googleblog
Google for Developers Blog - News about Web, Mobile, AI and Cloud
Google is releasing updated Gemini 2.5 Flash and Flash-Lite preview models with improved quality, speed, and efficiency.