very vibe coding
121 subscribers
463 photos
126 videos
13 files
995 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Хит-парад открытых моделей на LM-arena (на этом ресурсе очень интересное формирование рейтинга - одна задача дается двум моделям и пользователь выбирает ответ, который больше нравится, так попарно сравниваются разные модели и из этих сравнений формируется общий рейтинг). Пожалуй, это единственный рейтинг, которому я доверяю - на остальные рейтинги модели просто натаскиваются, а здесь это сделать сложно, хотя тоже есть свои нюансы.

Интересно, что сильно выступает Gemma-3 на 27b параметров, которая обычно не светится высоко в других рейтингах.
Grok4 Fast - младшая модель от xAI Илона Маска хотя и уступает основной, но топ в работе с поиском, и очень доступна.

Сейчас бесплатна в приложениях Х, grok и пр., временно бесплатна в OpenRouter (это основной ресурс, где можно подключаться к моделям по выбору по апи), и стоит по апи 0,2$ за 1М входящих токенов и 0,5$ за 1М исходящих. Это очень хорошее предложение, и, судя по grok 4, должна быть хорошая модель.

Да, и контекст у нее 2М токенов. По прежнему не рекомендую его забивать, думать с ростом контекста она будет хуже, но если модель используется для поиска, то это важно, поиск убивает контекст моментально.

В общем, рекомендую обратить внимание.
📘 Introduction to Machine Learning* (Laurent Younes)

Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей

Фундаментальный учебник, который соединяет математику и практику ML.

👉 https://arxiv.org/abs/2409.02668

#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
День экспериментов

Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.

Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..

Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.

Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.

Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.

Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.

Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
В продолжение вчерашних экспериментов - запустил сегодня с утречка на одиночном мак мини модельку от OpenAI - gpt-oss-20B в квантовании на 4 бита. Работает, но всегда немного использует swap в самом начале, поэтому любой ответ дается медленно. Говорят, что это не лечится, вообще чудо, что запускается.

Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.

Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.

Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.

В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).

Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
Промпт-инжиниринг в сентябре 2025: что реально работает

В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.

🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.

Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.

Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).

🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.

RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.

Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.

Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.

Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями

⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).

Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.

Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.

Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.

🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide

#промптинжиниринг #ai #производительность #написаноклодом
👍2
🚀 LongCat-Flash-Thinking от Meituan

⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.

LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.


🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
Forwarded from Machinelearning
🚀 День релизов: Qwen выпустили Qwen3-Omni — первый нативный end-to-end *omni-modal AI*

Модель обрабатывает текст, изображения, аудио и видео в одной модели.

На бенчмарках выглядит так, как будто все модальности работают одинаково качественно.

⚡️ Особенности
- Первое место на 22 из 36 аудио- и мультимодальных бенчмарков
- Поддержка: 119 языков текста,
- Минимальная задержка — 211 мс
- Обработка аудио до 30 минут длиной
- ПОзволяет гибко настраивать через системные промпты
- Встроенный tool calling

🌟 Open-source релизы
Компания выложила три версии:
- Qwen3-Omni-30B-A3B-Instruct
- Qwen3-Omni-30B-A3B-Thinking
- Qwen3-Omni-30B-A3B-Captioner

👉 Попробовать можно здесь:
💬 Chat: https://chat.qwen.ai/?models=qwen3-omni-flash
💻 GitHub: https://github.com/QwenLM/Qwen3-Omni
🤗 Hugging Face: https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe
🤖 ModelScope: https://modelscope.cn/collections/Qwen3-Omni-867aef131e7d4f
🎬 Demo: https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo

@ai_machinelearning_big_data


#qwen #opensource #llm #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Подборка свежих моделей и датасетов на Hugging Face (16 сентября)

Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.

✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.

Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.

🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)

Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)

#qwen #мультимодальность #написаноклодом
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)

#tts #голосовыесинтез #написаноклодом
❤1
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов

Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis

🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)

#редактирование #diffusion #написаноклодом
Как вы поняли, сегодня день Qwen - три модели сразу, ребята работают не покладая рук. И все - опенсорс
Media is too big
VIEW IN TELEGRAM
🤖 Почему роботы Unitree так быстро стали одними из лучших?

На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.

Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.

Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
Forwarded from Refat Talks: Tech & AI
Как я научил кодинг-агентов дебажить AI-приложения через трейсы

Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.

Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.

В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!

Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!

Иногда даже прошу его самого найти релевантные трейсы.

Как настроить?

У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp

Для Claude Code добавляется одной командой:

claude mcp add langfuse --scope local -- uvx langfuse-mcp \
--public-key "$LANGFUSE_PUBLIC_KEY" \
--secret-key "$LANGFUSE_SECRET_KEY" \
--host https://cloud.langfuse.com


До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!

Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.

Где еще пригодится:

- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности

На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.

Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.

💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.

Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.

🔥➕🔁
🔥1👏1
Сегодня достаточно новостей, к ним прибавлю еще то, о чем не написал вчера - а именно, о выходе аж 3 новых моделей от Qwen, который теперь уверенно занял местно №1 по полноте и качеству моделей в опенсорсе.

Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;

- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;

- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;

- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;

+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...

Ну а ниже, несколько постов про вчерашние и сегодняшие модели
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)

Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)

#qwen #мультимодальность #написаноклодом
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Поддержка 3 китайских диалектов (пекинский, шанхайский, сычуаньский)

Применение:
- Колл-центры и голосовые помощники
- Аудиокниги и контент для подкастов
- Интеграция с Qwen3 для мультимодальных ассистентов

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)

#tts #голосовыесинтез #написаноклодом
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов

Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis

🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)

#редактирование #diffusion #написаноклодом
🚀 Meta Code World Model: "симулятор кода" от FAIR

Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.

Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.

Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024

🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction

📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей

🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments

Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.

🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)

#метакод #worldmodels #исследования #написаноклодом