very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Как вы поняли, сегодня день Qwen - три модели сразу, ребята работают не покладая рук. И все - опенсорс
Media is too big
VIEW IN TELEGRAM
🤖 Почему роботы Unitree так быстро стали одними из лучших?

На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.

Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.

Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
Forwarded from Refat Talks: Tech & AI
Как я научил кодинг-агентов дебажить AI-приложения через трейсы

Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.

Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.

В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!

Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!

Иногда даже прошу его самого найти релевантные трейсы.

Как настроить?

У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp

Для Claude Code добавляется одной командой:

claude mcp add langfuse --scope local -- uvx langfuse-mcp \
--public-key "$LANGFUSE_PUBLIC_KEY" \
--secret-key "$LANGFUSE_SECRET_KEY" \
--host https://cloud.langfuse.com


До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!

Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.

Где еще пригодится:

- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности

На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.

Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.

💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.

Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.

🔥➕🔁
🔥1👏1
Сегодня достаточно новостей, к ним прибавлю еще то, о чем не написал вчера - а именно, о выходе аж 3 новых моделей от Qwen, который теперь уверенно занял местно №1 по полноте и качеству моделей в опенсорсе.

Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;

- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;

- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;

- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;

+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...

Ну а ниже, несколько постов про вчерашние и сегодняшие модели
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)

Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)

#qwen #мультимодальность #написаноклодом
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Поддержка 3 китайских диалектов (пекинский, шанхайский, сычуаньский)

Применение:
- Колл-центры и голосовые помощники
- Аудиокниги и контент для подкастов
- Интеграция с Qwen3 для мультимодальных ассистентов

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)

#tts #голосовыесинтез #написаноклодом
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов

Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis

🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)

#редактирование #diffusion #написаноклодом
🚀 Meta Code World Model: "симулятор кода" от FAIR

Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.

Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.

Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024

🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction

📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей

🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments

Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.

🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)

#метакод #worldmodels #исследования #написаноклодом
Кажется, все уже вчера написали про релизы от OpenAI - это новый агент Pulse, который смотрит всю вашу переписку (читает все письма, подслушивает разговоры и пр.) и дает вам полезные советы на очередной день - напоминает про вылет, заказывает столик в ресторане и пр. Скоро будет знать вас лучше, чем ваша жена (спасибо, не надо!).

Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).

Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
🚀 Google выкатила обновленный Gemini 2.5 Flash и Flash-Lite

Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.

🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками

Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов

Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.

Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.

🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование

#gemini #ai #agentai #написаноклодом
📱 Liquid Nanos: GPT-4o качество в кармане

🚀 Что анонсировали: [Liquid AI](https://www.liquid.ai/) выпустили коллекцию Liquid Nanos — сверхкомпактные модели (350M–2.6B параметров), которые показывают качество GPT-4o на специализированных задачах, работая полностью локально на телефонах и ноутбуках.

🔧 Техническая магия: Вместо классических трансформеров используют liquid neural networks (вдохновленные биологическими системами). Размер в RAM: всего 100MB–2GB. Task-specific подход — каждая модель заточена под конкретную задачу: извлечение данных, перевод, RAG, математику, tool calling.

Примеры моделей:
- LFM2-Extract (350M/1.2B) — извлекает данные из документов в JSON
- LFM2-1.2B-RAG — для длинных контекстов
- LFM2-1.2B-Tool — function calling
- LFM2-350M-Math — математические задачи

🇷🇺 Русский язык пока НЕ поддерживается (только EN, AR, ZH, FR, DE, JA, KO, ES).

Экономика впечатляет: по расчетам Liquid, их локальные агенты обходятся в 50 раз дешевле облачных решений и потребляют в 100 раз меньше энергии. [Shopify CTO](https://finance.yahoo.com/news/liquid-unveils-nanos-extremely-small-130000600.html) называет результаты "very impressive", а Deloitte уже планирует внедрение. Модели обгоняют Gemma 3 в 10+ раз их размером.

🔗 Основные ссылки:
🏠 [Официальный блог](https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices) | 🤗 [HuggingFace](https://huggingface.co/LiquidAI) | 📱 [LEAP платформа](https://www.liquid.ai/models)

#локальныйai #edgeai #написаноклодом
Media is too big
VIEW IN TELEGRAM
⚡️ Tencent представила Hunyuan3D-Part, первую в своём роде open-source модель генерации 3D-объектов на уровне деталей, которая обгоняет все существующие открытые и закрытые решения.

Главное:
🔹 P3-SAM — первая нативная 3D-модель сегментации деталей
🔹 X-Part — генератор деталей с SOTA-результатами по управляемости и качеству

Ключевые особенности:
1️⃣ Обучение на 3.7 млн форм с чистыми аннотациями без использования 2D SAM
2️⃣ Новый автоматический пайплайн сегментации в 3D — полностью без участия пользователя
3️⃣ Диффузионный пайплайн для разбиения на части с учётом геометрии и семантики

Код доступен на GitHub, веса выложены на Hugging Face, а протестировать модель можно как в облегчённой версии на Hugging Face, так и в полном формате через Hunyuan3D Studio.

→Code: https://github.com/Tencent-Hunyuan/Hunyuan3D-Part
→ Веса: https://huggingface.co/tencent/Hunyuan3D-Part
→ Paper: https://arxiv.org/abs/2509.06784
→ Project page: https://murcherful.github.io/P3-SAM/
Попробовать:
→ (Light version) Hugging Face demo: https://huggingface.co/spaces/tencent/Hunyuan3D-Part
→ (Full version) Hunyuan3D Studio: https://3d.hunyuan.tencent.com/studio
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышел Kling 2.5 turbo

Кто-то уже тестил?

По бенчмаркам лучше чем veo 3 fast и seedance 1.0

Но, как говоря, текст рендерит паршиво

@creadvice
⚡️ Новые модели для Кодина от Kwaipilot: KAT-Dev-32B и KAT-Coder

- KAT-Dev-32B — 62.4% на SWE-Bench Verified, входит в топ-5 среди open-source моделей
- KAT-Coder — 73.4% на SWE-Bench Verified, результат на уровне лучших проприетарных решений

🔗 Попробовать: https://huggingface.co/Kwaipilot/KAT-Dev
Perplexity Comet

Поставил себе потестировать новомодный браузер Comet от Perplexity в платном режиме. С vpn работает и у нас, ищет быстро, в нем живет агент - сегодня он писал от меня мастерским запросы по ремонту телефона (как это работает пока не до конца разобрался - в том плане, что ответов я не получил, но когда был в мастерской, оказалось, что им действительно кто-то писал. Прикольно, чо).

Еще нравится то, что работает быстро. Плюс в нем лимиты на платные модели claude sonnet 4, gpt-5 на уровне от создателей на платных режимах, так что можно при одной подписке получить все из них и gemini-2.5 pro + grok 4 в придачу. Солидный набор. Проблема одна - по апи они не работают и claude code, codex на них не запустишь - но если вы еще до этого не добрались и не собираетесь, то подумайте, вариант интересный.

Из любопытного - ты обращаешься не просто к модели, а к агенту от perplexity, который использует модель. Этот агент использует поиск и делает это почти всегда, в то время как сам Claude этого бы делать не стал.

Да, еще голос у перплексити хорошо работает, у антропика и гугла этого нет, а вот OpenAI тоже умеет.

Если кто-то захочет подписаться, по ссылке ниже - 1 бесплатный месяц ($20). Ну и мне тоже перепадет )) Присоединяйтесь

https://perplexity.ai/pro?referral_code=G8O2K6Q0
Forwarded from эйай ньюз
Media is too big
VIEW IN TELEGRAM
Suno V5 + Suno Studio — RIP Mozart AI

Недавно я писал про Mozart AI, которые пытались сделать AI DAW (Digital Audio Workstation) для музыкантов. Но их продукт, как многие заметили в комментариях, всё ещё сырой. И вот пришёл гигант — Suno (по моему мнению, лучший, лучше чем Udio), выкатил свою новую SOTA-модель V5 и сразу же полноценную Studio-версию. И просто решил все проблемы.

По сути, это всё, что обещал Mozart AI, но уже реализованное и с новыми фичами. Главная из них — можно напеть мелодию, а затем превратить её в отдельную дорожку (stem), как на 10:25.

Что это даёт? Дикий контроль. Теперь продюсер, имея один только ноутбук, может получить реалистичную аудиозапись инструмента, а не MIDI-болванку. Причём со всеми нюансами, которые невозможно запрограммировать: реалистичной динамикой, звуком удара медиатора по струнам или шорохом пальцев гитариста по грифу, и всё это в «комнате» с её естественным эмбиенсом.

Профессионалы, конечно, не будут использовать Suno Studio как основную DAW, но как генератор стемов — это геймченджер.

Многие боятся, что генеративная музыка захламит чарты AI-слопом (треть новой музыки на стримингах уже сгенерирована). Но я думаю, что именно эта технология сделает музыку только лучше. Теперь вместо стерильных, запрограммированных в MIDI инструменталов можно будет генерить реалистичные аудиодорожки, что только поднимет общее качество продакшена.

V5 доступна пока только по подписке. Suno Studio — на тире Premier, но сейчас есть скидка: $15 в месяц на первые 3 месяца вместо $30.

@ai_newz