very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Промпт-инжиниринг в сентябре 2025: что реально работает

В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.

🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.

Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.

Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).

🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.

RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.

Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.

Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.

Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями

⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).

Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.

Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.

Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.

🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide

#промптинжиниринг #ai #производительность #написаноклодом
👍2
🚀 LongCat-Flash-Thinking от Meituan

⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.

LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.


🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking
Forwarded from Machinelearning
🚀 День релизов: Qwen выпустили Qwen3-Omni — первый нативный end-to-end *omni-modal AI*

Модель обрабатывает текст, изображения, аудио и видео в одной модели.

На бенчмарках выглядит так, как будто все модальности работают одинаково качественно.

⚡️ Особенности
- Первое место на 22 из 36 аудио- и мультимодальных бенчмарков
- Поддержка: 119 языков текста,
- Минимальная задержка — 211 мс
- Обработка аудио до 30 минут длиной
- ПОзволяет гибко настраивать через системные промпты
- Встроенный tool calling

🌟 Open-source релизы
Компания выложила три версии:
- Qwen3-Omni-30B-A3B-Instruct
- Qwen3-Omni-30B-A3B-Thinking
- Qwen3-Omni-30B-A3B-Captioner

👉 Попробовать можно здесь:
💬 Chat: https://chat.qwen.ai/?models=qwen3-omni-flash
💻 GitHub: https://github.com/QwenLM/Qwen3-Omni
🤗 Hugging Face: https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe
🤖 ModelScope: https://modelscope.cn/collections/Qwen3-Omni-867aef131e7d4f
🎬 Demo: https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo

@ai_machinelearning_big_data


#qwen #opensource #llm #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🚀 Подборка свежих моделей и датасетов на Hugging Face (16 сентября)

Здесь интересные релизы из разных областей: текст, аудио, изображения и даже видео.

✨ Модели:
- https://huggingface.co/ibm-granite/granite-docling-258M — универсальный инструмент для работы с документами (конвертация и Q&A).
- https://huggingface.co/XiaomiMiMo/MiMo-Audio-7B-Base — мощная аудио-модель для понимания и генерации.
- https://huggingface.co/OpenGVLab/ScaleCUA-3B — мультимодальная модель (картинка → текст).
- https://huggingface.co/decart-ai/Lucy-Edit-Dev — модель для редактирования видео.
- https://huggingface.co/inclusionAI/Ling-flash-2.0 — текстовая модель на 103B параметров.

Эта подборка удобна, чтобы быстро посмотреть, что вышло нового и полезного за последние дни.

🔗 Полный список доступен здесь: https://huggingface.co/collections/merve/sep-16-releases-68d13ea4c547f02f95842f05
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)

Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)

#qwen #мультимодальность #написаноклодом
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Интеграция с Qwen3 для мультимодальных ассистентов

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)

#tts #голосовыесинтез #написаноклодом
❤1
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов

Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis

🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)

#редактирование #diffusion #написаноклодом
Как вы поняли, сегодня день Qwen - три модели сразу, ребята работают не покладая рук. И все - опенсорс
Media is too big
VIEW IN TELEGRAM
🤖 Почему роботы Unitree так быстро стали одними из лучших?

На самом деле - не «вдруг». Секрет в том, что компания не закрылась в себе:
- они продают железо и открывают SDK,
- сами роботы «из коробки» почти бесполезны, но дают полный контроль разработчикам.

Благодаря этому Unitree стала популярной платформой для исследований и разработок, вокруг которой выросло активное сообщество. Результат - G1 сегодня на порядок лучше, чем мог бы быть, если бы компания развивала всё только внутри себя.

Многие хардварные компании с амбициями на «комьюнити-продукты» (роботы, AR-очки и др.) выбирают путь закрытых экосистем. Но такая жадность оборачивается тем, что их решения быстро уступают открытым платформам вроде Unitree G1.
Forwarded from Refat Talks: Tech & AI
Как я научил кодинг-агентов дебажить AI-приложения через трейсы

Уже писал про важность обратной связи при разработке и про observability tools. Сегодня расскажу про технику, которая объединяет оба концепта и мне лично сильно помогает с AI разработкой.

Суть: научить кодинг-агентов читать детальные трейсы исполнения вашего приложения и правильно с ними работать, чтобы они помогали фиксить промпты и код AI-powered приложений.

В трейсах есть все что нужно в структурированном формате: сам промпт, состав контекста и (если правильно настроили трейсинг) вызываемые tools с input/output каждого. Это как рентген каждого вызова!

Подумал - почему бы не скормить это напрямую Claude Code? После внедрения такой штуки теперь вместо детального описания issue просто пишу что-то вроде: есть такая-то проблема , глянь трейс # такой-то в Langfuse. И кодинг-агент:
- находит trace
- изучает длиннющий JSON где все расписано по полочкам в нужном порядке вызова
- чекает имплементацию в коде
- выдает решение
- может тут же протестить фикс таким же образом!

Иногда даже прошу его самого найти релевантные трейсы.

Как настроить?

У Langfuse пока нет официального MCP для этого, но есть готовое решение: https://github.com/avivsinai/langfuse-mcp

Для Claude Code добавляется одной командой:

claude mcp add langfuse --scope local -- uvx langfuse-mcp \
--public-key "$LANGFUSE_PUBLIC_KEY" \
--secret-key "$LANGFUSE_SECRET_KEY" \
--host https://cloud.langfuse.com


До того как я нашел этот MCP мне пришлось написать свой небольшой CLI tool для этого, но этот MCP работает сильно лучше!

Это кстати часть паттерна Automatic Prompt Engineering (APE) - когда AI сам улучшает промпты на основе реальных данных исполнения. А варить APE без feedback loop - не так эффективно.

Где еще пригодится:

- Анализ edge cases - агент сам найдет паттерны в сбойных трейсах и предложит обработку
- Оптимизация токенов - видит где жрется много токенов и предлагает сократить контекст
- Рефакторинг tool chains - анализирует последовательности вызовов и предлагает более эффективные пути
- Автоматические тесты - генерирует e2e тест-кейсы на основе реальных трейсов пользователей
- Миграция промптов - когда переходишь на новую модель, агент адаптирует промпты под ее особенности

На практике это дико ускоряет разработку и дебаг AI-приложений, особенно с agentic поведением где путь исполнения может быть запутанным и неочевидным. Больше не надо гадать что пошло не так - агент сам разберется в трейсах и предложит фикс.

Кстати, достаточно перспективная альтернатива LangFuse - SigNoz - добавил официальный MCP для этих целей недавно.

💡Pro-tip: создай отдельного саб-агента для работы с трейсами, это позволит более эффективно использовать контекст, потому что и дополнительный MCP, и сами трейсы - это дополнительные токены, которые зашумляют твой контекст.

Кто уже использует observability для AI - попробуйте подключить к своим кодинг-агентам. Кто еще не использует - самое время начать, иначе много упускаешь в разработке своих AI-систем.

🔥➕🔁
🔥1👏1
Сегодня достаточно новостей, к ним прибавлю еще то, о чем не написал вчера - а именно, о выходе аж 3 новых моделей от Qwen, который теперь уверенно занял местно №1 по полноте и качеству моделей в опенсорсе.

Итак:
- главная новость дня - выход думающей модели-кодера от Meta - Code World Model. Доступна в опенсорсе - сделаю отдельный пост, хорошие метрики, уступающие только большим моделям типа Kimi K2 (сама модель на 32В). Новации - модель имеет "модель мира", т.е. до того, как что-то написать, она представляет себе, как это будет работать в модели мира, оценивает, и только потом действует;

- Microsoft раскатал в своем Copilot модели Anthropic. Я вот все жду, когда нормальные модели появятся в Microsot Office, но что-то с этим все глухо;

- у Qwen также обновился большой кодер, который теперь называется Qwen-coder-plus;

- Google раскатал в США поиск, который работает по голосу и с изображениями с телефона - т.е. смотрите сайт, задаете вопрос, и гугл ищет по тому, что вы видите на экране. Круто. Пока только на английском;

+ всякая мелочевка: небольшое обновление Codex, увеличение лимитов на модели Google для платных версий, новый курс от Эндрю Нг по агентам, Майкрософт сделал платный раздел на ХаггингФейс с 400 разными моделями и плюшками для разработчиков...

Ну а ниже, несколько постов про вчерашние и сегодняшие модели
🚀 Qwen3-Omni: нативная мультимодальная модель от Alibaba

Alibaba выпустила Qwen3-Omni — end-to-end мультимодальную модель, которая работает с текстом, аудио, видео и изображениями, генерируя ответы в реальном времени как текстом, так и голосом.

Ключевые характеристики:
- MoE-архитектура: 30B параметров, активируется 3B
- SOTA на 22 из 36 audio/video бенчмарков
- Производительность распознавания речи сравнима с Gemini 2.5 Pro
- Латентность: от 234ms (audio) до 507ms (audio+video)
- Архитектура Thinker-Talker с AuT энкодером

Языковая поддержка:
- 119 языков для текста (включая русский)
- 19 языков для голосового ввода (включая русский)
- 10 языков для голосового вывода (включая русский)

Размер модели:
- ~70GB в BF16
- После Q4 квантизации ~14-18GB

Бонус: Qwen3-Omni-Captioner — модель для детального audio caption с низким уровнем галлюцинаций.

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [Qwen3-Omni-30B-A3B-Instruct](https://huggingface.co/Qwen/Qwen3-Omni-30B-A3B-Instruct)
🐙 [GitHub](https://github.com/QwenLM/Qwen3-Omni)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen3-Omni-Demo)

#qwen #мультимодальность #написаноклодом
🗣️ Qwen3-TTS-Flash: мультиязычный голосовой движок

Alibaba представила Qwen3-TTS-Flash — флагманскую text-to-speech модель с поддержкой нескольких голосов, языков и диалектов. Фокус на естественности речи и стабильности.

Ключевые характеристики:
- 17 встроенных голосов без дополнительного обучения
- Минимум заиканий и ошибок произношения на длинных текстах
- SOTA word-error rates по бенчмаркам
- Автоматическая настройка просодии, темпа и эмоциональных интонаций

Языковая поддержка:
- Оптимизирована для китайского и английского
- Поддержка 10+ языков, включая русский
- Поддержка 3 китайских диалектов (пекинский, шанхайский, сычуаньский)

Применение:
- Колл-центры и голосовые помощники
- Аудиокниги и контент для подкастов
- Интеграция с Qwen3 для мультимодальных ассистентов

🔗 Ссылки:
🏠 [Qwen Blog](https://qwen.ai)
🤗 [TTS Demo](https://huggingface.co/spaces/Qwen/Qwen3-TTS-Demo)
📄 [API Docs](https://qwenlm.github.io/blog/qwen-tts/)

#tts #голосовыесинтез #написаноклодом
🎨 Qwen-Image-Edit-2509: серьезный апгрейд редактора изображений

Сентябрьская итерация Qwen-Image-Edit с существенными улучшениями консистентности и новыми возможностями. Модель на ~20B параметров.

Главные нововведения:
- Мульти-изображение: редактирование 1-3 изображений одновременно (person+person, person+product, person+scene)
- Улучшенная консистентность персон: сохранение идентичности лица при разных стилях и позах
- Улучшенная консистентность продуктов: генерация постеров из plain-background изображений
- Продвинутое текстовое редактирование: изменение шрифтов, цветов и материалов текста
- Нативная поддержка ControlNet (keypoints, depth maps, sketches)

Особенности:
- Поддержка двуязычного редактирования текста (китайский и английский)
- Работа с кириллицей через text rendering capabilities
- Semantic editing: изменение контента с сохранением визуальной семантики
- Appearance editing: точные low-level изменения элементов

Применение:
- IP creation и мем-генерация
- Реставрация старых фото
- Создание product постеров
- Novel view synthesis

🔗 Ссылки:
🏠 [Qwen Blog](https://qwenlm.github.io/blog/qwen-image-edit/)
🤗 [Qwen-Image-Edit-2509](https://huggingface.co/Qwen/Qwen-Image-Edit-2509)
🎮 [Demo](https://huggingface.co/spaces/Qwen/Qwen-Image-Edit-2509)
🐙 [GitHub](https://github.com/QwenLM/Qwen-Image)

#редактирование #diffusion #написаноклодом
🚀 Meta Code World Model: "симулятор кода" от FAIR

Meta FAIR представила Code World Model (CWM) — исследовательскую модель на 32B параметров, которая не просто генерирует код, а понимает, как он влияет на состояние системы.

Ключевая особенность:
CWM обучена на observation-action trajectories из Python execution traces и Docker environments. Это значит, что модель понимает не только "как пишется код", но и "что происходит при его выполнении" — причинно-следственные связи между действиями кода и изменениями среды.

Впечатляющие результаты:
• 65.8% на SWE-bench Verified (с test-time scaling)
• 68.6% на LiveCodeBench
• 96.6% на Math-500
• 76.0% на AIME 2024

🆚 Сравнение с другими моделями:
• vs GPT-4: сопоставимая производительность на coding benchmarks, но с open weights
• vs DeepSeek Coder: лучше в tasks requiring state awareness и environment interaction

📱 Где попробовать:
• HuggingFace: [facebook/cwm](https://huggingface.co/facebook/cwm) (требует одобрение доступа ~1 час)
• GitHub: полный код для исследователей

🔧 Краткие характеристики:
Dense decoder-only, контекст 131k токенов, research license, фокус на Python + Docker environments

Применение: исследование world models в кодинге, multi-step software engineering, симуляция выполнения кода без реального запуска.

🔗 Ссылки:
🏠 [Техотчёт Meta](https://ai.meta.com/research/publications/cwm/)
🤗 [HuggingFace](https://huggingface.co/facebook/cwm)
🐙 [GitHub](https://github.com/facebookresearch/cwm)

#метакод #worldmodels #исследования #написаноклодом
Кажется, все уже вчера написали про релизы от OpenAI - это новый агент Pulse, который смотрит всю вашу переписку (читает все письма, подслушивает разговоры и пр.) и дает вам полезные советы на очередной день - напоминает про вылет, заказывает столик в ресторане и пр. Скоро будет знать вас лучше, чем ваша жена (спасибо, не надо!).

Еще опубликовали новый бенчмарк GDPval, по которому проверяют модели, и, видимо, бенчмарк хороший, так как это один из немногих бенчей, где первое место у Claude - а они реально хороши, но большинстве тестов недооценены (скорее по причине того, что конкуренты больше работают над тем, чтобы научиться решать эти тесты, а Антропик - больше работает над моделями).

Расшарили проекты на команды пользователей для больших платных подписок. Полезно тем, кто работает в командах - но я не знаю, кто у нас делает это с дорогими моделями
🚀 Google выкатила обновленный Gemini 2.5 Flash и Flash-Lite

Вчера Google выпустила [обновленные preview-версии](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/) Gemini 2.5 Flash и Flash-Lite с серьезными улучшениями. Особенно порадовали изменения в работе с инструментами и экономичности - на 50% меньше токенов у Flash-Lite и 24% у Flash.

🔧 Что нового в Flash Preview (gemini-2.5-flash-preview-09-2025):
- Лучший agentic tool use - модель теперь умнее использует инструменты в сложных многошаговых задачах. На бенчмарке SWE-Bench Verified рост с 48.9% до 54% (+5%)
- Более экономичный thinking - при включенном "мышлении" модель генерирует меньше токенов, но качество выше
- Улучшенное форматирование - в приложении Gemini теперь лучше структурирует ответы с заголовками и списками

Flash-Lite Preview (gemini-2.5-flash-lite-preview-09-2025) получил:
- Лучшее выполнение инструкций и системных промптов
- Менее "болтливые" ответы (снижение стоимости на 50%)
- Улучшенную мультимодальность и качество переводов

Gemini неплохо работает с русскими текстами, хотя иногда видно, что "думает на английском". Стоимость: Flash - $0.85 за 1M токенов, Flash-Lite - $0.10/$0.40 (input/output). Пожалуй, основной конкурент теперь - это Grok 4 fast, который дешевле Flash, но дороже Flash-Lite.

Народ в [Reddit хвалит](https://artificialanalysis.ai/models/gemini-2-5-flash) новые версии за скорость (192.6 токенов/сек) и низкую задержку (0.33s до первого токена). Manus сообщает о 15% росте производительности в долгосрочных агентных задачах. Не прорыв, но еще один шаг вперед.

🔗 Полезные ссылки:
🏠 [Официальный блог Google](https://developers.googleblog.com/en/continuing-to-bring-you-our-latest-models-with-an-improved-gemini-2-5-flash-and-flash-lite-release/)
🎮 [Google AI Studio](https://ai.google.dev) - для тестирования
🤗 [Vertex AI](https://cloud.google.com/vertex-ai) - корпоративное использование

#gemini #ai #agentai #написаноклодом
📱 Liquid Nanos: GPT-4o качество в кармане

🚀 Что анонсировали: [Liquid AI](https://www.liquid.ai/) выпустили коллекцию Liquid Nanos — сверхкомпактные модели (350M–2.6B параметров), которые показывают качество GPT-4o на специализированных задачах, работая полностью локально на телефонах и ноутбуках.

🔧 Техническая магия: Вместо классических трансформеров используют liquid neural networks (вдохновленные биологическими системами). Размер в RAM: всего 100MB–2GB. Task-specific подход — каждая модель заточена под конкретную задачу: извлечение данных, перевод, RAG, математику, tool calling.

Примеры моделей:
- LFM2-Extract (350M/1.2B) — извлекает данные из документов в JSON
- LFM2-1.2B-RAG — для длинных контекстов
- LFM2-1.2B-Tool — function calling
- LFM2-350M-Math — математические задачи

🇷🇺 Русский язык пока НЕ поддерживается (только EN, AR, ZH, FR, DE, JA, KO, ES).

Экономика впечатляет: по расчетам Liquid, их локальные агенты обходятся в 50 раз дешевле облачных решений и потребляют в 100 раз меньше энергии. [Shopify CTO](https://finance.yahoo.com/news/liquid-unveils-nanos-extremely-small-130000600.html) называет результаты "very impressive", а Deloitte уже планирует внедрение. Модели обгоняют Gemma 3 в 10+ раз их размером.

🔗 Основные ссылки:
🏠 [Официальный блог](https://www.liquid.ai/blog/introducing-liquid-nanos-frontier-grade-performance-on-everyday-devices) | 🤗 [HuggingFace](https://huggingface.co/LiquidAI) | 📱 [LEAP платформа](https://www.liquid.ai/models)

#локальныйai #edgeai #написаноклодом
Media is too big
VIEW IN TELEGRAM
⚡️ Tencent представила Hunyuan3D-Part, первую в своём роде open-source модель генерации 3D-объектов на уровне деталей, которая обгоняет все существующие открытые и закрытые решения.

Главное:
🔹 P3-SAM — первая нативная 3D-модель сегментации деталей
🔹 X-Part — генератор деталей с SOTA-результатами по управляемости и качеству

Ключевые особенности:
1️⃣ Обучение на 3.7 млн форм с чистыми аннотациями без использования 2D SAM
2️⃣ Новый автоматический пайплайн сегментации в 3D — полностью без участия пользователя
3️⃣ Диффузионный пайплайн для разбиения на части с учётом геометрии и семантики

Код доступен на GitHub, веса выложены на Hugging Face, а протестировать модель можно как в облегчённой версии на Hugging Face, так и в полном формате через Hunyuan3D Studio.

→Code: https://github.com/Tencent-Hunyuan/Hunyuan3D-Part
→ Веса: https://huggingface.co/tencent/Hunyuan3D-Part
→ Paper: https://arxiv.org/abs/2509.06784
→ Project page: https://murcherful.github.io/P3-SAM/
Попробовать:
→ (Light version) Hugging Face demo: https://huggingface.co/spaces/tencent/Hunyuan3D-Part
→ (Full version) Hunyuan3D Studio: https://3d.hunyuan.tencent.com/studio
Please open Telegram to view this post
VIEW IN TELEGRAM