very vibe coding
121 subscribers
463 photos
126 videos
13 files
995 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
⚡️ Qwen-ASR Toolkit — мощный Python CLI для быстрой транскрипции длинных аудио и видео

Эта утилита снимает ограничение API Qwen-ASR (бывший Qwen3-ASR-Flash) в 3 минуты и позволяет расшифровывать часы контента. Достигается это за счёт умного разбиения записи и параллельной обработки.

Основные возможности:
- Снятие лимита в 3 минуты - транскрибируй файлы любой длины
- Умное разбиение (VAD - это технология, которая определяет, где в аудио есть речь, а где — пауза или шум.) - деление по естественным паузам, без
- Высокая скорость - многопоточность и параллельные запросы к API
- Автоматический ресемплинг — конвертация в нужный формат 16kHz mono
- Поддержка любых форматов — MP4, MOV, MKV, MP3, WAV, M4A и др.
- Простота - запуск одной командой через CLI

🟢 Установка:


pip install qwen3-asr-toolkit


🔗 GitHub: https://github.com/QwenLM/Qwen3-ASR-Toolkit

@ai_machinelearning_big_data


#asr #speech2text #qwen #opensource #nlp #toolki
Please open Telegram to view this post
VIEW IN TELEGRAM
У меня сегодня небольшой лайфхак. На работе использую старый iMac с 8гб памяти - тормозит безбожно, теперь понятно почему, просто системе надо ее больше. Отключил пожирателей памяти - из стандартных программ это спотлайт и «живые» обои. Вместо них поставил просто черный экран. И вот это вообще бомба - по-сути, режим фокусировки включен всегда. Очень понравилось, думаю, как я раньше до этого не догадался. Попробуйте
В ChatGPT платным пользователям теперь можно выбирать самостоятельно время, которое модель «думает». Отличное обновление
Очередная открытая китайская моделька Ling-flash-2.0 на 103В параметров. По рейтингам выступает не хуже got-oss-120B от OpenAI
И новая Magistral-1.2 от европейского лидера - Mistral. Запускается на 32гб, но можно попробовать и на 16… (квантизация от Unsloth)
Forwarded from Dealer.AI
Mem-agent еще одна концепция памяти 🧠

В своих постах про память, а также выступлении на datafest я обозревал самые популярные подходы к созданию памяти: long context, саммаризация, ner, function calling и rag. Однако мельком, буквально на слайдике одним пунктиком я упоминал про агентный подход для памяти. И обещал, что, как-нибудь, мы еще об этом поговорим.

После релиза manus и их восхитительного поста про то как они используют память на файлах и incontext learning, вышла еще одна интересная работа - MemAgent. И самое интересное, что у нее много общего и с решением Manus и с нашим подходом.

В центре всего стоит взаимодействие их small-LM на базе Qwen3-4b-thinking (т.е. рассуждающая моделька с CoT, SO, и т.п.). Кстати, модель обучена уже с GSPO против GRPO, но об этом в следующий раз. Вернёмся к малышке модельке, такой типоразмер, а главное способ обучения, и поддержка long-context позволяет нам не использовать RAG механики. Ввиду своей скорости, агент на такой модели может быстро серфить по их файловой системе памяти, основанной на двусторонней связи .md файлов по типу obsidian. Если мы вспомним мой рассказ про Manus, там тоже агенты пишут флоу/чекпоинты действий в "локальный" буфер в виде to-do файла. Это же, по словам авторов, позволяет не прибегать к сложному RAG подходу (векторным БД и т.п.), хотя использует поиск по ключевым словам. Да и я думаю, что rag механики только бы усилили этот сетап. Сейчас все-таки мода на гибридизацию памяти.

🗂️ Организация памяти

Mem-Agent использует иерархическую структуру хранения данных в формате Markdown:

memory/
├── user.md
└── entities/
└── [entity_name_1].md
└── [entity_name_2].md
└── …

· user.md: центральный файл с информацией о пользователе, содержащий ссылки на связанные сущности.
· entities/: каталог с дополнительными файлами, описывающими различные сущности (люди, организации, проекты).

Пример содержимого user.md:

# User Information
- user_name: Atakan Tekparmak
- birth_date: 2001-09-27
- birth_location: Istanbul, Turkey
## User Relationships
- employer: [[entities/dria.md]
]
Тут прям key/value подход как у нас.

🔗 Система связей

Mem-Agent реализует двунаправленные связи между файлами по аналогии с Obsidian, что позволяет агенту эффективно навигировать по данным и формировать контекстуально обогащенные ответы.

💻 MCP-сервер для интеграции.

Важно, стоит отметить, что данное решение только для работы с глобальной памятью. Поэтому это именно MemAgent, и для работы с ним даже есть свой MCP, чтобы можно было агрегировать в проекте любые доступные LLM-api и иметь локальную систему памяти на файлах.

В состав проекта входит MCP-сервер, который обеспечивает seamless-интеграцию с популярными платформами:

· Claude Desktop
· LM Studio
· ChatGPT

Это позволяет использовать Mem-Agent в качестве единого центра памяти для различных ИИ-помощников без необходимости переключения между платформами.

Итого на выходе получаем легкого агента для заполнения, и чтения/навигации по памяти. С возможностью работать с поиском, вызовом функций, MCP протоколом и интеграцией с популярными LLM api.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🎥 Ray3 — новая модель генерации видео от Luma AI

Это первая reasoning-модель для видео: она не только генерирует контент, но и «понимает» задачи, анализирует, исправляет себя и создаёт генерации студийного уровня.

Можно попробовать бесплатно в Dream Machine.

🔥 Что умеет Ray3:
- Черновой режим (Draft Mode) - позволяет быстро создавай креативы и генерирвать сцены, а потом выводить их в 4K HDR.
- Reasoning — модель хорошо понимает промпты и визуальные команды, строит логику движения и компоновки, умеет «думать» о том, что генерирует.
- Визуальные пометки - можно нарисовать стрелку или кружок на кадре, и Ray3 поймёт, куда двигать камеру или объект.
- Физика и реализм — симуляции движения, толпы, анатомия, свет, отражения, размытость в движении.
- HDR-видео — вывод в 10, 12 и 16-бит HDR с яркими цветами, деталями в тенях и бликах, экспорт в EXR для пост-продакшна.

🟠 Подробнее:
http://lumalabs.ai/ray3

@ai_machinelearning_big_data

#Ray3 #LumaAI #AIVideo #GenerativeAI #ReasoningAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Google раскатывает Gemini в своем браузере Chrome. Теперь он может анализировать данные открытых страниц, искать по ним информацию и пр.

Следующим шагом запустят агента, который сможет заполнять анкеты, делать заказы, и много другое.

Пока функция доступна только пользователям в США.

А главным конкурентом Google на этом поле, видимо, будет Perplexity Comet, который не обладает такой мощной моделью, но агента уже запустил и набирает пользователей.
Последнее время много информации о том, как OpenAI докручивает gpt-5, прежде всего в Codex, который как агент работает в командной строке. Его потребление выросло втрое, прежде всего, за счет тех, кто пересел с Claude Code.

А у Claude тем временем технические проблемы - народ жалуется на поглупевшие модели, идут какие-то сбои.

Пожалуй, тоже попробую Codex - он где-то был у меня…
Я как-то больше с текстовыми моделями работаю, а хайп делается на картинках и видео. Сначала OpenAI поймала волну с рисованием картинок в ChatGPT, потом Google с Nano banana.

Поэтому новость о том, что число пользователей Perplexity Comet удвоилось за несколько часов после того, как агенту в этот браузере дали доступ к nano banana, уже не удивляет.
Хит-парад открытых моделей на LM-arena (на этом ресурсе очень интересное формирование рейтинга - одна задача дается двум моделям и пользователь выбирает ответ, который больше нравится, так попарно сравниваются разные модели и из этих сравнений формируется общий рейтинг). Пожалуй, это единственный рейтинг, которому я доверяю - на остальные рейтинги модели просто натаскиваются, а здесь это сделать сложно, хотя тоже есть свои нюансы.

Интересно, что сильно выступает Gemma-3 на 27b параметров, которая обычно не светится высоко в других рейтингах.
Grok4 Fast - младшая модель от xAI Илона Маска хотя и уступает основной, но топ в работе с поиском, и очень доступна.

Сейчас бесплатна в приложениях Х, grok и пр., временно бесплатна в OpenRouter (это основной ресурс, где можно подключаться к моделям по выбору по апи), и стоит по апи 0,2$ за 1М входящих токенов и 0,5$ за 1М исходящих. Это очень хорошее предложение, и, судя по grok 4, должна быть хорошая модель.

Да, и контекст у нее 2М токенов. По прежнему не рекомендую его забивать, думать с ростом контекста она будет хуже, но если модель используется для поиска, то это важно, поиск убивает контекст моментально.

В общем, рекомендую обратить внимание.
📘 Introduction to Machine Learning* (Laurent Younes)

Что внутри:
- 📐 Математический фундамент: анализ, линейная алгебра, теория вероятностей
- ⚡ Оптимизация: SGD, проксимальные методы и др.
- 🤖 Алгоритмы с учителем: линейные модели, SVM, деревья, бустинг, нейросети
- 🎲 Генеративные модели: MCMC, графические модели, вариационные подходы, GAN
- 🔎 Без учителя: кластеризация, PCA, факторный анализ, обучение на многообразиях
- 📊 Теория: неравения концентрации, обобщающая способность моделей

Фундаментальный учебник, который соединяет математику и практику ML.

👉 https://arxiv.org/abs/2409.02668

#MachineLearning #DeepLearning #Mathematics #DataScience #DataScientist
День экспериментов

Сегодня у меня был план - довести до ума мой кластер из мак мини и запустить на них модель (выбрал себе Qwen3 30B A3B 4bit) - если расшифровать, то модель на 30В параметров, которая MoE - mixture of experts, каждый размером 3В, квантованная на 4 бита. На самом деле, там 3 модели разные с этими характеристиками, но не суть.

Дожал установку пакета EXO на третьем компьютере - этот пакет позволяет строить кластер из нескольких машин. Проблема, почему не ставилось все нормально с самого начала - включенный VPN, пара часов ушла на то, чтобы в этом разобраться. Ну ок, все встало, машинки связались, показали общую вычислительную мощь больше, чем у М4 Мах. Не удивительно. Кстати, увидел в Х приглашение в ЕХО на работу в Лондон - 300К в год + акции. Нормально..

Дальше выбрал модель и попытался ее установить. И вот тут меня ждал большой облом - оказалось, что в EXO есть ограниченный набор моделей, которые поддерживаются пакетом. И все они не так, чтобы новые. Ну, скажем, Qwen 2.5, Gemini 2... Прямо скажу, смысла их ставить большого не вижу.

Других пакетов, объединяющих маки в кластеры, как я понимаю, нет. В общем, приплыли. Не делайте как я. Купите сразу одну машинку помощнее.

Посмотрел попутно другие варианты - установить на мак Linux и пр. Пока сыро, смысла нет.

Ну, делать нечего, ставлю модельку на отдельно взятый мак мини. Тоже интересная задачка. Выбрал ERNIE-4.5-21B-A3B-Thinking в 2-х битном квантовании. Казалось бы, должен быть трэш, ан нет - это умное динамическое квантование от Unsloth, где разные веса, в зависимости, от значимости, квантуются с разной потерей точности. Как оказалось, модели MoE в целом лучше работают с динамическим квантованием - эксперты, которые используются чаще, квантуются слабее. Посмотрим, что получится.

Теперь думаю, что делать с моим кластером - если вам вдруг нужен новенький мак мини (покупал по 45 тыс. руб.), отдам в хорошие руки, пишите в личку. Могу и что-нибудь интересное сразу на него поставить ))
В продолжение вчерашних экспериментов - запустил сегодня с утречка на одиночном мак мини модельку от OpenAI - gpt-oss-20B в квантовании на 4 бита. Работает, но всегда немного использует swap в самом начале, поэтому любой ответ дается медленно. Говорят, что это не лечится, вообще чудо, что запускается.

Взял модельку поменьше, ориентированную именно на русский язык.
https://huggingface.co/VlSav/Vikhr-Nemo-12B-Instruct-R-21-09-24-Q4_K_M-GGUF
Называется Вихрь, оптимизирована нашими умельцами, в кванте на 4 бита вполне нормально работает, со свопом не сталкивался, по крайней мере, пока - надо посмотреть, как будет работать с разными контекстами.

Попробую в пока использовать в различных автоматизациях ее - посмотрим, будет ли хватать или нет.

Но в целом немного устал, и от Клода, и от Джемини - пока с ними что-то устанавливаешь все время косяки - то не посмотрели на актуальный синтаксис, то забыли, что у меня памяти всего 16гб. Клод так вообще пять раз в предел контекстного окна упирался, и все, как всегда, внезапно. Раздражает.

В общем, надо как-то жестче управлять контекстом. Помнить нужное, забывать лишнее. Пожалуй, надо repo prompt подробнее осваивать. И его создатель настоятельно рекомендует использовать с ним codex, который под хорошим управлением сильно адекватнее того же Клода, причем не Соннета, а Опуса (которым я не пользуюсь - там 5 запросов, и все, можно отдыхать).

Зато, в дополнение к Ollama и LM Studio попробовал поработать с пакетами llama.cpp и mlx-lm. Действительно, более сложно и непонятно, но, как говорят, ресурсы используются эффективнее. Будем надеяться
Промпт-инжиниринг в сентябре 2025: что реально работает

В 2025 году промпт-инжиниринг превратился из простых трюков с "думай пошагово" в серьёзные фреймворки, которые дают +67% к продуктивности в энтерпрайзе. Разбираем, что изменилось и что реально работает сейчас.

🚀 Главные изменения года
Chain-of-Thought готов для продакшна. Больше не просто "let's think step by step", а сложные CoT-реализации, которые разбивают бизнес-задачи на проверяемые шаги. Финансовые промпты теперь показывают математику, ссылаются на источники и помечают уровень неопределённости.

Мультимодальные промпты в реальном использовании. Компании реально применяют image+text промпты для анализа документов, техчертежей и проверки соответствия. В одном кейсе точность анализа контрактов выросла на 25% по сравнению с text-only подходом.

Self-consistency против галлюцинаций. Вместо одного пути рассуждений запускается 3-5 параллельных цепочек, выбирается консенсусный ответ. Прорыв для задач, где важна точность (финансы, медицина, юриспруденция).

🔧 Что реально работает сейчас
Prompt Scaffolding (каркас промптов) для продакшн-систем включает проверки безопасности, фреймворки рассуждений и enterprise-граничения с обязательным указанием источников и уровней уверенности.

RAG-Enhanced Context Engineering эволюционировал от простого "вот документы" до систем с оценкой релевантности, взвешиванием источников и явной квантификацией неопределённости.

Структурированные промпты (роль + контекст + задача + формат) побеждают хаотичные инструкции.

Мультимодальные техники (текст + изображения) дают серьёзный прирост точности для анализа документов.

Temperature 0.1-0.3 работает лучше нуля для задач с рассуждениями

⚡ Главные сюрпризы года
Эмоциональные промпты работают. Фразы типа "This is very important to my career" реально улучшают производительность на ~10% (подтверждено исследованиями, не анекдоты).

Оптимизация под конкретные модели важна. GPT-4o лучше отвечает на структурированное форматирование, Claude 4 предпочитает разговорный тон, Gemini 1.5 Pro отлично работает с явными шагами рассуждений.

Простое побеждает сложное. Переинженированные промпты часто работают хуже чётких прямых инструкций.

Безопасность — новое узкое место. Adversarial prompt injection (атаки через враждебные промпты) — реальная угроза. Продакшн-системам нужен защитный дизайн промптов с первого дня.

🔗 Источники:
🏠 Reddit: State of Prompt Engineering September 2025
📊 The Prompt Report (2025) - самый полный академический обзор
🔒 Lakera's adversarial testing guide
🏢 IBM's 2025 prompt engineering guide

#промптинжиниринг #ai #производительность #написаноклодом
👍2
🚀 LongCat-Flash-Thinking от Meituan

⚡ Главное
- Размер: 560 миллиардов параметров, но работает только часть (~27B), поэтому инференс быстрее и дешевле.
- Технология ScMoE (Shortcut-Connected MoE) позволяет совмещать вычисления и обмен данными, уменьшая задержку.
- Поддерживает контекст до 128k токенов — можно обрабатывать очень длинные документы.
- Обучалась на 20+ триллионах токенов всего за месяц.
- Скорость инференса: 100+ токенов в секунду.
- Лицензия: MIT.
- Поддерживает работу с агентами (agentic tasks).
- Модель хороша в программировании и рассуждениях.
- На бенчмарке результаты на уровне топовых моделей.

LongCat-Flash доказывает, что даже модель на сотни миллиардов параметров может быть быстрой и практичной.


🔗 Hugging Face: https://huggingface.co/meituan-longcat/LongCat-Flash-Thinking