very vibe coding
121 subscribers
463 photos
126 videos
13 files
995 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Vikhr models
Vikhr Borealis - первая русскоязычная открытая audio llm

Мы долго и не очень успешно развивали свой tts - Salt, от него исторически осталось довольно много данных и наработок, мы решили - чо бы не сварить asr + llm как модно?

Ну и сварили. Архитектурно - whisper + qwen, учили на 7к часов аудио только адаптер+llm, сейчас работает только в ASR режиме, позже возможно довезем инструктивный режим. Так же выйдет бенчмарк для русского asr, он пока в доработке.
Блог так же выйдет, там будут небольшие аблейшены по данным

Модель в данный момент бьет whisperы на русском и на части бенчей лучше чем gigam.

Модель
Сolab поиграться
This media is not supported in your browser
VIEW IN TELEGRAM
📱 Убийца фотошопа…

Вашему вниманию - фотошоп, но управляемый MCP

Просто смотрите видео как дизайнеры становятся все менее и менее нужными…

(В особенности со всеми новым функциями фотошоп который будто бы специально для MCP делают интерфейс максимально нативно кнопочным)

@creadvice
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI выпустили новую GPT-5 😑

...заточенную на программистов, GPT-5 Codex. Эта модель заменит o3 в Codex в веб-клиенте (наконец-то) и уже доступна в локальном Codex CLI / плагине для вашей IDE. Если вы ещё не пробовали — обязательно попробуйте! Это бесплатно, если вы подписаны на любой тир ChatGPT. В комментариях многие отмечали, что им нравится больше, чем Claude Code, и модель работает лучше.

GPT-5 Codex дотренировали на новых сложных реальных задач, создании проектов с нуля, добавлении функций и тестов, отладке, проведении масштабных рефакторингов и ревью кода.

По стандартному бенчмарку SWE-bench Verified разница не особо заметна, 74.5% против старых 72.8%. Однако на внутреннем бенчмарке OpenAI на задачах рефакторинга модель стала гораздо лучше: прыжок с 33.9% до 51.3%!

Но и это не всё: модель стала писать меньше бесполезных или ошибочных комментариев, лучше ловить баги в коде, и... думать меньше, когда это не надо. OpenAI взяли запросы от сотрудников внутри компании и сравнили количество токенов в ответах двух моделей.

Там, где ответы были короткими, они стали ещё короче, а там, где цепочки рассуждений и сгенерированный код были длиннее — стало больше. Со слов OpenAI, во время они наблюдали, как GPT‑5-Codex работал автономно более 7 часов подряд над большими и сложными задачами, выполняя итерации по внедрению, исправляя ошибки тестирования и в конечном итоге обеспечивая успешное решение задачи.

Codex CLI и Codex Web получили кучу обновлений за последний месяц, но про них писать не буду.

В API модель появится скоро, очень ждём, пока замеряют качество и на других бенчмарках. В системной карточке модели указали лишь один — по решению многоступенчатых задачек по кибер-взлому (с соревнований CTF). Модель наконец-то статистически значимо обгоняет o3! Жаль, не замерили другие бенчмарки (вроде PaperBench).
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Кстати, Claude code также выпустил обновление, но там больше всяких мелких улучшизмов. Зато некоторое время назад Claude code научился писать функции и сам их вызывать. Пока не знаю, как это будет на практике, но звучит интересно.

А для программирования с Codex на маках вышло приложение (IDE) от OpenAI, которое называется Xcode 26.

Кстати, как сказал Альтман, на Codex приходится уже 40% использования ChatGPT. В целом народ очень хвалит то, как модель программирует. Подробнее о последних новинках кодекса - по ссылке
Кстати, на днях попробовал Grok 4 от Илона нашего Маска. И знаете, хорошая модель. И раньше модель была неплохой, и сейчас очень даже на уровне Клода, ЧатГПТ и Джемини. Понравилось
Моя ML студия теперь выглядит так
👍5
Приехали еще 2 машинки - минимальные мак мини м4 с 16гб памяти. Последние два вечера настраивал их (ранее купил за 9 тыс. простейший монитор - без него никак). Теперь колдую над организацией машин в кластер. Новости есть и плохие, и хорошие. Начну с плохих.

Кластер я начинал создавать исходя из того, что базовые машины очень дешевые. Цена одной - 45 тыс., при увеличении памяти до 32 цена вырастает до 100 тыс. при всех тех же самых характеристиках. Мой эпик фейл заключается в том, что я очень сильно недооценил потребление памяти самой операционкой. В обычном режиме она жрет около 12гб (!) памяти. Убрав все, я сократил потребление примерно до 8, экстремальные варианты обрезания функционала дают около 5-6гб - это то, что использовать никак нельзя. Собственно, это причина, почему Apple поднял минималку с 8 до 16гб. Поэтому выигрыш от машины с большой памятью больше, чем может показаться.

Рассмотрел вариант установки Linux на мак - проблемы с памятью решаются (занимает 1-2 гб), но тут пропадает одна важная фишка. На маках есть библиотека MLX, которая сильно оптимизирует работу с нейронками и дает очень большой прирост и по скорости, и по использованию памяти. При использовании линукса все теряется. Сейчас идет разработка Asahi Linux под эти задачки, но как пишут нейронки, продукт еще сырой.

Ну а хорошая новость - купил кабели thunderbolt 5 (тоже недешевое удовольствие), объединил машины в кластер, они видят друг друга и скорость обмена данными по тандерболту максимальная - 37Гбит/сек, что для моих задачек очень важно, так как одна нейронка будет раскатываться на нескольких машинках.

Устанавливаю exo - пакет для распределенной работы с моделями и, пожалуй, еще поколдую с обрезанием потребителей памяти.
👍1
Новости от Qwen (теперь это моя любимая рубрика, так как у ребят очень много топ моделей небольшого размера, которые можно развернуть у себя).

Новейший Qwen 3 Next 80B раскатали на mlx для использования на маках. 4битная квантизация летает на машине с 64гб памяти. Посмотрим, найдется ли там что-то для меня - разве что с супер-квантизацией от Unslosh.

Вышел релиз Qwen3-Coder-480B-A35B-Instruct - агента типа Claude code, которые выступает на том же уровне (по бенчам) и превосходит все другие опенсорсные решения.

И сюда же добавлю новость от Unslosh - выпуск ноутбука Unsloth VLM RL (это программа, не железа) для очень эффективного обучения мультимодальных моделей, включая Qwen-2.5VL. За этими ребятами надо следить внимательно
👍1
Forwarded from Data Secrets
Агенты теперь смогут безопасно платить: Google выпустили Agent Payments Protocol (АP2)

Его можно будет использовать как расширение MCP или A2A. Протокол задуман как единый фреймворк, который позволит агентам и продавцам проводить любые виды транзакций.

На практике это будет работать благодаря цифровым мандатам:

– Когда вы говорите агенту «Найди мне новые белые кроссовки Nike» формируется Intent Mandate, то есть ваше предварительное намерение уже фиксируется документально.

– Когда агент предложит вам варианты, а вы тыкните «Хочу вот эти, покупай», сформируется Cart Mandate. Этот документ фиксирует: человек выбрал, одобрил, знает цену и ответственен за эту покупку.

– В случае отложенных задач (типа «Купи билеты, как только они появятся в продаже») Cart Mandate может формироваться автоматически без человека, но тогда вы должны четко зафиксировать диапазон одобренных вами цен, тайминг и прочие условия.

То есть, по сути, протокол фиксирует, что агент – исполнитель с доверенностью, а транзакция происходит на деле между вами и продавцом. Юридически это очень нужная штука.

В проекте уже участвуют более 60 партнеров, включая Mastercard, PayPal, Intuit и Salesforce.

Интересно, взлетит или нет

GitHub | Блогпост
Forwarded from Machinelearning
⚡️ Qwen-ASR Toolkit — мощный Python CLI для быстрой транскрипции длинных аудио и видео

Эта утилита снимает ограничение API Qwen-ASR (бывший Qwen3-ASR-Flash) в 3 минуты и позволяет расшифровывать часы контента. Достигается это за счёт умного разбиения записи и параллельной обработки.

Основные возможности:
- Снятие лимита в 3 минуты - транскрибируй файлы любой длины
- Умное разбиение (VAD - это технология, которая определяет, где в аудио есть речь, а где — пауза или шум.) - деление по естественным паузам, без
- Высокая скорость - многопоточность и параллельные запросы к API
- Автоматический ресемплинг — конвертация в нужный формат 16kHz mono
- Поддержка любых форматов — MP4, MOV, MKV, MP3, WAV, M4A и др.
- Простота - запуск одной командой через CLI

🟢 Установка:


pip install qwen3-asr-toolkit


🔗 GitHub: https://github.com/QwenLM/Qwen3-ASR-Toolkit

@ai_machinelearning_big_data


#asr #speech2text #qwen #opensource #nlp #toolki
Please open Telegram to view this post
VIEW IN TELEGRAM
У меня сегодня небольшой лайфхак. На работе использую старый iMac с 8гб памяти - тормозит безбожно, теперь понятно почему, просто системе надо ее больше. Отключил пожирателей памяти - из стандартных программ это спотлайт и «живые» обои. Вместо них поставил просто черный экран. И вот это вообще бомба - по-сути, режим фокусировки включен всегда. Очень понравилось, думаю, как я раньше до этого не догадался. Попробуйте
В ChatGPT платным пользователям теперь можно выбирать самостоятельно время, которое модель «думает». Отличное обновление
Очередная открытая китайская моделька Ling-flash-2.0 на 103В параметров. По рейтингам выступает не хуже got-oss-120B от OpenAI
И новая Magistral-1.2 от европейского лидера - Mistral. Запускается на 32гб, но можно попробовать и на 16… (квантизация от Unsloth)
Forwarded from Dealer.AI
Mem-agent еще одна концепция памяти 🧠

В своих постах про память, а также выступлении на datafest я обозревал самые популярные подходы к созданию памяти: long context, саммаризация, ner, function calling и rag. Однако мельком, буквально на слайдике одним пунктиком я упоминал про агентный подход для памяти. И обещал, что, как-нибудь, мы еще об этом поговорим.

После релиза manus и их восхитительного поста про то как они используют память на файлах и incontext learning, вышла еще одна интересная работа - MemAgent. И самое интересное, что у нее много общего и с решением Manus и с нашим подходом.

В центре всего стоит взаимодействие их small-LM на базе Qwen3-4b-thinking (т.е. рассуждающая моделька с CoT, SO, и т.п.). Кстати, модель обучена уже с GSPO против GRPO, но об этом в следующий раз. Вернёмся к малышке модельке, такой типоразмер, а главное способ обучения, и поддержка long-context позволяет нам не использовать RAG механики. Ввиду своей скорости, агент на такой модели может быстро серфить по их файловой системе памяти, основанной на двусторонней связи .md файлов по типу obsidian. Если мы вспомним мой рассказ про Manus, там тоже агенты пишут флоу/чекпоинты действий в "локальный" буфер в виде to-do файла. Это же, по словам авторов, позволяет не прибегать к сложному RAG подходу (векторным БД и т.п.), хотя использует поиск по ключевым словам. Да и я думаю, что rag механики только бы усилили этот сетап. Сейчас все-таки мода на гибридизацию памяти.

🗂️ Организация памяти

Mem-Agent использует иерархическую структуру хранения данных в формате Markdown:

memory/
├── user.md
└── entities/
└── [entity_name_1].md
└── [entity_name_2].md
└── …

· user.md: центральный файл с информацией о пользователе, содержащий ссылки на связанные сущности.
· entities/: каталог с дополнительными файлами, описывающими различные сущности (люди, организации, проекты).

Пример содержимого user.md:

# User Information
- user_name: Atakan Tekparmak
- birth_date: 2001-09-27
- birth_location: Istanbul, Turkey
## User Relationships
- employer: [[entities/dria.md]
]
Тут прям key/value подход как у нас.

🔗 Система связей

Mem-Agent реализует двунаправленные связи между файлами по аналогии с Obsidian, что позволяет агенту эффективно навигировать по данным и формировать контекстуально обогащенные ответы.

💻 MCP-сервер для интеграции.

Важно, стоит отметить, что данное решение только для работы с глобальной памятью. Поэтому это именно MemAgent, и для работы с ним даже есть свой MCP, чтобы можно было агрегировать в проекте любые доступные LLM-api и иметь локальную систему памяти на файлах.

В состав проекта входит MCP-сервер, который обеспечивает seamless-интеграцию с популярными платформами:

· Claude Desktop
· LM Studio
· ChatGPT

Это позволяет использовать Mem-Agent в качестве единого центра памяти для различных ИИ-помощников без необходимости переключения между платформами.

Итого на выходе получаем легкого агента для заполнения, и чтения/навигации по памяти. С возможностью работать с поиском, вызовом функций, MCP протоколом и интеграцией с популярными LLM api.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🎥 Ray3 — новая модель генерации видео от Luma AI

Это первая reasoning-модель для видео: она не только генерирует контент, но и «понимает» задачи, анализирует, исправляет себя и создаёт генерации студийного уровня.

Можно попробовать бесплатно в Dream Machine.

🔥 Что умеет Ray3:
- Черновой режим (Draft Mode) - позволяет быстро создавай креативы и генерирвать сцены, а потом выводить их в 4K HDR.
- Reasoning — модель хорошо понимает промпты и визуальные команды, строит логику движения и компоновки, умеет «думать» о том, что генерирует.
- Визуальные пометки - можно нарисовать стрелку или кружок на кадре, и Ray3 поймёт, куда двигать камеру или объект.
- Физика и реализм — симуляции движения, толпы, анатомия, свет, отражения, размытость в движении.
- HDR-видео — вывод в 10, 12 и 16-бит HDR с яркими цветами, деталями в тенях и бликах, экспорт в EXR для пост-продакшна.

🟠 Подробнее:
http://lumalabs.ai/ray3

@ai_machinelearning_big_data

#Ray3 #LumaAI #AIVideo #GenerativeAI #ReasoningAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM