very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Успехи вчерашнего дня - откопал на просторах гитхаба и установил программку chezmoi. Прозносится как шемуа - по-французки "у меня". Предназначена для того, чтобы настройки в скрытых директориях синхронизировать между разными компьюетрами. Поскольку их у меня много, удобно иметь одни и те же настройки Клода, промпты, МСР-сервера и пр. одинаковые везде.

Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.

Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида

{
"GPT_PASS": { "id": "GPT", "field": "password" }
}

- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта

python main.py

сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда

secure-run python main.py

- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.

Ровно то, что хотел. Очень доволен и собой, и программой
🤯1
Microsoft запустила VibeVoice Realtime на Hugging Face - лёгкую стриминговую text-to-speech модель, которая начинает озвучивать текст примерно за 300 миллисекунд.

Идеально для живых данных и разговоров с LLM.

huggingface.co/microsoft/VibeVoice-Realtime-0.5B
👍1
Forwarded from Machinelearning
🖥 XiYan-SQL - инструмент для интерактивной работы с SQL

XiYan-SQL - это open-source решение, позволяющее генерировать, анализировать и выполнять SQL-запросы с использованием больших языковых моделей. Инструмент ориентирован на ускорение исследования данных и автоматизацию рутинных операций, связанных с запросами к базе.

Ключевые возможности:
- Генерация SQL из естественного языка -пользователь формулирует задачу обычными словами, а система преобразует её в корректный SQL-запрос.
- Интерактивная работа с базой данных - запросы можно оперативно уточнять, редактировать и выполнять, получая быстрый цикл обратной связи.
- Поддержка нескольких СУБД - PostgreSQL, MySQL, SQLite и другие.
- 🛠️ Минимальная конфигурация - подходит для анализа данных, прототипирования и облегчения доступа к базе без сложной инфраструктуры.


🔗 Репозиторий: github.com/XGenerationLab/XiYan-SQL

@ai_machinelearning_big_data


#sql #llm #ai #opensource #database #datatools #postgresql
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🖥 NVIDIA представила новое открытое семейство моделей Nemotron 3

✔️ Nemotron 3 Nano - это универсальная модель для рассуждений и чата, ориентированная на локальный запуск.

Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений

Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска

Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач

Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.

✔️ Nemotron 3 Super и Nemotron 3 Ultra значительно превосходят Nano по масштабу - примерно в 4 раза и 16 раз соответственно. Но ключевой момент здесь не просто в размере моделей, а в том, как NVIDIA удалось увеличить мощность без пропорционального роста стоимости инференса.

Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.

Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.

NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.

Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.

🟡Release: https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
🟡Guide: https://docs.unsloth.ai/models/nemotron-3
🟡GGUF: https://huggingface.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF
🟡lmstudio: https://lmstudio.ai/models/nemotron-3

@ai_machinelearning_big_data


#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Сегодня, кстати, ждем новый опенсорсный релиз (привет, Gemma 4!) от Google

Должны завезти уже совсем скоро
С этим постом для меня началась новая эпоха. Обратите внимание на второй пункт - стартап Миры Муратти (один из бывших боссов OpenAI) Thinking machines запустила полноценную эксплуатацию Tinker - продукта, который позволяет обучать нейронки ламерам.

Идея такая - есть классические способы обучения типа Lora. Классические опенсорс модели - Qwen, Llama, gpt-oss и пр. Рябята уже реализовали все нужные алгоритмы для обучения, от вас нужны просто данные и выбрать модель. Цены на обучение привлекательные.

Например, если я хочу научить небольшую модель оформлять протоколы в моем стиле, нужно несколько десятков протоколов, до сотни, это 1-2 миллиона токенов обучения - и у Тинкера это обойдется в 0,5-1 доллара для небольших моделей. Вообще халява.

Бонус еще с том, что обученный слой можно будет перенести и на квантованные модели.

Да, еще один бонус - обученные модели можно запускать не у себя, а у облачных провайдеров вычислений, например, Replicate. Это, кстати, позволяет погонять дообученную модель на разном квантовании и посмотреть, что лучше подходит.

В общем, не зря Мире отвалили несколько миллиардов на разработку, когда продукт был только на бумаге.
🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Большинство быстрых text-to-speech моделей звучат роботизировано.

Большинство качественных - слишком медленные.
И почти ни одна не решает вопрос аутентичности аудио на уровне архитектуры.

Resemble AI закрыли все три проблемы сразу.

Chatterbox Turbo 0 это:

🟢 <150 мс до первого звука
🟢 Качество уровня SOTA - превосходит более крупные проприетарные модели
🟢 Естественные, программируемые эмоции и интонации
🟢 Zero-shot клонирование голоса всего по 5 секундам аудио
🟢 PerTh watermarking - проверяемое и аутентифицированное аудио
🟢 Полностью open source, никакой «чёрной магии»

Редкий пример, когда скорость, качество и безопасность не идут на компромисс, а работают вместе.

HuggingFace: https://huggingface.co/spaces/ResembleAI/chatterbox-turbo-demo
Please open Telegram to view this post
VIEW IN TELEGRAM
🧠 Xiaomi представила MiMo-V2-Flash - новую open-source MoE-модель с фокусом на максимальную скорость без потери качества.

Моделька на 309B параметров, из которых одновременно активны лишь 15B - за счёт умной MoE-маршрутизации модель достигает высокой эффективности. Сравнима с DeepSeek-V3.2 на общих бенчмарках.

MiMo-V2-Flash заточена под агентов и работу с инструментами.

🔥 Ключевые особенности

🏗️ Hybrid Attention
5:1 чередование 128-window SWA и Global Attention
Контекст — 256K токенов

🏆 Код и разработка
• SWE-Bench Verified - 73.4%
• SWE-Bench Multilingual - 71.7%
Новый SOTA среди open-source моделей

🚀 Скорость
• До 150 output tokens/sec
• Day-0 поддержка от @lmsysorg

MiMo-V2-Flash - пример того, как MoE-архитектуры выходят на новый уровень: быстрее, дешевле и готовые к агентным сценариям.

🤗 Model: http://hf.co/XiaomiMiMo/MiMo-V2-Flash
📝 Blog: http://mimo.xiaomi.com/blog/mimo-v2-flash
📄 Technical Report: http://github.com/XiaomiMiMo/MiMo-V2-Flash/blob/main/paper.pdf
🎨 AI Studio
: http://aistudio.xiaomimimo.com

#AI #LLM #MoE #OpenSource #AgenticAI #MachineLearning #DeepLearning #GenAI #SWEBench #Xiaomi #AIModels
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Новый день – новые модели: Nvidia выпустили прекрасную Nemotron 3 Nano

В ней 31.6B параметров, но активных всего 3.6B (это MoE). Запустить можно на 24ГБ RAM. Зафайнтюнить – на 60ГБ VRAM.

Контекст – 1 миллион токенов.

По метрикам, внимание, обходит Qwen3-30В-А3В-Thinking и GPT-oss-20B-А4В. Получается, модель не просто конкурентоспособная, но и лучшая в своем классе на многих основных бенчмарках: SWE-bench, GPQA и др.

И еще – моделька очень шустрая, выдает больше 350 токенов в секунду. Это в 2-3 раза быстрее того же Qwen.

Nvidia умеют удивлять.

Веса (+датасеты!) | Статья | Блогпост

P.S. Любителям опенсорса напоминаем, что сегодня также ждем новенькую Gemma-3
Media is too big
VIEW IN TELEGRAM
🔉 Meta SAM Audio: Segment Anything Model Audio

SAM Audio — это “Segment Anything”, но для звука: foundation-модель, которая выделяет любой целевой звук (separation) из микса по промпту (текстом) или по отдельным объектам из видео!

Что может модель:

— Аудио сепарация: целевой объект (человек, машина, инструмент) + все остальное (бэкграунд, шум, пространство, реверберация и эхо)

— Visual prompting: можно привязать звук к объекту на кадре (маской/объектом в видео) и отделять “звук этого объекта” от остальных.

— Span prompting: задаёшь временные якоря, где звук есть/нет и модель сама определяет “что именно считать целевым”.

💻 github + модель SAM Audio
👄
Есть демо: можно потыкать по этой ссылке
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Google Code Wiki.

Google запустила в публичное превью платформу Code Wiki. Инструмент сканирует репозиторий и генерирует живую базу знаний, которая перестраивается автоматически после каждого изменения в коде.

Под капотом - естественно Gemini. Разработчики могут общаться с контекстно-зависимым чат-ботом, который понимает структуру конкретного проекта «от и до».

Code Wiki умеет строить диаграммы архитектуры, объяснять логику работы модулей и мгновенно перенаправлять из вики к конкретным определениям функций.

Сейчас веб-версия работает с публичными репозиториями, но в планах - CLI-расширение для развертывания системы в закрытых корпоративных контурах.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Какое-то бесконечное количество новостей и новых моделей. Вот, например, еще для любителей 3D разразились моделями Microsoft и Apple. Тоже что-то пилят..
Forwarded from Machinelearning
🔍 Mistral представила OCR 3 - новую версию своей AI-системы распознавания документов.

Ключевое:
- Существенный рост качества по сравнению с OCR 2, особенно на формах, таблицах и сложных PDF
- Уверенно работает со сканами, рукописным текстом и нестандартной версткой
- Возвращает структурированный результат, а не просто сырой текст
- Подходит для автоматизации Document AI и downstream-аналитики
- Доступен через API и готов к продакшен-использованию

Главное
- На 74% лучше Mistral OCR 2 при работе с формами, сканированными документами, сложными таблицами и рукописным текстом.

- Точность уровня state-of-the-art: Обходит как корпоративные системы обработки документов, так и современные AI-OCR решения.

- Используется в Document AI Playground:
В Mistral AI Studio появился простой drag-and-drop интерфейс для разбора PDF и изображений в чистый текст или структурированный JSON.


https://mistral.ai/news/mistral-ocr-3

@ai_machinelearning_big_data

#ocr #mistal #llm