very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Сегодня с утра - пара новых моделей tts - text to speech. Если у VOX-cpm 1.5 только два языка - английский и китайский, то у Google все норм, русский есть. Но не опен сорс..

А вообще прикольно, когда с нейронкой можно говорить, обязательно что-то такое замучу
Ну что, ChatGPT 5.2 вышел, рекордные метрики, любопытно
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:

во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);

во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;

Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.

Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
С учетом того, что теперь вайб-кодинг - наше все, надо озаботиться правильными промптами для агентов.

Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.

Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.

Так работает вайб-кодинг..
Интересная мини-моделька на 3В специально натренированная для распознавания pdf - в последнее время, интересная для меня тема
Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io

Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Forwarded from дядя_д
😎 Оказывается, OpenAI втихую добавили поддержку Skills в ChatGPT и Codex CLI

Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию /home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets.

Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме 😳

сурс – https://simonwillison.net/2025/Dec/12/openai-skills/

дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.

Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.

Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.

Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.

По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.

Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..

https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
Сегодня с утра имел первый удачный опыт изготовления презентации с использованию ИИ. Как обычно, мне было поручено помогать детям - рисовали презентацию о церкви Санта-Мария-ин-Космедин. Делал в Google Docs.

Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.

Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.

Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Успехи вчерашнего дня - откопал на просторах гитхаба и установил программку chezmoi. Прозносится как шемуа - по-французки "у меня". Предназначена для того, чтобы настройки в скрытых директориях синхронизировать между разными компьюетрами. Поскольку их у меня много, удобно иметь одни и те же настройки Клода, промпты, МСР-сервера и пр. одинаковые везде.

Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.

Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида

{
"GPT_PASS": { "id": "GPT", "field": "password" }
}

- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта

python main.py

сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда

secure-run python main.py

- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.

Ровно то, что хотел. Очень доволен и собой, и программой
🤯1
Microsoft запустила VibeVoice Realtime на Hugging Face - лёгкую стриминговую text-to-speech модель, которая начинает озвучивать текст примерно за 300 миллисекунд.

Идеально для живых данных и разговоров с LLM.

huggingface.co/microsoft/VibeVoice-Realtime-0.5B
👍1
Forwarded from Machinelearning
🖥 XiYan-SQL - инструмент для интерактивной работы с SQL

XiYan-SQL - это open-source решение, позволяющее генерировать, анализировать и выполнять SQL-запросы с использованием больших языковых моделей. Инструмент ориентирован на ускорение исследования данных и автоматизацию рутинных операций, связанных с запросами к базе.

Ключевые возможности:
- Генерация SQL из естественного языка -пользователь формулирует задачу обычными словами, а система преобразует её в корректный SQL-запрос.
- Интерактивная работа с базой данных - запросы можно оперативно уточнять, редактировать и выполнять, получая быстрый цикл обратной связи.
- Поддержка нескольких СУБД - PostgreSQL, MySQL, SQLite и другие.
- 🛠️ Минимальная конфигурация - подходит для анализа данных, прототипирования и облегчения доступа к базе без сложной инфраструктуры.


🔗 Репозиторий: github.com/XGenerationLab/XiYan-SQL

@ai_machinelearning_big_data


#sql #llm #ai #opensource #database #datatools #postgresql
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🖥 NVIDIA представила новое открытое семейство моделей Nemotron 3

✔️ Nemotron 3 Nano - это универсальная модель для рассуждений и чата, ориентированная на локальный запуск.

Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений

Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска

Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач

Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.

✔️ Nemotron 3 Super и Nemotron 3 Ultra значительно превосходят Nano по масштабу - примерно в 4 раза и 16 раз соответственно. Но ключевой момент здесь не просто в размере моделей, а в том, как NVIDIA удалось увеличить мощность без пропорционального роста стоимости инференса.

Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.

Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.

NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.

Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.

🟡Release: https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
🟡Guide: https://docs.unsloth.ai/models/nemotron-3
🟡GGUF: https://huggingface.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF
🟡lmstudio: https://lmstudio.ai/models/nemotron-3

@ai_machinelearning_big_data


#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM