very vibe coding
120 subscribers
463 photos
126 videos
13 files
994 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Ну что, ChatGPT 5.2 вышел, рекордные метрики, любопытно
Для любителей экзотики - маленькая модель text-to-3D. Можно ставить на свой комп
Почему я возлагаю большие надежды на релиз ChatGPT 5.2:

во-первых, и 5.1 был прекрасен в написании кода, причем на недорогих подписках в Claude code модель Opus недоступна, только Sonnet, а chatGPT дает доступ к последним моделям (почти);

во-вторых, теперь она знает то, что происходило до августа 2025 - это удобно, модели, которые обучались давно, местами тупят;

Контекст вырос до 400К - тоже удобно, и этого, в общем, достаточно.

Рекомендую Codex как первую опцию для программирования. Будет меньше заморочек, чем с Claude и Gemini.
С учетом того, что теперь вайб-кодинг - наше все, надо озаботиться правильными промптами для агентов.

Прежде чем, собственно, программировать, попросите модель сначала сделать readme.md (для людей), а потом agents.md (для агентов), для Клода - Claude.md. Чтобы этот файл получился качественным, попросите модель посмотреть этот репозиторий:
https://github.com/agentsmd/agents.md
Ну или его аналог.

Положите эти файлы в директорию проекта и запускайте Codex (рекомендую) или другого вашего агента для программирования.

Так работает вайб-кодинг..
Интересная мини-моделька на 3В специально натренированная для распознавания pdf - в последнее время, интересная для меня тема
Лайфхак. Если вы регулярно используете схемы в презентациях, то их гораздо проще и удобнее рисовать в draw.io

Это шикарная, очень простая и удобная программа. 100% рекомендую. А теперь к ней еще прикрутили и ИИ. Надо пробовать
Forwarded from дядя_д
😎 Оказывается, OpenAI втихую добавили поддержку Skills в ChatGPT и Codex CLI

Это спустя два месяца после запуска запуска этой фичи у Anthropic. Skills – это папки с markdown-файлами и скриптами, которые позволяют LLM получать специализированные знания для конкретных задач. ChatGPT теперь имеет встроенную директорию /home/oai/skills с готовыми skills для работы с PDF, DOCX и spreadsheets.

Когда внедряли MCP (тоже антропиковская разработка) воротили носом только так. А тут что-то быстро прошло. И в стелс-режиме 😳

сурс – https://simonwillison.net/2025/Dec/12/openai-skills/

дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
💡 Google Переводчик запускает перевод речи в реальном времени прямо в беспроводные наушники - и да, подходят любые модели.

Функция работает на базе нейросети Gemini и уже проходит тестирование на Android в США, Индии и Мексике. Поддерживается более 70 языков, включая русский.

Как это выглядит на практике:
собеседник говорит - ты сразу слышишь перевод в наушниках. Без пауз, без необходимости смотреть на экран, без лишних действий.

Ключевое отличие от конкурентов - универсальность. Google не привязывает функцию к конкретному «железу» и не требует фирменных наушников. Это резко контрастирует с подходом Apple, где подобные возможности ограничены экосистемой AirPods.

По сути, Google делает перевод частью повседневного общения, а не отдельным режимом в приложении.

Глобальный релиз и версия для iOS ожидаются в 2026 году.
Большая книжка из Стенфорда - такую я бы начал читать с NotebookLM..

https://web.stanford.edu/~jurafsky/slp3/ed3book_aug25.pdf
Сегодня с утра имел первый удачный опыт изготовления презентации с использованию ИИ. Как обычно, мне было поручено помогать детям - рисовали презентацию о церкви Санта-Мария-ин-Космедин. Делал в Google Docs.

Очень впечатляющий опыт - получилось быстро, вполне симпатично, в общем реально можно пользоваться. Нано-банана постаралась.

Правда есть один нюанс - вместо использования фотографий она рисовала картинки "по мотивам". Не видел церкви - не подкопаешься, все очень реалистично, только вот те, кто в курсе увидят, что у колокольни 5 этажей вместо 7, мозаика не такая, план немного другой, ну и т.д. Впечатление такое, что это рисунок "по памяти" - как запомнила.

Так что пользуйтесь, но проверяйте. Галлюцинаций выше крыши. Но симпатично получилось, и, главное - очень быстро, чисто на основе текста
Успехи вчерашнего дня - откопал на просторах гитхаба и установил программку chezmoi. Прозносится как шемуа - по-французки "у меня". Предназначена для того, чтобы настройки в скрытых директориях синхронизировать между разными компьюетрами. Поскольку их у меня много, удобно иметь одни и те же настройки Клода, промпты, МСР-сервера и пр. одинаковые везде.

Синхронизация происходит по принципу звезды - база в зашифрованном виде хранится в GitHub, обновления на компе пушим туда, и наоборот, при обновлении на компе подтягиваем последнюю версию из GitHub.

Бонус - настроена синхронизация с bitwarden, которым я активно пользуюсь. Благодаря этому я, можно сказать, финализировал свою организацию секретов. Теперь это работает так:
- в директории проекта лежит файл json вида

{
"GPT_PASS": { "id": "GPT", "field": "password" }
}

- для такого файла есть скрипт, который вытаскивает пароль из bitwarden - он в скрытой директории, синхронизирован через chezmoi;
- далее сделан скрипт-обертка, которой вместо запуска основного питоновского файла проекта

python main.py

сначала идет в bitwarden, получает пароли, а потом запускает питоновский файл. Выглядит это как команда

secure-run python main.py

- как итог, пароли появляются только для питона, "на лету", нейронка их не видит ни в один момент. И нигде эти пароли в явном виде не прописаны.

Ровно то, что хотел. Очень доволен и собой, и программой
🤯1
Microsoft запустила VibeVoice Realtime на Hugging Face - лёгкую стриминговую text-to-speech модель, которая начинает озвучивать текст примерно за 300 миллисекунд.

Идеально для живых данных и разговоров с LLM.

huggingface.co/microsoft/VibeVoice-Realtime-0.5B
👍1
Forwarded from Machinelearning
🖥 XiYan-SQL - инструмент для интерактивной работы с SQL

XiYan-SQL - это open-source решение, позволяющее генерировать, анализировать и выполнять SQL-запросы с использованием больших языковых моделей. Инструмент ориентирован на ускорение исследования данных и автоматизацию рутинных операций, связанных с запросами к базе.

Ключевые возможности:
- Генерация SQL из естественного языка -пользователь формулирует задачу обычными словами, а система преобразует её в корректный SQL-запрос.
- Интерактивная работа с базой данных - запросы можно оперативно уточнять, редактировать и выполнять, получая быстрый цикл обратной связи.
- Поддержка нескольких СУБД - PostgreSQL, MySQL, SQLite и другие.
- 🛠️ Минимальная конфигурация - подходит для анализа данных, прототипирования и облегчения доступа к базе без сложной инфраструктуры.


🔗 Репозиторий: github.com/XGenerationLab/XiYan-SQL

@ai_machinelearning_big_data


#sql #llm #ai #opensource #database #datatools #postgresql
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
🖥 NVIDIA представила новое открытое семейство моделей Nemotron 3

✔️ Nemotron 3 Nano - это универсальная модель для рассуждений и чата, ориентированная на локальный запуск.

Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений

Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска

Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач

Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.

✔️ Nemotron 3 Super и Nemotron 3 Ultra значительно превосходят Nano по масштабу - примерно в 4 раза и 16 раз соответственно. Но ключевой момент здесь не просто в размере моделей, а в том, как NVIDIA удалось увеличить мощность без пропорционального роста стоимости инференса.

Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.

Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.

NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.

Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.

🟡Release: https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
🟡Guide: https://docs.unsloth.ai/models/nemotron-3
🟡GGUF: https://huggingface.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF
🟡lmstudio: https://lmstudio.ai/models/nemotron-3

@ai_machinelearning_big_data


#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Сегодня, кстати, ждем новый опенсорсный релиз (привет, Gemma 4!) от Google

Должны завезти уже совсем скоро