very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Я уже писал, что установил себе супермодного нынче агента - OpenClaw. Живет у меня в отдельной квартире в отдельном контейнере комфортабельного мак мини.

Посадил его на подписку ChatGPT-5.4, одна из топ моделей на сегодня, вроде должен быть неглупым.

Оно прикольно, с одной стороны, подключился к телеграмму, общается с тобой, весь такой самостоятельный, типа - все сделаю сам.

Но есть одна проблема. Он врет. Ну просто постоянно воет. У меня в Claude code есть отдельный агент, который смотрит за тем, что делает OpenClaw, поэтому знаю из достоверных источников.

Типичный диалог:
- подключи Gemini через acpx;
- да, сейчас, все будет, минут 10;
- подключился?
- да, но соединение не стабильное, надо не через CLI, а сделать обертку. Сделаю, прогоню smoke-тесты?
- делай;

Ну и дальше в таком же духе - еще 15 минут, какая-то авторизация нужна, что-то на серваке не работает. Спрашиваю Клода - что он там делает?

А он ДАЖЕ НЕ НАЧИНАЛ.

Просто чатится со мной и кормит обещаниями. Очень по-человечески. И так из раза в раз. Просто жесть.

Теперь помимо модного слова Claw изучаю еще одно модное слово - Harness
😁6
Два слова о том, почему после всех этих фокусов я все-таки продолжаю с ним заморачиваться.

Во-первых, он воспринимается очень естественно. Пишет в телеграмм как помощник, оборудован памятью (еще предстоит посмотреть, как она работает), может и в вотсапе писать (это мало кто умеет) - т.е. хороший канал связи и много инструментов.

Во-вторых, это очень удобный оркестратор - ты закинул ему задачку, он сам разбил ее на подзадачи, ушел в луп разработки, загрузил другие модели - и выдал результат. Так в теории должно работать.

У него очень классные внутренние промпты. Подключаю к нему сейчас по acpx claude code, codex, gemini - должны работать по подпискам. Т.е. Claw должен задачку грузить агенту, например, в кодексе, и проверять результат разработки. Подписок у меня достаточно, а здесь - возможность их использовать на максимум.

Поэтому работаю над harness - пытаюсь дать инструменты и заставить делать то, что от него прошу. Если получится, буду просто в телеграмме давать команду и там же получать ответ, и цель кажется достижимой и очень привлекательной.

В общем, пытаюсь сделать из двоечника отличника. Как-то так
🔥1
Forwarded from Machinelearning
🌟 Nemotron-Terminal: небольшое семейство для терминальных задач.

NVIDIA обучила семейство моделей Nemotron-Terminal для автономной работы в терминале Linux: устанавливать зависимости, писать и запускать код, отлаживать окружения и выполнять сквозные инженерные задачи без участия человека.

Семейство построено на базе Qwen3 и специально собранном датасете Terminal-Corpus. И фишка не в архитектуре, а в данных.

🟡NVIDIA собрала пайплайн Terminal-Task-Gen с 2 потоками.

Первый адаптирует готовые датасеты по математике, коду и SWE-задачам под терминальный формат (без участия LLM в процессе адаптации).

Второй генерирует синтетику 2 методами: seed-based (LLM создает новые задачи на основе существующих задач из смежных областей) и skill-based (LLM комбинирует до пяти примитивных навыков из таксономии по 9 доменам: Security, Data Science, System Administration и другим).

🟡В открытый релиз вошли все три модели на 8B, 14B, 32B параметров и 2 датасета:

Terminal-Corpus: около 366K траекторий выполнения задач, разбитых на два потока: ~226K адаптированных примеров из Math/Code/SWE и ~140K синтетических задач на основе skill-таксономии.

Synthetic-Tasks: задачи в стандартизированном формате: инструкция, Docker-окружение из 9 преднастроенных образов и верификационный набор на pytest.


🟡Результаты прогонов на бенчах.

На Terminal-Bench 2.0 все 3 модели показали кратный рост относительно базовой Qwen3: 8B - с 2.5% до 13%, 14B - с 4% до 20.2%, 32B - с 3.4% до 27.4%.

Для сравнения: Qwen3-Coder на 480B параметров набирает 23.9%, GPT-5-Mini - 24.0%, Grok 4 - 23.1%. Nemotron-Terminal-32B превосходит или вплотную конкурирует с ними всеми при разнице в размере на порядок.


🟡Несколько внезапных выводов из абляции.

Фильтрация неудачных траекторий вредит. Модель, обученная на всех траекториях включая ошибочные, набирает 12.4% против 5.06% у варианта только с успешными.

Curriculum learning (сначала простые данные, потом сложные) не дал преимуществ перед простым смешанным обучением.

Увеличение контекстного окна с 32K до 65K токенов также не помогло, длинные траектории оказались шумнее.


📌Лицензирование моделей: NVIDIA Open Model License

📌Лицензирование датасетов : CC-BY-4.0 License.


🟡Набор моделей
🟡Arxiv


@ai_machinelearning_big_data

#AI #ML #LLM #NemotronTerminal #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Tips AI | IT & AI
Есть public-apis — старый репозиторий с огромной базой бесплатных API на любую тему.

Финансы, новости, погода, спорт, ML, развлечения.

Там у каждого API указан тип доступа:
• No auth: бесплатно, без регистрации
• apiKey: нужно получить ключ, есть с free тарифами и лимитами
• OAuth: нужна авторизация, часть платные

Можно скормить весь список AI-агенту и попросить найти что пригодится под твои задачи, найдёт то, что сам бы пропустил.

@tips_ai #tools
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
У CEO Obsidian есть еще проект Defuddle — который поможет вытаскивает чистый контент из любой веб-страницы и отдавать в Markdown.

Берёт страницу, убирает рекламу, навигацию, сайдбары, скрытые элементы, трекинг-пиксели, оставляет только контент.

Плюс вытаскивает метаданные в YAML формате: автор, дата публикации, описание, язык.

Можно получить то же самое прямо из CLI одной командой: curl defuddle.md/stephango.com

Использовать для скриптов и AI-агентов, которым нужен чистый текст без мусора — самое то.

Есть ещё markdown.new от Cloudflare, но он просто конвертирует весь HTML.

Использовать Defuddle можно как угодно:

• Веб — defuddle.md/URL
• CLI — npx defuddle parse URL
• Node.js — как библиотеку в своём проекте
• Obsidian Web Clipper
• Self-hosted

Изначально сделан для Obsidian Web Clipper: расширение, которое сохраняет веб-страницы в заметки Obsidian.

Сейчас он туда встроен (см. видео).

Вот ссылки на [сайт] и [GitHub]

@tips_ai #tools
❤1
Ну все! Теперь у меня Claude-code на телефоне. Если нужно, подключаюсь к этой сессии с компа. Ничто теперь не остановит вайбкодинг ))
🔥1
Кстати, после обновления у Claude появился 1 млн токенов контекста. Это круто, но все-равно, советую за контекстом следить, так как длинные сессии жрут много токенов (каждый новый вопрос к модели - это не добавление одной фразы, а загрузка всего контекста с нуля), а качество ответов модели - падает. Но это все-равно лучше чем autocompact
О, субагенты теперь и в Codex. Интересно, будут ли доступны суб-субагенты (в Claude code - нет). Вообще, время такое, что любое успешное решение моментально копируется.

А я как раз только-только, настраивая агентов, перенес их в папку с Клодом - теперь придется возвращаться к общей (у меня общие доки для моделей, будут и общие агенты)

PS - посмотрел, можно и вложенных агентов делать, то есть оркестрацию можно субагенту передать
А Claude code получил новую фишку - форк контекста. Раньше головной агент получал всю инфу из контекста субагента, а теперь, при включенной опции fork, будет получать только результат - ну, собственно, так и должны работать агентские системы.

Тут важно, правда, чтобы при новом запросе можно было вызвать того конкретного субагента с контекстом, а не такого же нового. Не уверен, что это так сейчас работает, но посмотрим.
Подоспел интересный фреймворк для создания голосовых агентов. Тема очень любопытная - может прикручу к моему кло колонку от Яндекса (но без Яндекса)

Ну и, кстати, кто не захочет тратить память на локальные модели - апи для генерации голоса по тексту от Элона Маска
Forwarded from Machinelearning
⚡️ OpenAI выпустили GPT-5.4 mini - новый быстрый и компактный вариант GPT-5.4.

Модель уже доступна в:
• ChatGPT
• Codex
• OpenAI API

🚀 в 2 раза быстрее GPT-5 mini

По словам OpenAI, это самая мощная mini-модель компании, которая почти догоняет полноценный GPT-5.4 по возможностям, но работает быстрее и дешевле.

Также представлена версия GPT-5.4 nano - самая маленькая и дешёвая модель для задач вроде:
- классификации
- извлечения данных
- ranking
- coding-агентов

https://openai.com/index/introducing-gpt-5-4-mini-and-nano/

@ai_machinelearning_big_data

#openai #ai #ml #chatgpt
Вместе с установкой МАХ на iphone решил посмотреть, кто у меня куда передает данные без спроса. Поставил себе на сервер, через который идет мой траффик, программку Pi-hole. И много мне явилось чудных открытий. Вот мы на МАХ ругаемся, а стоит у меня VK - и передает данные непонятно кому ничем не хуже.

Среди покупных VPN обнаружились настоящие шпионские программы. Какие-то стремные неизвестные приложения (еще надо найти их на телефоне).

Про рекламу молчу - особенно отличается Озон, Яндекс, Google, тащит данные Microsoft. Очень любят тянуть данные банки - ПСБ, Тинькофф и пр.

В общем, шпионских программ на телефонах - больше чем глистов у бомжа. Буду теперь заниматься детоксикацией на постоянной основе...
🔥2😱2🤔1👀1