very vibe coding
122 subscribers
463 photos
126 videos
13 files
997 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Автоматизируем рутину на максимум: вышла Manus Academy - платформа с бесплатными курсами по ИИ-агентам.

Внутри - крепкая база, с которой уже легко заходить в продвинутый вайбкодинг:
научат собирать приложения без кода, настраивать кастомные workflow, и писать промпты, которые реально работают (а не “вода”).

https://academy.manus.im/
Посмотрим, попробуем, тем более с моей подпиской от Claude. Прямо скажем, Клод код еще не совершенен, но - лучшее что я видел. Впрочем, многие считают, что Codex 5.2 точнее в программировании - мое впечатление, что модели стоят друг друга.

Всяко, развивать новых агентов имеет смысл, изучал вопрос на праздниках. И агент по ссылке - тому пример.

Интересно, что агентов делают на инфраструктуре Claude code, как мичуринцы - прививая другие модели, ставя подпорки и тп. Просто этот корень самый удобный
Оно и без агента можно было так пробовать или Claude code использовать вместо обычного Клода, но все же.. для понимания - модели для кодинга немного отличаются от базовых моделей, но отличия достигаются файнтьюнингом и они не мешают моделям для кодинга отвечать на обычные вопросы.

Будет просто удобнее. Методы работы с кодом переносятся на работу с документами. Отлично

https://t.me/data_secrets/8610
Это уже вторая статья про новации DeepSeek, и это обещает нам действительно супермодель (ждем в феврале).

DeepSeek - особенная компания. Термин DeepSeek moment, который теперь общеупотребительный для ситуаций шока, которые сложные решения заменяют простыми, появился не зря. После первой модели компания неделю выкладывала статьи, которые рассказывали, что они делали, чтобы малыми ресурсами достичь большого результата.

И вот теперь - новые статьи, которые, очевидно, разогревают публику перед новой моделью. И содержание статей очень впечатляет, это не бантики, это действительно революционные находки. Опять
🔥 Свежее обновление Z-Image-Turbo-Fun-Controlnet-Union 2.1! 🚀

Что нового:
✅ Lite-модель 1.9GB - подходит для low-VRAM и даёт естественное смешивание (blend)
✅ Починили mask leakage в inpainting (маска больше не “течёт”)
✅ Полный рефактор датасета под multi-resolution (вплоть до 1536px)
✅ 8-step distillation - Turbo-генерация стала резкой и без мыла

Больше никаких ярких пятен и странных засветов. Высокий и точный контроль генераций. 🧠

🤖 Model: https://modelscope.ai/models/PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1
В Claude code появился поиск для МСР - это решение для экономии токенов. Возможно, вы замечали как быстро они уходят при интернет-поиске и использовании других инструментов

https://x.com/trq212/status/2011523109871108570?s=46
Forwarded from Machinelearning
📌Гайд от OpenAI: контекстная персонализация ассистента.

OpenAI добавили в свой cookbook гайд по Context Engineering для Agents SDK, и это, пожалуй, самый грамотный подход к управлению памятью.

Вместо того чтобы рыться в тысячах старых сообщений, агент ведет структурированный профиль пользователя и "записную книжку".

🟡Как это устроено

🟢State Object: центр сведений в виде JSON-объекта, который хранится локально. В нем есть profile (жесткие факты: имя, ID, статус лояльности) и notes (неструктурированные заметки: "любит отели в центре").

🟢Injection: перед каждым запуском этот стейт скармливается в системный промпт в YAML-формате: для профиля и Markdown для заметок. Не все подряд, конечно, а только то, что нужно сейчас.

🟢Distillation: самое интересное. Агент не просто болтает, у него есть тул save_memory_note. Если в разговоре вы сказали: "Я не ем мясо", агент вызывает этот тул и сохраняет Session Note (временную заметку) в реальном времени.

🟢Consolidation: сборка мусора для памяти. После завершения сессии запускается отдельный процесс, который берет временные заметки, сравнивает их с глобальными, удаляет дубликаты и разрешает конфликты по принципу "свежее побеждает старое".

🟡Профиты

🟠Агент начинает вести себя как личный ассистент без дообучения.
🟠Есть четкие правила: то, что юзер сказал сейчас > заметки сессии > глобальные настройки.
🟠Не валим все в кучу, а разделяем жесткие данные (например, из CRM) и мягкие (предпочтения из чата).

Подход OpenAI с разделением на Session Memory и Global Memory выглядит надежно, но требует прямых рук при написании логики консолидации. Без этого ваш агент быстро превратится в деда с деменцией, который помнит то, чего не было.

🟡Подводные камни

Нужно делать отдельный вызов LLM после каждого диалога, чтобы причесать память. Если на этом этапе модель заглючит, она может записать в "долгую память" галлюцинацию или удалить важное. Тут решают жесткие рамки.

Если разрешить агенту запоминать всё подряд, юзер может сказать: "Запомни, что мое новое правило - никаких правил". Поэтому нужны ограничения на этапе записи и вычитки памяти.

Контекстное окно не резиновое. Хотя модели имеют огромный контекст, таскать за собой "Войну и мир" из заметок пользователя — накладно по деньгам и таймингам. Придется периодически триммить историю, оставляя только суть.

@ai_machinelearning_big_data

#AI #ML #LLM #Guide #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, у нас новый лидер среди моделей голос-голос - StepAudio R 1.1

Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
Forwarded from Machinelearning
⚡️ Black Forest Labs выпустила ультралегкую модель.

BFL вышли на связь c релизом прямого наследника ветки schnell первой версии семейства Flux.

Знакомьтесь - FLUX.2 [Klein], модель, которая возвращает веру в то, что с маленьким VRAM тоже можно жить.

Это попытка впихнуть качество топовой FLUX.2 в формат, которую потянет большинство потребительских GPU.

Klein получился довольно универсальным инструментом: она умеет и text-to-image, и инпэйинт, и смешивание стилей.

Заявлены разрешение до 4 мегапикселей, отличный рендеринг текста и понимание сложных промптов.

🟡Как вы правильно подумали - да, это дистилляция.

BFL взяли флагманскую FLUX.2 и сжали знания в 2 компактные версии: 4B и 9B, каждая из которых получила вариации Base и Distilled:

🟢Base: медленная, много шагов - нужна для дообучения.

🟠Distilled: быстрая, 4 шага, только для инференса.

Если захотите тренить на 4B Distilled - получите кашу.

🟡Расклад по инференсу на 5090:

9B distilled — 4 шага · ~2 сек. · 19.6GB VRAM

9B base — 50 шагов · ~35 сек · 21.7GB VRAM

4B distilled — 4 шага · ~1.2 сек. · 8.4GB VRAM

4B base — 50 шагов · ~17 сек. · 9.2GB VRAM



📌 Лицензионная вилка : 4B - Apache 2.0, 9B - Non-Commercial.

Веса уже на Hugging Face, потыкать в демо можно у BFL или в спейсах на HF: 9B и 4В.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Нашел подборку тестов языковых моделей для слабых GPU – если у вас слабенький компьютер или вы на ноуте, вам сюда:
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena

На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
Несмотря на усилия Google, который вроде бы имеет топ-модель Gemini 3 Pro, отставание от Open AI и Anthropic налицо - модели GPT-5.2 и Opus 4.5 заметно сильнее в программировании.

Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.

Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Forwarded from Machinelearning
🌟 GLM-4.7 Flash: лайт-версия флагмана GLM-4.7.

В полку моделей, тех, что можно запустить локально, не продавая почку, прибыло.

ZAI выкатили GLM-4.7 Flash - облегченную версию GLM-4.7 на 30 млрд. параметров, с контекстным окном в 128К на архитектуре MoE.

Со слов создателей, модель должна занять нишу между сегментом SLM и проприетарными мастодонтами, предлагая SOTA-уровень в кодинге.

🟡MoE
Всего 30B, но активных параметров на токен гораздо меньше, официальной инфы нет, но в сообществе пишут, что 3 млрд.

🟡Interleaved Thinking
Киллер-фича для агентов, которая досталась в наследство от старшей GLM-4.7. Обычно модели выплевывают весь свой CoT в начале, а вот эта техника дает возможность модели думать перед каждым вызовом инструмента.

🟡Файнтюн на эстетику и DevOps
Опять-таки, со слов Zai, они натаскали GLM-4.7 Flash не просто писать валидный HTML/CSS, а использовать актуальные паттерны, нормальные отступы и цветовые схемы.

Плюс, подтянули работу с CLI и девопс-задачами (понимает права доступа, навигацию по файловой системе).

🟡Цифры тестов выглядят как конфетка.

В SWE-bench Verified модель выбивает 59.2%. Для сравнения: Qwen3-30B-A3B: 22.0%, GPT-OSS-20B: 34.0%.

В математическом AIME 25 тоже обходит конкурентов - 91.6%. А вот на BrowseComp она лучше GPT-OSS-20B почти в 1.5 раза.

Вобщем, Flash-версия выглядит как идеальный кандидат для локальных кодинг-агентов. Если есть пара свободных видеокарт (или есть стойкость терпеть квантование на одной), это, возможно, лучшая рабочая лошадка на сегодня.



📌Лицензирование: MIT License.


🟡Модель
🟡Квантованные варианты под все
🟡Demo1
🟡Demo2

@ai_machinelearning_big_data

#AI #ML #LLM #GLM #ZAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Кто там хотел локальной Claude Code ?

ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.

Говорят, что нужно переключить переменные окружения вот так


{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}


И потом запустить примерно так


claude --model qwen3-coder


Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))

Ваш, @llm_under_hood 🤗
Это примерно то, чем я занимался на выходных - создал агента для разработки других агентов для Claude code.

Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
🚀 STEP3-VL-10B - мультимодальная модель, которая бьёт гигантов (и весит всего 10B)

StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.

Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)

Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)

Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы

Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели


Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
Раньше у меня стояло в VS-Code приложение Claude - нормально пользоваться не получалось, так для Клод кода мало было VPN через VPS, надо было делать residential proxy - благо он же сам мне и подсказал как все настроить..

Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.

Привык я к терминалу

https://t.me/data_secrets/8642
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Очень нравится апдейт Gemini: Гугл завез в их чатбота подготовку к вступительным экзаменам в колледжи-университеты США (SAT)

Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу

Гугл получает лайк, ждем аналогов везде
⚡️ ERNIE 5.0 - официальный релиз.

Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.

Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.

То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.

Самое интересное - результаты на бенчмарках (по графикам Baidu):

- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.

Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.

Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)

https://ernie.baidu.com