very vibe coding
122 subscribers
463 photos
126 videos
13 files
997 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
📌Гайд от OpenAI: контекстная персонализация ассистента.

OpenAI добавили в свой cookbook гайд по Context Engineering для Agents SDK, и это, пожалуй, самый грамотный подход к управлению памятью.

Вместо того чтобы рыться в тысячах старых сообщений, агент ведет структурированный профиль пользователя и "записную книжку".

🟡Как это устроено

🟢State Object: центр сведений в виде JSON-объекта, который хранится локально. В нем есть profile (жесткие факты: имя, ID, статус лояльности) и notes (неструктурированные заметки: "любит отели в центре").

🟢Injection: перед каждым запуском этот стейт скармливается в системный промпт в YAML-формате: для профиля и Markdown для заметок. Не все подряд, конечно, а только то, что нужно сейчас.

🟢Distillation: самое интересное. Агент не просто болтает, у него есть тул save_memory_note. Если в разговоре вы сказали: "Я не ем мясо", агент вызывает этот тул и сохраняет Session Note (временную заметку) в реальном времени.

🟢Consolidation: сборка мусора для памяти. После завершения сессии запускается отдельный процесс, который берет временные заметки, сравнивает их с глобальными, удаляет дубликаты и разрешает конфликты по принципу "свежее побеждает старое".

🟡Профиты

🟠Агент начинает вести себя как личный ассистент без дообучения.
🟠Есть четкие правила: то, что юзер сказал сейчас > заметки сессии > глобальные настройки.
🟠Не валим все в кучу, а разделяем жесткие данные (например, из CRM) и мягкие (предпочтения из чата).

Подход OpenAI с разделением на Session Memory и Global Memory выглядит надежно, но требует прямых рук при написании логики консолидации. Без этого ваш агент быстро превратится в деда с деменцией, который помнит то, чего не было.

🟡Подводные камни

Нужно делать отдельный вызов LLM после каждого диалога, чтобы причесать память. Если на этом этапе модель заглючит, она может записать в "долгую память" галлюцинацию или удалить важное. Тут решают жесткие рамки.

Если разрешить агенту запоминать всё подряд, юзер может сказать: "Запомни, что мое новое правило - никаких правил". Поэтому нужны ограничения на этапе записи и вычитки памяти.

Контекстное окно не резиновое. Хотя модели имеют огромный контекст, таскать за собой "Войну и мир" из заметок пользователя — накладно по деньгам и таймингам. Придется периодически триммить историю, оставляя только суть.

@ai_machinelearning_big_data

#AI #ML #LLM #Guide #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, у нас новый лидер среди моделей голос-голос - StepAudio R 1.1

Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
Forwarded from Machinelearning
⚡️ Black Forest Labs выпустила ультралегкую модель.

BFL вышли на связь c релизом прямого наследника ветки schnell первой версии семейства Flux.

Знакомьтесь - FLUX.2 [Klein], модель, которая возвращает веру в то, что с маленьким VRAM тоже можно жить.

Это попытка впихнуть качество топовой FLUX.2 в формат, которую потянет большинство потребительских GPU.

Klein получился довольно универсальным инструментом: она умеет и text-to-image, и инпэйинт, и смешивание стилей.

Заявлены разрешение до 4 мегапикселей, отличный рендеринг текста и понимание сложных промптов.

🟡Как вы правильно подумали - да, это дистилляция.

BFL взяли флагманскую FLUX.2 и сжали знания в 2 компактные версии: 4B и 9B, каждая из которых получила вариации Base и Distilled:

🟢Base: медленная, много шагов - нужна для дообучения.

🟠Distilled: быстрая, 4 шага, только для инференса.

Если захотите тренить на 4B Distilled - получите кашу.

🟡Расклад по инференсу на 5090:

9B distilled — 4 шага · ~2 сек. · 19.6GB VRAM

9B base — 50 шагов · ~35 сек · 21.7GB VRAM

4B distilled — 4 шага · ~1.2 сек. · 8.4GB VRAM

4B base — 50 шагов · ~17 сек. · 9.2GB VRAM



📌 Лицензионная вилка : 4B - Apache 2.0, 9B - Non-Commercial.

Веса уже на Hugging Face, потыкать в демо можно у BFL или в спейсах на HF: 9B и 4В.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Нашел подборку тестов языковых моделей для слабых GPU – если у вас слабенький компьютер или вы на ноуте, вам сюда:
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena

На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
Несмотря на усилия Google, который вроде бы имеет топ-модель Gemini 3 Pro, отставание от Open AI и Anthropic налицо - модели GPT-5.2 и Opus 4.5 заметно сильнее в программировании.

Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.

Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Forwarded from Machinelearning
🌟 GLM-4.7 Flash: лайт-версия флагмана GLM-4.7.

В полку моделей, тех, что можно запустить локально, не продавая почку, прибыло.

ZAI выкатили GLM-4.7 Flash - облегченную версию GLM-4.7 на 30 млрд. параметров, с контекстным окном в 128К на архитектуре MoE.

Со слов создателей, модель должна занять нишу между сегментом SLM и проприетарными мастодонтами, предлагая SOTA-уровень в кодинге.

🟡MoE
Всего 30B, но активных параметров на токен гораздо меньше, официальной инфы нет, но в сообществе пишут, что 3 млрд.

🟡Interleaved Thinking
Киллер-фича для агентов, которая досталась в наследство от старшей GLM-4.7. Обычно модели выплевывают весь свой CoT в начале, а вот эта техника дает возможность модели думать перед каждым вызовом инструмента.

🟡Файнтюн на эстетику и DevOps
Опять-таки, со слов Zai, они натаскали GLM-4.7 Flash не просто писать валидный HTML/CSS, а использовать актуальные паттерны, нормальные отступы и цветовые схемы.

Плюс, подтянули работу с CLI и девопс-задачами (понимает права доступа, навигацию по файловой системе).

🟡Цифры тестов выглядят как конфетка.

В SWE-bench Verified модель выбивает 59.2%. Для сравнения: Qwen3-30B-A3B: 22.0%, GPT-OSS-20B: 34.0%.

В математическом AIME 25 тоже обходит конкурентов - 91.6%. А вот на BrowseComp она лучше GPT-OSS-20B почти в 1.5 раза.

Вобщем, Flash-версия выглядит как идеальный кандидат для локальных кодинг-агентов. Если есть пара свободных видеокарт (или есть стойкость терпеть квантование на одной), это, возможно, лучшая рабочая лошадка на сегодня.



📌Лицензирование: MIT License.


🟡Модель
🟡Квантованные варианты под все
🟡Demo1
🟡Demo2

@ai_machinelearning_big_data

#AI #ML #LLM #GLM #ZAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Кто там хотел локальной Claude Code ?

ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.

Говорят, что нужно переключить переменные окружения вот так


{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}


И потом запустить примерно так


claude --model qwen3-coder


Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))

Ваш, @llm_under_hood 🤗
Это примерно то, чем я занимался на выходных - создал агента для разработки других агентов для Claude code.

Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
🚀 STEP3-VL-10B - мультимодальная модель, которая бьёт гигантов (и весит всего 10B)

StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.

Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)

Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)

Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы

Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели


Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
Раньше у меня стояло в VS-Code приложение Claude - нормально пользоваться не получалось, так для Клод кода мало было VPN через VPS, надо было делать residential proxy - благо он же сам мне и подсказал как все настроить..

Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.

Привык я к терминалу

https://t.me/data_secrets/8642
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Очень нравится апдейт Gemini: Гугл завез в их чатбота подготовку к вступительным экзаменам в колледжи-университеты США (SAT)

Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу

Гугл получает лайк, ждем аналогов везде
⚡️ ERNIE 5.0 - официальный релиз.

Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.

Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.

То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.

Самое интересное - результаты на бенчмарках (по графикам Baidu):

- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.

Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.

Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)

https://ernie.baidu.com
У меня тут вчера случился шок контент. Некоторое время назад Антропики выпустили к Claude надстройку для браузера Chrome. Ну, вроде ничего нового, у ChatGPT есть отдельный браузер Atlas, у Perplexity - Comet. Повозился немного и бросил, как то показалось - не очень.

Но тут вчера вернулся к этой задачке - надо было с сайта вытащить информацию. И оно работает, работает хорошо.

Клод, правда ленится, надо его пинать и заставлять, но этому я уже более-менее научился.

Весь вечер ходил под впечатлением. Ох, много чего можно с этой штукой делать…
Forwarded from Dealer.AI
Вайбовый STT с часом контекста от 📱

Microsoft выпустила VibeVoice-ASR на Hugging Face для тех, кто хочет в свой пайп агентов закинуть транскрибацию звука.

Модель умеет расшифровывать длинные аудио до 60 минут за один проход и без нарезки на короткие куски.

Что есть в функционале:
- Single-pass транскрипция дает меньше потерь контекста и стабильную речь по всей дорожке.
- Встроенная диарризация по принципу "кто говорит + таймкоды".
- Custom hotwords + user context. На вход можно подать список имён, терминов или контекст. Это позволяет работать со специфичными текстами.

Знаю, что много кто в своих пайпах с LLM используют ASR, OCR и тп. Вот вам новый кандидат на замену в аудио. До кучи. Приятно, что лицензия MIT. И код есть с поддержкой vLLM-asr.
Please open Telegram to view this post
VIEW IN TELEGRAM
Супер-популярный в последнее время агент. ClawdBot. Попробуйте, лучше установить на свой сервер

Tencent обновила свою топовую модельку по рисованию картинок

Клод код научился работать асинхронно - например, теперь сможет доделывать какие-то свои задачи, пока общается с вами

Кстати, Клод начал работать в Excel на дешевой подписке. Надо пробовать
🚀 PageIndex - умный индекс документов для reasoning-RAG (без векторов)

PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.

В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.

📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска

🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа

🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев

PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.

▪ Github: https://github.com/VectifyAI/PageIndex
▪ Blog post: https://vectify.ai/blog/Mafin2.5