Forwarded from Machine learning Interview
Автоматизируем рутину на максимум: вышла Manus Academy - платформа с бесплатными курсами по ИИ-агентам.
Внутри - крепкая база, с которой уже легко заходить в продвинутый вайбкодинг:
научат собирать приложения без кода, настраивать кастомные workflow, и писать промпты, которые реально работают (а не “вода”).
https://academy.manus.im/
Внутри - крепкая база, с которой уже легко заходить в продвинутый вайбкодинг:
научат собирать приложения без кода, настраивать кастомные workflow, и писать промпты, которые реально работают (а не “вода”).
https://academy.manus.im/
Посмотрим, попробуем, тем более с моей подпиской от Claude. Прямо скажем, Клод код еще не совершенен, но - лучшее что я видел. Впрочем, многие считают, что Codex 5.2 точнее в программировании - мое впечатление, что модели стоят друг друга.
Всяко, развивать новых агентов имеет смысл, изучал вопрос на праздниках. И агент по ссылке - тому пример.
Интересно, что агентов делают на инфраструктуре Claude code, как мичуринцы - прививая другие модели, ставя подпорки и тп. Просто этот корень самый удобный
Всяко, развивать новых агентов имеет смысл, изучал вопрос на праздниках. И агент по ссылке - тому пример.
Интересно, что агентов делают на инфраструктуре Claude code, как мичуринцы - прививая другие модели, ставя подпорки и тп. Просто этот корень самый удобный
Telegram
Anton Vdovitchenko — Ai Agents
Привет, друзья! Как отдохнули? Врываемся на танцпол первой половины 2026! Я бы не стал писать про «ещё один агентный CLI», но этот очень интересный, причём широкая общественность вообще обходит его стороной.
Называется Kiro, делает его AWS (Amazon). Есть…
Называется Kiro, делает его AWS (Amazon). Есть…
Оно и без агента можно было так пробовать или Claude code использовать вместо обычного Клода, но все же.. для понимания - модели для кодинга немного отличаются от базовых моделей, но отличия достигаются файнтьюнингом и они не мешают моделям для кодинга отвечать на обычные вопросы.
Будет просто удобнее. Методы работы с кодом переносятся на работу с документами. Отлично
https://t.me/data_secrets/8610
Будет просто удобнее. Методы работы с кодом переносятся на работу с документами. Отлично
https://t.me/data_secrets/8610
Telegram
Data Secrets
Anthropic анонсировали Cowork: computer use агента для non-coding рабочих задач
Это буквально Claude Code для отдельной директории на вашем компьютере. Cowork сможет читать, изменять и создавать файлы в конкретной папке, к которой вы его подключите.
Например…
Это буквально Claude Code для отдельной директории на вашем компьютере. Cowork сможет читать, изменять и создавать файлы в конкретной папке, к которой вы его подключите.
Например…
Это уже вторая статья про новации DeepSeek, и это обещает нам действительно супермодель (ждем в феврале).
DeepSeek - особенная компания. Термин DeepSeek moment, который теперь общеупотребительный для ситуаций шока, которые сложные решения заменяют простыми, появился не зря. После первой модели компания неделю выкладывала статьи, которые рассказывали, что они делали, чтобы малыми ресурсами достичь большого результата.
И вот теперь - новые статьи, которые, очевидно, разогревают публику перед новой моделью. И содержание статей очень впечатляет, это не бантики, это действительно революционные находки. Опять
DeepSeek - особенная компания. Термин DeepSeek moment, который теперь общеупотребительный для ситуаций шока, которые сложные решения заменяют простыми, появился не зря. После первой модели компания неделю выкладывала статьи, которые рассказывали, что они делали, чтобы малыми ресурсами достичь большого результата.
И вот теперь - новые статьи, которые, очевидно, разогревают публику перед новой моделью. И содержание статей очень впечатляет, это не бантики, это действительно революционные находки. Опять
Telegram
Machinelearning
⚡️ DeepSeek Engram: условная память LLM через поиск.
DeepSeek опять шатают устои архитектуры трансформеров свежайшим пейпером, который доказывает, что новое — это хорошо ⡢ ⢒⣄⠨⠸⣀ ⠍⠆⠤⠴⡤ забытое старое.
Пока все пытаются запихнуть в LLM как можно больше слоев…
DeepSeek опять шатают устои архитектуры трансформеров свежайшим пейпером, который доказывает, что новое — это хорошо ⡢ ⢒⣄⠨⠸⣀ ⠍⠆⠤⠴⡤ забытое старое.
Пока все пытаются запихнуть в LLM как можно больше слоев…
Forwarded from Анализ данных (Data analysis)
🔥 Свежее обновление Z-Image-Turbo-Fun-Controlnet-Union 2.1! 🚀
Что нового:
✅ Lite-модель 1.9GB - подходит для low-VRAM и даёт естественное смешивание (blend)
✅ Починили mask leakage в inpainting (маска больше не “течёт”)
✅ Полный рефактор датасета под multi-resolution (вплоть до 1536px)
✅ 8-step distillation - Turbo-генерация стала резкой и без мыла
Больше никаких ярких пятен и странных засветов. Высокий и точный контроль генераций. 🧠
🤖 Model: https://modelscope.ai/models/PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1
Что нового:
✅ Lite-модель 1.9GB - подходит для low-VRAM и даёт естественное смешивание (blend)
✅ Починили mask leakage в inpainting (маска больше не “течёт”)
✅ Полный рефактор датасета под multi-resolution (вплоть до 1536px)
✅ 8-step distillation - Turbo-генерация стала резкой и без мыла
Больше никаких ярких пятен и странных засветов. Высокий и точный контроль генераций. 🧠
🤖 Model: https://modelscope.ai/models/PAI/Z-Image-Turbo-Fun-Controlnet-Union-2.1
В Claude code появился поиск для МСР - это решение для экономии токенов. Возможно, вы замечали как быстро они уходят при интернет-поиске и использовании других инструментов
https://x.com/trq212/status/2011523109871108570?s=46
https://x.com/trq212/status/2011523109871108570?s=46
X (formerly Twitter)
Thariq (@trq212) on X
Tool Search now in Claude Code
Такие агенты нам нужны! И размерчик подходящий
Telegram
Анализ данных (Data analysis)
AgentCPM-Explore🔥 - on-device модель от OpenBMB
OpenBMB выпустили AgentCPM-Explore - компактную, но очень мощную модель-агента, которая рассчитана на работу прямо на устройстве.
Что внутри:
✨ 4B параметров + Apache 2.0
Полностью open-source лицензия
…
OpenBMB выпустили AgentCPM-Explore - компактную, но очень мощную модель-агента, которая рассчитана на работу прямо на устройстве.
Что внутри:
✨ 4B параметров + Apache 2.0
Полностью open-source лицензия
…
Forwarded from Machinelearning
OpenAI добавили в свой cookbook гайд по Context Engineering для Agents SDK, и это, пожалуй, самый грамотный подход к управлению памятью.
Вместо того чтобы рыться в тысячах старых сообщений, агент ведет структурированный профиль пользователя и "записную книжку".
save_memory_note. Если в разговоре вы сказали: "Я не ем мясо", агент вызывает этот тул и сохраняет Session Note (временную заметку) в реальном времени.Подход OpenAI с разделением на Session Memory и Global Memory выглядит надежно, но требует прямых рук при написании логики консолидации. Без этого ваш агент быстро превратится в деда с деменцией, который помнит то, чего не было.
Нужно делать отдельный вызов LLM после каждого диалога, чтобы причесать память. Если на этом этапе модель заглючит, она может записать в "долгую память" галлюцинацию или удалить важное. Тут решают жесткие рамки.
Если разрешить агенту запоминать всё подряд, юзер может сказать: "Запомни, что мое новое правило - никаких правил". Поэтому нужны ограничения на этапе записи и вычитки памяти.
Контекстное окно не резиновое. Хотя модели имеют огромный контекст, таскать за собой "Войну и мир" из заметок пользователя — накладно по деньгам и таймингам. Придется периодически триммить историю, оставляя только суть.
@ai_machinelearning_big_data
#AI #ML #LLM #Guide #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, у нас новый лидер среди моделей голос-голос - StepAudio R 1.1
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
GitHub
GitHub - stepfun-ai/Step-Audio-R1
Contribute to stepfun-ai/Step-Audio-R1 development by creating an account on GitHub.
Forwarded from Machinelearning
BFL вышли на связь c релизом прямого наследника ветки
schnell первой версии семейства Flux.Знакомьтесь - FLUX.2 [Klein], модель, которая возвращает веру в то, что с маленьким VRAM тоже можно жить.
Это попытка впихнуть качество топовой FLUX.2 в формат, которую потянет большинство потребительских GPU.
Klein получился довольно универсальным инструментом: она умеет и text-to-image, и инпэйинт, и смешивание стилей.
Заявлены разрешение до 4 мегапикселей, отличный рендеринг текста и понимание сложных промптов.
BFL взяли флагманскую FLUX.2 и сжали знания в 2 компактные версии: 4B и 9B, каждая из которых получила вариации Base и Distilled:
Если захотите тренить на 4B Distilled - получите кашу.
9B distilled — 4 шага · ~2 сек. · 19.6GB VRAM
9B base — 50 шагов · ~35 сек · 21.7GB VRAM
4B distilled — 4 шага · ~1.2 сек. · 8.4GB VRAM
4B base — 50 шагов · ~17 сек. · 9.2GB VRAM
Веса уже на Hugging Face, потыкать в демо можно у BFL или в спейсах на HF: 9B и 4В.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Нашел подборку тестов языковых моделей для слабых GPU – если у вас слабенький компьютер или вы на ноуте, вам сюда:
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
Несмотря на усилия Google, который вроде бы имеет топ-модель Gemini 3 Pro, отставание от Open AI и Anthropic налицо - модели GPT-5.2 и Opus 4.5 заметно сильнее в программировании.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Forwarded from Machinelearning
В полку моделей, тех, что можно запустить локально, не продавая почку, прибыло.
ZAI выкатили GLM-4.7 Flash - облегченную версию GLM-4.7 на 30 млрд. параметров, с контекстным окном в 128К на архитектуре MoE.
Со слов создателей, модель должна занять нишу между сегментом SLM и проприетарными мастодонтами, предлагая SOTA-уровень в кодинге.
Всего 30B, но активных параметров на токен гораздо меньше, официальной инфы нет, но в сообществе пишут, что 3 млрд.
Киллер-фича для агентов, которая досталась в наследство от старшей GLM-4.7. Обычно модели выплевывают весь свой CoT в начале, а вот эта техника дает возможность модели думать перед каждым вызовом инструмента.
Опять-таки, со слов Zai, они натаскали GLM-4.7 Flash не просто писать валидный HTML/CSS, а использовать актуальные паттерны, нормальные отступы и цветовые схемы.
Плюс, подтянули работу с CLI и девопс-задачами (понимает права доступа, навигацию по файловой системе).
В SWE-bench Verified модель выбивает 59.2%. Для сравнения: Qwen3-30B-A3B: 22.0%, GPT-OSS-20B: 34.0%.
В математическом AIME 25 тоже обходит конкурентов - 91.6%. А вот на BrowseComp она лучше GPT-OSS-20B почти в 1.5 раза.
Вобщем, Flash-версия выглядит как идеальный кандидат для локальных кодинг-агентов. Если есть пара свободных видеокарт (или есть стойкость терпеть квантование на одной), это, возможно, лучшая рабочая лошадка на сегодня.
@ai_machinelearning_big_data
#AI #ML #LLM #GLM #ZAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from LLM под капотом
Кто там хотел локальной Claude Code ?
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
И потом запустить примерно так
Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))
Ваш, @llm_under_hood 🤗
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
И потом запустить примерно так
claude --model qwen3-coder
Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))
Ваш, @llm_under_hood 🤗
Это примерно то, чем я занимался на выходных - создал агента для разработки других агентов для Claude code.
Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
Telegram
Анализ данных (Data analysis)
🚀 Superpowers - это плагин для Claude Code, который предоставляет обширную библиотеку навыков для тестирования, отладки и сотрудничества. Он позволяет пользователям загружать и вносить изменения в репозиторий навыков, а также использовать команды для выполнения…
Новая крутая микромоделька, если вдруг кому-то это интересно ))
Telegram
Анализ данных (Data analysis)
📱 Сегодня мы выпускаем LFM2.5-1.2B-Thinking - reasoning-модель, которая работает полностью на устройстве.
То, что ещё 2 года назад требовало дата-центра, теперь запускается на любом телефоне и требует всего 900 МБ памяти.
Ключевые особенности:
> Натренирована…
То, что ещё 2 года назад требовало дата-центра, теперь запускается на любом телефоне и требует всего 900 МБ памяти.
Ключевые особенности:
> Натренирована…
Forwarded from Machine learning Interview
🚀 STEP3-VL-10B - мультимодальная модель, которая бьёт гигантов (и весит всего 10B)
StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.
Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)
Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)
Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы
Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели
Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.
Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)
Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)
Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы
Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели
Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
Раньше у меня стояло в VS-Code приложение Claude - нормально пользоваться не получалось, так для Клод кода мало было VPN через VPS, надо было делать residential proxy - благо он же сам мне и подсказал как все настроить..
Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.
Привык я к терминалу
https://t.me/data_secrets/8642
Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.
Привык я к терминалу
https://t.me/data_secrets/8642
Telegram
Data Secrets
Черный день для Cursor: Anthropic выкатили полноценное расширение для Claude Code в VS Code
Выглядит привычно: ассистент сбоку, подсказки через diff, добавились явные указатели контекста с помощью @. В целом намного удобнее, чем обычный Claude Code, и вероятно…
Выглядит привычно: ассистент сбоку, подсказки через diff, добавились явные указатели контекста с помощью @. В целом намного удобнее, чем обычный Claude Code, и вероятно…
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Очень нравится апдейт Gemini: Гугл завез в их чатбота подготовку к вступительным экзаменам в колледжи-университеты США (SAT)
Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу
Гугл получает лайк, ждем аналогов везде
Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу
Гугл получает лайк, ждем аналогов везде
Forwarded from Анализ данных (Data analysis)
⚡️ ERNIE 5.0 - официальный релиз.
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com