very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Machinelearning
👀 Релиз SAM 3.1 - одной из самых сильных open-source моделей для компьютерного зрения.

Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.

Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.

Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.

Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.

Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.

В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.

По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.

Теперь модель может отслеживать до 16 объектов за один проход.

С multiplexing все объекты обрабатываются одновременно:

• меньше лишних вычислений
• нет узких мест по памяти

Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!

На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.

https://github.com/facebookresearch/sam3

@ai_machinelearning_big_data

#ai #ml #llm #cv #python
Forwarded from Data Secrets
NeuralDeep Skills: локальная база агентных навыков под ру-сервисы

Всем, кто пользуется агентами, 100% известна такая вещь, как skills.sh. Это огромная база скиллов агентов под любые сервисы. Ставишь – и агент уже умеет с ними работать из коробки.

Так вот, в российском сообществе давно напрашивался аналог под локальный стек. И его сделал наш друг и коллега по тг – Валерий @neuraldeep. Он в целом регулярно делает разные практичные штуки для разработчиков, и это как раз одна из них.

Итак, встречайте: neuraldeep.ru/

Это база, в которой будут собраны скиллы для работы с самими разными ру-сервисами. Туда уже залили интеграции под инструменты Яндекс, Битрикс24, 1С и другое, чем многие пользуются каждый день.

– Установка все так же происходит одной командой, все привычно и понятно
– Проект опенсорсный: туда можно просто прийти и залить свой скилл через GitHub (формат claude-skill)
– Есть модерация и базовые проверки безопасности

Из этого вполне может получиться что-то вроде стандартного слоя для агентных интеграций под рф-рынок. Если работаете с агентами – заходите попробовать или даже поучаствовать.

Проект -> neuraldeep.ru/
Гитхаб -> https://github.com/vakovalskii/neuraldeep
Следите за обновлениями в канале Валеры -> @neuraldeep
❤1
Слушайте, тут со странной вещью столкнулся, но поскольку с нейронками в этом варюсь, напишу здесь.

Делаю пет-проект по переноске законодательства в граф, на основе онтологии, которая описывается триплетами: субъект - предикат - объект. С дополнениями, условиями, списками и пр. Типа такого: Орган регулирования - устанавливает - тарифы {в соответствии с Основами ценообразования}. Ожидаю и надеюсь, что эта структара поможет нейронкам лучше и надежнее понимать законодательство.

В этой системе, упрощенно, предикат - это глагол. У нас есть ограниченно количество сущностей, составляющих субъекты и объекты, и предикатов - глаголов. На этом и строится направленный (это важно) граф. Субекты и объекты - это вершины (сущности), ребра - предикаты (глаголы).

И для сущностей, и для глаголов формируются реестры, описываются свойства, формируются синонимы, типы и пр.

Так вот, собственно, в чем сидит заноза - раньше я слушал лекции по квантовой механике, и там все время возникали частицы - переносчики взаимодействия. И это было очень сложно понять. А у меня здесь в графе глаголы - ребра графа - как переносчики взаимодействия выступают, и как частицы тоже, потому что их свойства не сильно от свойств вершин отличаются.

В итоге не могу понять, это реально разумная аналогия или у меня крыша от вайбкодинга уже двигается... Но вообще красиво, я с этой мыслью даже смирился как-то.
👍1
Один очень простой промпт
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Не хватало конечно такой фичи: Claude Code умеет пользоваться не файлами, а самим пк.

Открывать приложения, печатать, делать скриншоты. Всё через CLI, без переключения на десктоп.

То есть клод написал код, скомпилировал, запустил приложение, прокликал, нашёл баг, починил, проверил фикс.

Пока только на Мак, и нужен Pro или Max подписка ✋

Включается через /mcp > computer-use.

Надеюсь, что в скором времени линукс и винду добавят.

[Документация]

@tips_ai #news
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Machinelearning
🌟 Alibaba выпустили Qwen3.5-Omni

Не мультимодальную сборку из отдельных компонентов, а единую нативную архитектуру, которая с первого слоя работает с текстом, изображением, аудио и видео одновременно.

Главное, что отличает модель от конкурентов: Audio-Visual Vibe Coding. Описываешь голосом в камеру что нужно сделать, модель генерирует рабочий код сайта или игры.

Плюс Script-Level Captioning, который превращает видео в полноценный сценарий с таймкодами и привязкой реплик к спикерам.

• По бенчмаркам Qwen3.5-Omni-Plus бьёт Gemini 3.1 Pro в большинстве категорий.
• По распознаванию речи WenetSpeech: 4.30/5.84 против 11.5/14.2.
• По пониманию аудио VoiceBench: 93.1 против 88.9.
•
• По зрению MVBench: 79.0 против 74.1. По тексту MMLU-Redux: 94.2 против 95.9 (тут паритет). Итого 215 SOTA-результатов по подзадачам.

Модель корректно реагирует на перебивание и не ломается от фонового шума), встроенный WebSearch и Function Calling, поддержка 74 языков в ASR и 29 в TTS.
Доступна через Qwen Chat, HuggingFace и API Alibaba Cloud.

Qwenchat: https://chat.qwen.ai
Blog: https://qwen.ai/blog?id=qwen3.5-omni
Hugging Face Offline Demo: https://huggingface.co/spaces/Qwen/Qwen3.5-Omni-Offline-Demo
Hugging Face Online Demo: https://huggingface.co/spaces/Qwen/Qwen3.5-Omni-Online-Demo

@ai_machinelearning_big_data

#ai #ml #qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
📌 Claude Code: подборка полезных материалов, чтобы стать ПРО.

Видео, репозитории, документация и книги. Без шума. Без мусора. Всё в одном месте.

🗂 Репозитории

Claude Code (официальный)
https://github.com/anthropics/claude-code
Claude Cookbooks
https://github.com/anthropics/claude-cookbooks
Ultimate Guide по Claude Code
https://github.com/FlorianBruhinux/claude-code-ultimate-guide
Подборка лучших плагинов Claude
https://github.com/quemsah/awesome-claude-plugins
Лучшие репозитории по Claude Code
https://mejba.me/locale/en?next=%2Fblog%2Fbest-github-repos-claude-code

📚 Гайды и документация

Обзор документации Claude Code
https://code.claude.com/docs/en/overview
Claude Code Handbook (freeCodeCamp)
https://freecodecamp.org/news/claude-code-handbook/
Полный гайд по Claude Code (2026)
https://claude-world.com/articles/claude-code-complete-guide-2026/
Практическое руководство по Claude Code
https://evakeiffenheim.substack.com/p/a-clear-guide-to-claude-code-for
Гайд для новичков по Claude Code
https://nxcode.io/resources/news/claude-code-tutorial-beginners-guide-2026

🎥 Видео

Полный гайд по Claude Code для новичков (2026)
https://youtube.com/watch?v=qYqIhX9hTQk
Полный курс по Claude Code — создание и монетизация (4 часа)
https://youtube.com/watch?v=QoQBzR1NlqI
Освой Claude Code за 30 минут
https://youtube.com/watch?v=6eBSHbLKuN0
Освой 95% навыков Claude Code за 28 минут
https://youtube.com/watch?v=zKBPwDpBfhs
Плейлист по Claude Code (от новичка до продвинутого)
https://youtube.com/playlist?list=PL4HikwTaYE0ETMaJqnNvm_2I3NEbexMDZ
Топ-6 советов для эффективной работы с Claude Code
https://youtube.com/watch?v=WwdlYp5fuxY

📖 Книги

Mastering Claude AI — практический путь
https://amazon.com/Mastering-Claude-AI-Practical-Journey/dp/B0FLJEY8BD
AI Engineering — Chip Huyen
https://amazon.com/AI-Engineering-Building-Applications-Foundation/dp/B0F3ZZTKG5
Claude Code Lab — production AI-приложения
https://books.google.com/books/about/Claude_Code_Lab.html?id=EOng0QEACAAJ

Сохрани - пригодится.
Поделись с коллегой и ускоришь кому-то путь в Claude Code.)
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
На базе утекшего кода Claude Code сделали полноценный опенсорсный инструмент OpenClaude

github.com/Gitlawb/openclaude

Это форк исходного слива, из которого убрали vendor lock-in. То есть теперь тот же самый Claude Code, со всеми сохраненными фичами и логикой, совместим с любыми моделями. В том числе локальными.

Уже 2к звезд на GitHub
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Code 2.1.90 - добавили новую команду /powerup.

Запускаешь её - и прямо внутри инструмента получаешь интерактивные уроки по работе с Claude Code.

Выглядит полезно: можно учиться прямо в терминале, без переключений и гайдов на стороне.

Интересно, как это реализуют в VSCode и в десктопной версии Claude Code.

Еще полезное - Когда Claude накосячил - запусти /rewind, чтобы откатить изменения в коде

Пойду дальше копаться в новом релизе 👀

Релиз: https://x.com/ClaudeCodeLog/status/2039493041979847023

🐍 полезные ресурсы 🚀Max

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Праздник опенсорса (теперь уже официального) продолжается: Google намекают, что сегодня выйдет Gemma 4 🔥
Forwarded from Неискусственный интеллект (Илья Склюев)
Компактная LLM впервые вошла в топ-3 бенчмарка MERA

Новая Cotype Light 3 на 9 млрд параметров обошла на русскоязычных задачах даже модели на 100+ млрд параметров, набрав 0,792 балла из 1,0. Разрыв с Qwen3-235B-A22B на 235 млрд составил всего 0,003 в пользу последнего.

В MWS AI говорят, что их модель одинаково точно работает с текстом и визуальными данными в едином контексте: может обрабатывать договоры, технические чертежи, формы, изображения. За счёт этого на Cotype Light 3 удобно строить специализированных агентов: они смогут самостоятельно решать большие задачи на корпоративных материалах.

Фокус в релизе сделали на возможность дообучения под отраслевую специфику и развёртывания в закрытом контуре. Модель в стандартной точности (FP16/BF16) занимает около 18 ГБ видеопамяти. Это позволяет запускать инференс Cotype Light 3 на одном серверном ускорителе — без многокарточных конфигураций и специализированных кластеров.

В ходе тестирования MWS AI также подтвердила полную совместимость моделей семейства Cotype со всеми компонентами отечественных ПАКов, включая «Машину ИИ» от Скала^р (продукт Группы Rubytech).

@anti_agi
⚡️ Карпати собрал второй мозг на LLM

Андрей Карпаты, один из самых влиятельных людей в мире AI, поделился подходом, который может изменить то, как мы работаем с информацией. Он перестал тратить токены LLM на написание кода и переключился на нечто более интересное: построение персональных баз знаний с помощью языковых моделей.

Идея простая, но мощная. Карпаты собирает сырые данные из разных источников (статьи, научные работы, репозитории, датасеты, изображения) в директорию raw/.

Затем LLM инкрементально “компилирует” из этого вики – коллекцию .md файлов с четкой структурой директорий. Модель сама создает саммари, обратные ссылки, категоризирует данные по концептам, пишет статьи для каждого из них и связывает все между собой. Для конвертации веб-статей в .md файлы он использует расширение Obsidian Web Clipper, а все связанные изображения скачивает локально, чтобы LLM мог к ним обращаться.

В качестве IDE выступает Obsidian. Через него Карпаты просматривает сырые данные, скомпилированную вики и визуализации. Важный момент: LLM пишет и поддерживает все данные вики самостоятельно, человек почти не трогает это руками. Плюс Obsidian-плагины вроде Marp позволяют рендерить данные в других форматах, например в слайды.

Еще один крутой прием - LLM-«линтинг» вики. Модель прогоняет проверки здоровья базы, находит противоречивые данные, заполняет пробелы через веб-поиск, обнаруживает интересные связи для новых статей и постепенно повышает целостность данных.

Следующий логичный шаг - синтетическая генерация данных и файнтюнинг, чтобы LLM «знала» данные в своих весах, а не только через контекстное окно. Карпати считает, что здесь есть место для нового крутого продукта, а не просто набора скриптов. И с этим сложно не согласиться.

https://uproger.com/karpati-sobral-vtoroj-mozg-na-llm/

🐍 полезные ресурсы 🚀Max

@machinelearning_interview
Все ругают Антропик за отказ запускать OpenClaw через Claude, но вот возможность подключить к OpenClaw Claude code через acpx никуда не делась… у меня все так и работает. Агент сидит на GPT-5.4, но может вызывать и Claude, и Gemini

https://t.me/ai_machinelearning_big_data/9812