very vibe coding
121 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Появился ещё один интересный кандидат для голосовых агентов — Voxtral Mini 4B Realtime от Mistral.

Что важно:

• это realtime streaming ASR,
• русский язык поддерживается,
• модель заточена именно под низкую задержку и voice-agent сценарии,
• размер около 4B, то есть это уже похоже на реальный кандидат для локального/edge запуска.

Но: “поддерживает русский” ещё не значит “лучше всех на русском”. Для прод-сценария его всё равно надо сравнивать с Sber STT, Yandex SpeechKit и Whisper/Whisper-MLX на реальных русских звонках и шумном аудио.

Ссылки:

• Hugging Face: https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602
• Документация Transformers: https://huggingface.co/docs/transformers/model_doc/voxtral
• Анонс Mistral: https://mistral.ai/news/voxtral-transcribe-2
Forwarded from Data Secrets
Google выпустили Gemini 3.1 Flash Live

Это аудио‑first модель, которая ориентирована на лайв диалоги и голосовые интерфейсы.

Обещают максимально естественную речь и минимальную задержку. Модель может отличать нюансы диалога по тону и темпу голоса (например, может поменять стиль ответа, если вы выказываете раздражение).

Контекст у новой модели держится примерно в два раза дольше, чем у прошлой версии Gemini Live, то есть она довольна хороша в длинных диалогах.

По другим бенчмаркам (устойчивость к шуму, многошаговый tool call из аудио ввода, следование инструкциям, логика диалога) Gemini 3.1 Flash Live также сильно скакнула относительно предыдущей модели и выбилась в уверенные лидеры.

Для потребителей эта моделька будет лежать в основе Search Live и Gemini Live.

Сейчас поболтать с ней уже можно в Gemini app или через Live API (цена относительно Gemini 2.5 Flash Live не изменилась)
📌 Большой мастер-класс по Claude Code!

Перед вами репозиторий с полноценным визуальным и практическим гайдом по одному из самых мощных инструментов для разработчиков.

Что внутри:

• Пошаговое обучение - от базовых команд (/init, /plan) до продвинутых вещей вроде MCP, хуков и агентов
Осваивается за ~11–13 часов

• Большая библиотека кастомных команд под реальные задачи

• Готовые шаблоны памяти - как для одиночной работы, так и для команд

• Инструкции и скрипты для:
- автокод-ревью
- проверки стиля и стандартов
- генерации API-документации

• Автоматизация через циклы
Можно настроить Claude так, чтобы он работал автономно без вашего участия

• Подключение внешних инструментов
GitHub, API и другие сервисы - всё разложено по шагам

• Объяснения через схемы и диаграммы
Подойдёт даже тем, кто только начинает

• Примеры настройки узкоспециализированных субагентов

• Отдельные скрипты под обучение
Например, генерация книг и материалов для быстрого освоения любой темы

https://github.com/luongnv89/claude-howto
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Мне тут Клод пишет, что из-за нехватки памяти Apple сняли с производства Mac Studio M3 Ultra 512….
Forwarded from Machinelearning
👀 Релиз SAM 3.1 - одной из самых сильных open-source моделей для компьютерного зрения.

Модель понимает, что происходит на изображении или видео, и умеет находить объекты по текстовому описанию. Можно буквально написать «человек в красной футболке» и она найдёт нужных людей.

Работает не только с картинками, но и с видео. Объект можно задать один раз, и дальше модель будет отслеживать его между кадрами.

Ключевая идея - open-vocabulary. Модель не ограничена фиксированными классами, как старые системы. Она оперирует огромным количеством понятий и может находить практически любые объекты.

Ещё важный момент можно комбинировать способы управления: текст, клики, рамки, маски. Это даёт гораздо больше контроля и точности.

Под капотом новая архитектура, где отдельно решаются задачи поиска объектов и их отслеживания. За счёт этого модель лучше различает похожие вещи и стабильнее работает на видео.

В репозитории уже есть всё для старта: готовые веса, код, примеры и ноутбуки.

По факту это уже не просто инструмент для разметки, а полноценный vision-движок, который можно встраивать в реальные продукты от аналитики видео до автоматизации разметки данных.

Теперь модель может отслеживать до 16 объектов за один проход.

С multiplexing все объекты обрабатываются одновременно:

• меньше лишних вычислений
• нет узких мест по памяти

Результат: скорость обработки видео увеличивается примерно в 2 раза
с 16 до 32 FPS на одном NVIDIA H100!

На новом бенчмарке SA-CO, который включает 270 тысяч уникальных концептов, SAM 3 достигает 75–80% от уровня человека.

https://github.com/facebookresearch/sam3

@ai_machinelearning_big_data

#ai #ml #llm #cv #python
Forwarded from Data Secrets
NeuralDeep Skills: локальная база агентных навыков под ру-сервисы

Всем, кто пользуется агентами, 100% известна такая вещь, как skills.sh. Это огромная база скиллов агентов под любые сервисы. Ставишь – и агент уже умеет с ними работать из коробки.

Так вот, в российском сообществе давно напрашивался аналог под локальный стек. И его сделал наш друг и коллега по тг – Валерий @neuraldeep. Он в целом регулярно делает разные практичные штуки для разработчиков, и это как раз одна из них.

Итак, встречайте: neuraldeep.ru/

Это база, в которой будут собраны скиллы для работы с самими разными ру-сервисами. Туда уже залили интеграции под инструменты Яндекс, Битрикс24, 1С и другое, чем многие пользуются каждый день.

– Установка все так же происходит одной командой, все привычно и понятно
– Проект опенсорсный: туда можно просто прийти и залить свой скилл через GitHub (формат claude-skill)
– Есть модерация и базовые проверки безопасности

Из этого вполне может получиться что-то вроде стандартного слоя для агентных интеграций под рф-рынок. Если работаете с агентами – заходите попробовать или даже поучаствовать.

Проект -> neuraldeep.ru/
Гитхаб -> https://github.com/vakovalskii/neuraldeep
Следите за обновлениями в канале Валеры -> @neuraldeep
❤1
Слушайте, тут со странной вещью столкнулся, но поскольку с нейронками в этом варюсь, напишу здесь.

Делаю пет-проект по переноске законодательства в граф, на основе онтологии, которая описывается триплетами: субъект - предикат - объект. С дополнениями, условиями, списками и пр. Типа такого: Орган регулирования - устанавливает - тарифы {в соответствии с Основами ценообразования}. Ожидаю и надеюсь, что эта структара поможет нейронкам лучше и надежнее понимать законодательство.

В этой системе, упрощенно, предикат - это глагол. У нас есть ограниченно количество сущностей, составляющих субъекты и объекты, и предикатов - глаголов. На этом и строится направленный (это важно) граф. Субекты и объекты - это вершины (сущности), ребра - предикаты (глаголы).

И для сущностей, и для глаголов формируются реестры, описываются свойства, формируются синонимы, типы и пр.

Так вот, собственно, в чем сидит заноза - раньше я слушал лекции по квантовой механике, и там все время возникали частицы - переносчики взаимодействия. И это было очень сложно понять. А у меня здесь в графе глаголы - ребра графа - как переносчики взаимодействия выступают, и как частицы тоже, потому что их свойства не сильно от свойств вершин отличаются.

В итоге не могу понять, это реально разумная аналогия или у меня крыша от вайбкодинга уже двигается... Но вообще красиво, я с этой мыслью даже смирился как-то.
👍1
Один очень простой промпт
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
Не хватало конечно такой фичи: Claude Code умеет пользоваться не файлами, а самим пк.

Открывать приложения, печатать, делать скриншоты. Всё через CLI, без переключения на десктоп.

То есть клод написал код, скомпилировал, запустил приложение, прокликал, нашёл баг, починил, проверил фикс.

Пока только на Мак, и нужен Pro или Max подписка ✋

Включается через /mcp > computer-use.

Надеюсь, что в скором времени линукс и винду добавят.

[Документация]

@tips_ai #news
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from Machinelearning
🌟 Alibaba выпустили Qwen3.5-Omni

Не мультимодальную сборку из отдельных компонентов, а единую нативную архитектуру, которая с первого слоя работает с текстом, изображением, аудио и видео одновременно.

Главное, что отличает модель от конкурентов: Audio-Visual Vibe Coding. Описываешь голосом в камеру что нужно сделать, модель генерирует рабочий код сайта или игры.

Плюс Script-Level Captioning, который превращает видео в полноценный сценарий с таймкодами и привязкой реплик к спикерам.

• По бенчмаркам Qwen3.5-Omni-Plus бьёт Gemini 3.1 Pro в большинстве категорий.
• По распознаванию речи WenetSpeech: 4.30/5.84 против 11.5/14.2.
• По пониманию аудио VoiceBench: 93.1 против 88.9.
•
• По зрению MVBench: 79.0 против 74.1. По тексту MMLU-Redux: 94.2 против 95.9 (тут паритет). Итого 215 SOTA-результатов по подзадачам.

Модель корректно реагирует на перебивание и не ломается от фонового шума), встроенный WebSearch и Function Calling, поддержка 74 языков в ASR и 29 в TTS.
Доступна через Qwen Chat, HuggingFace и API Alibaba Cloud.

Qwenchat: https://chat.qwen.ai
Blog: https://qwen.ai/blog?id=qwen3.5-omni
Hugging Face Offline Demo: https://huggingface.co/spaces/Qwen/Qwen3.5-Omni-Offline-Demo
Hugging Face Online Demo: https://huggingface.co/spaces/Qwen/Qwen3.5-Omni-Online-Demo

@ai_machinelearning_big_data

#ai #ml #qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
📌 Claude Code: подборка полезных материалов, чтобы стать ПРО.

Видео, репозитории, документация и книги. Без шума. Без мусора. Всё в одном месте.

🗂 Репозитории

Claude Code (официальный)
https://github.com/anthropics/claude-code
Claude Cookbooks
https://github.com/anthropics/claude-cookbooks
Ultimate Guide по Claude Code
https://github.com/FlorianBruhinux/claude-code-ultimate-guide
Подборка лучших плагинов Claude
https://github.com/quemsah/awesome-claude-plugins
Лучшие репозитории по Claude Code
https://mejba.me/locale/en?next=%2Fblog%2Fbest-github-repos-claude-code

📚 Гайды и документация

Обзор документации Claude Code
https://code.claude.com/docs/en/overview
Claude Code Handbook (freeCodeCamp)
https://freecodecamp.org/news/claude-code-handbook/
Полный гайд по Claude Code (2026)
https://claude-world.com/articles/claude-code-complete-guide-2026/
Практическое руководство по Claude Code
https://evakeiffenheim.substack.com/p/a-clear-guide-to-claude-code-for
Гайд для новичков по Claude Code
https://nxcode.io/resources/news/claude-code-tutorial-beginners-guide-2026

🎥 Видео

Полный гайд по Claude Code для новичков (2026)
https://youtube.com/watch?v=qYqIhX9hTQk
Полный курс по Claude Code — создание и монетизация (4 часа)
https://youtube.com/watch?v=QoQBzR1NlqI
Освой Claude Code за 30 минут
https://youtube.com/watch?v=6eBSHbLKuN0
Освой 95% навыков Claude Code за 28 минут
https://youtube.com/watch?v=zKBPwDpBfhs
Плейлист по Claude Code (от новичка до продвинутого)
https://youtube.com/playlist?list=PL4HikwTaYE0ETMaJqnNvm_2I3NEbexMDZ
Топ-6 советов для эффективной работы с Claude Code
https://youtube.com/watch?v=WwdlYp5fuxY

📖 Книги

Mastering Claude AI — практический путь
https://amazon.com/Mastering-Claude-AI-Practical-Journey/dp/B0FLJEY8BD
AI Engineering — Chip Huyen
https://amazon.com/AI-Engineering-Building-Applications-Foundation/dp/B0F3ZZTKG5
Claude Code Lab — production AI-приложения
https://books.google.com/books/about/Claude_Code_Lab.html?id=EOng0QEACAAJ

Сохрани - пригодится.
Поделись с коллегой и ускоришь кому-то путь в Claude Code.)
Please open Telegram to view this post
VIEW IN TELEGRAM