Немного не по теме, но не могу не поделиться - лучший репозиторий прошлой недели. Хотите видеть сквозь стены?
RuView — это open-source edge AI система, которая «видит» людей через стены, используя только WiFi-сигналы. Без камер, без носимых устройств, без интернета.
Суть технологии:
WiFi-роутер заполняет комнату радиоволнами. Когда человек двигается (или даже дышит), волны рассеиваются по-другому. RuView анализирует эти изменения через CSI (Channel State Information) — поканальные данные об амплитуде и фазе сигнала — и восстанавливает позу тела, частоту дыхания и пульс в реальном времени.
Что умеет:
Оценка позы — 17 точек тела (как COCO keypoints) из WiFi-сигнала, 54K fps на Rust
Витальные показатели — дыхание (6–30 вдохов/мин), пульс (40–120 уд/мин) бесконтактно
Сквозь стены — WiFi проходит через стены, мебель, завалы (до 5 м)
Многопользовательское отслеживание — несколько человек одновременно, без путаницы ID
Самообучение — модель учится на сырых WiFi-данных без камер и разметки (ADR-024)
Железо:
Основной вариант — mesh из 3–6 ESP32-S3 (~$8–54 за комплект) + обычный WiFi-роутер
Альтернатива — Intel 5300 / Atheros AR9580 (исследовательские NIC)
Без CSI-оборудования — только грубое определение присутствия по RSSI
Стек:
Основной runtime — Rust (810x быстрее Python-версии), 15 crate'ов на crates.io
65 edge-модулей (WASM,
Docker-образы для быстрого старта:
Прошивка ESP32 на C (CSI collector + TDM mesh протокол)
Web UI — Three.js визуализация в реальном времени
Применения: уход за пожилыми (падения, дыхание ночью), больничный мониторинг, ритейл (поток/очереди без камер), умный дом (присутствие через стены), спасательные операции (поиск выживших в завалах), промышленная безопасность, робототехника.
Статус: 32.9K звёзд, 274 коммита, 1300+ тестов, MIT-лицензия. Проект основан на академической работе Carnegie Mellon DensePose From WiFi и расширен до практической edge-системы.
По сути, это превращение обычного WiFi в «рентген для движения» — приватно (нет видео), дёшево (ESP32 за копейки) и автономно (без облака).
RuView — это open-source edge AI система, которая «видит» людей через стены, используя только WiFi-сигналы. Без камер, без носимых устройств, без интернета.
Суть технологии:
WiFi-роутер заполняет комнату радиоволнами. Когда человек двигается (или даже дышит), волны рассеиваются по-другому. RuView анализирует эти изменения через CSI (Channel State Information) — поканальные данные об амплитуде и фазе сигнала — и восстанавливает позу тела, частоту дыхания и пульс в реальном времени.
Что умеет:
Оценка позы — 17 точек тела (как COCO keypoints) из WiFi-сигнала, 54K fps на Rust
Витальные показатели — дыхание (6–30 вдохов/мин), пульс (40–120 уд/мин) бесконтактно
Сквозь стены — WiFi проходит через стены, мебель, завалы (до 5 м)
Многопользовательское отслеживание — несколько человек одновременно, без путаницы ID
Самообучение — модель учится на сырых WiFi-данных без камер и разметки (ADR-024)
Железо:
Основной вариант — mesh из 3–6 ESP32-S3 (~$8–54 за комплект) + обычный WiFi-роутер
Альтернатива — Intel 5300 / Atheros AR9580 (исследовательские NIC)
Без CSI-оборудования — только грубое определение присутствия по RSSI
Стек:
Основной runtime — Rust (810x быстрее Python-версии), 15 crate'ов на crates.io
65 edge-модулей (WASM,
no_std Rust, 5–30 KB каждый) — от апноэ сна до детекции дождяDocker-образы для быстрого старта:
docker run -p 3000:3000 ruvnet/wifi-densepose:latestПрошивка ESP32 на C (CSI collector + TDM mesh протокол)
Web UI — Three.js визуализация в реальном времени
Применения: уход за пожилыми (падения, дыхание ночью), больничный мониторинг, ритейл (поток/очереди без камер), умный дом (присутствие через стены), спасательные операции (поиск выживших в завалах), промышленная безопасность, робототехника.
Статус: 32.9K звёзд, 274 коммита, 1300+ тестов, MIT-лицензия. Проект основан на академической работе Carnegie Mellon DensePose From WiFi и расширен до практической edge-системы.
По сути, это превращение обычного WiFi в «рентген для движения» — приватно (нет видео), дёшево (ESP32 за копейки) и автономно (без облака).
GitHub
GitHub - ruvnet/RuView: π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence…
π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence detection — all without a single pixel of video. - ruvnet/RuView
Forwarded from Machine learning Interview
⚡️ Alibaba Tongyi Lab открыла исходники GUI-Owl-1.5 и Mobile-Agent-v3.5 - семейства моделей-агентов, которые умеют напрямую управлять интерфейсами: desktop, мобильными приложениями и браузером.
Все модели построены на базе Qwen3-VL и обучены в одной парадигме для работы с GUI.
Доступно 6 размеров моделей:
• 2B / 4B / 8B / 32B Instruct — быстрые модели с низкой задержкой (без Chain-of-Thought)
• 8B / 32B Thinking — более сильное планирование и reasoning
По бенчмаркам это open-source SOTA на более чем 20 тестах GUI-агентов:
• OSWorld-Verified — 56.5 (32B-Instruct)
• AndroidWorld — 71.6 (8B-Thinking)
• VisualWebArena — 46.6
• WebArena — 48.4 (32B-Thinking)
• ScreenSpot-Pro — 80.3 с двухэтапным crop refine
• OSWorld-MCP — 47.6
• MobileWorld — 46.8
Архитектура обучения строится на трех ключевых идеях:
• Hybrid Data Flywheel — комбинация симуляций и cloud sandbox для генерации GUI-траекторий с проверкой чекпоинтов
• Unified CoT Synthesis — world modeling, knowledge injection и tool/MCP reasoning встроены в каждый шаг
• MRPO — multi-platform reinforcement learning с online rollout buffer и защитой от outcome collapse
Фактически это еще один шаг к полностью автономным AI-агентам, которые могут работать с интерфейсами так же, как человек.
Models: modelscope.cn/models/iic/GUI-Owl-1.5-8B-Instruct
GitHub: github.com/X-PLUG/MobileAgent
🎯Полезные Мл-ресурсы 🚀 Max
@machinelearning_interview
Все модели построены на базе Qwen3-VL и обучены в одной парадигме для работы с GUI.
Доступно 6 размеров моделей:
• 2B / 4B / 8B / 32B Instruct — быстрые модели с низкой задержкой (без Chain-of-Thought)
• 8B / 32B Thinking — более сильное планирование и reasoning
По бенчмаркам это open-source SOTA на более чем 20 тестах GUI-агентов:
• OSWorld-Verified — 56.5 (32B-Instruct)
• AndroidWorld — 71.6 (8B-Thinking)
• VisualWebArena — 46.6
• WebArena — 48.4 (32B-Thinking)
• ScreenSpot-Pro — 80.3 с двухэтапным crop refine
• OSWorld-MCP — 47.6
• MobileWorld — 46.8
Архитектура обучения строится на трех ключевых идеях:
• Hybrid Data Flywheel — комбинация симуляций и cloud sandbox для генерации GUI-траекторий с проверкой чекпоинтов
• Unified CoT Synthesis — world modeling, knowledge injection и tool/MCP reasoning встроены в каждый шаг
• MRPO — multi-platform reinforcement learning с online rollout buffer и защитой от outcome collapse
Фактически это еще один шаг к полностью автономным AI-агентам, которые могут работать с интерфейсами так же, как человек.
Models: modelscope.cn/models/iic/GUI-Owl-1.5-8B-Instruct
GitHub: github.com/X-PLUG/MobileAgent
🎯Полезные Мл-ресурсы 🚀 Max
@machinelearning_interview
Читая такие новости про Claude и про других агентов, понимаешь, что ситуация начинает выходить из под контроля...
https://t.me/ai_machinelearning_big_data/9644
https://t.me/ai_machinelearning_big_data/9644
Telegram
Machinelearning
✔️ Anthropic представила Claude Code Review.
Claude Code Review - инструмент для поиска багов в пулл-реквестах, который сейчас доступен в режиме превью для корпоративных пользователей Team и Enterprise. Процесс полностью бесшовен, агенты автоматически активируются…
Claude Code Review - инструмент для поиска багов в пулл-реквестах, который сейчас доступен в режиме превью для корпоративных пользователей Team и Enterprise. Процесс полностью бесшовен, агенты автоматически активируются…
Gemini начали разворачивать в Chrome - сейчас это вторая нейросетка по популярности, и, видимо, доля ее будет расти и дальше
Google
Expanding Chrome’s AI experiences to India, New Zealand and Canada
We’re bringing Gemini in Chrome’s powerful AI features to more regions and languages, helping millions of people get the most out of their browser.
Было ли у вас такое, что пока Claude code работает, хочется задать ему вопрос по ходу? Так вот, теперь вы можете - /btw и пишите вопрос. Клод будет продолжать работать и говорить с вами одновременно.
X (formerly Twitter)
Thariq (@trq212) on X
We just added /btw to Claude Code!
Use it to have side chain conversations while Claude is working.
Use it to have side chain conversations while Claude is working.
🔥2
Forwarded from Анализ данных (Data analysis)
Модель поддерживает 100+ языков, текстовые входы до 8192 токенов, до 6 изображений в одном запросе, видео до 120 секунд, нативные аудио-эмбеддинги и PDF-файлы до 6 страниц. Это позволяет упростить пайплайны для задач вроде RAG, семантического поиска, кластеризации и анализа тональности.
Благодаря технологии Matryoshka Representation Learning, которая позволяет гибко менять размер векторов (3072 → 1536 → 768), разработчики могут балансировать между качеством модели и затратами на хранение, сохраняя при этом передовое мультимодальное понимание данных.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-embedding-2/
🎯Полезные Мл-ресурсы 🚀 Max
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Я уже писал, что установил себе супермодного нынче агента - OpenClaw. Живет у меня в отдельной квартире в отдельном контейнере комфортабельного мак мини.
Посадил его на подписку ChatGPT-5.4, одна из топ моделей на сегодня, вроде должен быть неглупым.
Оно прикольно, с одной стороны, подключился к телеграмму, общается с тобой, весь такой самостоятельный, типа - все сделаю сам.
Но есть одна проблема. Он врет. Ну просто постоянно воет. У меня в Claude code есть отдельный агент, который смотрит за тем, что делает OpenClaw, поэтому знаю из достоверных источников.
Типичный диалог:
- подключи Gemini через acpx;
- да, сейчас, все будет, минут 10;
- подключился?
- да, но соединение не стабильное, надо не через CLI, а сделать обертку. Сделаю, прогоню smoke-тесты?
- делай;
Ну и дальше в таком же духе - еще 15 минут, какая-то авторизация нужна, что-то на серваке не работает. Спрашиваю Клода - что он там делает?
А он ДАЖЕ НЕ НАЧИНАЛ.
Просто чатится со мной и кормит обещаниями. Очень по-человечески. И так из раза в раз. Просто жесть.
Теперь помимо модного слова Claw изучаю еще одно модное слово - Harness
Посадил его на подписку ChatGPT-5.4, одна из топ моделей на сегодня, вроде должен быть неглупым.
Оно прикольно, с одной стороны, подключился к телеграмму, общается с тобой, весь такой самостоятельный, типа - все сделаю сам.
Но есть одна проблема. Он врет. Ну просто постоянно воет. У меня в Claude code есть отдельный агент, который смотрит за тем, что делает OpenClaw, поэтому знаю из достоверных источников.
Типичный диалог:
- подключи Gemini через acpx;
- да, сейчас, все будет, минут 10;
- подключился?
- да, но соединение не стабильное, надо не через CLI, а сделать обертку. Сделаю, прогоню smoke-тесты?
- делай;
Ну и дальше в таком же духе - еще 15 минут, какая-то авторизация нужна, что-то на серваке не работает. Спрашиваю Клода - что он там делает?
А он ДАЖЕ НЕ НАЧИНАЛ.
Просто чатится со мной и кормит обещаниями. Очень по-человечески. И так из раза в раз. Просто жесть.
Теперь помимо модного слова Claw изучаю еще одно модное слово - Harness
😁6
Два слова о том, почему после всех этих фокусов я все-таки продолжаю с ним заморачиваться.
Во-первых, он воспринимается очень естественно. Пишет в телеграмм как помощник, оборудован памятью (еще предстоит посмотреть, как она работает), может и в вотсапе писать (это мало кто умеет) - т.е. хороший канал связи и много инструментов.
Во-вторых, это очень удобный оркестратор - ты закинул ему задачку, он сам разбил ее на подзадачи, ушел в луп разработки, загрузил другие модели - и выдал результат. Так в теории должно работать.
У него очень классные внутренние промпты. Подключаю к нему сейчас по acpx claude code, codex, gemini - должны работать по подпискам. Т.е. Claw должен задачку грузить агенту, например, в кодексе, и проверять результат разработки. Подписок у меня достаточно, а здесь - возможность их использовать на максимум.
Поэтому работаю над harness - пытаюсь дать инструменты и заставить делать то, что от него прошу. Если получится, буду просто в телеграмме давать команду и там же получать ответ, и цель кажется достижимой и очень привлекательной.
В общем, пытаюсь сделать из двоечника отличника. Как-то так
Во-первых, он воспринимается очень естественно. Пишет в телеграмм как помощник, оборудован памятью (еще предстоит посмотреть, как она работает), может и в вотсапе писать (это мало кто умеет) - т.е. хороший канал связи и много инструментов.
Во-вторых, это очень удобный оркестратор - ты закинул ему задачку, он сам разбил ее на подзадачи, ушел в луп разработки, загрузил другие модели - и выдал результат. Так в теории должно работать.
У него очень классные внутренние промпты. Подключаю к нему сейчас по acpx claude code, codex, gemini - должны работать по подпискам. Т.е. Claw должен задачку грузить агенту, например, в кодексе, и проверять результат разработки. Подписок у меня достаточно, а здесь - возможность их использовать на максимум.
Поэтому работаю над harness - пытаюсь дать инструменты и заставить делать то, что от него прошу. Если получится, буду просто в телеграмме давать команду и там же получать ответ, и цель кажется достижимой и очень привлекательной.
В общем, пытаюсь сделать из двоечника отличника. Как-то так
🔥1
Forwarded from Machinelearning
NVIDIA обучила семейство моделей Nemotron-Terminal для автономной работы в терминале Linux: устанавливать зависимости, писать и запускать код, отлаживать окружения и выполнять сквозные инженерные задачи без участия человека.
Семейство построено на базе Qwen3 и специально собранном датасете Terminal-Corpus. И фишка не в архитектуре, а в данных.
Первый адаптирует готовые датасеты по математике, коду и SWE-задачам под терминальный формат (без участия LLM в процессе адаптации).
Второй генерирует синтетику 2 методами: seed-based (LLM создает новые задачи на основе существующих задач из смежных областей) и skill-based (LLM комбинирует до пяти примитивных навыков из таксономии по 9 доменам: Security, Data Science, System Administration и другим).
Terminal-Corpus: около 366K траекторий выполнения задач, разбитых на два потока: ~226K адаптированных примеров из Math/Code/SWE и ~140K синтетических задач на основе skill-таксономии.
Synthetic-Tasks: задачи в стандартизированном формате: инструкция, Docker-окружение из 9 преднастроенных образов и верификационный набор на pytest.
На Terminal-Bench 2.0 все 3 модели показали кратный рост относительно базовой Qwen3: 8B - с 2.5% до 13%, 14B - с 4% до 20.2%, 32B - с 3.4% до 27.4%.
Для сравнения: Qwen3-Coder на 480B параметров набирает 23.9%, GPT-5-Mini - 24.0%, Grok 4 - 23.1%. Nemotron-Terminal-32B превосходит или вплотную конкурирует с ними всеми при разнице в размере на порядок.
Фильтрация неудачных траекторий вредит. Модель, обученная на всех траекториях включая ошибочные, набирает 12.4% против 5.06% у варианта только с успешными.
Curriculum learning (сначала простые данные, потом сложные) не дал преимуществ перед простым смешанным обучением.
Увеличение контекстного окна с 32K до 65K токенов также не помогло, длинные траектории оказались шумнее.
@ai_machinelearning_big_data
#AI #ML #LLM #NemotronTerminal #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Tips AI | IT & AI
Есть public-apis — старый репозиторий с огромной базой бесплатных API на любую тему.
Финансы, новости, погода, спорт, ML, развлечения.
Там у каждого API указан тип доступа:
• No auth: бесплатно, без регистрации
• apiKey: нужно получить ключ, есть с free тарифами и лимитами
• OAuth: нужна авторизация, часть платные
Можно скормить весь список AI-агенту и попросить найти что пригодится под твои задачи, найдёт то, что сам бы пропустил.
@tips_ai #tools
Финансы, новости, погода, спорт, ML, развлечения.
Там у каждого API указан тип доступа:
• No auth: бесплатно, без регистрации
• apiKey: нужно получить ключ, есть с free тарифами и лимитами
• OAuth: нужна авторизация, часть платные
Можно скормить весь список AI-агенту и попросить найти что пригодится под твои задачи, найдёт то, что сам бы пропустил.
@tips_ai #tools
Вот прямо сейчас чем-то таким занимаюсь (с перерывом на работу) - а тут и новый пакет подоспел. Надо пробовать
https://t.me/ai_machinelearning_big_data/9664
https://t.me/ai_machinelearning_big_data/9664
Telegram
Machinelearning
🌟 ByteDance перезапустила DeerFlow.
DeerFlow 2.0 - проект, переписанный с нуля, который не имеет ничего общего с первой версией. Там был фреймворк для глубокого ресерча, а здесь полноценный рантайм для агентов.
🟡В основе лежит связка LangGraph и LangChain.…
DeerFlow 2.0 - проект, переписанный с нуля, который не имеет ничего общего с первой версией. Там был фреймворк для глубокого ресерча, а здесь полноценный рантайм для агентов.
🟡В основе лежит связка LangGraph и LangChain.…
Forwarded from Tips AI | IT & AI
This media is not supported in your browser
VIEW IN TELEGRAM
У CEO Obsidian есть еще проект Defuddle — который поможет вытаскивает чистый контент из любой веб-страницы и отдавать в Markdown.
Берёт страницу, убирает рекламу, навигацию, сайдбары, скрытые элементы, трекинг-пиксели, оставляет только контент.
Плюс вытаскивает метаданные в YAML формате: автор, дата публикации, описание, язык.
Можно получить то же самое прямо из CLI одной командой:
Использовать для скриптов и AI-агентов, которым нужен чистый текст без мусора — самое то.
Есть ещё markdown.new от Cloudflare, но он просто конвертирует весь HTML.
Использовать Defuddle можно как угодно:
• Веб — defuddle.md/URL
• CLI — npx defuddle parse URL
• Node.js — как библиотеку в своём проекте
• Obsidian Web Clipper
• Self-hosted
Изначально сделан для Obsidian Web Clipper: расширение, которое сохраняет веб-страницы в заметки Obsidian.
Сейчас он туда встроен (см. видео).
Вот ссылки на [сайт] и [GitHub]
@tips_ai #tools
Берёт страницу, убирает рекламу, навигацию, сайдбары, скрытые элементы, трекинг-пиксели, оставляет только контент.
Плюс вытаскивает метаданные в YAML формате: автор, дата публикации, описание, язык.
Можно получить то же самое прямо из CLI одной командой:
curl defuddle.md/stephango.com Использовать для скриптов и AI-агентов, которым нужен чистый текст без мусора — самое то.
Есть ещё markdown.new от Cloudflare, но он просто конвертирует весь HTML.
Использовать Defuddle можно как угодно:
• Веб — defuddle.md/URL
• CLI — npx defuddle parse URL
• Node.js — как библиотеку в своём проекте
• Obsidian Web Clipper
• Self-hosted
Изначально сделан для Obsidian Web Clipper: расширение, которое сохраняет веб-страницы в заметки Obsidian.
Сейчас он туда встроен (см. видео).
Вот ссылки на [сайт] и [GitHub]
@tips_ai #tools
❤1
Мой Claw сначала посмотрел на тему скептически - типа больше рекламы, но почитал код и решил - а что, системно написано, интересно…
https://t.me/ai_machinelearning_big_data/9667
https://t.me/ai_machinelearning_big_data/9667
Telegram
Machinelearning
🌟 OpenJarvis: фреймворк все-в-одном для ИИ-агентов
Stanford SAIL замерили, насколько эффективно локальные языковые модели конвертируют электроэнергию в полезные вычисления и назвали этот показатель "intelligence per watt".
Они прогнали больше миллиона реальных…
Stanford SAIL замерили, насколько эффективно локальные языковые модели конвертируют электроэнергию в полезные вычисления и назвали этот показатель "intelligence per watt".
Они прогнали больше миллиона реальных…
Кстати, после обновления у Claude появился 1 млн токенов контекста. Это круто, но все-равно, советую за контекстом следить, так как длинные сессии жрут много токенов (каждый новый вопрос к модели - это не добавление одной фразы, а загрузка всего контекста с нуля), а качество ответов модели - падает. Но это все-равно лучше чем autocompact