very vibe coding
120 subscribers
463 photos
126 videos
13 files
991 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Вот те раз, ждать ждали, но не так быстро. У меня мой OpenClaw на 5.3 сидит, буду апгрейдить, но он мне пока прогу допиливает. Вообще, впечатления и от GPT-5.3, и от OpenClaw самые положительные, скорее бы выпускали тариф на 100 баксов, пошел бы брать.,
Народ строит ВПН для нейронок - смысл в том, чтобы поставить между вами и нейронками слой, который делает запрос анонимным и не позволяет по нему вас идентифицировать. Стоит только пожелать удачи такому проекту
❤1
Проблемам тем, что Клоду постоянно нужно одобрять действия есть, тот же Codex в разы меньше разрешений при программировании запрашивает, чем Claude code. Я ее в целом решил настройкой запросов в settings.json, но всегда лучше, когда есть системное решение
⚡️ Андрей Карпаты выложил минимальный репозиторий Autoresearch - систему, где AI сам проводит исследования.

Это упрощённая версия ядра обучения LLM из nanoGPT/nanochat:
весь код обучения помещается в один файл (~630 строк) и работает на одной GPU.

Как это устроено:

- человек редактирует prompt (.md)
- AI-агент автоматически меняет training code (.py)

Дальше начинается цикл автономных экспериментов.

Каждая точка на графике — полный запуск обучения LLM (~5 минут).

AI-агент работает в бесконечном цикле:

- создаёт git-ветку
- меняет архитектуру модели
- подбирает optimizer
- оптимизирует гиперпараметры
- запускает обучение
- коммитит улучшения

Если validation loss становится ниже, изменение сохраняется.

Фактически агент сам оптимизирует собственный код обучения и постепенно улучшает модель.

Можно запускать несколько агентов с разными промптами и сравнивать, кто быстрее двигает исследование.

Карпаты шутит, что раньше AI-исследования делали люди между:

- едой
- сном
- митингами

Теперь же исследования могут выполнять рои автономных AI-агентов, которые бесконечно гоняют эксперименты на кластерах.

GitHub: github.com/karpathy/autoresearch

🎯Полезные Мл-ресурсы 🚀 Max

@data_analysis_ml
Эндрю Нг (профессор Станфорда, который радует нас бесконечным количеством обучающих материалов по ИИ) сделал репозиторий для агентов, чтобы они подхватывали актуальные API и документацию. Еще один маленький шажок в сторону ненавязчивой тотальной автоматизации
Глыба современного ИИстроения Андрей Карпаты продолжает эксперименты - сначала написал nanochat - минимальную GPT, которая обучается до уровня GPT-2. Теперь сделал среду, в которой агент учится совершениюствовать модель и обучение. Сейчас рекордное время обучение сети до состояния GPT-2 составило 1,8 часа. Воистину, возможности думающего человека безграничны
Немного не по теме, но не могу не поделиться - лучший репозиторий прошлой недели. Хотите видеть сквозь стены?

RuView — это open-source edge AI система, которая «видит» людей через стены, используя только WiFi-сигналы. Без камер, без носимых устройств, без интернета.
Суть технологии:
WiFi-роутер заполняет комнату радиоволнами. Когда человек двигается (или даже дышит), волны рассеиваются по-другому. RuView анализирует эти изменения через CSI (Channel State Information) — поканальные данные об амплитуде и фазе сигнала — и восстанавливает позу тела, частоту дыхания и пульс в реальном времени.
Что умеет:
Оценка позы — 17 точек тела (как COCO keypoints) из WiFi-сигнала, 54K fps на Rust
Витальные показатели — дыхание (6–30 вдохов/мин), пульс (40–120 уд/мин) бесконтактно
Сквозь стены — WiFi проходит через стены, мебель, завалы (до 5 м)
Многопользовательское отслеживание — несколько человек одновременно, без путаницы ID
Самообучение — модель учится на сырых WiFi-данных без камер и разметки (ADR-024)
Железо:
Основной вариант — mesh из 3–6 ESP32-S3 (~$8–54 за комплект) + обычный WiFi-роутер
Альтернатива — Intel 5300 / Atheros AR9580 (исследовательские NIC)
Без CSI-оборудования — только грубое определение присутствия по RSSI
Стек:
Основной runtime — Rust (810x быстрее Python-версии), 15 crate'ов на crates.io
65 edge-модулей (WASM, no_std Rust, 5–30 KB каждый) — от апноэ сна до детекции дождя
Docker-образы для быстрого старта: docker run -p 3000:3000 ruvnet/wifi-densepose:latest
Прошивка ESP32 на C (CSI collector + TDM mesh протокол)
Web UI — Three.js визуализация в реальном времени
Применения: уход за пожилыми (падения, дыхание ночью), больничный мониторинг, ритейл (поток/очереди без камер), умный дом (присутствие через стены), спасательные операции (поиск выживших в завалах), промышленная безопасность, робототехника.
Статус: 32.9K звёзд, 274 коммита, 1300+ тестов, MIT-лицензия. Проект основан на академической работе Carnegie Mellon DensePose From WiFi и расширен до практической edge-системы.
По сути, это превращение обычного WiFi в «рентген для движения» — приватно (нет видео), дёшево (ESP32 за копейки) и автономно (без облака).
⚡️ Alibaba Tongyi Lab открыла исходники GUI-Owl-1.5 и Mobile-Agent-v3.5 - семейства моделей-агентов, которые умеют напрямую управлять интерфейсами: desktop, мобильными приложениями и браузером.

Все модели построены на базе Qwen3-VL и обучены в одной парадигме для работы с GUI.

Доступно 6 размеров моделей:

• 2B / 4B / 8B / 32B Instruct — быстрые модели с низкой задержкой (без Chain-of-Thought)
• 8B / 32B Thinking — более сильное планирование и reasoning

По бенчмаркам это open-source SOTA на более чем 20 тестах GUI-агентов:

• OSWorld-Verified — 56.5 (32B-Instruct)
• AndroidWorld — 71.6 (8B-Thinking)
• VisualWebArena — 46.6
• WebArena — 48.4 (32B-Thinking)
• ScreenSpot-Pro — 80.3 с двухэтапным crop refine
• OSWorld-MCP — 47.6
• MobileWorld — 46.8

Архитектура обучения строится на трех ключевых идеях:

• Hybrid Data Flywheel — комбинация симуляций и cloud sandbox для генерации GUI-траекторий с проверкой чекпоинтов
• Unified CoT Synthesis — world modeling, knowledge injection и tool/MCP reasoning встроены в каждый шаг
• MRPO — multi-platform reinforcement learning с online rollout buffer и защитой от outcome collapse

Фактически это еще один шаг к полностью автономным AI-агентам, которые могут работать с интерфейсами так же, как человек.

Models: modelscope.cn/models/iic/GUI-Owl-1.5-8B-Instruct

GitHub: github.com/X-PLUG/MobileAgent

🎯Полезные Мл-ресурсы 🚀 Max

@machinelearning_interview
Gemini начали разворачивать в Chrome - сейчас это вторая нейросетка по популярности, и, видимо, доля ее будет расти и дальше
Было ли у вас такое, что пока Claude code работает, хочется задать ему вопрос по ходу? Так вот, теперь вы можете - /btw и пишите вопрос. Клод будет продолжать работать и говорить с вами одновременно.
🔥2
🏴‍☠️ Google представила Gemini Embedding 2 - свою первую полностью мультимодальную модель эмбеддингов, которая отображает текст, изображения, видео, аудио и документы в единое общее векторное пространство.

Модель поддерживает 100+ языков, текстовые входы до 8192 токенов, до 6 изображений в одном запросе, видео до 120 секунд, нативные аудио-эмбеддинги и PDF-файлы до 6 страниц. Это позволяет упростить пайплайны для задач вроде RAG, семантического поиска, кластеризации и анализа тональности.

Благодаря технологии Matryoshka Representation Learning, которая позволяет гибко менять размер векторов (3072 → 1536 → 768), разработчики могут балансировать между качеством модели и затратами на хранение, сохраняя при этом передовое мультимодальное понимание данных.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-embedding-2/

🎯Полезные Мл-ресурсы 🚀 Max

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Я уже писал, что установил себе супермодного нынче агента - OpenClaw. Живет у меня в отдельной квартире в отдельном контейнере комфортабельного мак мини.

Посадил его на подписку ChatGPT-5.4, одна из топ моделей на сегодня, вроде должен быть неглупым.

Оно прикольно, с одной стороны, подключился к телеграмму, общается с тобой, весь такой самостоятельный, типа - все сделаю сам.

Но есть одна проблема. Он врет. Ну просто постоянно воет. У меня в Claude code есть отдельный агент, который смотрит за тем, что делает OpenClaw, поэтому знаю из достоверных источников.

Типичный диалог:
- подключи Gemini через acpx;
- да, сейчас, все будет, минут 10;
- подключился?
- да, но соединение не стабильное, надо не через CLI, а сделать обертку. Сделаю, прогоню smoke-тесты?
- делай;

Ну и дальше в таком же духе - еще 15 минут, какая-то авторизация нужна, что-то на серваке не работает. Спрашиваю Клода - что он там делает?

А он ДАЖЕ НЕ НАЧИНАЛ.

Просто чатится со мной и кормит обещаниями. Очень по-человечески. И так из раза в раз. Просто жесть.

Теперь помимо модного слова Claw изучаю еще одно модное слово - Harness
😁6
Два слова о том, почему после всех этих фокусов я все-таки продолжаю с ним заморачиваться.

Во-первых, он воспринимается очень естественно. Пишет в телеграмм как помощник, оборудован памятью (еще предстоит посмотреть, как она работает), может и в вотсапе писать (это мало кто умеет) - т.е. хороший канал связи и много инструментов.

Во-вторых, это очень удобный оркестратор - ты закинул ему задачку, он сам разбил ее на подзадачи, ушел в луп разработки, загрузил другие модели - и выдал результат. Так в теории должно работать.

У него очень классные внутренние промпты. Подключаю к нему сейчас по acpx claude code, codex, gemini - должны работать по подпискам. Т.е. Claw должен задачку грузить агенту, например, в кодексе, и проверять результат разработки. Подписок у меня достаточно, а здесь - возможность их использовать на максимум.

Поэтому работаю над harness - пытаюсь дать инструменты и заставить делать то, что от него прошу. Если получится, буду просто в телеграмме давать команду и там же получать ответ, и цель кажется достижимой и очень привлекательной.

В общем, пытаюсь сделать из двоечника отличника. Как-то так
🔥1