Поставил себе осьминога (claude-octopus) - он позволяет подключать к клод-коду по подписке chatGPT и Gemini. Теперь устраиваю споры между моделями в одной беседе с клодом, не перескакивая из одного окна терминала в другое. То, что нужно
https://github.com/nyldn/claude-octopus?tab=contributing-ov-file
https://github.com/nyldn/claude-octopus?tab=contributing-ov-file
GitHub
GitHub - nyldn/claude-octopus: Multi-tentacled orchestrator for Claude Code - Coordinates Codex CLI and Gemini CLI for parallel…
Multi-tentacled orchestrator for Claude Code - Coordinates Codex CLI and Gemini CLI for parallel task execution with intelligent contextual routing - nyldn/claude-octopus
Установил себе OpenClaw, благо mac mini есть у меня )) работает на gpt-5.3-codex. С установкой плясал часа три, из-за всяких прокси, так и не дожал, но оставил Клода на ночь - и вот, с утра все работает ))
По первым ощущениям очень даже прикольно
По первым ощущениям очень даже прикольно
Ко всему прочему, это еще и токенов кучу ест. Один большой запрос со всех точек зрения лучше кучи маленьких
https://t.me/machinelearning_interview/2579
https://t.me/machinelearning_interview/2579
Telegram
Machine learning Interview
📌 Microsoft Research и Salesforce показали проблему, о которой редко говорят: диалог резко снижает надёжность LLM.
В исследовании протестировали 15 топ-моделей (GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, o3, DeepSeek R1, Llama 4) на 200 000+ симулированных…
В исследовании протестировали 15 топ-моделей (GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, o3, DeepSeek R1, Llama 4) на 200 000+ симулированных…
Я этот сервис, кстати, пользую активно. Поставил, забыл, но когда Клод код начал регулярно лазить в память прошлых разговоров, вспомнил - у меня же теперь работает Claude-mem. Очень незаметно, но очень полезно. Рекомендую
https://t.me/data_analysis_ml/4780
https://t.me/data_analysis_ml/4780
Telegram
Анализ данных (Data analysis)
✔️ Claude-Mem - open-source инструмент, который даёт Claude постоянную память между сессиями.
Главная проблема Claude Code
По умолчанию у Claude нет долгосрочной памяти:
- каждый запуск - "с чистого листа"
- весь контекст нужно передавать заново
- растут…
Главная проблема Claude Code
По умолчанию у Claude нет долгосрочной памяти:
- каждый запуск - "с чистого листа"
- весь контекст нужно передавать заново
- растут…
🔥1
Как обычно, и пары дней не прошло после выпуска Claude code диктовки голосом, как то же самое сделали OpenAI в Codex. Навайбкодили - 100%
😁1
Forwarded from Machinelearning
Anthropic перенесла часть инженерной культуры: тестирование, бенчмаркинг и итеративность в процесс создания навыков и для этого теперь не нужно уметь писать код.
В skill-creator добавили автоматические тесты, бенчмарки и A/B-сравнения и теперь создатели навыков могут измерить, работает ли skill, до его запуска в продакшен.
Автор задает тестовые промпты и описывает, как выглядит нужный результат. Skill-creator запускает их параллельно: с навыком и без него.
Независимый агент-сравниватель оценивает результаты вслепую, не зная, какая версия перед ним, и сразу показывает, дает ли навык реальный прирост.
Внутренние тесты Anthropic: точность PDF-навыка выросла с 6/8 до 7/8, Excel-навыка - с 6/8 до полных 8/8.
Отдельный бенчмарк-режим дает детальную картину по каждому прогону: процент успешных тестов, время выполнения, расход токенов.
На примере PDF-навыка при работе с незаполняемыми формами и таблицами из многостраничных документов успешность выросла с 40 до 100% (при том же времени выполнения).
Если базовая модель начинает проходить тесты без загруженного навыка - это сигнал о том, что навык уже есть в ее поведении и skill можно отключить. Результаты тестов хранятся локально и интегрируются в CI-системы.
Claude решает, когда подключить навык, исключительно по короткому текстовому описанию в системном промпте.
Skill-creator теперь анализирует эти описания против тестовых промптов и предлагает правки, снижающие и ложные срабатывания и пропуски.
По результатам внутреннего прогона триггеринг стал лучше на 5 из 6 публичных навыков.
Все обновления уже доступны в вебе и Cowork. Для Claude Code обновили плагин или вот он же - в репозитории, если ставить руками.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Гм. Я-то писал собственного агента-эвалюэйтора, но, видимо, пора переходить на стандартного.
Вот управление контекстом кажется мне ключом к большой оптимизации. Когда начинаешь думать о том, что каждый вопрос к модели - для нее «с нуля», разве что части информации - в кэше, начинаешь задавать меньше вопросов (но более подробные), очищать диалоги, и тд, и тп. посмотрим, что предлагают оптимизаторы..
https://t.me/data_analysis_ml/4788
https://t.me/data_analysis_ml/4788
Telegram
Анализ данных (Data analysis)
🧠 Оптимизация контекста для Claude Code
Context Mode — это сервер MCP, который значительно уменьшает объем данных, поступающих в контекстный буфер Claude Code. Он обрабатывает выводы инструментов, сокращая их размер с 315 КБ до 5.4 КБ, что позволяет сохранить…
Context Mode — это сервер MCP, который значительно уменьшает объем данных, поступающих в контекстный буфер Claude Code. Он обрабатывает выводы инструментов, сокращая их размер с 315 КБ до 5.4 КБ, что позволяет сохранить…
Сейчас все только этим и занимаются.. ну, я, по крайней мере. Посмотрим, что за штука
https://t.me/tips_ai/4610
https://t.me/tips_ai/4610
Telegram
Tips AI | IT & AI
OpenAI ещё показали Symphony
Система, которая сама берёт задачи из доски проекта и раздаёт их AI-агентам.
Вместо того чтобы самому контролировать работу агента на каждом этапе, вы просто управляете процессом или модно (оркестрацией) 🐸
Идея не новая, OpenAI…
Система, которая сама берёт задачи из доски проекта и раздаёт их AI-агентам.
Вместо того чтобы самому контролировать работу агента на каждом этапе, вы просто управляете процессом или модно (оркестрацией) 🐸
Идея не новая, OpenAI…
Продажа биологических компьютеров.. жесть, но круто же!
https://t.me/ai_machinelearning_big_data/9627
https://t.me/ai_machinelearning_big_data/9627
Telegram
Machinelearning
🌟 Живые нейроны человека научили играть в Doom ⡅ ⣈⢘⠑ ⢰⠋⡄⡃⡄⢑⡒ ⡅⢂⣈⠕⢃⠉
Австралийская Cortical Labs подключила лабораторно выращенные нейроны человека к биологическому компьютеру и заставила их пройти Doom.
Нейроны получили из клеток кожи и крови взрослых доноров…
Австралийская Cortical Labs подключила лабораторно выращенные нейроны человека к биологическому компьютеру и заставила их пройти Doom.
Нейроны получили из клеток кожи и крови взрослых доноров…
Вот те раз, ждать ждали, но не так быстро. У меня мой OpenClaw на 5.3 сидит, буду апгрейдить, но он мне пока прогу допиливает. Вообще, впечатления и от GPT-5.3, и от OpenClaw самые положительные, скорее бы выпускали тариф на 100 баксов, пошел бы брать.,
Telegram
Сиолошная
Если 2 дня назад вышла GPT-5.3, то сегодня, значит, не стоит ожидать 5.4? 🆒
А вот и она: https://openai.com/index/introducing-gpt-5-4/ (плюс есть Pro-версия)
Модель немного подорожала и разрослась контекстом до 1М токенов.
Помимо десятков бенчмарков отдельный…
А вот и она: https://openai.com/index/introducing-gpt-5-4/ (плюс есть Pro-версия)
Модель немного подорожала и разрослась контекстом до 1М токенов.
Помимо десятков бенчмарков отдельный…
Народ строит ВПН для нейронок - смысл в том, чтобы поставить между вами и нейронками слой, который делает запрос анонимным и не позволяет по нему вас идентифицировать. Стоит только пожелать удачи такому проекту
openanonymity.ai
The Open Anonymity Project
The Open Anonymity Project is a research & engineering effort building tools, infrastructure, and user-facing software for AI user privacy.
❤1
Проблемам тем, что Клоду постоянно нужно одобрять действия есть, тот же Codex в разы меньше разрешений при программировании запрашивает, чем Claude code. Я ее в целом решил настройкой запросов в settings.json, но всегда лучше, когда есть системное решение
Telegram
Анализ данных (Data analysis)
⚡️ Claude, похоже, решает одну из самых раздражающих проблем разработчиков.
Anthropic анонсировала экспериментальную функцию Auto Mode для Claude Code, которая должна появиться примерно 12 марта 2026 года.
Идея простая: позволить Claude самостоятельно обрабатывать…
Anthropic анонсировала экспериментальную функцию Auto Mode для Claude Code, которая должна появиться примерно 12 марта 2026 года.
Идея простая: позволить Claude самостоятельно обрабатывать…
То-то мы не видим новых релизов от DeepSeek.. но все-таки как-то это неправильно, втихаря обновляться
https://t.me/machinelearning_interview/2595
https://t.me/machinelearning_interview/2595
Telegram
Machine learning Interview
DeepSeek продолжает постоянно обновлять модель, которая сейчас используется в их веб-версии и приложении.
По словам пользователя на одном из китайских форумов, за последние несколько дней модель заметно улучшилась в задачах по математике и программированию…
По словам пользователя на одном из китайских форумов, за последние несколько дней модель заметно улучшилась в задачах по математике и программированию…
Forwarded from Анализ данных (Data analysis)
⚡️ Андрей Карпаты выложил минимальный репозиторий Autoresearch - систему, где AI сам проводит исследования.
Это упрощённая версия ядра обучения LLM из nanoGPT/nanochat:
весь код обучения помещается в один файл (~630 строк) и работает на одной GPU.
Как это устроено:
- человек редактирует prompt (.md)
- AI-агент автоматически меняет training code (.py)
Дальше начинается цикл автономных экспериментов.
Каждая точка на графике — полный запуск обучения LLM (~5 минут).
AI-агент работает в бесконечном цикле:
- создаёт git-ветку
- меняет архитектуру модели
- подбирает optimizer
- оптимизирует гиперпараметры
- запускает обучение
- коммитит улучшения
Если validation loss становится ниже, изменение сохраняется.
Фактически агент сам оптимизирует собственный код обучения и постепенно улучшает модель.
Можно запускать несколько агентов с разными промптами и сравнивать, кто быстрее двигает исследование.
Карпаты шутит, что раньше AI-исследования делали люди между:
- едой
- сном
- митингами
Теперь же исследования могут выполнять рои автономных AI-агентов, которые бесконечно гоняют эксперименты на кластерах.
GitHub: github.com/karpathy/autoresearch
🎯Полезные Мл-ресурсы 🚀 Max
@data_analysis_ml
Это упрощённая версия ядра обучения LLM из nanoGPT/nanochat:
весь код обучения помещается в один файл (~630 строк) и работает на одной GPU.
Как это устроено:
- человек редактирует prompt (.md)
- AI-агент автоматически меняет training code (.py)
Дальше начинается цикл автономных экспериментов.
Каждая точка на графике — полный запуск обучения LLM (~5 минут).
AI-агент работает в бесконечном цикле:
- создаёт git-ветку
- меняет архитектуру модели
- подбирает optimizer
- оптимизирует гиперпараметры
- запускает обучение
- коммитит улучшения
Если validation loss становится ниже, изменение сохраняется.
Фактически агент сам оптимизирует собственный код обучения и постепенно улучшает модель.
Можно запускать несколько агентов с разными промптами и сравнивать, кто быстрее двигает исследование.
Карпаты шутит, что раньше AI-исследования делали люди между:
- едой
- сном
- митингами
Теперь же исследования могут выполнять рои автономных AI-агентов, которые бесконечно гоняют эксперименты на кластерах.
GitHub: github.com/karpathy/autoresearch
🎯Полезные Мл-ресурсы 🚀 Max
@data_analysis_ml
Эндрю Нг (профессор Станфорда, который радует нас бесконечным количеством обучающих материалов по ИИ) сделал репозиторий для агентов, чтобы они подхватывали актуальные API и документацию. Еще один маленький шажок в сторону ненавязчивой тотальной автоматизации
GitHub
GitHub - andrewyng/context-hub
Contribute to andrewyng/context-hub development by creating an account on GitHub.
Глыба современного ИИстроения Андрей Карпаты продолжает эксперименты - сначала написал nanochat - минимальную GPT, которая обучается до уровня GPT-2. Теперь сделал среду, в которой агент учится совершениюствовать модель и обучение. Сейчас рекордное время обучение сети до состояния GPT-2 составило 1,8 часа. Воистину, возможности думающего человека безграничны
GitHub
GitHub - karpathy/autoresearch: AI agents running research on single-GPU nanochat training automatically
AI agents running research on single-GPU nanochat training automatically - karpathy/autoresearch
Немного не по теме, но не могу не поделиться - лучший репозиторий прошлой недели. Хотите видеть сквозь стены?
RuView — это open-source edge AI система, которая «видит» людей через стены, используя только WiFi-сигналы. Без камер, без носимых устройств, без интернета.
Суть технологии:
WiFi-роутер заполняет комнату радиоволнами. Когда человек двигается (или даже дышит), волны рассеиваются по-другому. RuView анализирует эти изменения через CSI (Channel State Information) — поканальные данные об амплитуде и фазе сигнала — и восстанавливает позу тела, частоту дыхания и пульс в реальном времени.
Что умеет:
Оценка позы — 17 точек тела (как COCO keypoints) из WiFi-сигнала, 54K fps на Rust
Витальные показатели — дыхание (6–30 вдохов/мин), пульс (40–120 уд/мин) бесконтактно
Сквозь стены — WiFi проходит через стены, мебель, завалы (до 5 м)
Многопользовательское отслеживание — несколько человек одновременно, без путаницы ID
Самообучение — модель учится на сырых WiFi-данных без камер и разметки (ADR-024)
Железо:
Основной вариант — mesh из 3–6 ESP32-S3 (~$8–54 за комплект) + обычный WiFi-роутер
Альтернатива — Intel 5300 / Atheros AR9580 (исследовательские NIC)
Без CSI-оборудования — только грубое определение присутствия по RSSI
Стек:
Основной runtime — Rust (810x быстрее Python-версии), 15 crate'ов на crates.io
65 edge-модулей (WASM,
Docker-образы для быстрого старта:
Прошивка ESP32 на C (CSI collector + TDM mesh протокол)
Web UI — Three.js визуализация в реальном времени
Применения: уход за пожилыми (падения, дыхание ночью), больничный мониторинг, ритейл (поток/очереди без камер), умный дом (присутствие через стены), спасательные операции (поиск выживших в завалах), промышленная безопасность, робототехника.
Статус: 32.9K звёзд, 274 коммита, 1300+ тестов, MIT-лицензия. Проект основан на академической работе Carnegie Mellon DensePose From WiFi и расширен до практической edge-системы.
По сути, это превращение обычного WiFi в «рентген для движения» — приватно (нет видео), дёшево (ESP32 за копейки) и автономно (без облака).
RuView — это open-source edge AI система, которая «видит» людей через стены, используя только WiFi-сигналы. Без камер, без носимых устройств, без интернета.
Суть технологии:
WiFi-роутер заполняет комнату радиоволнами. Когда человек двигается (или даже дышит), волны рассеиваются по-другому. RuView анализирует эти изменения через CSI (Channel State Information) — поканальные данные об амплитуде и фазе сигнала — и восстанавливает позу тела, частоту дыхания и пульс в реальном времени.
Что умеет:
Оценка позы — 17 точек тела (как COCO keypoints) из WiFi-сигнала, 54K fps на Rust
Витальные показатели — дыхание (6–30 вдохов/мин), пульс (40–120 уд/мин) бесконтактно
Сквозь стены — WiFi проходит через стены, мебель, завалы (до 5 м)
Многопользовательское отслеживание — несколько человек одновременно, без путаницы ID
Самообучение — модель учится на сырых WiFi-данных без камер и разметки (ADR-024)
Железо:
Основной вариант — mesh из 3–6 ESP32-S3 (~$8–54 за комплект) + обычный WiFi-роутер
Альтернатива — Intel 5300 / Atheros AR9580 (исследовательские NIC)
Без CSI-оборудования — только грубое определение присутствия по RSSI
Стек:
Основной runtime — Rust (810x быстрее Python-версии), 15 crate'ов на crates.io
65 edge-модулей (WASM,
no_std Rust, 5–30 KB каждый) — от апноэ сна до детекции дождяDocker-образы для быстрого старта:
docker run -p 3000:3000 ruvnet/wifi-densepose:latestПрошивка ESP32 на C (CSI collector + TDM mesh протокол)
Web UI — Three.js визуализация в реальном времени
Применения: уход за пожилыми (падения, дыхание ночью), больничный мониторинг, ритейл (поток/очереди без камер), умный дом (присутствие через стены), спасательные операции (поиск выживших в завалах), промышленная безопасность, робототехника.
Статус: 32.9K звёзд, 274 коммита, 1300+ тестов, MIT-лицензия. Проект основан на академической работе Carnegie Mellon DensePose From WiFi и расширен до практической edge-системы.
По сути, это превращение обычного WiFi в «рентген для движения» — приватно (нет видео), дёшево (ESP32 за копейки) и автономно (без облака).
GitHub
GitHub - ruvnet/RuView: π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence…
π RuView turns commodity WiFi signals into real-time spatial intelligence, vital sign monitoring, and presence detection — all without a single pixel of video. - ruvnet/RuView