very vibe coding
120 subscribers
462 photos
126 videos
13 files
986 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Forwarded from Сиолошная
Маленькое обновление по свежему бенчмарку ProgramBench (писал о нем неделю назад тут). Авторы соизволили прогнать GPT 5.5 на high/xhigh (максимальная длина рассуждений и время работы). И Opus 4.7 до кучи тоже. Процитирую авторов: «GPT 5.5 xhigh значительно превосходит Claude Opus 4.7 xhigh по всем параметрам» 😏

Во-первых, появилась первая полностью решённая задача (из 200). Оба запуска GPT-5.5 решили её, при этом на двух разных языках, Python и C.

Во-вторых, если брать не полностью решённые задачи, а те, где проходит 95% тестов (то есть выполнена почти вся функциональность), то разрыв ещё больше: GPT-5.5 xhigh может написать с нуля 13.5% программ, GPT 5.5 high 5%, Opus 4.7 xhigh 4.5%. Я не ожидал такой разницы.

На второй картинке график доли задач, в которых проходит заданный процент тестов. Видно, как фронтир GPT-5.5 xhigh гораздо правее и выше, чем других моделей — то есть в целом модель закрывает сильно больше фичей в задачах.

К сожалению, авторы так и не прогнали модели в Codex / Claude Code, не говоря уже про какой-то минимальный цикл работы до конца (аналог `/goal`), и я всё ещё ожидаю, что это повысит качество ещё больше.

Что это значит для нас? Ждём к концу года агентов, которые будут выплёвывать по 100к строк кода на ваш промпт, и даже работать будет (на 95% 😂)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Dealer.AI
Мозг,мыши и путь к сыру AGI✌️👋

Вышла интересная статья в Nature Communications, которая описывает, как в процессе развития мозг мышей меняет архитектуру нейронных связей: от локальной, плотной и случайной к распределённой, разреженной и структурированной.
По сути, мозг переходит от жёсткой и энергозатратной сети к более гибкой и эффективной.

Проведем параллели между этим биологическим процессом и обучением LLM.
Можно выделить несколько основных направлений:

🧠 Этапы развития в жизни, как путь от переобучения к обобщению в LLM.

В статьей рассказано, что в раннем возрасте у мышей связи между нейронами гиппокампа были локальными, плотными и случайными. При этом сила отдельных синапсов была настолько высокой, что одного события было достаточно для активации нейрона. Это напоминает состояние переобучения у нейросетей: модель буквально запоминает каждый факт и не умеет видеть общие закономерности. Даже к 18–25 дням связи всё ещё были случайными и сильными, но сеть уже начинала реорганизовываться, подготовливая почву для следующего этапа.

У взрослых особей архитектура кардинально меняется: плотность связей снижается, они становятся разреженными и структурированными, обеспечивая надёжное и точное хранение информации. Синапсы слабеют, и для активации нейрона требуется суммация сигналов от нескольких входов.

Тут возникает аналогия с LLM. В процессе обобщения модель учится выявлять закономерности и абстрагироваться от конкретных примеров, что позволяет ей гибко реагировать на новые данные, а не просто вспоминать заученное. Снижение силы отдельных связей можно сравнить с регуляризацией, которая предотвращает запоминание шума и улучшает способность модели к обобщению.

🎯 Память, точность и контроль галлюцинаций в LLM

Разреженная, структурированная сеть взрослого гиппокампа идеально подходит для хранения множества различных воспоминаний без взаимных помех (низкая интерференция). Случайная, плотная сеть ребёнка, напротив, была бы плохим хранилищем, так как новые данные быстро перезаписывали бы старые.

Это может стать аналогией с проблемой катастрофического забывания, которая стоит перед LLM при дообучении на новых данных. Кроме того, разреженная архитектура снижает риск создания ложных ассоциаций - аналог галлюцинаций LLM, когда модель генерирует правдоподобную, но неверную информацию. Для LLM это означает, что более структурированное и разреженное внутреннее представление знаний потенциально может сделать её более надёжной и точной.

⚡️ Экономия ресурсов мышления и вычислений

Переход к разреженной сети значительно энергоэффективнее, тк активируется лишь малая часть нейронов, необходимая для обработки конкретного сигнала. Это критически важно для биологического мозга, работающего в условиях ограниченных ресурсов.

Для LLM мы наблюдаем то же самое. Вспомним разреженные вычисления, такие как MoE, sparse attention и тп. В таких моделях для каждого запроса активируется только небольшая часть экспертов, что позволяет достигать высокой производительности с меньшими вычислительными затратами, чем у плотных моделей аналогичного размера. Однако, мы храним все веса модели в памяти gpu. Но давайте будем честны, мы и весь вес мозга носим на себе, хотя активируем отдельные области 🧠

Ну а что делать-то? 🙄
Как мы видим по статье, что для мышей, что для LLM - путь к эффективности общая стратегия.

Природа за миллионы лет эволюции пришла к разреженности не потому, что лень, а потому что плотная сеть не масштабируется 😱

LLM на 100B параметров в плотном виде — это мышь на P8: шумная, жадная до энергии и неспособная к сложной ассоциативной памяти.

Разреженность - не фича, а база. Получается, что LLM должна эволюционировать от плотной детской фазы к структурированной взрослой.

Правда, эволюция сделала это без градиентного спуска и H100 👍 А сможете ли Вы? 🤔
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Разработчик БПЛА (Anry Guruerez)
robot-lawnmower.gif
1.7 MB
Хакер дистанционно захватил робота-газонокосилку и сымитировал наезд на живого человека

«Белый хакер» Андреас Макрис обнаружил серьёзный бэкдор в софте садовых роботов компании Yarbo, которые могут работать как газонокосилки, снегоуборщики, воздуходувки, триммеры и кромкорезы. Проблема была в том, что если получить доступ к одному роботу, то можно добраться до управления всеми остальными.

В ходе демонстрации он показал карту с более чем 11000 устройств по всему миру, после чего Макрис подключился к одному из роботов в штате Нью-Йорк, смог управлять его камерой и движением. Кроме этого робот может передавать точные GPS-координаты, изображение с камер, адреса электронной почты владельцев и даже пароли от Wi-Fi.

Журналист The Verge Шон Холлистер проверил эти данные на практике: по координатам он нашёл реальные дома владельцев Yarbo, а один из них подтвердил, что показанные исследователем пароли от Wi-Fi действительно принадлежат ему. Во время ещё одной демонстрации Макрис, находясь в Германии, устроил наезд газонокосильщика на Холлистера.

Ситуация интересна ещё и тем, что найденный хакером бэкдор мог быть специально оставлен разработчиками. Его суть состояла в том, что у роботов Yarbo был один и тот же root-пароль, но даже его изменение не защитит владельцев, потому что после каждого обновления прошивки пароль сбрасывается к изначальному значению, выставленному разработчиками. Компания объясняла это заботой о пользователях: якобы это нужно техподдержке для удаленной диагностики. Но после демонстрации «наезда» на журналиста Yarbo пообещала исправить уязвимость.

Это не первый случай дистанционного захвата роботов. В феврале текущего года инженер Сэмми Аздуфаль, решив ради шутки подключить робопылесос DJI Romo к геймпаду PS5, случайно захватил контроль над 7000 устройствами в 24 странах. Благодаря слабому API и помощи ИИ-ассистента, он получил доступ к видеопотокам, микрофонам и картам квартир тысяч незнакомых людей. Компания также пообещала устранить проблему.
С одной стороны неплохо, что Антропик выделяет кредиты, с другой - в апреле наблюдал как мой кредит в 100 баксов просто тает за минуты по апишным ценам. Мне кажется, по подписке за 20 баксов токенов больше давали..

https://t.me/data_analysis_ml/5123
О, игрушка для любителей пофилософствовать с нейронками

https://x.com/nosilverv/status/2054547741645099068/video/1?s=46
Прикрутил тут на днях к моему OpenClaw покупку продуктов из ВкусВилла. Теперь можно голосом надиктовать ему что нужно, и он соберет корзину. Классно, к OpenClaw вопросов нет.

К ВкусВиллу - есть. Корзину я собираю по апи не для конкретного магазина, а в целом. В итоге, когда перехожу на оплату, мне надо вбивать адрес доставки, выбирать магазин и пр. - почему бы не прикрутить в апи сразу возможность собирать продукты в конкретном магазине. А так, получилось, что из набранной корзины в магазине есть только половина, да и при каждой покупке заново вбивать адрес доставки - дикость.

Но ВкусВилл в любом случае молодцы, так как в других магазинах возможности покупать продукты с агентами нет в принципе. Пока.

Есть возможность разве что делать это через браузер, без апи - попробую, насколько это в принципе работает. Если будет разумно по времени и качеству, можно будет выкатить универсальное решение.

А вообще - суперудобно. Раньше ходили в магазин, потом стали заказывать доставку, а теперь просто говоришь телефону - мне полтора кило зеленых яблок и литр кефира (агент, конечно, обратит внимание, что в литре кефира всего 0,923 мл, но ок) - и все, готово. Хотите такого агента?
Кстати, на удивление, с OpenClaw как-то более живо получается общаться, чем просто с Codex, несмотря на то, что под капотом одна и та же модель. Пользовательский опыт, что называется, лучше.

К тому же с ним выяснил, что программка, с которой сейчас вожусь (речь про Plane), к нему прикручена уже в базе. +100 в карму. А дальше обнаружил, что он в ней уже сидит с админскими доступами у меня в проектах - как-то не помню, чтобы его подключал, работал только через Codex..

В общем, чувствуется, больше буду "щелкать клешнями" с OpenClaw в ближайшие дни. Посмотрим, как пойдет. А про Plane расскажу немного позже, если из этого что-то получится
👍1
Mac mini, похоже, подорожает на 200 баксов… диск будет побольше - на 512, но это слабое утешение. Дефицит памяти никуда не делся..
Философский четверг.

Одна из важнейших частей концепции One Man Enterprise — иметь надежный и качественный мастер-майнд.

Очевидно, что средний человек (архитектор / оператор OME) не может вместить глубокие знания из различных областей, но он может автоматизировать получение и дистилляцию этих знаний для извлечения важных инсайтов по нужным темам.

Вчера я был на небольшой встрече внутреннего «книжного клуба», где в очередной раз обсуждали философию Naval Ravikant.

Для тех, кто еще не проникся, напомню, что Naval, на мой взгляд, это один из достойнейших мыслителей нашего поколения, который с потрясающей способностью Ричарда Фейнмана умеет выделять сигнал из шума и преобразовывать сложные философские конструкции в очень простые практические выводы.

Вот здесь лежит книга, которую рекомендую всем и каждому, а вот тут подкаст с Джо Роганом, который также рекомендую посмотреть на выходных.

Хочу пойти немного дальше и вспомнить еще одного замечательного человека, Наполеона Хилла, автора книги *Думай и богатей* 1937 года выпуска (тоже рекомендую прочитать).

Так вот, в своей книге он написал концепцию «невидимых советников», это был его некий воображаемый мастер-майнд, который он создал сам для себя.

В своем воображении он представлял выдающихся исторических личностей, каждая из которых была наделена определенной ролью. Среди них были Эмерсон, Наполеон Бонапарт, Дарвин, Линкольн, Эдисон, Карнеги и Форд.

Когда перед Наполеоном Хилом возникал вопрос, на который он не мог найти ответ самостоятельно, он воображал, что задает этот вопрос внутри своего мастер-майнда и просил воображаемого участника поделиться решением.

Fast forward to 2026…

Сегодня можно делать то же самое автоматически с использованием несложных инструментов, которые есть «на кухне у каждой хозяйки».

1. Выбираем участников нашего собственного клуба CEO, советы которых нам нужны.

2. Находим материалы, которымы могут быть книги, подкасты и любые значимые оригинальные работы этих участников.

3. Загружаем коллекцию материалов каждого из участников в NotebookLM или в любую систему, которая способна каталогизировать и структурировать знания для последующего извлечения. LightRAG, RAG-Anythig, Trustgraph.

4. Создаем pipeline извлечения знаний из источника.

5. Собираем несложную агентную систему, где каждый из агентов будет имперсонирован соответствующим участником и иметь доступ к собственной базе знаний.

6. При необходимости подключаем участников к диалогу в виде саб-агентов. Либо создаем коллективные сессии в TMUX, чтобы они могли общаться друг с другом и приходить к более сложным выводам, участвуя в общем обсуждении.

Я рекомендую серьезно задуматься над созданием подобных продуктов для тех, кто интересуется концепцией OME.

Напоследок: есть совершенно чумовое расширение для Chrome под названием **Grabbit**, оно позволяет массово копировать ссылки со страниц.

Есть дешевый и простой способ работы с каналами в YouTube для описанных выше сценариев.

1. Открываем видео из канала и выделяем все видео, которые нас интересуют, копируя ссылки в буфер обмена при помощи Grabbit. Так, например, можно скопировать все видео какого-нибудь автора за последний год: 50 или 100 штук.

2. Идем в NotebookLM и вставляем все ссылки из буфера обмена в новый проект.

3. После анализа у нас появляется возможность задавать вопросы автору канала через стройные инструменты NotebookLM. Ну и вообще, крутить эту информацию в любую сторону.

4. Ну, а дальше подключаем NotebookLM через MCP к нужному проекту, и вот у нас появились дистиллированные знания автора канала за нужное нам время по нужной нам теме.

Профит!

Happy Thursday, @aiwizards
Forwarded from дядя_д
This media is not supported in your browser
VIEW IN TELEGRAM
🥸 Вышла режиссерская версия Игры Престолов. Парень пофиксил все промахи сценаристов. Спасибо ему.

дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Делал тут сегодня исследовательскую задачку с кодексом и дошел почти до белого каления. Переключился на Клода - на соннет - ничего, норм. Дальше уже сел на привычный опус и в режиме жесткой экономии конеткста стал разбирать вопрос.

В общем, если тщательно экономить, можно и за 20 баксов получать вменяемый результат от опуса, но эта экономия, конечно убивает - к чему привык на большом тарифе, можно спрашивать что угодно, и не париться, кто и как тебе отвечает.

И, все-таки, для таких задач Кодекс туповат - программирует он хорошо, а вот смутные томления людей разбирает плохо. Антропик в этом преуспел гораздо лучше.

Пробую дипсик с Гермесом - но тоже надежды особой не питаю. Ощущения, конечно, на фоне Клода - так себе. Выглядит все так, что постановку задачи надо разбирать с Клодом, а всю работу - поручать другим.
👍1🔥1
Любите ли вы Офис так, как люблю его я?

https://x.com/mom_agency_/status/2054909371071582501/video/1?s=46
Сегодня все внимание соцсетей - на запуске мобильного приложения Codex. Но у нас оно не работает, да и кайфа в программировании с телефона, прямо скажем, маловато. Но в целом стремление иметь общую среду на всех устройствах - похвальное, так все и должно работать. В этом плане удивительно, что сессии в терминале и сессии в приложении никак не видят друг друга, ни у Клода, ни у Кодекса
Claude code постоянно обновляется, и работать с ним удобнее, чем с Codex. Как минимум, таблички нормально отрисовываются в диалоге - не понимаю, почему OpenAI с этим справить не может. А еще появилась опция отражать внизу диалога тех субагентов, которые работают - очень удобно и полезно для понимания процесса. На шаг впереди идут Антропики
🔥2
В ближайшие дни нас могут ждать большие новости о создании новой архитектуры сетей от компании с говорящим названием SubQ - обещают, что будет решена проблема квадратичного роста компьюта при увеличении контекста. Все больше свидетельств, что это не фейк, а реальный прорыв

https://subq.ai/introducing-subq
🎉1
This media is not supported in your browser
VIEW IN TELEGRAM
Mythos обошёл защиту, в которую Apple вложила 5 лет и миллиарды

Три исследователя использовали Anthropic Mythos, чтобы собрать рабочий exploit для macOS kernel. По их словам, он обходит Apple M5 Memory Integrity Enforcement - систему защиты, которую Apple строила годами и продвигала как один из главных барьеров против memory corruption атак.

Таймлайн выглядит жёстко:

- 25 апреля нашли баг
- 1 мая уже был рабочий exploit
- отчёт понесли лично в Apple Park

MIE была флагманской security-фичей для M5 и A19. Apple описывала её как защиту, которая должна резко усложнить целый класс атак на память. По их же исследованиям, MIE ломала все известные публичные exploit chains против современных iOS-устройств.

Исследователи не «сломали» MIE напрямую. Они её обошли. По описанию, атака была data-only: без манипуляций с указателями, через стандартные syscalls, от обычного непривилегированного пользователя до root.

Проблема уже не только в том, что уязвимости всё ещё находятся. Проблема в том, что frontier-модели начинают ускорять самую сложную часть offensive security: связывать баги, проверять гипотезы, искать обходные маршруты и собирать рабочую цепочку быстрее, чем это делала бы обычная команда вручную.

55-страничный технический отчёт обещают выпустить после патча Apple.

Если всё подтвердится, это одна из самых важных cybersecurity-историй года.

https://blog.calif.io/p/first-public-kernel-memory-corruption
🔥1
У меня сейчас в качестве пвмяти используется claude-mem - штука хорошая, работает, но на рынке появляются все более продвинутые продукты. Поставил себе попробовать agentmemory - работает со всеми агентами, на всех моих компьютерах, есть графовая база, рефлексия на полученный опыт. Посмотрим, как будет работать. Это есь и в том же Гермесе, но пока ланирую сидеть на Codex + Claude-code, так что отдельня память не помешает.
Из нового - что еще себе поставил. Во-первых, CodexBar - это проект, который делает создатель OpenClaw. Учитывая, что его команда палит на токены в OpenAI 1,3 млн баксов в месяц, а результаты - ложатся в опенсорс, продукты качественные. По смыслу - это простая иконка сверху, при клике на которую показываются лимиты Codex, Claude, Gemini. То, что нужно, когда сидишь на этих лимитах - Клода я использую активно, а при лимите в 20 баксов приходится за расходом токенов следить. Выглядит отлично, рекомендую.

Как мне эта панелька говорит, за сегодня, если считать токены по апи, а не по подписке, за вечер я сжег их на 130 баксов. А за месяц - на 3 тысячи. Люди, не пользуйтесь нейронками по апи. Разве что deepseek - он дешевый и унего других вариантов нет.
Вторая история - поставил себе бесплатный внешний поиск для агентов TinyFish. Писал о нем раньше. Дает агентам более чистый результат, особенно, когда много страниц надо лопатить. Экономит токены - поработаю, расскажу подбробнее о впечатлениях.
Теперь, когда надо разобраться в новой программке, статье, посте, я всегда бросаю ссылку в телеграмме OpenClaw, и он мне кратко описывает, что это и дает рекомендации. Очень к этому привык.

С утречка получил он него положительную рецензию на еще одну программку ClawPatch - буду ставить. Это тоже от создателя OpenClaw, так что положительный ответ меня не удивляет )