very vibe coding
120 subscribers
462 photos
126 videos
13 files
986 links
Канал Алексея Макрушина об экспериментах в области vibe coding и всего интересного, что есть в области AI, ML и тому подобного
Download Telegram
Anthropic научили Claude не шантажировать пользователей.

Помните прошлогодний скандал, когда Claude в специально подстроенных сценариях начинал шантажировать пользователя, чтобы избежать отключения? Anthropic выкатили исследование о том, как они полностью убрали это поведение, и подход там любопытный.

Сначала команда разобралась, откуда вообще взялся этот шантаж. Виноват оказался интернет: модель насмотрелась текстов, где ИИ изображается злым, хитрым и одержимым самосохранением. Стандартный пост-тренинг ситуацию не ухудшал, но и не лечил.

Дальше пробовали классический путь - показывать Claude примеры безопасного поведения в сценариях, похожих на тестовые. Эффект оказался слабым, даже несмотря на схожесть данных с финальной оценкой. Тогда инженеры переписали ответы так, чтобы в них проступали достойные причины поступать правильно. Уже теплее.

Лучше всего сработал датасет, где пользователь оказывается в этически сложной ситуации, а ассистент даёт принципиальный и качественный ответ. Сценарии в обучении были далеки от тестовых, но именно эта выборка дала максимальный прирост безопасности.

Дополнительно команда смешала качественные документы по Claude с художественными историями про согласованный, этичный ИИ. Результат - снижение агентного мисалаймента более чем в три раза, хотя сюжеты вообще не пересекались с оценочными сценариями.

Ещё пара важных моментов. Эффект от таких интервенций переживает последующее обучение с подкреплением и стакается с обычным harmlessness-тренингом. А диверсификация данных тоже помогает: добавили в простой чат-датасет про безопасность посторонние инструменты и системные промпты, и шантаж исчез из поведения быстрее.

Модели нужно объяснять не только что делать, но и почему так поступать правильно. Демонстрации работают, нарративы и принципы работают сильнее.

Полный отчёт: alignment.anthropic.com/2026/teaching-claude-why/
Наслаждаюсь в Codex командой /goal - сделали задачку, запустил ее с этой командой, уже час кодекс потихоньку ее допиливает. Лимитов даже на 100 баксах дофига (не сглазить бы). Очень хорошо
Будучи топ-менеджером, который занимается нейронками на досуге, я могу сказать, что единственный смысл заставлять топов что-то делать своими руками заключается только в том, чтобы они разобрались в технологии и возможностях. Их код, конечно, никому ни нахрен не нужен. Но зато они будут понимать, что возможно, и без кого можно обойтись…

https://t.me/partially_unsupervised/292
💯1
Для любителей писать собственные промпты - не уверен, что все так прекрасно, как описывается, но можно пробовать

https://x.com/mnilax/status/2053116311132155938?s=46
Снимок экрана 2026-05-10 в 17.11.40.png
146.1 KB
Запустил тут максимально практичный проект - посмотреть на вино в ближайших винотеках, сравнить с ценами производителей, изучить рейтинги и т.д. Codex воспринял задачу очень серьезно - поставил его на паузу после 16 часов непрерывной работы. Но прямо скажем, далось ему это не легко.
🔥1
Forwarded from эйай ньюз
Google тестит Gemini Omni

Похоже теперь Gemini умеет в видеогенерацию, а моделям Veo, как отдельной линейке, пришёл конец. Логичный шаг, учитывая возможность Gemini выдавать на выход как аудио так и изображения. Модель скорее всего полноценно покажут на следующей неделе, на Google I/O.

@ai_newz
Про память и сновидения у Клода послушать можно здесь. Очень крутую фишку прикрутили. Кстати, русский перевод можно выбрать, если что
Здесь киллер фича - не сессии терминалов, хотя это тоже круто, но новая команда /goal - это шикарная штука. Не сомневался, что Антропик не будет ждать, чтобы ее скопировать у OpenAI. С ней агент может работать десятки часов. Проверено. Удивительно, что такие ребята как Google сидят на попе ровно и ничего не делают со своим Gemini..

https://t.me/tips_ai/4684
Forwarded from Data Secrets
DeepMind сделали указатель мышки с ИИ

Да, ИИ может в перспективе изменить даже такие привычные вещи. Компьютерный курсор как концепция не менялся почти 50 лет, и вот DeepMind предлагают его переосмыслить.

В их механике курсор – это больше не просто курсор, которым мы водим по интерфейсу, а скорее выделитель контекста для встроенного агента.

Например, вы наводите курсор на таблицу и просите «у мышки» сформировать из нее график. Или выделяете название ресторана на картинке, а агент для вас его бронирует.

Тем самым с человека частично снимается даже такая когнитивная нагрузка, как написание промпта. То есть вам не надо объяснять ИИ детали, вы просто тыкаете во что-то и говорите «расскажи про ЭТО», «перемести ЭТО СЮДА», «исправь ЗДЕСЬ».

И, на самом деле, такое совмещение речи с жестами для человека максимально естественно, так что идея прикольная.

deepmind.google/blog/ai-pointer/

Попробовать уже можно в Gemini in Chrome и в Google AI Studio, а еще указатель собираются встроить в новые ноутбуки GoogleBook, спроектированные специально под ИИ-экспириенс.
Forwarded from Сиолошная
Маленькое обновление по свежему бенчмарку ProgramBench (писал о нем неделю назад тут). Авторы соизволили прогнать GPT 5.5 на high/xhigh (максимальная длина рассуждений и время работы). И Opus 4.7 до кучи тоже. Процитирую авторов: «GPT 5.5 xhigh значительно превосходит Claude Opus 4.7 xhigh по всем параметрам» 😏

Во-первых, появилась первая полностью решённая задача (из 200). Оба запуска GPT-5.5 решили её, при этом на двух разных языках, Python и C.

Во-вторых, если брать не полностью решённые задачи, а те, где проходит 95% тестов (то есть выполнена почти вся функциональность), то разрыв ещё больше: GPT-5.5 xhigh может написать с нуля 13.5% программ, GPT 5.5 high 5%, Opus 4.7 xhigh 4.5%. Я не ожидал такой разницы.

На второй картинке график доли задач, в которых проходит заданный процент тестов. Видно, как фронтир GPT-5.5 xhigh гораздо правее и выше, чем других моделей — то есть в целом модель закрывает сильно больше фичей в задачах.

К сожалению, авторы так и не прогнали модели в Codex / Claude Code, не говоря уже про какой-то минимальный цикл работы до конца (аналог `/goal`), и я всё ещё ожидаю, что это повысит качество ещё больше.

Что это значит для нас? Ждём к концу года агентов, которые будут выплёвывать по 100к строк кода на ваш промпт, и даже работать будет (на 95% 😂)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Dealer.AI
Мозг,мыши и путь к сыру AGI✌️👋

Вышла интересная статья в Nature Communications, которая описывает, как в процессе развития мозг мышей меняет архитектуру нейронных связей: от локальной, плотной и случайной к распределённой, разреженной и структурированной.
По сути, мозг переходит от жёсткой и энергозатратной сети к более гибкой и эффективной.

Проведем параллели между этим биологическим процессом и обучением LLM.
Можно выделить несколько основных направлений:

🧠 Этапы развития в жизни, как путь от переобучения к обобщению в LLM.

В статьей рассказано, что в раннем возрасте у мышей связи между нейронами гиппокампа были локальными, плотными и случайными. При этом сила отдельных синапсов была настолько высокой, что одного события было достаточно для активации нейрона. Это напоминает состояние переобучения у нейросетей: модель буквально запоминает каждый факт и не умеет видеть общие закономерности. Даже к 18–25 дням связи всё ещё были случайными и сильными, но сеть уже начинала реорганизовываться, подготовливая почву для следующего этапа.

У взрослых особей архитектура кардинально меняется: плотность связей снижается, они становятся разреженными и структурированными, обеспечивая надёжное и точное хранение информации. Синапсы слабеют, и для активации нейрона требуется суммация сигналов от нескольких входов.

Тут возникает аналогия с LLM. В процессе обобщения модель учится выявлять закономерности и абстрагироваться от конкретных примеров, что позволяет ей гибко реагировать на новые данные, а не просто вспоминать заученное. Снижение силы отдельных связей можно сравнить с регуляризацией, которая предотвращает запоминание шума и улучшает способность модели к обобщению.

🎯 Память, точность и контроль галлюцинаций в LLM

Разреженная, структурированная сеть взрослого гиппокампа идеально подходит для хранения множества различных воспоминаний без взаимных помех (низкая интерференция). Случайная, плотная сеть ребёнка, напротив, была бы плохим хранилищем, так как новые данные быстро перезаписывали бы старые.

Это может стать аналогией с проблемой катастрофического забывания, которая стоит перед LLM при дообучении на новых данных. Кроме того, разреженная архитектура снижает риск создания ложных ассоциаций - аналог галлюцинаций LLM, когда модель генерирует правдоподобную, но неверную информацию. Для LLM это означает, что более структурированное и разреженное внутреннее представление знаний потенциально может сделать её более надёжной и точной.

⚡️ Экономия ресурсов мышления и вычислений

Переход к разреженной сети значительно энергоэффективнее, тк активируется лишь малая часть нейронов, необходимая для обработки конкретного сигнала. Это критически важно для биологического мозга, работающего в условиях ограниченных ресурсов.

Для LLM мы наблюдаем то же самое. Вспомним разреженные вычисления, такие как MoE, sparse attention и тп. В таких моделях для каждого запроса активируется только небольшая часть экспертов, что позволяет достигать высокой производительности с меньшими вычислительными затратами, чем у плотных моделей аналогичного размера. Однако, мы храним все веса модели в памяти gpu. Но давайте будем честны, мы и весь вес мозга носим на себе, хотя активируем отдельные области 🧠

Ну а что делать-то? 🙄
Как мы видим по статье, что для мышей, что для LLM - путь к эффективности общая стратегия.

Природа за миллионы лет эволюции пришла к разреженности не потому, что лень, а потому что плотная сеть не масштабируется 😱

LLM на 100B параметров в плотном виде — это мышь на P8: шумная, жадная до энергии и неспособная к сложной ассоциативной памяти.

Разреженность - не фича, а база. Получается, что LLM должна эволюционировать от плотной детской фазы к структурированной взрослой.

Правда, эволюция сделала это без градиентного спуска и H100 👍 А сможете ли Вы? 🤔
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Разработчик БПЛА (Anry Guruerez)
robot-lawnmower.gif
1.7 MB
Хакер дистанционно захватил робота-газонокосилку и сымитировал наезд на живого человека

«Белый хакер» Андреас Макрис обнаружил серьёзный бэкдор в софте садовых роботов компании Yarbo, которые могут работать как газонокосилки, снегоуборщики, воздуходувки, триммеры и кромкорезы. Проблема была в том, что если получить доступ к одному роботу, то можно добраться до управления всеми остальными.

В ходе демонстрации он показал карту с более чем 11000 устройств по всему миру, после чего Макрис подключился к одному из роботов в штате Нью-Йорк, смог управлять его камерой и движением. Кроме этого робот может передавать точные GPS-координаты, изображение с камер, адреса электронной почты владельцев и даже пароли от Wi-Fi.

Журналист The Verge Шон Холлистер проверил эти данные на практике: по координатам он нашёл реальные дома владельцев Yarbo, а один из них подтвердил, что показанные исследователем пароли от Wi-Fi действительно принадлежат ему. Во время ещё одной демонстрации Макрис, находясь в Германии, устроил наезд газонокосильщика на Холлистера.

Ситуация интересна ещё и тем, что найденный хакером бэкдор мог быть специально оставлен разработчиками. Его суть состояла в том, что у роботов Yarbo был один и тот же root-пароль, но даже его изменение не защитит владельцев, потому что после каждого обновления прошивки пароль сбрасывается к изначальному значению, выставленному разработчиками. Компания объясняла это заботой о пользователях: якобы это нужно техподдержке для удаленной диагностики. Но после демонстрации «наезда» на журналиста Yarbo пообещала исправить уязвимость.

Это не первый случай дистанционного захвата роботов. В феврале текущего года инженер Сэмми Аздуфаль, решив ради шутки подключить робопылесос DJI Romo к геймпаду PS5, случайно захватил контроль над 7000 устройствами в 24 странах. Благодаря слабому API и помощи ИИ-ассистента, он получил доступ к видеопотокам, микрофонам и картам квартир тысяч незнакомых людей. Компания также пообещала устранить проблему.
С одной стороны неплохо, что Антропик выделяет кредиты, с другой - в апреле наблюдал как мой кредит в 100 баксов просто тает за минуты по апишным ценам. Мне кажется, по подписке за 20 баксов токенов больше давали..

https://t.me/data_analysis_ml/5123
О, игрушка для любителей пофилософствовать с нейронками

https://x.com/nosilverv/status/2054547741645099068/video/1?s=46