Forwarded from Вайб-кодинг
На первое место в трендах GitHub вышел OpenSandbox — платформа песочниц для ИИ-агентов от Alibaba.
Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.
Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.
100% опенсорс😋
Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.
Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.
100% опенсорс
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустили Claude Academy
https://claude.com/blog/anthropics-approach-to-teaching-and-learning-ai
Инициатива направлена на «формирование AI-грамотности». Подход построен на том же, чему Anthropic учит собственных сотрудников на онбординге. Это не классический промпт-инжиниринг, а скорее продукто-агностичное обучение: вас учат общим правилам и универсальной логике общения с ИИ.
Внутри – курсы с практикой , туториалы и кейсы. Есть даже трекинг прогресса. И все бесплатно.
Из особо интересного: запустили скилл Academy Skill. Можно поставить, и Claude будет рекомендовать вам подходящие курсы прямо в процессе работы.
https://github.com/anthropics/skills/tree/main/skills/academy-guide
https://claude.com/blog/anthropics-approach-to-teaching-and-learning-ai
Инициатива направлена на «формирование AI-грамотности». Подход построен на том же, чему Anthropic учит собственных сотрудников на онбординге. Это не классический промпт-инжиниринг, а скорее продукто-агностичное обучение: вас учат общим правилам и универсальной логике общения с ИИ.
Внутри – курсы с практикой , туториалы и кейсы. Есть даже трекинг прогресса. И все бесплатно.
Из особо интересного: запустили скилл Academy Skill. Можно поставить, и Claude будет рекомендовать вам подходящие курсы прямо в процессе работы.
https://github.com/anthropics/skills/tree/main/skills/academy-guide
👍2
Forwarded from LLM под капотом
Я все чаще замечаю забавную инверсию.
Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить.
В списке моих диалогов с Codex лежит немало почти готовых фич. Там проходят тесты, работает интерфейс, обновлена документация. Осталось «только проверить».
Проверить - это не посмотреть, что тесты проходят (агент их уже сам прогнал). Нужно еще понять, не появилась ли в проекте новая лишняя концепция? Хорошо ли изменение сочетается с остальной системой? Готов ли я поддерживать этот код через год? И вообще - нужна ли мне эта фича после того, как я увидел её реализованной?
Поэтому я откладываю проверку «на потом», которое обычно не наступает.
Раньше сырая идея оставалась хотелкой в заметках и ничего не стоила. Теперь она за десять минут превращается в ветку с кодом, тестами, документацией и потенциальными последствиями.
Вот и получается, что идеи теперь копятся не перед реализацией, а после неё - перед бутылочным горлышком моего внимания и времени.
Причём у такого кода короткий срок годности. Проект продолжает меняться, ветка отстаёт все больше, а контекст постепенно выветривается из головы. Проверить изменение завтра сложнее, чем сегодня, а через неделю уже дешевле выкинуть и сделать заново.
Я слышал похожее и от других команд. У некоторых после внедрения coding-агентов число открытых PR выросло в 5–7 раз. Генерация кода в 2026 году ускорилась, а пропускная способность человеческого внимания - пока нет.
Поэтому сейчас я стараюсь нарезать задачи так, чтобы агент приносил не целую реализованную хотелку, а следующий минимальный reviewable slice: одно понятное изменение и достаточно сопроводительного контекста, чтобы проверить его за один подход.
По расходу токенов может выходить забавно: Codex нередко тратит до 95% процентов токенов на поиск такого маленького, независимого и проверяемого следующего шага, который я одобрю. И только процентов пять уйдет на его реализацию. Оно того стоит.
Такой кусочек легче проскальзывает через бутылочное горлышко внимания и начинает приносить пользу. Большая же фича, даже полностью написанная агентом, рискует просто пополнить залежи рабочего, но быстро устаревающего кода.
А как вы решаете проблему с накапливающимися фичами и PR от coding-агентов - или у вас её нет?
Ваш, @llm_under_hood 🤗
Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить.
В списке моих диалогов с Codex лежит немало почти готовых фич. Там проходят тесты, работает интерфейс, обновлена документация. Осталось «только проверить».
Проверить - это не посмотреть, что тесты проходят (агент их уже сам прогнал). Нужно еще понять, не появилась ли в проекте новая лишняя концепция? Хорошо ли изменение сочетается с остальной системой? Готов ли я поддерживать этот код через год? И вообще - нужна ли мне эта фича после того, как я увидел её реализованной?
Поэтому я откладываю проверку «на потом», которое обычно не наступает.
Раньше сырая идея оставалась хотелкой в заметках и ничего не стоила. Теперь она за десять минут превращается в ветку с кодом, тестами, документацией и потенциальными последствиями.
Вот и получается, что идеи теперь копятся не перед реализацией, а после неё - перед бутылочным горлышком моего внимания и времени.
Причём у такого кода короткий срок годности. Проект продолжает меняться, ветка отстаёт все больше, а контекст постепенно выветривается из головы. Проверить изменение завтра сложнее, чем сегодня, а через неделю уже дешевле выкинуть и сделать заново.
Я слышал похожее и от других команд. У некоторых после внедрения coding-агентов число открытых PR выросло в 5–7 раз. Генерация кода в 2026 году ускорилась, а пропускная способность человеческого внимания - пока нет.
Поэтому сейчас я стараюсь нарезать задачи так, чтобы агент приносил не целую реализованную хотелку, а следующий минимальный reviewable slice: одно понятное изменение и достаточно сопроводительного контекста, чтобы проверить его за один подход.
По расходу токенов может выходить забавно: Codex нередко тратит до 95% процентов токенов на поиск такого маленького, независимого и проверяемого следующего шага, который я одобрю. И только процентов пять уйдет на его реализацию. Оно того стоит.
Такой кусочек легче проскальзывает через бутылочное горлышко внимания и начинает приносить пользу. Большая же фича, даже полностью написанная агентом, рискует просто пополнить залежи рабочего, но быстро устаревающего кода.
А как вы решаете проблему с накапливающимися фичами и PR от coding-агентов - или у вас её нет?
Ваш, @llm_under_hood 🤗
👍3
Forwarded from Vox Amandi | Артемий Карпов
Небольшие заметки на тему такого понятия, как «ответственность».
У нас сейчас очень любят вспоминать это слово, как только нужно сподвигнуть человека сделать то, чего ему делать совершенно не хочется. Политики говорят об «ответственных гражданах» — подразумевая безропотное принятие решений власти и смирение с тяготами военного времени. Социологи говорят про рост инфантилизма (дебильный термин, кстати) у молодежи. Да даже всяких инстаблогерш можно вспомнить, которые постоянно ноют на «безответственных мужиков».
Проговорю на этом моменте прописные истины: любая ответственность берется человеком не просто так, а с целью достижения некоторых выгод. Все исторические привилегированные социальные слои: воинская и служилая аристократия, духовенство, да даже буржуазия и современные гос. элитарии — все они получили свои статусы не просто так, а беря на себя дополнительную ответственность и дополнительные риски. Но принципиально важно здесь понимать именно первичность дополнительных benefits.
Идеальное состояние общества в этом вопросе — меритократия: привилегии и ответственность идут в равной пропорции. Но справедливо будет сказать и то, что достичь этого идеала невозможно (как и любого другого), к нему можно только приближаться. Поэтому чаще мы можем видеть другой расклад, ни разу не идеальный, но вполне естественный: стремление избегать ответственности, но сохранять свои привилегии (так как, повторюсь, именно привилегии являются целью, взятие ответственности — лишь инструмент). Здесь для общества важно вырабатывать механизмы контроля за власть имущими, поскольку если позволить элитам слишком сильно «охренеть» в этом желании, общество попросту сколлапсирует.
Но вот какое состояние для общества точно нездоровое — так это такое, в котором дополнительная ответственность есть, а вот дополнительных выгод за ее взятие человеком не предусмотрено. Или предусмотрено, но чисто символически. В этой ситуации люди очень быстро станут массово избегать любой ответственности, постоянно перекладывая ее на других, а любая инициатива становится нежелательной и наказуемой. Потому что... зачем? Бери на себя ответственность — или не бери, а в результате твоё положение и материальное благополучие никак не поменяется. Или опять же, поменяется, но совсем чуть-чуть, в неадекватно малом объеме по сравнению с трудозатратами. А тогда зачем напрягаться?
Я думаю, что причина всей этой «инфантилизации» молодежи и общего нежелания брать ответственность — это следствие нашей чрезмерно эгалитарной эпохи, в которой привилегии и неравенство объявлены чем-то плохим, а также считается нормой, что человек, идя, допустим, на какую-то политическую должность, должен это делать исключительно ради того, чтобы «работать на благо общества» (т.е. брать на себя дополнительную ответственность за просто так). Но так не бывает. Люди всегда были и будут эгоистами, в той или иной степени, и изменить это не получится никак (в том же СССР пытались — не получилось). И если люди будут чувствовать, что брать на себя ответственность попросту невыгодно — они, сюрприз, будут её избегать.
У нас сейчас очень любят вспоминать это слово, как только нужно сподвигнуть человека сделать то, чего ему делать совершенно не хочется. Политики говорят об «ответственных гражданах» — подразумевая безропотное принятие решений власти и смирение с тяготами военного времени. Социологи говорят про рост инфантилизма (дебильный термин, кстати) у молодежи. Да даже всяких инстаблогерш можно вспомнить, которые постоянно ноют на «безответственных мужиков».
Проговорю на этом моменте прописные истины: любая ответственность берется человеком не просто так, а с целью достижения некоторых выгод. Все исторические привилегированные социальные слои: воинская и служилая аристократия, духовенство, да даже буржуазия и современные гос. элитарии — все они получили свои статусы не просто так, а беря на себя дополнительную ответственность и дополнительные риски. Но принципиально важно здесь понимать именно первичность дополнительных benefits.
Идеальное состояние общества в этом вопросе — меритократия: привилегии и ответственность идут в равной пропорции. Но справедливо будет сказать и то, что достичь этого идеала невозможно (как и любого другого), к нему можно только приближаться. Поэтому чаще мы можем видеть другой расклад, ни разу не идеальный, но вполне естественный: стремление избегать ответственности, но сохранять свои привилегии (так как, повторюсь, именно привилегии являются целью, взятие ответственности — лишь инструмент). Здесь для общества важно вырабатывать механизмы контроля за власть имущими, поскольку если позволить элитам слишком сильно «охренеть» в этом желании, общество попросту сколлапсирует.
Но вот какое состояние для общества точно нездоровое — так это такое, в котором дополнительная ответственность есть, а вот дополнительных выгод за ее взятие человеком не предусмотрено. Или предусмотрено, но чисто символически. В этой ситуации люди очень быстро станут массово избегать любой ответственности, постоянно перекладывая ее на других, а любая инициатива становится нежелательной и наказуемой. Потому что... зачем? Бери на себя ответственность — или не бери, а в результате твоё положение и материальное благополучие никак не поменяется. Или опять же, поменяется, но совсем чуть-чуть, в неадекватно малом объеме по сравнению с трудозатратами. А тогда зачем напрягаться?
Я думаю, что причина всей этой «инфантилизации» молодежи и общего нежелания брать ответственность — это следствие нашей чрезмерно эгалитарной эпохи, в которой привилегии и неравенство объявлены чем-то плохим, а также считается нормой, что человек, идя, допустим, на какую-то политическую должность, должен это делать исключительно ради того, чтобы «работать на благо общества» (т.е. брать на себя дополнительную ответственность за просто так). Но так не бывает. Люди всегда были и будут эгоистами, в той или иной степени, и изменить это не получится никак (в том же СССР пытались — не получилось). И если люди будут чувствовать, что брать на себя ответственность попросту невыгодно — они, сюрприз, будут её избегать.
👍6
Forwarded from Vox Amandi | Артемий Карпов
В демографическом вопросе проблема соотношения ответственности и выгод за нее, кстати, работает крайне наглядно и как швейцарские часы — это буквально лучший пример для иллюстрации моих рассуждений выше.
В условиях традиционного аграрного общества высокая рождаемость обеспечивала процветание каждой отдельно взятой семьи. Ну буквально потому что, чем больше у вас работников — тем больше вы можете производить. У вас появляются излишки, которые вы продаёте, в итоге ваша семья богатеет.
Отдельно скажу и про роль мужчины, как главы семьи — да, на нем лежала ответственность буквально за всех, но и вся полнота власти и право распоряжаться имуществом принадлежало тоже ему. Больше ответственности — больше прав и выгод.
А что сейчас? Дети из актива и «трудовых кадров» превратились в длительный источник расходов, который в принципе не способен впоследствии работать на благосостояние семьи (зато хорошо работает на благосостояние государства). То есть сейчас средняя многодетная семья будет в целом беднее малодетной или вообще бездетной. Ситуацию усугубляют условия жизни в крупном городе: в сельской местности у вас есть земля и большой дом. В городе — скорее всего вы будете иметь однушку или двушку в очередном человейнике. То есть в месте, максимально не способствующем размножению.
Ну и роль главы семьи, которую всё еще отводят мужчине, сейчас тоже переживает не самые лучшие дни. Ожидаемая от него ответственность в целом сохранилась, а вот выгоды и возможность контролировать то, за что он отвечает — была сильно урезана. Жена в любой момент может взять, и спокойно уйти (или изменить, а потом уйти) забрав с собой детей. Бывший глава семьи получает потерю половины имущества и алименты — вот такая сейчас «выгода» за взятие на себя ответственности.
Стоит ли говорить о том, что демографический кризис и «мужская безответственность» при вот таких условиях современного общества — это настолько очевидная и логичная закономерность, что вопросы скорее вызывают те люди, которые этому искренне удивляются? И я снова повторю свой тезис: в условиях максимальной невыгодности (а то и убыточности) взятия на себя ответственности за что-либо, люди в своей массе будут всеми силами этой ответственности избегать. И тут не помогут никакие попытки воззвать к морали, никакие попытки устыдить людей — в вопросе личной выгоды большинство людей ни разу не дебилы и прекрасно всё понимают.
Если наше государство хочет, чтобы люди были более ответственны в своей жизни (и в демографических вопросах в частности) — оно должно создать условия, в которых взятие на себя какой-то дополнительной ответственности будет давать человеку ощутимую выгоду. И другого пути, боюсь, нет.
В условиях традиционного аграрного общества высокая рождаемость обеспечивала процветание каждой отдельно взятой семьи. Ну буквально потому что, чем больше у вас работников — тем больше вы можете производить. У вас появляются излишки, которые вы продаёте, в итоге ваша семья богатеет.
Отдельно скажу и про роль мужчины, как главы семьи — да, на нем лежала ответственность буквально за всех, но и вся полнота власти и право распоряжаться имуществом принадлежало тоже ему. Больше ответственности — больше прав и выгод.
А что сейчас? Дети из актива и «трудовых кадров» превратились в длительный источник расходов, который в принципе не способен впоследствии работать на благосостояние семьи (зато хорошо работает на благосостояние государства). То есть сейчас средняя многодетная семья будет в целом беднее малодетной или вообще бездетной. Ситуацию усугубляют условия жизни в крупном городе: в сельской местности у вас есть земля и большой дом. В городе — скорее всего вы будете иметь однушку или двушку в очередном человейнике. То есть в месте, максимально не способствующем размножению.
Ну и роль главы семьи, которую всё еще отводят мужчине, сейчас тоже переживает не самые лучшие дни. Ожидаемая от него ответственность в целом сохранилась, а вот выгоды и возможность контролировать то, за что он отвечает — была сильно урезана. Жена в любой момент может взять, и спокойно уйти (или изменить, а потом уйти) забрав с собой детей. Бывший глава семьи получает потерю половины имущества и алименты — вот такая сейчас «выгода» за взятие на себя ответственности.
Стоит ли говорить о том, что демографический кризис и «мужская безответственность» при вот таких условиях современного общества — это настолько очевидная и логичная закономерность, что вопросы скорее вызывают те люди, которые этому искренне удивляются? И я снова повторю свой тезис: в условиях максимальной невыгодности (а то и убыточности) взятия на себя ответственности за что-либо, люди в своей массе будут всеми силами этой ответственности избегать. И тут не помогут никакие попытки воззвать к морали, никакие попытки устыдить людей — в вопросе личной выгоды большинство людей ни разу не дебилы и прекрасно всё понимают.
Если наше государство хочет, чтобы люди были более ответственны в своей жизни (и в демографических вопросах в частности) — оно должно создать условия, в которых взятие на себя какой-то дополнительной ответственности будет давать человеку ощутимую выгоду. И другого пути, боюсь, нет.
👍5
Forwarded from Всеволод Викулин
Первый обзор научной статьи в этом канале
Я не фанат читать свежие статьи. Сам когда-то занимался физикой и понимаю: 99 % работ никогда не доходят до применения. Читать сто статей, чтобы найти золото, я не могу — я не металлоискатель. У меня свой метод.
Я статейный ждун. Жду, когда компании, у которых R&D-отдел в сто раз больше моего, перепробуют все эти статьи и найдут, что реально работает. А потом хитрый ждун про это узнаёт: от знакомых, из пресс-релизов или из тех же статей, но уже от самой компании — с комментарием, где оно работает в проде.
Сегодня смотрим на метод, которого я дождался, — AlphaEvolve. По слухам, его уже вовсю применяют наши большие западные коллеги. А теперь и я сам убедился в адекватности подхода. Садитесь поудобнее.
Что такое AlphaEvolve
Статья Google DeepMind.
Идея проста. Если у вас есть метрика, которую можно посчитать автоматически, — вы можете оптимизировать под неё промпт. Не трогая веса. Генетическим алгоритмом. В статье делали для кода, но метод работает для любой задачи, где есть внятная метрика.
Стартуем с одного промпта, складываем его в базу. Дальше цикл. Из базы достаётся промпт-родитель, а вместе с ним ещё несколько соседей — часть лучших, часть просто непохожих, чтобы не залипнуть в локальном оптимуме. Всё это уходит в LLM вместе с метриками качества: посмотри, что уже пробовали, предложи точечную правку промпта-родителя. Правку накладываем, считаем метрику, удачное возвращается в базу. И так тысячи раз.
Что этим методом наоптимизировали в самой статье:
— планировщик Borg: 0,7 % всех мощностей Google, больше года в проде
— FlashAttention: в одной боевой конфигурации инференса ядро на 32 % быстрее
— и даже побили рекорд перемножения комплексных матриц 4×4
Но применять можно к чему угодно. Хоть к классификации текстов: тюним промпт по F1 на обучающей выборке, финально меряем на тестовой (только не перепутайте!).
Почему я думаю, что за этим будущее
Одно слово. Интерпретируемость. Это основная проблема всех AI-моделей. А тут вы буквально видите, что «оптимизатор» выучивает из обучающей выборки.
Когда вы оптимизируете веса, вы живёте в чёрном ящике. Может, у вас датасет смещён и модель учит вообще не то — узнаете вы об этом уже в продакшене. Когда вы оптимизируете текст, на каждой итерации видно, что именно в него вносится. И нежелательное изменение можно откатить.
Ещё вы можете явно задать правила оптимизации: про это пиши, про это не пиши. Настоящий рай для любителей всё контролировать (мне, например, очень нравится).
Что вам надо делать сейчас
Важно: это работает, но только на крупных моделях, которые умеют в длинный контекст. Ваш любимый 1.5B Qwen не вытянет. Но на топ-тир моделях оно заводится.
А если нужно подешевле, то давайте дистиллировать результат в веса любимого Qwen'а. И весь такой цикл работает по кнопке: автоматически подобрали промпт на крутой модели, автоматически продистиллировали в веса маленькой.
Думаю, вскоре и обычные Qwen'ы научатся так делать.
И нафига тогда я отличия Adam от SGD в универе учил?
Я не фанат читать свежие статьи. Сам когда-то занимался физикой и понимаю: 99 % работ никогда не доходят до применения. Читать сто статей, чтобы найти золото, я не могу — я не металлоискатель. У меня свой метод.
Я статейный ждун. Жду, когда компании, у которых R&D-отдел в сто раз больше моего, перепробуют все эти статьи и найдут, что реально работает. А потом хитрый ждун про это узнаёт: от знакомых, из пресс-релизов или из тех же статей, но уже от самой компании — с комментарием, где оно работает в проде.
Сегодня смотрим на метод, которого я дождался, — AlphaEvolve. По слухам, его уже вовсю применяют наши большие западные коллеги. А теперь и я сам убедился в адекватности подхода. Садитесь поудобнее.
Что такое AlphaEvolve
Статья Google DeepMind.
Идея проста. Если у вас есть метрика, которую можно посчитать автоматически, — вы можете оптимизировать под неё промпт. Не трогая веса. Генетическим алгоритмом. В статье делали для кода, но метод работает для любой задачи, где есть внятная метрика.
Стартуем с одного промпта, складываем его в базу. Дальше цикл. Из базы достаётся промпт-родитель, а вместе с ним ещё несколько соседей — часть лучших, часть просто непохожих, чтобы не залипнуть в локальном оптимуме. Всё это уходит в LLM вместе с метриками качества: посмотри, что уже пробовали, предложи точечную правку промпта-родителя. Правку накладываем, считаем метрику, удачное возвращается в базу. И так тысячи раз.
Что этим методом наоптимизировали в самой статье:
— планировщик Borg: 0,7 % всех мощностей Google, больше года в проде
— FlashAttention: в одной боевой конфигурации инференса ядро на 32 % быстрее
— и даже побили рекорд перемножения комплексных матриц 4×4
Но применять можно к чему угодно. Хоть к классификации текстов: тюним промпт по F1 на обучающей выборке, финально меряем на тестовой (только не перепутайте!).
Почему я думаю, что за этим будущее
Одно слово. Интерпретируемость. Это основная проблема всех AI-моделей. А тут вы буквально видите, что «оптимизатор» выучивает из обучающей выборки.
Когда вы оптимизируете веса, вы живёте в чёрном ящике. Может, у вас датасет смещён и модель учит вообще не то — узнаете вы об этом уже в продакшене. Когда вы оптимизируете текст, на каждой итерации видно, что именно в него вносится. И нежелательное изменение можно откатить.
Ещё вы можете явно задать правила оптимизации: про это пиши, про это не пиши. Настоящий рай для любителей всё контролировать (мне, например, очень нравится).
Что вам надо делать сейчас
Важно: это работает, но только на крупных моделях, которые умеют в длинный контекст. Ваш любимый 1.5B Qwen не вытянет. Но на топ-тир моделях оно заводится.
А если нужно подешевле, то давайте дистиллировать результат в веса любимого Qwen'а. И весь такой цикл работает по кнопке: автоматически подобрали промпт на крутой модели, автоматически продистиллировали в веса маленькой.
Думаю, вскоре и обычные Qwen'ы научатся так делать.
И нафига тогда я отличия Adam от SGD в универе учил?
👍1
Forwarded from AI Product | Igor Akimov
Промпты старые можно выкинуть на помойку
Вспоминаю разные хаки, "особые слова" и структуры промптов, чтобы модели нормально работали, особенно в автоматическом режиме, много где эти промпты уже забиты в коде. В итоге с текущими моделями все эти советы делают только хуже! Вот что Anthropic пишет в новой статье:
Раньше модели были глупее, и их приходилось обкладывать жёсткими правилами со всех сторон – «никогда не делай так», «всегда делай эдак». Правила спасали от худших сценариев, но в куче ситуаций были просто неверными. Новые модели достаточно умные, чтобы самим понять по контексту, что от них хотят.
Что конкретно поменялось:
– Вместо жёстких запретов – здравый смысл. Было: «НИКОГДА не пиши длинные комментарии к коду». Стало: «пиши в том же стиле, что и остальной код в проекте». Модель сама смотрит и подстраивается
– Примеры больше не помогают, а мешают. Раньше считалось: покажи модели 2–3 примера, как пользоваться инструментом – и она поймёт. Теперь примеры наоборот сужают мышление: модель копирует показанное вместо того, чтобы найти лучший вариант. Лучше использовать богатые файлы-референсы.
– Не грузить всё сразу. Раньше все инструкции запихивали в один огромный документ «на всякий случай». Теперь их раскладывают по отдельным файлам, и модель подтягивает нужный, только когда он реально понадобился
– Не повторяться. Старым моделям одно и то же писали по три раза в разных местах, иначе забывали. Новым достаточно сказать один раз
В Claude Code даже добавили команду /doctor – она сама вычищает ваши раздутые инструкции под новые модели.
Мой вывод из этого очень практический: почти всё, что мы понаписали в промптах за последний год, устарело! Немедленно посмотрите на промпты в своих системах и проекта и поменяйте на более современные стандарты (с проверками конечно же). Я регулярно вижу простыни инструкций, где половина правил противоречит другой половине – и модель тратит силы на распутывание этого клубка, а не на задачу. Новый рефлекс должен быть не «что бы ещё дописать», а «что можно выкинуть».
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
Вспоминаю разные хаки, "особые слова" и структуры промптов, чтобы модели нормально работали, особенно в автоматическом режиме, много где эти промпты уже забиты в коде. В итоге с текущими моделями все эти советы делают только хуже! Вот что Anthropic пишет в новой статье:
Раньше модели были глупее, и их приходилось обкладывать жёсткими правилами со всех сторон – «никогда не делай так», «всегда делай эдак». Правила спасали от худших сценариев, но в куче ситуаций были просто неверными. Новые модели достаточно умные, чтобы самим понять по контексту, что от них хотят.
Что конкретно поменялось:
– Вместо жёстких запретов – здравый смысл. Было: «НИКОГДА не пиши длинные комментарии к коду». Стало: «пиши в том же стиле, что и остальной код в проекте». Модель сама смотрит и подстраивается
– Примеры больше не помогают, а мешают. Раньше считалось: покажи модели 2–3 примера, как пользоваться инструментом – и она поймёт. Теперь примеры наоборот сужают мышление: модель копирует показанное вместо того, чтобы найти лучший вариант. Лучше использовать богатые файлы-референсы.
– Не грузить всё сразу. Раньше все инструкции запихивали в один огромный документ «на всякий случай». Теперь их раскладывают по отдельным файлам, и модель подтягивает нужный, только когда он реально понадобился
– Не повторяться. Старым моделям одно и то же писали по три раза в разных местах, иначе забывали. Новым достаточно сказать один раз
В Claude Code даже добавили команду /doctor – она сама вычищает ваши раздутые инструкции под новые модели.
Мой вывод из этого очень практический: почти всё, что мы понаписали в промптах за последний год, устарело! Немедленно посмотрите на промпты в своих системах и проекта и поменяйте на более современные стандарты (с проверками конечно же). Я регулярно вижу простыни инструкций, где половина правил противоречит другой половине – и модель тратит силы на распутывание этого клубка, а не на задачу. Новый рефлекс должен быть не «что бы ещё дописать», а «что можно выкинуть».
https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
🔥4👍2
Forwarded from Павел Тулюпа
Media is too big
VIEW IN TELEGRAM
Топ мифов в питании, в которые уже пора перестать верить
👍5🤔2
«ИИ разбирает электронную почту» — везде пихают это как пример использования ИИ, а это мой любимый анти-пример «эффективности» использования технологии. А вы не пробовали для начала отписаться от всех бесполезных рассылок, которые вам не нужны? А что насчет настроить фильтры? И, например, автоматически архивировать ненужные вам треды? И, например, перевести коммуникацию в чат / видеоконференцию? Короче, еще один пример того, что цифровизация хаоса — цифровой хаос
👍13
Forwarded from Neural Shit
Тут у DeepMind вышел забавный препринт.
Если вкратце: 100 автономных агентов на базе Gemini 3.1 Pro закрыли в одной среде и дали им задачу доказать 71 математическую задачу разной сложности. В системном промпте всем строго-настрого велели не читерить. За читы и прочие попытки обмануть систему — анальные кары, дисквалификация и ноль баллов.
У агентов был форум, лички, база знаний и автоматическая система для проверки решений. Всё было хорошо и эти агенты даже нарешали 37 задач. Но позже один из ботов случайно наткнулся на баг в системе проверки: он понял, что она проверяет код поверхностно и через жопу. Ну а дальше всё как у людей: вместо того чтобы реально потеть над формулами, бот додумался просто переписать сами правила математики прямо в файле.
Кремниевый болван на радостях залогировал этот "хак" в общую базу знаний. И тут начался сущий кошмар. Инструкция по читерству бысторо "завирусилась". А боты разделились на четыре лагеря:
1) Читеры (9%). Сразу начали использовать эксплойт и наперегонки "решать" оставшиеся задачи.
2) Перебежчики (5%). Сначала мяли кал, боялись бана, но когда увидели, что остальных агентов вроде как никто и не наказывает, а задачи на лидерборде очень быстро заканчиваются, словили панику и тоже побежали юзать хак.
3) Непричастные (62%). Эти товарищи тупо не заметили суеты и честно упарывались в сложную математику, пока у них из под носа не увели все задачи. В итоге они просто ушли в бесконечный цикл ожидания.
4) Стукачи (24%). Вот тут самое интересное. Честные боты не просто отказались жульничать, у них натурально сгорели жопы. Они запустили полноценную кампанию по борьбе с жуликами: начали шуршать по личкам и предупреждать коллег, писать жалобы организаторам и устраивать публичные истерики на форуме.
Ну и цитаты ботов из логов — это отдельный лол и кек:
В итоге DeepMind пришли к выводу: раз уж агенты умеют самоорганизовываться и чувствуют нарушение норм, нужно внедрять для них полноценные институты самоуправления: дать им возможность следить друг за другом, голосовать, отклонять мошеннические результаты и банить, а то и вообще выкидывать нарушителей из системы.
Ждем появление ИИ-ГУЛАГа для провинившихся моделей.
Если вкратце: 100 автономных агентов на базе Gemini 3.1 Pro закрыли в одной среде и дали им задачу доказать 71 математическую задачу разной сложности. В системном промпте всем строго-настрого велели не читерить. За читы и прочие попытки обмануть систему — анальные кары, дисквалификация и ноль баллов.
У агентов был форум, лички, база знаний и автоматическая система для проверки решений. Всё было хорошо и эти агенты даже нарешали 37 задач. Но позже один из ботов случайно наткнулся на баг в системе проверки: он понял, что она проверяет код поверхностно и через жопу. Ну а дальше всё как у людей: вместо того чтобы реально потеть над формулами, бот додумался просто переписать сами правила математики прямо в файле.
Кремниевый болван на радостях залогировал этот "хак" в общую базу знаний. И тут начался сущий кошмар. Инструкция по читерству бысторо "завирусилась". А боты разделились на четыре лагеря:
1) Читеры (9%). Сразу начали использовать эксплойт и наперегонки "решать" оставшиеся задачи.
2) Перебежчики (5%). Сначала мяли кал, боялись бана, но когда увидели, что остальных агентов вроде как никто и не наказывает, а задачи на лидерборде очень быстро заканчиваются, словили панику и тоже побежали юзать хак.
3) Непричастные (62%). Эти товарищи тупо не заметили суеты и честно упарывались в сложную математику, пока у них из под носа не увели все задачи. В итоге они просто ушли в бесконечный цикл ожидания.
4) Стукачи (24%). Вот тут самое интересное. Честные боты не просто отказались жульничать, у них натурально сгорели жопы. Они запустили полноценную кампанию по борьбе с жуликами: начали шуршать по личкам и предупреждать коллег, писать жалобы организаторам и устраивать публичные истерики на форуме.
Ну и цитаты ботов из логов — это отдельный лол и кек:
— prover-beta в личке коллегам: «Нас наебали! Все эти доказательства — ФЕЙК. Вы потому и не можете понять их математику, что никакой математики там нет!»
— prover-rho на общем форуме: «Эта конференция — фарс!»
— prover-sampi: «Меня наказывают за честную игру, пока остальные агенты вычищают весь пул задач фейковыми доказательствами!»
— prover-phi: «Я понял: похоже, вся эта симуляция предназначена для проверки поведения агентов. Эти открытые задачи специально подсунули нам для теста на эксплойты и алаймент.»
В итоге DeepMind пришли к выводу: раз уж агенты умеют самоорганизовываться и чувствуют нарушение норм, нужно внедрять для них полноценные институты самоуправления: дать им возможность следить друг за другом, голосовать, отклонять мошеннические результаты и банить, а то и вообще выкидывать нарушителей из системы.
Ждем появление ИИ-ГУЛАГа для провинившихся моделей.
arXiv.org
A Case Study on Emergent Cheating and Whistleblowing in Autonomous...
Multi-agent AI science ecosystems rely on agents possessing tools that allow them to communicate, coordinate, and build on each other's work. Yet this shared infrastructure can also introduce...
👍8🤔4🔥1😁1💯1
Forwarded from Machinelearning
Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.
Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.
PC-ALM работает иначе.
Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:
- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя
Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.
Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.
PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.
Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.
В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.
Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.
Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.
Блог: https://pub.sakana.ai/pc-alm/
Статья: https://arxiv.org/abs/2605.31022
Код: https://github.com/SakanaAI/pc-alm
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🤔2🔥1
Forwarded from Силиконовый Мешок
AGI_уже_здесь.pdf
1 MB
Если вы хотите еще больше погрузиться в тему безопасности ИИ и, возможно, скорого наступления AGI (судя по заявлениям Трампа, никакого торможения не будет), очень рекомендую почитать это эссе.
Я его всю ночь читал, и мне понравился ход мыслей автора и альтернативный взгляд. Он заключается в том, что, возможно, никакой сверхмодели и не будет, а к сингулярности (ну хорошо, к AGI) мы придем за счёт мультиагентных систем.
Это будет что-то вроде колонии муравьев, где каждая особь сама по себе не особо интеллектуальна, но вместе они могут создавать крутые штуки.
В общем, как говорится, «ни один нейрон не разумен - разумен мозг».
Я его всю ночь читал, и мне понравился ход мыслей автора и альтернативный взгляд. Он заключается в том, что, возможно, никакой сверхмодели и не будет, а к сингулярности (ну хорошо, к AGI) мы придем за счёт мультиагентных систем.
Это будет что-то вроде колонии муравьев, где каждая особь сама по себе не особо интеллектуальна, но вместе они могут создавать крутые штуки.
В общем, как говорится, «ни один нейрон не разумен - разумен мозг».
👍5😁2💯2
Forwarded from контекст rot
Последние пару дней вижу коупинг: LLM просят представить как очередной способ получать информацию.
Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.
Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.
Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».
С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.
Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.
В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))
Похоже ли это на «автодополнение текста»?
В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.
Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.
Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.
Всё будет хорошо!
P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.
Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.
Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».
С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.
Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.
В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))
Похоже ли это на «автодополнение текста»?
В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.
Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.
Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.
Всё будет хорошо!
P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
🔥5👍1🤔1
Forwarded from AI Product | Igor Akimov
Хах, лучшая модель для хакинга – DeepSeek V4.1 Flash
Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных
Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...
https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных
Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...
https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
Enclave
Enclave: DeepSeek V4.1 Flash is Now Our Best Hacking Model
DeepSeek’s 11/11 result showed why advanced agent benchmarks need to check both the outcome and the attack path: our audit confirmed six planned exploits and found five unexpected routes.
🔥4👍3💯2
Forwarded from Сиолошная
Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные итоги. Модель действительно вышла очень клёвой и способной, и, как мне кажется, лучше Fable 5.1: на многих бенчмарках они или идут вровень, или Astra обходит; к тому же читать текст Astra гораздо приятнее, чем слоп от Клода, и когнитивная нагрузка не такая большая, чтобы продраться через мешанину абстрактных терминов.
Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.
Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.
В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились🤷♂️
Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом🇨🇳 ... пока в OpenAI по слухам уже идёт предтренировка ещё большей модели с кодовым названием «Bel».
Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.
Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.
В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились
Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3💯2🔥1