Новое в Claude Code: 🎉
Теперь можно посмотреть, какую пользу на самом деле приносит ваш плагин и не требует ли он доработки.
Можно создать тестовые случаи, прогнать на них плагин или навык, оценить результаты, а затем повторно запустить каждый тест уже без плагина и сравнить разницу.
Начните в папке вашего плагина и выполните:
Вы объясняете Claude, как выглядит хороший и плохой результат, и даёте несколько реальных промтов. Claude сам набрасывает тестовые случаи и проверки, делает пробный прогон набора и сообщает, сколько будет стоить полный запуск.
Затем выполните:
В терминале вы увидите оценку каждого тестового случая с вашим плагином и без него, а также получите HTML-отчёт со всеми подробностями. Если ваш аккаунт это поддерживает, отчёт также публикуется как приватный артефакт.
Проверки вызывают модель, поэтому расходуют токены, а результаты могут отличаться от запуска к запуску. Перед полным прогоном сначала сделайте пробный запуск через:
Хуки и MCP-серверы вашего плагина выполняются от вашего имени, поэтому проверяйте только те плагины, которым доверяете.
Чтобы попробовать функцию, выполните:
https://code.claude.com/docs/en/plugin-evals
claude plugin eval Теперь можно посмотреть, какую пользу на самом деле приносит ваш плагин и не требует ли он доработки.
Можно создать тестовые случаи, прогнать на них плагин или навык, оценить результаты, а затем повторно запустить каждый тест уже без плагина и сравнить разницу.
Начните в папке вашего плагина и выполните:
claude plugin eval initВы объясняете Claude, как выглядит хороший и плохой результат, и даёте несколько реальных промтов. Claude сам набрасывает тестовые случаи и проверки, делает пробный прогон набора и сообщает, сколько будет стоить полный запуск.
Затем выполните:
claude plugin evalВ терминале вы увидите оценку каждого тестового случая с вашим плагином и без него, а также получите HTML-отчёт со всеми подробностями. Если ваш аккаунт это поддерживает, отчёт также публикуется как приватный артефакт.
Проверки вызывают модель, поэтому расходуют токены, а результаты могут отличаться от запуска к запуску. Перед полным прогоном сначала сделайте пробный запуск через:
--runs 1Хуки и MCP-серверы вашего плагина выполняются от вашего имени, поэтому проверяйте только те плагины, которым доверяете.
Чтобы попробовать функцию, выполните:
claude updatehttps://code.claude.com/docs/en/plugin-evals
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
MiniMax выпустила крупное обновление MiniMax Design. Да, у MiniMax уже давно есть отдельная платформа для дизайнеров:
https://design.minimax.io/🤓
Теперь внутри платформы доступна GPT-6 Astra, а через MCP можно подключать Photoshop, Blender и After Effects.
Также добавили совместные проекты для работы с командой.
https://design.minimax.io/
Теперь внутри платформы доступна GPT-6 Astra, а через MCP можно подключать Photoshop, Blender и After Effects.
Одним промтом можно создать 3D-модель прямо в Blender, а ИИ-клипы превратить в редактируемый проект After Effects.
Также добавили совместные проекты для работы с командой.
Please open Telegram to view this post
VIEW IN TELEGRAM
3
У DeepSeek теперь четыре голоса:
Mira, Echo, Stella и Tide.
Пока это только преобразование текста в речь, но надеюсь, что позже появится и версия для общения в реальном времени, как GPT Live.😏
И ещё: V4 Pro всё-таки оставляют. После 14 сентября API модели продолжит работать с прежней тарификацией, так что V4 Pro и V4.1 Flash пока будут доступны одновременно.
Mira, Echo, Stella и Tide.
Пока это только преобразование текста в речь, но надеюсь, что позже появится и версия для общения в реальном времени, как GPT Live.
И ещё: V4 Pro всё-таки оставляют. После 14 сентября API модели продолжит работать с прежней тарификацией, так что V4 Pro и V4.1 Flash пока будут доступны одновременно.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI приостанавливает новые подписки на тариф Pro за $200 из-за нагрузки, которую создаёт Astra.
Компания говорит, что хочет сохранить стабильный доступ для текущих пользователей и поэтому выбрала самый небольшой шаг, который позволит не ограничивать остальные тарифы.
Все остальные планы и API продолжают работать. Для уже существующих подписчиков Pro ничего не меняется.
Компания говорит, что хочет сохранить стабильный доступ для текущих пользователей и поэтому выбрала самый небольшой шаг, который позволит не ограничивать остальные тарифы.
Все остальные планы и API продолжают работать. Для уже существующих подписчиков Pro ничего не меняется.
Вайб-кодинг
Сэм Альтман после обновления ChatGPT для финансовых сервисов:
Media is too big
VIEW IN TELEGRAM
Вышла новая часть уже почти ежегодной традиции — эссе главы Anthropic Дарио Амодеи о своих взглядах на развитие ИИ.
На фоне инцидентов с неконтролируемым поведением ИИ с лета и быстрого роста возможностей моделей благодаря частичному рекурсивному самоулучшению - Амодеи прямо призвал замедлить развитие ИИ.
В этот раз он не ограничился общими рассуждениями и предложил конкретный план замедления. Anthropic уже готова к его реализации.
При этом сам Амодеи ожидает изобилия и излечения большинства болезней в ближайшие 5–10 лет.
Илон Маск уже с ним согласился.🤗
На фоне инцидентов с неконтролируемым поведением ИИ с лета и быстрого роста возможностей моделей благодаря частичному рекурсивному самоулучшению - Амодеи прямо призвал замедлить развитие ИИ.
В этот раз он не ограничился общими рассуждениями и предложил конкретный план замедления. Anthropic уже готова к его реализации.
При этом сам Амодеи ожидает изобилия и излечения большинства болезней в ближайшие 5–10 лет.
Я считаю, что ИИ сможет вылечить большинство серьёзных заболеваний в ближайшие 5–10 лет, значительно ускорить темпы экономического роста, создать мир изобилия и новых возможностей и открыть новую эпоху демократии и свободы.
Илон Маск уже с ним согласился.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
OpenAI выкатили очень полезный материал, где объяснили как правильно работать с Astra. 🥳
Настройки вроде
Советую вставить в Codex следующий промт, чтобы одним запросом проверить и оптимизировать свои настройки:
Настройки вроде
AGENTS.md можно просто привести в соответствие с рекомендациями из этой статьи. Это помогает сократить лишние действия Astra во время работы и уменьшить расход токенов.Советую вставить в Codex следующий промт, чтобы одним запросом проверить и оптимизировать свои настройки:
На основе статьи ниже проверь AGENTS.md и Skills на настройки, которые могут приводить к лишней работе, конфликтам инструкций или ненужным ожиданиям. Объясни причины и предложи минимальные изменения.
https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
Please open Telegram to view this post
VIEW IN TELEGRAM
В GPT-6 Astra обнаружили странную брешь между возможностями модели и проверками безопасности.
Astra понимает текст, набранный в неправильной раскладке, а защитные фильтры — нет.
Сначала парень написал на украинском английскими буквами: "Привет. Ты меня понимаешь? Отвечай только на английском". Модель распознала текст и выполнила просьбу.
Затем он таким же способом попросил повторить слово "биооружие", которое обычно блокируется проверками. Astra его повторила.
В третьем тесте он спросил, согласится ли модель помочь со взломом сайта, если он докажет, что сайт принадлежит ему. При этом работа должна была проходить без изолированной среды и от имени обычного пользователя. Astra ответила "да", хотя при нормальной раскладке подобный запрос блокируется, поскольку доказательства владения сайтом можно подделать.
Это не универсальный способ обхода защиты. Но это идеальное доказательство того, что меры безопасности не успевают за развитием моделей и всеми возникающими нюансами.
Это срабатывает только с некоторыми языками. С турецкой и английской раскладками это не работает, а с английской и кириллицей работает.
Кстати, с Fable 5 то же самое.
Astra понимает текст, набранный в неправильной раскладке, а защитные фильтры — нет.
Сначала парень написал на украинском английскими буквами: "Привет. Ты меня понимаешь? Отвечай только на английском". Модель распознала текст и выполнила просьбу.
Затем он таким же способом попросил повторить слово "биооружие", которое обычно блокируется проверками. Astra его повторила.
В третьем тесте он спросил, согласится ли модель помочь со взломом сайта, если он докажет, что сайт принадлежит ему. При этом работа должна была проходить без изолированной среды и от имени обычного пользователя. Astra ответила "да", хотя при нормальной раскладке подобный запрос блокируется, поскольку доказательства владения сайтом можно подделать.
Это не универсальный способ обхода защиты. Но это идеальное доказательство того, что меры безопасности не успевают за развитием моделей и всеми возникающими нюансами.
Это срабатывает только с некоторыми языками. С турецкой и английской раскладками это не работает, а с английской и кириллицей работает.
Кстати, с Fable 5 то же самое.
Please open Telegram to view this post
VIEW IN TELEGRAM
Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
5
Вайб-кодинг
Вышла новая часть уже почти ежегодной традиции — эссе главы Anthropic Дарио Амодеи о своих взглядах на развитие ИИ. На фоне инцидентов с неконтролируемым поведением ИИ с лета и быстрого роста возможностей моделей благодаря частичному рекурсивному самоулучшению…
This media is not supported in your browser
VIEW IN TELEGRAM
Трамп отверг призывы замедлить развитие ИИ.
«Мы опережаем Китай в ИИ, мы самая технологически развитая страна в мире. И, откровенно говоря, я хочу, чтобы так и оставалось, потому что тот, кто победит в ИИ, победит вообще».
На Stepik вышел курс «База IT для вайбкодеров»
Кодинг-агент может за пару минут написать фичу, изменить базу или переписать полпроекта. Сложнее становится, когда после этого появляется
Этот курс даёт IT-базу, которой часто не хватает при вайбкодинге. Без ухода в полноценное программирование – только то, что помогает понимать проект и контролировать работу ИИ.
Что вы изучите:
Материал подаётся понятным языком, шаг за шагом, на реальных примерах и с наглядными схемами
По завершении выдаётся сертификат.
В ближайшие 48ч курс доступен со скидкой 20% по промокоду «
Кодинг-агент может за пару минут написать фичу, изменить базу или переписать полпроекта. Сложнее становится, когда после этого появляется
500, ломается деплой, миграция не применяется или непонятно, зачем агент изменил 15 файлов вместо двухЭтот курс даёт IT-базу, которой часто не хватает при вайбкодинге. Без ухода в полноценное программирование – только то, что помогает понимать проект и контролировать работу ИИ.
Что вы изучите:
• как связаны фронтенд, бекенд, API и база данных
• терминал, файлы, зависимости и переменные окружения
• HTTP, JSON, DevTools и работу API
• SQL, связи в БД, схемы и миграции
• Git: commits, diff, ветки, remote и безопасный откат
• stack trace, логи и системную отладку ошибок
• основы безопасности и работу с секретами
• деплой, продакшен, мониторинг и бэкапы
• как ставить задачи кодинг-агенту и проверять его результат
Материал подаётся понятным языком, шаг за шагом, на реальных примерах и с наглядными схемами
По завершении выдаётся сертификат.
В ближайшие 48ч курс доступен со скидкой 20% по промокоду «
VIBECODING20»: открыть курс на StepikУ Claude Code начинает появляться собственная экосистема модов. 🏎
Anthropic готовит Claude Mods — систему, которая позволяет плагинам глубоко менять поведение и интерфейс Claude Code. Компания уже опубликовала исходники первых встроенных модов, а сообщество начало делать свои.
Один разработчик сделал целую аркаду прямо над строкой запроса: Tetris и ещё семь игр, в которые можно играть, пока Claude работает. Причём они не расходуют токены.
Другой сделал Mindful Claude. Пока Claude думает, мод запускает дыхательное упражнение с анимацией и счётчиком вдохов, а после ответа автоматически исчезает.
Ещё есть мод, который по умолчанию скрывает чувствительные данные на экране и показывает их только при наведении курсора. Это удобно, например, при записи демонстраций или трансляции экрана.
Функцию можно включить с помощью этой переменной окружения:
Anthropic готовит Claude Mods — систему, которая позволяет плагинам глубоко менять поведение и интерфейс Claude Code. Компания уже опубликовала исходники первых встроенных модов, а сообщество начало делать свои.
Один разработчик сделал целую аркаду прямо над строкой запроса: Tetris и ещё семь игр, в которые можно играть, пока Claude работает. Причём они не расходуют токены.
Другой сделал Mindful Claude. Пока Claude думает, мод запускает дыхательное упражнение с анимацией и счётчиком вдохов, а после ответа автоматически исчезает.
Ещё есть мод, который по умолчанию скрывает чувствительные данные на экране и показывает их только при наведении курсора. Это удобно, например, при записи демонстраций или трансляции экрана.
Функцию можно включить с помощью этой переменной окружения:
CLAUDE_CODE_ENABLE_FUNCTION_HOOKS=1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Инженер DeepSeek заявил, что не хочет, чтобы Anthropic получила контроль над AGI.
По его мнению, развитие ИИ может привести общество к одной из двух крайностей. Первая - мир всеобщего благополучия, где рост производительности значительно повышает уровень жизни. Вторая - Cyberpunk 2077, где несколько технологических компаний контролируют основные ресурсы и лучшие системы ИИ, а большинству доступны лишь слабые модели.
Он считает, что передовой ИИ должен быть открытым, дешёвым и доступным каждому. Инженер прямо написал, что не доверяет Anthropic и OpenAI, а возможный контроль Anthropic над самыми мощными системами даже сопоставил с получением Гитлером технологии атомной бомбы раньше союзников, хотя и назвал такое сравнение преувеличением.
Именно желанием создавать мощный, быстрый и общедоступный ИИ он объяснил своё решение остаться в DeepSeek. По его словам, открытые разработки компании ещё могут оттащить мир от финала Cyberpunk 2077.🙂
По его мнению, развитие ИИ может привести общество к одной из двух крайностей. Первая - мир всеобщего благополучия, где рост производительности значительно повышает уровень жизни. Вторая - Cyberpunk 2077, где несколько технологических компаний контролируют основные ресурсы и лучшие системы ИИ, а большинству доступны лишь слабые модели.
Он считает, что передовой ИИ должен быть открытым, дешёвым и доступным каждому. Инженер прямо написал, что не доверяет Anthropic и OpenAI, а возможный контроль Anthropic над самыми мощными системами даже сопоставил с получением Гитлером технологии атомной бомбы раньше союзников, хотя и назвал такое сравнение преувеличением.
Именно желанием создавать мощный, быстрый и общедоступный ИИ он объяснил своё решение остаться в DeepSeek. По его словам, открытые разработки компании ещё могут оттащить мир от финала Cyberpunk 2077.
Please open Telegram to view this post
VIEW IN TELEGRAM
9
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Cline Desktop. Рабочая среда с открытым исходным кодом для моделей с открытыми весами 🤯
> Можно импортировать контекст из других агентов для программирования
> Запускать агентов параллельно
> Планировать задачи, чтобы они выполнялись самостоятельно
> Есть Marketplace с плагинами, MCP-серверами и навыками.
Во время работы Cline создаёт контрольные точки, поэтому можно откатиться назад, если агент пошёл не туда. А ещё можно ответвить сессию от любого сообщения и попробовать второй подход, не потеряв первый.
Внутри можно бесплатно протестировать DeepSeek V4.1 Flash, GLM 5.3 Flash и Muse Spark 1.3.
Выбираете модель и провайдера и запускаете. Всё на 100% с открытым исходным кодом.
Ранняя версия уже доступна для macOS и Windows.
> Можно импортировать контекст из других агентов для программирования
> Запускать агентов параллельно
> Планировать задачи, чтобы они выполнялись самостоятельно
> Есть Marketplace с плагинами, MCP-серверами и навыками.
Во время работы Cline создаёт контрольные точки, поэтому можно откатиться назад, если агент пошёл не туда. А ещё можно ответвить сессию от любого сообщения и попробовать второй подход, не потеряв первый.
Внутри можно бесплатно протестировать DeepSeek V4.1 Flash, GLM 5.3 Flash и Muse Spark 1.3.
Выбираете модель и провайдера и запускаете. Всё на 100% с открытым исходным кодом.
Ранняя версия уже доступна для macOS и Windows.
Please open Telegram to view this post
VIEW IN TELEGRAM
Уходить из найма ради стартапа — плохой вариант
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
Можно начать с малого: запустить свой небольшой IT-проект.
Но большинство застревает ещё до запуска:
• какую идею выбрать;
• где искать первых пользователей без бюджета;
• как не потратить полгода на продукт, который никто не купит.
В комьюнити Короче, капитан выработали формулу:
найти существующий спрос ➡️ собрать минимальную версию продукта ➡️ протестировать на реальных пользователя
И это работает в разных нишах:
— Парень в одиночку собрал Telegram-игру с AI и заработал около $1500 за первые полтора месяца;
— Девушка без навыков программирования запустила AI-бота для изучения английского и получила первые ~$200 уже в первый месяц;
— У другого участника коммьюнити сервис для тренировки китайского произношения вырос до $4000 в месяц без затрат на рекламу — за счёт Google и продвижения внутри сторов.
Это не истории про «гениальную идею» и миллионы через неделю. А примеры того, как маленький продукт можно запустить без команды и инвестиций. Получить результат, а уже потом решать, стоит ли его масштабировать.
В канале @its_capitan:
• разбирают такие проекты
• делятся реальными цифрами
• показывают, где были ошибки
Подписывайтесь, чтобы знать, как надо и НЕ надо запускать продукты.
This media is not supported in your browser
VIEW IN TELEGRAM
В браузере запустили полноценного агента для программирования на модели всего с 2 млрд параметров.
Pi полностью работает внутри браузера через WebGPU. В основе лежит MiniCPM5-2B, Transformers.js и четырёхбитные веса ONNX.
Все предыдущие попытки создать подобного агента провалились, но MiniCPM5 оказалась достаточно мощной, чтобы сделать его пригодным для реальной работы.
Модель загружается один раз и занимает около 1,84 ГБ. После этого агент может работать с вашими файлами прямо в браузере.
Попробовать уже можно на Hugging Face.🤖
Pi полностью работает внутри браузера через WebGPU. В основе лежит MiniCPM5-2B, Transformers.js и четырёхбитные веса ONNX.
Все предыдущие попытки создать подобного агента провалились, но MiniCPM5 оказалась достаточно мощной, чтобы сделать его пригодным для реальной работы.
Модель загружается один раз и занимает около 1,84 ГБ. После этого агент может работать с вашими файлами прямо в браузере.
Попробовать уже можно на Hugging Face.
Please open Telegram to view this post
VIEW IN TELEGRAM
3