Forwarded from Федор
Как лучше промптить Claude Opus 5
Opus 5 сильнее всего в сложных агентных задачах: больших фичах, рефакторинге и поиске багов. Чтобы получить лучший результат:
— Давайте полную постановку задачи сразу и не дробите работу без необходимости.
— Явно задавайте длину ответа: параметр effort влияет прежде всего на «мышление», а не на многословность.
— Для экономии начинайте с
— Не перегружайте промпт требованиями «перепроверить всё» и «обязательно запустить агента для верификации» — модель и так хорошо самопроверяется, лишние инструкции тратят токены.
— Чётко ограничивайте scope: модель может сама расширять задачу.
— Субагентов стоит включать только для крупных независимых потоков работы, а не для мелких задач или двойной проверки.
— Лучше не отключать thinking: при
Полная инструкция Anthropic:
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
Opus 5 сильнее всего в сложных агентных задачах: больших фичах, рефакторинге и поиске багов. Чтобы получить лучший результат:
— Давайте полную постановку задачи сразу и не дробите работу без необходимости.
— Явно задавайте длину ответа: параметр effort влияет прежде всего на «мышление», а не на многословность.
— Для экономии начинайте с
low или medium; xhigh оставляйте для действительно сложной разработки.— Не перегружайте промпт требованиями «перепроверить всё» и «обязательно запустить агента для верификации» — модель и так хорошо самопроверяется, лишние инструкции тратят токены.
— Чётко ограничивайте scope: модель может сама расширять задачу.
— Субагентов стоит включать только для крупных независимых потоков работы, а не для мелких задач или двойной проверки.
— Лучше не отключать thinking: при
low effort обычно качество выше при сопоставимой стоимости.Полная инструкция Anthropic:
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
Claude Platform Docs
Prompting Claude Opus 5
Behavioral differences and prompting patterns for Claude Opus 5, covering response verbosity, agentic narration, task scoping, subagent delegation, self-correction, and output artifacts when thinking is disabled.
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
Я всё это смотреть не буду.
Теперь и не нужно — появился опенсорс скилл, который позволяет Claude разбирать видео по ссылке почти как человек.
Он работает с YouTube, Loom, TikTok, локальными файлами и всем, что поддерживает
yt-dlp.С его помощью агент может разобрать запуск конкурента по хукам, визуалу и структуре, найти баг по записи экрана, сделать краткое резюме длинного выступления с точными таймкодами или вытащить из продуктового видео только реальные изменения без маркетинга.
Под капотом
yt-dlp сначала забирает доступные субтитры, а ffmpeg извлекает кадры с учётом смены сцен, чтобы не тратить токены на десятки одинаковых изображений. Claude получает кадры с таймкодами, а если субтитров нет, подключается Groq Whisper.Для Claude Code:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Для Codex, Cursor и Gemini CLI:
npx skills add bradautomates/claude-video -g
p.s. Для видео длиннее 10 минут лучше указывать нужный фрагмент через
--start и --end, иначе полный разбор может заметно расходовать токены.Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Федор
Агенты наконец-то перестают драться с человеком за браузер.
На GitHub сегодня резко выстрелил ego (lite) — отдельный Chromium-браузер для совместной работы человека и CLI-агента. Идея здесь не в очередной Playwright-обёртке: Claude Code, Codex или Cursor получают свой изолированный Space внутри того же браузера, пока мои обычные вкладки остаются нетронутыми. Можно параллельно отдать агенту несколько задач — например, собрать лиды из залогиненного CRM, пройти внутреннюю админку или сверить данные в SaaS — и не наблюдать, как он уводит мышь и закрывает нужные табы.
Технически агент работает через skill
Самая полезная и одновременно опасная часть — при онбординге можно перенести из Chrome профиль, cookies, расширения и активные логины. После этого агент реально способен работать там, где нет нормального API: в закрытой админке, CRM, почте, аналитике. Но это не «безобидный браузерный skill»: агент получает доступ к уже авторизованным сессиям. Для финансовых, продовых и личных аккаунтов я бы сначала завёл отдельный профиль с минимальными правами и оставил подтверждение на любые необратимые действия.
Пока только macOS; репозиторий и skill открыты под MIT, а сам браузер скачивается отдельно. Сегодня проект в GitHub Trending набрал около тысячи звёзд за сутки — хороший индикатор, что сценарий «агент работает в моей реальной веб-среде, но не ломает мои вкладки» становится отдельной категорией инструментов.
GitHub: https://github.com/citrolabs/ego-lite
Релиз v1.2.5: https://github.com/citrolabs/ego-lite/releases/tag/v1.2.5
Документация: https://lite.ego.app/document/en/docs/quick-start
На GitHub сегодня резко выстрелил ego (lite) — отдельный Chromium-браузер для совместной работы человека и CLI-агента. Идея здесь не в очередной Playwright-обёртке: Claude Code, Codex или Cursor получают свой изолированный Space внутри того же браузера, пока мои обычные вкладки остаются нетронутыми. Можно параллельно отдать агенту несколько задач — например, собрать лиды из залогиненного CRM, пройти внутреннюю админку или сверить данные в SaaS — и не наблюдать, как он уводит мышь и закрывает нужные табы.
Технически агент работает через skill
ego-browser: вместо длинной цепочки CLI-вызовов он отправляет JavaScript, который за один проход вызывает snapshot/fill/click/navigate. Авторы обещают меньше tool calls и приводят собственный benchmark до 2,5× быстрее против Vercel agent-browser — это именно их замеры, а не независимый тест.Самая полезная и одновременно опасная часть — при онбординге можно перенести из Chrome профиль, cookies, расширения и активные логины. После этого агент реально способен работать там, где нет нормального API: в закрытой админке, CRM, почте, аналитике. Но это не «безобидный браузерный skill»: агент получает доступ к уже авторизованным сессиям. Для финансовых, продовых и личных аккаунтов я бы сначала завёл отдельный профиль с минимальными правами и оставил подтверждение на любые необратимые действия.
Пока только macOS; репозиторий и skill открыты под MIT, а сам браузер скачивается отдельно. Сегодня проект в GitHub Trending набрал около тысячи звёзд за сутки — хороший индикатор, что сценарий «агент работает в моей реальной веб-среде, но не ломает мои вкладки» становится отдельной категорией инструментов.
GitHub: https://github.com/citrolabs/ego-lite
Релиз v1.2.5: https://github.com/citrolabs/ego-lite/releases/tag/v1.2.5
Документация: https://lite.ego.app/document/en/docs/quick-start
GitHub
GitHub - citrolabs/ego-lite: The fastest browser for AI agents to run browser automation, built for sharing your logged-in browser…
The fastest browser for AI agents to run browser automation, built for sharing your logged-in browser state with your AI agents, like Codex or Claude Code, without disturbing you. Zero cost, zero c...
Сегодня про браузеры - мы очень быстро придем к тому, что браузеры будут особенно и не нужны в том виде, как мы их используем сейчас - будем просто спрашивать своих агентов, что нужно.
https://t.me/vibecoding_tg/3582
https://t.me/vibecoding_tg/3582
Telegram
Вайб-кодинг
А что, так можно было: существует браузер для ИИ-агентов и веб-скрейпинга, который не тащит за собой полноценный Chrome.
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой…
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой…
Ну и правда, то ли у нас SOTA для запуска на локальных машинках, то ли бенчмарки хакнули..
https://t.me/machinelearning_interview/2910
https://t.me/machinelearning_interview/2910
Telegram
Machine learning Interview
KAT-Coder-V2.5-Dev: 35B параметров, но активны только 3B
KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработки на базе Qwen3.6-35B-A3B.
На каждом токене используется около 3 млрд параметров, при этом результаты выглядят серьёзно:
- 69…
KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработки на базе Qwen3.6-35B-A3B.
На каждом токене используется около 3 млрд параметров, при этом результаты выглядят серьёзно:
- 69…
Forwarded from Denis Sexy IT 🤖
В выходные потестировал еще один популярный скилл, который называется ponytail –
он пытается сделать из кодинг агента, такого душного чувака с хвостиком, который с самым большим ЧСВ на свете программирует бекенд какой-то корпорации за 300кк в секунду
И на удивление, оказалось, что если этот скилл подключить через хук (ну то есть, чтобы он вызывался всегда а не по настроению агента) – скилл правда экономит ~10% токенов, и даже больше иногда
Тут все детали:
https://blog.jetbrains.com/ai/2026/07/ponytail-skill-claude-tested/
(последний час теста, я анимировал хвостик на аватарке)
💎
🌝
он пытается сделать из кодинг агента, такого душного чувака с хвостиком, который с самым большим ЧСВ на свете программирует бекенд какой-то корпорации за 300кк в секунду
И на удивление, оказалось, что если этот скилл подключить через хук (ну то есть, чтобы он вызывался всегда а не по настроению агента) – скилл правда экономит ~10% токенов, и даже больше иногда
Тут все детали:
https://blog.jetbrains.com/ai/2026/07/ponytail-skill-claude-tested/
(последний час теста, я анимировал хвостик на аватарке)
Please open Telegram to view this post
VIEW IN TELEGRAM
The JetBrains Blog
Ponytail Skill for Claude Code: Does It Really Cut Tokens
Part 3 of a series where we take public "token saver" add-ons for coding agents and run the same paired A/B benchmark against each of them. Part 1 was the caveman skill (advertised −65%, measured −8.5
OpenAI сделали специальную программу для поиска проблем с безопасностью. Опенсорс. Ну что, отлично, не помешает..
https://github.com/openai/codex-security
https://github.com/openai/codex-security
GitHub
GitHub - openai/codex-security: OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities.…
OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities. npm: https://www.npmjs.com/package/@openai/codex-security - openai/codex-security
Очень впечатляющая история - своего рода первая ласточка. В Америке сейчас в связи с этим проходят конкурсы открытых писем и большой срач между конторами.
Ну и на этом фоне интересно, что проект Ильи Суцкевера по безопасным моделям не умер, а получил еще 5 ярдов от NVIDIA. Видимо, тема актуальна как никогда.
Да, есть ощущение, что и на рынке крипты как никогда много успешных атак. Очевидные жертвы
Ну и на этом фоне интересно, что проект Ильи Суцкевера по безопасным моделям не умер, а получил еще 5 ярдов от NVIDIA. Видимо, тема актуальна как никогда.
Да, есть ощущение, что и на рынке крипты как никогда много успешных атак. Очевидные жертвы
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Forwarded from эйай ньюз
OpenAI сбросили цены на GPT 5.6
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Luna теперь дешевле в пять раз, всего $0.2/$1.2 за миллион токенов, против $1/$6 на релизе. Цену Terra сбросили на 20%, до $2/$12 за миллион токенов. Понижение цен касается не только API, но и квоты в Codex/ChatGPT Work. Sol не получил понижения цены, но для него выпустили Fast режим, который в 2.5x быстрее по 2x цене, но про дату релиза Sol запущенного на железе Cerebras OpenAI всё ещё молчат.
@ai_newz
Forwarded from Вайб-кодинг
This media is not supported in your browser
VIEW IN TELEGRAM
WTF: Этот CLI вытаскивает дизайн-систему из любого сайта
Просто передаёте URL, а он достаёт цвета, типографику, отступы, границы, тени, компоненты, брейкпоинты, моушен-токены и даже генерирует
Фронтендеры, вайбкодеры и дизайнеры теперь могут закрыть DevTools. И открыть терминал.✋
https://dembrandt.com
Просто передаёте URL, а он достаёт цвета, типографику, отступы, границы, тени, компоненты, брейкпоинты, моушен-токены и даже генерирует
DESIGN.md.Фронтендеры, вайбкодеры и дизайнеры теперь могут закрыть DevTools. И открыть терминал.
https://dembrandt.com
Please open Telegram to view this post
VIEW IN TELEGRAM
River AI: как обучить собственную GLM-5.2 без GPU
River AI — новый сервис для дообучения open-source моделей через LoRA и reinforcement learning. Можно взять базовую Qwen, Kimi или GLM-5.2 и получить специализированный checkpoint под конкретную задачу.
Создатель и CEO River — Игорь Бабушкин. Ранее он работал над ИИ в DeepMind, OpenAI и xAI; River позиционирует себя как инфраструктуру для персонального, контролируемого пользователем ИИ.
Что даёт сервис:
— дообучение модели на своих примерах;
— RL с собственной функцией награды;
— хранение checkpoint;
— инференс через OpenAI-совместимый API без своих GPU.
Цены для GLM-5.2 с контекстом 32k:
— обучение: $4,40 за 1 млн токенов;
— вход при инференсе: $1,46 / 1M;
— выход: $3,67 / 1M;
— хранение: $0,10/ГБ в месяц.
Пример: запрос с 5 тыс. токенов входа и ответом на 1 тыс. токенов будет стоить примерно $0,011.
Но актуальные знания и документы лучше оставлять в RAG. Дообучение полезнее для устойчивых вещей — формата ответа, стиля, классификации, последовательности действий и проверки результата.
За стиль простите, лень переписывать за кло..
River AI — новый сервис для дообучения open-source моделей через LoRA и reinforcement learning. Можно взять базовую Qwen, Kimi или GLM-5.2 и получить специализированный checkpoint под конкретную задачу.
Создатель и CEO River — Игорь Бабушкин. Ранее он работал над ИИ в DeepMind, OpenAI и xAI; River позиционирует себя как инфраструктуру для персонального, контролируемого пользователем ИИ.
Что даёт сервис:
— дообучение модели на своих примерах;
— RL с собственной функцией награды;
— хранение checkpoint;
— инференс через OpenAI-совместимый API без своих GPU.
Цены для GLM-5.2 с контекстом 32k:
— обучение: $4,40 за 1 млн токенов;
— вход при инференсе: $1,46 / 1M;
— выход: $3,67 / 1M;
— хранение: $0,10/ГБ в месяц.
Пример: запрос с 5 тыс. токенов входа и ответом на 1 тыс. токенов будет стоить примерно $0,011.
Но актуальные знания и документы лучше оставлять в RAG. Дообучение полезнее для устойчивых вещей — формата ответа, стиля, классификации, последовательности действий и проверки результата.
За стиль простите, лень переписывать за кло..
Ну, кстати, цены на Luna действительно интересные, чтобы пробовать модель даже по апи…
https://t.me/vibecoding_tg/3597
https://t.me/vibecoding_tg/3597
Telegram
Вайб-кодинг
OpenAI бросила вызов дешёвому интеллекту из Китая:
OpenAI снизила цену GPT-5.6 Luna на 80% — до $0,20 за миллион входных токенов и $1,20 за миллион выходных.
Terra подешевела на 20% — до $2/$12 соответственно. Теперь Luna в 25 раз дешевле Sol.
Изменения…
OpenAI снизила цену GPT-5.6 Luna на 80% — до $0,20 за миллион входных токенов и $1,20 за миллион выходных.
Terra подешевела на 20% — до $2/$12 соответственно. Теперь Luna в 25 раз дешевле Sol.
Изменения…
Я эту модель в прошлом исполнении использовал для отдельных задач - это было выгодное предложение. А текущая модель по бенчам так и вообще сильнее старшей версии. Если нужна модель по апи - однозначно, один из лучших вариантов
https://t.me/data_analysis_ml/5531
https://t.me/data_analysis_ml/5531
Telegram
Анализ данных (Data analysis)
DeepSeek запустила официальный API модели V4-Flash и заметно улучшила её работу в агентных сценариях.
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности…
По тестам компании, новая версия значительно опережает V4-Pro-Preview в задачах, связанных с кодом и автономными агентами.
Что изменилось:
- усилены возможности…
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1👏1🎉1
В таких харнесах, правда, есть проблема - их надо подключать по апи. Но можно использовать с GLM или DeepSeek, например.
У chatGPT в настройках для Luna есть уровень Max, который по умолчанию недоступен. Говорят, что моделька на этом уровне выступает очень даже сильно, при том, что стоит в разы дешевле Terra и Sol. Попробуйте
На просторах интернета нашел программку, которая переводит экран браузера в темную тему - после того, как начал пользоваться терминалом, постепенно перешел на черный цвет везде..
Dark Reader
Dark Reader — dark theme for every website
Dark mode for every website. Take care of your eyes, use dark theme for night and daily browsing. For Chrome and Firefox, Edge and Safari.
Вышел Qwen-3.8 Max на 2.4Т параметров. Теперь это - не опенсорс. Но, может, хотя бы маленькие модели откроют.
PS. Алибаба написала, что все-таки веса откроют. Заодно и метрики подоспели
PS. Алибаба написала, что все-таки веса откроют. Заодно и метрики подоспели
X (formerly Twitter)
Qwen (@Alibaba_Qwen) on X
Meet Qwen3.8-Max: A New Bar for Coding and Cowork.
very vibe coding
У chatGPT в настройках для Luna есть уровень Max, который по умолчанию недоступен. Говорят, что моделька на этом уровне выступает очень даже сильно, при том, что стоит в разы дешевле Terra и Sol. Попробуйте
Совет использовать Luna для агентской работы был ошибкой - об этом говорят и разработчики из OpenAI. Нужно подниматься до Терры.
X (formerly Twitter)
eric provencher (@pvncher) on X
I understand there's a lot of desire to get Luna used as a sub agent.
I do not recommend messing with your model catalog to force capabilities that are not natively exposed.
Multi agents v2 requires proactive inter agent communication, which only Sol and…
I do not recommend messing with your model catalog to force capabilities that are not natively exposed.
Multi agents v2 requires proactive inter agent communication, which only Sol and…