Sonnet 5 уже дефолтная модель в Free и Pro, доступна в Max, Team, Enterprise, в
Claude Code и через API под именем claude-sonnet-5.По бенчмаркам (BrowseComp, OSWorld-Verified) Sonnet 5 вплотную подходит к Opus 4.8. Цифры вендора, но разрыв между Sonnet и Opus раньше был намного больше. Скорость и реальная глубина на живых задачах — проверю сам, собираюсь пересесть на неё как на основную в ближайшие дни.
Контекст — 1M токенов. Sonnet 4.6 работал на 200k. Это уже другой класс задач.
Цена. Вводная $2 / $10 за Mtok (вход/выход) до 31 августа, дальше $3 / $15.
Токенайзер. Поменяли (как с Opus 4.7): тот же текст кодируется в 1.0–1.35x больше токенов. Вводная цена это компенсирует, но только до конца августа. Плюс — effort по умолчанию стоит на
high, бюджет при переходе стоит пересчитать.Extended thinking — нет. Только adaptive thinking. Если завязан на extended thinking, Sonnet 5 его не даст.
Буду садиться и пробовать её как основную, потому что пора думать о снижении расходов с аналогичным уровнем качества ответов. Как думаете что выйдет?
🔗 Анонс
🔗 Доки
#AI #ClaudeCode #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14👎7
Если провести сравнение Sonnet 5 и Opus 4.7 то разница становится меньше, а Opus 4.7 позволяла мне достигать результатов
#AI #ClaudeCode #Anthropic
#AI #ClaudeCode #Anthropic
👎12👍5
Новый API лимит Claude Code
Помимо 5 часовых и недельныз лимитов Claude Code теперь мне просто выбивает лимит сервера и остававливает сессию работы. Это уже какой непорядок
#Claude #Anthropic
Помимо 5 часовых и недельныз лимитов Claude Code теперь мне просто выбивает лимит сервера и остававливает сессию работы. Это уже какой непорядок
#Claude #Anthropic
👎28👍1
Китай хочет закрыть доступ к своим топовым моделям из-за пределов страны
Совсем не удивлен, уже давно говорил что так и будет, когда модели достигнут определенного уровня качества ответов и глубины работы. ИИ - новое оружие и давать его всем подряд, а китайцы еще и открывали его веса, это сейчас большая роскошь. Что будут делать те, кто на основе китайских моделей делал свои пока вообще непонятно... Что опять же приводит к выводу - надо развивать ключевые компетенции и уметь создавать железо внутри своей страны, иначе будешь довольствоваться продуктами второго или ниже сорта.
Источник - Reuters
#AI
Совсем не удивлен, уже давно говорил что так и будет, когда модели достигнут определенного уровня качества ответов и глубины работы. ИИ - новое оружие и давать его всем подряд, а китайцы еще и открывали его веса, это сейчас большая роскошь. Что будут делать те, кто на основе китайских моделей делал свои пока вообще непонятно... Что опять же приводит к выводу - надо развивать ключевые компетенции и уметь создавать железо внутри своей страны, иначе будешь довольствоваться продуктами второго или ниже сорта.
Источник - Reuters
#AI
👍10👎10
Fable 5 будет доступна до 12 июля включительно. Планировали сегодня уже закрыть доступ.
Кто прямо смог ощутить разницу с Opus? Поделитесь в комментариях
#Claude
Кто прямо смог ощутить разницу с Opus? Поделитесь в комментариях
#Claude
👎10👍9
В комьюнити гуляет тезис «дизайнь луп вместо промпта», но что такое луп — трактуют кто во что горазд. Выпустили гайд от команды Claude Code по 4 типам loop:
Turn-based — базовый агентный цикл. Пишешь промпт, Claude читает контекст, редактирует, гоняет тесты, отчитывается, ты проверяешь руками. Улучшить можно, зашив ручную верификацию в
SKILL.md, чтобы Claude сам проверял результат (открыл браузер, кликнул, посмотрел консоль), а не просто отчитался «готово».Goal-based (`/goal`) — когда одного захода мало. Задаёшь достигаемый и измеримый критерий готовности, и отдельный агент evaluator гоняет Claude по кругу, пока критерий не выполнен или не достигнут лимит по кол-ву попыток:
/goal get the homepage Lighthouse score to 90 or above, stop after 5 tries.
Работает лучше всего с детерминированными метриками: число прошедших тестов, конкретный порог, кол-во минорных багов и др..
#ClaudeCode #AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11👎5
Если часть работы завязана не на запрос, а на внешнюю систему или периодичность, например PR-ы ждут ревью или сделать rebase чтобы влится, появляются креши в Crashlytics и другие, тогда можно пробовать периодические запуски.
/loop перезапускает промпт с заданным интервалом, пока работает у тебя на машине:/loop 5m check my PR, address review comments, and fix failing CI
Чтобы вынести это в облако и не держать сессию живой, есть
/schedule — уже отдельная Claude routine в облаке Anthropic, а не процесс на твоём компе.⚠️ Момент, который стоит держать в голове: `/schedule` и связанные с ним dynamic workflows пока в статусе research preview и не доступна всем. Подавать как «уже можно поставить на прод и забыть» рано.
#ClaudeCode #AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👎6👍5
Самая интересный для меня вариант loop, потому что не нужно вообще участия, а только запуск и приемка результата.
Событие или расписание триггерит работу,
/goal описывает, что считать сделанным, dynamic workflows раскидывают агентов по подзадачам (триаж, фикс, ревью), auto mode не спрашивает разрешения на каждый шаг.Пример из документации — почасовой разбор бэклога багов с ревью фикса в параллельных worktree.
Источник и подробности с примерами SKILL.md: Getting started with loops
#ClaudeCode #AI #Agents
Please open Telegram to view this post
VIEW IN TELEGRAM
👎6👍5
😂 Тесты GLM 5.2 откладываются: недельная квота сгорела быстрее, чем успел что-то толком сделать
Вышел GLM 5.2, контекст на миллион токенов, отзывы из чатов в целом неплохие. Не Opus 4.8 и тем более не Fable, но интересно было попробовать на живом проекте.
Взял GLM Coding Pro за ~$65/мес, погонял на паре параллельных задач в рабочем репозитории — ребейзы на нескольких ветках, ничего экстремального. Через день недельная квота была выжрана в ноль ⚠️ Серьёзной работы толком не успел сделать.
Тут вопрос не только к модели, но и к тарифу: Pro — не топовый план, а недельный лимит внутри месячной подписки. На Max возможно другая картина.
У кого есть свежий опыт с GLM 5.2 в агентном режиме на реальных задачах? Сколько квоты реально уходит на день работы, и есть ли смысл брать тариф выше?
#AI #GLM
Вышел GLM 5.2, контекст на миллион токенов, отзывы из чатов в целом неплохие. Не Opus 4.8 и тем более не Fable, но интересно было попробовать на живом проекте.
Взял GLM Coding Pro за ~$65/мес, погонял на паре параллельных задач в рабочем репозитории — ребейзы на нескольких ветках, ничего экстремального. Через день недельная квота была выжрана в ноль ⚠️ Серьёзной работы толком не успел сделать.
Тут вопрос не только к модели, но и к тарифу: Pro — не топовый план, а недельный лимит внутри месячной подписки. На Max возможно другая картина.
У кого есть свежий опыт с GLM 5.2 в агентном режиме на реальных задачах? Сколько квоты реально уходит на день работы, и есть ли смысл брать тариф выше?
#AI #GLM
👎10👍4
⚡️ SpaceXAI выпустила Grok 4.5 и это уже стоящий конкурент Claude Code с Sonnet/Opus
Модель доступна уже сегодня в Grok Build, во всех тарифах Cursor и в консоли SpaceXAI. Цена: $2/млн входных токенов, $6/млн выходных — заметно дешевле Opus $5/$25
Главный аргумент компании не про качество, а про эффективность: на SWE-Bench Pro Grok 4.5 тратит в среднем 15 954 токена на задачу против 67 020 у Opus 4.8 (max) — это в 4.2 раза меньше. Цена за токен падает, а реальная стоимость задачи определяется не прайсом, а тем, сколько токенов агент нажигает на решение. Попробовать можно уже сегодня в Cursor.
Цифрам доверять пока нельзя так как все тесты внутренние. DeepSWE и Terminal Bench SpaceXAI гоняла каждую модель в её собственном харнессе — Fable, GPT 5.5 и Opus тестировались не в одинаковых условиях с Grok. Пока это маркетинг и лишь заявку, а не независимое сравнение. А Маск любит такое.
Для агентных пайплайнов интереснее проверить не заявленную эффективность, а реальный расход токенов на своих задачах, а не на чужих графиках.
Однозначно покупка Cursor пошла напользу, вполне возможно, что именно их наработки и легли в основу новой модели.
#AI #Grok #Cursor
Модель доступна уже сегодня в Grok Build, во всех тарифах Cursor и в консоли SpaceXAI. Цена: $2/млн входных токенов, $6/млн выходных — заметно дешевле Opus $5/$25
Главный аргумент компании не про качество, а про эффективность: на SWE-Bench Pro Grok 4.5 тратит в среднем 15 954 токена на задачу против 67 020 у Opus 4.8 (max) — это в 4.2 раза меньше. Цена за токен падает, а реальная стоимость задачи определяется не прайсом, а тем, сколько токенов агент нажигает на решение. Попробовать можно уже сегодня в Cursor.
Цифрам доверять пока нельзя так как все тесты внутренние. DeepSWE и Terminal Bench SpaceXAI гоняла каждую модель в её собственном харнессе — Fable, GPT 5.5 и Opus тестировались не в одинаковых условиях с Grok. Пока это маркетинг и лишь заявку, а не независимое сравнение. А Маск любит такое.
Для агентных пайплайнов интереснее проверить не заявленную эффективность, а реальный расход токенов на своих задачах, а не на чужих графиках.
Однозначно покупка Cursor пошла напользу, вполне возможно, что именно их наработки и легли в основу новой модели.
#AI #Grok #Cursor
👍16👎7
Для тех кто любит рефлексировать теперь в Claude можно получить рекап за продеший месяц/квартал/полугодие/год
Переходите https://claude.ai/new#settings/reflect и делитесь результатами в комментариях
UPD Это касается только чатов а не сессия кода 😂
#Claude
Переходите https://claude.ai/new#settings/reflect и делитесь результатами в комментариях
UPD Это касается только чатов а не сессия кода 😂
#Claude
👍8👎5
Да заееее.... Meta выпустила модель для кодинга, которая на уровне Opus 4.8 и GPT 5.5. Мир AI притормози, дай перевести дух и адекватные цены за токены
👍12👎5