AI for Devs
17.5K subscribers
416 photos
123 videos
372 links
По сотрудничеству пишите в личные сообщения канала.

Канал для разработчиков про AI. Модели, ИИ-агенты, практические кейсы и новости из мира AI. Всё, что можно применить в работе.
Download Telegram
⚡️ Low, medium, high или max: выбираем effort для модели

Инженер Anthropic разобрал на примерах, что меняется при переключении effort в Claude Code. Если вы до сих пор не уверены, какой уровень ставить, вот короткая шпаргалка.

TL;DR: Чем выше effort, тем больше Claude сам принимает решений, проверяет результат и ищет крайние случаи.

• Low — наброски, обсуждение идей и простые правки, когда хочется быстро получить ответ и продолжить диалог
• Medium — обычная разработка, в том числе реализация новых фич
• High — баги в существующем коде и задачи, где важно тщательно проверить результат
• Max — сложная автономная работа от начала до конца, например сборка приложения или поиск уязвимостей в критичном ПО

На расплывчатых задачах высокий effort означает ещё и больше предположений, которые Claude сделает за вас. Поэтому Тарик предлагает сначала уточнить требования, собрать первую версию на low или medium, посмотреть, правильно ли Claude понял задачу, а затем переключиться на high для тестов и проверки.


На самом деле выбор effort руками сейчас выглядят странновато) В Projects Claude уже сам понимает, к какой сессии отнести задачу, а effort по промпту мы по-прежнему должны настраивать самостоятельно.

Ждём для effort что-то вроде Auto mode для аппрувов, ну или настраиваем Jev.

@ai_for_devs
1👍67❤19💯11🔥3⚡1
⚡️ OpenClaw удалили 400 тысяч строк тестов, которые ничего не проверяли

Мы уже разбирали Caveman, rtk и Ponytail скиллы из серии статей от JetBrains. Первые два не дали обещанной экономии, а Ponytail действительно сократил и код, и расходы.

Нашёлся ещё один полезный скилл: test-audit от создателя OpenClaw Питера Штайнбергера.

Питер рассказал, что из проекта удалили около 400 тысяч строк тестов, а покрытие почти не изменилось. По его словам, модели любят писать тест на каждое мелкое изменение, даже когда пользы от него нет.


test-audit просит агента перед каждым новым тестом объяснить, какое поведение тот защищает, какую ошибку поймает и почему существующих проверок недостаточно.

@ai_for_devs
1👍92🔥20🤯11❤7⚡3
⚡️ Anthropic выпустили Claude Sonnet 5.5: на 30% быстрее и до 30% дешевле

На Terminal-Bench 4.0 новинка набрала 70,6% против 10,3% у Sonnet 5 и даже обошла Opus 5.5 с 66,4%.

Стоиомость в API осталась прежней — $2/$10 за миллион входных и выходных токенов, но благодаря меньшему расходу токенов одна задача обходится дешевле.


Впрочем, Opus 5.5 и так оказался неожиданно эффективным: даже на подписке за $20 он очень медленно съедает лимиты.

Остаётся надеяться, что после релиза Sonnet 5.5 Anthropic не понерфят Opus.

@ai_for_devs
1👍65🔥30❤7⚡5🤯3
⚡️ OpenAI возвращают подписку за $200, но с новыми условиями

Представитель компании рассказал, как изменится текущий самый дорогой тариф. Коротко по пунктам:

– Pro за $200 снова откроют для новых подписчиков, но поменяют подсчёт использования. В пересчёте на стоимость API включённый объём станет вдвое меньше, чем раньше.

– Лимит на 5 часов возвращать не будут. Недельный запас можно тратить тогда, когда удобно.

– Сделать обещают больше, чем месяц назад на том же Pro. Объясняют это ростом эффективности моделей. Дальше обещают больше работы и выше качество за те же деньги.

– Цены API продолжат снижать. По словам представителя, GPT-6 Sol и Luna уже подешевели вдвое. Искусственно завышать прайс ради «выгодности» подписки не хотят.

– В перспективе разница между подпиской и API за тот же доллар должна сократиться, чтобы большинству было разумно покупать использование по мере необходимости.

– На DevDay представят фичи, которые не расходуют лимиты. Какие именно — пока секрет.


Пока такие вводные. Вечером нас ждёт DevDay, посмотрим, что ещё положат в подписку за $200)

@ai_for_devs
1👍51🤯29❤8🔥4⚡3
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ OpenAI DevDay [2026]: 20+ анонсов, новый агент и подписка за $500

Сегодня OpenAI проведут свою ежегодную конференцию для разработчиков. Обычно к DevDay готовят крупные релизы, а в этом году обещают показать больше 20 новинок.

Что ждём по тизерам и утечкам:

• Новый постоянно работающий агент — «o», или Aeon. Что-то в духе Grok Bot: помощник, которому можно делегировать долгие задачи. Цветные сферы в тизерах выглядят как жирный намёк, а упоминание «o, your always-on assistant» уже заметили в интерфейсе подписки.

• ChatGPT Pro Max за $500 в месяц. Про этот тариф мы уже рассказывали. Вероятно, представят именно сегодня: в утечке обещают более быстрые Work и Codex, но конкретные лимиты пока неизвестны.

• Объединение ChatGPT и Work, обновления агентных инструментов и, возможно, первая демонстрация собственного физического устройства. Эти пункты пока на уровне слухов, особенно железка.

• Новую флагманскую модель мы сегодня вряд ли увидим. По сообщению WSJ, запланированный на октябрь выпуск GPT-6.1 Astra отменили из-за проблем с безопасностью: модель чаще скрывала свои действия и выходила за рамки разрешённого.


Начало трансляции сегодня в 20:00 МСК: https://openai.com/live/

@ai_for_devs
1🔥29👍19⚡7🤯4
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ OpenAI представили dots [DevDay 2026]

Персональный агент на базе Astra, по сути OpenClaw в удобном интерфейсе.

С ним можно общаться в ChatGPT, голосом и в мессенджерах, а для доступа к сервисам доступно 4 тысячи коннекторов.


У агента есть свой браузер и виртуальный компьютер, а по мере использования он подстраивается под вас и ваши задачи.

Трансляция тут: https://openai.com/live/

@ai_for_devs
3🤯36🔥22👍14❤5⚡5
⚡️ OpenAI обновили GPT-6.1 Sol

Параллельно с трансляцией всем стала доступна новая версия Sol.

Модель приблизилась к Astra на бенчмарках, а цены на токены в API в пять раз ниже.

В DeepSWE 1.1 новая Sol достигла уровня Astra и уверенно обошла предыдущую Sol.


Цена — $2 за миллион входных токенов, $10 за выходные и $0,10 за кэшированный вход.

@ai_for_devs
1🔥57🤯21👍9⚡8😁2
⚡️ DevDay 2026 подошел к концу

Помимо главных новинок, также показали:

• Тариф Pro Max за $500/мес — новый x25. И эксклюзивный Ultrafast для Astra в Codex: ускорение в 8 раз (~300 токенов/с)

• Codex — добавили голосовое управление и команду /agents в CLI, облачные задачи с доступом с телефона и отдельный интерфейс для код-ревью.

• Decisions API — Luna выбирает ответ из заданных вариантов: классифицирует контент, маршрутизирует запросы и определяет следующий шаг агента. Пока в ограниченном превью. Jev оказал влияние)


P.S. Без подарков тоже не обошлось: всем пользователям выдали сброс лимитов, а участникам DevDay вручили по тамагочи от OpenAI 👍

Все подробности по анонсам в обзоре OpenAI.

@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥42👍27🤩4❤2⚡2
⚡️ Anthropic опубликовали лучшую рекламу GLM

Помните пост про abliterated-модели, у которых можно ослабить привычку отвечать «извините, я не могу вам с этим помочь»?

Anthropic проделали это с GLM-5.3. В среднем по трём тестам доля отказов упала примерно с 95% до 6%. На остальных бенчмарках способности модели при этом практически не изменились.

На ExploitBench модель получила 12% успешных попыток разработки полноценного эксплойта против 14% у Mythos Preview.


При этом веса GLM доступны всем, а Mythos Preview дают попробовать только избранным компаниям из США.

В общем, неплохой отзыв от конкурента для лаборатории из Китая)

@ai_for_devs
2🔥64😁44👍13🤯8❤1
⚡️ Google представили Gemini 4 Argon

По заявлениям компании, новая модель обошла флагманы OpenAI и Anthropic в большинстве опубликованных бенчмарков.

Только посмотрите на картинку: кажется, гонку ИИ можно сворачивать.

Однако мы уже рассказывали про попытки Google и Meta забенчмаксить всё, что можно забенчмаксить.

На свежем Terminal-Bench 4.0 Argon уступает всем трём конкурентам из таблицы, а на FrontierSWE v2 проигрывает и Astra, и Opus 5.5.

Это относительно свежие бенчмарки, и мы бы ориентировались именно на них.


К сожалению, проверить всю мощь модели самим пока не получится: общего доступа нет, выдают только отдельным специалистам по кибербезопасности и ранним тестировщикам.

Стартовая цена API составит $2/$10. Далее её увеличат до $4/$20, ровно как у Opus 5.5.

@ai_for_devs
1👍34🔥16😁13🤯4⚡2