AI for Devs
15K subscribers
302 photos
104 videos
281 links
По сотрудничеству пишите в личные сообщения канала.

Канал для разработчиков про AI. Модели, ИИ-агенты, практические кейсы и новости из мира AI. Всё, что можно применить в работе.

Технологический партнер: veai.ru
Download Telegram
⚡️ OpenAI показали GPT-5.6: семейство Sol, Terra и Luna

Под конец недели OpenAI выпустили GPT-5.6 — но только узкому кругу партнёров, согласованных с правительством США.

GPT-5.6 разбили на три тира:
1. Sol (флагман)
2. Terra (на уровне GPT-5.5, но вдвое дешевле)
3. и Luna (быстрая и самая дешёвая)

Цены за 1M токенов (вход/выход): Sol $5/$30, Terra $2.50/$15, Luna $1/$6.

Ключевое сравнение с Mythos (Fable 5) от Anthropic идёт по кибербезопасности. На ExploitBench Sol тянется к Mythos Preview, расходуя при этом примерно треть выходных токенов.


В июле Sol запустят на Cerebras — до 750 токенов/с. Публичный доступ в ChatGPT, Codex и API обещают через пару недель.

@ai_for_devs
349🔥30👍192👌2🤩1
Так у нас год за 5 получается 🤣
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁216👍22🔥13💯94🤡2
Как не слить конфиденциальные данные в общедоступные нейросети?

Самый надежный способ — развернуть их локально на собственном сервере. Или не тратить на это время и воспользоваться готовым решением от Selectel. В каталоге готовых ИИ-моделей нейросети уже развернуты на оптимальном железе для инференса.

Что вы получаете в Selectel:

1. Большой выбор моделей для ваших задач: для генерации текста и кода, распознавания речи, создания контента и других

2. Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки

3. Прогнозируемую стоимость: платите за фактическое время потребления вычислительных ресурсов

Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/vj562
1👌20👍159🔥2
⚡️ Grok 4.5 вышел в приватную бету в SpaceX и Tesla

В основе Grok 4.5 лежит V9: новая модель, которую xAI обучали с нуля вместе с инженерами из Cursor на их данных.

Модель втрое больше предыдущей: 1.5 триллиона параметров против 0.5T у v8-small (Grok 4.3), которая сейчас обслуживает весь продакшен трафик.

Макс отметил, что данные Cursor добавили уже после основного этапа (это менее эффективно, чем с нуля). В следующей версии на 2T параметров они войдут с самого начала.


Илон обещает по одной новой модели в месяц от SpaceX. То есть в паблик Grok 4.5 должен выйти уже в июле!

Параллельно xAI развивает Grok Build (собственный инструмент для кодинга), конкурент того же Cursor. Маск говорит, что он становится лучше с каждым днём. Делаем ставки, кого из них в итоге принесут в жертву?

@ai_for_devs
1👍44127🔥6👏1🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
Холли-молли...

🤯 А чё, так можно было что ли!?
🤡 Ну ты и дед...
3🤯158🤡28👍3
⚡️ Claude Sonnet 5: Anthropic обновили главную рабочую лошадку

Позиционируется как самый агентный Sonnet. По качеству близка к Opus 4.8, но дешевле.

Цены: $2 за млн входных и $10 за млн выходных токенов до 31 августа, с 1 сентября $3/$15.

Обновили токенайзер, входные тексты занимают на 0–35% больше токенов, чем в предыдущих версиях.


По рассуждению, использованию инструментов, написанию кода и задачам на знание строгое доминирование над Sonnet 4.6. На многих бенчмарках Opus 4.8 по-прежнему впереди.

Наконец-то что-то для просто народа!)

@ai_for_devs
1🤩3727👍18🔥32
⚡️ Anthropic "возвращают" доступ к Fable 5

Экспортные ограничения на Fable 5 и Mythos 5 сняли вчера, 30 июня, модель обещают сделать доступной всем уже сегодня. Но "всеобщий" доступ с оговорками.

1. На Pro/Max/Team Fable 5 входит в подписку только в пределах 50% недельного лимита и только до 7 июля. Дальше исключительно через usage credits, то есть отдельная оплата сверху подписки, по себестоимости как за API. Для тех, у кого тариф enterprise, usage credits нужны вообще сразу, никакого бесплатного окна нет.

2. Заодно выкатили "улучшенный" классификатор безопасности. Anthropic сами пишут, что он чаще блокирует безобидные запросы на обычном кодинге и дебаге. В те пару дней, что модель уже была доступна в июне, часть пользователей и так жаловалась на запросы, которые без видимой причины перекидывало на Opus 4.8. С новым классификатором таких случаев станет только больше.

3. Anthropic согласились, что релизы топовых моделей теперь идут через расширенный ранний доступ для правительства США: Минторг, CAISI и профильные ведомства получают модели и защитные механизмы до публичного релиза. Тут без комментариев))

В общем да, сегодня Fable 5 снова станет доступна "всем" 🙂

@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
132👍2914🤯7😢5🔥1💯1
This media is not supported in your browser
VIEW IN TELEGRAM
Fable 5 is back.
1🔥66👍19🤯1465🤩3
⚡️ Z.ai выпустили крупное обновление ZCode

Альтернатива Claude Code и Codex от создателей GLM-5.2 уже доступна для всех OS.

Их собственный ZCode Agent заточен под GLM-5.2, но через BYOK можно подключить свои подписки OpenAI, Anthropic и других провайдеров.

Новым пользователям дают 5 дней бесплатного доступа с повышенным дневным лимитом: хороший повод протестировать китайский флагман.


Подписчикам GLM Coding Plan квота в ZCode в 1.5 раза выше обычной.

P.S. GLM в ZCode доступна из России без VPN.

@ai_for_devs
1🔥66👍26155🤩2
⚡️ Fable 5 снова в строю: модель уже доступна в Veai

По бенчмаркам отрыв безоговорочный: Fable 5 обходит и Opus 4.8, и GPT-5.5 почти во всём, от кода и работы с компьютером до юридических задач и медицины. На SWE-Bench Pro, например, у неё 80.3% против 69.2% у Opus 4.8, а в кибербезопасности разрыв с Opus почти вдвое.

⚠️ Модель дорогая и "думает" много, поэтому токены на ней сгорают сильно быстрее обычного. Будьте бдительны!


Всем новым пользователям Veai даём 30 дней бесплатного триала. Поделитесь этой инфой с друзьями, они будут благодарны)

https://veai.ru/products

Если Fable 5 покажется слишком прожорливой и долгодумающей, в Veai есть ещё больше десятка моделей: Sonnet 5, Opus 4.8, GPT-5.5, Gemini, GLM, DeepSeek, Kimi. Переключиться можно в любой момент.

@veai_devs
1👌25👍168🔥1
⚡️ Слепые зоны в промптинге: полный гайд по Fable 5

Инженеры из Anthropic порадовали новой статьёй о работе с Fable 5. Главных выводов из этого материала два.

Первый, про важность промпта.

Даже с такими моделями, как Fable 5, результат упирается не в возможности модели, а в то, насколько чётко вы умеете сформулировать, чего хотите. Если пережмёте с конкретикой, то модель послушно идёт по инструкции даже там, где стоило бы свернуть в сторону. Чуть недожмёте, и модель добирает недостающее из усреднённых практик индустрии, которые не всегда подходят именно вам.

Второй, про собственное эго.

Призвайтесь честно, чего вы не знаете. Если задача выходит за рамки вашей экспертизы, быть самым глупым в комнате (даже с бездушными LLM) – нормально.

И в первом и во втором случаях, помогает деление задачи на четыре типа неизвестных:

1. Известное известное: то, что реально прописано в промпте
2. Известное неизвестное: то, что вы осознаёте, что ещё не выяснили
3. Неизвестное известное: то, что очевидно, но вы никогда бы это не записали
4. Неизвестное неизвестное: то, о чём вы вообще не задумывались


Примеры поиска всех типов неизветных в формате Claude Artifacts тут.

📚 Читайте и комментируйте на Хабр: https://habr.com/ru/articles/1055458

@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥35👏1915👍12💯1
🪨 JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5%

Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub!

Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым.

Результат по 82 парным задачам:

1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает.

2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82).

3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39).

Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее)

@ai_for_devs
1🗿64👍4012🤩5💯3🔥1
⚡️ Лайфхак: контролируем лимиты Claude

Скользящее 5-часовое окно может застать врасплох: оно стартует только с вашего первого сообщения.

Чтобы всегда точно знать, когда начнётся 5-часовая сессия и когда обнулится, создайте простейшую routine (ping-pong) на запуск по расписанию. Например, каждый день в 0, 5, 10, 15 и 20 часов (cron 0 0,5,10,15,20 * * *). Тогда окно стартует в фиксированное время, а не когда придётся.

Время можно подогнать под сброс почти вплотную к своим пиковым часам (их, кстати, можно спросить у самого Claude).


В итоге садитесь за комп, сжигаете первую сессию за час и сразу катите следующую — предыдущая стартанула задолго до того, как вы подошли к компу. Profit!

@ai_for_devs
2🔥88👍42👏9🤯76💯2
Anthropic продлили доступ к Fable на всех платных тарифах до 12 июля!

Казнить нельзя помиловать

@ai_for_devs
1🔥80😁2015👍10
⚡️ Российская LLM Koda Pro почти сравнялась с Claude Sonnet и Opus

KodaCode выпустили версию 1.0 своего плагина для VS Code. Вместе с релизом агента обновили и флагманскую LLM.

На SWE-bench Verified новая Koda Pro на основе GLM 5.2 набрала 77.4% (у Claude Sonnet 5 на этом же бенче 78.8%, у Claude Opus 4.8 результат 83%).

В агента для VS Code, JetBrains и CLI добавили маркетплейс MCP и скиллов, просмотр diff прямо в чате и починили зависания на длинных сессиях.

Telegram-интеграция раньше работала только в VS Code, теперь доступна в JetBrains и CLI.


Также выкатили подключение российских провайдеров моделей без VPN.

@ai_for_devs
1👍103🤯58🔥23175
⚡️ Cursor выпустили Grok 4.5: флагман уровня Opus, обучали вместе со SpaceXAI

«Opus-класс, но быстрее, экономнее по токенам и дешевле» — так Маск описал модель в X.

Уже доступна в Grok Build, в Cursor на всех тарифах.

На первую неделю дают двойные лимиты и уточняют: у Grok 4.5 и Composer разные весовые категории.

Composer 2.5 остаётся в строю, новые модели этого размера продолжат выходить отдельно.


Цена: $2/$6 за млн токенов (input/output). Для сравнения, у Opus 4.8 — $5/$25.

@ai_for_devs
1🔥66🤯12👍1075
⚡️ Через 5 минут смотрим релиз GPT-5.6 Sol

Sol — флагманская модель нового поколения от OpenAI, по слухам последняя в серии 5.x. Дальше компания переходит на нейминг 6+.

Модель почти месяц была в закрытом превью для избранных партнёров по запросу властей США, сегодня открывают публичный доступ.

Стрим здесь: https://youtu.be/Wq45rvPGNHs

@ai_for_devs
1👍33🤩14🔥1263
⚡️ Линейку моделей GPT-5.6 раскатили на всех

Модель уже доступна всем пользователям Codex, её добавили в Cursor, JetBrains Air и в десяток других самых популярных агентов.

На части бенчмарков Sol обходит Fable 5, в том числе в кодинге. Главный акцент OpenAI делают на цене и скорости: тех же результатов Sol добивается вдвое быстрее и примерно на треть дешевле.

Цена за 1М токенов: Sol $5/$30, Terra $2.50/$15, Luna $1/$6.

Также OpenAI выпустили аналог Artifacts у Claude Code — назвали ChatGPT Sites, собирать сайты и мини-приложения прямо в Codex.

И раскатали ChatGPT Work — по сути слияние ChatGPT и Codex в одном приложении, уже можно скачать на macOS, версии для Windows как обычно обещают позже.


А для тех, кто сидит на Claude, а не на Codex — Anthropic прямо сейчас сбросили недельные лимиты, чтобы никто никуда не переметнулся 😄 В общем, сегодня в плюсе все!

@ai_for_devs
1🔥95👍221412🤯4
⚡️ Поменять модель или повысить effort?

Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.

Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?

Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.

Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.

Отсюда принцип работы с крутилками:

1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.

Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.

@ai_for_devs
161👍34🔥14👏2
⚡️ GitHub перестал работать в России

Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.

На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.

UPD: Github, Google и другие сайты снова доступны в России.

@ai_for_devs
1🤯80😱291510🔥8👍7👏4🤩4