⚡️ xAI выпустили Grok 4.6: модель сравнялась с GPT-5.6 Sol
В CursorBench Grok обошёл GPT-5.6 Sol: 69,9% против 67,2%.
Но на DeepSWE и Terminal-Bench GPT пока заметно впереди: 73% против 65,9% и 34,6% против 26%.
Модель уже доступна в Cursor, Grok Build, API и OpenRouter.
@ai_for_devs
В CursorBench Grok обошёл GPT-5.6 Sol: 69,9% против 67,2%.
Но на DeepSWE и Terminal-Bench GPT пока заметно впереди: 73% против 65,9% и 34,6% против 26%.
Цена $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое дороже, а первую неделю в Cursor и Grok Build дают двойные лимиты.
Модель уже доступна в Cursor, Grok Build, API и OpenRouter.
@ai_for_devs
3👍43🔥25🤯11❤5⚡2
⚡️ DeepSeek обновили V4 Pro
Китайцы выкатили V4 Pro 0813: большое обновление апрельской Preview-версии модели, которое уже заменило старую модель в API.
После нового пост-тренинга почти все агентные бенчмарки заметно выросли: Terminal Bench поднялся с 72,1 до 87,9, вплотную к Kimi K3 и Fable 5 и выше Opus 4.8.
Цена тоже не изменилась: $0,435/$0,87 за миллион токенов. Веса модели пока что не опубликовали.
@ai_for_devs
Китайцы выкатили V4 Pro 0813: большое обновление апрельской Preview-версии модели, которое уже заменило старую модель в API.
После нового пост-тренинга почти все агентные бенчмарки заметно выросли: Terminal Bench поднялся с 72,1 до 87,9, вплотную к Kimi K3 и Fable 5 и выше Opus 4.8.
На DeepSWE результат вырос почти в пять раз: с 12,8 до 62,7. На бенчмарке от Code Arena новинка получила 1607 баллов и попала на Pareto frontier — сопоставимые по качеству модели стоят в разы дороже.
Цена тоже не изменилась: $0,435/$0,87 за миллион токенов. Веса модели пока что не опубликовали.
@ai_for_devs
1👍45🔥28⚡13❤10🤯2
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁113🤣26👍13❤5🔥3
⚡️ Z.ai выпустили GLM-5.3: обошла Opus 4.8 на, но уступила Fable 5 и GPT-5.6 Sol
Технически внутри та же GLM-5.2: без нового претрейна и архитектуры, просто ещё месяц RL на длинных инженерных задачах DeepSWE вырос с 46,2% до 66,9%, Terminal-Bench 3.0 с 4,6% до 28,3%.
GLM-5.3 уже раскатили в Coding Plan от $18/мес, а веса обещают через две недели; цены API за токены пока нет.
@ai_for_devs
Технически внутри та же GLM-5.2: без нового претрейна и архитектуры, просто ещё месяц RL на длинных инженерных задачах DeepSWE вырос с 46,2% до 66,9%, Terminal-Bench 3.0 с 4,6% до 28,3%.
На Terminal-Bench 3.0 новинка обошла Kimi K3 и Opus 4.8, но не дотянула до Fable 5 и GPT-5.6 Sol.
Начиная с GLM-5.2 команда проверяла реальные кодовые базы несколькими своими моделями и нашла 2436 уязвимостей в 269 проектах; какие именно версии участвовали, Z.ai не уточняет.
GLM-5.3 уже раскатили в Coding Plan от $18/мес, а веса обещают через две недели; цены API за токены пока нет.
@ai_for_devs
1🔥43👍22❤7🤯5⚡2
⚡️ DeepSeek поднимают цены на API до 12 раз
С 16 августа DeepSeek вводят часы пик. В это время API будет стоить вдвое дороже, чем в остальные часы. Сами базовые цены тоже выросли.
Эпоха почти бесплатного DeepSeek подошла к концу.
@ai_for_devs
С 16 августа DeepSeek вводят часы пик. В это время API будет стоить вдвое дороже, чем в остальные часы. Сами базовые цены тоже выросли.
Генерация V4 Flash подорожает с $0,28 до $0,66–1,32 за миллион токенов, V4 Pro — с $0,87 до $1,98–3,96.
Сильнее всего досталось кэшированному входу V4 Pro: вместо $0,003625 придётся платить $0,022 вне часов пик и $0,044 в часы пик. Это в 6–12 раз дороже.
Эпоха почти бесплатного DeepSeek подошла к концу.
@ai_for_devs
1🤯93👍19⚡8🔥4❤2
⚡️ Google выпустили Gemini 3.7 Flash
Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.
До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.
Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.
@ai_for_devs
Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.
По coding-бенчмаркам 3.7 Flash примерно на уровне GPT-5.6 Terra и в среднем немного лучше Sonnet 5. На DeepSWE — 65.3% против 69.6% у Terra и 53.8% у Sonnet, на FrontierCode уже обходит обе: 43.6% против 41.3% и 42.7%.
До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.
Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.
@ai_for_devs
1🔥43👍21⚡7❤4
⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6
Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.
В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.
Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.
@ai_for_devs
Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.
По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus.
В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.
Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.
@ai_for_devs
2🔥73👍27❤12🤩5
⚡️ GPT-5.6 Sol разогнали до 750 токенов в секунду
OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.
Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.
Можно попробовать оставить заявку на ранний доступ.
@ai_for_devs
OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.
На всех 2500 вопросах Humanity's Last Exam Sol закончила работу за 11 часов 11 минут. Claude Fable 5 понадобилось 78 часов 27 минут при сопоставимой точности.
Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.
Можно попробовать оставить заявку на ранний доступ.
@ai_for_devs
1🤯38🔥21👍13❤10⚡3
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Cursor запустил Origin: конкурента GitHub для AI-агентов
Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.
Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.
Репозитории из GitHub можно подключать выборочно и отключать в любой момент.
@ai_for_devs
Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.
Доступ получают пользователи всех платных тарифов. На старте доступны репозитории, пул-реквесты, просмотр и поиск кода, а также синхронизация с GitHub.
Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.
Репозитории из GitHub можно подключать выборочно и отключать в любой момент.
@ai_for_devs
1🔥35👍17🤯5⚡4❤2
⚡️ Claude Code получил нативный аналог Caveman
Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.
Включается через
@ai_for_devs
Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.
По сути, это нативный аналог Caveman: скилла, который заставляет агента говорить как пещерный человек и экономить output-токены. Только теперь ничего устанавливать не нужно.
Включается через
/config → Output style → Concise или строчкой "outputStyle": "Concise" в settings.json.@ai_for_devs
1🔥70👍42❤15🤩3👏2⚡1
⚡️ Новая stealth-модель обгоняет Fable 5 и GPT-5.6 Sol на DeepSWE
У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.
Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.
Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.
@ai_for_devs
У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.
Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.
Модель прогнали на 10 задачах DeepSWE: Ox Alpha набрала 80%, Fable 5 — 65%, GLM-5.3 и Grok 4.6 — по 62%, GPT-5.6 Sol — 52%.
Выборка маленькая, поэтому до полноценного бенчмарка далеко, но результат внушительный.
Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.
@ai_for_devs
2🔥54🤯29👍21❤5🤩1