AI for Devs
16.2K subscribers
346 photos
111 videos
316 links
По сотрудничеству пишите в личные сообщения канала.

Канал для разработчиков про AI. Модели, ИИ-агенты, практические кейсы и новости из мира AI. Всё, что можно применить в работе.

Технологический партнер: veai.ru
Download Telegram
⚡️ xAI выпустили Grok 4.6: модель сравнялась с GPT-5.6 Sol

В CursorBench Grok обошёл GPT-5.6 Sol: 69,9% против 67,2%.

Но на DeepSWE и Terminal-Bench GPT пока заметно впереди: 73% против 65,9% и 34,6% против 26%.

Цена $2 за миллион входных и $6 за миллион выходных токенов. Fast-версия вдвое дороже, а первую неделю в Cursor и Grok Build дают двойные лимиты.


Модель уже доступна в Cursor, Grok Build, API и OpenRouter.

@ai_for_devs
3👍43🔥25🤯1152
⚡️ DeepSeek обновили V4 Pro

Китайцы выкатили V4 Pro 0813: большое обновление апрельской Preview-версии модели, которое уже заменило старую модель в API.

После нового пост-тренинга почти все агентные бенчмарки заметно выросли: Terminal Bench поднялся с 72,1 до 87,9, вплотную к Kimi K3 и Fable 5 и выше Opus 4.8.

На DeepSWE результат вырос почти в пять раз: с 12,8 до 62,7. На бенчмарке от Code Arena новинка получила 1607 баллов и попала на Pareto frontier — сопоставимые по качеству модели стоят в разы дороже.


Цена тоже не изменилась: $0,435/$0,87 за миллион токенов. Веса модели пока что не опубликовали.

@ai_for_devs
1👍45🔥281310🤯2
Ждём первый рэп-кодинг баттл 🤣
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁113🤣26👍135🔥3
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍41🔥209🤩4
⚡️ Z.ai выпустили GLM-5.3: обошла Opus 4.8 на, но уступила Fable 5 и GPT-5.6 Sol

Технически внутри та же GLM-5.2: без нового претрейна и архитектуры, просто ещё месяц RL на длинных инженерных задачах DeepSWE вырос с 46,2% до 66,9%, Terminal-Bench 3.0 с 4,6% до 28,3%.

На Terminal-Bench 3.0 новинка обошла Kimi K3 и Opus 4.8, но не дотянула до Fable 5 и GPT-5.6 Sol.

Начиная с GLM-5.2 команда проверяла реальные кодовые базы несколькими своими моделями и нашла 2436 уязвимостей в 269 проектах; какие именно версии участвовали, Z.ai не уточняет.


GLM-5.3 уже раскатили в Coding Plan от $18/мес, а веса обещают через две недели; цены API за токены пока нет.

@ai_for_devs
1🔥43👍227🤯52
⚡️ DeepSeek поднимают цены на API до 12 раз

С 16 августа DeepSeek вводят часы пик. В это время API будет стоить вдвое дороже, чем в остальные часы. Сами базовые цены тоже выросли.

Генерация V4 Flash подорожает с $0,28 до $0,66–1,32 за миллион токенов, V4 Pro — с $0,87 до $1,98–3,96.

Сильнее всего досталось кэшированному входу V4 Pro: вместо $0,003625 придётся платить $0,022 вне часов пик и $0,044 в часы пик. Это в 6–12 раз дороже.


Эпоха почти бесплатного DeepSeek подошла к концу.

@ai_for_devs
1🤯93👍198🔥42
⚡️ Google выпустили Gemini 3.7 Flash

Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.

По coding-бенчмаркам 3.7 Flash примерно на уровне GPT-5.6 Terra и в среднем немного лучше Sonnet 5. На DeepSWE — 65.3% против 69.6% у Terra и 53.8% у Sonnet, на FrontierCode уже обходит обе: 43.6% против 41.3% и 42.7%.


До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.

Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.

@ai_for_devs
1🔥43👍2174
⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6

Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.

По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus.


В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.

Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.

@ai_for_devs
2🔥73👍2712🤩5
⚡️ GPT-5.6 Sol разогнали до 750 токенов в секунду

OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.

На всех 2500 вопросах Humanity's Last Exam Sol закончила работу за 11 часов 11 минут. Claude Fable 5 понадобилось 78 часов 27 минут при сопоставимой точности.


Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.

Можно попробовать оставить заявку на ранний доступ.

@ai_for_devs
1🤯38🔥21👍13103
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Cursor запустил Origin: конкурента GitHub для AI-агентов

Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.

Доступ получают пользователи всех платных тарифов. На старте доступны репозитории, пул-реквесты, просмотр и поиск кода, а также синхронизация с GitHub.


Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.

Репозитории из GitHub можно подключать выборочно и отключать в любой момент.

@ai_for_devs
1🔥35👍17🤯542
⚡️ Claude Code получил нативный аналог Caveman

Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.

По сути, это нативный аналог Caveman: скилла, который заставляет агента говорить как пещерный человек и экономить output-токены. Только теперь ничего устанавливать не нужно.


Включается через /config → Output style → Concise или строчкой "outputStyle": "Concise" в settings.json.

@ai_for_devs
1🔥70👍4215🤩3👏21
⚡️ Новая stealth-модель обгоняет Fable 5 и GPT-5.6 Sol на DeepSWE

У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.

Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.

Модель прогнали на 10 задачах DeepSWE: Ox Alpha набрала 80%, Fable 5 — 65%, GLM-5.3 и Grok 4.6 — по 62%, GPT-5.6 Sol — 52%.

Выборка маленькая, поэтому до полноценного бенчмарка далеко, но результат внушительный.


Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.

@ai_for_devs
2🔥54🤯29👍215🤩1