⚡️ Российская LLM Koda Pro почти сравнялась с Claude Sonnet и Opus
KodaCode выпустили версию 1.0 своего плагина для VS Code. Вместе с релизом агента обновили и флагманскую LLM.
На SWE-bench Verified новая Koda Pro на основе GLM 5.2 набрала 77.4% (у Claude Sonnet 5 на этом же бенче 78.8%, у Claude Opus 4.8 результат 83%).
Также выкатили подключение российских провайдеров моделей без VPN.
@ai_for_devs
KodaCode выпустили версию 1.0 своего плагина для VS Code. Вместе с релизом агента обновили и флагманскую LLM.
На SWE-bench Verified новая Koda Pro на основе GLM 5.2 набрала 77.4% (у Claude Sonnet 5 на этом же бенче 78.8%, у Claude Opus 4.8 результат 83%).
В агента для VS Code, JetBrains и CLI добавили маркетплейс MCP и скиллов, просмотр diff прямо в чате и починили зависания на длинных сессиях.
Telegram-интеграция раньше работала только в VS Code, теперь доступна в JetBrains и CLI.
Также выкатили подключение российских провайдеров моделей без VPN.
@ai_for_devs
1👍103🤯58🔥23❤17⚡5
⚡️ Cursor выпустили Grok 4.5: флагман уровня Opus, обучали вместе со SpaceXAI
«Opus-класс, но быстрее, экономнее по токенам и дешевле» — так Маск описал модель в X.
Уже доступна в Grok Build, в Cursor на всех тарифах.
Цена: $2/$6 за млн токенов (input/output). Для сравнения, у Opus 4.8 — $5/$25.
@ai_for_devs
«Opus-класс, но быстрее, экономнее по токенам и дешевле» — так Маск описал модель в X.
Уже доступна в Grok Build, в Cursor на всех тарифах.
На первую неделю дают двойные лимиты и уточняют: у Grok 4.5 и Composer разные весовые категории.
Composer 2.5 остаётся в строю, новые модели этого размера продолжат выходить отдельно.
Цена: $2/$6 за млн токенов (input/output). Для сравнения, у Opus 4.8 — $5/$25.
@ai_for_devs
1🔥66🤯12👍10⚡7❤5
⚡️ Через 5 минут смотрим релиз GPT-5.6 Sol
Sol — флагманская модель нового поколения от OpenAI, по слухам последняя в серии 5.x. Дальше компания переходит на нейминг 6+.
Модель почти месяц была в закрытом превью для избранных партнёров по запросу властей США, сегодня открывают публичный доступ.
Стрим здесь: https://youtu.be/Wq45rvPGNHs
@ai_for_devs
Sol — флагманская модель нового поколения от OpenAI, по слухам последняя в серии 5.x. Дальше компания переходит на нейминг 6+.
Модель почти месяц была в закрытом превью для избранных партнёров по запросу властей США, сегодня открывают публичный доступ.
Стрим здесь: https://youtu.be/Wq45rvPGNHs
@ai_for_devs
YouTube
Introducing the next chapter for ChatGPT
Andrew Ambrosino, Jessica Liang, Ed Bayes, Lauren Gordon, Tejal Patwardhan, and Katy Shi join host Thibault Sottiaux to introduce and demo the new ChatGPT and GPT-5.6.
1👍33🤩14🔥12❤6⚡3
⚡️ Линейку моделей GPT-5.6 раскатили на всех
Модель уже доступна всем пользователям Codex, её добавили в Cursor, JetBrains Air и в десяток других самых популярных агентов.
На части бенчмарков Sol обходит Fable 5, в том числе в кодинге. Главный акцент OpenAI делают на цене и скорости: тех же результатов Sol добивается вдвое быстрее и примерно на треть дешевле.
Цена за 1М токенов: Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
А для тех, кто сидит на Claude, а не на Codex — Anthropic прямо сейчас сбросили недельные лимиты, чтобы никто никуда не переметнулся 😄 В общем, сегодня в плюсе все!
@ai_for_devs
Модель уже доступна всем пользователям Codex, её добавили в Cursor, JetBrains Air и в десяток других самых популярных агентов.
На части бенчмарков Sol обходит Fable 5, в том числе в кодинге. Главный акцент OpenAI делают на цене и скорости: тех же результатов Sol добивается вдвое быстрее и примерно на треть дешевле.
Цена за 1М токенов: Sol $5/$30, Terra $2.50/$15, Luna $1/$6.
Также OpenAI выпустили аналог Artifacts у Claude Code — назвали ChatGPT Sites, собирать сайты и мини-приложения прямо в Codex.
И раскатали ChatGPT Work — по сути слияние ChatGPT и Codex в одном приложении, уже можно скачать на macOS, версии для Windows как обычно обещают позже.
А для тех, кто сидит на Claude, а не на Codex — Anthropic прямо сейчас сбросили недельные лимиты, чтобы никто никуда не переметнулся 😄 В общем, сегодня в плюсе все!
@ai_for_devs
OpenAI
GPT-5.6: Frontier intelligence that scales with your ambition
More intelligence from every token, stronger performance per dollar, and more capability on demand for your hardest work.
1🔥95👍22❤14⚡12🤯4
⚡️ Поменять модель или повысить effort?
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
1❤61👍34🔥14👏2
⚡️ GitHub перестал работать в России
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
1🤯80😱29❤15⚡10🔥8👍7👏4🤩4
😎 Методология работы с ИИ-агентом | Модуль №3
15 июля пройдет третий, финальный вебинар курса Veai «AI-инструменты для разработчиков 2026». Первые два были про выбор инструментов и настройку агента.
В прямо эфире Михаил Костицын (Lead Developer) разберет:
— методологию разработки с ИИ-агентами
— подходы к постановке задачи
— обратную связь (feedback loops)
— параллельную работу и субагентов
15 июля (завтра)🟡 19:00 МСК 🟡 Онлайн
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/agent-methodology/join
15 июля пройдет третий, финальный вебинар курса Veai «AI-инструменты для разработчиков 2026». Первые два были про выбор инструментов и настройку агента.
Без выстроенного процесса на сложном проекте агент решает не ту задачу и оставляет баги даже под зелёными тестами. Результат через неделю сложно повторить и передать команде.
В прямо эфире Михаил Костицын (Lead Developer) разберет:
— методологию разработки с ИИ-агентами
— подходы к постановке задачи
— обратную связь (feedback loops)
— параллельную работу и субагентов
15 июля (завтра)
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/agent-methodology/join
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤16👍15🔥9🤩5
⚡️ OpenAI даёт $100 в кредитах Codex за твит
Пишете свой твит о том, что нравится в GPT-5.6 Sol или почему перешли на неё, отправляете ссылку и почту от аккаунта через форму.
За 24 часа заявку подтверждают и присылают ваучер со $100 на почту.
switch-to-codex.openai.chatgpt.site
👍 Норм маркетинг
👎 Зашкварно
@ai_for_devs
Пишете свой твит о том, что нравится в GPT-5.6 Sol или почему перешли на неё, отправляете ссылку и почту от аккаунта через форму.
За 24 часа заявку подтверждают и присылают ваучер со $100 на почту.
Условие: активная подписка Go, Plus или Pro, на неё и начислят кредиты. $ получат первые 10 000 участников.
switch-to-codex.openai.chatgpt.site
👍 Норм маркетинг
👎 Зашкварно
@ai_for_devs
1👎138👍124🔥8❤6🤩4⚡1👏1
⚡️ xAI выложили исходный код Grok Build в open source
Лицензия Apache 2.0, но контрибьютить, заводить тикеты и открывать PR нельзя. Опубликовали исходники из-за скандала с сохранением кода пользователей на серверах xAI.
С 12 июля эту "фичу" отключили по умолчанию для всех, накопленные данные удалили.
https://github.com/xai-org/grok-build/tree/main
Прикольно, что часть инструментов Grok Build это адаптированный код из исходников Сodex и OpenCode.
@ai_for_devs
Лицензия Apache 2.0, но контрибьютить, заводить тикеты и открывать PR нельзя. Опубликовали исходники из-за скандала с сохранением кода пользователей на серверах xAI.
С 12 июля эту "фичу" отключили по умолчанию для всех, накопленные данные удалили.
Также в качестве бонуса сбросили лимиты всем пользователям.
https://github.com/xai-org/grok-build/tree/main
Прикольно, что часть инструментов Grok Build это адаптированный код из исходников Сodex и OpenCode.
@ai_for_devs
1🔥37👍12⚡10❤8👏1
⚡️ Kimi K3: опенсорс-модель на 2.8 трлн параметров обходит Opus 4.8
Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров!
Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro.
Поддерживает контекст в 1 млн токенов, а также нативную работу с изображениями и видео.
Стоимость за 1М токенов: $3/$15 ввод/вывод.
Модель уже доступна на kimi.com, в Kimi Code и через API. Полные веса опубликуют 27 июля.
@ai_for_devs
Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров!
Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro.
Поддерживает контекст в 1 млн токенов, а также нативную работу с изображениями и видео.
По бенчмаркам K3 обходит Claude Opus 4.8. В Frontend Code Arena (независимый рейтинг по голосам пользователей) K3 занял 1-е место, обойдя Fable 5, и это скачок на 17 позиций за одно поколение: предыдущая K2.6 была лишь на 18-й строчке.
Fable 5 и GPT-5.6 Sol по сумме собственных бенчмарков Moonshot K3 всё же уступает. Сами разработчики признают отставание только от этих двух моделей. Разрыв на большинстве тестов от 2 до 5 пунктов.
Стоимость за 1М токенов: $3/$15 ввод/вывод.
Модель уже доступна на kimi.com, в Kimi Code и через API. Полные веса опубликуют 27 июля.
@ai_for_devs
4👍66🔥38🤯20❤5⚡5🤩1
AI for Devs
⚡️ Kimi K3: опенсорс-модель на 2.8 трлн параметров обходит Opus 4.8 Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров! Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro. Поддерживает…
Kimi K3 от Moonshot AI доступна в Router AI без VPN и иностранной карты
Цены:
– 305 ₽/1М input, 1527 ₽/1М output
– Кэш: 30 ₽/1М токенов
Контекст 1М токенов, есть поддержка изображений. Модель: moonshotai/kimi-k3
Настройка для Claude Code — routerai.ru/pages/vibe-coding-claude-code
Настройка для OpenCode — routerai.ru/pages/vibe-coding-opencode
Cursor, JetBrains, Cline, и другие — routerai.ru/vibe-coding#where-to-start
Цены:
– 305 ₽/1М input, 1527 ₽/1М output
– Кэш: 30 ₽/1М токенов
Контекст 1М токенов, есть поддержка изображений. Модель: moonshotai/kimi-k3
Настройка для Claude Code — routerai.ru/pages/vibe-coding-claude-code
Настройка для OpenCode — routerai.ru/pages/vibe-coding-opencode
Cursor, JetBrains, Cline, и другие — routerai.ru/vibe-coding#where-to-start
3👍35❤11🔥8👌5🤩3
⚡️ Fable 5 уберут из подписки за $20
Начиная с 20 июля в планах Pro и Team Standard Fable 5 больше не будет входить в подписку, доступ только через usage credits.
На тарифах Max и Team Premium с 20 июля Fable 5 будет включён по умолчанию с лимитом 50% от стандартного.
Пользователям Pro Anthropic обещают компенсировать утрату разовым пополнением usage credits на $100.
@ai_for_devs
Начиная с 20 июля в планах Pro и Team Standard Fable 5 больше не будет входить в подписку, доступ только через usage credits.
На тарифах Max и Team Premium с 20 июля Fable 5 будет включён по умолчанию с лимитом 50% от стандартного.
Пользователям Pro Anthropic обещают компенсировать утрату разовым пополнением usage credits на $100.
@ai_for_devs
1🤯44😢34🔥15👏7🤩6❤2⚡2💯2
⚡️ В Claude Cowork завезли запись Skills
Теперь можно включить запись экрана, выполнить задачу и по ходу объяснить, что делаешь.
Cowork запишет экран, клики, клавиатуру и голос, а потом соберёт из этого Skill.
Удивительно, но в Codex это дело завезли раньше, больше месяца назад (видео).
@ai_for_devs
Теперь можно включить запись экрана, выполнить задачу и по ходу объяснить, что делаешь.
Cowork запишет экран, клики, клавиатуру и голос, а потом соберёт из этого Skill.
Можно показать, как собирать отчёты, разбирать документы и выполнять другую рабочую рутину, не связанную с написанием кода.
Удивительно, но в Codex это дело завезли раньше, больше месяца назад (видео).
@ai_for_devs
1🔥70👍29❤17👏4🤩2
⚡️ Google выпустили сразу три новые Gemini
1. Gemini 3.6 Flash. На DeepSWE она набрала 49% против 37% у прошлой Flash. Для сравнения: Opus 4.8 набирает 59%, GPT-5.6-sol достигла 73%.
2. Gemini 3.5 Flash-Lite. Для простых задач, где скорость в приоритете. Она выдаёт 350 токенов в секунду и стоит $0.30 за миллион входных и $2.50 за миллион выходных токенов.
3. Gemini 3.5 Flash Cyber. Специализированная версия для поиска и исправления уязвимостей. Доступ выдали только правительствам и доверенным партнёрам.
Gemini 3.5 Pro пока тестируют. Для Gemini 4 Google уже запустили самый амбициозный (по их собственным словам) процесс предобучения в своей истории.
@ai_for_devs
1. Gemini 3.6 Flash. На DeepSWE она набрала 49% против 37% у прошлой Flash. Для сравнения: Opus 4.8 набирает 59%, GPT-5.6-sol достигла 73%.
2. Gemini 3.5 Flash-Lite. Для простых задач, где скорость в приоритете. Она выдаёт 350 токенов в секунду и стоит $0.30 за миллион входных и $2.50 за миллион выходных токенов.
3. Gemini 3.5 Flash Cyber. Специализированная версия для поиска и исправления уязвимостей. Доступ выдали только правительствам и доверенным партнёрам.
Gemini 3.5 Pro пока тестируют. Для Gemini 4 Google уже запустили самый амбициозный (по их собственным словам) процесс предобучения в своей истории.
@ai_for_devs
1👍29🔥14⚡10🤯9❤7
⚡️ Claude Code научился запускать и тестировать iOS-приложения
В Claude Code Desktop встроили iOS Simulator. Теперь агент может собрать приложение, установить его, запустить, прокликать нужный сценарий и проверить результат.
Фича доступна в public beta на macOS для тарифов Pro, Max и Team.
@ai_for_devs
В Claude Code Desktop встроили iOS Simulator. Теперь агент может собрать приложение, установить его, запустить, прокликать нужный сценарий и проверить результат.
Можно наблюдать за тестированием или в любой момент перехватить управление: тапать, свайпать, менять устройство, делать скриншоты и записывать экран.
У каждой сессии свой симулятор, поэтому параллельные агенты друг другу не мешают.
Фича доступна в public beta на macOS для тарифов Pro, Max и Team.
@ai_for_devs
1🔥31🤯10👍5❤2⚡1