⚡️ Поменять модель или повысить effort?
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
Когда агент не справляется с задачей, первое естественное желание — поменять модель. Причём работает это в обе стороны: то суперумная модель странно тупит на казалось бы лёгкой задаче, то маленькая вообще не отдупляет, что происходит в сложной.
Но модель это не единственная ручка, которую можно покрутить. Может, лучше повысить/понизить effort?
Выбор модели определяет то, что агент знает по умолчанию. Веса любой модели были зафиксированы в процессе обучения, благодаря чему она знает о паттернах, фреймворках, подводных камнях и так далее. Размер модели определяет, насколько много и насколько хорошо она разбирается в различных областях. Если проводить весёлые аналогии, то Fable — Principal Engineer, Opus — Senior, Sonnet — Middle, а Haiku лучше не подпускать к коду.
Effort же определяет, насколько каждый из них будет стараться над решением конкретной задачи. Сколько файлов прочитать, сколько раз перепроверить себя, насколько уверенным быть перед ответом. На одном и том же промпте одна и та же модель с высоким effort может сгенерировать в 7 раз больше токенов, чем с низким.
Отсюда принцип работы с крутилками:
1. Если ошибка от нехватки знаний (тонкий баг, незнакомая область, архитектурное решение, модель уверенно врёт при любом количестве контекста) — берите модель крупнее.
2. Если ошибка от нехватки старания (агент пропустил файл, не прогнал тесты, не перепроверил себя) — поднимайте effort.
Подробнее про механику выбора, влияние на расход токенов и качество результата, читайте в новой статье на Хабре.
@ai_for_devs
1❤61👍34🔥14👏2
⚡️ GitHub перестал работать в России
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
Не работает Git, сам сайт не открывается, а также невозможно получить доступ к репозиториям.
На глобальный сбой GitHub не похоже, во всех остальных странах сервис функционирует нормально.
UPD: Github, Google и другие сайты снова доступны в России.
@ai_for_devs
1🤯80😱29❤15⚡10🔥8👍7👏4🤩4
😎 Методология работы с ИИ-агентом | Модуль №3
15 июля пройдет третий, финальный вебинар курса Veai «AI-инструменты для разработчиков 2026». Первые два были про выбор инструментов и настройку агента.
В прямо эфире Михаил Костицын (Lead Developer) разберет:
— методологию разработки с ИИ-агентами
— подходы к постановке задачи
— обратную связь (feedback loops)
— параллельную работу и субагентов
15 июля (завтра)🟡 19:00 МСК 🟡 Онлайн
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/agent-methodology/join
15 июля пройдет третий, финальный вебинар курса Veai «AI-инструменты для разработчиков 2026». Первые два были про выбор инструментов и настройку агента.
Без выстроенного процесса на сложном проекте агент решает не ту задачу и оставляет баги даже под зелёными тестами. Результат через неделю сложно повторить и передать команде.
В прямо эфире Михаил Костицын (Lead Developer) разберет:
— методологию разработки с ИИ-агентами
— подходы к постановке задачи
— обратную связь (feedback loops)
— параллельную работу и субагентов
15 июля (завтра)
Вебинар бесплатный, главное зарегистрироваться: https://veai.ru/events/agent-methodology/join
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤16👍15🔥9🤩5
⚡️ OpenAI даёт $100 в кредитах Codex за твит
Пишете свой твит о том, что нравится в GPT-5.6 Sol или почему перешли на неё, отправляете ссылку и почту от аккаунта через форму.
За 24 часа заявку подтверждают и присылают ваучер со $100 на почту.
switch-to-codex.openai.chatgpt.site
👍 Норм маркетинг
👎 Зашкварно
@ai_for_devs
Пишете свой твит о том, что нравится в GPT-5.6 Sol или почему перешли на неё, отправляете ссылку и почту от аккаунта через форму.
За 24 часа заявку подтверждают и присылают ваучер со $100 на почту.
Условие: активная подписка Go, Plus или Pro, на неё и начислят кредиты. $ получат первые 10 000 участников.
switch-to-codex.openai.chatgpt.site
👍 Норм маркетинг
👎 Зашкварно
@ai_for_devs
1👎138👍124🔥8❤6🤩4⚡1👏1
⚡️ xAI выложили исходный код Grok Build в open source
Лицензия Apache 2.0, но контрибьютить, заводить тикеты и открывать PR нельзя. Опубликовали исходники из-за скандала с сохранением кода пользователей на серверах xAI.
С 12 июля эту "фичу" отключили по умолчанию для всех, накопленные данные удалили.
https://github.com/xai-org/grok-build/tree/main
Прикольно, что часть инструментов Grok Build это адаптированный код из исходников Сodex и OpenCode.
@ai_for_devs
Лицензия Apache 2.0, но контрибьютить, заводить тикеты и открывать PR нельзя. Опубликовали исходники из-за скандала с сохранением кода пользователей на серверах xAI.
С 12 июля эту "фичу" отключили по умолчанию для всех, накопленные данные удалили.
Также в качестве бонуса сбросили лимиты всем пользователям.
https://github.com/xai-org/grok-build/tree/main
Прикольно, что часть инструментов Grok Build это адаптированный код из исходников Сodex и OpenCode.
@ai_for_devs
1🔥37👍12⚡10❤8👏1
⚡️ Kimi K3: опенсорс-модель на 2.8 трлн параметров обходит Opus 4.8
Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров!
Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro.
Поддерживает контекст в 1 млн токенов, а также нативную работу с изображениями и видео.
Стоимость за 1М токенов: $3/$15 ввод/вывод.
Модель уже доступна на kimi.com, в Kimi Code и через API. Полные веса опубликуют 27 июля.
@ai_for_devs
Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров!
Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro.
Поддерживает контекст в 1 млн токенов, а также нативную работу с изображениями и видео.
По бенчмаркам K3 обходит Claude Opus 4.8. В Frontend Code Arena (независимый рейтинг по голосам пользователей) K3 занял 1-е место, обойдя Fable 5, и это скачок на 17 позиций за одно поколение: предыдущая K2.6 была лишь на 18-й строчке.
Fable 5 и GPT-5.6 Sol по сумме собственных бенчмарков Moonshot K3 всё же уступает. Сами разработчики признают отставание только от этих двух моделей. Разрыв на большинстве тестов от 2 до 5 пунктов.
Стоимость за 1М токенов: $3/$15 ввод/вывод.
Модель уже доступна на kimi.com, в Kimi Code и через API. Полные веса опубликуют 27 июля.
@ai_for_devs
4👍66🔥38🤯20❤5⚡5🤩1
AI for Devs
⚡️ Kimi K3: опенсорс-модель на 2.8 трлн параметров обходит Opus 4.8 Moonshot AI выпустили Kimi K3 — самую крупную открытую модель на сегодня. 2.8 трлн параметров! Вдвое больше, чем у DeepSeek V4 Pro, и втрое больше, чем у Xiaomi MiMo V2.5 Pro. Поддерживает…
Kimi K3 от Moonshot AI доступна в Router AI без VPN и иностранной карты
Цены:
– 305 ₽/1М input, 1527 ₽/1М output
– Кэш: 30 ₽/1М токенов
Контекст 1М токенов, есть поддержка изображений. Модель: moonshotai/kimi-k3
Настройка для Claude Code — routerai.ru/pages/vibe-coding-claude-code
Настройка для OpenCode — routerai.ru/pages/vibe-coding-opencode
Cursor, JetBrains, Cline, и другие — routerai.ru/vibe-coding#where-to-start
Цены:
– 305 ₽/1М input, 1527 ₽/1М output
– Кэш: 30 ₽/1М токенов
Контекст 1М токенов, есть поддержка изображений. Модель: moonshotai/kimi-k3
Настройка для Claude Code — routerai.ru/pages/vibe-coding-claude-code
Настройка для OpenCode — routerai.ru/pages/vibe-coding-opencode
Cursor, JetBrains, Cline, и другие — routerai.ru/vibe-coding#where-to-start
3👍35❤11🔥8👌5🤩3
⚡️ Fable 5 уберут из подписки за $20
Начиная с 20 июля в планах Pro и Team Standard Fable 5 больше не будет входить в подписку, доступ только через usage credits.
На тарифах Max и Team Premium с 20 июля Fable 5 будет включён по умолчанию с лимитом 50% от стандартного.
Пользователям Pro Anthropic обещают компенсировать утрату разовым пополнением usage credits на $100.
@ai_for_devs
Начиная с 20 июля в планах Pro и Team Standard Fable 5 больше не будет входить в подписку, доступ только через usage credits.
На тарифах Max и Team Premium с 20 июля Fable 5 будет включён по умолчанию с лимитом 50% от стандартного.
Пользователям Pro Anthropic обещают компенсировать утрату разовым пополнением usage credits на $100.
@ai_for_devs
1🤯44😢34🔥15👏7🤩6❤2⚡2💯2
⚡️ В Claude Cowork завезли запись Skills
Теперь можно включить запись экрана, выполнить задачу и по ходу объяснить, что делаешь.
Cowork запишет экран, клики, клавиатуру и голос, а потом соберёт из этого Skill.
Удивительно, но в Codex это дело завезли раньше, больше месяца назад (видео).
@ai_for_devs
Теперь можно включить запись экрана, выполнить задачу и по ходу объяснить, что делаешь.
Cowork запишет экран, клики, клавиатуру и голос, а потом соберёт из этого Skill.
Можно показать, как собирать отчёты, разбирать документы и выполнять другую рабочую рутину, не связанную с написанием кода.
Удивительно, но в Codex это дело завезли раньше, больше месяца назад (видео).
@ai_for_devs
1🔥71👍30❤17👏5🤩2
⚡️ Google выпустили сразу три новые Gemini
1. Gemini 3.6 Flash. На DeepSWE она набрала 49% против 37% у прошлой Flash. Для сравнения: Opus 4.8 набирает 59%, GPT-5.6-sol достигла 73%.
2. Gemini 3.5 Flash-Lite. Для простых задач, где скорость в приоритете. Она выдаёт 350 токенов в секунду и стоит $0.30 за миллион входных и $2.50 за миллион выходных токенов.
3. Gemini 3.5 Flash Cyber. Специализированная версия для поиска и исправления уязвимостей. Доступ выдали только правительствам и доверенным партнёрам.
Gemini 3.5 Pro пока тестируют. Для Gemini 4 Google уже запустили самый амбициозный (по их собственным словам) процесс предобучения в своей истории.
@ai_for_devs
1. Gemini 3.6 Flash. На DeepSWE она набрала 49% против 37% у прошлой Flash. Для сравнения: Opus 4.8 набирает 59%, GPT-5.6-sol достигла 73%.
2. Gemini 3.5 Flash-Lite. Для простых задач, где скорость в приоритете. Она выдаёт 350 токенов в секунду и стоит $0.30 за миллион входных и $2.50 за миллион выходных токенов.
3. Gemini 3.5 Flash Cyber. Специализированная версия для поиска и исправления уязвимостей. Доступ выдали только правительствам и доверенным партнёрам.
Gemini 3.5 Pro пока тестируют. Для Gemini 4 Google уже запустили самый амбициозный (по их собственным словам) процесс предобучения в своей истории.
@ai_for_devs
1👍34🔥15⚡10🤯9❤8😁1
⚡️ Claude Code научился запускать и тестировать iOS-приложения
В Claude Code Desktop встроили iOS Simulator. Теперь агент может собрать приложение, установить его, запустить, прокликать нужный сценарий и проверить результат.
Фича доступна в public beta на macOS для тарифов Pro, Max и Team.
@ai_for_devs
В Claude Code Desktop встроили iOS Simulator. Теперь агент может собрать приложение, установить его, запустить, прокликать нужный сценарий и проверить результат.
Можно наблюдать за тестированием или в любой момент перехватить управление: тапать, свайпать, менять устройство, делать скриншоты и записывать экран.
У каждой сессии свой симулятор, поэтому параллельные агенты друг другу не мешают.
Фича доступна в public beta на macOS для тарифов Pro, Max и Team.
@ai_for_devs
1🔥65🤯13👍10❤7⚡2