⚡️ Google выпустили Gemini 3.7 Flash
Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.
До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.
Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.
@ai_for_devs
Последнюю Pro-модель Google выпустили ещё 19 февраля. Зато с тех пор успели зарелизить уже три Flash подряд: 3.5, 3.6 и 3.7.
По coding-бенчмаркам 3.7 Flash примерно на уровне GPT-5.6 Terra и в среднем немного лучше Sonnet 5. На DeepSWE — 65.3% против 69.6% у Terra и 53.8% у Sonnet, на FrontierCode уже обходит обе: 43.6% против 41.3% и 42.7%.
До конца года стоимость $0.75/$3.75 за миллион токенов (input/output). Это в 2.7 раза дешевле Sonnet 5 по output и больше чем в 3 раза дешевле Terra.
Контекст 1M, модель уже доступна через API, в AI Studio и Antigravity.
@ai_for_devs
2🔥43👍22⚡7❤4
⚡️ Qwen3.8-27B запускается локально и местами обходит Opus 4.6
Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.
В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.
Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.
@ai_for_devs
Alibaba открыли веса Qwen3.8-27B. В одном из тестов на агентное программирование результат вырос более чем втрое по сравнению с Qwen3.6-27B.
По совокупности тестов новинка оказалась сильнее даже предыдущей облачной Qwen3.7-Plus.
В отдельных задачах по программированию она показывает результаты выше Opus 4.6, хотя всё ещё уступает некогда флагману в сложных рассуждениях и работе с терминалом.
Облегчённая версия от Unsloth занимает около 17 ГБ: её можно запустить на Mac с Apple Silicon или видеокарте с 24 ГБ памяти.
@ai_for_devs
2🔥75👍28❤12🤩5
⚡️ GPT-5.6 Sol разогнали до 750 токенов в секунду
OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.
Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.
Можно попробовать оставить заявку на ранний доступ.
@ai_for_devs
OpenAI и Cerebras запустили ограниченное превью Ultrafast, нового режима GPT-5.6 Sol в API. Полная модель генерирует до 750 выходных токенов в секунду. Это до 14 раз быстрее Standard без перехода на уменьшённую модель.
На всех 2500 вопросах Humanity's Last Exam Sol закончила работу за 11 часов 11 минут. Claude Fable 5 понадобилось 78 часов 27 минут при сопоставимой точности.
Для сравнения, нынешний Fast mode ускоряет Sol только до 2,5 раза и стоит вдвое дороже Standard. Цену Ultrafast пока не раскрыли, а доступ дали лишь нескольким клиентам.
Можно попробовать оставить заявку на ранний доступ.
@ai_for_devs
1🤯40🔥22👍15❤10⚡3
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Cursor запустил Origin: конкурента GitHub для AI-агентов
Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.
Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.
Репозитории из GitHub можно подключать выборочно и отключать в любой момент.
@ai_for_devs
Мы уже писали о его анонсе, а теперь сервис начал публичное развёртывание в ранней бете.
Доступ получают пользователи всех платных тарифов. На старте доступны репозитории, пул-реквесты, просмотр и поиск кода, а также синхронизация с GitHub.
Создать репозиторий можно во вкладке Codebase, после чего Cursor покажет CLI-команды для клонирования или загрузки локального проекта.
Репозитории из GitHub можно подключать выборочно и отключать в любой момент.
@ai_for_devs
1🔥36👍19🤯6⚡4❤2
⚡️ Claude Code получил нативный аналог Caveman
Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.
Включается через
@ai_for_devs
Anthropic добавили встроенный стиль Concise. Claude начинает с результата, пропускает предисловия и не расписывает детали, пока его об этом не попросят.
По сути, это нативный аналог Caveman: скилла, который заставляет агента говорить как пещерный человек и экономить output-токены. Только теперь ничего устанавливать не нужно.
Включается через
/config → Output style → Concise или строчкой "outputStyle": "Concise" в settings.json.@ai_for_devs
1🔥79👍48❤16🤩3👏2⚡1
⚡️ Новая stealth-модель обгоняет Fable 5 и GPT-5.6 Sol на DeepSWE
У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.
Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.
Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.
@ai_for_devs
У неизвестной мультимодальной модели контекст на 1 млн токенов. OpenCode обещают почти безлимитное бесплатное использование до 27 августа.
Бесплатно Ox Alpha доступна и через OpenRouter. Правда, там провайдер сохраняет запросы и ответы, но обещает не использовать их для обучения.
Модель прогнали на 10 задачах DeepSWE: Ox Alpha набрала 80%, Fable 5 — 65%, GLM-5.3 и Grok 4.6 — по 62%, GPT-5.6 Sol — 52%.
Выборка маленькая, поэтому до полноценного бенчмарка далеко, но результат внушительный.
Кто сделал модель, неизвестно. Вероятнее всего это новая GLM-5.x: совпадают токенизатор, видеоэнкодер, стиль ответов и реакция на аудио.
@ai_for_devs
2🔥64🤯31👍26❤7🤩1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Orca ADE преодолела отметку в 50 тысяч звёзд на GitHub
Orca – это новая ADE (Agent Development Environment), среда для параллельной работы с AI-агентами. Меньше чем за полгода репозиторий отметили 50 тысяч разработчиков.
Десктопная версия ADE построена на базе Electron.
Продукт разрабатывает команда выходцев из Y Combinator. Orca бесплатна, исходный код открыт под лицензией MIT. Отдельная подписка на ADE не нужна.
Orca поддерживает 35 агентов, включая самые популярные: Claude Code, Codex, OpenCode и т.д. Также можно запустить любой CLI-агент, который работает в терминале.
@ai_for_devs
Orca – это новая ADE (Agent Development Environment), среда для параллельной работы с AI-агентами. Меньше чем за полгода репозиторий отметили 50 тысяч разработчиков.
Десктопная версия ADE построена на базе Electron.
Продукт разрабатывает команда выходцев из Y Combinator. Orca бесплатна, исходный код открыт под лицензией MIT. Отдельная подписка на ADE не нужна.
Основные возможности:
• Переключиться между агентами можно в рамках одной задачи
• Прикольно, что прямо в ADE видны лимиты всех агентов: Claude Code, Codex, Gemini, OpenCode, Kimi Code и MiniMax
• Есть Workspace Board, на котором видны запущенные задачи, а карточки можно перетаскивать между статусами
• Изменения можно проверить во встроенном редакторе и Git-диффе, а комментарии передать агенту
• Здорово, что есть Design Mode: можно откомментить элемент страницы, а не делать несколько скриншотов
• Есть управление с телефона
• Задачи можно запустить параллельно в отдельных git worktree, локально или через SSH
Orca поддерживает 35 агентов, включая самые популярные: Claude Code, Codex, OpenCode и т.д. Также можно запустить любой CLI-агент, который работает в терминале.
@ai_for_devs
1👍71🔥23❤15🤯6
⚡️ Сегодня ночью в Codex вернут 5-часовой лимит для $20 подписок
Пользователи Plus вернутся к старой схеме: 5-часовой лимит поверх недельного в ChatGPT Work и Codex.
Для пользователей на тарифах за $100 и $200 пока ничего не меняется: в ближайшие несколько месяцев 5-часовое ограничение включать не будут.
@ai_for_devs
Пользователи Plus вернутся к старой схеме: 5-часовой лимит поверх недельного в ChatGPT Work и Codex.
Инженеры OpenAI заявляют 2 причины:
1. 5-часовое окно помогает сглаживать нагрузку на дата-центры и сохранять щедрый недельный лимит
2. Новые юзеры часто случайно сжигали весь недельный лимит за несколько часов и потом не понимали, почему остались без Codex
Для пользователей на тарифах за $100 и $200 пока ничего не меняется: в ближайшие несколько месяцев 5-часовое ограничение включать не будут.
@ai_for_devs
1🤯39👍34🔥19❤9🤩1
⚡️ Новый чип OpenAI разогнал Kimi K2.5 почти до 700 ток/с
В июне мы уже рассказывали про Jalapeño, собственный чип OpenAI для инференса. Тогда готовых бенчмарков ещё не было, теперь компания опубликовала первые результаты.
На GPT-OSS, DeepSeek R1 и Kimi K2.5 чип выдаёт в 2,7–4,1 раза больше токенов в секунду на пользователя, чем NVIDIA GB200 и GB300 (самые мощные решения NVIDIA для запуска AI-моделей).
В абсолютной скорости генерации Cerebras пока впереди: Kimi K2.6 на их гигантском чипе выдаёт около 1000 ток/с, хотя напрямую сравнивать результаты нельзя из-за разных версий модели и методик тестирования.
@ai_for_devs
В июне мы уже рассказывали про Jalapeño, собственный чип OpenAI для инференса. Тогда готовых бенчмарков ещё не было, теперь компания опубликовала первые результаты.
На GPT-OSS, DeepSeek R1 и Kimi K2.5 чип выдаёт в 2,7–4,1 раза больше токенов в секунду на пользователя, чем NVIDIA GB200 и GB300 (самые мощные решения NVIDIA для запуска AI-моделей).
Если зафиксировать максимальную скорость NVIDIA для одного пользователя, разрыв по общей пропускной способности получается вообще аномальным: Jalapeño обрабатывает до 100 раз больше токенов на киловатт.
В абсолютной скорости генерации Cerebras пока впереди: Kimi K2.6 на их гигантском чипе выдаёт около 1000 ток/с, хотя напрямую сравнивать результаты нельзя из-за разных версий модели и методик тестирования.
@ai_for_devs
1🔥44👍18🤯12⚡6❤5
⚡️ Z.ai выпустили GLM-5.3-Flash — ту самую Ox Alpha, которая за неделю стала топ-1 в OpenCode и OpenRouter
Стелс-превью закончилось: за шесть дней пользователи OpenCode прогнали через модель 42 трлн токенов, а на OpenRouter она обошла ближайший DeepSeek по использованию больше чем в два раза!
GLM-5.3-Flash — первая нативно мультимодальная модель семейства GLM-5: контекст на 1 млн токенов, 320 млрд параметров и 18 млрд активных.
Веса уже открыли под MIT. Причём весь трафик Ox Alpha Z.ai обслуживали исключительно на китайских AI-чипах!
API стоит $0,15 за миллион входных токенов, $0,50 за выходные и $0,03 за закэшированный ввод.
Модель уже доступна в API, ZCode, Chat, AutoClaw и OpenCode.
@ai_for_devs
Стелс-превью закончилось: за шесть дней пользователи OpenCode прогнали через модель 42 трлн токенов, а на OpenRouter она обошла ближайший DeepSeek по использованию больше чем в два раза!
GLM-5.3-Flash — первая нативно мультимодальная модель семейства GLM-5: контекст на 1 млн токенов, 320 млрд параметров и 18 млрд активных.
Веса уже открыли под MIT. Причём весь трафик Ox Alpha Z.ai обслуживали исключительно на китайских AI-чипах!
В официальном прогоне DeepSWE v1.1 модель набрала 63,4% против 46,2% у GLM-5.2. На собственном Code Bench от Z.ai она почти сравнялась с Opus 4.8: 29 против 29,5 на максимальном effort.
API стоит $0,15 за миллион входных токенов, $0,50 за выходные и $0,03 за закэшированный ввод.
Модель уже доступна в API, ZCode, Chat, AutoClaw и OpenCode.
@ai_for_devs
2🔥93🤯22❤10👏4🤩3⚡2👍2
⚡️ Qwen4: Alibaba выпустили первую модель на новой архитектуре
Состоялся релиз Qwen3.8-Flash-Next на 125 млрд параметров. Alibaba переработали механизм работы с длинным контекстом и добавили отдельную память на 51 млрд параметров для частых сочетаний текста и кода.
Это пока не полноценная Qwen4: модель выпустили, чтобы сообщество научилось работать с новой архитектурой до появления всего семейства.
Веса уже доступны бесплатно, но для локального запуска потребуется больше 80 ГБ памяти.
API-версия скоро появится в QwenCloud по цене $0,16/$0,47 за миллион токенов.
@ai_for_devs
Состоялся релиз Qwen3.8-Flash-Next на 125 млрд параметров. Alibaba переработали механизм работы с длинным контекстом и добавили отдельную память на 51 млрд параметров для частых сочетаний текста и кода.
Это пока не полноценная Qwen4: модель выпустили, чтобы сообщество научилось работать с новой архитектурой до появления всего семейства.
На DeepSWE новинка набрала 58,7% против 42,2% у Qwen3.8-27B и 54,4% у DeepSeek V4 Flash. Но до Kimi K3 с открытыми весами не дотянула, у последней 67,5%.
Веса уже доступны бесплатно, но для локального запуска потребуется больше 80 ГБ памяти.
API-версия скоро появится в QwenCloud по цене $0,16/$0,47 за миллион токенов.
@ai_for_devs
1🔥37👍26❤8🤯1
⚡️ NVIDIA согласилась купить Hugging Face за $12,9 млрд
Если сделка состоится, она станет крупнейшей покупкой в истории NVIDIA. Предыдущий рекорд — Mellanox за $7 млрд.
Забавно, но ещё пол года назад стало известно, что Hugging Face отказала NVIDIA в инвестиции $500 млн при оценке $7 млрд: компания не хотела одного доминирующего инвестора, способного влиять на решения🧠
@ai_for_devs
Если сделка состоится, она станет крупнейшей покупкой в истории NVIDIA. Предыдущий рекорд — Mellanox за $7 млрд.
Годовой темп выручки Hugging Face оценивают всего в $150 млн, поэтому цена равна примерно 86 годовым выручкам. NVIDIA платит не за текущий бизнес, а за доступ к миллионам разработчиков.
Забавно, но ещё пол года назад стало известно, что Hugging Face отказала NVIDIA в инвестиции $500 млн при оценке $7 млрд: компания не хотела одного доминирующего инвестора, способного влиять на решения
@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥40🤯33 19👍6 3❤2
AI for Devs
⚡️ Z.ai выпустили GLM-5.3-Flash — ту самую Ox Alpha, которая за неделю стала топ-1 в OpenCode и OpenRouter Стелс-превью закончилось: за шесть дней пользователи OpenCode прогнали через модель 42 трлн токенов, а на OpenRouter она обошла ближайший DeepSeek по…
В дополнение к релизу Z.ai на две недели снизили цены GLM-5.3-Flash вдвое: $0,075/$0,25 за миллион входных/выходных токенов.
На Router AI модель уже доступна без VPN и иностранной карты:
– 9 ₽/1М input, 30 ₽/1M output
– Кэш 1,81 ₽ / 1M токенов
Настройка для Claude Code, OpenCode, Cursor, JetBrains, Cline, и т.д.
@ai_for_devs
У обновлённого DeepSeek V4 Flash после подорожания даже off-peak стоимость почти в 3 раза дороже.
На Router AI модель уже доступна без VPN и иностранной карты:
– 9 ₽/1М input, 30 ₽/1M output
– Кэш 1,81 ₽ / 1M токенов
Настройка для Claude Code, OpenCode, Cursor, JetBrains, Cline, и т.д.
@ai_for_devs
4🔥44👍20🤯10⚡5❤3
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Anthropic сделали «MCP для железа»
Model Hardware Standard (MHS) — общий интерфейс, через который AI-агенты могут находить и безопасно управлять микроскопами, роботами и другим лабораторным оборудованием.
Для каждого устройства создаётся MHS-драйвер с простыми командами вроде
Пока это закрытый research preview. После тестов MHS обещают сделать open source.
@ai_for_devs
Model Hardware Standard (MHS) — общий интерфейс, через который AI-агенты могут находить и безопасно управлять микроскопами, роботами и другим лабораторным оборудованием.
Для каждого устройства создаётся MHS-драйвер с простыми командами вроде
read и write, описанием возможностей и ограничений безопасности. Агент читает эту инструкцию и управляет сразу несколькими устройствами.В первых тестах AI-агент сам подбирал параметры лабораторного робота и справлялся с частью ошибок по ходу эксперимента. Подготовка сложного эксперимента с микроскопом сократилась с нескольких недель до одного дня.
Пока это закрытый research preview. После тестов MHS обещают сделать open source.
@ai_for_devs
2🔥93🤯31👍27❤4⚡4