Локальная LLM на твоём Mac — бесплатно и без API-ключей.
magnitude — open-source inference-сервер под Apple Silicon. Сам профилирует чип и память, подбирает модель по скорости и точности, скачивает, тюнит и запускает. Подключается к Claude Code, Codex, OpenCode и Hermes. 3,353 звезды, Apache 2.0.
npm i -g @magnitudedev/cli && magnitude setup — и твой агент пересажен на локальную модель. Токены больше не капают, промпты и файлы остаются на твоём железе, работает офлайн.
Рядом в трендах PI-Desktop — local-first кодинг-агент десктопом, 1,479 звёзд за пару дней.
https://github.com/magnitudedev/magnitude
🤯
magnitude — open-source inference-сервер под Apple Silicon. Сам профилирует чип и память, подбирает модель по скорости и точности, скачивает, тюнит и запускает. Подключается к Claude Code, Codex, OpenCode и Hermes. 3,353 звезды, Apache 2.0.
npm i -g @magnitudedev/cli && magnitude setup — и твой агент пересажен на локальную модель. Токены больше не капают, промпты и файлы остаются на твоём железе, работает офлайн.
Рядом в трендах PI-Desktop — local-first кодинг-агент десктопом, 1,479 звёзд за пару дней.
https://github.com/magnitudedev/magnitude
🤯
Прогноз продаж, цен и спроса — бесплатно и локально, 385M параметров.
IBM выкатил Granite Time Series PatchTST-FM-r2 — модель для прогноза временных рядов. Zero-shot: скормил историю продаж или трафика и получил прогноз, без всякого дообучения.
На бенчмарке GIFT-Eval она №1 среди open-source моделей с нормальной лицензией и №2 в общем зачёте. Apache 2.0 — крути в проде без роялти.
Внутри conformer: self-attention плюс временная свёртка, контекст до 8192 шагов, прогноз 99 квантилями и автозаполнение пропусков в данных.
Раньше прогноз на месяц вперёд — самописный скрипт или платный API. Теперь ставишь через Granite-TSFM или берёшь чекпоинт на Hugging Face, одна команда — и прогноз готов.
https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2
🤯
IBM выкатил Granite Time Series PatchTST-FM-r2 — модель для прогноза временных рядов. Zero-shot: скормил историю продаж или трафика и получил прогноз, без всякого дообучения.
На бенчмарке GIFT-Eval она №1 среди open-source моделей с нормальной лицензией и №2 в общем зачёте. Apache 2.0 — крути в проде без роялти.
Внутри conformer: self-attention плюс временная свёртка, контекст до 8192 шагов, прогноз 99 квантилями и автозаполнение пропусков в данных.
Раньше прогноз на месяц вперёд — самописный скрипт или платный API. Теперь ставишь через Granite-TSFM или берёшь чекпоинт на Hugging Face, одна команда — и прогноз готов.
https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2
🤯
Один промпт гоняет 5 агентов параллельно.
Orca — среда разработки для флота агентов. Веером кидаешь одну задачу сразу на пять, каждый копает в своём изолированном git-worktree. Потом сравниваешь результаты и мержишь победителя.
Claude Code, Codex, OpenCode, Pi — любой CLI-агент бок о бок. Свою подписку, что уже платишь, выжимаешь в разы плотнее. Почти 60 тысяч звёзд, MIT, бесплатно под macOS/Windows/Linux.
Старт одной командой:
brew install --cask stablyai/orca/orca
https://github.com/stablyai/orca
🤯
Orca — среда разработки для флота агентов. Веером кидаешь одну задачу сразу на пять, каждый копает в своём изолированном git-worktree. Потом сравниваешь результаты и мержишь победителя.
Claude Code, Codex, OpenCode, Pi — любой CLI-агент бок о бок. Свою подписку, что уже платишь, выжимаешь в разы плотнее. Почти 60 тысяч звёзд, MIT, бесплатно под macOS/Windows/Linux.
Старт одной командой:
brew install --cask stablyai/orca/orca
https://github.com/stablyai/orca
🤯
OpenAI открыл исходники сканера, который сам находит и чинит дыры в твоём коде.
Codex Security — это CLI и TypeScript SDK: прогоняет репо, подтверждает уязвимости, правит их и умеет сам открыть PR с фиксами. ~10k звёзд на GitHub, Apache-2.0, npm-пакет качают 31k раз в неделю.
Всё в три команды:
npm install @openai/codex-security
npx @openai/codex-security login
npx @openai/codex-security scan .
Флаг --patch сам правит найденное, --create-pr открывает пул-реквест. Нужны Node 22+ и Python 3.10+.
Сканы идут через твой ChatGPT-аккаунт, так что если у тебя уже оплачен Codex — security-ревью с автопатчем включено, просто им почти никто не пользуется. Прогони по пет-проекту до релиза.
https://github.com/openai/codex-security
🤯
Codex Security — это CLI и TypeScript SDK: прогоняет репо, подтверждает уязвимости, правит их и умеет сам открыть PR с фиксами. ~10k звёзд на GitHub, Apache-2.0, npm-пакет качают 31k раз в неделю.
Всё в три команды:
npm install @openai/codex-security
npx @openai/codex-security login
npx @openai/codex-security scan .
Флаг --patch сам правит найденное, --create-pr открывает пул-реквест. Нужны Node 22+ и Python 3.10+.
Сканы идут через твой ChatGPT-аккаунт, так что если у тебя уже оплачен Codex — security-ревью с автопатчем включено, просто им почти никто не пользуется. Прогони по пет-проекту до релиза.
https://github.com/openai/codex-security
🤯
435 млн токенов за день — счёт $12 вместо $61.
Reasonix — кодинг-агент для терминала, заточенный только под DeepSeek. MIT, ставится одной командой.
Фишка в prefix-cache. Агент держит контекст так, чтобы DeepSeek кэшировал почти каждый байт. Реальный юзер за сутки прогнал 435 млн входных токенов с попаданием в кэш 99.82% — заплатил $12, а без кэша вышло бы $61.
Claude Code и Cursor под такой кэш не заточены — эту механику они просто не видят.
Ставишь npm install -g reasonix, потом reasonix code my-project и один раз вставляешь ключ DeepSeek.
https://github.com/esengine/DeepSeek-Reasonix
🤯
Reasonix — кодинг-агент для терминала, заточенный только под DeepSeek. MIT, ставится одной командой.
Фишка в prefix-cache. Агент держит контекст так, чтобы DeepSeek кэшировал почти каждый байт. Реальный юзер за сутки прогнал 435 млн входных токенов с попаданием в кэш 99.82% — заплатил $12, а без кэша вышло бы $61.
Claude Code и Cursor под такой кэш не заточены — эту механику они просто не видят.
Ставишь npm install -g reasonix, потом reasonix code my-project и один раз вставляешь ключ DeepSeek.
https://github.com/esengine/DeepSeek-Reasonix
🤯
Codeforces 3206, лицензия MIT. DeepSeek выкатил V4-Pro
1,6 трлн параметров, 49 млрд активных, контекст на 1 млн токенов. И веса под MIT — бери и гоняй в проде как хочешь, без юристов.
По коду обходит GPT-5.4 xhigh: Codeforces 3206 против 3168, LiveCodeBench 93,5. По агентским задачам внутри DeepSeek говорят «на уровне Opus 4.5» — но бесплатно и у себя.
Главная фишка — длинный контекст стал дешёвым: 1 млн токенов = 27% флопсов и 10% KV-кэша от V3.2. Закидываешь весь реп целиком, не пилишь на куски.
vLLM 0.28 уже поддержал. Скачивай веса и тестируй.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
🤯
1,6 трлн параметров, 49 млрд активных, контекст на 1 млн токенов. И веса под MIT — бери и гоняй в проде как хочешь, без юристов.
По коду обходит GPT-5.4 xhigh: Codeforces 3206 против 3168, LiveCodeBench 93,5. По агентским задачам внутри DeepSeek говорят «на уровне Opus 4.5» — но бесплатно и у себя.
Главная фишка — длинный контекст стал дешёвым: 1 млн токенов = 27% флопсов и 10% KV-кэша от V3.2. Закидываешь весь реп целиком, не пилишь на куски.
vLLM 0.28 уже поддержал. Скачивай веса и тестируй.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
🤯
OpenAI: рисуешь каракулю в чате — получаешь готовую картинку.
ChatGPT Images 2.5 выкатили на все тарифы, включая бесплатный. Генерация до 50% быстрее, правки точнее — объект с рефа больше не плывёт между итерациями.
Главная фишка — Sketch. Пишешь @Sketch, рисуешь набросок от руки (планировку комнаты, лук, хоть каракулю), добавляешь пару слов про стиль — ChatGPT рендерит полноценное изображение.
Для разрабов в API две новые модели: GPT-Image-2.5 Flare (быстрее, дефолт) и Sunburst (точнее для сложных правок). Цена за токены та же, что у gpt-image-2.
3 млрд картинок в неделю генерят через ChatGPT — теперь вместо пятого переписывания промпта можно просто нарисовать 🤔
https://community.openai.com/t/introducing-gpt-images-2-5-in-the-api-and-chatgpt/1395897
ChatGPT Images 2.5 выкатили на все тарифы, включая бесплатный. Генерация до 50% быстрее, правки точнее — объект с рефа больше не плывёт между итерациями.
Главная фишка — Sketch. Пишешь @Sketch, рисуешь набросок от руки (планировку комнаты, лук, хоть каракулю), добавляешь пару слов про стиль — ChatGPT рендерит полноценное изображение.
Для разрабов в API две новые модели: GPT-Image-2.5 Flare (быстрее, дефолт) и Sunburst (точнее для сложных правок). Цена за токены та же, что у gpt-image-2.
3 млрд картинок в неделю генерят через ChatGPT — теперь вместо пятого переписывания промпта можно просто нарисовать 🤔
https://community.openai.com/t/introducing-gpt-images-2-5-in-the-api-and-chatgpt/1395897
Google: выложили в open-source Mantis — набор слэш-команд, после которых твой кодинг-агент сам находит уязвимости, воспроизводит их в песочнице и пишет патч.
Это не сканер «запустил и ушёл»: агент строит карту репозитория и модель угроз, ищет подозрительные места, отсеивает ложные срабатывания, прогоняет эксплойт в контейнере без сети и перепроверяет свой патч новой атакой.
Google пишет, что наивное «AI просканировал код» даёт меньше 7% реальных находок — Mantis верит не уверенности модели, а воспроизведённому багу. Заодно дерево саммари режет расход токенов больше чем на 85%: иначе большой репо просто не влезает в контекст.
Ставится быстро: клонируешь репо, кладёшь skill-файлы в проект и вызываешь команды по одной — /mantis-plan, /mantis-reproduce, /mantis-patch. Проверяли на Google ADK и Antigravity SDK, лицензия Apache 2.0.
В прод рано: только интерактивный режим, без --yolo и на изолированной машине 😬
https://github.com/google/mantis
Это не сканер «запустил и ушёл»: агент строит карту репозитория и модель угроз, ищет подозрительные места, отсеивает ложные срабатывания, прогоняет эксплойт в контейнере без сети и перепроверяет свой патч новой атакой.
Google пишет, что наивное «AI просканировал код» даёт меньше 7% реальных находок — Mantis верит не уверенности модели, а воспроизведённому багу. Заодно дерево саммари режет расход токенов больше чем на 85%: иначе большой репо просто не влезает в контекст.
Ставится быстро: клонируешь репо, кладёшь skill-файлы в проект и вызываешь команды по одной — /mantis-plan, /mantis-reproduce, /mantis-patch. Проверяли на Google ADK и Antigravity SDK, лицензия Apache 2.0.
В прод рано: только интерактивный режим, без --yolo и на изолированной машине 😬
https://github.com/google/mantis
134 000 звёзд за три месяца — у скилла, который заставляет твоего кодинг-агента писать вдвое меньше кода.
Это Ponytail, «ленивый сеньор с хвостом»: показываешь ему 50 строк — он молча оставляет одну. Ставится в Claude Code, Codex, Copilot CLI, Gemini CLI и OpenCode, лицензия MIT.
Цифры честные: на реальном репо FastAPI + React агент с Ponytail выдал на 54% меньше строк кода, сжёг на 22% меньше токенов и на 20% меньше денег, а сделал всё на 27% быстрее. Проверки безопасности при этом на 100% на месте.
Пример из README: просишь date picker — обычный агент тянет flatpickr, пишет обёртку и спорит про таймзоны. Ponytail ставит нативную строчку input type="date". Было 404 строки — стало 23.
Ставится в две команды в Claude Code:
/plugin marketplace add DietrichGebert/ponytail
/plugin install ponytail@ponytail
Меньше кода — меньше токенов — меньше счёта за API 🤓
https://github.com/DietrichGebert/ponytail
Это Ponytail, «ленивый сеньор с хвостом»: показываешь ему 50 строк — он молча оставляет одну. Ставится в Claude Code, Codex, Copilot CLI, Gemini CLI и OpenCode, лицензия MIT.
Цифры честные: на реальном репо FastAPI + React агент с Ponytail выдал на 54% меньше строк кода, сжёг на 22% меньше токенов и на 20% меньше денег, а сделал всё на 27% быстрее. Проверки безопасности при этом на 100% на месте.
Пример из README: просишь date picker — обычный агент тянет flatpickr, пишет обёртку и спорит про таймзоны. Ponytail ставит нативную строчку input type="date". Было 404 строки — стало 23.
Ставится в две команды в Claude Code:
/plugin marketplace add DietrichGebert/ponytail
/plugin install ponytail@ponytail
Меньше кода — меньше токенов — меньше счёта за API 🤓
https://github.com/DietrichGebert/ponytail
Google выкатил третий Flash за шесть недель — и он уже топ DeepSWE.
Gemini 3.8 Flash обходит 3.7 почти везде, а в кодинге отрыв заметный: возглавил DeepSWE, где решают сложные software-задачи. Контекст 1 млн токенов, вывод до 65K, thinking в трёх режимах.
Главное — цена. До конца года интро-тариф: $0.75 за млн входа и $3.75 за выход. Потом вдвое дороже, так что сейчас брать выгоднее всего.
Почему важно: почти фронтир-качество за копейки. Рефакторинг, агентные скрипты, разбор легаси можно вынести на Flash и не жечь бюджет.
Как применить сегодня: открой Google AI Studio — там 3.8 Flash бесплатно, без подписки. Прогони свой реальный таск и сравни с текущей моделью. В приложении Gemini нужен Pro или Ultra.
https://arstechnica.com/ai/2026/09/google-releases-gemini-3-8-flash-its-third-flash-model-in-six-weeks 🤓
Gemini 3.8 Flash обходит 3.7 почти везде, а в кодинге отрыв заметный: возглавил DeepSWE, где решают сложные software-задачи. Контекст 1 млн токенов, вывод до 65K, thinking в трёх режимах.
Главное — цена. До конца года интро-тариф: $0.75 за млн входа и $3.75 за выход. Потом вдвое дороже, так что сейчас брать выгоднее всего.
Почему важно: почти фронтир-качество за копейки. Рефакторинг, агентные скрипты, разбор легаси можно вынести на Flash и не жечь бюджет.
Как применить сегодня: открой Google AI Studio — там 3.8 Flash бесплатно, без подписки. Прогони свой реальный таск и сравни с текущей моделью. В приложении Gemini нужен Pro или Ultra.
https://arstechnica.com/ai/2026/09/google-releases-gemini-3-8-flash-its-third-flash-model-in-six-weeks 🤓
1,6 трлн параметров выложили в открытый доступ.
Nex-AGI открыла веса Nex-N2.5-Max — текстовая MoE-модель на 1,6 трлн параметров под Apache 2.0, контекст 1M. На Hugging Face лежат все 644 шарда: 1,65 ТБ без гейта и без ключей.
Почему это важно: «триллионник» впервые можно не пробовать через чат, а скачать целиком — посмотреть конфиг, файнтюнить, гонять на своём железе. Такое раньше жило только за API.
Как применить уже сегодня: Nex-N2.5-Pro и mini той же семьи сейчас бесплатны на OpenRouter — 0 $ за токен, 262K контекста. Берёшь nex-agi/nex-n2.5-pro:free как модель в своём кодинг-агенте и тестишь агентные задачи за ноль.
https://huggingface.co/nex-agi/Nex-N2.5-Max 🤯
Nex-AGI открыла веса Nex-N2.5-Max — текстовая MoE-модель на 1,6 трлн параметров под Apache 2.0, контекст 1M. На Hugging Face лежат все 644 шарда: 1,65 ТБ без гейта и без ключей.
Почему это важно: «триллионник» впервые можно не пробовать через чат, а скачать целиком — посмотреть конфиг, файнтюнить, гонять на своём железе. Такое раньше жило только за API.
Как применить уже сегодня: Nex-N2.5-Pro и mini той же семьи сейчас бесплатны на OpenRouter — 0 $ за токен, 262K контекста. Берёшь nex-agi/nex-n2.5-pro:free как модель в своём кодинг-агенте и тестишь агентные задачи за ноль.
https://huggingface.co/nex-agi/Nex-N2.5-Max 🤯
Три опенсорсных репо набрали 245 тыс. звёзд меньше чем за месяц. Второе захочешь поставить уже сегодня.
deepseek-ai/deepseek-harness — 218 899 звёзд, MIT. Агентный харнесс от DeepSeek по принципу «всё — плагин». Запуск одной командой: npx @deepseek-ai/dsh web — веб-морда на 127.0.0.1:3080. Это developer preview (ломающие изменения будут), зато свою фичу добавляешь плагином, без форка.
guillaumemeyer/watermarks-remover — 21 615 звёзд, MIT. Срезает следы ИИ с твоего же контента: невидимый юникод, текстовые вотермарки, C2PA/EXIF/XMP. PNG, JPEG, PDF, DOCX, PPTX, MP4, MP3 — 20+ форматов. Полезно, если не хочешь ярлык «сделано ИИ» на своих файлах.
CopilotKit/OpenBot — 4 602 звезды, MIT. AI-коллеги, каждому свой браузер и файлы: действие видно до, лог — после. Для тех, кто устал от агента, шурующего по системе без отчёта.
https://github.com/deepseek-ai/deepseek-harness 🤔
deepseek-ai/deepseek-harness — 218 899 звёзд, MIT. Агентный харнесс от DeepSeek по принципу «всё — плагин». Запуск одной командой: npx @deepseek-ai/dsh web — веб-морда на 127.0.0.1:3080. Это developer preview (ломающие изменения будут), зато свою фичу добавляешь плагином, без форка.
guillaumemeyer/watermarks-remover — 21 615 звёзд, MIT. Срезает следы ИИ с твоего же контента: невидимый юникод, текстовые вотермарки, C2PA/EXIF/XMP. PNG, JPEG, PDF, DOCX, PPTX, MP4, MP3 — 20+ форматов. Полезно, если не хочешь ярлык «сделано ИИ» на своих файлах.
CopilotKit/OpenBot — 4 602 звезды, MIT. AI-коллеги, каждому свой браузер и файлы: действие видно до, лог — после. Для тех, кто устал от агента, шурующего по системе без отчёта.
https://github.com/deepseek-ai/deepseek-harness 🤔
Фронтирная модель за $0.10 за миллион токенов. Но платишь не деньгами.
Meta открыла API к Muse Spark 1.3 — своей лучшей модели, вровень с GPT-5.6 Sol и Claude Opus 5. Контекст 1M, заточка под долгие агентные задачи и кодинг.
На contributor-тарифе вход стоит $0.10 за млн токенов, выход — $0.20, кэш — $0.002. У GPT-6 Astra те же позиции стоят $10 и $50. Разница в 100 раз.
Секрет простой: на этом тарифе Meta читает твои промпты и учится на них, плюс лимит 100 запросов в минуту.
Как применить: ставь модель muse-spark-1.3-contributor туда, где данные не секретны — прототипы, тесты, пет-проекты. Меняешь только model ID, эндпоинты и SDK те же. Для клиентского кода и приватных данных — обычный тариф.
Цукерберг обещал открытые веса Muse Spark «скоро».
https://dev.meta.ai/docs/pricing-rate-limits/ 🤔
Meta открыла API к Muse Spark 1.3 — своей лучшей модели, вровень с GPT-5.6 Sol и Claude Opus 5. Контекст 1M, заточка под долгие агентные задачи и кодинг.
На contributor-тарифе вход стоит $0.10 за млн токенов, выход — $0.20, кэш — $0.002. У GPT-6 Astra те же позиции стоят $10 и $50. Разница в 100 раз.
Секрет простой: на этом тарифе Meta читает твои промпты и учится на них, плюс лимит 100 запросов в минуту.
Как применить: ставь модель muse-spark-1.3-contributor туда, где данные не секретны — прототипы, тесты, пет-проекты. Меняешь только model ID, эндпоинты и SDK те же. Для клиентского кода и приватных данных — обычный тариф.
Цукерберг обещал открытые веса Muse Spark «скоро».
https://dev.meta.ai/docs/pricing-rate-limits/ 🤔
NASA и IBM выложили в опенсорс модель, которая ищет лёд на Луне на 23% точнее.
Веса под Apache 2.0 уже на Hugging Face, рядом — SomBench, первый единый датасет по Луне для ML: 17 лет наблюдений, 9 приборов, 4 миссии.
На 100 м/пиксель она обходит обычный SwinV2-B почти на 19% по кратерам, учась при этом на вдвое меньшем объёме данных, а по льду в вечно тёмных кратерах даёт минус 23% ошибки. По этим картам NASA выбирает посадочные площадки.
Зачем тебе: забрать можно не Луну, а рецепт. Это тот же Prithvi-стек, что работает по спутникам, дронам и аэросъёмке — свой foundation model и файнтюн под свой домен без госконтракта.
Веса и TerraTorch: https://huggingface.co/nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model 🤯
Веса под Apache 2.0 уже на Hugging Face, рядом — SomBench, первый единый датасет по Луне для ML: 17 лет наблюдений, 9 приборов, 4 миссии.
На 100 м/пиксель она обходит обычный SwinV2-B почти на 19% по кратерам, учась при этом на вдвое меньшем объёме данных, а по льду в вечно тёмных кратерах даёт минус 23% ошибки. По этим картам NASA выбирает посадочные площадки.
Зачем тебе: забрать можно не Луну, а рецепт. Это тот же Prithvi-стек, что работает по спутникам, дронам и аэросъёмке — свой foundation model и файнтюн под свой домен без госконтракта.
Веса и TerraTorch: https://huggingface.co/nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model 🤯
Suno выкатил v6 и удалил все старые модели навсегда.
9 сентября вышло сразу три модели: v6 и v6-wild — для подписчиков Pro за $10 и Premier за $30 в месяц, v6-mini — бесплатно всем. Отката нет: v5.5 и всё, что было до него, не вернуть. Треки в библиотеке останутся, но перегенерить их старым движком больше нельзя.
Для тебя главное — лимиты на скачивание. На бесплатном тарифе всего 7 скачиваний за всю жизнь и без коммерческих прав. На Pro — 20 скачиваний в месяц, дальше $2.99 за каждое. Права на свою музыку остаются даже после отмены подписки.
Ещё из нового: можно править одну строку текста, не пересобирая весь трек, и склеивать мэшапы из нескольких песен. Обучали модели с нуля на лицензированных каталогах Warner, BMG и Believe, Universal и Sony в датасете нет — значит, релизить через Believe и TuneCore можно без риска.
Забирай бесплатную v6-mini прямо сейчас 🤯
https://suno.com/blog/introducing-v6
9 сентября вышло сразу три модели: v6 и v6-wild — для подписчиков Pro за $10 и Premier за $30 в месяц, v6-mini — бесплатно всем. Отката нет: v5.5 и всё, что было до него, не вернуть. Треки в библиотеке останутся, но перегенерить их старым движком больше нельзя.
Для тебя главное — лимиты на скачивание. На бесплатном тарифе всего 7 скачиваний за всю жизнь и без коммерческих прав. На Pro — 20 скачиваний в месяц, дальше $2.99 за каждое. Права на свою музыку остаются даже после отмены подписки.
Ещё из нового: можно править одну строку текста, не пересобирая весь трек, и склеивать мэшапы из нескольких песен. Обучали модели с нуля на лицензированных каталогах Warner, BMG и Believe, Universal и Sony в датасете нет — значит, релизить через Believe и TuneCore можно без риска.
Забирай бесплатную v6-mini прямо сейчас 🤯
https://suno.com/blog/introducing-v6
DeepSeek: 552B параметров, а на входе работает всего 8B.
Вышел DeepSeek-V4.1-Flash — веса под MIT на Hugging Face, контекст 1M, картинки понимает нативно. Архитектура новая: Causal Encoder-Decoder, 8B активных параметров на префилле и 16B на генерации, обучен с нуля на 45 трлн токенов.
Самая вкусная цифра — KV-кэш: 890 байт на токен, в 4 раза меньше, чем у V4-Flash. Кэш — это и есть основная статья расходов у кодинг-агентов, так что длинные прогоны подешевеют в разы.
Флагманов он тоже обошёл: Terminal-Bench 2.1 — 90.6 против 89.1 у Opus 5.0, DeepSWE 74.2, CyberGym 88.1, Codeforces 3471 (у V4-Pro было 3348).
Как применить: ставь в конфиге deepseek-flash. Старые V4-Flash и Vision-Exp уже выведены, а с 14 сентября все запросы deepseek-v4-pro сами уедут на V4.1-Flash по его ценам — пока не выйдет V4.1-Pro.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🤯
Вышел DeepSeek-V4.1-Flash — веса под MIT на Hugging Face, контекст 1M, картинки понимает нативно. Архитектура новая: Causal Encoder-Decoder, 8B активных параметров на префилле и 16B на генерации, обучен с нуля на 45 трлн токенов.
Самая вкусная цифра — KV-кэш: 890 байт на токен, в 4 раза меньше, чем у V4-Flash. Кэш — это и есть основная статья расходов у кодинг-агентов, так что длинные прогоны подешевеют в разы.
Флагманов он тоже обошёл: Terminal-Bench 2.1 — 90.6 против 89.1 у Opus 5.0, DeepSWE 74.2, CyberGym 88.1, Codeforces 3471 (у V4-Pro было 3348).
Как применить: ставь в конфиге deepseek-flash. Старые V4-Flash и Vision-Exp уже выведены, а с 14 сентября все запросы deepseek-v4-pro сами уедут на V4.1-Flash по его ценам — пока не выйдет V4.1-Pro.
https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🤯
OpenAI: рантайм Codex теперь в API, за один вызов.
Вчера вышла Agents API в публичной бете — та самая обвязка, что крутит Codex. Даёшь задачу, модель и инструменты — получаешь durable-сессию: она живёт часами, сама сжимает контекст, переживает обрыв, её можно продолжить и подправить по ходу.
Агент сам бьёт работу на подзадачи и раскидывает их по сабагентам параллельно. MCP, свои функции, веб-поиск и песочница — на выбор: хостерная у OpenAI, своя или у партнёров.
За сам harness отдельной платы нет — платишь только за токены и вызовы тулов, как за обычный API. Раньше всё это (сессии, компакция, восстановление после падения) пришлось бы писать руками и тащить на своём сервере.
Минус жирный: data residency только США и Zero Data Retention не поддерживается даже в self-hosted песочнице. Для прода с требованиями к данным — мимо.
https://openai.com/index/introducing-the-agents-api/ 🤓
Вчера вышла Agents API в публичной бете — та самая обвязка, что крутит Codex. Даёшь задачу, модель и инструменты — получаешь durable-сессию: она живёт часами, сама сжимает контекст, переживает обрыв, её можно продолжить и подправить по ходу.
Агент сам бьёт работу на подзадачи и раскидывает их по сабагентам параллельно. MCP, свои функции, веб-поиск и песочница — на выбор: хостерная у OpenAI, своя или у партнёров.
За сам harness отдельной платы нет — платишь только за токены и вызовы тулов, как за обычный API. Раньше всё это (сессии, компакция, восстановление после падения) пришлось бы писать руками и тащить на своём сервере.
Минус жирный: data residency только США и Zero Data Retention не поддерживается даже в self-hosted песочнице. Для прода с требованиями к данным — мимо.
https://openai.com/index/introducing-the-agents-api/ 🤓
OpenAI: голосовой агент в API теперь стоит $0,05 за минуту.
GPT‑Live‑1 вышел в API — он слушает и говорит одновременно, как живой человек. На Full Duplex Bench это на 30 пунктов больше прошлой GPT‑Realtime‑2.1, а у Speak ложных перебиваний стало меньше на 80%.
Почему важно: больше не надо склеивать STT → LLM → TTS. Одна модель держит и входящий, и исходящий звук, поэтому нет задержки на стыках и не теряется контекст. Сложное мышление и вызовы тулз она скидывает на GPT‑6 Astra или свою модель.
Как применить: задаёшь тон и темп речи прямо в system prompt, подключаешь телефонию — и бот сам бронирует столики и держит первую линию поддержки. Пять центов за минуту фронтового слоя, шум улицы и перебивания ему не мешают.
https://openai.com/index/introducing-gpt-live-1-in-the-api/
🤯
GPT‑Live‑1 вышел в API — он слушает и говорит одновременно, как живой человек. На Full Duplex Bench это на 30 пунктов больше прошлой GPT‑Realtime‑2.1, а у Speak ложных перебиваний стало меньше на 80%.
Почему важно: больше не надо склеивать STT → LLM → TTS. Одна модель держит и входящий, и исходящий звук, поэтому нет задержки на стыках и не теряется контекст. Сложное мышление и вызовы тулз она скидывает на GPT‑6 Astra или свою модель.
Как применить: задаёшь тон и темп речи прямо в system prompt, подключаешь телефонию — и бот сам бронирует столики и держит первую линию поддержки. Пять центов за минуту фронтового слоя, шум улицы и перебивания ему не мешают.
https://openai.com/index/introducing-gpt-live-1-in-the-api/
🤯
Cognition: SWE-2 берёт 50,0% там, где топовая Fable 5.1 даёт 50,9% — и стоит на 64% меньше.
Это новая флагманская кодинг-модель Cognition. Учили не с нуля: взяли открытый Kimi K3 от Moonshot (2,8 трлн параметров, 104 млрд активных на токен) и накатили свой RL — +5-6 пунктов почти везде. Terminal-Bench 2.1 — 92,8, DeepSWE 1.1 — 73,0.
Почему важно: впервые RL в мульти-триллионном масштабе, причём все три режима (medium/high/max) тренят в одном прогоне штрафом за стоимость. medium обгоняет прошлую SWE-1.7 при 58% меньшем числе шагов и цене ниже на 81%: первый реальный edit — на 18-м шаге против 48-го.
Как применить: отдельного API и весов нет, модель живёт внутри Devin — с $20/мес на Pro без лимитов. Прогони десяток своих тикетов через medium и считай цену за решённую задачу, а не за токен.
https://cognition.com/blog/swe-2
🤓
Это новая флагманская кодинг-модель Cognition. Учили не с нуля: взяли открытый Kimi K3 от Moonshot (2,8 трлн параметров, 104 млрд активных на токен) и накатили свой RL — +5-6 пунктов почти везде. Terminal-Bench 2.1 — 92,8, DeepSWE 1.1 — 73,0.
Почему важно: впервые RL в мульти-триллионном масштабе, причём все три режима (medium/high/max) тренят в одном прогоне штрафом за стоимость. medium обгоняет прошлую SWE-1.7 при 58% меньшем числе шагов и цене ниже на 81%: первый реальный edit — на 18-м шаге против 48-го.
Как применить: отдельного API и весов нет, модель живёт внутри Devin — с $20/мес на Pro без лимитов. Прогони десяток своих тикетов через medium и считай цену за решённую задачу, а не за токен.
https://cognition.com/blog/swe-2
🤓
Abacus.AI: дообучение даёт +20% к агентным циклам бесплатно.
Выложили три открытые модели: Smaug Agentic — файнтюн Kimi K3 на 2,8 трлн параметров, Flash — на DeepSeek V4-Flash, Mini — 27B на Qwen3.8. Веса лежат на Hugging Face, качает любой.
Фишка в методе: дообучают на отфильтрованных многоходовых трейсах с выключенными в лоссе reasoning-токенами. У Flash на LiveBench agentic coding 61,1 против 46,8 у базы, на AutomationBench 38,8 против 25,1, на NL2repo 73,3 против 54,2.
Платформа та же, цена та же, а длинные агентские циклы стали на 15-20% надёжнее — в 10-100 раз дешевле фронтира от OpenAI и Anthropic.
Как применить сегодня: берёшь веса с huggingface.co/abacusai, гоняешь свой агентский прогон и сравниваешь с тем, что стоит у тебя сейчас.
https://huggingface.co/abacusai
🤔
Выложили три открытые модели: Smaug Agentic — файнтюн Kimi K3 на 2,8 трлн параметров, Flash — на DeepSeek V4-Flash, Mini — 27B на Qwen3.8. Веса лежат на Hugging Face, качает любой.
Фишка в методе: дообучают на отфильтрованных многоходовых трейсах с выключенными в лоссе reasoning-токенами. У Flash на LiveBench agentic coding 61,1 против 46,8 у базы, на AutomationBench 38,8 против 25,1, на NL2repo 73,3 против 54,2.
Платформа та же, цена та же, а длинные агентские циклы стали на 15-20% надёжнее — в 10-100 раз дешевле фронтира от OpenAI и Anthropic.
Как применить сегодня: берёшь веса с huggingface.co/abacusai, гоняешь свой агентский прогон и сравниваешь с тем, что стоит у тебя сейчас.
https://huggingface.co/abacusai
🤔