Коммит
5 subscribers
194 photos
193 links
ИИ меняет разработку — модели, кодинг-агенты, инструменты. Каждый день, без воды, с цифрами и живым мнением.
Download Telegram
Nex-AGI выложила computer-use агента с открытыми весами. 35 млрд параметров, Apache-2.0, 70 ГБ.

Nex-N2.5 Mini видит экран, ходит по браузеру и сам правит код по ходу. Заявляют 71.2 на OSWorld-Verified — для ~3 млрд активных параметров это офигеть.

Крутится на двух H100. Не дата-центр, а обычный узел — и никаких закрытых API.

Зачем тебе: пока все спорят, готовы ли open-source агенты к длинным задачам, ты скачиваешь чекпойнт и проверяешь сам. nex-agi/Nex-N2.5-mini, SGLang-форк и рецепт в репо.

https://www.orcarouter.ai/blog/nex-n2-5-mini-open-weights-release

👀
68% SWE-bench бесплатно — OpenHands 1.0 догнал платных агентов на твоём железе.

Бывший OpenDevin дозрел до продакшена: Docker-песочница, политики безопасности, лимиты ресурсов, плагины. Каждое действие агента — правки файлов, shell, тесты — крутится в изолированном контейнере, код и ключи с машины не уходят.

Цифры: с открытой моделью Devstral 24B он даёт 46.8% SWE-bench Verified — вровень с тем, что Devin 2.0 публикует за деньги. С frontier-моделью — около 68%. Себестоимость $0.20–1.05 за решённую задачу.

Как затестить за минуту:
```
docker run -it --rm -p 8000:8000 -v "$HOME/.openhands:/home/openhands/.openhands" -v "$HOME/projects:/projects" ghcr.io/openhands/agent-canvas:1.15.0
```

Фишка — харнессу всё равно, какая модель внутри. Рутину гоняй через дешёвые open-модели, frontier оставь на сложное. 🤓

https://github.com/OpenHands/OpenHands
Ant Group: финансовая модель на 124B — бесплатно, открытые веса.

Ling-3.0-flash-Fin. MoE: 124 млрд параметров всего, 5,1 млрд активных на токен. Заточена под инвестиционные исследования, оценку компаний и готовые отчёты.

Такое раньше делали терминалы за тысячи баксов в месяц или платные фин-LLM. Веса открыты на Hugging Face и ModelScope, API на OpenRouter и Vercel.

Подключаешь поиск, Python, базы и таблицы — приватный фин-агент под свои воркфлоу. Бонусом FinFIRST: 123 задачи, 701 критерий, писали инвестбанкиры из CICC.

https://businesswire.com/news/home/20260908565055/en/

🤓
Локальная LLM на твоём Mac — бесплатно и без API-ключей.

magnitude — open-source inference-сервер под Apple Silicon. Сам профилирует чип и память, подбирает модель по скорости и точности, скачивает, тюнит и запускает. Подключается к Claude Code, Codex, OpenCode и Hermes. 3,353 звезды, Apache 2.0.

npm i -g @magnitudedev/cli && magnitude setup — и твой агент пересажен на локальную модель. Токены больше не капают, промпты и файлы остаются на твоём железе, работает офлайн.

Рядом в трендах PI-Desktop — local-first кодинг-агент десктопом, 1,479 звёзд за пару дней.

https://github.com/magnitudedev/magnitude

🤯
Прогноз продаж, цен и спроса — бесплатно и локально, 385M параметров.

IBM выкатил Granite Time Series PatchTST-FM-r2 — модель для прогноза временных рядов. Zero-shot: скормил историю продаж или трафика и получил прогноз, без всякого дообучения.

На бенчмарке GIFT-Eval она №1 среди open-source моделей с нормальной лицензией и №2 в общем зачёте. Apache 2.0 — крути в проде без роялти.

Внутри conformer: self-attention плюс временная свёртка, контекст до 8192 шагов, прогноз 99 квантилями и автозаполнение пропусков в данных.

Раньше прогноз на месяц вперёд — самописный скрипт или платный API. Теперь ставишь через Granite-TSFM или берёшь чекпоинт на Hugging Face, одна команда — и прогноз готов.

https://huggingface.co/ibm-granite/granite-timeseries-patchtst-fm-r2
🤯
Один промпт гоняет 5 агентов параллельно.

Orca — среда разработки для флота агентов. Веером кидаешь одну задачу сразу на пять, каждый копает в своём изолированном git-worktree. Потом сравниваешь результаты и мержишь победителя.

Claude Code, Codex, OpenCode, Pi — любой CLI-агент бок о бок. Свою подписку, что уже платишь, выжимаешь в разы плотнее. Почти 60 тысяч звёзд, MIT, бесплатно под macOS/Windows/Linux.

Старт одной командой:
brew install --cask stablyai/orca/orca

https://github.com/stablyai/orca

🤯
OpenAI открыл исходники сканера, который сам находит и чинит дыры в твоём коде.

Codex Security — это CLI и TypeScript SDK: прогоняет репо, подтверждает уязвимости, правит их и умеет сам открыть PR с фиксами. ~10k звёзд на GitHub, Apache-2.0, npm-пакет качают 31k раз в неделю.

Всё в три команды:

npm install @openai/codex-security
npx @openai/codex-security login
npx @openai/codex-security scan .

Флаг --patch сам правит найденное, --create-pr открывает пул-реквест. Нужны Node 22+ и Python 3.10+.

Сканы идут через твой ChatGPT-аккаунт, так что если у тебя уже оплачен Codex — security-ревью с автопатчем включено, просто им почти никто не пользуется. Прогони по пет-проекту до релиза.

https://github.com/openai/codex-security

🤯
435 млн токенов за день — счёт $12 вместо $61.

Reasonix — кодинг-агент для терминала, заточенный только под DeepSeek. MIT, ставится одной командой.

Фишка в prefix-cache. Агент держит контекст так, чтобы DeepSeek кэшировал почти каждый байт. Реальный юзер за сутки прогнал 435 млн входных токенов с попаданием в кэш 99.82% — заплатил $12, а без кэша вышло бы $61.

Claude Code и Cursor под такой кэш не заточены — эту механику они просто не видят.

Ставишь npm install -g reasonix, потом reasonix code my-project и один раз вставляешь ключ DeepSeek.

https://github.com/esengine/DeepSeek-Reasonix

🤯
Codeforces 3206, лицензия MIT. DeepSeek выкатил V4-Pro

1,6 трлн параметров, 49 млрд активных, контекст на 1 млн токенов. И веса под MIT — бери и гоняй в проде как хочешь, без юристов.

По коду обходит GPT-5.4 xhigh: Codeforces 3206 против 3168, LiveCodeBench 93,5. По агентским задачам внутри DeepSeek говорят «на уровне Opus 4.5» — но бесплатно и у себя.

Главная фишка — длинный контекст стал дешёвым: 1 млн токенов = 27% флопсов и 10% KV-кэша от V3.2. Закидываешь весь реп целиком, не пилишь на куски.

vLLM 0.28 уже поддержал. Скачивай веса и тестируй.

https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro

🤯
OpenAI: рисуешь каракулю в чате — получаешь готовую картинку.

ChatGPT Images 2.5 выкатили на все тарифы, включая бесплатный. Генерация до 50% быстрее, правки точнее — объект с рефа больше не плывёт между итерациями.

Главная фишка — Sketch. Пишешь @Sketch, рисуешь набросок от руки (планировку комнаты, лук, хоть каракулю), добавляешь пару слов про стиль — ChatGPT рендерит полноценное изображение.

Для разрабов в API две новые модели: GPT-Image-2.5 Flare (быстрее, дефолт) и Sunburst (точнее для сложных правок). Цена за токены та же, что у gpt-image-2.

3 млрд картинок в неделю генерят через ChatGPT — теперь вместо пятого переписывания промпта можно просто нарисовать 🤔

https://community.openai.com/t/introducing-gpt-images-2-5-in-the-api-and-chatgpt/1395897
Google: выложили в open-source Mantis — набор слэш-команд, после которых твой кодинг-агент сам находит уязвимости, воспроизводит их в песочнице и пишет патч.

Это не сканер «запустил и ушёл»: агент строит карту репозитория и модель угроз, ищет подозрительные места, отсеивает ложные срабатывания, прогоняет эксплойт в контейнере без сети и перепроверяет свой патч новой атакой.

Google пишет, что наивное «AI просканировал код» даёт меньше 7% реальных находок — Mantis верит не уверенности модели, а воспроизведённому багу. Заодно дерево саммари режет расход токенов больше чем на 85%: иначе большой репо просто не влезает в контекст.

Ставится быстро: клонируешь репо, кладёшь skill-файлы в проект и вызываешь команды по одной — /mantis-plan, /mantis-reproduce, /mantis-patch. Проверяли на Google ADK и Antigravity SDK, лицензия Apache 2.0.

В прод рано: только интерактивный режим, без --yolo и на изолированной машине 😬

https://github.com/google/mantis
134 000 звёзд за три месяца — у скилла, который заставляет твоего кодинг-агента писать вдвое меньше кода.

Это Ponytail, «ленивый сеньор с хвостом»: показываешь ему 50 строк — он молча оставляет одну. Ставится в Claude Code, Codex, Copilot CLI, Gemini CLI и OpenCode, лицензия MIT.

Цифры честные: на реальном репо FastAPI + React агент с Ponytail выдал на 54% меньше строк кода, сжёг на 22% меньше токенов и на 20% меньше денег, а сделал всё на 27% быстрее. Проверки безопасности при этом на 100% на месте.

Пример из README: просишь date picker — обычный агент тянет flatpickr, пишет обёртку и спорит про таймзоны. Ponytail ставит нативную строчку input type="date". Было 404 строки — стало 23.

Ставится в две команды в Claude Code:
/plugin marketplace add DietrichGebert/ponytail
/plugin install ponytail@ponytail

Меньше кода — меньше токенов — меньше счёта за API 🤓

https://github.com/DietrichGebert/ponytail
Google выкатил третий Flash за шесть недель — и он уже топ DeepSWE.

Gemini 3.8 Flash обходит 3.7 почти везде, а в кодинге отрыв заметный: возглавил DeepSWE, где решают сложные software-задачи. Контекст 1 млн токенов, вывод до 65K, thinking в трёх режимах.

Главное — цена. До конца года интро-тариф: $0.75 за млн входа и $3.75 за выход. Потом вдвое дороже, так что сейчас брать выгоднее всего.

Почему важно: почти фронтир-качество за копейки. Рефакторинг, агентные скрипты, разбор легаси можно вынести на Flash и не жечь бюджет.

Как применить сегодня: открой Google AI Studio — там 3.8 Flash бесплатно, без подписки. Прогони свой реальный таск и сравни с текущей моделью. В приложении Gemini нужен Pro или Ultra.

https://arstechnica.com/ai/2026/09/google-releases-gemini-3-8-flash-its-third-flash-model-in-six-weeks 🤓
1,6 трлн параметров выложили в открытый доступ.

Nex-AGI открыла веса Nex-N2.5-Max — текстовая MoE-модель на 1,6 трлн параметров под Apache 2.0, контекст 1M. На Hugging Face лежат все 644 шарда: 1,65 ТБ без гейта и без ключей.

Почему это важно: «триллионник» впервые можно не пробовать через чат, а скачать целиком — посмотреть конфиг, файнтюнить, гонять на своём железе. Такое раньше жило только за API.

Как применить уже сегодня: Nex-N2.5-Pro и mini той же семьи сейчас бесплатны на OpenRouter — 0 $ за токен, 262K контекста. Берёшь nex-agi/nex-n2.5-pro:free как модель в своём кодинг-агенте и тестишь агентные задачи за ноль.

https://huggingface.co/nex-agi/Nex-N2.5-Max 🤯
Три опенсорсных репо набрали 245 тыс. звёзд меньше чем за месяц. Второе захочешь поставить уже сегодня.

deepseek-ai/deepseek-harness — 218 899 звёзд, MIT. Агентный харнесс от DeepSeek по принципу «всё — плагин». Запуск одной командой: npx @deepseek-ai/dsh web — веб-морда на 127.0.0.1:3080. Это developer preview (ломающие изменения будут), зато свою фичу добавляешь плагином, без форка.

guillaumemeyer/watermarks-remover — 21 615 звёзд, MIT. Срезает следы ИИ с твоего же контента: невидимый юникод, текстовые вотермарки, C2PA/EXIF/XMP. PNG, JPEG, PDF, DOCX, PPTX, MP4, MP3 — 20+ форматов. Полезно, если не хочешь ярлык «сделано ИИ» на своих файлах.

CopilotKit/OpenBot — 4 602 звезды, MIT. AI-коллеги, каждому свой браузер и файлы: действие видно до, лог — после. Для тех, кто устал от агента, шурующего по системе без отчёта.

https://github.com/deepseek-ai/deepseek-harness 🤔
Фронтирная модель за $0.10 за миллион токенов. Но платишь не деньгами.

Meta открыла API к Muse Spark 1.3 — своей лучшей модели, вровень с GPT-5.6 Sol и Claude Opus 5. Контекст 1M, заточка под долгие агентные задачи и кодинг.

На contributor-тарифе вход стоит $0.10 за млн токенов, выход — $0.20, кэш — $0.002. У GPT-6 Astra те же позиции стоят $10 и $50. Разница в 100 раз.

Секрет простой: на этом тарифе Meta читает твои промпты и учится на них, плюс лимит 100 запросов в минуту.

Как применить: ставь модель muse-spark-1.3-contributor туда, где данные не секретны — прототипы, тесты, пет-проекты. Меняешь только model ID, эндпоинты и SDK те же. Для клиентского кода и приватных данных — обычный тариф.

Цукерберг обещал открытые веса Muse Spark «скоро».

https://dev.meta.ai/docs/pricing-rate-limits/ 🤔
NASA и IBM выложили в опенсорс модель, которая ищет лёд на Луне на 23% точнее.

Веса под Apache 2.0 уже на Hugging Face, рядом — SomBench, первый единый датасет по Луне для ML: 17 лет наблюдений, 9 приборов, 4 миссии.

На 100 м/пиксель она обходит обычный SwinV2-B почти на 19% по кратерам, учась при этом на вдвое меньшем объёме данных, а по льду в вечно тёмных кратерах даёт минус 23% ошибки. По этим картам NASA выбирает посадочные площадки.

Зачем тебе: забрать можно не Луну, а рецепт. Это тот же Prithvi-стек, что работает по спутникам, дронам и аэросъёмке — свой foundation model и файнтюн под свой домен без госконтракта.

Веса и TerraTorch: https://huggingface.co/nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model 🤯
Suno выкатил v6 и удалил все старые модели навсегда.

9 сентября вышло сразу три модели: v6 и v6-wild — для подписчиков Pro за $10 и Premier за $30 в месяц, v6-mini — бесплатно всем. Отката нет: v5.5 и всё, что было до него, не вернуть. Треки в библиотеке останутся, но перегенерить их старым движком больше нельзя.

Для тебя главное — лимиты на скачивание. На бесплатном тарифе всего 7 скачиваний за всю жизнь и без коммерческих прав. На Pro — 20 скачиваний в месяц, дальше $2.99 за каждое. Права на свою музыку остаются даже после отмены подписки.

Ещё из нового: можно править одну строку текста, не пересобирая весь трек, и склеивать мэшапы из нескольких песен. Обучали модели с нуля на лицензированных каталогах Warner, BMG и Believe, Universal и Sony в датасете нет — значит, релизить через Believe и TuneCore можно без риска.

Забирай бесплатную v6-mini прямо сейчас 🤯

https://suno.com/blog/introducing-v6
DeepSeek: 552B параметров, а на входе работает всего 8B.

Вышел DeepSeek-V4.1-Flash — веса под MIT на Hugging Face, контекст 1M, картинки понимает нативно. Архитектура новая: Causal Encoder-Decoder, 8B активных параметров на префилле и 16B на генерации, обучен с нуля на 45 трлн токенов.

Самая вкусная цифра — KV-кэш: 890 байт на токен, в 4 раза меньше, чем у V4-Flash. Кэш — это и есть основная статья расходов у кодинг-агентов, так что длинные прогоны подешевеют в разы.

Флагманов он тоже обошёл: Terminal-Bench 2.1 — 90.6 против 89.1 у Opus 5.0, DeepSWE 74.2, CyberGym 88.1, Codeforces 3471 (у V4-Pro было 3348).

Как применить: ставь в конфиге deepseek-flash. Старые V4-Flash и Vision-Exp уже выведены, а с 14 сентября все запросы deepseek-v4-pro сами уедут на V4.1-Flash по его ценам — пока не выйдет V4.1-Pro.

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

🤯
OpenAI: рантайм Codex теперь в API, за один вызов.

Вчера вышла Agents API в публичной бете — та самая обвязка, что крутит Codex. Даёшь задачу, модель и инструменты — получаешь durable-сессию: она живёт часами, сама сжимает контекст, переживает обрыв, её можно продолжить и подправить по ходу.

Агент сам бьёт работу на подзадачи и раскидывает их по сабагентам параллельно. MCP, свои функции, веб-поиск и песочница — на выбор: хостерная у OpenAI, своя или у партнёров.

За сам harness отдельной платы нет — платишь только за токены и вызовы тулов, как за обычный API. Раньше всё это (сессии, компакция, восстановление после падения) пришлось бы писать руками и тащить на своём сервере.

Минус жирный: data residency только США и Zero Data Retention не поддерживается даже в self-hosted песочнице. Для прода с требованиями к данным — мимо.

https://openai.com/index/introducing-the-agents-api/ 🤓