Коммит
5 subscribers
194 photos
193 links
ИИ меняет разработку — модели, кодинг-агенты, инструменты. Каждый день, без воды, с цифрами и живым мнением.
Download Telegram
Codeforces 3206, лицензия MIT. DeepSeek выкатил V4-Pro

1,6 трлн параметров, 49 млрд активных, контекст на 1 млн токенов. И веса под MIT — бери и гоняй в проде как хочешь, без юристов.

По коду обходит GPT-5.4 xhigh: Codeforces 3206 против 3168, LiveCodeBench 93,5. По агентским задачам внутри DeepSeek говорят «на уровне Opus 4.5» — но бесплатно и у себя.

Главная фишка — длинный контекст стал дешёвым: 1 млн токенов = 27% флопсов и 10% KV-кэша от V3.2. Закидываешь весь реп целиком, не пилишь на куски.

vLLM 0.28 уже поддержал. Скачивай веса и тестируй.

https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro

🤯
OpenAI: рисуешь каракулю в чате — получаешь готовую картинку.

ChatGPT Images 2.5 выкатили на все тарифы, включая бесплатный. Генерация до 50% быстрее, правки точнее — объект с рефа больше не плывёт между итерациями.

Главная фишка — Sketch. Пишешь @Sketch, рисуешь набросок от руки (планировку комнаты, лук, хоть каракулю), добавляешь пару слов про стиль — ChatGPT рендерит полноценное изображение.

Для разрабов в API две новые модели: GPT-Image-2.5 Flare (быстрее, дефолт) и Sunburst (точнее для сложных правок). Цена за токены та же, что у gpt-image-2.

3 млрд картинок в неделю генерят через ChatGPT — теперь вместо пятого переписывания промпта можно просто нарисовать 🤔

https://community.openai.com/t/introducing-gpt-images-2-5-in-the-api-and-chatgpt/1395897
Google: выложили в open-source Mantis — набор слэш-команд, после которых твой кодинг-агент сам находит уязвимости, воспроизводит их в песочнице и пишет патч.

Это не сканер «запустил и ушёл»: агент строит карту репозитория и модель угроз, ищет подозрительные места, отсеивает ложные срабатывания, прогоняет эксплойт в контейнере без сети и перепроверяет свой патч новой атакой.

Google пишет, что наивное «AI просканировал код» даёт меньше 7% реальных находок — Mantis верит не уверенности модели, а воспроизведённому багу. Заодно дерево саммари режет расход токенов больше чем на 85%: иначе большой репо просто не влезает в контекст.

Ставится быстро: клонируешь репо, кладёшь skill-файлы в проект и вызываешь команды по одной — /mantis-plan, /mantis-reproduce, /mantis-patch. Проверяли на Google ADK и Antigravity SDK, лицензия Apache 2.0.

В прод рано: только интерактивный режим, без --yolo и на изолированной машине 😬

https://github.com/google/mantis
134 000 звёзд за три месяца — у скилла, который заставляет твоего кодинг-агента писать вдвое меньше кода.

Это Ponytail, «ленивый сеньор с хвостом»: показываешь ему 50 строк — он молча оставляет одну. Ставится в Claude Code, Codex, Copilot CLI, Gemini CLI и OpenCode, лицензия MIT.

Цифры честные: на реальном репо FastAPI + React агент с Ponytail выдал на 54% меньше строк кода, сжёг на 22% меньше токенов и на 20% меньше денег, а сделал всё на 27% быстрее. Проверки безопасности при этом на 100% на месте.

Пример из README: просишь date picker — обычный агент тянет flatpickr, пишет обёртку и спорит про таймзоны. Ponytail ставит нативную строчку input type="date". Было 404 строки — стало 23.

Ставится в две команды в Claude Code:
/plugin marketplace add DietrichGebert/ponytail
/plugin install ponytail@ponytail

Меньше кода — меньше токенов — меньше счёта за API 🤓

https://github.com/DietrichGebert/ponytail
Google выкатил третий Flash за шесть недель — и он уже топ DeepSWE.

Gemini 3.8 Flash обходит 3.7 почти везде, а в кодинге отрыв заметный: возглавил DeepSWE, где решают сложные software-задачи. Контекст 1 млн токенов, вывод до 65K, thinking в трёх режимах.

Главное — цена. До конца года интро-тариф: $0.75 за млн входа и $3.75 за выход. Потом вдвое дороже, так что сейчас брать выгоднее всего.

Почему важно: почти фронтир-качество за копейки. Рефакторинг, агентные скрипты, разбор легаси можно вынести на Flash и не жечь бюджет.

Как применить сегодня: открой Google AI Studio — там 3.8 Flash бесплатно, без подписки. Прогони свой реальный таск и сравни с текущей моделью. В приложении Gemini нужен Pro или Ultra.

https://arstechnica.com/ai/2026/09/google-releases-gemini-3-8-flash-its-third-flash-model-in-six-weeks 🤓
1,6 трлн параметров выложили в открытый доступ.

Nex-AGI открыла веса Nex-N2.5-Max — текстовая MoE-модель на 1,6 трлн параметров под Apache 2.0, контекст 1M. На Hugging Face лежат все 644 шарда: 1,65 ТБ без гейта и без ключей.

Почему это важно: «триллионник» впервые можно не пробовать через чат, а скачать целиком — посмотреть конфиг, файнтюнить, гонять на своём железе. Такое раньше жило только за API.

Как применить уже сегодня: Nex-N2.5-Pro и mini той же семьи сейчас бесплатны на OpenRouter — 0 $ за токен, 262K контекста. Берёшь nex-agi/nex-n2.5-pro:free как модель в своём кодинг-агенте и тестишь агентные задачи за ноль.

https://huggingface.co/nex-agi/Nex-N2.5-Max 🤯
Три опенсорсных репо набрали 245 тыс. звёзд меньше чем за месяц. Второе захочешь поставить уже сегодня.

deepseek-ai/deepseek-harness — 218 899 звёзд, MIT. Агентный харнесс от DeepSeek по принципу «всё — плагин». Запуск одной командой: npx @deepseek-ai/dsh web — веб-морда на 127.0.0.1:3080. Это developer preview (ломающие изменения будут), зато свою фичу добавляешь плагином, без форка.

guillaumemeyer/watermarks-remover — 21 615 звёзд, MIT. Срезает следы ИИ с твоего же контента: невидимый юникод, текстовые вотермарки, C2PA/EXIF/XMP. PNG, JPEG, PDF, DOCX, PPTX, MP4, MP3 — 20+ форматов. Полезно, если не хочешь ярлык «сделано ИИ» на своих файлах.

CopilotKit/OpenBot — 4 602 звезды, MIT. AI-коллеги, каждому свой браузер и файлы: действие видно до, лог — после. Для тех, кто устал от агента, шурующего по системе без отчёта.

https://github.com/deepseek-ai/deepseek-harness 🤔
Фронтирная модель за $0.10 за миллион токенов. Но платишь не деньгами.

Meta открыла API к Muse Spark 1.3 — своей лучшей модели, вровень с GPT-5.6 Sol и Claude Opus 5. Контекст 1M, заточка под долгие агентные задачи и кодинг.

На contributor-тарифе вход стоит $0.10 за млн токенов, выход — $0.20, кэш — $0.002. У GPT-6 Astra те же позиции стоят $10 и $50. Разница в 100 раз.

Секрет простой: на этом тарифе Meta читает твои промпты и учится на них, плюс лимит 100 запросов в минуту.

Как применить: ставь модель muse-spark-1.3-contributor туда, где данные не секретны — прототипы, тесты, пет-проекты. Меняешь только model ID, эндпоинты и SDK те же. Для клиентского кода и приватных данных — обычный тариф.

Цукерберг обещал открытые веса Muse Spark «скоро».

https://dev.meta.ai/docs/pricing-rate-limits/ 🤔
NASA и IBM выложили в опенсорс модель, которая ищет лёд на Луне на 23% точнее.

Веса под Apache 2.0 уже на Hugging Face, рядом — SomBench, первый единый датасет по Луне для ML: 17 лет наблюдений, 9 приборов, 4 миссии.

На 100 м/пиксель она обходит обычный SwinV2-B почти на 19% по кратерам, учась при этом на вдвое меньшем объёме данных, а по льду в вечно тёмных кратерах даёт минус 23% ошибки. По этим картам NASA выбирает посадочные площадки.

Зачем тебе: забрать можно не Луну, а рецепт. Это тот же Prithvi-стек, что работает по спутникам, дронам и аэросъёмке — свой foundation model и файнтюн под свой домен без госконтракта.

Веса и TerraTorch: https://huggingface.co/nasa-ibm-ai4science/NASA-IBM-Lunar-Foundation-Model 🤯
Suno выкатил v6 и удалил все старые модели навсегда.

9 сентября вышло сразу три модели: v6 и v6-wild — для подписчиков Pro за $10 и Premier за $30 в месяц, v6-mini — бесплатно всем. Отката нет: v5.5 и всё, что было до него, не вернуть. Треки в библиотеке останутся, но перегенерить их старым движком больше нельзя.

Для тебя главное — лимиты на скачивание. На бесплатном тарифе всего 7 скачиваний за всю жизнь и без коммерческих прав. На Pro — 20 скачиваний в месяц, дальше $2.99 за каждое. Права на свою музыку остаются даже после отмены подписки.

Ещё из нового: можно править одну строку текста, не пересобирая весь трек, и склеивать мэшапы из нескольких песен. Обучали модели с нуля на лицензированных каталогах Warner, BMG и Believe, Universal и Sony в датасете нет — значит, релизить через Believe и TuneCore можно без риска.

Забирай бесплатную v6-mini прямо сейчас 🤯

https://suno.com/blog/introducing-v6
DeepSeek: 552B параметров, а на входе работает всего 8B.

Вышел DeepSeek-V4.1-Flash — веса под MIT на Hugging Face, контекст 1M, картинки понимает нативно. Архитектура новая: Causal Encoder-Decoder, 8B активных параметров на префилле и 16B на генерации, обучен с нуля на 45 трлн токенов.

Самая вкусная цифра — KV-кэш: 890 байт на токен, в 4 раза меньше, чем у V4-Flash. Кэш — это и есть основная статья расходов у кодинг-агентов, так что длинные прогоны подешевеют в разы.

Флагманов он тоже обошёл: Terminal-Bench 2.1 — 90.6 против 89.1 у Opus 5.0, DeepSWE 74.2, CyberGym 88.1, Codeforces 3471 (у V4-Pro было 3348).

Как применить: ставь в конфиге deepseek-flash. Старые V4-Flash и Vision-Exp уже выведены, а с 14 сентября все запросы deepseek-v4-pro сами уедут на V4.1-Flash по его ценам — пока не выйдет V4.1-Pro.

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

🤯
OpenAI: рантайм Codex теперь в API, за один вызов.

Вчера вышла Agents API в публичной бете — та самая обвязка, что крутит Codex. Даёшь задачу, модель и инструменты — получаешь durable-сессию: она живёт часами, сама сжимает контекст, переживает обрыв, её можно продолжить и подправить по ходу.

Агент сам бьёт работу на подзадачи и раскидывает их по сабагентам параллельно. MCP, свои функции, веб-поиск и песочница — на выбор: хостерная у OpenAI, своя или у партнёров.

За сам harness отдельной платы нет — платишь только за токены и вызовы тулов, как за обычный API. Раньше всё это (сессии, компакция, восстановление после падения) пришлось бы писать руками и тащить на своём сервере.

Минус жирный: data residency только США и Zero Data Retention не поддерживается даже в self-hosted песочнице. Для прода с требованиями к данным — мимо.

https://openai.com/index/introducing-the-agents-api/ 🤓
OpenAI: голосовой агент в API теперь стоит $0,05 за минуту.

GPT‑Live‑1 вышел в API — он слушает и говорит одновременно, как живой человек. На Full Duplex Bench это на 30 пунктов больше прошлой GPT‑Realtime‑2.1, а у Speak ложных перебиваний стало меньше на 80%.

Почему важно: больше не надо склеивать STT → LLM → TTS. Одна модель держит и входящий, и исходящий звук, поэтому нет задержки на стыках и не теряется контекст. Сложное мышление и вызовы тулз она скидывает на GPT‑6 Astra или свою модель.

Как применить: задаёшь тон и темп речи прямо в system prompt, подключаешь телефонию — и бот сам бронирует столики и держит первую линию поддержки. Пять центов за минуту фронтового слоя, шум улицы и перебивания ему не мешают.

https://openai.com/index/introducing-gpt-live-1-in-the-api/

🤯
Cognition: SWE-2 берёт 50,0% там, где топовая Fable 5.1 даёт 50,9% — и стоит на 64% меньше.

Это новая флагманская кодинг-модель Cognition. Учили не с нуля: взяли открытый Kimi K3 от Moonshot (2,8 трлн параметров, 104 млрд активных на токен) и накатили свой RL — +5-6 пунктов почти везде. Terminal-Bench 2.1 — 92,8, DeepSWE 1.1 — 73,0.

Почему важно: впервые RL в мульти-триллионном масштабе, причём все три режима (medium/high/max) тренят в одном прогоне штрафом за стоимость. medium обгоняет прошлую SWE-1.7 при 58% меньшем числе шагов и цене ниже на 81%: первый реальный edit — на 18-м шаге против 48-го.

Как применить: отдельного API и весов нет, модель живёт внутри Devin — с $20/мес на Pro без лимитов. Прогони десяток своих тикетов через medium и считай цену за решённую задачу, а не за токен.

https://cognition.com/blog/swe-2

🤓
Abacus.AI: дообучение даёт +20% к агентным циклам бесплатно.

Выложили три открытые модели: Smaug Agentic — файнтюн Kimi K3 на 2,8 трлн параметров, Flash — на DeepSeek V4-Flash, Mini — 27B на Qwen3.8. Веса лежат на Hugging Face, качает любой.

Фишка в методе: дообучают на отфильтрованных многоходовых трейсах с выключенными в лоссе reasoning-токенами. У Flash на LiveBench agentic coding 61,1 против 46,8 у базы, на AutomationBench 38,8 против 25,1, на NL2repo 73,3 против 54,2.

Платформа та же, цена та же, а длинные агентские циклы стали на 15-20% надёжнее — в 10-100 раз дешевле фронтира от OpenAI и Anthropic.

Как применить сегодня: берёшь веса с huggingface.co/abacusai, гоняешь свой агентский прогон и сравниваешь с тем, что стоит у тебя сейчас.

https://huggingface.co/abacusai
🤔
RSA-260 вскрыт: 260-значное число разложили на множители.

Рекорд RSA-250 держался с февраля 2020 — теперь пал, и сделал это один человек с командой агентов Devin, а не отдел из сотни криптографов.

Devin сам написал самый быстрый в мире GPU-сит числового поля, и разложить такое число стало в 10 раз дешевле публичного state of the art. От первого промпта до готовых множителей — три недели и около 13,5 GPU-лет (~$414K), причём на свободных мощностях кластера.

Польза простая: агент тянет не «напиши функцию», а месяцы исследовательского инжиниринга — человек только ставил приоритеты и ловил момент, когда работа ушла не туда.

Порог входа в научные вычисления рухнул: RSA-1024 (309 цифр) теперь оценивают в ~$32M, а RSA-2048 не тронут — он тяжелее примерно в миллиард раз, так что TLS может спать. Учиться важнее не писать CUDA руками, а ставить задачу и проверять результат.

https://cognition.com/blog/factoring-rsa-260 🤯
30 из 42 задач IMO 2026 — и теперь весь рецепт этого золота в открытом доступе.

NVIDIA выложила «An Open Recipe for IMO Gold»: два дообученных чекпоинта Nemotron 3 Ultra (550 млрд параметров, 55 млрд активных), датасеты для SFT и RL, пайплайн инференса и новый бенчмарк Nemotron-IMO-Bench — 200 олимпиадных задач, собранных вместе с Титу Андрееску.

Почему это важно: золото взято без формальных пруверов и Lean — чистый естественный язык, ансамбль моделей плюс проверка и доработка доказательств. Данные и бенчмарк открыты под CC BY 4.0, чекпоинты — под OpenMDW-1.1, то есть рецепт можно не читать, а повторить.

Как применить: забираешь веса с Hugging Face, подключаешь рецепт из NeMo-Skills и гоняешь свои задачи — сразу видно, где модель врёт в доказательстве. Нюанс: BF16-веса требуют минимум 8×B200 или кластер из H100/H200, так что дома это только через квантованный дистиллят.

https://huggingface.co/collections/nvidia/nemotron-labs-imo-2026 🤓
Fugu Max: $6 за миллион выходных токенов вместо $15-20 у Sonnet 5.

Sakana AI выпустила Fugu Max и Fugu Ultra v2. Это не модели, а обученный оркестратор: он смотрит на задачу и решает, кого из пула позвать — дешёвую модель на простой запрос, сильную на тяжёлый. Пул расширили открытыми весами, включая NVIDIA Nemotron. API один, OpenAI-совместимый.

Цифры: $2 за миллион входных и $6 за выходные — на 40-60% дешевле вывода у Sonnet 5, GPT-5.6 Terra и Kimi K3, при лучшем общем балле на шести бенчмарках, включая Terminal Bench 2.1 и GPQA Diamond. Ultra v2 берёт потолок: Chartography 48,3 против 27,3 у Opus 5, DeepSWE 74,3.

Что с этого тебе: если у тебя агентский пайплайн и счёт за токены пухнет, гнать вообще всё через фронтир — переплата в 2-6 раз. Меняешь base_url на Fugu и платишь по факту. Минусы честные: только хостинг, весов нет, в ЕС/EEA недоступно, и Fable 5.1 с GPT-6 Astra в пуле Ultra v2 не участвуют.

https://sakana.ai/fugu-max-release 🤔
Cohere выложила открытую модель перевода, которая обходит DeepL и Google.

North Small Translate: 218 млрд параметров всего, но на каждый токен включается только 25 млрд (128 экспертов, 8 активных). 50 языков, русский в списке, на вход и выход по 16K токенов.

На своём WMT26 модель набрала 83,6 против 81,4 у DeepL NextGen и 68,2 у Google Translate. Две главы книги одним вызовом — 48,9 против 21,3 у Google. Скорость 112 токенов/с против 81 у Gemma 4 31B.

По деньгам $0,0007 за задачу против $0,039 у Gemini 3.1 Pro — в 58 раз дешевле. Цифры вендорские, судья — GPT-5.6-Sol, так что делить на два.

Как применить: в Cohere API (Chat V2, model ID north-small-translate-1-0) сейчас бесплатно по лимитам, веса лежат на HF и 4-битный чекпоинт влезает в одну B200 или две H100. Лицензия некоммерческая — для продукта нужен договор.

https://huggingface.co/CohereLabs/North-Small-Translate-1.0 🤓
25 медалистов Филдса разом подписали декларацию против AI-компаний в математике.

Повод — 8 сентября: OpenAI заявила, что 10 000 агентов за 88 часов сломали уравнения Навье—Стокса из списка задач тысячелетия. 130 млрд выходных токенов, 2,7 млн сообщений между агентами, ещё 17 часов на проверку в Lean — а у клиента такой заход стоил бы около $15 млн.

Спор не про ответ, а про происхождение: двое математиков год шли к тому же методу, и OpenAI признала, что «не может исключить», что модели улучшились на обезличенных данных их работы.

Что делать прямо сейчас: в ChatGPT → Settings → Data Controls выключи «Improve the model for everyone», а в настройках Codex — отдельный переключатель обучения на твой full environment, настройки ChatGPT его не перебивают. Если твои идеи уходят в чужую модель, они возвращаются решёнными — уже без тебя. И да, 10 000 агентов на 88 часов — это новый продукт, но проверка результата всё ещё дороже генерации.

https://mathandai.org/ 🤯