🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c
#AI #Kimi #LLM #C #LocalAI
@Python_Community_ru
Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c
#AI #Kimi #LLM #C #LocalAI
@Python_Community_ru
GitHub
GitHub - FareedKhan-dev/kimi-k3-in-c: A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable…
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU. - FareedKhan-dev/kimi-k3-in-c
Модель показывает отличную точность в ноутбуке, но так и не становится рабочим сервисом. Причина часто не в качестве самой модели, а в архитектуре системы вокруг неё.
07 сентября в 20:00 на открытом уроке курса «ML System Design» вы разберёте, как превратить модель на Python в полноценный ML-сервис. Увидите, как связаны хранение данных, обучение, реестр моделей, сервис инференса и мониторинг.
На занятии рассмотрите весь жизненный цикл модели — от обучения до эксплуатации в постоянно меняющихся условиях. Поймёте, почему высокая точность ещё не гарантирует успешного внедрения и какие инженерные задачи возникают при работе с реальными пользователями и большими объёмами данных.
Урок будет полезен специалистам по данным, ML- и MLOps-инженерам, разработчикам и архитекторам.
Урок проведёт Игорь Стурейко.
https://vk.cc/d0yk82
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
07 сентября в 20:00 на открытом уроке курса «ML System Design» вы разберёте, как превратить модель на Python в полноценный ML-сервис. Увидите, как связаны хранение данных, обучение, реестр моделей, сервис инференса и мониторинг.
На занятии рассмотрите весь жизненный цикл модели — от обучения до эксплуатации в постоянно меняющихся условиях. Поймёте, почему высокая точность ещё не гарантирует успешного внедрения и какие инженерные задачи возникают при работе с реальными пользователями и большими объёмами данных.
Урок будет полезен специалистам по данным, ML- и MLOps-инженерам, разработчикам и архитекторам.
Урок проведёт Игорь Стурейко.
https://vk.cc/d0yk82
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
🐍 Опытный Python-разработчик рассказал, для каких проектов в 2026 году он уже не выбирает Python первым.
Автор десятилетиями использовал Python практически для всего, но со временем пришёл к простой мысли: хороший универсальный язык не обязан быть лучшим инструментом для каждой задачи.
В презентации разбирается, где ограничения Python начинают перевешивать его удобство и почему для некоторых проектов сегодня разумнее посмотреть на другие языки и экосистемы.
При этом это не очередное «Python умер».
Наоборот, автор по-прежнему активно использует Python и отдельно показывает области, где язык остаётся одним из лучших вариантов.
Получился полезный взгляд без фанатизма: выбирать язык не по привычке, а под конкретную задачу.
#/
#Python #Programming #SoftwareEngineering #Development
@Python_Community_ru
https://menno.io/presentations/not-python-2026/index.html
Автор десятилетиями использовал Python практически для всего, но со временем пришёл к простой мысли: хороший универсальный язык не обязан быть лучшим инструментом для каждой задачи.
В презентации разбирается, где ограничения Python начинают перевешивать его удобство и почему для некоторых проектов сегодня разумнее посмотреть на другие языки и экосистемы.
При этом это не очередное «Python умер».
Наоборот, автор по-прежнему активно использует Python и отдельно показывает области, где язык остаётся одним из лучших вариантов.
Получился полезный взгляд без фанатизма: выбирать язык не по привычке, а под конкретную задачу.
#/
#Python #Programming #SoftwareEngineering #Development
@Python_Community_ru
https://menno.io/presentations/not-python-2026/index.html
🐍 Python-разработчики часто тестируют код с зависимостью от времени. Но обычный mock для дат — это намного сложнее, чем кажется.
Библиотека time-machine решает эту проблему: она позволяет буквально «перемещать время» внутри тестов.
Например:
import datetime as dt
import time_machine
@time_machine.travel("2030-01-01")
def test_future():
assert dt.date.today() == dt.date(2030, 1, 1)
В отличие от популярных подходов вроде freezegun, библиотека не ищет и не заменяет все импорты в проекте.
Она работает на уровне C API CPython, перехватывая функции даты и времени напрямую. Поэтому скорость не зависит от количества загруженных модулей. В бенчмарках time-machine оказался более чем в 100 раз быстрее freezegun на простых сценариях.
Полезно для тестирования:
• подписок и платежей
• истечения токенов
• календарных функций
• планировщиков задач
• логики с дедлайнами
Проект:
https://github.com/adamchainz/time-machine
https://adamj.eu/tech/2026/08/03/python-time-machine-o1-freezegun-on/
@Python_Community_ru
Библиотека time-machine решает эту проблему: она позволяет буквально «перемещать время» внутри тестов.
Например:
import datetime as dt
import time_machine
@time_machine.travel("2030-01-01")
def test_future():
assert dt.date.today() == dt.date(2030, 1, 1)
В отличие от популярных подходов вроде freezegun, библиотека не ищет и не заменяет все импорты в проекте.
Она работает на уровне C API CPython, перехватывая функции даты и времени напрямую. Поэтому скорость не зависит от количества загруженных модулей. В бенчмарках time-machine оказался более чем в 100 раз быстрее freezegun на простых сценариях.
Полезно для тестирования:
• подписок и платежей
• истечения токенов
• календарных функций
• планировщиков задач
• логики с дедлайнами
Проект:
https://github.com/adamchainz/time-machine
https://adamj.eu/tech/2026/08/03/python-time-machine-o1-freezegun-on/
@Python_Community_ru
Полный инженерный курс по AI-агентам на русском: от tool calling до production
Курс инженерный, а не обзорный. Здесь почти нет рассуждений о том, «изменит ли ИИ мир», зато есть: минимальные работающие реализации каждого механизма, лабораторные с критериями приёмки, шаблоны для копирования, чек-листы перед релизом, каталог антипаттернов и набор бенчмарков, по которым можно честно сравнить две версии своего агента.
Качество агента почти никогда не упирается в модель. Оно упирается в инженерию вокруг модели: как описаны инструменты, что попадает в контекст, где стоят проверки, что происходит при третьей подряд ошибке и сколько это стоит за тысячу запусков. Модель - двигатель. Курс -про всё остальное в автомобиле.
https://github.com/justxor/Aiagentsfullcourse
@Python_Community_ru
Курс инженерный, а не обзорный. Здесь почти нет рассуждений о том, «изменит ли ИИ мир», зато есть: минимальные работающие реализации каждого механизма, лабораторные с критериями приёмки, шаблоны для копирования, чек-листы перед релизом, каталог антипаттернов и набор бенчмарков, по которым можно честно сравнить две версии своего агента.
Качество агента почти никогда не упирается в модель. Оно упирается в инженерию вокруг модели: как описаны инструменты, что попадает в контекст, где стоят проверки, что происходит при третьей подряд ошибке и сколько это стоит за тысячу запусков. Модель - двигатель. Курс -про всё остальное в автомобиле.
https://github.com/justxor/Aiagentsfullcourse
@Python_Community_ru
🔥 DeepSeek Harness - пример того, почему сегодня важна не только модель, но и всё окружение вокруг неё
Harness - это слой между LLM и реальной работой: инструменты, terminal, permissions, память, tool loop и правила обработки ответов.
У deepseek-harness есть Python-библиотека, CLI dsh, MCP-сервер и интеграция в формате Anthropic Skill. Проект документирует особенности протокола DeepSeek V4-Pro/V4-Flash и автоматически обрабатывает проблемные места вроде reasoning_content, parallel tool calls, streaming и context limits.
Например:
pip install deepseek-harness-cli
Ключевая идея очень актуальна для agent engineering:
одна и та же модель с разным harness может вести себя как совершенно другой агент.
Модель отвечает за интеллект.
Harness - за то, сможет ли этот интеллект стабильно работать с инструментами и длинными workflow.
Вот полезный гайд, (https://helmcode.com/deepseek-harness) где собрали большой разбор проекта: 23 секции, от запуска за минуту до архитектуры и теории Cordis.
Что особенно интересно:
архитектура максимально модульная - компоненты можно заменять плагинами;
проект model-agnostic и работает с OpenAI-compatible API;
под harness лежит Cordis - отдельная формальная модель безопасного самоизменения программ;
можно менять не только tools, но даже логику, которая решает, что агент должен делать дальше;
проект пока developer preview, поэтому breaking changes ожидаемы
Разбор: https://helmcode.com/deepseek-harness
@Python_Community_ru
Harness - это слой между LLM и реальной работой: инструменты, terminal, permissions, память, tool loop и правила обработки ответов.
У deepseek-harness есть Python-библиотека, CLI dsh, MCP-сервер и интеграция в формате Anthropic Skill. Проект документирует особенности протокола DeepSeek V4-Pro/V4-Flash и автоматически обрабатывает проблемные места вроде reasoning_content, parallel tool calls, streaming и context limits.
Например:
pip install deepseek-harness-cli
Ключевая идея очень актуальна для agent engineering:
одна и та же модель с разным harness может вести себя как совершенно другой агент.
Модель отвечает за интеллект.
Harness - за то, сможет ли этот интеллект стабильно работать с инструментами и длинными workflow.
Вот полезный гайд, (https://helmcode.com/deepseek-harness) где собрали большой разбор проекта: 23 секции, от запуска за минуту до архитектуры и теории Cordis.
Что особенно интересно:
архитектура максимально модульная - компоненты можно заменять плагинами;
проект model-agnostic и работает с OpenAI-compatible API;
под harness лежит Cordis - отдельная формальная модель безопасного самоизменения программ;
можно менять не только tools, но даже логику, которая решает, что агент должен делать дальше;
проект пока developer preview, поэтому breaking changes ожидаемы
Разбор: https://helmcode.com/deepseek-harness
@Python_Community_ru
🖥 Для Python появился Interlock - современный circuit breaker без зоопарка отдельных решений для sync и async.
Один CircuitBreaker умеет работать и с обычными функциями, и с async, считать процент ошибок по скользящему окну и отдельно реагировать на слишком медленные вызовы.
Можно собрать полноценный pipeline отказоустойчивости:
pipeline = (
Pipeline.builder()
.fallback(...)
.retry(attempts=4)
.circuit_breaker(breaker)
.bulkhead(8)
.timeout(2.0)
.build()
)
То есть timeout, retry, ограничение параллелизма, circuit breaker и fallback складываются в одну явную цепочку.
Есть интеграции с httpx, aiohttp, requests, FastAPI, Redis и OpenTelemetry. Через Redis состояние breaker можно шарить между несколькими процессами или инстансами приложения.
Ещё полезная штука - METRICS_ONLY: сначала можно просто посмотреть реальные проценты ошибок и медленных запросов в проде, ничего не блокируя, а уже потом включить breaker.
https://github.com/bagowix/interlock
@Python_Community_ru
Один CircuitBreaker умеет работать и с обычными функциями, и с async, считать процент ошибок по скользящему окну и отдельно реагировать на слишком медленные вызовы.
Можно собрать полноценный pipeline отказоустойчивости:
pipeline = (
Pipeline.builder()
.fallback(...)
.retry(attempts=4)
.circuit_breaker(breaker)
.bulkhead(8)
.timeout(2.0)
.build()
)
То есть timeout, retry, ограничение параллелизма, circuit breaker и fallback складываются в одну явную цепочку.
Есть интеграции с httpx, aiohttp, requests, FastAPI, Redis и OpenTelemetry. Через Redis состояние breaker можно шарить между несколькими процессами или инстансами приложения.
Ещё полезная штука - METRICS_ONLY: сначала можно просто посмотреть реальные проценты ошибок и медленных запросов в проде, ничего не блокируя, а уже потом включить breaker.
https://github.com/bagowix/interlock
@Python_Community_ru
25 августа встречаемся на Agentic Coding Meetup (https://developers.sber.ru/portal/sreda/agentic-coding-meetup?utm_source=telegram&utm_medium=fix&utm_campaign=agentic_meetup_august_2026_post&utm_content=&utm_term=pythonl&erid=2VtzqwpQLgT) в Сбер.Среде и в онлайне⚡️
AI-агенты уже умеют писать код. Но самое интересное начинается дальше — когда вместе с инструментами меняются роли инженеров, команды и сам процесс разработки.
🔥 Поговорим о том, как agentic coding выглядит на практике: новые инженерные роли и модели команд, SDD и трансформация процессов, coding-агенты и инструменты, подходы к постановке задач и управлению контекстом, а также опыт внедрения AI в разработку больших технологических компаний.
⏳ Начало в 17:00, встреча очных гостей — в 16:00.
Количество очных мест ограничено — успейте зарегистрироваться (https://developers.sber.ru/portal/sreda/agentic-coding-meetup?utm_source=telegram&utm_medium=fix&utm_campaign=agentic_meetup_august_2026_post&utm_content=&utm_term=pythonl&erid=2VtzqwpQLgT)!
@Python_Community_ru
AI-агенты уже умеют писать код. Но самое интересное начинается дальше — когда вместе с инструментами меняются роли инженеров, команды и сам процесс разработки.
🔥 Поговорим о том, как agentic coding выглядит на практике: новые инженерные роли и модели команд, SDD и трансформация процессов, coding-агенты и инструменты, подходы к постановке задач и управлению контекстом, а также опыт внедрения AI в разработку больших технологических компаний.
⏳ Начало в 17:00, встреча очных гостей — в 16:00.
Количество очных мест ограничено — успейте зарегистрироваться (https://developers.sber.ru/portal/sreda/agentic-coding-meetup?utm_source=telegram&utm_medium=fix&utm_campaign=agentic_meetup_august_2026_post&utm_content=&utm_term=pythonl&erid=2VtzqwpQLgT)!
@Python_Community_ru
Для тех, кто работает с ACP-агентами из терминала, появился простой REPL
acp-repl запускает любой stdio-сервер с поддержкой Agent Client Protocol и позволяет общаться с агентом прямо из терминала: отправлять промпты, создавать сессии, переключать модель и режим, обрабатывать permission-запросы и смотреть debug-логи.
Работает не с одним конкретным агентом. В README есть примеры для OpenCode, Codex, Claude Code и Pi, плюс можно подключить любой другой ACP-совместимый executable.
Удобная штука для быстрой проверки агента до того, как встраивать его в свой runtime или приложение. Можно сравнить поведение разных моделей и режимов, проверить permissions или просто понять, нормально ли стартует конкретный ACP-провайдер.
Запуск через npm:
npm install -g @normahq/acp-repl@latest
acp-repl -- opencode acp
Репозиторий:
https://github.com/normahq/acp-repl
@Python_Community_ru
acp-repl запускает любой stdio-сервер с поддержкой Agent Client Protocol и позволяет общаться с агентом прямо из терминала: отправлять промпты, создавать сессии, переключать модель и режим, обрабатывать permission-запросы и смотреть debug-логи.
Работает не с одним конкретным агентом. В README есть примеры для OpenCode, Codex, Claude Code и Pi, плюс можно подключить любой другой ACP-совместимый executable.
Удобная штука для быстрой проверки агента до того, как встраивать его в свой runtime или приложение. Можно сравнить поведение разных моделей и режимов, проверить permissions или просто понять, нормально ли стартует конкретный ACP-провайдер.
Запуск через npm:
npm install -g @normahq/acp-repl@latest
acp-repl -- opencode acp
Репозиторий:
https://github.com/normahq/acp-repl
@Python_Community_ru
Python Game Server: простой сервер для пошаговых мультиплеерных игр
python-game-server — лёгкий open source-фреймворк на Python для создания пошаговых мультиплеерных игр.
Он даёт готовую серверную основу, чтобы не писать с нуля комнаты, игровые сессии и сетевое взаимодействие.
Из коробки есть:
— единый API для разных игр
— несколько параллельных игровых сессий
— подключение к конкретной комнате
— автоматический вход в ближайшую свободную сессию
— возможность относительно легко добавлять новые игры
Проект рассчитан в первую очередь на настольные, карточные и другие turn-based игры. Для написания клиентов и новых игровых механик, по словам автора, достаточно базового знания Python.
В репозитории уже больше 600 коммитов, отдельно лежат клиентская и серверная части.
GitHub: https://github.com/feberts/python-game-server
@Python_Community_ru
python-game-server — лёгкий open source-фреймворк на Python для создания пошаговых мультиплеерных игр.
Он даёт готовую серверную основу, чтобы не писать с нуля комнаты, игровые сессии и сетевое взаимодействие.
Из коробки есть:
— единый API для разных игр
— несколько параллельных игровых сессий
— подключение к конкретной комнате
— автоматический вход в ближайшую свободную сессию
— возможность относительно легко добавлять новые игры
Проект рассчитан в первую очередь на настольные, карточные и другие turn-based игры. Для написания клиентов и новых игровых механик, по словам автора, достаточно базового знания Python.
В репозитории уже больше 600 коммитов, отдельно лежат клиентская и серверная части.
GitHub: https://github.com/feberts/python-game-server
@Python_Community_ru
🖥 pyhctsa - Python-инструмент для highly comparative time-series analysis: он автоматически считает большой набор характеристик временного ряда и превращает сигнал в таблицу признаков.
Базовый сценарий выглядит так:
from pyhctsa.calculator import FeatureCalculator
calc = FeatureCalculator()
features = calc.extract(data)
На выходе — DataFrame, где каждая временная серия превращается в набор feature'ов. Причём серии могут быть разной длины.
Есть:
— полный набор операций из коробки
— собственные YAML-конфиги для подмножеств признаков
— вызов отдельных feature-функций
— параллельная обработка на нескольких CPU
— инструменты для nonlinear analysis, HRV и других специализированных задач
GitHub: https://github.com/DynamicsAndNeuralSystems/pyhctsa
@Python_Community_ru
Базовый сценарий выглядит так:
from pyhctsa.calculator import FeatureCalculator
calc = FeatureCalculator()
features = calc.extract(data)
На выходе — DataFrame, где каждая временная серия превращается в набор feature'ов. Причём серии могут быть разной длины.
Есть:
— полный набор операций из коробки
— собственные YAML-конфиги для подмножеств признаков
— вызов отдельных feature-функций
— параллельная обработка на нескольких CPU
— инструменты для nonlinear analysis, HRV и других специализированных задач
GitHub: https://github.com/DynamicsAndNeuralSystems/pyhctsa
@Python_Community_ru