Python RU
12.4K subscribers
1.05K photos
103 videos
40 files
1.29K links
Все для python разработчиков

админ - @haarrp

@python_job_interview - Python собеседования

@ai_machinelearning_big_data - машинное обучение

@itchannels_telegram - 🔥лучшие ит-каналы

@programming_books_it - it книги

@pythonl

РКН: clck.ru/3Fmy2j
Download Telegram
🔥 Вышли официальные GGUF-квантизации GLM-5.3 Flash Uncensored

Модель: 320B параметров, 18B активных.

Доступные варианты:

- Q6_K — 263 ГБ / 94,3% Top-1
- Q4_K_M — 193 ГБ / 89,8% Top-1 — рекомендуемый
- Q3_K_M — 153 ГБ / 85,6% Top-1
- Q2_K — 117 ГБ / 75,5% Top-1

Подходит для запуска на CPU + GPU, включая Apple Silicon.

Это не jailbreak: удаление отказов зашито прямо в веса модели.

API со стандартными весами:
https://orcarouter.ai/models/z-ai/glm-5.3-flash

Uncensored GGUF:
https://huggingface.co/orcarouter/GLM-5.3-Flash-Uncensored-GGUF
👍1
⚡️ Google открыла TimesFM 3 для прогнозирования временных рядов.

Модель уже доступна на GitHub и Hugging Face и рассчитана на задачи forecasting без необходимости обучать отдельную модель с нуля под каждый датасет.

Подходит для:

- прогнозирования продаж
- нагрузки и трафика
- финансовых и бизнес-метрик
- спроса
- сенсорных и временных данных

TimesFM 3 можно запускать локально и использовать как готовую базовую модель для time-series задач.

GitHub: https://github.com/google-research/timesfm

Hugging Face: https://huggingface.co/google/timesfm-3.0-pytorch
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
Media is too big
VIEW IN TELEGRAM
False Sharing: два ядра, никаких lock, а всё тормозит. Почему?

Два потока пишут в разные переменные a и b, блокировок нет, а код всё равно упирается в потолок. Виноват false sharing: a и b лежат в одной cache line на 64 байта, и каждая запись одного ядра сбрасывает копию линии у второго. CPU гоняет кэш туда-сюда вместо полезной работы. Лечится разнесением горячи

https://youtube.com/shorts/piUddxoKcoY?feature=share
3
🧠 Как обучить нейросеть на Python с нуля

Пошаговый разбор полного процесса:

* подготовка и разделение данных
* создание архитектуры модели
* выбор функции потерь и оптимизатора
* запуск обучения
* проверка качества на новых данных
* сохранение готовой модели

Материал подойдёт новичкам, которые хотят перейти от теории к первой работающей нейросети и понять, что происходит внутри обучения.

https://uproger.com/obuchit-nejroset-na-python/
3👍2😁1
Forwarded from Machinelearning
⚡️ DeepSeek выпустила V4.1 Flash

Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображений свели в один: выбирать вручную больше ничего не нужно.

Теперь одна модель ведёт и обычный диалог, и разбор картинок, и сложные вопросы. Сложность запроса она определяет сама, а зрение включает, когда на вход приходит изображение.

По словам DeepSeek, V4.1 Flash обходит V4 Pro по качеству, стоимости и скорости. До выхода V4.1 Pro она возьмёт на себя все запросы, которые раньше уходили на V4 Pro.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Команды ждут тебя на треке программирование роботов на МТС True Tech Champ 2026  — всероссийском чемпионате по программированию с двумя треками и призовым фондом 10 250 000 рублей.

Успей зарегистрироваться до 13 сентября.

В треке программирования роботов тебе предстоит запрограммировать робособаку для доставки груза через полосу препятствий сначала в онлайн-симуляторе, а затем на офлайн-полигоне в финале 22 октября. Рекомендуемые стеки: Go, Java, Python, C#, C++, JS.

Участие в командах 2-5 человек. Если у тебя нет своей команды, кураторы помогут объединиться с другими участниками на платформе.

Масштабный финал объединит борьбу за призовой фонд 10 250 000 рублей, выступления хедлайнеров, доклады спикеров и активности для всех гостей мероприятия.

Успей зарегистрироваться и пройти квалификацию до 13 сентября.

erid:2VSb5xVWJTL
Forwarded from Machinelearning
⚡️ DeepSeek открыла веса V4.1-Flash

DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.

На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.


В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.

Каждому слою внимания заранее назначен один из трёх режимов:

🟢в полном слой считает свои ключи и значения сам;
🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть;
🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор.

Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.

🟡Causal Encoder-Decoder

Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.

40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.

Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.

Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.


🟡Бенчмарки

На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.

На Terminal-Bench 2.1 - 90,6% (выше всех).

На AutomationBench - 54,8% против 50,3 у Opus 5.

А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.


Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.

Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.

Сообщество на Hugging Face уже сделало квантованные версии практически под всё.


📌Лицензирование: MIT License


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MoE #Deepseek
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2
🔥 Один из лучших обучающих курсов на StepiK по SQL

SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.

Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.

Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.

После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.

Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
3👍1🔥1
Kubernetes NodeLocal DNSCache: ускоряем DNS-запросы 🚀

Без NodeLocal DNSCache DNS-запрос от Pod проходит через:

Service IP → kube-proxy → DNAT → conntrack → CoreDNS

В нагруженных кластерах это увеличивает задержки и создаёт дополнительную нагрузку на таблицу conntrack.

NodeLocal DNSCache запускает локальный DNS-кеш на каждой ноде как DaemonSet:

Pod → локальный DNS-кеш → CoreDNS

Если запись уже есть в кеше, Pod получает ответ прямо с текущей ноды. При промахе запрос передаётся в CoreDNS.

Преимущества

- быстрее обрабатываются повторные DNS-запросы;
- снижается нагрузка на CoreDNS;
- уменьшается межнодовый DNS-трафик;
- обходятся kube-proxy и DNAT;
- сокращается количество UDP-записей в conntrack;
- доступны DNS-метрики отдельно для каждой ноды.

NodeLocal DNSCache стабилен с Kubernetes 1.18, но обычно его нужно включать отдельно и развернуть node-local-dns как DaemonSet.

🔗 Официальная документация Kubernetes: https://kubernetes.io/docs/tasks/administer-cluster/nodelocaldns/
1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prism ML собрала тернарную версию Qwen3.8-27B

Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.

Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.

Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.


Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.

Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.

Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.

В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.


Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.

🟡В релизе три варианта

🟢GGUF в двух упаковках: PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);

🟢сборка под MLX на 8,60 ГБ вместе со зрением;

🟠тестовая упаковка Q2_0 для доработки ядер.

Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.

🟡Бенчмарки

Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.

Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.

AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.

LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.

BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.

MMMU-Pro: 75,49 против 81,73.

Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.



📌Лицензирование: Apache 2.0


🟡Блогпост
🟡Веса
🟡Техотчет
🟡Демо на WebGPU
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Bonsai #PrizmML
Please open Telegram to view this post
VIEW IN TELEGRAM
1