Python RU
12.4K subscribers
1.05K photos
103 videos
40 files
1.3K links
Все для python разработчиков

админ - @haarrp

@python_job_interview - Python собеседования

@ai_machinelearning_big_data - машинное обучение

@itchannels_telegram - 🔥лучшие ит-каналы

@programming_books_it - it книги

@pythonl

РКН: clck.ru/3Fmy2j
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
🖥 open-interpreter инструмент управление компьютером с помощью естественного языка

Это Python-библиотека, которая позволяет управлять ПК с помощью обычной челочеческой речи, в том числе на русском. На видео переключаются со светлой темы на тёмную, конвертируют docx-файлы на рабочем столе в .pdf.

Репозиторий проекта
Интерактивная демка в Colab

#llm #библиотека

@pro_python_code
Please open Telegram to view this post
VIEW IN TELEGRAM
👍72🥰2👎1
Forwarded from Machinelearning
🌟 Arch-Function: коллекция моделей для вызова функций.

Модели Arch-Function понимают сложные сигнатуры функций, идентифицируют необходимые параметры и генерируют точные вызовы функций на основе промптов.

Семейство основано на Qwen 2.5, его модели оптимизированы для низкой задержки инференса и высокой пропускной способности. Они отлично подходят для работы в режиме реального времени в производственной среде.

▶️Функциональные возможности моделей:

🟢Single Function Calling. Вызов одной функции для каждого запроса;

🟢Parallel Function Calling. Вызов одной и той же функции несколько раз, но с разным набором параметров;

🟢Multiple Function Calling. Вызов различных функций для каждого запроса;

🟢Parallel & Multiple. Выполнение параллельного и множественного вызова функций.

▶️Семейство Arch-Function:

🟢Arch-Function-7B;
🟢Arch-Function-3B;
🟢Arch-Function-1.5B.

В репозитории на HF доступны квантованные версии всех моделей в формате GGUF:

🟠Arch-Function-7B в 4-bit разрядности;
🟠Arch-Function-3B в разрядностях от 2-bit до 6-bit;
🟠Arch-Function-1.5B в разрядностях от 2-bit до 6-bit.

Модели семейства прошли оценку на Berkeley Function-Calling Leaderboard (BFCL).
Результаты показывают, что Arch-Function-7B и Arch-Function-3B демонстрируют производительность, сопоставимую с GPT-4-turbo-2024-04-09 и xLAM-8x22b-r.

Arch-Function можно запустить с помощью библиотеки Transformers или в промпт-шлюзе Arch.

⚠️ Для достижения наилучших результатов рекомендуется использовать конфигурацию промптов, указанных в примерах одиночного или многошагового вызова функций.


📌Лицензирование : Katanemo license.


🟡Коллекция моделей
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Katanemo #Arch-Function
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
Forwarded from Machinelearning
🚀Только что выпущено новое семейство моделей генерации кода Salesforce (SFR-Embedding-Code), занявшее 1-е место на бенчмарке CoIR!

Модель доступна в в 2-х размерах: 2B, 400M.

Основные характеристики:
1️⃣ Модель 2B: Занимает первое место в CoIR.
2️⃣ Модель 400M: демонстрирует лучшие показатели среди моделей на 0,5B параметров.
3️⃣ Поддерживает 12 языков программирования, Python, Java, C++, JavaScript, C# и другие!

Пример Запуска:

import torch.nn.functional as F
from transformers import AutoTokenizer, AutoModel

# Each query needs to be accompanied by an corresponding instruction describing the task.
query_instruction_example = "Given Code or Text, retrieval relevant content"
queries = [
"how to implement quick sort in Python?"
]

# No instruction needed for retrieval passages
passages = [
"def quick_sort(arr):\n if len(arr) <= 1:\n return arr\n pivot = arr[len(arr) // 2]\n left = [x for x in arr if x < pivot]\n middle = [x for x in arr if x == pivot]\n right = [x for x in arr if x > pivot]\n return quick_sort(left) + middle + quick_sort(right)",
"def bubble_sort(arr):\n n = len(arr)\n for i in range(n):\n for j in range(0, n-i-1):\n if arr[j] > arr[j+1]:\n arr[j], arr[j+1] = arr[j+1], arr[j]\n return arr"
]

# load model with tokenizer
model = AutoModel.from_pretrained('Salesforce/SFR-Embedding-Code-2B_R', trust_remote_code=True)

# get the embeddings
max_length = 32768
query_embeddings = model.encode_queries(queries, instruction=query_instruction_example, max_length=max_length)
passage_embeddings = model.encode_corpus(passages, max_length=max_length)

# normalize embeddings
query_embeddings = F.normalize(query_embeddings, p=2, dim=1)
passage_embeddings = F.normalize(passage_embeddings, p=2, dim=1)

scores = (query_embeddings @ passage_embeddings.T) * 100
print(scores.tolist())



Документация
Модель 400M
Модель 2B


📌Лицензирование моделей: CC-BY-NC-SA-4.0 License.


#CodeAI #MLResearch #SOTA #OpenScience #code #llm #ml
4😁2👍1
Forwarded from Machinelearning
⭐️ LLM-Reasoner

Инструмент, который поможет добавить рассждуения в ваши LLM проекты , подобно OpenAI o1 и deepseek R1.

Функции:
🧠 Пошаговые рассуждения: Больше никаких ответов из «черного ящика»! Узнайте, как именно мыслит ваш LLM, по аналогии с O1.
🔄 Прогресс в реальном времени: позволяет наблюдать за ходом рассуждений с помощью плавных анимаций
🎯 Поддержка множества LLM провайдеров: Работает со всеми провайдерами LiteLLM
🎮 Streamlit: Удобный пользовательский интерфейс
🛠️ Поддердка CLI: для тех, кто любит возиться с командной строкой.
📊 Проверка уверенности ответа: Узнайте, насколько уверен ваш LLM в каждом шаге рассуждений.

⭐️ Установка:
pip install llm-reasoner

Пример с кодом:

from llm_reasoner import ReasonChain
import asyncio

async def main():
# Create a chain with your preferred settings
chain = ReasonChain(
model="gpt-4", # Choose your model
min_steps=3, # Minimum reasoning steps
temperature=0.2, # Control creativity
timeout=30.0 # Set your timeout
)

# Watch it think step by step!
async for step in chain.generate_with_metadata("Why is the sky blue?"):
print(f"\nStep {step.number}: {step.title}")
print(f"Thinking Time: {step.thinking_time:.2f}s")
print(f"Confidence: {step.confidence:.2f}")
print(step.content)

asyncio.run(main())


@ai_machinelearning_big_data


#llm #ml #ai #opensource #reasoning
Please open Telegram to view this post
VIEW IN TELEGRAM
👍53🔥2👎1
Forwarded from Machinelearning
🧠 Qwen3-MT — Alibaba продолжает жечь и выпускает еще одну модель, в этот раз для машинного перевода.

🌍 Поддерживает 92+ языка, на которых говорит 95% населения мира

📚 Обучен на триллионах токенов из интернета, открытых документов и книгах, субтитров из видео.

🔬 Что внутри:
- Модель Qwen3-MoE-72B с архитектурой Mixture-of-Experts
- Заточена на переводческие фишки, поддерживает сложную терминологию и даже очень редкие слова.
- RLHF: обучение с подкреплением повышает точность и естественность модели

Возможности:
Обеспечивает качественный перевод в реальном времени
Контроль стиля и терминов
Масштабируемость для API и продакшена
Цена — от $0.5 за миллион токенов

🟡 Попробовать демку: https://huggingface.co/spaces/Qwen/Qwen3-MT-Demo
🟡 ModelScope: https://modelscope.cn/studios/Qwen/Qwen3-MT-demo
🟡 Документация API: https://alibabacloud.com/help/en/model-studio/translation-abilities
🟡 Блог с подробностями: https://qwenlm.github.io/blog/qwen-mt/

@ai_machinelearning_big_data


#Qwen #Alibaba #ml #llm #ai
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍2🔥2
Forwarded from Machinelearning
🌟 OLMo Hybrid: RNN плюс трансформер в одной модели.

Институт Аллена опубликовал OLMo Hybrid 7B - модель, которая построена на чередовании слоев Gated DeltaNet и стандартного внимания в соотношении 3:1. Такая архитектура решает больше подзадач из обучающих данных за меньшее число токенов, что напрямую снижает потребность в данных при обучении.

Gated DeltaNet - это RNN с расширением в виде отрицательных значений матрицы переходов. Это небольшое изменение в правиле обновления внутреннего состояния позволяет слоям Gated DeltaNet реализовывать динамику попарной перестановки элементов и за счет этого решать задачи отслеживания состояния, недоступные чистым трансформерам.


В OLMo Hybrid Ai2 показали, что гибридные модели выразительнее суммы своих частей. Существует класс задач (назовем их отслеживание состояния с обращением к памяти), которые не решают ни чистые трансформеры, ни чистые RNN, но гибрид справляется с ними уже при одинарном чередовании типов слоев.

Абляционные эксперименты от 60M до 1B параметров показали, что GDN стабильно лучше Mamba2 как в чистом, так и в гибридном варианте, равномерное чередование слоев лучше концентрации внимания в середине сети, а соотношение 3:1 - оптимальный баланс между качеством и вычислительной стоимостью на средних и крупных масштабах.

🟡Тесты

🟢На MMLU OLMo Hybrid достигает той же точности, что OLMo 3 7B, используя на 49% меньше токенов; на срезе Common Crawl - на 35% меньше.

🟢Коэффициент эффективности использования данных у гибрида равен 83,7 против 94,9 у трансформера.

🟢Экономия данных растет с размером модели: примерно в 1,3 раза на 1B параметров и в 1,9 раза на 70B.

После дообучения и адаптации к длинному контексту OLMo Hybrid обходит OLMo 3 во всех категориях оценки. На RULER при 64k токенах - 85,0 против 70,9 у базовой модели.


📌Лицензирование: Apache 2.0 License.


🟡Статья
🟡Набор моделей
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #LLM #OLMoHybrid #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍32
🔥 9B-модель на 7 ГБ, которая по тестам автора лезет на территорию 27B

На Hugging Face вышла Qwen3.5-9B The Defiant Fable от DavidAU. Это многоэтапный fine-tune Qwen3.5-9B с упором на reasoning, instruction following, код и creative-задачи. Модель распространяется под Apache 2.0, а автор также позиционирует её как uncensored/heretic-версию с минимальными отказами.

Самое интересное в результатах. По собственному набору из семи бенчмарков автор заявляет, что 9B-версия обходит базовые Qwen3.5-9B, Qwen3.5-27B и Qwen3.6-35B-A3B, а местами приближается к Qwen3.6-27B. Причём сильные результаты сохраняются даже после 4-bit квантования. Это пока именно авторские тесты, а не независимый leaderboard.

Для локального запуска уже готовы обычные и MTP GGUF с NEO IMATRIX. Q4_K_M занимает примерно 6,8-7 ГБ, IQ3_M около 5,6 ГБ, а экстремальный IQ2_M всего 4,94 ГБ.

Контекст у базовой архитектуры до 262K токенов. Запускать можно через llama.cpp, Ollama, LM Studio, vLLM и другие локальные рантаймы, а через llama.cpp сразу поднимается OpenAI-compatible API.

Если независимые тесты подтвердят цифры, это хороший пример того, насколько далеко сейчас можно вытянуть маленькую 9B-модель правильным fine-tuning, merge и квантованием.

#AI #Qwen #LLM #LocalAI #GGUF
👍62
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prism ML собрала тернарную версию Qwen3.8-27B

Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.

Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.

Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.


Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.

Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.

Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.

В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.


Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.

🟡В релизе три варианта

🟢GGUF в двух упаковках: PTQ1_0 (1,75 бита, 5,95 ГБ, быстрее на картах Ada и L4) и PQ2_0 (2,13 бита, 7,21 ГБ, быстрее на H100 и Blackwell);

🟢сборка под MLX на 8,60 ГБ вместе со зрением;

🟠тестовая упаковка Q2_0 для доработки ядер.

Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.

🟡Бенчмарки

Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.

Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.

AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.

LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.

BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.

MMMU-Pro: 75,49 против 81,73.

Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.



📌Лицензирование: Apache 2.0


🟡Блогпост
🟡Веса
🟡Техотчет
🟡Демо на WebGPU
🟡Сообщество в Discord
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Bonsai #PrizmML
Please open Telegram to view this post
VIEW IN TELEGRAM
1