Transfunctions — это инструмент для создания чистых, переиспользуемых и управляемых пайплайнов из функций. Подходит для задач, где нужно чётко контролировать каждый шаг выполнения.
Что такое транзакционные функции?
Это функции, которые:
• имеют чёткое начало и откат (rollback) — как в базах данных
• могут быть объединены в цепочки, где каждая часть знает, как отменить свои действия
• обрабатывают ошибки и контекст централизованно
• позволяют писать бизнес-логику без дублирования и хаоса
Что умеет Transfunctions:
• Объединение функций в контролируемые пайплайны
• Поддержка отката и логирования
• Контекстное выполнение (например, сессии, транзакции, данные)
• Минимум шаблонного кода
Подходит для ETL, финансовых операций, инфраструктурных обработчиков и сценариев с проверками и откатами.
pip install transfunctions🔗 GitHub: https://github.com/pomponchik/transfunctions
#python #pipeline #transactions #opensource #architecture
@pythonl
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍5🔥3😁1🤩1
🚀 Kreuzberg — мощный фреймворк Document Intelligence для Python!
🔹 Извлекает текст, метаданные и структурированные данные из PDF, Office-документов, изображений и др.
🔹 Основан на проверенных open-source решениях: Pandoc, PDFium, Tesseract
🔹 Поддержка 18 форматов (PDF, DOCX, PPTX, HTML, изображения, таблицы и пр.)
🔹 Высокая производительность: 30+ документов/с, лёгкий runtime (≈360 МБ), установка 71 МБ
🔹 Открытый исходный код под MIT-лицензией, 2 000⭐ на GitHub
GitHub
Пример:
✨ Попробуйте: https://github.com/Goldziher/kreuzberg
@pythonl
#Python #OCR #DocumentIntelligence #OpenSource #Kreuzberg
🔹 Извлекает текст, метаданные и структурированные данные из PDF, Office-документов, изображений и др.
🔹 Основан на проверенных open-source решениях: Pandoc, PDFium, Tesseract
🔹 Поддержка 18 форматов (PDF, DOCX, PPTX, HTML, изображения, таблицы и пр.)
🔹 Высокая производительность: 30+ документов/с, лёгкий runtime (≈360 МБ), установка 71 МБ
🔹 Открытый исходный код под MIT-лицензией, 2 000⭐ на GitHub
GitHub
Пример:
from kreuzberg import extract_file
# In your async function
result = await extract_file("presentation.pptx")
print(result.content)
# Rich metadata extraction
print(f"Title: {result.metadata.title}")
print(f"Author: {result.metadata.author}")
print(f"Page count: {result.metadata.page_count}")
print(f"Created: {result.metadata.created_at}")
✨ Попробуйте: https://github.com/Goldziher/kreuzberg
@pythonl
#Python #OCR #DocumentIntelligence #OpenSource #Kreuzberg
🔥13❤8👍5
🚀 Lemonade SDK — локальный сервер для LLM с максимальной производительностью
Что это?
Lemonade — это open-source проект (спонсируется AMD), который позволяет запускать большие языковые модели прямо у себя: на ПК, в браузере или на сервере. Всё работает локально, без облака, с поддержкой GPU и NPU, и при этом совместимо со стандартом OpenAI API.
Возможности
- Lemonade Server — локальный сервер, который имитирует OpenAI API. Поддерживает движки llama.cpp (GGUF), ONNX Runtime GenAI и HuggingFace Transformers. Работает с ускорением через Vulkan и ROCm.
- Lemonade CLI — консольный инструмент для запуска моделей, тестов производительности, проверки памяти и точности.
- Python API — простой способ подключить LLM к своим скриптам и приложениям.
Интеграция и совместимость
- Полная поддержка OpenAI API (`/chat/completions`,
- SDK доступен для Python, C++, Java, C#, Go, Node.js, Rust, PHP и других языков.
Почему это важно
- Всё работает локально → выше приватность и ниже затраты.
- Автоматическая оптимизация под ваше железо.
- Подходит для продакшн-нагрузок, edge-устройств и экспериментов.
- Удобные инструменты: сервер, CLI, Python API, web-панель.
- Проект активно развивается: свежие релизы выходят каждую неделю.
👉 Репозиторий: [github.com/lemonade-sdk/lemonade](https://github.com/lemonade-sdk/lemonade)
#LLM #AI #Lemonade #OpenSource #AMD
@pythonl
Что это?
Lemonade — это open-source проект (спонсируется AMD), который позволяет запускать большие языковые модели прямо у себя: на ПК, в браузере или на сервере. Всё работает локально, без облака, с поддержкой GPU и NPU, и при этом совместимо со стандартом OpenAI API.
Возможности
- Lemonade Server — локальный сервер, который имитирует OpenAI API. Поддерживает движки llama.cpp (GGUF), ONNX Runtime GenAI и HuggingFace Transformers. Работает с ускорением через Vulkan и ROCm.
- Lemonade CLI — консольный инструмент для запуска моделей, тестов производительности, проверки памяти и точности.
- Python API — простой способ подключить LLM к своим скриптам и приложениям.
Интеграция и совместимость
- Полная поддержка OpenAI API (`/chat/completions`,
/completions, /models, /load, /stats и др.). - SDK доступен для Python, C++, Java, C#, Go, Node.js, Rust, PHP и других языков.
Почему это важно
- Всё работает локально → выше приватность и ниже затраты.
- Автоматическая оптимизация под ваше железо.
- Подходит для продакшн-нагрузок, edge-устройств и экспериментов.
- Удобные инструменты: сервер, CLI, Python API, web-панель.
- Проект активно развивается: свежие релизы выходят каждую неделю.
👉 Репозиторий: [github.com/lemonade-sdk/lemonade](https://github.com/lemonade-sdk/lemonade)
#LLM #AI #Lemonade #OpenSource #AMD
@pythonl
❤13👍9😁1🤩1
✨ Возможности:
- Объединение и разделение файлов
- Поворот и обрезка страниц
- Перестановка и удаление страниц
- Интуитивный drag-and-drop интерфейс
Полностью опенсорс (GPL-3.0).
Идеален, если нужно быстро подготовить PDF к печати или презентации — без сложных настроек.
📌 GitHub
#PDF #opensource #Linux #devtools
@pythonl
Please open Telegram to view this post
VIEW IN TELEGRAM
❤14🔥8👍6
This media is not supported in your browser
VIEW IN TELEGRAM
🗣️ RealtimeVoiceChat — живой голосовой чат с ИИ.
RealtimeVoiceChat — это open-source проект, который позволяет общаться с LLM в реальном времени голосом. Он объединяет распознавание речи, LLM и синтез речи в единую систему с минимальной задержкой — около 500 мс при локальной установке.
➡️ Как работает:
1. Запись речи в браузере
2. Передача аудио по WebSocket на сервер
3. Распознавание речи через
4. Ответ от LLM (Ollama, OpenAI и др.)
5. Озвучка ответа через
6. Обратная передача аудио в браузер
7. Поддержка прерываний и динамики через
✨ Особенности:
- Задержка ~500 мс
- Поддержка разных LLM и TTS движков
- Быстрый запуск через Docker Compose
- Чистый веб-интерфейс на Vanilla JS + Web Audio API
✔️ Стек:
- Backend: Python + FastAPI
- Frontend: JS + WebSockets
- ML: transformers, torchaudio, Ollama, Whisper, TTS
- Контейнеризация: Docker
✔️ Требуется CUDA-совместимая видеокарта (для Whisper/TTS) и Docker.
🔥 Отличный проект для тех, кто хочет интегрировать голосовой интерфейс с LLM — например, для ассистентов, чат-ботов, презентаций или UX-экспериментов.
🔜 Репозиторий: https://github.com/KoljaB/RealtimeVoiceChat
🔜 Демо: https://www.youtube.com/watch?v=-1AD4gakCKw
@pythonl
#tts #llm #opensource
RealtimeVoiceChat — это open-source проект, который позволяет общаться с LLM в реальном времени голосом. Он объединяет распознавание речи, LLM и синтез речи в единую систему с минимальной задержкой — около 500 мс при локальной установке.
1. Запись речи в браузере
2. Передача аудио по WebSocket на сервер
3. Распознавание речи через
RealtimeSTT (на базе Whisper)4. Ответ от LLM (Ollama, OpenAI и др.)
5. Озвучка ответа через
RealtimeTTS (Coqui XTTSv2, Kokoro и др.)6. Обратная передача аудио в браузер
7. Поддержка прерываний и динамики через
turndetect.py✨ Особенности:
- Задержка ~500 мс
- Поддержка разных LLM и TTS движков
- Быстрый запуск через Docker Compose
- Чистый веб-интерфейс на Vanilla JS + Web Audio API
- Backend: Python + FastAPI
- Frontend: JS + WebSockets
- ML: transformers, torchaudio, Ollama, Whisper, TTS
- Контейнеризация: Docker
@pythonl
#tts #llm #opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤21🔥9👍6😁4
Forwarded from Machinelearning
🐋 DeepSeek выпустили DeepSeek-OCR 2 - новое поколение OCR с SOTA качеством
DeepSeek представили DeepSeek-OCR 2 - 3B модель для продвинутого понимания изображений, документов и OCR, которая выходит на уровень SOTA.
Ключевая новинка - DeepEncoder V2.
В отличие от классических vision LLM, которые «читают» картинку как сетку (слева-направо, сверху-вниз), DeepEncoder V2 работает ближе к тому, как читает человек:
- Сначала формируется глобальное понимание изображения
- Затем модель определяет логический порядок чтения — что важно первым, что дальше
Что это даёт на практике
📄 Лучше работает со сложными макетами документов
📊 Корректно читает таблицы
🧾 Связывает подписи и значения
📰 Понимает колонки и структурированный текст
🔀 Надёжнее обрабатывает смесь текста и визуальной структуры
По качеству
- Обходит Gemini 3 Pro на ряде бенчмарков
- Даёт >4% прироста по сравнению с прошлой версией DeepSeek-OCR
И это при размере модели всего 3B параметров.
Можно запускать и дообучать
Теперь DeepSeek-OCR 2 можно удобно запускать и fine-tune через Unsloth по готовому гайду.
🔗 Guide: https://unsloth.ai/docs/models/deepseek-ocr-2
🔗 Model: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
@ai_machinelearning_big_data
#DeepSeek #ocr #opensource
DeepSeek представили DeepSeek-OCR 2 - 3B модель для продвинутого понимания изображений, документов и OCR, которая выходит на уровень SOTA.
Ключевая новинка - DeepEncoder V2.
В отличие от классических vision LLM, которые «читают» картинку как сетку (слева-направо, сверху-вниз), DeepEncoder V2 работает ближе к тому, как читает человек:
- Сначала формируется глобальное понимание изображения
- Затем модель определяет логический порядок чтения — что важно первым, что дальше
Что это даёт на практике
📄 Лучше работает со сложными макетами документов
📊 Корректно читает таблицы
🧾 Связывает подписи и значения
📰 Понимает колонки и структурированный текст
🔀 Надёжнее обрабатывает смесь текста и визуальной структуры
По качеству
- Обходит Gemini 3 Pro на ряде бенчмарков
- Даёт >4% прироста по сравнению с прошлой версией DeepSeek-OCR
И это при размере модели всего 3B параметров.
Можно запускать и дообучать
Теперь DeepSeek-OCR 2 можно удобно запускать и fine-tune через Unsloth по готовому гайду.
🔗 Guide: https://unsloth.ai/docs/models/deepseek-ocr-2
🔗 Model: https://huggingface.co/deepseek-ai/DeepSeek-OCR-2
@ai_machinelearning_big_data
#DeepSeek #ocr #opensource
❤16👍6🔥5
Все уже пользуются AI coding agents. Но почти никто не понимает, как они реально работают.
Вместо магии и маркетинга там показывают базовый цикл агента: модель отвечает, просит вызвать tool, код выполняет действие, результат возвращается обратно в контекст, и цикл продолжается.
Дальше на этот скелет постепенно навешиваются реальные части агентной системы:
* tool use
* permissions
* hooks
* memory
* context compaction
* subagents
* background tasks
* MCP
* worktree isolation
71.1K звёзд у tutorial repo — хороший сигнал. Люди устали от “AI agents за 5 минут” и хотят наконец понять, что там внутри.
https://github.com/shareAI-lab/learn-claude-code
#AI #OpenSource
learn-claude-code разбирает Claude Code-style agent harness с нуля. Авторская формула простая: Bash is all you need.Вместо магии и маркетинга там показывают базовый цикл агента: модель отвечает, просит вызвать tool, код выполняет действие, результат возвращается обратно в контекст, и цикл продолжается.
Дальше на этот скелет постепенно навешиваются реальные части агентной системы:
* tool use
* permissions
* hooks
* memory
* context compaction
* subagents
* background tasks
* MCP
* worktree isolation
71.1K звёзд у tutorial repo — хороший сигнал. Люди устали от “AI agents за 5 минут” и хотят наконец понять, что там внутри.
https://github.com/shareAI-lab/learn-claude-code
#AI #OpenSource
❤7👍4🔥4
Возможности
- проверка корректности телефонного номера
- определение страны и оператора связи
- поиск упоминаний через Google, Bing и DuckDuckGo
- поиск номера в открытом коде на GitHub
- поиск публикаций и обсуждений на Reddit
- создание отчётов в форматах JSON и PDF
- параллельная обработка запросов
- управление через простой CLI
Инструмент пригодится для OSINT-исследований, threat intelligence и проверки открытых источников.
Используйте его только законно и с соблюдением права на конфиденциальность.
🔗 GitHub: https://github.com/HackUnderway/SearchPhone
#OSINT #CyberSecurity #Python #OpenSource #GitHub #ThreatIntelligence #InfoSec
Please open Telegram to view this post
VIEW IN TELEGRAM
❤13👍6🔥5
Обычный вызов LLM часто напоминает лотерею: модель может нарушить формат, пропустить требование или вернуть ответ, который сложно проверить.
Mellea предлагает писать такие системы как типизированные generative-программы.
Достаточно описать Python-функцию:
from pydantic import BaseModel
from mellea import generative, start_session
class UserProfile(BaseModel):
name: str
age: int
@generative
def extract_user(text: str) -> UserProfile:
"""Извлеки имя и возраст пользователя."""
m = start_session()
user = extract_user(
m,
text="Alice is 31 years old."
)
Mellea превращает docstring в инструкцию, аннотации типов - в схему ответа, а затем проверяет результат и при необходимости автоматически повторяет генерацию.
Возможности проекта:
- структурированные ответы через Pydantic;
- проверяемые требования и автоматический repair;
- rejection sampling и majority voting;
- поддержка OpenAI, Ollama, Hugging Face, Bedrock, LiteLLM и WatsonX;
- интеграция с существующим кодом;
- публикация generative-программ как MCP-инструментов.
Проект начат в IBM Research, написан на Python и распространяется под лицензией Apache 2.0.
https://github.com/generative-computing/mellea
#python #ai #llm #opensource #agents
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11🔥8👍5
🚀 LoopX удерживает ИИ-агента в одной задаче более 200 часов
Главная проблема долгих агентных сценариев - ограниченный контекст. Модель забывает решения, теряет цель, повторяет работу и не понимает, что делать после ожидания, ревью или смены сессии.
LoopX выносит состояние за пределы LLM и хранит его в отдельной контрольной плоскости:
- цель и ограничения;
- текущие задачи и ответственных;
- решения, требующие участия человека;
- доказательства выполненной работы;
- квоты и расписание запусков;
- handoff для восстановления после смены модели, сессии или хоста.
Каждый запуск агента ограничен конкретным шагом. После выполнения он записывает результат, доказательства и следующую задачу. Затем LoopX решает: продолжать, ждать внешнего события или запросить решение человека.
В открытых демонстрациях циклы исправления Issue/PR в OpenViking и AutoML-эксперимента сохраняли состояние более 200 часов. Это время всей траектории с ожиданием, ревью и повторными запусками, а не непрерывная работа модели.
По сути, LoopX - это Kanban-доска, превращённая в систему выполнения для агентов. Её состояние напрямую определяет следующий допустимый шаг.
Поддерживаются Codex, Claude Code, Cursor, OpenCode и собственные рантаймы. Проект распространяется по лицензии MIT.
https://github.com/huangruiteng/loopx
#AI #AIAgents #OpenSource #Codex #ClaudeCode #Automation
Главная проблема долгих агентных сценариев - ограниченный контекст. Модель забывает решения, теряет цель, повторяет работу и не понимает, что делать после ожидания, ревью или смены сессии.
LoopX выносит состояние за пределы LLM и хранит его в отдельной контрольной плоскости:
- цель и ограничения;
- текущие задачи и ответственных;
- решения, требующие участия человека;
- доказательства выполненной работы;
- квоты и расписание запусков;
- handoff для восстановления после смены модели, сессии или хоста.
Каждый запуск агента ограничен конкретным шагом. После выполнения он записывает результат, доказательства и следующую задачу. Затем LoopX решает: продолжать, ждать внешнего события или запросить решение человека.
В открытых демонстрациях циклы исправления Issue/PR в OpenViking и AutoML-эксперимента сохраняли состояние более 200 часов. Это время всей траектории с ожиданием, ревью и повторными запусками, а не непрерывная работа модели.
По сути, LoopX - это Kanban-доска, превращённая в систему выполнения для агентов. Её состояние напрямую определяет следующий допустимый шаг.
Поддерживаются Codex, Claude Code, Cursor, OpenCode и собственные рантаймы. Проект распространяется по лицензии MIT.
https://github.com/huangruiteng/loopx
#AI #AIAgents #OpenSource #Codex #ClaudeCode #Automation
🔥8❤6👍3🎉2
🚀 Neo4j без сервера: GraphForge запускает полноценный Cypher прямо внутри Python-скрипта
GraphForge занимает редкую нишу между NetworkX и серверными графовыми БД. Вы получаете встроенный графовый движок на Rust, полный openCypher и хранение проекта в обычной директории.
Что внутри:
- четыре независимых слоя на Rust: parser → IR → planning → execution;
- результаты сразу возвращаются как Apache Arrow Table;
- данные легко передаются в Pandas и Polars;
- постоянное хранение построено на Parquet;
- встроены PageRank, Louvain и гибридный текстово-векторный поиск;
- Python- и Node.js-биндинги работают поверх одного движка.
При этом GraphForge честно позиционируется как инструмент исследовательского и notebook-масштаба. Для миллиардных графов, высокой нагрузки и многопользовательского доступа по-прежнему нужна серверная БД.
Python и Node.js доступны сейчас, Swift и Kotlin находятся в планах. Лицензия — Apache 2.0.
https://github.com/CurateLabs/graphforge
#RustLang #Python #OpenSource #GraphDatabase #DataScience #KnowledgeGraph
GraphForge занимает редкую нишу между NetworkX и серверными графовыми БД. Вы получаете встроенный графовый движок на Rust, полный openCypher и хранение проекта в обычной директории.
Что внутри:
- четыре независимых слоя на Rust: parser → IR → planning → execution;
- результаты сразу возвращаются как Apache Arrow Table;
- данные легко передаются в Pandas и Polars;
- постоянное хранение построено на Parquet;
- встроены PageRank, Louvain и гибридный текстово-векторный поиск;
- Python- и Node.js-биндинги работают поверх одного движка.
from graphforge import GraphForge
graph = GraphForge("research/")
result = graph.execute("""
MATCH (a)-[:CITES]->(b)
RETURN a.title, b.title
""")
print(result.to_pandas())
При этом GraphForge честно позиционируется как инструмент исследовательского и notebook-масштаба. Для миллиардных графов, высокой нагрузки и многопользовательского доступа по-прежнему нужна серверная БД.
Python и Node.js доступны сейчас, Swift и Kotlin находятся в планах. Лицензия — Apache 2.0.
https://github.com/CurateLabs/graphforge
#RustLang #Python #OpenSource #GraphDatabase #DataScience #KnowledgeGraph
❤7👍6🔥2
🚀 LLMs-from-scratch пробил 100 000 звёзд на GitHub - и это уже одна из лучших практических баз по устройству современных LLM.
Проект Себастьяна Рашки показывает весь путь с нуля - без магии высокоуровневых библиотек:
- токенизация и attention;
- pretraining;
- классификация;
- instruction fine-tuning;
- LoRA, DPO и evaluation;
- KV cache и оптимизация памяти;
- эффективная загрузка весов.
Причём репозиторий давно вышел за рамки «соберём маленький GPT».
Там уже есть реализации Llama, Qwen, Gemma и OLMo с нуля, а также современные архитектурные техники:
- GQA;
- MLA;
- Sliding Window Attention;
- Gated DeltaNet;
- DeepSeek Sparse Attention;
- cross-layer KV sharing;
- Mixture-of-Experts.
Самое полезное - уменьшенные версии моделей можно запускать локально и подключать к тем же training scripts, чтобы реально экспериментировать с архитектурой, а не только читать статьи.
Рашка продолжит добавлять новые варианты attention и архитектуры, а RL и Reasoning From Scratch развивает в отдельных репозиториях.
Если хочется не просто использовать LLM через API, а действительно понять, что происходит внутри трансформера - это один из тех репозиториев, которые стоит пройти руками.
🔗
#AI #LLM #MachineLearning #DeepLearning #OpenSource
Проект Себастьяна Рашки показывает весь путь с нуля - без магии высокоуровневых библиотек:
- токенизация и attention;
- pretraining;
- классификация;
- instruction fine-tuning;
- LoRA, DPO и evaluation;
- KV cache и оптимизация памяти;
- эффективная загрузка весов.
Причём репозиторий давно вышел за рамки «соберём маленький GPT».
Там уже есть реализации Llama, Qwen, Gemma и OLMo с нуля, а также современные архитектурные техники:
- GQA;
- MLA;
- Sliding Window Attention;
- Gated DeltaNet;
- DeepSeek Sparse Attention;
- cross-layer KV sharing;
- Mixture-of-Experts.
Самое полезное - уменьшенные версии моделей можно запускать локально и подключать к тем же training scripts, чтобы реально экспериментировать с архитектурой, а не только читать статьи.
Рашка продолжит добавлять новые варианты attention и архитектуры, а RL и Reasoning From Scratch развивает в отдельных репозиториях.
Если хочется не просто использовать LLM через API, а действительно понять, что происходит внутри трансформера - это один из тех репозиториев, которые стоит пройти руками.
🔗
github.com/rasbt/LLMs-from-scratch#AI #LLM #MachineLearning #DeepLearning #OpenSource
❤7👍4🔥1