Python/ django
59.3K subscribers
2.51K photos
192 videos
48 files
3.24K links
по всем вопросам @haarrp

@itchannels_telegram - 🔥 все ит каналы

@ai_machinelearning_big_data -ML

@ArtificialIntelligencedl -AI

@datascienceiot - 📚

@pythonlbooks

РКН: clck.ru/3FmxmM
Download Telegram
«Не получу оффер в течение месяца , забью на поиск работы»
- пообещал себе Миша.

Его можно понять: парень уже 5 лет работает в бигтехе, и все никак не мог пробить планку в 200к+. Те, кто только недавно пришли в компанию, уже с порога зарабатывали 350к на руки, в то время как Миша был в разы опытнее их, но внутри компании рост бы минимальный.

На этот раз Миша подготовился: новое резюме, прогоны собеседований и еще кое какие секреты. И всё это - под руководством опытного человека.

Да, первые несколько собеседований закончились отказами - а кто говорил, что все будет получаться с первого раза?

Но спустя три недели - первый оффер. И не какой-нибудь, а с зарплатой в 1,5 раза выше.

Хочешь также? Подписывайся на Богдана - за 6 лет работы в бигтехах он прошел 350+ собеседований, открыл свою школу и уже устроил на работу более 45 человек.

Реклама. ИП Камаев Богдан Эльмарович. ИНН 770973951244. Erid:CQH36pWzJqVJCbWwdQ59bD3AvGXXg5vDaVyKQrh8EK8NV5
😁1211👍2🎉2
Вышел MOSS-VL-Realtime - 11B vision-language model для потокового видео.

Не просто “загрузил ролик и получил ответ”, а режим, где модель непрерывно обрабатывает timestamped frames и может отвечать в любой момент по тому, что уже увидела.

Контекст - 256K, лицензия - Apache 2.0.

Что заявлено по бенчмаркам:

* 70.2 avg на OVOBench
* 47.2 avg на ProactiveVideoQA
* 66.0 на OmniMMI Proactive Alerting

MOSS-VL-Realtime умеет молчать, если визуальных данных пока недостаточно, а потом обновлять ответ, когда сцена меняется. Для видеоагентов это важнее, чем просто “ответить красиво”: модель должна не фантазировать раньше времени.

Есть online inference в стиле session/queue, offline API для изображений и видео, а также Instruct и Base checkpoints.

Похоже на шаг к VLM, которые работают не с готовым файлом, а с живым потоком: наблюдают, ждут, уточняют и реагируют по мере появления новых кадров.

ModelScope: https://modelscope.ai/models/openmoss/MOSS-VL-Realtime
🔥84👍4🎉1
⚡️ VGGT: превращает набор фотографий в геометрию 3D-сцены

Обычно реконструкция сцены требует отдельной связки для оценки камер, глубины и отслеживания точек. VGGT получает изображения и предсказывает всё это одной feed-forward моделью.

На вход можно подать один кадр, несколько снимков или сотни ракурсов. На выходе модель строит:

- внутренние и внешние параметры камер
- карты глубины
- плотные карты 3D-точек
- траектории выбранных точек между кадрами

Результаты можно экспортировать в формат COLMAP, дополнительно обработать через bundle adjustment и использовать в пайплайнах NeRF или Gaussian Splatting через gsplat.

Запуск занимает несколько строк:


model = VGGT.from_pretrained("facebook/VGGT-1B").to(device)
images = load_and_preprocess_images(image_names).to(device)

with torch.no_grad():
predictions = model(images)


https://github.com/facebookresearch/vggt
4👍3🎉2😁1🤩1
Hugging Face собрала open-source стек для локальных голосовых агентов

Репозиторий speech-to-speech содержит модульный пайплайн с низкой задержкой:

VAD → STT → LLM → TTS

Каждый компонент можно заменить. Для распознавания речи поддерживаются Parakeet TDT, Whisper, Faster Whisper и Paraformer. Для генерации голоса доступны Qwen3-TTS, Kokoro, Pocket TTS, ChatTTS и MMS.

LLM можно запускать через облачный OpenAI-совместимый API либо локально через Transformers, MLX, vLLM или llama.cpp. Весь стек способен работать на собственном железе без передачи аудио внешнему сервису.

Сервер поддерживает протокол OpenAI Realtime и WebSocket-эндпоинт /v1/realtime. Это позволяет подключать существующие клиенты с потоковой передачей аудио, транскрипцией, прерыванием ответа и tool calling.

Запуск:


pip install speech-to-speech
speech-to-speech


По умолчанию используются Parakeet TDT для распознавания и Qwen3-TTS для синтеза речи. Есть отдельные режимы для локального микрофона, WebSocket, TCP и Docker. Проект уже используется как разговорный бэкенд для тысяч роботов Reachy Mini.

Лицензия: Apache 2.0.

https://github.com/huggingface/speech-to-speech
🔥107👍6🎉1
PyPI закрыл опасную лазейку в старых релизах

Теперь PyPI запрещает загружать новые файлы в релиз спустя 14 дней после его публикации. Старую версию пакета больше нельзя внезапно дополнить новым wheel или архивом.

Ограничение защищает от атаки, при которой злоумышленник крадёт токен публикации и добавляет вредоносный файл в давно стабильный релиз. Часть пользователей могла бы скачать заражённую сборку, хотя номер версии остался прежним.

Изменение затронет мало проектов: среди 15 000 популярных пакетов лишь 56 добавляли wheel для Python 3.14 позже установленного срока.

Разработчикам теперь придётся выпускать новую версию пакета, даже когда нужно лишь добавить сборку для свежей версии Python. В будущем PyPI планирует формально разделить релизы на открытые и закрытые через Upload 2.0 API.


https://blog.pypi.org/posts/2026-07-22-releases-now-reject-new-files-after-14-days/
👍85🔥5😱1🎉1
🖥 Git bisect - для поиска багов

Когда баг появился где-то между сотнями коммитов, не нужно проверять историю вручную.

Запускаем:


git bisect start
git bisect bad
git bisect good <старый_рабочий_коммит>


Git будет делить историю пополам и просить отметить каждый найденный коммит:


git bisect good
git bisect bad


Через несколько шагов он покажет коммит, в котором появился баг.

Можно автоматизировать:


git bisect run pytest


Тогда Git сам прогонит тесты и найдёт виновника.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥74🎉1
CLI-Anything: как дать AI-агентам руки для обычных приложений

Идея простая: CLI-Anything генерирует командные интерфейсы для реального софта, чтобы агент мог не «тыкать мышкой», а вызывать понятные команды.

Так можно управлять CAD-инструментами, 3D-редакторами, редакторами субтитров, браузером, Blender, FreeCAD, GIMP, Inkscape, Obsidian, Kdenlive, OBS и другими приложениями. В репозитории уже есть десятки agent-harness’ов под разные программы.

Как это выглядит:

* агент получает задачу
* вызывает CLI
* приложение делает работу
* результат можно проверить и повторить

Есть и CLI-Hub: установка через pip install cli-anything-hub, дальше можно ставить готовые CLI через cli-hub install <name>.

GitHub: https://github.com/HKUDS/CLI-Anything
🔥8👍43
🔥 За одну неделю вышло сразу 6 интересных open-weight моделей

Пока все ждут веса Kimi K3 и Ling 3.0, в LLM Architecture Gallery Себастьяна Расчки появилось несколько свежих архитектур.

1. Nanbeige 4.2 3B
Всего 3B non-embedding параметров, но используется Looped Transformer: один и тот же стек слоёв проходит дважды. Больше эффективной глубины без удвоения весов.

https://huggingface.co/Nanbeige/Nanbeige4.2-3B

2. Laguna S 2.1
118B MoE, только 8B активных параметров, 48 слоёв и контекст 1M токенов. Сделана Poolside с упором на coding agents и длинные задачи.

https://huggingface.co/poolside/Laguna-S-2.1

3. Motif-3-Beta
Огромный 314B-A13B MoE: 384 routed experts, 8 активируются на токен, контекст 256K.

https://huggingface.co/Motif-Technologies/Motif-3-Beta

4. Solar Open 2
250B-A15B MoE от Upstage с 1M контекстом. Архитектура чередует три linear-attention слоя с одним обычным softmax-attention слоем. Модель рассчитана на длинные agentic workflows.

https://www.upstage.ai/blog/en/solar-open-2

5. Antares 1B
Компактная security-модель Cisco для анализа репозиториев и поиска потенциально уязвимого кода. Основана на Granite и дообучена под agentic terminal workflows.

https://huggingface.co/fdtn-ai/antares-1b

6. BTL-3
Rank-32 LoRA для Qwen3.6-27B, заточенная под coding agents и tool calling. Авторы заявляют 95,1% HumanEval и 88,5% BFCL v4 AST.

https://huggingface.co/badtheorylabs/BTL-3

Полная галерея архитектур:

https://sebastianraschka.com/llm-architecture-gallery/
👍64🔥4
ProtoLink - лёгкий Python-фреймворк для мультиагентных систем с A2A в основе

ProtoLink строит архитектуру вокруг самих агентов, а не цепочек вызовов LLM. Каждый агент имеет собственные capabilities, tools, lifecycle и может напрямую передавать задачи другим агентам через Agent-to-Agent (A2A).

Что есть внутри:

* OpenAI, Anthropic, Gemini, DeepSeek, Ollama, llama.cpp и другие модели;
* native Python tools и MCP;
* HTTP, SSE, WebSocket и gRPC;
* SQLite state и хранение запусков;
* telemetry через Langfuse и LangSmith;
* auth, policies, approvals, budgets и replay;
* Pipeline, Parallel, Router и Graph для детерминированных workflow.

Фреймворк local-first: можно поднять агента вообще без API-ключа и облачной модели, а затем подключить Ollama или другой backend без переписывания tools и логики взаимодействия. Базовый пакет зависит только от Pydantic.

GitHub:
https://github.com/nMaroulis/protolink

Лицензия: MIT.
🔥5👍43🎉1
Сложный индустриальный ML, работа с генеративными подсказками, уровни дообучения и агентский Cotype — на E-CODE 2026 трек ML&DS снова впечатляет.

Программа ещё пополняется. Но уже сейчас понятно, что успевшая заслужить высокоранговую славу конференция Ozon Tech снова станет одним из ключевых событий в индустрии.

Осталось только пройти модерацию, чтобы убедиться лично: https://ecode.ozon.tech/. Ну, и дать огня на вечеринках, конечно!
👍4🔥31😢1
🔥 `Agents-cli` от Google - полный конвейер разработки AI-агентов из терминала

Инструмент добавляет coding-агентам вроде Claude Code, Codex и Antigravity CLI готовые навыки для работы с Google ADK и облачной инфраструктурой. Сам agents-cli моделью или отдельным coding-агентом не является.

Что умеет:

• создавать каркас агентного проекта
• запускать агента локально
• генерировать датасеты для eval
• оценивать и сравнивать трассы
• находить типичные причины ошибок
• автоматически оптимизировать промпты
• добавлять RAG, CI/CD и observability
• деплоить в Cloud Run, GKE или Agent Runtime
• публиковать агента в Gemini Enterprise

Для локальной разработки Google Cloud необязателен — достаточно Gemini API через AI Studio. Для облачного деплоя уже потребуется собственный проект Google Cloud.

Установка:


uvx google-agents-cli setup


Можно установить только skills:


npx skills add google/agents-cli


Лицензия Apache 2.0.

🔗 https://github.com/google/agents-cli
👍6🔥51
One Day Offer: заходи в команду, которая двигает финансы на терабайтах данных! 🔥

На связи блок «Финансы» в Сбере! Мы строим системы, которые автоматизируют казначейство, риск‑менеджмент, отчётность — и добавляем AI для точных прогнозов.

На One Day Offer мы хотим найти коллег сразу в 3 продуктовые команды. Базовый стек и уровень задач одинаковы — выбирай направление по душе:

✔️ BigData: Spark (batch+streaming), сложные SQL‑оптимизации, DWH/Data Lake.
✔️ Микросервисы: Python (FastAPI/Django), API, интеграции с системами.

От тебя ждём: Python от 5 лет, экспертный SQL, PySpark, SOLID/asyncio, HDFS/Kafka.

👉 Регистрируйся по ссылке. Встречаемся 8 августа!
🎉1
🎙 Kyutai открыла готовый стек для потоковых голосовых агентов

Delayed Streams Modeling — репозиторий с моделями и примерами для streaming STT и TTS. Аудио обрабатывается частями: агент начинает распознавать речь и генерировать ответ, не дожидаясь окончания записи.

Что внутри:

• потоковая транскрибация с временными метками для каждого слова
• модель 1B EN/FR с задержкой около 0,5 секунды и semantic VAD
• английская модель 2.6B с задержкой около 2,5 секунды
• PyTorch-ноутбуки для экспериментов
• Rust-сервер с WebSocket для продакшена
• MLX-реализация для Mac и iPhone
• streaming TTS, который принимает текст и сразу выдаёт звук частями.

На H100 разработчики заявляют обработку до 400 одновременных STT-потоков, а Rust-сервер на L40S обслуживает 64 подключения быстрее реального времени.

Лицензии разделены по компонентам: Python и web — MIT, Rust backend — Apache 2.0, веса STT — CC BY 4.0.

🔗 https://github.com/kyutai-labs/delayed-streams-modeling
🔥21👍1