💻 PYTHON | Backend | Frontend
91.1K subscribers
476 photos
93 videos
117 links
🔥 ЕЩЁ БОЛЬШЕ КОНТЕНТА:
t.me/addlist/2EjwwexCDeRlNWNh

💬 ЧАТЫ ДЛЯ ОБЩЕНИЯ:
t.me/addlist/1ZoIIyAsAgkzYjEx

🌐 Реклама / Сотрудничество: @DealAds
Download Telegram
Новый разбор по мультиагентным системам показывает важный нюанс: больше агентов — не всегда лучше.

Авторы сравнили одноагентные и мультиагентные LLM-архитектуры на задачах многошагового рассуждения, но с честным условием: одинаковый бюджет reasoning-токенов. И при таком сравнении одиночные агенты часто используют вычисления эффективнее.

Отдельно исследователи указывают на артефакты API-контроля бюджета, из-за которых преимущества мультиагентного подхода могут выглядеть сильнее, чем есть на практике. Почти как в соревновательных играх: со стороны всё кажется очевидным, но реальную мету и разбор стратегий удобнее отслеживать через @game_mod_skin_stream.

Вывод простой: прежде чем собирать сложную мультиагентную схему, стоит проверить, не решит ли ту же задачу один агент при том же лимите токенов.

#LLM #мультиагентныеСистемы #reasoning #AI
🚀 Как выжать максимум из LLM на RTX 3090

Появился набор конфигураций и патчей для запуска современных языковых моделей на RTX 3090. Решение рассчитано на разные сценарии: можно сделать упор либо на максимальную скорость, либо на более стабильную и предсказуемую работу.

Что внутри:
— два режима запуска: производительность или надёжность;
— готовые Docker-конфиги для локального API;
— модель-агностичный подход без жёсткой привязки к одному стеку;
— настройки как для одной, так и для двух RTX 3090.

Полезная находка для тех, кто поднимает LLM локально и хочет меньше времени тратить на ручной тюнинг.

#LLM #RTX3090 #Docker
Как собрать GPT-подобную LLM с нуля на PyTorch

Неплохой практический разбор для тех, кто хочет понять, как устроены большие языковые модели без лишней теории.

Внутри — 10 ноутбуков с пошаговой подачей: от базовых компонентов до сборки GPT-подобной архитектуры по частям. Материал подаётся простым языком, поэтому подойдёт и тем, кто только начинает разбираться в LLM.

Главный плюс — формат hands-on: не просто чтение, а работа с кодом и последовательная сборка модели своими руками.

#PyTorch #LLM #GPT
Похоже, ИИ окончательно ушёл в офлайн. Энтузиасты собрали CrankGPT — механического ассистента, которому не нужны ни облако, ни розетка, ни аккумулятор.

В основе — Raspberry Pi 5 с 8 ГБ памяти и компактная LLM. После примерно 30 секунд ручной прокрутки устройство принимает голосовой запрос, локально обрабатывает его и затем проговаривает ответ. Всё это — без подключения к интернету.

Звучит как странный, но очень наглядный эксперимент на стыке железа и AI. Для тех, кому интересны такие разборы по AI, разработке и технологиям, это ещё и хороший пример того, как локальные модели можно запускать буквально в полевых условиях.

Если что, к апокалипсису ручной GPT уже почти готов

#AI #Raspberry #LLM
❤2🔥1😢1
LLMOps: Управление большими языковыми моделями
Автор: Аби Ариан

Книга про то, как большие языковые модели живут не в демо, а в бою — на реальных продакшн-нагрузках. Автор проводит через весь жизненный цикл LLM-проекта: выбор архитектуры, подготовка данных, развёртывание, мониторинг и последующая оптимизация.

Отдельно разбираются вещи, о которых часто забывают на старте:

• надёжность и производительность под нагрузкой
• безопасность и контроль над моделью
• стоимость эксплуатации — LLM умеют съедать бюджет
• адаптация под конкретные бизнес-задачи

Плюс современные подходы к выстраиванию LLMOps-процессов и встраиванию моделей в уже работающую IT-инфраструктуру. Полезно всем, кто выводит AI за рамки прототипа.

#LLM #LLMOps #AI
❤3🔥2🥰1👏1😁1
🎙 Почему мощная видеокарта не гарантирует быстрый ответ нейросети?

Между отправкой запроса и появлением ответа происходит куда больше, чем кажется. Разбираемся, как устроен инференс больших языковых моделей и что реально помогает сделать его быстрее и дешевле — без апгрейда железа.

Ключевые моменты:

🟢 Чем обработка контекста отличается от генерации токенов

🟢 Как KV-кеш, квантование и спекулятивное декодирование выжимают максимум из GPU

🟢 Как обработать тяжёлый запрос одного пользователя, не тормозя остальных

🟢 Почему удачная на бумаге оптимизация может оказаться бесполезной под конкретную нагрузку

🟢 Когда есть смысл писать свою библиотеку инференса, а что уже можно доверить AI-агентам

Итог простой: скорость LLM — это не только про терафлопсы, а про грамотную работу с памятью и очередью запросов.

Здесь пахнет тайгой, а поклёвка ждёт за каждым поворотом реки. Заходи к тем, кто живёт рыбалкой и охотой — тут делятся уловом, тропами и настоящими историями с воды.

#LLM #инференс #GPU
⚡3🥰2❤1🔥1👏1🤬1👌1💯1🙉1
Жирный котяра прибыл 🍿

Mistral выкатила свежую модель — Mistral Large 4, в народе уже прозванную Le Chonk. Монстр внушительный:

• 1 трлн параметров, из них 49 млрд активных
• 62% на бенчмарке DeepSWE в задачах кодинга — обходит GLM-5.3
• по словам команды, SOTA в киберзащите, производстве и финансах
• открытые веса обещают 27 октября

Есть и нюанс: на AA модель набрала 38 — ровно столько же, сколько Luna, но стоит при этом дороже. Так что за красивые цифры придётся доплатить.

Через API пощупать можно уже сегодня.

Подписывайся, чтобы не пропустить разборы новых моделей — здесь про это выходит регулярно

#Mistral #LLM #AI
❤2👏2🔥1💯1🤝1