ОНСОФТ
131 subscribers
139 photos
3 videos
90 links
Создаем web и retail решения, под задачи вашего бизнеса!

ОНСОФТ — аккредитованная ИТ-компания, реализовавшая более 200 проектов
Download Telegram
Почему Open Source модели становятся популярнее? 🤖

Ещё недавно большинство компаний использовали только закрытые AI-модели. Сегодня всё больше организаций выбирают open source решения благодаря их гибкости, прозрачности и полного контроля. 👇

🔹 Полный контроль над данными
Open Source модели можно развернуть на собственной инфраструктуре, сохранив корпоративные данные внутри компании.

🔹 Гибкость настройки
Компании могут адаптировать модель под свои задачи, выбирать способ развёртывания и интегрировать её с внутренними системами.

🔹 Снижение затрат
Во многих сценариях использование open source моделей позволяет сократить расходы на лицензии и API, особенно при большом количестве запросов.

🔹 Быстрое развитие
Над открытыми моделями работают тысячи разработчиков по всему миру, благодаря чему регулярно появляются новые версии, инструменты и улучшения.

Специалисты ONSOFT помогут вам внедрить как open source, так и коммерческие AI-решения для вашего бизнеса 👉 on-soft.ru/ru/contact
📌 Вебинар: ИИ-тестирование в 1С: как проверить код, который написала нейросеть

📅 Дата: 9 июля 2026 | 13:00 МСК
📍 Где: онлайн

В наше время ИИ уже умеет писать код для 1С и делает это неплохо, но насколько ему можно доверять? Использование ИИ ускоряет разработку, но не отменяет необходимость проверки результата. Как убедиться, что сгенерированный код работает корректно и соответствует нужным требованиям ?

Мы разберем такие аспекты, как:
🔹 Какие ошибки чаще всего допускает ИИ при генерации кода для 1С.
🔹 Как проверить корректность и надежность сгенерированного кода.
🔹 Какие инструменты и подходы использовать для автоматизации тестирования.
🔹 Как встроить проверку ИИ-кода в существующий процесс разработки.
🔹 Практические примеры тестирования кода, созданного нейросетью.

После вебинара вы узнаете, как правильно и эффективно проверять код, созданный ИИ, чтобы минимизировать возможные риски и использовать возможности нейросетей по полной.

🔗 Ссылка на регистрацию: ссылка
Почему для LLM важнее объём VRAM, чем мощность GPU? 🖥️

Многие считают, что скорость работы AI зависит только от мощности видеокарты. Однако при запуске больших моделей ключевую роль часто играет именно объём видеопамяти. 👇

🔹 Что хранится в VRAM?
Во время работы модели в видеопамять загружаются её вес, KV Cache и промежуточные данные. Если памяти недостаточно, модель не сможет разместиться на GPU.

🔹 Что происходит при его нехватке?
Часть переносится в оперативную память компьютера, которая работает значительно медленнее, тем самым снижается скорость генерации.

🔹 Почему мощный GPU не всегда помогает?
Даже самый мощный графический процессор не обеспечит высокую скорость, если модели не хватает места в видеопамяти.

🔹 Когда важна мощность GPU?
Мощность GPU помогает после того, как модель полностью помещается в VRAM. Тогда ресурсы GPU снижают задержки при генерации.

Специалисты ONSOFT помогут вам подобрать оптимальную AI-инфраструктуру для задач бизнеса 👉 on-soft.ru/ru/contact
Что такое Continuous Batching и как он ускоряет AI-сервисы?

Когда AI-сервис получает множество запросов одновременно, их нужно обрабатывать максимально эффективно. Для этого используется механизм Continuous Batching. 👇

🔹 Что такое Continuous Batching?
Continuous Batching — это способ обработки запросов, позволяющий добавлять новые запросы в
процесс выполнения без формирования новой очереди.

🔹 Как это работает?
Новые запросы добавляются в уже выполняющийся пакет, что позволяет максимально эффективно использовать GPU.

🔹 Почему это быстрее?
GPU меньше простаивает между вычислениями и обрабатывает больше запросов. Это повышает производительность и сокращает время ожидания.

🔹 Где это используется?
Continuous Batching применяется в современных inference-серверах, таких как vLLM, TensorRT-LLM и SGLang, обеспечивая высокую производительность.

Специалисты ONSOFT помогут вам внедрить и оптимизировать AI-инфраструктуру для ваших сервисов 👉 on-soft.ru/ru/contact
Какие метрики действительно важны для LLM? 📊

При выборе языковой модели многие обращают внимание только на количество параметров. Однако на практике её производительность определяются совсем другими показателями. 👇

🔹 Качество ответов
Главный показатель — насколько модель точно понимает запрос и генерирует полезные, логичные и достоверные ответы.

🔹 Скорость генерации
Для AI-сервисов важна скорость обработки запросов. Чем быстрее модель генерирует токены, тем комфортнее взаимодействие для пользователя.

🔹 Размер контекстного окна
Контекстное окно определяет, какой объём текста модель может учитывать одновременно. Чем оно больше, тем лучше модель работает с исходными данными.

🔹 Стоимость использования
При выборе модели важно учитывать не только её возможности, но и стоимость обработки токенов, требования к инфраструктуре и вычислительным ресурсам.

Специалисты ONSOFT помогут вам подобрать AI-модели с оптимальным балансом качества, производительности и стоимости 👉 on-soft.ru/ru/contact
🔥1
Как AI работает в микросервисной архитектуре? 🧩

Современные AI-приложения редко представляют собой один большой сервис. Чаще они состоят из набора микросервисов, где каждый отвечает за свою задачу. 👇

🔹 Разделение задач
Отдельные сервисы отвечают за обработку запросов, работу с LLM, поиск по базе знаний, хранение данных и взаимодействие с внешними системами.

🔹 Обмен данными
Микросервисы взаимодействуют через API или брокеры сообщений, передавая данные между собой без тесной зависимости друг от друга.

🔹 Независимое масштабирование
Если один из сервисов испытывает высокую нагрузку, его можно масштабировать отдельно, не затрагивая остальные компоненты системы.

🔹 Гибкость разработки
Новые AI-функции можно добавлять как отдельные сервисы, не изменяя существующую архитектуру. Это ускоряет разработку и упрощает адаптацию.

Специалисты ONSOFT помогут вам спроектировать масштабируемые AI-решения на базе современной микросервисной архитектуры 👉 on-soft.ru/ru/contact
🔥1
Провели вебинар на тему: «ИИ-тестирование в 1С: как проверить код, который написала нейросеть»

Спасибо всем, кто присоединился к нам! 🙌

На вебинаре мы обсудили, почему код, сгенерированный ИИ, нельзя использовать без проверки, какие ошибки чаще всего встречаются в таких решениях и как выстроить процесс тестирования,
чтобы использовать нейросети в разработке 1С более эффективно.

В рамках вебинара рассмотрели:
🔹 какие ошибки чаще всего допускает ИИ при генерации кода для 1С;
🔹 как проверить корректность сгенерированного кода;
🔹 какие инструменты помогают автоматизировать тестирование;
🔹 как встроить проверку ИИ-кода в существующий процесс разработки;
🔹 практические примеры тестирования кода, созданного нейросетью.

🎥 Запись вебинара и презентацию можно посмотреть по ссылке ниже:
https://disk.360.yandex.ru/d/-22N83jGrDfC8g
👍1🔥1
Что такое метаданные и почему они важны для AI? 🏷️
AI работает не только с данными, но и с информацией о них. Именно метаданные помогают быстрее находить нужную информацию и учитывать контекст. 👇

🔹 Что такое метаданные?
Метаданные — это информация, которая описывает сами данные: автор документа, дата создания, категория, язык, источник и другие характеристики.

🔹 Как AI использует метаданные?
Метаданные помогают модели фильтровать, сортировать и находить наиболее релевантную информацию без необходимости анализировать всё содержимое.

🔹 Почему это важно?
Использование метаданных повышает точность поиска, ускоряет обработку данных и помогает AI учитывать дополнительный контекст при формировании ответа.

🔹 Где применяются метаданные?
Они используются в RAG-системах, векторных базах данных и корпоративных базах знаний, где важно быстро находить нужную информацию.

Специалисты ONSOFT помогают внедрять AI-решения для эффективной работы с корпоративными данными 👉 on-soft.ru/ru/contact
👍1
Как защитить корпоративный AI от утечки данных? 🔒

При внедрении AI компании работают с внутренними документами, клиентской информацией и другими конфиденциальными данными. Поэтому безопасность становится одной из ключевых задач. 👇

🔹 Разграничение доступа
AI должен работать только с теми данными, к которым у пользователя есть соответствующие права доступа.

🔹 Локальное развёртывание
Для работы с конфиденциальной информацией многие компании размещают AI внутри собственной инфраструктуры, не передавая данные внешним сервисам.

🔹 Шифрование данных
Документы, запросы и результаты обработки защищаются с помощью современных методов шифрования при хранении и передаче.

🔹 Контроль действий AI
Журналирование запросов, аудит и мониторинг помогают отслеживать работу AI и своевременно выявлять потенциальные риски безопасности.

Специалисты ONSOFT помогут вам внедрить защищённые AI-решения для бизнеса с учётом требований безопасности 👉 on-soft.ru/ru/contact
1
Почему AI становится частью WMS и OMS? 📦

Современные склады и интернет-магазины обрабатывают тысячи заказов ежедневно. Чтобы быстрее принимать решения и автоматизировать рутинные процессы, AI всё чаще интегрируют в WMS и OMS. 👇

🔹 Более точное управление запасами
AI анализирует продажи, сезонность и спрос, помогая прогнозировать потребность в товарах и снижать риск дефицита или излишков.

🔹 Оптимизация обработки заказов
AI помогает определять приоритеты, распределять заказы между складами и выбирать наиболее эффективные сценарии их выполнения.

🔹 Повышение эффективности склада
Интеллектуальные алгоритмы оптимизируют маршруты комплектовщиков, размещение товаров и использование складских ресурсов.

🔹 Быстрое принятие решений
AI анализирует данные в реальном времени и помогает оперативно реагировать на изменения спроса, задержки поставок и другие события.

Специалисты ONSOFT помогут вам внедрить ИИ в WMS, OMS и другие корпоративные системы 👉 on-soft.ru/ru/contact
1
Что ограничивает скорость современных LLM?

Кажется, что скорость работы языковой модели зависит только от мощности GPU. На практике на производительность влияет сразу несколько факторов. 👇

🔹 Пропускная способность памяти
Во время генерации модель постоянно считывает свои веса и KV Cache из видеопамяти. Чем быстрее происходит обмен данными, тем выше скорость работы.

🔹 Размер модели
Чем больше параметров содержит LLM, тем больше вычислений и памяти требуется для генерации каждого нового токена.

🔹 Длина контекста
Большой объём передаваемого текста увеличивает количество данных, которые модель должна обработать перед генерацией ответа.

🔹 Оптимизация inference
Скорость работы также зависит от используемого inference-сервера и технологий оптимизации, таких как KV Cache, Continuous Batching и квантование моделей.

Специалисты ONSOFT помогут вам оптимизировать AI-инфраструктуру и повышать производительность LLM 👉 on-soft.ru/ru/contact
📌 Вебинар: Управление знаниями в эпоху ИИ: RAG, Memory Bank и корпоративная память для 1С

📅 Дата: 23 июля 2026 | 13:00 МСК
📍 Где: онлайн

Даже самые современные ИИ-модели не знают особенностей вашей компании и конфигурации 1С. Чтобы нейросеть давала точные и полезные ответы, ей необходим доступ к актуальным знаниям и корпоративному контексту. На вебинаре разберем, как с помощью RAG, Memory Bank и корпоративной памяти сделать ИИ надежным помощником для разработчиков, аналитиков и пользователей 1С.

На предстоящем вебинаре рассмотрим:
🔹 что такое RAG и Memory Bank, и в чем их отличия;
🔹 как организовать корпоративную память для ИИ;
🔹 как подключить внутреннюю документацию и базу знаний к ИИ;
🔹 как избежать ошибок при работе с корпоративными знаниями;
🔹 примеры использования RAG в решениях на платформе 1С.

После вебинара вы узнаете, как создать эффективную систему управления знаниями, которая поможет ИИ работать с корпоративной информацией.

🔗 Ссылка на регистрацию: ссылка
Провели вебинар на тему: «Управление знаниями в эпоху ИИ: RAG, Memory Bank и корпоративная память для 1С»

Спасибо всем, кто присоединился к нам! 🙌

На вебинаре мы разобрали, почему для эффективной работы ИИ недостаточно просто подключить языковую модель. Обсудили, как RAG, Memory Bank и корпоративная память помогают превратить ИИ в надежного помощника, который работает с актуальными знаниями компании, а не с догадками.

В рамках вебинара рассмотрели:
🔹 что такое RAG и почему он стал стандартом для корпоративного ИИ;
🔹 как устроен Memory Bank и зачем ИИ долгосрочная память;
🔹 как организовать корпоративную базу знаний для 1С;
🔹 практические подходы к интеграции RAG и Memory Bank в AI-решения для 1С;
🔹 реальные сценарии использования корпоративной памяти и типичные ошибки при ее внедрении.

🎥 Запись вебинара и презентацию можно посмотреть по ссылке ниже:
https://disk.360.yandex.ru/d/Ezeo1ltpTJkMsw
Почему одинаковые запросы могут стоить по-разному? 💰

Два одинаковых вопроса не всегда обходятся одинаково. Стоимость обработки зависит не только от самого запроса, но и от того, как с ним работает AI-модель. 👇

🔹 Размер контекста
Даже одинаковый запрос может использовать разный объём предыдущей переписки или документов. Чем больше контекст, тем выше стоимость обработки.

🔹 Размер ответа
Модели тарифицируют не только входные, но и выходные токены. Чем длиннее ответ, тем выше итоговая стоимость.

🔹 Выбранная модель
Один и тот же запрос к компактной и флагманской LLM может отличаться по стоимости в несколько раз.

🔹 Дополнительные операции
Поиск в базе знаний, вызов внешних инструментов (Tool Calling), обработка изображений или использование нескольких AI-агентов также увеличивают стоимость выполнения запроса.

Специалисты ONSOFT помогут вам оптимизировать AI-инфраструктуру и снижать стоимость эксплуатации LLM 👉 on-soft.ru/ru/contact
Как построить AI-архитектуру, независимую от конкретного провайдера? 🏗️

Использование только одного AI-провайдера может привести к высоким затратам и сложностям при переходе на другие модели. Поэтому всё больше компаний строят гибкую AI-архитектуру. 👇

🔹 Единый слой
Все приложения работают через единый API, а не напрямую с конкретной моделью. Это упрощает замену AI-провайдера.

🔹 Несколько моделей
Архитектура позволяет использовать облачные, локальные и open source LLM, выбирая оптимальную модель для каждой задачи.

🔹 Независимые компоненты
RAG, Tool Calling, векторные базы данных и бизнес-логика работают отдельно от модели, поэтому их не нужно перестраивать при смене провайдера.

🔹 Гибкое управление
Можно быстро переключаться между моделями в зависимости от цены, производительности или требований к безопасности без изменений в приложении.

Специалисты ONSOFT помогут вам проектировать масштабируемые AI-архитектуры без привязки к одному провайдеру 👉 on-soft.ru/ru/contact
Почему квантизация стала стандартом для LLM? ⚙️

Современные языковые модели требуют больших вычислительных ресурсов. Чтобы добиться более высокой эффективности, широко применяется квантизация. 👇

🔹 Что такое квантизация?
Квантизация — это уменьшение точности представления весов модели, например с 16 или 32 бит до 8 или 4 бит. Это снижает требования к памяти и вычислениям.

🔹 Меньше потребление VRAM
После квантизации модель занимает значительно меньше видеопамяти, что позволяет запускать более крупные LLM на том же оборудовании.

🔹 Выше скорость работы
Уменьшение объёма данных ускоряет их передачу и обработку, благодаря чему модель генерирует ответы быстрее.

🔹 Минимальная потеря качества
Современные методы квантизации позволяют значительно сократить требования к ресурсам, сохраняя качество модели на уровне, достаточном для большинства практических задач.

Специалисты ONSOFT помогут вам оптимизировать AI-инфраструктуру и запускать LLM максимально эффективно 👉 on-soft.ru/ru/contact
Почему LLM ограничены пропускной способностью памяти? 🚀

Кажется, что скорость работы языковых моделей определяется мощностью GPU. На практике главным ограничением часто становится скорость обмена данными между памятью и графическим процессором. 👇

🔹 Чтение весов модели
Во время генерации каждого токена GPU многократно считывает веса модели и данные из видеопамяти. На это уходит значительная часть времени.

🔹 Передача данных
Во многих современных LLM GPU способен выполнять вычисления быстрее, чем память успевает передавать необходимые данные.

🔹 Пропускная способность памяти
Чем быстрее видеопамять передаёт данные графическому процессору, тем меньше простоев и выше скорость генерации ответов.

🔹 Как решается эта проблема?
Используются квантизация, KV Cache, оптимизированные inference-серверы и GPU с высокой пропускной способностью памяти, например HBM.

Специалисты ONSOFT помогут вам оптимизировать AI-инфраструктуру для максимальной производительности LLM 👉 on-soft.ru/ru/contact
🚀 Вебинар: Memory Bank: как настроить внешнюю память для ИИ-агента в 1С-проекте

📅 Дата: 6 августа 2026 | 13:00 МСК
📍 Где: онлайн

ИИ-агент без памяти каждый раз начинает работу с нуля. Он не знает особенностей вашего проекта, архитектуры решений, внутренних стандартов и накопленного опыта команды. Именно поэтому внешняя память (Memory Bank) становится ключевым элементом при внедрении ИИ в 1С-разработку.

На вебинаре рассмотрим:
🔹 что такое Memory Bank и зачем он нужен ИИ-агенту;
🔹 какие данные стоит хранить во внешней памяти;
🔹 как организовать структуру знаний для 1С-проекта;
🔹 как подключить Memory Bank к ИИ-агенту и поддерживать его в актуальном состоянии;
🔹 практические примеры использования Memory Bank в проектах на платформе 1С.

После вебинара вы узнаете, как создать внешнюю память для ИИ-агента, чтобы он учитывал контекст проекта, давал более точные ответы и становился полноценным помощником команды.

🔗 Ссылка на регистрацию: ссылка
👍1
Провели вебинар на тему: «Memory Bank: как настроить внешнюю память для ИИ-агента в 1С-проекте»

Спасибо всем, кто присоединился к нам! 🙌

На вебинаре мы подробно разобрали, зачем ИИ-агенту нужна внешняя память и как Memory Bank помогает сохранять контекст, накапливать знания и использовать их в работе с проектами 1С. Показали, как организовать долговременную память ИИ, чтобы он не терял важную информацию между сессиями и становился действительно полезным помощником для команды.

В рамках вебинара рассмотрели:
🔹 что такое Memory Bank и чем он отличается от обычного контекста LLM;
🔹 как организовать внешнюю память для ИИ-агента;
🔹 какие данные стоит сохранять и как ими управлять;
🔹 практический пример настройки Memory Bank в 1С-проекте;
🔹 рекомендации по внедрению и типичные ошибки, которых стоит избегать.

🎥 Запись вебинара и презентацию можно посмотреть по ссылке ниже:
https://disk.360.yandex.ru/d/pccQLx8FtIoFFQ
Что такое LLM Serving и как модель превращается в API? 🚀

Сама языковая модель — это набор весов, который не умеет напрямую принимать HTTP-запросы от пользователей. Чтобы превратить её в полноценный AI-сервис, используется LLM Serving. 👇

🔹 Загрузка модели
Inference-сервер загружает веса LLM в GPU и подготавливает модель к обработке запросов.

🔹 API для приложений
Serving-слой предоставляет API, через которое приложения могут отправлять промпты и получать ответы модели.

🔹 Обработка запросов
Сервер управляет очередью, KV Cache, батчингом и распределением нагрузки, чтобы эффективно использовать GPU.

🔹 Масштабирование сервиса
При росте нагрузки можно добавлять новые GPU или экземпляры модели, распределяя запросы между ними.

Специалисты ONSOFT помогут вам превратить LLM в масштабируемые AI-сервисы и интегрировать их в корпоративные системы 👉 https://on-soft.ru/ru/contact
Как работает Dynamic Batching для AI-запросов?

Когда AI-сервис получает много запросов, обрабатывать каждый отдельно неэффективно. Dynamic Batching позволяет объединять запросы в группы прямо во время работы сервера. 👇

🔹 Формирование батча
Сервер собирает несколько запросов, которые поступили примерно одновременно, и объединяет их в один пакет для обработки на GPU.

🔹 Динамическая обработка
В отличие от статического батчинга, сервер не ждёт фиксированного количества запросов. Батч формируется в зависимости от текущей нагрузки.

🔹 Использование GPU
Вместо множества небольших операций GPU выполняет более крупные параллельные вычисления, что повышает общую производительность.

🔹 Баланс между скоростью и задержкой
Сервер может немного подождать новые запросы, чтобы сформировать батч. Это повышает throughput, но долгое ожидание увеличивает задержку для пользователя.

Специалисты ONSOFT помогут вам оптимизировать и повысить производительность LLM-сервисов 👉 on-soft.ru/ru/contact
🔥1