Проект призван решить ключевую проблему выбора больших языковых моделей для разработки на 1С, заменив субъективные оценки объективным автоматизированным тестированием.
Мы разработали автоматизированный цикл, который обеспечивает комплексную проверку способности нейросетей решать задачи программирования в среде 1С:
1. Формируется набор тестовых задач. Каждая задача включает промпт для LLM (например: «Сделай функцию, которая отсортирует массив по возрастанию») и готовый юнит-тест на YAXUNIT, который определяет логически корректный результат.
2. Система направляет промпт выбранной нейросети.
3. Полученный код автоматически вставляется в тестовую конфигурацию 1С и проходит типовую синтаксическую проверку.
4. После интеграции запускаются юнит-тесты. Успешное прохождение теста подтверждает, что код логически корректен и работоспособен в реальной среде 1С.
5. Система анализирует отчет о выполнении тестов и на основе полученных данных формирует объективный рейтинг моделей.
Данный подход позволяет оценивать не только синтаксическую чистоту, но и функциональность генерируемого LLM кода.
Объективный мониторинг навыков программирования LLM на 1С для содействия специалистам в подборе наиболее эффективных моделей под их задачи.
Планы по развитию:
1. Расширение пула задач — Добавление новых типов задач (доработка форм, работа с метаданными, написание запросов и т.д.).
2. Интеграция MCP серверов — Добавление использования MCP серверов для расширения возможностей тестирования.
3. Тестирование агентов — Разработка механизмов оценки агентов, способных самостоятельно анализировать файлы конфигурации и вносить необходимые изменения.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
Приветствуем всех, кто следит за развитием нашего проекта! Делимся свежими улучшениями и новостями.
Мы добавили в нашу систему оценки последнюю модель от Яндекса.
И вот результаты:
Что помешало ей подняться выше? Основные причины ошибок:
1. Нарушение синтаксиса языка
2. Использование неправильных конструкций
3. Галлюцинации
4. Ошибки в логике решения
Мы серьезно поработали над скоростью и эффективностью:
1. Тестирование теперь в 22 раза быстрее! Это позволяет нам оперативнее оценивать новые модели.
2. Внедрили параллельное тестирование в нескольких базах данных для большей стабильности.
3. Оптимизировали запуск «Предприятия» для работы с тестовыми прогонами.
Мы активно работаем над крупным и очень интересным обновлением, которое выведет проект на новый уровень. Обещаем, будет круто! 🏟
Следите за анонсами, самое интересное — впереди!
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10👀2🔥1
Запустили Arena Mode для всех пользователей 1C LLM Benchmark 😍
Последний месяц мы отдельно готовили и дорабатывали этот режим, и теперь любой специалист 1С может бесплатно зайти в АРЕНУ, выбрать две модели, задать свой рабочий запрос и проголосовать, чей ответ лучше
На Арене уже доступны самые топовые модели: Gemini 3 pro, ChatGPT 5.1, Claude Sonnet 4.5 — их можно напрямую сравнивать между собой на ваших реальных задачах по 1С
Каждое такое сравнение влияет на живой рейтинг нейросетей и делает наш бенчмарк по-настоящему народным — в нём участвует всё сообщество 1С, а не только организаторы. Это уже не только тесты и метрики, а совместная оценка качества решений для 1С
Не забывайте выбирать категорию перед началом диалога!
Арена уже доступна, для каждого по ссылке: 1c-llm-benchmark.ru/arena
Меньше слов, посмотрите сами как это работает👐
Последний месяц мы отдельно готовили и дорабатывали этот режим, и теперь любой специалист 1С может бесплатно зайти в АРЕНУ, выбрать две модели, задать свой рабочий запрос и проголосовать, чей ответ лучше
На Арене уже доступны самые топовые модели: Gemini 3 pro, ChatGPT 5.1, Claude Sonnet 4.5 — их можно напрямую сравнивать между собой на ваших реальных задачах по 1С
Каждое такое сравнение влияет на живой рейтинг нейросетей и делает наш бенчмарк по-настоящему народным — в нём участвует всё сообщество 1С, а не только организаторы. Это уже не только тесты и метрики, а совместная оценка качества решений для 1С
Не забывайте выбирать категорию перед началом диалога!
Арена уже доступна, для каждого по ссылке: 1c-llm-benchmark.ru/arena
Меньше слов, посмотрите сами как это работает
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥15⚡3💯2❤1👀1
К сожалению, у нас возникли технические сложности, связанные с блокировкой OpenRouter'а на отправление запросов из России
Арена в ближайшее время не будет работать
Мы активно обновляем задачи бенчмарка и готовим большой пул задач с разными категориями. Бенчмарк тоже пострадал из-за блокировки
Также до нового года мы готовим новые функции в наш сервис, которые будут полезны всем! Обязательно вернемся с новостями!
А пока работаем над исправлением всех неполадок!
Арена в ближайшее время не будет работать
Мы активно обновляем задачи бенчмарка и готовим большой пул задач с разными категориями. Бенчмарк тоже пострадал из-за блокировки
Также до нового года мы готовим новые функции в наш сервис, которые будут полезны всем! Обязательно вернемся с новостями!
А пока работаем над исправлением всех неполадок!
🥰3🔥1
Арена снова доступна!
Мы устранили неполадки, связанные с блокировками, и сервис снова работает в штатном режиме. Спасибо, что оставались с нами!
Вместе с возвращением функционала мы обновили список доступных моделей. Уже сейчас вы можете протестировать и сравнить Gemini 3.0 Flash и GLM 4.7!
Заходите, тестируйте промпты и голосуйте за лучшие ответы. Ваши голоса формируют объективный рейтинг нейросетей!
Мы устранили неполадки, связанные с блокировками, и сервис снова работает в штатном режиме. Спасибо, что оставались с нами!
Вместе с возвращением функционала мы обновили список доступных моделей. Уже сейчас вы можете протестировать и сравнить Gemini 3.0 Flash и GLM 4.7!
Заходите, тестируйте промпты и голосуйте за лучшие ответы. Ваши голоса формируют объективный рейтинг нейросетей!
👍9❤🔥1
Наш проект "1С LLM Бенчмарк" теперь официально называется BenchLabs
Почему мы это сделали?
Мы расширяем поле наших исследований. Теперь это не только сравнение моделей, но и тесты RAG-систем, а также другие изыскания, которые помогают в работе с 1С и смежными областями. Название BenchLabs лучше отражает этот масштаб
Методология, Arena Mode и все старые результаты доступны по новому адресу:
И уже на обновленном сайте вы можете увидеть новые разделы — "Промпты" и "Подборки промптов"
Мы решили создать единую базу промптов именно для 1С-сообщества. Раньше не было одного места, где можно было бы найти качественные запросы для аналитики, разработки, администрирования или тестирования в 1С. Теперь оно появилось.
Что в этих разделах интересного:
Зачем мы это делаем?
Наша цель — помочь тем, кто работает с 1С, быстрее решать рабочие задачи. Мы объединяем опыт сообщества, чтобы вам не приходилось каждый раз заново изобретать велосипед при общении с нейросетью.
Заходите на сайт, тестируйте новый функционал и делитесь своими наработками:
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11❤6🎉4
