BenchLabs
340 subscribers
28 photos
2 videos
9 links
Download Telegram
Channel created
🚀 Запуск первого автоматизированного бенчмарка LLM для 1С
🖥 Сайт — 1c-llm-benchmark.ru

Проект призван решить ключевую проблему выбора больших языковых моделей для разработки на 1С, заменив субъективные оценки объективным автоматизированным тестированием.

⚙️ Методология тестирования
Мы разработали автоматизированный цикл, который обеспечивает комплексную проверку способности нейросетей решать задачи программирования в среде 1С:

1. Формируется набор тестовых задач. Каждая задача включает промпт для LLM (например: «Сделай функцию, которая отсортирует массив по возрастанию») и готовый юнит-тест на YAXUNIT, который определяет логически корректный результат.
2. Система направляет промпт выбранной нейросети.
3. Полученный код автоматически вставляется в тестовую конфигурацию 1С и проходит типовую синтаксическую проверку.
4. После интеграции запускаются юнит-тесты. Успешное прохождение теста подтверждает, что код логически корректен и работоспособен в реальной среде 1С.
5. Система анализирует отчет о выполнении тестов и на основе полученных данных формирует объективный рейтинг моделей.

Данный подход позволяет оценивать не только синтаксическую чистоту, но и функциональность генерируемого LLM кода.

🎯 Цели и развитие проекта
Объективный мониторинг навыков программирования LLM на 1С для содействия специалистам в подборе наиболее эффективных моделей под их задачи.

Планы по развитию:

1. Расширение пула задач — Добавление новых типов задач (доработка форм, работа с метаданными, написание запросов и т.д.).
2. Интеграция MCP серверов — Добавление использования MCP серверов для расширения возможностей тестирования.
3. Тестирование агентов — Разработка механизмов оценки агентов, способных самостоятельно анализировать файлы конфигурации и вносить необходимые изменения.

🖥 Перейти к рейтингу
➡️ https://1c-llm-benchmark.ru/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
📣 Наш проект растет: новые модели, скорость и планы!

Приветствуем всех, кто следит за развитием нашего проекта! Делимся свежими улучшениями и новостями.

🌐Новый игрок в рейтинге:

💸YandexGPT 5.1 pro
Мы добавили в нашу систему оценки последнюю модель от Яндекса.
И вот результаты:

📉 Занятое место: 12
⚙️Решенные задачи: 30%
💸Средняя стоимость решения: 0,12 ₽

Что помешало ей подняться выше? Основные причины ошибок:

1. Нарушение синтаксиса языка
2. Использование неправильных конструкций
3. Галлюцинации
4. Ошибки в логике решения

⚡️ Супер-обновление производительности
Мы серьезно поработали над скоростью и эффективностью:

1. Тестирование теперь в 22 раза быстрее! Это позволяет нам оперативнее оценивать новые модели.
2. Внедрили параллельное тестирование в нескольких базах данных для большей стабильности.
3. Оптимизировали запуск «Предприятия» для работы с тестовыми прогонами.

🔜 И главное... готовим сюрприз!
Мы активно работаем над крупным и очень интересным обновлением, которое выведет проект на новый уровень. Обещаем, будет круто! 🏟

Следите за анонсами, самое интересное — впереди!

➡️ https://1c-llm-benchmark.ru/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10👀2🔥1
Запустили Arena Mode для всех пользователей 1C LLM Benchmark 😍

Последний месяц мы отдельно готовили и дорабатывали этот режим, и теперь любой специалист 1С может бесплатно зайти в АРЕНУ, выбрать две модели, задать свой рабочий запрос и проголосовать, чей ответ лучше

На Арене уже доступны самые топовые модели: Gemini 3 pro, ChatGPT 5.1, Claude Sonnet 4.5 — их можно напрямую сравнивать между собой на ваших реальных задачах по 1С

Каждое такое сравнение влияет на живой рейтинг нейросетей и делает наш бенчмарк по-настоящему народным — в нём участвует всё сообщество 1С, а не только организаторы. Это уже не только тесты и метрики, а совместная оценка качества решений для 1С

Не забывайте выбирать категорию перед началом диалога!

Арена уже доступна, для каждого по ссылке: 1c-llm-benchmark.ru/arena

Меньше слов, посмотрите сами как это работает 👐
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥153💯21👀1
К сожалению, у нас возникли технические сложности, связанные с блокировкой OpenRouter'а на отправление запросов из России

Арена в ближайшее время не будет работать

Мы активно обновляем задачи бенчмарка и готовим большой пул задач с разными категориями. Бенчмарк тоже пострадал из-за блокировки

Также до нового года мы готовим новые функции в наш сервис, которые будут полезны всем! Обязательно вернемся с новостями!

А пока работаем над исправлением всех неполадок!
🥰3🔥1
Арена снова доступна!

Мы устранили неполадки, связанные с блокировками, и сервис снова работает в штатном режиме. Спасибо, что оставались с нами!

Вместе с возвращением функционала мы обновили список доступных моделей. Уже сейчас вы можете протестировать и сравнить Gemini 3.0 Flash и GLM 4.7!

Заходите, тестируйте промпты и голосуйте за лучшие ответы. Ваши голоса формируют объективный рейтинг нейросетей!
👍9❤‍🔥1
Channel name was changed to «BenchLabs»
Channel photo updated