Может ли ИИ-текст ранжироваться в топ-10 Google?
Предисловие:
У Pangram (сервис для проверки текста на ИИ) есть API. За $10 можно сделать 200 проверок. Я его хорошенько погонял в попытках обойти (потратил 1000 запросов) - никакие промпты и никакие языковые модели (в том числе диффузионные модели) не проходят проверку как написанные человеком. Но об этом - в другой раз, когда мне хватит сил структурировать все мои попытки.
Поэтому результатам проверки можно доверять. Если каким-то чудом у кого-то из топа получилось пройти проверку, при этом сохранив качество текста - значит, там проделана колоссальная работа, повторить которую за один вечер или неделю, мучая Claude запросами "напиши так, чтобы прошло проверку Pangram", не получится. Различные комбинации нейронок тоже не помогут. Тем более на потоке.
А теперь суть:
Сделал веб-панель на основе выдачи Google от сервиса DataForSEO + Pangram API, чтобы проверить выдачу на ИИ-тексты. Результаты можно посмотреть на скриншотах.
Для некоторых сайтов можно увидеть количество слов - 950. Это намеренное ограничение, чтобы не отправлять на проверку тексты на несколько тысяч слов. 950 слов достаточно для качественной оценки.
Выводы делайте сами.
Предисловие:
У Pangram (сервис для проверки текста на ИИ) есть API. За $10 можно сделать 200 проверок. Я его хорошенько погонял в попытках обойти (потратил 1000 запросов) - никакие промпты и никакие языковые модели (в том числе диффузионные модели) не проходят проверку как написанные человеком. Но об этом - в другой раз, когда мне хватит сил структурировать все мои попытки.
Поэтому результатам проверки можно доверять. Если каким-то чудом у кого-то из топа получилось пройти проверку, при этом сохранив качество текста - значит, там проделана колоссальная работа, повторить которую за один вечер или неделю, мучая Claude запросами "напиши так, чтобы прошло проверку Pangram", не получится. Различные комбинации нейронок тоже не помогут. Тем более на потоке.
А теперь суть:
Сделал веб-панель на основе выдачи Google от сервиса DataForSEO + Pangram API, чтобы проверить выдачу на ИИ-тексты. Результаты можно посмотреть на скриншотах.
Для некоторых сайтов можно увидеть количество слов - 950. Это намеренное ограничение, чтобы не отправлять на проверку тексты на несколько тысяч слов. 950 слов достаточно для качественной оценки.
Выводы делайте сами.
👍7❤5
Как я пытался обойти проверку на ИИ-текст
Pangram - один из самых жестких ИИ-детекторов. Стояла задача: сделать так, чтобы он стабильно помечал тексты как написанные человеком, при этом контент должен быть качественным и точным.
Спойлер: большинство советов из интернета (писать проще, менять температуру, использовать хуманайзеры) - не работают.
В процессе борьбы с Pangram я просил Claude записывать все, что мы делаем и какие результаты получаем - набралось 4000 строк. Не без помощи ИИ я сжал это все до 1500 слов. На мой взгляд, получилось интересно.
Надеюсь, вы получите удовольствие от прочтения.
https://telegra.ph/Kak-ya-pytalsya-obojti-proverku-na-II-tekst-v-Pangram-04-21
Pangram - один из самых жестких ИИ-детекторов. Стояла задача: сделать так, чтобы он стабильно помечал тексты как написанные человеком, при этом контент должен быть качественным и точным.
Спойлер: большинство советов из интернета (писать проще, менять температуру, использовать хуманайзеры) - не работают.
В процессе борьбы с Pangram я просил Claude записывать все, что мы делаем и какие результаты получаем - набралось 4000 строк. Не без помощи ИИ я сжал это все до 1500 слов. На мой взгляд, получилось интересно.
Надеюсь, вы получите удовольствие от прочтения.
https://telegra.ph/Kak-ya-pytalsya-obojti-proverku-na-II-tekst-v-Pangram-04-21
🔥13👍9❤2
iGeoLeak - база гео-ротации партнерских ссылок в iGaming
Прогнал 219 мани-сайтов через резидентные прокси из 196 стран и собрал открытую базу, которая показывает, на какой бренд попадает юзер в зависимости от его гео.
Что внутри:
- 219 сайтов с гео-ротацией (без урлов)
- 297 брендов
- 196 стран - от US и DE до экзотики BD и KE
- фильтры по стране и бренду
- в разделе статистики реальные пары брендов в ротации по 196 странам.
Добро пожаловать на https://igeoleak.vercel.app/
Бесплатно, без регистрации. ❤️
Прогнал 219 мани-сайтов через резидентные прокси из 196 стран и собрал открытую базу, которая показывает, на какой бренд попадает юзер в зависимости от его гео.
Что внутри:
- 219 сайтов с гео-ротацией (без урлов)
- 297 брендов
- 196 стран - от US и DE до экзотики BD и KE
- фильтры по стране и бренду
- в разделе статистики реальные пары брендов в ротации по 196 странам.
В Tier-3 в два раза больше брендов в ротации по сравнению с Tier-1/2
Добро пожаловать на https://igeoleak.vercel.app/
Бесплатно, без регистрации. ❤️
🔥8
Pangram: как устроен детектор ИИ-текста изнутри
Спойлер: Все проще, чем мы думали.
Pangram 3.3 построен на архитектуре EditLens, описанной в их собственном докладе на конференции ICLR 2026. Из него можно узнать, как именно работает детектор изнутри.
EditLens в свою очередь построен на основе Mistral Small - open source модели с 24 миллиардами параметров. Pangram взял готовую модель и дообучил ее под свою задачу через QLoRA (метод дообучения, при котором меняются не все параметры модели, а только небольшие надстройки - это дешевле и быстрее).
H2: Что они сделали?
1. Собрали 60 000 человеческих текстов из разных источников: обзоры с Amazon, посты с Reddit, образовательные статьи, новости.
2. Создали 303 различных промпта (список доступен на 18 странице доклада), которые люди реально дают ИИ. От "Исправь ошибки" до "Перепиши для SEO". Промпты разбиты по категориям:
- Тон и стиль: 84 промпта
- Добавление деталей: 59
- Сокращение: 32
- Плавность текста: 30
- Перефразирование: 26
- И другие
3. Прогнали каждый текст через три LLM (GPT-4.1, Claude Sonnet 4, Gemini 2.5 Flash) с каждым промптом. Получили пары: оригинальный текст - ИИ-отредактированный текст.
4. Для каждой пары посчитали косинусное расстояние. Чем сильнее ИИ изменил текст, тем больше расстояние.
Для эмбеддингов использовали модель Linq-Embed-Mistral на 7 миллиардов параметров с размерностью вектора 4096.
5. Обучили модель предсказывать, видя только финальный текст - без оригинала.
Весь датасет на 60 000+ примеров обошелся в $530. Обучение на 8 GPU A100 заняло 8 часов. Модели хватило одного прохода по данным (одна эпоха), чтобы научиться определять ИИ-текст.
H2: Open source
Pangram выложил все в открытый доступ на GitHub:
- Код для обучения и запуска предсказаний
- Датасет на HuggingFace
- Веса моделей
Но есть нюансы:
- В репозитории скрипты для RoBERTa-Large (355 млн параметров, запускается на обычном ноутбуке) и Llama-3.2-3B (нужно 16 GB RAM). А лучший результат в докладе показал Mistral Small 24B - скрипты для него не предоставлены.
- Лицензия только для некоммерческого использования
- Легкую версию (RoBERTa) можно запустить на обычном ноутбуке с 8 GB RAM. Для обучения Llama 3B нужен GPU с 24+ GB видеопамяти. Для Mistral 24B - мощный сервер.
Спойлер: Все проще, чем мы думали.
Pangram 3.3 построен на архитектуре EditLens, описанной в их собственном докладе на конференции ICLR 2026. Из него можно узнать, как именно работает детектор изнутри.
EditLens в свою очередь построен на основе Mistral Small - open source модели с 24 миллиардами параметров. Pangram взял готовую модель и дообучил ее под свою задачу через QLoRA (метод дообучения, при котором меняются не все параметры модели, а только небольшие надстройки - это дешевле и быстрее).
H2: Что они сделали?
1. Собрали 60 000 человеческих текстов из разных источников: обзоры с Amazon, посты с Reddit, образовательные статьи, новости.
2. Создали 303 различных промпта (список доступен на 18 странице доклада), которые люди реально дают ИИ. От "Исправь ошибки" до "Перепиши для SEO". Промпты разбиты по категориям:
- Тон и стиль: 84 промпта
- Добавление деталей: 59
- Сокращение: 32
- Плавность текста: 30
- Перефразирование: 26
- И другие
3. Прогнали каждый текст через три LLM (GPT-4.1, Claude Sonnet 4, Gemini 2.5 Flash) с каждым промптом. Получили пары: оригинальный текст - ИИ-отредактированный текст.
4. Для каждой пары посчитали косинусное расстояние. Чем сильнее ИИ изменил текст, тем больше расстояние.
Для эмбеддингов использовали модель Linq-Embed-Mistral на 7 миллиардов параметров с размерностью вектора 4096.
5. Обучили модель предсказывать, видя только финальный текст - без оригинала.
Весь датасет на 60 000+ примеров обошелся в $530. Обучение на 8 GPU A100 заняло 8 часов. Модели хватило одного прохода по данным (одна эпоха), чтобы научиться определять ИИ-текст.
H2: Open source
Pangram выложил все в открытый доступ на GitHub:
- Код для обучения и запуска предсказаний
- Датасет на HuggingFace
- Веса моделей
Но есть нюансы:
- В репозитории скрипты для RoBERTa-Large (355 млн параметров, запускается на обычном ноутбуке) и Llama-3.2-3B (нужно 16 GB RAM). А лучший результат в докладе показал Mistral Small 24B - скрипты для него не предоставлены.
- Лицензия только для некоммерческого использования
- Легкую версию (RoBERTa) можно запустить на обычном ноутбуке с 8 GB RAM. Для обучения Llama 3B нужен GPU с 24+ GB видеопамяти. Для Mistral 24B - мощный сервер.
🤣3👌2❤1
Бот для оценки траста домена в Google
Запустил бота, который оценивает траст домена только на основе анализа выдачи Google. Без Ahrefs, Moz, Majestic и других внешних сервисов. И он отлично работает!
→ @google_trust_checker_bot
Бот делает 50+ запросов в Google и анализирует, как домен ранжируется:
— domain com
— domain.com
— "domain.com"
— site:domain.com
— intitle, inurl, allinurl
— проверка по title, H1, H2, description
— и многое другое
Шкала оценки:
🟢 53+ — TOP (Wikipedia, Forbes, GitHub)
🟡 28–52 — MID (сильный сайт)
🔴 <28 — DROP (сайт с низким уровнем траста)
Пример
Автор сайта про Германию жалуется в Twitter, что Google AI Overviews убил его сайт. Но, возможно, дело не в Google AI, а в трасте сайта.
Его сайт:
🔴 allaboutberlin.com — 23.4 (DROP)
Его конкуренты в выдаче:
✅ TOP berlin.de — 67
🟡 MID iamexpat.de — 48
🟡 MID bzst.de — 47
🟡 MID settle-in-berlin.com — 40
🟡 MID germany-visa.org — 40
🟡 MID how-to-germany.com — 36
🟡 MID simplegermany.com — 35
Бесплатно
Для подписчиков этого канала - 3 бесплатных аудита любого домена. Плюс анализ еще 9 доменов из списка, чтобы можно было сравнить результаты работы бота со своей собственной оценкой.
→ @google_trust_checker_bot
Запустил бота, который оценивает траст домена только на основе анализа выдачи Google. Без Ahrefs, Moz, Majestic и других внешних сервисов. И он отлично работает!
→ @google_trust_checker_bot
Бот делает 50+ запросов в Google и анализирует, как домен ранжируется:
— domain com
— domain.com
— "domain.com"
— site:domain.com
— intitle, inurl, allinurl
— проверка по title, H1, H2, description
— и многое другое
Шкала оценки:
🟢 53+ — TOP (Wikipedia, Forbes, GitHub)
🟡 28–52 — MID (сильный сайт)
🔴 <28 — DROP (сайт с низким уровнем траста)
Пример
Автор сайта про Германию жалуется в Twitter, что Google AI Overviews убил его сайт. Но, возможно, дело не в Google AI, а в трасте сайта.
Его сайт:
🔴 allaboutberlin.com — 23.4 (DROP)
Его конкуренты в выдаче:
✅ TOP berlin.de — 67
🟡 MID iamexpat.de — 48
🟡 MID bzst.de — 47
🟡 MID settle-in-berlin.com — 40
🟡 MID germany-visa.org — 40
🟡 MID how-to-germany.com — 36
🟡 MID simplegermany.com — 35
Бесплатно
Для подписчиков этого канала - 3 бесплатных аудита любого домена. Плюс анализ еще 9 доменов из списка, чтобы можно было сравнить результаты работы бота со своей собственной оценкой.
→ @google_trust_checker_bot
👍4🔥2
Родной язык копирайтера определяется даже после DeepL - и ловится без нейросетей
Когда копирайтер прогоняет свой текст через DeepL или Google Translate, грамматика на выходе обычно чистая, но синтаксические привычки родного языка остаются. Я решил проверить, насколько легко это ловится, и натренировал простую модель с помощью Claude. Она угадывает исходный язык (русский, немецкий, итальянский и ещё 6) с точностью 72%. При этом Native English определяется почти идеально - 96%.
Никакого BERT, GPT и LLM. Просто TF-IDF + линейный SVM (вектора). Эта архитектура выиграла соревнование PAN-2017 по определению родного языка автора по его английскому тексту (ссылка на ресерч). Вся эта движуха называется Native Language Identification (NLI).
Мой обучающий корпус состоял всего из 600 пар по каждому языку "оригинал - английский перевод". И этого хватило!
Модель угадала, что это перевод с русского.
Когда копирайтер прогоняет свой текст через DeepL или Google Translate, грамматика на выходе обычно чистая, но синтаксические привычки родного языка остаются. Я решил проверить, насколько легко это ловится, и натренировал простую модель с помощью Claude. Она угадывает исходный язык (русский, немецкий, итальянский и ещё 6) с точностью 72%. При этом Native English определяется почти идеально - 96%.
Никакого BERT, GPT и LLM. Просто TF-IDF + линейный SVM (вектора). Эта архитектура выиграла соревнование PAN-2017 по определению родного языка автора по его английскому тексту (ссылка на ресерч). Вся эта движуха называется Native Language Identification (NLI).
Мой обучающий корпус состоял всего из 600 пар по каждому языку "оригинал - английский перевод". И этого хватило!
Hi! Today I want to show you that it's actually quite easy to determine the original translation language. For example, if you wrote a text in...
Модель угадала, что это перевод с русского.
👍12
SEOGets.com снова стал бесплатным (пока)
Монетизировать SEO-специалистов, особенно в эпоху вайб-кодинга, оказалось крайне непростой задачей. Даже если продукт рос вирусно, и его рекомендовали самые известные эксперты индустрии.
Обещать, что сервис всегда будет бесплатным, а потом внезапно закрыть все за paywall в $50 - не рабочая схема. ✍️
Монетизировать SEO-специалистов, особенно в эпоху вайб-кодинга, оказалось крайне непростой задачей. Даже если продукт рос вирусно, и его рекомендовали самые известные эксперты индустрии.
Обещать, что сервис всегда будет бесплатным, а потом внезапно закрыть все за paywall в $50 - не рабочая схема. ✍️
👍3
This media is not supported in your browser
VIEW IN TELEGRAM
Контроль качества каждой статьи, а не только первой
Первую статью от нового промпта вычитывают все. А дальше конвейер: тексты выходят пачками, и остается только надеяться, что повезет и они окажутся не хуже. Если надежда - не ваш метод, этот пост для вас.
Знакомая ситуация: написали промпт, сгенерировали статью, прочитали, поправили, еще раз прочитали - отлично, запускаем. Дальше этим промптом генерятся еще тысячи текстов, которые уже никто не проверяет. А качество LLM плавает: где-то выдумала факты, где-то съела половину структуры.
Решение - тестировать тексты. Фреймворк называется deepeval (Codex или Claude поможет вам в установке и настройке): он гоняет каждую статью через набор тестов. Статья либо проходит, либо бракуется с указанием конкретной причины: "нет методологии оценки", "галлюцинация в фактах".
Как работает проверка
В deepeval два типа метрик.
Программатические: количество слов, один h1, повторы n-грамм, наличие дат, таблиц сравнения. Вы самостоятельно пишете код для проверки. Их может быть хоть 100 штук - это бесплатно. Настраивать можно вручную в браузере, через код, или дать задание вашему любимому ИИ.
G-Eval: LLM-судья, которому критерий проверки пишется обычным текстом. "Проверь, чтобы бонус был описан с реальными условиями: вейджер, минимальный депозит, срок отыгрыша".
Плюс встроенные: FaithfulnessMetric сверяет каждое утверждение с фактами из вашей БД (RTP, лицензии, платежки), есть еще HallucinationMetric и другие.
Калибровка на живых сайтах
Спойлер: пороги из головы не работают, их надо калибровать на реальных текстах.
Я прогнал свои тесты на статьях топовых сайтов и заведомый спам. Топы стабильно дают оценку ~0.76, спам ~0.46.
Максимальный разрыв между хорошим и плохим текстом:
- Попадание в интент запроса
- Переспам
- Таблица сравнения
- Числовой рейтинг с его обоснованием
Один вывод из калибровки, который сэкономит вам время:
Сколько стоит? У меня выходит от $0.148 (меньше проверок) до $0.24 за статью (135 проверок).
Первую статью от нового промпта вычитывают все. А дальше конвейер: тексты выходят пачками, и остается только надеяться, что повезет и они окажутся не хуже. Если надежда - не ваш метод, этот пост для вас.
Знакомая ситуация: написали промпт, сгенерировали статью, прочитали, поправили, еще раз прочитали - отлично, запускаем. Дальше этим промптом генерятся еще тысячи текстов, которые уже никто не проверяет. А качество LLM плавает: где-то выдумала факты, где-то съела половину структуры.
Решение - тестировать тексты. Фреймворк называется deepeval (Codex или Claude поможет вам в установке и настройке): он гоняет каждую статью через набор тестов. Статья либо проходит, либо бракуется с указанием конкретной причины: "нет методологии оценки", "галлюцинация в фактах".
Как работает проверка
В deepeval два типа метрик.
Программатические: количество слов, один h1, повторы n-грамм, наличие дат, таблиц сравнения. Вы самостоятельно пишете код для проверки. Их может быть хоть 100 штук - это бесплатно. Настраивать можно вручную в браузере, через код, или дать задание вашему любимому ИИ.
G-Eval: LLM-судья, которому критерий проверки пишется обычным текстом. "Проверь, чтобы бонус был описан с реальными условиями: вейджер, минимальный депозит, срок отыгрыша".
Плюс встроенные: FaithfulnessMetric сверяет каждое утверждение с фактами из вашей БД (RTP, лицензии, платежки), есть еще HallucinationMetric и другие.
Калибровка на живых сайтах
Спойлер: пороги из головы не работают, их надо калибровать на реальных текстах.
Я прогнал свои тесты на статьях топовых сайтов и заведомый спам. Топы стабильно дают оценку ~0.76, спам ~0.46.
Максимальный разрыв между хорошим и плохим текстом:
- Попадание в интент запроса
- Переспам
- Таблица сравнения
- Числовой рейтинг с его обоснованием
Один вывод из калибровки, который сэкономит вам время:
В качестве судьи используйте gpt-4o-mini. Тестировал более свежую gpt-5.4-nano - в 4 раза медленнее и ставит либо 0.0, либо 0.9.
Сколько стоит? У меня выходит от $0.148 (меньше проверок) до $0.24 за статью (135 проверок).
🔥6
Как сравнивать промпты и модели LLM перед запуском конвейера?
В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого - бесплатный promptfoo (есть веб-версия на локалке и CLI).
Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.
Проверки здесь двух видов, прям как в deepeval:
- Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
- LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.
С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.
h2: Лайв-тест
Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.
h3: Результаты по памяти
- gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).
- gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).
- gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).
- gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.
- gpt-5.4-nano выдал сетку 5x4 вместо 6x5.
Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 - они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).
h3: Результаты с фактами
Промпт с фактами внутри - обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.
h2: Вывод
Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель - добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.
Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.
Сколько стоит? Весь эксперимент - 14 моделей, два прогона, сотни проверок - обошелся меньше чем в доллар.
В прошлый раз разбирали как ловить плохую статью на выходе с помощью deepeval. Но можно ловить раньше: на самом промпте и модели, которой вы этот промпт скармливаете (спасибо, Кэп!). Инструмент для этого - бесплатный promptfoo (есть веб-версия на локалке и CLI).
Перечисляете промпты, модели и тесты с проверками, а promptfoo проверит их: каждый промпт * каждую модель * каждую проверку.
Проверки здесь двух видов, прям как в deepeval:
- Детерминированные: Проверяют, что в тексте есть нужное число, есть таблица и т.д. Это бесплатно.
- LLM-судья: Критерий пишется обычным текстом. Например: "верно ли передана механика?". Платим за токены.
С помощью promptfoo очень быстро можно протестировать новую модель, сравнив ее с другими.
h2: Лайв-тест
Я взял слот Gates of Olympus и собрал по нему: RTP, максимальный выигрыш, механика, множители, фриспины, ставки. И дал задание 14 моделям (OpenAI от gpt-4o-mini до gpt-5.6, плюс китайские Kimi-K3, GLM-5.2, Qwen3.8) написать обзор слота двумя промптами: по памяти и с фактами внутри промпта.
h3: Результаты по памяти
- gpt-5.4-mini перепутал механику: назвал "Pay Anywhere / Cluster" вместо Scatter Pays. Насчитал 6 номиналов множителей вместо 15, заявил, что бонуса нет (есть).
- gpt-5.6-sol выдумал номинал множителя 75x, которого в игре не существует, и hit frequency 27,27% (реальная 28,82%).
- gpt-4o-mini перепутал вообще все выплаты за скаттеры (5x/100x/500x вместо 3x/5x/100x).
- gpt-4.1-mini уверенно написал, что Ante Bet и Buy Feature "отсутствуют". Обе функции есть.
- gpt-5.4-nano выдал сетку 5x4 вместо 6x5.
Ноль галлюцинаций у gpt-4o, gpt-5, gpt-5.2, Kimi-K3 и Qwen3.8 - они либо знают точные цифры, либо честно пишут "нет данных". Отдельно отмечу Kimi-K3: китайская модель знает слоты не хуже топового OpenAI (25 верных фактов, ноль галлюцинаций).
h3: Результаты с фактами
Промпт с фактами внутри - обнулил галлюцинации у всех 14 моделей. Ноль. Включая тех, кто по памяти путал механику.
h2: Вывод
Имея пару промптов и базу фактов, вы за полчаса получаете объективный, воспроизводимый рейтинг любых моделей по своей теме. Вышла новая модель - добавили строчку в конфиг, прогнали, увидели ее место в рейтинге.
Про LLM-судью: где нужна смысловая оценка, берите gpt-5-mini.
Сколько стоит? Весь эксперимент - 14 моделей, два прогона, сотни проверок - обошелся меньше чем в доллар.
👍4