altblog - трудовые будни
303 subscribers
33 photos
4 videos
28 links
Делюсь своими находками в SEO и всем что связано с NLP (обработка текста).

Бот для оценки траста домена в Google - @google_trust_checker_bot

iGeoLeak - база гео-ротации партнерских ссылок в iGaming - https://igeoleak.vercel.app/
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Почему Google Ai Overview отвечал неверно по поводу угрозы цунами?

Картинка к посту - пример работы Graphiti, в котором девушка сначала любила кросовки Adidas, но потом когда они сломались, и она полюбима кросовки Puma.

Прочитал пост «Как Google дезинформировал людей во время угрозы цунами»(https://t.me/seoaspirant/1548) и решил поделиться мыслями, почему так произошло. Чтобы это понять, нужно разобраться, какие технологии использует Google для генерации AI Overview.

Большинство современных AI-саммари не работают в реальном времени. Они используют подход RAG - вытаскивают релевантную информацию из индексированной базы документов и на ее основе формируют ответ, и всё. Если база документов устарела и не была переиндексирована, (а в RAG нужно делать переиндексацию), то ответ может быть не точным.

Примечание: еще до ChatGPT были доступны модели для генерации саммари:
- Абстрактивные, которые создают новые формулировки.
- Экстрактивные, которые просто извлекают ключевые фразы из текста, без генерации новых.

Кроме RAG, есть более продвинутый подход - GraphRAG. Он использует не просто текстовую или векторную базу данных, а граф знаний, который отражает взаимосвязи между сущностями и фактами. Помимо семантического поиска, здесь есть поиск с учетом связей между сущностями. Это позволяет связывать разрозненные факты и давать пользователю более точные ответы.

Может показаться, то внедерние GraphRAG в Ai Overview - это следующий этап развития саммари в выдаче Google. Но есть кое-что получше - open-source фреймворк Graphiti. Это усовершенствованная версия GraphRAG, с фокусом на real-time, и bi-temporal (время появления факта). Ну и конечно же, есть отдельное поле для добавление URL источника факта.

Graphiti работает в реальном времени, умеет различать время появления данных, поддерживает инкрементальные обновления, без полной переиндексации базы данных. А еще автоматически отбрасывает старые или противоречивые факты

Это то, чего сейчас не хватает Google Ai Overview.

Уверен, что Google в скором времени пойдёт в этом направлении.

#google #rag
👍2
Нашел на сайте Hacker News анонс проекта OneMillionScreenshots.com который делает скриншоты сайтов и выводит их в виде галлерии. Подойдет дизайнерам для поиска вдохновения.

Но самое интересное, что можно указать конкретный сайт, например, slotcatalog.com и посмотреть отчет со списком похожих сайтов по тегу title или descriptions. А это уже поиск вдохновения для SEOшника :)
👍2
Pandas вместо Excel - апгрейд продуктивности ×100

Большую часть времени я работаю с кодом Python и Pandas - это мои настоящие трудовые будни. Я познакомился с ними примерно 4 года назад, и с того момента Excel и Google Таблицы для анализа данных не открываю.

С Pandas можно работать хоть с 12 000 000 строк даже на 8 ГБ оперативки и это почти не влияет на производительность компьютера.

Можно автоматизировать любой анализ и больше никогда не повторять одно и то же вручную:
- Не нужно кликать мышкой и перетаскивать формулы
- Не нужно переключаться по вкладкам
- Не нужно каждый раз собирать сводные таблицы

Просто указал новый путь к CSV-файлу, например из Ahrefs с ключевыми словами, нажал «Выполнить» и через пару секунд получил всё:
- средние значения
- графики
- выборки по нужным критериям
- сводные таблицы

Один раз настроил пайплайн - и в следующий раз одной кнопкой получаешь готовый результат.

Вот руководство, с которого я стартовал - Data Analysis (Pandas)

Если есть доступ к Google Colab (или аналог), то устанавливать на компьютер ничего не нужно, можно сразу пробовать сделать свой первый пайплайн анализ. Сейчас с ChatGPT это вообще не проблема.

#python
🔥5❤2
TL;DR: Google бот заходит на одни страницы в 8 раз чаще, чем на на другие, даже если контент сгенерирован по одному шаблону. Если коротко, то метрики вроде кликов, объема текста или уникальных биграм - не объясняют поведение бота.

Есть у меня скрипт, который считает, сколько раз Google бот зашёл на каждую страницу, записывает дату посещения и обновляет счётчик.

На сайте около 3000 страниц сгенерированных ChatGPT + интерактивные таблицы и уникальная информация собранная из приватных сервисов. Ранжирование очень слабое. Бывают всплески показов и кликов, потом всё уходит в ноль. В начале был "бонус новичка", но потом фильтр "низкое качество / thin content" сделал своё дело.

Данные Google бота:
- Максимум визитов на одну страницу с января 2022: 40
- 648 страниц: дата последнего визита = дата первого (январь 2025)
- 54 страницы - вообще ни разу не сканировались
- За последний месяц бот посетил 458 страниц 3765 раз (среднее 8)
- В индексе 952 страницы (GSC), остальные в категории Crawled - currently not indexed. В мае в индексе было 3000 страниц.

Вопрос: почему бот сканирует одни страницы чаще других, если все сгенерированы по одному шаблону?

Я проверил корреляцию посещений бота с разными метриками:
- Кол-во кликов из Google (GSC): 0.21
- Кластер: 0.12
- Global Volume кейворда: 0.07
- Кол-во слов: 0.07
- Части речи (VERB, AUX и т.д.): 0.06
- Процент уникальных биграм: -0.06
- Кол-во показов из Google: 0.06
- BM25 Score (название + описание): -0.03
- Косинусное сходство заголовка и текста: 0.001

Вывод: бот ценит что-то, что сложно измерить стандартными метриками.

#google
😢2
Канал SEO BAZA поделился ссылкой на справку в Википедии для ее редакторов, как определить ИИ-контент.

Я конспектировал для себя. Вот оригинал - Wikipedia:Signs of AI writing (7000 слов), а вот здесь мой конспект (1500 слов).

#ai #контент
🔥2
На основе Signs of AI writing сделал скрипт который находит ИИ-паттерны в тексте и возвращает тип паттерна. Чтобы убедиться, что скрипт работает - прогнал на 3000 статьях из Википедии и корпусе текстов (который был сохранен еще до выхода ChatGPT) с популярного блога, а затем сравнил с текстами, которые выдает ChatGPT. Есть заметные различия.

Далее будут самые явные различия. Сначала среднее значение (процентное соотношение к общему числу слов в статье) из Википедии, потом ChatGPT.
- cliches: 0.31 / 2.5
- overexplaining: 0.02 / 0.18
- surface_analysis_ing (ing на конце слов): 1.2 / 3
- broad_generalizations: 0.000750 / 0.039
- false_ranges: 0.005 / 0.021
- not_only_but: 0.003 / 0.063

В общем, "следов" более чем предостаточно, без всяких там векторов, регрессионных моделей и т.д.

После того как получил подтверждение, что скрипт работает - сделал сайт под него - encypher.xyz. Есть бесплатный API. Тексты нигде не сохраняются. Никаких вероятней, что это ИИ-текст - не выводится, пользователь пусть сам решает.

#ai #контент
🔥4❤3
Google Source Preferences Suggested Domains

Кто-то спарсил список из 15 тысяч сайтов Google Source Preferences Suggested Domains. А я прогнал их через Ahrefs Batch Analysis, спарсил title, анкоры, schema.org, передал данные в Google NLP для определение тематики.

И вот что получилось:
– Какие категории качают по трафику
– Сайты-лидеры в каждой нише
– Где есть трафик несмотря на малое число ключей
– Какие анкоры на главной встречаются чаще всего
– Насколько часто используют schema.org (спойлер - почти не используют)

Будет полезно тем, кто ищет новые ниши для сайтов, ну и посмотреть на лидеров в разных категориях можно.

Сухие данные можно посмотреть здесь.
А вот здесь сама таблица.
👍5
Perplexity запустила Search API
* На скриншоте показано качество ответов в сравнении с другими ПС.

Компания Perplexity запустила Search API, который предоставляет доступ к результатам поиска (вместе с текстами, а не только урлами), которые сервис использует для составления ответов на запросы пользователей. Кроме этого, можно искать по своему списку доменов (до 20 штук).

Параллельно они опубликовали статью "Разработка и оценка API поиска на базе ИИ".

Основные тезисы:

- Используется гибридный поиск (лексика + семантика), ранжирование происходит в несколько стадий + обучение на фидбэке юзеров (ПФ).
Лексика: в языке есть слова кошка и кот.
Семантика: они оба означают домашнее животное семейства кошачьих, но различаются по полу.

- Perplexity наблюдали бифуркацию (это точка, где порядок может перейти либо в хаос, либо в новый, более сложный порядок) экосистемы ИИ между лексическим и семантическим поиском, причем появились системы, переоптимизированные для одной модальности по сравнению с другой.

- Понимание контекста требует, чтобы система не только фиксировала релевантность на уровне документа, но и рассматривал отдельные разделы и группы документов как самостоятельные единицы. "Мы извлекаем и оцениваем результаты как на уровне документа, так и на уровне поддокументов."

- Разбивают документ на поддокументы, чтобы БД не засорялась мусором. Это решает ключевую проблему RAG, когда от слишком большого контекса модель тупеет.

- Используют ML, чтобы предсказывать что и когда индексировать. Это делается, чтобы поддерживать индекс, отвечающий требованиям как по полноте, так и по актуальности. Нельзя часто индексировать все, нужен ML, чтобы решать: «обновить старое» или «поймать новое».

- Полнота против качества. Жесткая фильтрация дает чистоту, но теряет важные куски, мягкая фильтрация дает больше, но с шумом.

- Модель машинного обучения предсказывает, нужно ли индексировать тот или иной URL.

- Используется динамический парсинг, разные правила под разные сайты.

- Поисковый индекс - эксабайтный (33 млн. фильмов в 4К формате). Более 400 петабайт в «горячем» (13 млн. фильмов в 4К формате) хранилище, а остальное — в «холодных» и «теплых» уровнях.

- Используются как обученные модели, так и настроенные эвристики для определения того, какие документы следует сохранять «горячими», отдавая приоритет документам из авторитетных доменов, документам, затрагивающим малоизученные темы.

- Ручная оптимизация качества возможна, но полученные правила анализа могут не охватить критически важный контент. "Мы могли бы вручную прописать правила, применяющие минимальную фильтрацию к исходному контенту, что может повысить полноту, но в ущерб качеству. Каждый элемент контекста ценен.".

- Для веб-сайта, насыщенного хорошо структурированными данными в виде списков или таблиц, могут быть полезны более шаблонные правила анализа и извлечения, в то время как для другого веб-сайта, преимущественно содержащего контент свободной формы, создаваемый пользователями, может потребоваться более свободный набор правил.

- Для проведения оценок использовали четыре бенчмарка: SimpleQA и FRAMES для одношагового поиска, а также BrowseComp и HLE для глубоких исследований. В совокупности эти бенчмарки предоставляют общепринятые критерии для агентов знаний.

#geo
Chris Long рассказал как можно найти по каким уточняющим запросам ChatGPT делает поиск, чтобы сгенерировать ответ. По ссылке выше есть инструкция - если коротко, то в Chrome DevTools есть JSON-файл в котором прописаны и запросы и урлы, по которым был сделан поиск.

В комментариях у него нашел ссылку на расширение Query Detector for ChatGPT которое показывает эти самые запросы (Fan-Out Queries). К сожалению, расширение не показывает урлы, которые использует ChatGPT.

Update: Есть расширение которое показывает используемый урлы, но его нет в каталоге расширений и нужно скачивать zip-файл.

#geo
Dan Okhlopkov который занимается TON в Telegram, опубликовал пост с примерными доходами различных ботов (там есть что посмотреть). И в конце дал ссылку на проект Dune, по которой доступна занимательная таблица по играм.

Немного данных с таблицы:
1win - 11 тыс. юзеров и доход $1.7m.
Whalecasino - 6.6 тыс. юзеров и доход $3.5m
1xbet - 7.6 тыс. юзеров и доход $679.0k

#casino
Поисковый алгоритм Perplexity

Если коротко:
1. Гибридный поиск (ключевые слова + семантика).
2. Фильтрация мусора.
3. Каскадное ранжирование:
3.1. сначала быстрые лексические и embedding-оценки
3.2. затем более дорогие кросс-энкодеры

Более развернуто (цитаты из статьи):
1. Поиск начинается с поиска по нашему индексу. Мы не навязываем выбор между лексическим и семантическим поиском. Вместо этого мы обращаемся к поисковому индексу через оба метода и объединяем результаты в гибридный набор кандидатов. На этом этапе приоритет отдается полноте, а не точности - последующие этапы конвейера будут оптимизироваться с учётом точности.

2. Процесс продолжается этапами предварительной фильтрации, на которых мы применяем базовые эвристические методы и фильтры первого отбора для удаления из набора кандидатов явно несоответствующего требованиям или устаревшего контента.

3. Затем мы применяем несколько этапов последовательного ранжирования. На более ранних этапах используются лексические и встраиваемые оценщики, оптимизированные для скорости. По мере постепенного отсева набора кандидатов мы используем более мощные модели кросс-энкодеров для окончательного результата.

Источник - блог perplexity.ai.

#geo
Просмотры ИИ видео на разных платформах

Недавно вышла новая версия генератора видео - Sora 2. Видео получаются очень реалистичные (не без ляпов). Есть водяной знак.

Посмотрите на эту колоссальную разницу в просмотрах. Видео про то, как котики спасают людей (часто детей) от медведей, тигров и других диких животных.

На YouTube видео вообще не набирают просмотры. За что же Google так не любит ИИ (кроме своего в поиске)? Ведь народу нравится.

#video #sora