altblog - трудовые будни
303 subscribers
33 photos
4 videos
28 links
Делюсь своими находками в SEO и всем что связано с NLP (обработка текста).

Бот для оценки траста домена в Google - @google_trust_checker_bot

iGeoLeak - база гео-ротации партнерских ссылок в iGaming - https://igeoleak.vercel.app/
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Почему Google Ai Overview отвечал неверно по поводу угрозы цунами?

Картинка к посту - пример работы Graphiti, в котором девушка сначала любила кросовки Adidas, но потом когда они сломались, и она полюбима кросовки Puma.

Прочитал пост «Как Google дезинформировал людей во время угрозы цунами»(https://t.me/seoaspirant/1548) и решил поделиться мыслями, почему так произошло. Чтобы это понять, нужно разобраться, какие технологии использует Google для генерации AI Overview.

Большинство современных AI-саммари не работают в реальном времени. Они используют подход RAG - вытаскивают релевантную информацию из индексированной базы документов и на ее основе формируют ответ, и всё. Если база документов устарела и не была переиндексирована, (а в RAG нужно делать переиндексацию), то ответ может быть не точным.

Примечание: еще до ChatGPT были доступны модели для генерации саммари:
- Абстрактивные, которые создают новые формулировки.
- Экстрактивные, которые просто извлекают ключевые фразы из текста, без генерации новых.

Кроме RAG, есть более продвинутый подход - GraphRAG. Он использует не просто текстовую или векторную базу данных, а граф знаний, который отражает взаимосвязи между сущностями и фактами. Помимо семантического поиска, здесь есть поиск с учетом связей между сущностями. Это позволяет связывать разрозненные факты и давать пользователю более точные ответы.

Может показаться, то внедерние GraphRAG в Ai Overview - это следующий этап развития саммари в выдаче Google. Но есть кое-что получше - open-source фреймворк Graphiti. Это усовершенствованная версия GraphRAG, с фокусом на real-time, и bi-temporal (время появления факта). Ну и конечно же, есть отдельное поле для добавление URL источника факта.

Graphiti работает в реальном времени, умеет различать время появления данных, поддерживает инкрементальные обновления, без полной переиндексации базы данных. А еще автоматически отбрасывает старые или противоречивые факты

Это то, чего сейчас не хватает Google Ai Overview.

Уверен, что Google в скором времени пойдёт в этом направлении.

#google #rag
👍2
Нашел на сайте Hacker News анонс проекта OneMillionScreenshots.com который делает скриншоты сайтов и выводит их в виде галлерии. Подойдет дизайнерам для поиска вдохновения.

Но самое интересное, что можно указать конкретный сайт, например, slotcatalog.com и посмотреть отчет со списком похожих сайтов по тегу title или descriptions. А это уже поиск вдохновения для SEOшника :)
👍2
Pandas вместо Excel - апгрейд продуктивности ×100

Большую часть времени я работаю с кодом Python и Pandas - это мои настоящие трудовые будни. Я познакомился с ними примерно 4 года назад, и с того момента Excel и Google Таблицы для анализа данных не открываю.

С Pandas можно работать хоть с 12 000 000 строк даже на 8 ГБ оперативки и это почти не влияет на производительность компьютера.

Можно автоматизировать любой анализ и больше никогда не повторять одно и то же вручную:
- Не нужно кликать мышкой и перетаскивать формулы
- Не нужно переключаться по вкладкам
- Не нужно каждый раз собирать сводные таблицы

Просто указал новый путь к CSV-файлу, например из Ahrefs с ключевыми словами, нажал «Выполнить» и через пару секунд получил всё:
- средние значения
- графики
- выборки по нужным критериям
- сводные таблицы

Один раз настроил пайплайн - и в следующий раз одной кнопкой получаешь готовый результат.

Вот руководство, с которого я стартовал - Data Analysis (Pandas)

Если есть доступ к Google Colab (или аналог), то устанавливать на компьютер ничего не нужно, можно сразу пробовать сделать свой первый пайплайн анализ. Сейчас с ChatGPT это вообще не проблема.

#python
🔥5❤2
TL;DR: Google бот заходит на одни страницы в 8 раз чаще, чем на на другие, даже если контент сгенерирован по одному шаблону. Если коротко, то метрики вроде кликов, объема текста или уникальных биграм - не объясняют поведение бота.

Есть у меня скрипт, который считает, сколько раз Google бот зашёл на каждую страницу, записывает дату посещения и обновляет счётчик.

На сайте около 3000 страниц сгенерированных ChatGPT + интерактивные таблицы и уникальная информация собранная из приватных сервисов. Ранжирование очень слабое. Бывают всплески показов и кликов, потом всё уходит в ноль. В начале был "бонус новичка", но потом фильтр "низкое качество / thin content" сделал своё дело.

Данные Google бота:
- Максимум визитов на одну страницу с января 2022: 40
- 648 страниц: дата последнего визита = дата первого (январь 2025)
- 54 страницы - вообще ни разу не сканировались
- За последний месяц бот посетил 458 страниц 3765 раз (среднее 8)
- В индексе 952 страницы (GSC), остальные в категории Crawled - currently not indexed. В мае в индексе было 3000 страниц.

Вопрос: почему бот сканирует одни страницы чаще других, если все сгенерированы по одному шаблону?

Я проверил корреляцию посещений бота с разными метриками:
- Кол-во кликов из Google (GSC): 0.21
- Кластер: 0.12
- Global Volume кейворда: 0.07
- Кол-во слов: 0.07
- Части речи (VERB, AUX и т.д.): 0.06
- Процент уникальных биграм: -0.06
- Кол-во показов из Google: 0.06
- BM25 Score (название + описание): -0.03
- Косинусное сходство заголовка и текста: 0.001

Вывод: бот ценит что-то, что сложно измерить стандартными метриками.

#google
😢2
Канал SEO BAZA поделился ссылкой на справку в Википедии для ее редакторов, как определить ИИ-контент.

Я конспектировал для себя. Вот оригинал - Wikipedia:Signs of AI writing (7000 слов), а вот здесь мой конспект (1500 слов).

#ai #контент
🔥2
На основе Signs of AI writing сделал скрипт который находит ИИ-паттерны в тексте и возвращает тип паттерна. Чтобы убедиться, что скрипт работает - прогнал на 3000 статьях из Википедии и корпусе текстов (который был сохранен еще до выхода ChatGPT) с популярного блога, а затем сравнил с текстами, которые выдает ChatGPT. Есть заметные различия.

Далее будут самые явные различия. Сначала среднее значение (процентное соотношение к общему числу слов в статье) из Википедии, потом ChatGPT.
- cliches: 0.31 / 2.5
- overexplaining: 0.02 / 0.18
- surface_analysis_ing (ing на конце слов): 1.2 / 3
- broad_generalizations: 0.000750 / 0.039
- false_ranges: 0.005 / 0.021
- not_only_but: 0.003 / 0.063

В общем, "следов" более чем предостаточно, без всяких там векторов, регрессионных моделей и т.д.

После того как получил подтверждение, что скрипт работает - сделал сайт под него - encypher.xyz. Есть бесплатный API. Тексты нигде не сохраняются. Никаких вероятней, что это ИИ-текст - не выводится, пользователь пусть сам решает.

#ai #контент
🔥4❤3
Google Source Preferences Suggested Domains

Кто-то спарсил список из 15 тысяч сайтов Google Source Preferences Suggested Domains. А я прогнал их через Ahrefs Batch Analysis, спарсил title, анкоры, schema.org, передал данные в Google NLP для определение тематики.

И вот что получилось:
– Какие категории качают по трафику
– Сайты-лидеры в каждой нише
– Где есть трафик несмотря на малое число ключей
– Какие анкоры на главной встречаются чаще всего
– Насколько часто используют schema.org (спойлер - почти не используют)

Будет полезно тем, кто ищет новые ниши для сайтов, ну и посмотреть на лидеров в разных категориях можно.

Сухие данные можно посмотреть здесь.
А вот здесь сама таблица.
👍5
Perplexity запустила Search API
* На скриншоте показано качество ответов в сравнении с другими ПС.

Компания Perplexity запустила Search API, который предоставляет доступ к результатам поиска (вместе с текстами, а не только урлами), которые сервис использует для составления ответов на запросы пользователей. Кроме этого, можно искать по своему списку доменов (до 20 штук).

Параллельно они опубликовали статью "Разработка и оценка API поиска на базе ИИ".

Основные тезисы:

- Используется гибридный поиск (лексика + семантика), ранжирование происходит в несколько стадий + обучение на фидбэке юзеров (ПФ).
Лексика: в языке есть слова кошка и кот.
Семантика: они оба означают домашнее животное семейства кошачьих, но различаются по полу.

- Perplexity наблюдали бифуркацию (это точка, где порядок может перейти либо в хаос, либо в новый, более сложный порядок) экосистемы ИИ между лексическим и семантическим поиском, причем появились системы, переоптимизированные для одной модальности по сравнению с другой.

- Понимание контекста требует, чтобы система не только фиксировала релевантность на уровне документа, но и рассматривал отдельные разделы и группы документов как самостоятельные единицы. "Мы извлекаем и оцениваем результаты как на уровне документа, так и на уровне поддокументов."

- Разбивают документ на поддокументы, чтобы БД не засорялась мусором. Это решает ключевую проблему RAG, когда от слишком большого контекса модель тупеет.

- Используют ML, чтобы предсказывать что и когда индексировать. Это делается, чтобы поддерживать индекс, отвечающий требованиям как по полноте, так и по актуальности. Нельзя часто индексировать все, нужен ML, чтобы решать: «обновить старое» или «поймать новое».

- Полнота против качества. Жесткая фильтрация дает чистоту, но теряет важные куски, мягкая фильтрация дает больше, но с шумом.

- Модель машинного обучения предсказывает, нужно ли индексировать тот или иной URL.

- Используется динамический парсинг, разные правила под разные сайты.

- Поисковый индекс - эксабайтный (33 млн. фильмов в 4К формате). Более 400 петабайт в «горячем» (13 млн. фильмов в 4К формате) хранилище, а остальное — в «холодных» и «теплых» уровнях.

- Используются как обученные модели, так и настроенные эвристики для определения того, какие документы следует сохранять «горячими», отдавая приоритет документам из авторитетных доменов, документам, затрагивающим малоизученные темы.

- Ручная оптимизация качества возможна, но полученные правила анализа могут не охватить критически важный контент. "Мы могли бы вручную прописать правила, применяющие минимальную фильтрацию к исходному контенту, что может повысить полноту, но в ущерб качеству. Каждый элемент контекста ценен.".

- Для веб-сайта, насыщенного хорошо структурированными данными в виде списков или таблиц, могут быть полезны более шаблонные правила анализа и извлечения, в то время как для другого веб-сайта, преимущественно содержащего контент свободной формы, создаваемый пользователями, может потребоваться более свободный набор правил.

- Для проведения оценок использовали четыре бенчмарка: SimpleQA и FRAMES для одношагового поиска, а также BrowseComp и HLE для глубоких исследований. В совокупности эти бенчмарки предоставляют общепринятые критерии для агентов знаний.

#geo
Chris Long рассказал как можно найти по каким уточняющим запросам ChatGPT делает поиск, чтобы сгенерировать ответ. По ссылке выше есть инструкция - если коротко, то в Chrome DevTools есть JSON-файл в котором прописаны и запросы и урлы, по которым был сделан поиск.

В комментариях у него нашел ссылку на расширение Query Detector for ChatGPT которое показывает эти самые запросы (Fan-Out Queries). К сожалению, расширение не показывает урлы, которые использует ChatGPT.

Update: Есть расширение которое показывает используемый урлы, но его нет в каталоге расширений и нужно скачивать zip-файл.

#geo
Dan Okhlopkov который занимается TON в Telegram, опубликовал пост с примерными доходами различных ботов (там есть что посмотреть). И в конце дал ссылку на проект Dune, по которой доступна занимательная таблица по играм.

Немного данных с таблицы:
1win - 11 тыс. юзеров и доход $1.7m.
Whalecasino - 6.6 тыс. юзеров и доход $3.5m
1xbet - 7.6 тыс. юзеров и доход $679.0k

#casino
Поисковый алгоритм Perplexity

Если коротко:
1. Гибридный поиск (ключевые слова + семантика).
2. Фильтрация мусора.
3. Каскадное ранжирование:
3.1. сначала быстрые лексические и embedding-оценки
3.2. затем более дорогие кросс-энкодеры

Более развернуто (цитаты из статьи):
1. Поиск начинается с поиска по нашему индексу. Мы не навязываем выбор между лексическим и семантическим поиском. Вместо этого мы обращаемся к поисковому индексу через оба метода и объединяем результаты в гибридный набор кандидатов. На этом этапе приоритет отдается полноте, а не точности - последующие этапы конвейера будут оптимизироваться с учётом точности.

2. Процесс продолжается этапами предварительной фильтрации, на которых мы применяем базовые эвристические методы и фильтры первого отбора для удаления из набора кандидатов явно несоответствующего требованиям или устаревшего контента.

3. Затем мы применяем несколько этапов последовательного ранжирования. На более ранних этапах используются лексические и встраиваемые оценщики, оптимизированные для скорости. По мере постепенного отсева набора кандидатов мы используем более мощные модели кросс-энкодеров для окончательного результата.

Источник - блог perplexity.ai.

#geo
Просмотры ИИ видео на разных платформах

Недавно вышла новая версия генератора видео - Sora 2. Видео получаются очень реалистичные (не без ляпов). Есть водяной знак.

Посмотрите на эту колоссальную разницу в просмотрах. Видео про то, как котики спасают людей (часто детей) от медведей, тигров и других диких животных.

На YouTube видео вообще не набирают просмотры. За что же Google так не любит ИИ (кроме своего в поиске)? Ведь народу нравится.

#video #sora
Хочешь купить ChatGPT Pro за 200 баксов?

Сейчас в блогах и чатах активно обсуждают тариф за $200: стоит ли вообще переходить, и настолько ли он лучше обычного? Люди хотят понять, реально ли качество ответов оправдывает цену.

На самом деле, все можно проверить самому - просто зайди в песочницу OpenAI, задай нужный промт и сравни ответы разных моделей. Здесь можно посмотреть пример ответа на просьбу написать ТЗ для статьи (модель думала 7 минут).

Ты можешь вообще не брать подписку. Через API доступна та же модель GPT-5 Pro ($15 за вход и $120 за выход, за 1 млн. токенов). Можно на коленке собрать свой веб- или десктоп-клиент, подключить API-ключ и платить только за токены, а не за подписку.
Batch Watcher - расширение для тех, кто смотрит Ahrefs как телевизор. Идеально подойдет для тех, кто отслеживает динамику конкурентов.

Оно позволяет сохранять показатели сайтов из Ahrefs Batch Analysis и сравнивать текущие показатели с сохраненными данными (снимками), например, до апдейта и после (нужно предварительно сделать снимок в расширении).

Работает полностью локально. Без API-ключей и паролей.

Как использовать:
1. Открой Ahrefs Batch Analysis.
2. Загрузите таблицу с сайтами, как обычно.
3. Нажми на иконку Batch Watcher в панели Chrome и сохрани снимок данных.
4. Уведомление покажет, сколько сайтов сохранено - это твой первый снимок.
5. Через несколько дней или недель сделай второй снимок.
6. Кликни правой кнопкой по иконке расширения и выбери Compare snapshots.
7. Выбери нужный снимок для сравнения - расширение покажет, что выросло, а что упало.

Если есть какие-то замечания или предложения - пишите в личку.
👍6
Ai Mode в Google

Если раньше, чтобы получить Ai-выдачу в Google нужно было перейти на соответсвующую вкладку, то сейчас при запросе, Google предложил получить результат в Ai-режиме. Раньше я с таким не сталкивался.

Но ссылки на приложения в Google Play - не дал.
Что ждет SEO в ближайшем будущем?

Если ChatGPT может ответить на ваш вопрос - вы не нужны в топе. Алгоритм будет пессимизировать страницы, семантический вектор которых совпадает с ответом AI-модели Google.


Я всегда скептически относился к прогнозам, но сегодня решил провести небольшой эксперимент. Загрузил в Claude и Gemini список обновлений Google, час гонял их по вопросам, а затем попросил предсказать, что будет дальше.

Их вывод удивил: картина получилась довольно реалистичной, их прогноз уже начинает сбываться. Задокоментируем их предсказание следующими статьями.


Предсказание Gemini о будущем SEO в ближайшие годы (640 слов)

Предсказание Claude о будущем SEO в ближайшие годы (1300 слов)

Claude: Будущее Google Search 2025-2028 (660 слов)
❤3
🏆 Топ-10 SEO-каналов в 2025 году

2025 год подходит к концу, и самое время опубликовать рейтинг SEO-каналов в Telegram.

С помощью Fomogram (агрегатор постов из SEO-каналов) я посчитал количество пересылок постов в 100 SEO-каналах за весь 2025 год.

Топ-10 каналов:

1. iGamingNews (44.4К пересылок)
2. Mike Blazer (44.2К пересылок)
3. R2B.News (31.7К пересылок)
4. DrMax SEO (16.8К пересылок)
5. PMP Media (15К пересылок)
6. Михаил Шакин (14.8К пересылок)
7. Артем Бородатюк (14.7К пересылок)
8. Англоязычное SEO (12.9К пересылок)
9. iGaming CEO (12.5К пересылок)
10. Oleg Shestakov (11.8К пересылок)

Посмотреть весь топ-30 и самые виральные посты каждого канала можно здесь.