yet another dev
40% новых артистов на Яндекс Музыке — ИИ На выходных написал скрипт, который сравнивает профили артистов на Яндекс Музыке и Deezer. Сейчас сравнил чуть больше 4000 артистов. Начал с самых новых (99% релизов проверенных артистов были сделаны за последние 3…
На основе полученных данных можно составлять рейтинг нейрослопа. Некоторые "музыканты" генерируют столько контента, что диву даёшься.
Вот топ-3 артистов по количеству релизов в день:
🥇 Sommnia — 91.1 релиза в день (загрузил 5465 релизов за 60 дней).
🥈 Context Collapse — 14.1 релиза в день (загрузил 902 релиза за 64 дня).
🥉 Jorvexi — 13.4 релиза в день (загрузил 187 релизов за 14 дней).
* Релиз — это альбом или сингл.
Вот топ-3 артистов по количеству релизов в день:
🥇 Sommnia — 91.1 релиза в день (загрузил 5465 релизов за 60 дней).
🥈 Context Collapse — 14.1 релиза в день (загрузил 902 релиза за 64 дня).
🥉 Jorvexi — 13.4 релиза в день (загрузил 187 релизов за 14 дней).
* Релиз — это альбом или сингл.
😁4👾1
yet another dev
40% новых артистов на Яндекс Музыке — ИИ На выходных написал скрипт, который сравнивает профили артистов на Яндекс Музыке и Deezer. Сейчас сравнил чуть больше 4000 артистов. Начал с самых новых (99% релизов проверенных артистов были сделаны за последние 3…
Новая информация по ИИ в Яндекс Музыке
В прошлый раз проверялись артисты, рекомендованные Яндексом. Алгоритм был такой: начинаем с рандомного артиста и обрабатываем его. Потом переходим в "Похожие артисты" и обрабатываем их. Для каждого похожего снова переходим в "Похожие артисты" и т. д. Что-то типа BFS-алгоритма по дереву похожих артистов. В итоге, я получил датасет из 4К артистов, но этот подход был медленным из-за большого количества вызовов API.
Я пересмотрел алгоритм и вместо BFS, сейчас тупо обрататываю ID артистов последовательно один за другим. Начал с ID последнего созданного профиля артиста, который я нашёл при помощи бинарного поиска (наконец-то пригодился LeetCode). Кроме того, оптимизировал вызовы API и сейчас из Яндекса за один вызов извлекается информация по 100 артистам и сравнивается с Deezer в 4 потока. Быстрее уже не получается, т.к. упираюсь в лимиты API Deezer.
В итоге мне удалось добиться скорости примернов 10К артистов в час.
UPD: Скорость примерно 20K в час.
В прошлый раз проверялись артисты, рекомендованные Яндексом. Алгоритм был такой: начинаем с рандомного артиста и обрабатываем его. Потом переходим в "Похожие артисты" и обрабатываем их. Для каждого похожего снова переходим в "Похожие артисты" и т. д. Что-то типа BFS-алгоритма по дереву похожих артистов. В итоге, я получил датасет из 4К артистов, но этот подход был медленным из-за большого количества вызовов API.
Я пересмотрел алгоритм и вместо BFS, сейчас тупо обрататываю ID артистов последовательно один за другим. Начал с ID последнего созданного профиля артиста, который я нашёл при помощи бинарного поиска (наконец-то пригодился LeetCode). Кроме того, оптимизировал вызовы API и сейчас из Яндекса за один вызов извлекается информация по 100 артистам и сравнивается с Deezer в 4 потока. Быстрее уже не получается, т.к. упираюсь в лимиты API Deezer.
В итоге мне удалось добиться скорости примерно
UPD: Скорость примерно 20K в час.
🔥3
yet another dev
Новая информация по ИИ в Яндекс Музыке В прошлый раз проверялись артисты, рекомендованные Яндексом. Алгоритм был такой: начинаем с рандомного артиста и обрабатываем его. Потом переходим в "Похожие артисты" и обрабатываем их. Для каждого похожего снова переходим…
👆Теперь о диаграмме и почему изменилось соотношение ИИ/не ИИ
Легенда (в прошлый раз забыл про неё):
🟢 100% не ИИ — артист был найден на Deezer и ни один из его релизов не был помечен как ИИ.
🔵 Нужна доп. проверка — артист найден на Deezer, существующие на Deezer релизы не помечены как ИИ, но на Яндексе есть релизы, которые не существуют на Deezer.
🔴100% ИИ — артист найден на Deezer и хотя бы один релиз помечен как ИИ.
⚫️ Нет на Deezer — профиль артиста не найден на Deezer.
Сейчас доля ИИ-исполнителей всего 14%. Кажется, что не так страшно. Причина, скорее всего, в том, что 4000 было слишком мало, чтобы делать какие-то выводы. По моим прикидкам, каждый месяц в Яндекс Музыке сейчас создаётся 100К-200К новых профилей (кто все эти люди?). Я же проверил всего лишь малу долю.
Кроме того, я использовал алгоритм с обходом похожих артистов. Не исключаю, что Яндекс подсовывает туда ИИ-артистов, точно так же, как он делает это с "Моей Волной". Поэтому на предыдущем графике был сильный перекос в сторону ИИ в датасете.
Легенда (в прошлый раз забыл про неё):
🟢 100% не ИИ — артист был найден на Deezer и ни один из его релизов не был помечен как ИИ.
🔵 Нужна доп. проверка — артист найден на Deezer, существующие на Deezer релизы не помечены как ИИ, но на Яндексе есть релизы, которые не существуют на Deezer.
🔴100% ИИ — артист найден на Deezer и хотя бы один релиз помечен как ИИ.
⚫️ Нет на Deezer — профиль артиста не найден на Deezer.
Сейчас доля ИИ-исполнителей всего 14%. Кажется, что не так страшно. Причина, скорее всего, в том, что 4000 было слишком мало, чтобы делать какие-то выводы. По моим прикидкам, каждый месяц в Яндекс Музыке сейчас создаётся 100К-200К новых профилей (кто все эти люди?). Я же проверил всего лишь малу долю.
Кроме того, я использовал алгоритм с обходом похожих артистов. Не исключаю, что Яндекс подсовывает туда ИИ-артистов, точно так же, как он делает это с "Моей Волной". Поэтому на предыдущем графике был сильный перекос в сторону ИИ в датасете.
yet another dev
👆Теперь о диаграмме и почему изменилось соотношение ИИ/не ИИ Легенда (в прошлый раз забыл про неё): 🟢 100% не ИИ — артист был найден на Deezer и ни один из его релизов не был помечен как ИИ. 🔵 Нужна доп. проверка — артист найден на Deezer, существующие на…
И последнее на сегодня — релизы.
Очевидно, что разные исполнители выпускают разное количество релизов. В случае с ИИ-исполнителями это особенно заметно, поскольку трудозатраты на создание одной композиции значительно ниже. Как мы могли убедиться, можно выпускать десятки релизов в день.
Получаем ситуацию, что как минимум четверть релизов на Яндекс Музыке — это ИИ. Это уже можно сказать с уверенностью, т.к. выборка достаточно большая.
Очевидно, что разные исполнители выпускают разное количество релизов. В случае с ИИ-исполнителями это особенно заметно, поскольку трудозатраты на создание одной композиции значительно ниже. Как мы могли убедиться, можно выпускать десятки релизов в день.
Получаем ситуацию, что как минимум четверть релизов на Яндекс Музыке — это ИИ. Это уже можно сказать с уверенностью, т.к. выборка достаточно большая.
yet another dev
⚡️ GitHub Copilot В-С-Ё Простите за кликбейтный заголовок. Просто мне кажется, после этих изменений GitHub проиграет Claude. 2 часа назад получил письмо от GitHub, что с 1 июня Copilot уходит от модели с реквестами к модели с токенами. То есть к такой же…
Альтернатива GitHub Copilot
Ещё 29 апреля я отменил подписку на Copilot и переехал на OpenCode с DeepSeek. Прошло уже чуть больше недели. За это время я потратил $0.36 ($0.04 в апреле, остальное в мае). Токенов сожжено: 35M.
Чтобы потратить сумму, аналогичную подписке на Copilot Pro ($10), мне нужно тратить в 7-9 раз больше.
OpenCode - это консольное приложение, поэтому работа немного отличается от Copilot в VS Code - имейте ввиду.
Я также пробовал текстовый редактор Zed. В нём уже встроен агент для разработки. Zed, как и OpenCode тоже поддерживает множество сторонних провайдеров ИИ, в том числе DeepSeek. Но мне этот редактор пока не зашёл. Ещё кажется сырым. Например, плохо работает масштабирование: текст масштабируется, но элементы UI нет. На 14" мониторе ноутбука работать было неудобно.
При этом, мне кажется, у него большой потенциал. В отличие от VS Code и остальных редакторов, основанных на нём, Zed не использует Electron. Работает он очень шустро.
Ещё 29 апреля я отменил подписку на Copilot и переехал на OpenCode с DeepSeek. Прошло уже чуть больше недели. За это время я потратил $0.36 ($0.04 в апреле, остальное в мае). Токенов сожжено: 35M.
Чтобы потратить сумму, аналогичную подписке на Copilot Pro ($10), мне нужно тратить в 7-9 раз больше.
OpenCode - это консольное приложение, поэтому работа немного отличается от Copilot в VS Code - имейте ввиду.
Я также пробовал текстовый редактор Zed. В нём уже встроен агент для разработки. Zed, как и OpenCode тоже поддерживает множество сторонних провайдеров ИИ, в том числе DeepSeek. Но мне этот редактор пока не зашёл. Ещё кажется сырым. Например, плохо работает масштабирование: текст масштабируется, но элементы UI нет. На 14" мониторе ноутбука работать было неудобно.
При этом, мне кажется, у него большой потенциал. В отличие от VS Code и остальных редакторов, основанных на нём, Zed не использует Electron. Работает он очень шустро.
🔥5
wiz.io
Mini Shai-Hulud Strikes Again: TanStack + more npm Packages Compromised | Wiz Blog
Detect and mitigate malicious npm packages linked to the latest Mini Shai-Hulud supply chain campaign targeting high-value developer tooling.
Читаю разбор одной свежей уязвимости в npm.
Разработчики - те ещё тролли
Ещё интересный факт:
UPD: там ещё есть аналогичная уязвимость в Python
Разработчики - те ещё тролли
On developer machines, the malware installs a persistent gh-token-monitor daemon (via macOS LaunchAgent or Linux systemd) that polls GitHub every 60 seconds. On receiving a 40X error due to token revocation, the monitor attempts to run rm -rf ~/. The daemon automatically exits after 24 hours without triggering the destructive handler.
Ещё интересный факт:
As with previous Mini Shai-Hulud variants, the malware checks if the system is configured for the Russian language and terminates without exfiltrating data if so.
UPD: там ещё есть аналогичная уязвимость в Python
If the package is executed on a system with location settings in Israel or Iran (via timezone and language) it invokes random.randing(1,6) and if that equals 2, it plays an mp3 file at full volume and runs rm -rf, attempting deleting the files in the system.
😁2🤬1
Начальство в очередной раз проявляет свою заботу
На этот раз, они переживают из-за GitHub. Разработчиков постепенно готовят к технологическому суверенитету и цифровой независимости от враждебных платформ.
"Интернет душителю" на заметку: расширенный список технологий созданных или принадлежащих Microsoft, но всё ещё доступных россиянам:
- .NET (С#, F#, Visual Basic)
- npm
- TypeScript
- Visual Studio
- Visual Studio Code
С нетерпением ждем дальнейшего расширения цифровой независимости.
На этот раз, они переживают из-за GitHub. Разработчиков постепенно готовят к технологическому суверенитету и цифровой независимости от враждебных платформ.
"Интернет душителю" на заметку: расширенный список технологий созданных или принадлежащих Microsoft, но всё ещё доступных россиянам:
- .NET (С#, F#, Visual Basic)
- npm
- TypeScript
- Visual Studio
- Visual Studio Code
С нетерпением ждем дальнейшего расширения цифровой независимости.
Telegram
Горелкин
Российские разработчики заметили, что GitHub всё чаще оказывается недоступен. Процент неудачных соединений с платформой, которую многие отечественные программисты используют для совместной работы с кодом, превысил 16%. Интересно, что проблема коснулась только…
🤬7
Кстати, о Китае, на который ссылается наш господин депутат
Я был там 2 недели назад. Посетил Шанхай и Пекин. Кроме осознания, что Китай впереди лет на 20, я убедился, что Поднебесная — это наш главный ориентир.
Например, одним из средством блокировок был DNS-спуфинг. И вот совсем недавно, выходит законопроект о "соответствии сетевых адресов доменным именам".
Надеюсь, начальство в своей заботе не забыло, что:
- В Китае население в 10 раз больше.
- В местное производство и технологии десятилетиями инвестировался западный капитал.
- Их модель интернета изначально строилась как изолированная, самодостаточная экосистема, а не как часть глобального интернета.
- Даже при всём своём технологичесоком превосходстве (без шуток), Великий китайский файервол обходится теми же самыми способами и протоколами.
Существующая сфера информационных технологий в Китае, на которую так облизываются наше начальство, — это многие годы упорного труда в мирных условиях сотен миллионов китайцев и огромных инвестиций.
Я был там 2 недели назад. Посетил Шанхай и Пекин. Кроме осознания, что Китай впереди лет на 20, я убедился, что Поднебесная — это наш главный ориентир.
Например, одним из средством блокировок был DNS-спуфинг. И вот совсем недавно, выходит законопроект о "соответствии сетевых адресов доменным именам".
Надеюсь, начальство в своей заботе не забыло, что:
- В Китае население в 10 раз больше.
- В местное производство и технологии десятилетиями инвестировался западный капитал.
- Их модель интернета изначально строилась как изолированная, самодостаточная экосистема, а не как часть глобального интернета.
- Даже при всём своём технологичесоком превосходстве (без шуток), Великий китайский файервол обходится теми же самыми способами и протоколами.
Существующая сфера информационных технологий в Китае, на которую так облизываются наше начальство, — это многие годы упорного труда в мирных условиях сотен миллионов китайцев и огромных инвестиций.
👍9
yet another dev
Альтернатива GitHub Copilot Ещё 29 апреля я отменил подписку на Copilot и переехал на OpenCode с DeepSeek. Прошло уже чуть больше недели. За это время я потратил $0.36 ($0.04 в апреле, остальное в мае). Токенов сожжено: 35M. Чтобы потратить сумму, аналогичную…
Вайбкодером быть дорого
GitHub запустил вебсайт, где можно оценить свои траты, если бы новая модель подписки на Copilot была введена ранее. Люди начали делиться на Reddit своими результатами.
Я свою статистику не могу посмотреть, потому что Microsoft не был бы Microsoft, если бы всё работало нормально. Я попробовал трижды и на каждую попытку на мой email приходила ошибка, вместо отчёта за апрель.
GitHub запустил вебсайт, где можно оценить свои траты, если бы новая модель подписки на Copilot была введена ранее. Люди начали делиться на Reddit своими результатами.
Я свою статистику не могу посмотреть, потому что Microsoft не был бы Microsoft, если бы всё работало нормально. Я попробовал трижды и на каждую попытку на мой email приходила ошибка, вместо отчёта за апрель.
😁3😭1
yet another dev
И последнее на сегодня — релизы. Очевидно, что разные исполнители выпускают разное количество релизов. В случае с ИИ-исполнителями это особенно заметно, поскольку трудозатраты на создание одной композиции значительно ниже. Как мы могли убедиться, можно выпускать…
Новости по slopless
- Сейчас обработано 914 тысяч артистов. Из них 76.5 тысяч — это ИИ.
- Если опираться только на результаты сравнения Yandex Music с Deezer, то получается, что ежемесячно на Yandex загружается как минимум 100 тысяч ИИ-треков.
- На первой диаграмме отчётливо видно, что количество нейрослопа начало увеличиваться после релиза Suno и Udio (инструменты для создания ИИ-музыки).
- В 2026 году с января по апрель было загружено 124к, 117к, 133к и 103к ИИ-треков соответственно. Получается, что сейчас примерно каждый третий новый трек — нейрослоп.
- На этих выходных добавлю новых ИИ-артистов в расширение. Также попробую поэкспериментировать с машинным обучением, чтобы найти ИИ-артистов в серой категории.
- Сейчас обработано 914 тысяч артистов. Из них 76.5 тысяч — это ИИ.
- Если опираться только на результаты сравнения Yandex Music с Deezer, то получается, что ежемесячно на Yandex загружается как минимум 100 тысяч ИИ-треков.
- На первой диаграмме отчётливо видно, что количество нейрослопа начало увеличиваться после релиза Suno и Udio (инструменты для создания ИИ-музыки).
- В 2026 году с января по апрель было загружено 124к, 117к, 133к и 103к ИИ-треков соответственно. Получается, что сейчас примерно каждый третий новый трек — нейрослоп.
- На этих выходных добавлю новых ИИ-артистов в расширение. Также попробую поэкспериментировать с машинным обучением, чтобы найти ИИ-артистов в серой категории.
🔥8
Кратко и тезисно про машинное обучение для детекта ИИ-артистов
- Я всё таки решил не использовать .NET для этого. У Python гораздо богаче экосистема.
- В качестве модели для обучения выбрал XGBoost.
- Модели требовались признаки (features). Признак — это некоторый измеримый параметр объекта, по которому модель может обучаться, а затем прогнозировать результат. Я отобрал 15 признаков.
- Например, чуть ранее я упоминал Sommina — артиста, который публикует 90+ релизов в день. Частота релизов — это один из признаков. У ИИ-артистов он выше, у обычных — ниже.
- Другой признак, который я обнаружил, это связь артистов с лейблами. Я заметил, что лейбл, сотрудничающий с одним ИИ-артистом, с большой долей вероятности сотрудничает и с другими ИИ-артистами. Например, Sommnia сотрудничает с лейблом Context Collapse, который, в свою очередь сотрудничает с множеством других ИИ-артистов (278, если быть точным).
- В обучении использовал метаданные артистов, начиная с 2024 года. Таких набралось 572 тысячи. 60% использовались непосредственно для обучения, 20% на тестирование и ещё 20% на калибровку.
- Матрица ошибок (confusion matrix) получилась следующая:
- Из всех, кого модель назвала ИИ, 83.77% действительно оказались ИИ. Из всех ИИ-артистов модель нашла 97.14%.
- Применив модель к артистам из "серой" категории (которых нет на Deezer), получилось, что ещё около 64 тысячи исполнителей с высокой вероятностью (≥ 0.85) можно отнести к ИИ. Они, в свою очередь, добавили ещё 129 тысяч ИИ-треков c января по апрель этого года.
- По моим скромным подсчётам, получается, что на "Яндекс Музыке" сейчас примерно 140 тысяч ИИ артистов. Ежемесячно они загружают около 40% новой музыки.
- Я всё таки решил не использовать .NET для этого. У Python гораздо богаче экосистема.
- В качестве модели для обучения выбрал XGBoost.
- Модели требовались признаки (features). Признак — это некоторый измеримый параметр объекта, по которому модель может обучаться, а затем прогнозировать результат. Я отобрал 15 признаков.
- Например, чуть ранее я упоминал Sommina — артиста, который публикует 90+ релизов в день. Частота релизов — это один из признаков. У ИИ-артистов он выше, у обычных — ниже.
- Другой признак, который я обнаружил, это связь артистов с лейблами. Я заметил, что лейбл, сотрудничающий с одним ИИ-артистом, с большой долей вероятности сотрудничает и с другими ИИ-артистами. Например, Sommnia сотрудничает с лейблом Context Collapse, который, в свою очередь сотрудничает с множеством других ИИ-артистов (278, если быть точным).
- В обучении использовал метаданные артистов, начиная с 2024 года. Таких набралось 572 тысячи. 60% использовались непосредственно для обучения, 20% на тестирование и ещё 20% на калибровку.
- Матрица ошибок (confusion matrix) получилась следующая:
| | Предсказано не ИИ | Предсказано ИИ |
| ----- | ----------------- | -------------- |
| Не ИИ | 96740 | 2784 |
| ИИ | 423 | 14370 |
- Из всех, кого модель назвала ИИ, 83.77% действительно оказались ИИ. Из всех ИИ-артистов модель нашла 97.14%.
- Применив модель к артистам из "серой" категории (которых нет на Deezer), получилось, что ещё около 64 тысячи исполнителей с высокой вероятностью (≥ 0.85) можно отнести к ИИ. Они, в свою очередь, добавили ещё 129 тысяч ИИ-треков c января по апрель этого года.
- По моим скромным подсчётам, получается, что на "Яндекс Музыке" сейчас примерно 140 тысяч ИИ артистов. Ежемесячно они загружают около 40% новой музыки.
😱3
yet another dev
Кратко и тезисно про машинное обучение для детекта ИИ-артистов - Я всё таки решил не использовать .NET для этого. У Python гораздо богаче экосистема. - В качестве модели для обучения выбрал XGBoost. - Модели требовались признаки (features). Признак — это…
Картинки, которые не поместились.
1. Кривая калибровки. Изначально модель была слишком "самоуверенной". Например, когда она оценивала вероятность ИИ в 85%, то по факту среди таких артистов оказывалось лишь около 50% реальных ИИ-исполнителей.
2. Количество треков в месяц по категориям. В серой зоне все ещё много контента.
1. Кривая калибровки. Изначально модель была слишком "самоуверенной". Например, когда она оценивала вероятность ИИ в 85%, то по факту среди таких артистов оказывалось лишь около 50% реальных ИИ-исполнителей.
2. Количество треков в месяц по категориям. В серой зоне все ещё много контента.
❤4