Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
​​Is AI writing any good?

Есть такой писатель фэнтези, Mark Lawrence. Он довольно популярен и время от времени организует различные активности.

2 года назад он организовал эксперимент с попыткой сравнить качество написания текстов реальными авторами и AI.

Идеально было бы организовать написание длинных текстов, но их сложнее сравнивать, и людям может быть лень их читать, поэтому ограничились текстами в ~350 слов. 4 автора и ChatGPT 4, потом количество текстов стало 10. Промпт был "write a piece of fiction based on meeting a dragon", при этом для ChatGPT дали дополнительные инструкции.

Потом это дали почитать желающим и попросили проголосовать в двух опросах: отранжировать тексты в порядке предпочтения и попробовать угадать написан текст AI или нет.

Результат: в большинстве случаев (кроме двух) люди правильно угадали был ли автором AI (но лишь с небольшим перевесом), топ-2 и топ-3 по предпочтениям заняли тексты написанные AI (причём люди ошибочно считали, что топ-2 текст написан человеком). Результаты получились не особо радостные для авторов - топ два места из трёх у AI, в большинстве случаев люди не смогли чётко отличить AI от человека.

И вот недавно был проведён второй раунд. Результаты и тексты. В написании текстов принимало участие 4 автора с общим тиражом проданных книг около 15 млн. Со стороны AI участвовал GPT-5 (не уточнено какая версия). Опять тексты по 350 слов.

Для чистоты эксперимента предлагаю вам самим вначале прочитать тексты и проголосовать :)

Какие же итоги? 964 голоса. Люди угадали правильно авторство трёх историй (1 AI, 2 автора), неправильно тоже три (2 AI, 1 автор) и два раза была ничья (1 AI, 1 автор). Получается по факту рандомное угадывание.

Но ещё печальнее то, что средняя оценка сгенеренных историй выше, чем написанных людьми. И топ-1 место по предпочтениям - AI.

Организатор опроса с печалью признаёт, что AI выиграл этот раунд.

> Should AI generate fiction, imagery, voices etc competing with artists in a number of fields and fooling the public. No, of course not. I hate that idea and most people do too.

> Will it happen? It's already happening. Wherever anyone can circumvent skill and heart and just profiteer off a new technology, they're going to do it. People threaten people with knives in the street for a few dollars - are people going to try to sell you AI books ... of course.

> It's a huge shock to me that fiction which, in this test, scores higher than great authors who write wonderful stories full of soul and heart and wit and intelligence, can be generated by the multiplication of a relatively small number of not particularly large matrices. On the face of it it undercuts so many things we value about being human.

В настоящий момент AI не может писать хорошие, последовательные истории большого размера, но прогресс не стоит на месте. И повторю, что промтп для написания историй был очень простой - если потратить больше времени на написание промта, результат будет ещё лучше.

Обсуждение на reddit и ycombinator.
🔥105👍1
​​И кто-то утверждает, что GPT-5 недостаточно эмоционален?
🤣20🙈2💊21
​​Новые метрики LLM подъехали
🤣33
Forwarded from AI.Insaf
Интересный обзор архитектур open-source LLM за 2025г The Big LLM Architecture Comparison

Забавно, как каждая из моделей по-своему комбинирует уже известные подходы, придуманные еще в прошлых года, при этом получая разнонаправленное влияние на метрики (Qwen3 почти не отличается по GPT-OSS. Тут детальнее про GPT-OSS). Например:
• Переход от ванильного Multi-Head Attention к Grouped-Query Attention (GQA), который появился ещё в 2023 году
• Attention Bias, который не использовали со времён GPT-2 и Attention Sinks обучаемый параметр для каждого блока внимания, которые применили в gpt-oss, хотя придумали его ещё в 2023 году
• NoPE (No Positional Encoding) — интересная идея, но её пока применили только в одной модели из обзора
• MoE (mixture of experts) - тоже известная больше года история

За деталями рекомендую к статье. Интересно на каких данных и как именно обучали модели. Но этой информацией зачастую делятся очень верхнеуровнево
🔥9👍51
​​DINOv3

Meta выпустила новую версию DINO. DINOv3 — это универсальная self-supervised модель для computer vision, которая показывает высокие результаты без fine-tuning. Она масштабируется на большие датасеты и архитектуры, использует метод Gram anchoring для сохранения качества dense features при длительном обучении и поддерживает гибкость по разрешению, размеру модели и выравниванию с текстом. Модель значительно превосходит предыдущие self- и weakly-supervised подходы и может быть использована для разных задач, включая satellite imaging.

Выглядит годно. Давно не было хороших статей про computer vision.

Paper
Blogpost

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

Мой обзор DINOv2

#paperreview
🔥10
Forwarded from Den4ik Research
Наш русскоязычный датасет для TTS опубликован!

Сегодня выкладываем открытые корпуса на 4000+ часов речи, а еще синтезатор речи ESpeech-TTS-1

Наш датасет содержит больше 4000 часов русской речи. Статистика по корпусам:

Многоголосые:
ESpeech-podcasts - 3200 часов
ESpeech-webinars - 850 часов

Одноголосые:
ESpeech-igm - 220 часов
ESpeech-buldjat - 54 часа
ESpeech-upvote - 296 часов
ESpeech-tuchniyzhab - 306 часов

Данные лежат вот тут: https://huggingface.co/ESpeech

Техрепорт датасета доступен тут: https://github.com/Den4ikAI/ESpeech/blob/main/ESpeech_techreport.pdf


Также, мы решили провести некоторые эксперименты с TTS. Получилось обучить F5-TTS на 10000 часов речи и сделать одну из лучших по нашим замерам моделей в опенсурсе для русского языка.

Какие модели доступны?
ESpeech-TTS-1 [RL] V1 - Первая версия модели с RL
ESpeech-TTS-1 [RL] V2 - Вторая версия модели с RL
ESpeech-TTS-1 PODCASTER [SFT] - Модель обученная только на подкастах, лучше генерирует спонтанную речь
ESpeech-TTS-1 [SFT] 95K - чекпоинт с 95000 шагов (на нем основана RL V1)
ESpeech-TTS-1 [SFT] 265K - чекпоинт с 265000 шагов (на нем основана RL V2)

Лайкайте модель которая больше понравится чтобы мы понимали есть ли смысл запускать RL.

Послушать модели без скачивания можно вот здесь:

https://huggingface.co/spaces/Den4ikAI/ESpeech-TTS

Совместно с @speech_recognition_ru ещё сделали лидерборд русского ТТС, где можно глянуть метрики:

https://huggingface.co/spaces/ESpeech/open_tts_leaderboard_ru
Задать вопросы по поводу данных и модели можно в наших телеграм каналах:
https://t.me/den4ikresearch
https://t.me/voice_stuff_chat

Вы можете мне задонатить, чтобы у меня были ресурсы делать более крутые модели и датасеты:

USDT (TRC20): TEpEM4VVmGmqKHn4Xz1FxM7qZiXjWtUEUB
BTC: bc1qw5lq7fc455e47hggax6zp8txw4ru7yvsxvawv3
https://www.tbank.ru/cf/7WKnNMqWtOx
👍7🔥2💩2
​​AI теперь и на LeetCode

На литкоде появилась новая экспериментальная фича - AI-помощник.

Я попробовал, и что-то это совсем не работает.
При нажатии на кнопку, открывается чат с двумя предложенными вариантами - Generate Idea Map и Generate Code.
При выборе одного из вариантов, помощник долго думает, аж несколько минут. Причём нет никакого UI-элемента, показывающего прогресс.
А потом генерит код. Попробовал использовать код - он не сработал, ибо там переменные сгаллюцинировались.

Как-то иронично, что ai-помощник, разработанный платформой для решения задачек на кодинг, не работает.

#datascience
🤣13👍2
​​Немного о прогрессе

DS/ML раньше: так, чтобы сделать систему для мониторинга товаров в магазине, надо поставить много камер, собрать данные, разметить их, натренировать хорошие модели object detection, возможно делать отдельные модели для разных магазинов...

GPT-5: Hold my beer!
🔥11😁7
https://x.ai/news/grok-code-fast-1
Новый Грок. Шустрый. Без метрик качества.

Окей, уверяют, что 70.8% на SWE-Bench-Verified
😁15🥴1
​​Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO - новый метод для обучения генерации изображений по тексту, в котором делается попарное сравнение картинок, вместо независимого скоронга. Это позволяет избежать reward hacking и улучшает стабильность. Помимо этого авторы публикуют UniGenBench — детальный бенчмарк с 600 промптами и кучей криметриев, использующий MLLM для автоматической генерации и оценки, позволяющий глубже анализировать качество моделей.

Выглядит интересно, похоже работает.

Paper
Project

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
👍4🤔1
​​Чудеса ai
🤣141
🙈3😁2👍1
​​Исследователи FAIR нашли случаи, когда модели на SWE-Bench подсматривают в будущее

Появилось issue в репе SWE-Bench от ресерчеров FAIR. Они заметили, что модельки могут смотреть в будущее состояние репозитория при работе над issue.

Приводят несколько примеров - модели банально запускают команды типа git log -all, получают доступ к коммитам, которые уже исправили issue из бенчмарка, и радостно используют это решение.

#datascience
😁34🔥9
​​Кажется некоторые программисты совсем разленились
🙈9😁8
​​New Kaggle Benchmark: SimpleQA Verified!

https://www.kaggle.com/benchmarks/deepmind/simpleqa-verified

На каггл выложили новый бенчмарк. Google DeepMind и Google Research собрали 1к промптов для тестирования short-form factuality and parametric knowledge. Топ моделей довольно интересен

#datascience #kaggle
🏆3
​​Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing

SAPO — децентрализованный, асинхронный RL post-training для LMs: узлы разнородного “swarm” шэрят rollouts без требований к latency/железу/моделям, могут работать в silo.
За счёт sharing "Aha moments" распространяются по сети и бустят обучение; в контролируемых экспериментах — до +94% cumulative reward.
Опен-демо на тысячах узлов показало практичность подхода; цель — обойти bottlenecks масштабирования и снизить cost по сравнению с централизованным параллелизмом.

Paper
Blogpost
RL Swarm repo

Мои обзоры:
Personal blog
Medium
Linkedin Pulse

#paperreview
🔥1
Колаб, который мы не ждали: Duolingo + LinkedIn

Неожиданно было объявлено, что теперь есть интеграция Duolingo и LinkedIn - можно слинковать аккаунты, и в профиле LinkedIn будет показываться твой уровень знания языков с Duolingo.

Я попробовал... получилось с третьего раза - то одно не работало, то другое. Теперь в профиле красуется, что мой скор немецкого и испанского - 80. Кстати, это баг - в приложении Duolingo мой скор испанского - 115 :)

Дополнительный прикол: раньше (и сейчас) мы могли вручную установить уровень знания языка в LinkedIn. Забавно выглядит, когда этот уровень и duolingo score совсем разные. И после линкования аккаунтов, я не могу редактировать уровень языка на LinkedIn - для этого надо язык удалить и добавить снова.

И это как-то совершенно бессмысленно: для сторонних людей эти баллы совершенно непонятны. Они типа показывают прогресс знания языка, коррелируют с уровнем CEFR. Но если это не знать - совсем непонятно, что они означают. Плюс, разные курсы на Duolingo имеют разное количество контента и, как следствие, разный максимальный уровень.

Возможно это попытка Duolingo найти новую аудиторию. Часть пользователей ушла после того как платформа стала делать уклон в AI и агрессивное продвижение подписок в ущерб бесплатной версии.

Посмотрим, как это будет работать.

#datascience #languages
😁103👍2🤡1🫡1
​​How people are using ChatGPT

OpenAI выложили пост о том, как люди используют ChatGPT. Инфа куцая, детали можно почитать в pdf.

Основные направления - вопросы типа "что делать" (practical guidande), поиск информации и написание текстов. Примерно 30% вопросов не про работу.
Раньше около 80% юзеров составляли мужчины, но теперь эта доля упала аж до 48% - да здравствует гендерное равенство!

Уверяют, что только 4.2% юзеров общаются про кодинг. Думаю, что это объяснимо - большинство кодящих использует api через другие инструменты.

Наконец, сообщают, что только 1.9% сообщений посвящены отношениям и персональным размышлениям, и только 0.4% занимаются ropeplay. Верим?

Ещё один нюанс - анализ данных не включает юзеров, которые в настройках отказались шарить данные. А это может быть большой и интересный сегмент.

#datascience
👍61
Бесплатные книги от Packt

Я уже несколько раз сотрудничал с Packt - они мне присылали беплатные книги в обмен на отзыв, теперь они мне предложили новый формат: они мне присылают ссылки на бесплатные книги или bundle от Packt которые я могу пошарить со всеми. Им польза в новых читателях (и надежде на то, что они когда-нибудь что-нибудь у них купят :) ).

Для начала вот книга Mathematics of Machine Learning, судя по оглавлению хорошо покрывает релевантную теорию. Сам я не читал :)

Из минусов - для получения книги надо подписаться на их рассылку.

#datascience
👍13