Forwarded from UX Notes (Антон Григорьев)
Виктория Гордеева написала о борьбе с сетевыми эффектами при проведении а/б-тестов.
— Сетевой эффект — влияние одного участника эксперимента на другого;
— Например, идёт тест изменения, которое должно повысить количество отправляемых сообщений. Пользователи из экспериментальной группы начинают активнее писать пользователям из контрольной группы, а те отвечают. Метрики меняются в обеих группах, и оценивать результаты а/б-теста становится сложно;
— С этим можно бороться: 1. Сравнивать метрики до и после изменения. Но на показатели могут повлиять внешние факторы вроде погоды;
— 2. Сравнивать разные натуральные кластеры пользователей, образовавшиеся естественным путём, например, людей из разных стран. Но они могут сильно отличаться поведенчески или быть слабо замкнутыми (пользователи из Беларуси и России часто взаимодействуют);
— 3. Сравнивать обычные кластеры. Но разные модели кластеризации дают разные результаты выборок, сценарий тестов нельзя унифицировать и применять всегда, результаты старых и новых тестов будут несопоставимыми;
— 4. Сравнивать эго-кластеры. Кластер формируют эго-вершины и альтер-вершины, которые связаны с эго-вершиной и взаимодействуют с ней;
— Эго-вершина должна подходить под критерии эксперимента;
— Кластер строится на основе графа взаимодействий, например, графа дружб, сообщений и так далее (надо подходить творчески);
— Минусы: не подходит для долгосрочных экспериментов, нужна большая аудитория, не подходит для тестирования изменений, направленных на расширение графа;
— Параметр Ignored vertices degree — отсечение эго-вершин, у которых альтер-вершин больше заданного предела. Такие эго-вершины повышают алгоритмическую нагрузку, плюс их альтер-вершины нельзя включать в другие кластеры.
#user_testing #unmoderated
— Сетевой эффект — влияние одного участника эксперимента на другого;
— Например, идёт тест изменения, которое должно повысить количество отправляемых сообщений. Пользователи из экспериментальной группы начинают активнее писать пользователям из контрольной группы, а те отвечают. Метрики меняются в обеих группах, и оценивать результаты а/б-теста становится сложно;
— С этим можно бороться: 1. Сравнивать метрики до и после изменения. Но на показатели могут повлиять внешние факторы вроде погоды;
— 2. Сравнивать разные натуральные кластеры пользователей, образовавшиеся естественным путём, например, людей из разных стран. Но они могут сильно отличаться поведенчески или быть слабо замкнутыми (пользователи из Беларуси и России часто взаимодействуют);
— 3. Сравнивать обычные кластеры. Но разные модели кластеризации дают разные результаты выборок, сценарий тестов нельзя унифицировать и применять всегда, результаты старых и новых тестов будут несопоставимыми;
— 4. Сравнивать эго-кластеры. Кластер формируют эго-вершины и альтер-вершины, которые связаны с эго-вершиной и взаимодействуют с ней;
— Эго-вершина должна подходить под критерии эксперимента;
— Кластер строится на основе графа взаимодействий, например, графа дружб, сообщений и так далее (надо подходить творчески);
— Минусы: не подходит для долгосрочных экспериментов, нужна большая аудитория, не подходит для тестирования изменений, направленных на расширение графа;
— Параметр Ignored vertices degree — отсечение эго-вершин, у которых альтер-вершин больше заданного предела. Такие эго-вершины повышают алгоритмическую нагрузку, плюс их альтер-вершины нельзя включать в другие кластеры.
#user_testing #unmoderated
Forwarded from Дизайн-снайпер
Блокнот для рисования дизайнера Iancu Barbarasa, рисует где бывает, чем обедает, что видит.
Forwarded from Shock Design
This media is not supported in your browser
VIEW IN TELEGRAM
Spine — программа для создания скелетной 2d анимации. Этот инструмент будет интересен не только инди-разработчикам и начинающим гейм дизайнерам, но также опытным игрокам рынка. Простота в использовании и притягательный дизайн создают впечатление творящегося на экране волшебства.
Наш канал поможет тебе в освоении этой программы. Тут ты найдешь уроки, статьи, вдохновение, советы и лайфхаки для комфортного освоения софта.
Подписывайся - @SpineSoft
Наш канал поможет тебе в освоении этой программы. Тут ты найдешь уроки, статьи, вдохновение, советы и лайфхаки для комфортного освоения софта.
Подписывайся - @SpineSoft
Forwarded from Сиолошная
Так вот, к чему была эта прелюдия. В Reuters пишут, что якобы катализатором увольнения Альтмана стало письмо сотрудников OpenAI совету директоров. В нём говорится о прорыве в исследовании ИИ, которое, «может угрожать человечеству».
Правда, Reuters не смогло ознакомиться с копией письма. А автор(ы) не ответили на запросы о комментариях. Так что особо почвы у теории под ногами нет.
Масла в огонь подливает тот факт, что за сутки до увольнения Sam Altman на оффлайн-саммите сказал следующее:
— Четыре раза за всю историю OpenAI, и последний раз был вот несколько недель назад, я присутствовал в комнате, когда мы как бы отодвигаем завесу невежества и подталкиваем границу открытий вперед. Сделать это — профессиональная честь на всю жизнь.
Что он там такого увидел?
Согласно новости, модель (система?) Q* смогла решить некоторые математические задачи, сообщил источник на условиях анонимности. Это само по себе выглядит странно — ведь даже в примере выше пример куда сложнее, это конец средней школы. И как будто никакого прорыва и нет. Возможно, журналисты всё перепутали — ну или история выдумка.
Теперь о том, как на это смотреть и чего ждать:
1) OpenAI точно занимается разработкой модели, которая будет осуществлять научные исследования. Они про это пишут открыто.
2) Для того, чтобы это произошло, нужно, чтобы модель-учёный умела решать сложные задачи и планировать исследования. Часть этой работы уже сделана — см. статью из поста выше.
3) Вся концепция заключается в том, что модель будет генерировать тысячи неправильных кусочков решений, иногда выдавая верные — главное, чтобы их можно было отранжировать в списке гипотез выше, чем мусорные (вспоминайте модель-оценщика из поста выше).
4) Для этого нужно огромное количество мощностей. Поэтому деньги тут решают. OpenAI пока привлекли больше всех инвестиций, и моё видение такое, что через 2 года это станет большим препятствием для входа. Останется 5-10 игроков, кто готов столько денег сжигать.
5) Вопрос в том, насколько большим будет следующий скачок. Сможет ли модель писать решения на уровне магистра? PhD? Постдока? Доктора наук? Будет ли она ограничена 2-3 доменами, или же обобщится на любую научную область, где есть вычисления?
6) Однажды вы проснётесь, и слух из новости станет правдой: появится модель, которая будет хотя бы частично (>50%) заменять одного учёного в лаборатории. С этих пор прогресс начнёт двигаться гораздо быстрее — потому что нанять 100 учёных за день нельзя, а запустить 100500 моделей на кластере за день — можно.
Более подробно с моим видением дальнейшей стратегии OpenAI и направлениями, в которых они будут копать, вы можете ознакомитсья в моей недавней лекции «What's next for OpenAI?». Там я, конечно, не предсказал шумиху с увольнением CEO, но много говорю про агентов-исследователей и подход OpenAI.
А почитать больше спекуляций по поводу Gemini и Q* можно на LessWrong.
Правда, Reuters не смогло ознакомиться с копией письма. А автор(ы) не ответили на запросы о комментариях. Так что особо почвы у теории под ногами нет.
Масла в огонь подливает тот факт, что за сутки до увольнения Sam Altman на оффлайн-саммите сказал следующее:
— Четыре раза за всю историю OpenAI, и последний раз был вот несколько недель назад, я присутствовал в комнате, когда мы как бы отодвигаем завесу невежества и подталкиваем границу открытий вперед. Сделать это — профессиональная честь на всю жизнь.
Что он там такого увидел?
Согласно новости, модель (система?) Q* смогла решить некоторые математические задачи, сообщил источник на условиях анонимности. Это само по себе выглядит странно — ведь даже в примере выше пример куда сложнее, это конец средней школы. И как будто никакого прорыва и нет. Возможно, журналисты всё перепутали — ну или история выдумка.
Теперь о том, как на это смотреть и чего ждать:
1) OpenAI точно занимается разработкой модели, которая будет осуществлять научные исследования. Они про это пишут открыто.
2) Для того, чтобы это произошло, нужно, чтобы модель-учёный умела решать сложные задачи и планировать исследования. Часть этой работы уже сделана — см. статью из поста выше.
3) Вся концепция заключается в том, что модель будет генерировать тысячи неправильных кусочков решений, иногда выдавая верные — главное, чтобы их можно было отранжировать в списке гипотез выше, чем мусорные (вспоминайте модель-оценщика из поста выше).
4) Для этого нужно огромное количество мощностей. Поэтому деньги тут решают. OpenAI пока привлекли больше всех инвестиций, и моё видение такое, что через 2 года это станет большим препятствием для входа. Останется 5-10 игроков, кто готов столько денег сжигать.
5) Вопрос в том, насколько большим будет следующий скачок. Сможет ли модель писать решения на уровне магистра? PhD? Постдока? Доктора наук? Будет ли она ограничена 2-3 доменами, или же обобщится на любую научную область, где есть вычисления?
6) Однажды вы проснётесь, и слух из новости станет правдой: появится модель, которая будет хотя бы частично (>50%) заменять одного учёного в лаборатории. С этих пор прогресс начнёт двигаться гораздо быстрее — потому что нанять 100 учёных за день нельзя, а запустить 100500 моделей на кластере за день — можно.
Более подробно с моим видением дальнейшей стратегии OpenAI и направлениями, в которых они будут копать, вы можете ознакомитсья в моей недавней лекции «What's next for OpenAI?». Там я, конечно, не предсказал шумиху с увольнением CEO, но много говорю про агентов-исследователей и подход OpenAI.
А почитать больше спекуляций по поводу Gemini и Q* можно на LessWrong.
YouTube
What's next for OpenAI? | SuperAlignment | Igor Kotenkov, Lecture in Russian
Ссылка на презентацию: https://1drv.ms/p/s!AlnN0aqNwShslxRizBwXClLYDHHe
Мой телеграм канал: https://t.me/seeallochnaya
Список всех моих образовательных материалов, статей, лекций итд: https://t.me/seeallochnaya/3
В этом докладе мы разберемся, что такое…
Мой телеграм канал: https://t.me/seeallochnaya
Список всех моих образовательных материалов, статей, лекций итд: https://t.me/seeallochnaya/3
В этом докладе мы разберемся, что такое…