Теория скипкодинга
108 subscribers
923 photos
1.59K videos
15 files
945 links
Около IT-тематика и early adopter технологии. Личный блог и скабрезные тексты на злобу дня. Конспирологические теории и прочее.
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Нет, это не трейлер к фильму-катастрофе. Это февральское вулканическое извержение в Исландии. Трещина, возникшая в результате этого, протянулась на три километра.

Никаких дополненных реальностей и 3D-рендеринга. И доказательство того, что настоящий мир может быть не менее апокалиптичным и опасным.

P.S: Напомним, что прошлая вулканическая активность вулкана Эйяфьядлайёкюдль в Исландии, в 2010 году, привела к проблемам с авиасообщением над большей частью Западной Европы.

#удивительныймир #skipcoding
🔥4
Нужны ли миру мнемоники?

Конечно же все уже слышали о языковых моделях основанных на нейронных сетях. Для чего они нужны? Если очень грубо, то нейронные сети были созданы для генерации контента в больших количествах. И мы уже сейчас находимся на этапе когда такой контент генерируется очень хорошо и активно эксплуатируется.

Но к сожалению такой контент не всегда является правдой. Иногда это ошибки самого алгоритма, а иногда умышленные инсинуации.

Пример явной ошибки алгоритма. Такой тип ошибок у ИИ называют – галлюцинациями:

Адвокат из США применял ChatGPT при подготовке судебного иска и сослался на несколько судебных прецедентов. Но вот незадача – в реальности таких дел никогда не существовало.


Пример ручного подкручивания:

Искусственный интеллект Google был пойман на переписыванием истории. Викинги, конечно же были чёрными, а папа Римский женщиной. Отцы основатели США и вовсе были представлены рабами, которыми они на самом деле владели.


В этом случае алгоритм стал слишком явно проявлять свою дисфункциональность, что стало слишком очевидным. Скандал быстро замяли, но осадочек остался. Случай далеко не единственный, тот же OpenAI, с одной из самой популярной языковой моделью GPT, давно цензурирует свой контент.

Недавнее исследование университета Восточной Англии показывает, что всего за несколько месяцев, компании OpenAI удалось промыть мозги своему детищу:

Языковая модель теперь активно поддерживает Лейбористскую партию Великобритании, президента Джо Байдена и Демократическую партию США. Ранее за такой явной политической пропагандой чат-бот замечен не был.

продолжение следует...

#skipcoding
👍2
Нужны ли миру мнемоники? (продолжение...)

💎Небольшое поясненение. Мнемоника – совокупность специальных приёмов и способов, облегчающих запоминание нужной информации.

В этом контексте, людей способных быть переносщиками информации, в качестве аллюзии, мы тоже назывём мнемониками. Например, ваш учитель в школе был по отношению к вам мнемоником. Носителем важной информации.

🤖 Проблема сгенерированного контента стоит сейчас очень остро во многих областях. Это и научная деятельность, и история, политика и авторское право и различные дипфейки, которых становится всё больше и больше. А распознавать его всё сложнее и сложнее.

Гиперболизируя ситуацию в долгосрочной перспективе получаем точку сингулярности – момент времени, когда человеческий разум окажется неспособным понять прогресс. А в краткосрочной ситуации – не способность отличить настоящий контент от сгенерированного.

продолжение следует...

#skipcoding
2
Нужны ли миру мнемоники? (продолжение...)

На эту тему у нас с коллегами совсем недавно было несколько конференций с социолого-технологическим уклоном, одна в МГИМО и ещё одна в МГУ.

👽В зависимости от контента разные организации используют различные механизмы распознавания подобной информации. Так например, совсем недавно Европарламент пошел по пути юридических ограничений и одобрил первый в мире закон об искусственном интеллекте. Один из его основных пунктов гласит что:


Необходима обязательная маркировка текстов, аудио-, видео-, фотоматериалов и чат-систем, созданных с помощью таких технологий.


Другой тенденцией по поиску такой информации, в мире IT является:

Путь обучения одних нейронных сетей для распознавания других нейронных сетей (которых в свою очередь пытаются обмануть третьи нейронные сети и т.д.).


Если немного отстраниться, то это всё напоминает замкнутый круг. Если подумать, это приближает нас к сингулярности, а не отдаляет. Ведь это в первую очередь способствует совершенствованию алгоритмов без участия человека.

Но что будет когда количество генерируемого материала станет огромным, его применение повсеместным, а качество станет неотличимым от настоящего? И на сколько мы вообще сейчас близки, или далеки, от той самой сингулярности?! Может быть не в днях, а хотя бы в процентах.

продолжение следует...

#skipcoding
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Нужны ли миру мнемоники? (продолжение... если вам не интересны технические подробности, этот блок можно пропустить) ⚠️

В нашем эксперементе мы будем работать с текстом, как наиболее популярным видом контента. Что бы провести измерение и не играть в технологические догонялки, было четкое понимание, что нужен эталон для сравнения и прозрачный механизм позволяющий это сравнение провести.

В качестве основы взят известный метод поиска нечетких дубликатов. Аналогичные алгоритмы составляют основу классических антиплагиатных и систем поиска “донейросетевой эпохи”.

Кратко опишем основные этапы. В таких системах их несколько:

1. Канонизация текста.
На этом этапе оригинальный текст приводится к единой “нормальной” форме. Текст очищается от предлогов, союзов, знаков препинания, и прочего «мусора», который не должен участвовать в сравнении. Простор для действий тут большой.

2. Разбиение текста на блоки.
Как правило этап нужен из-за ограниченности ресурсов и времени. Но если ресурсов достаточно и нет жесткой привязки к времени вычислений, можно использовать минимальную величину блока – одно слово.

3. Вычисление хэшей.
Принцип алгоритма заключается в сравнении случайной выборки контрольных сумм подпоследовательностей двух текстов между собой. Для каждого блока рассчитывается значения контрольных суммы через разные хэш-функции (например SHA1, MD5, CRC32 и т.д.).

4. Выборка значений контрольных сумм.
На этом этапе как правило беруться случайные блоки. В нашем случае выборка была полной, это исключало какие-то либо погрешности.

5. И сравнение и определение результата.
Этот этап сравнивает два массива – эталонный и преобразованный. И считает отношение одинаковых значений контрольных сумм в этих массивах по отношению к друг другу.

🚧 Для удобства сервис был оформлен как закрытый телеграмм-бот, к которому могли подключиться участники эксперимента. Сервис производил синтаксическое сравнение текстов с оригиналом и вычислял процентное соотношение схожих синтаксических конструкций.

продолжение следует...

#skipcoding
2
Нужны ли миру мнемоники? (продолжение... Описание эксперимента)

Алгоритм эксперемента был следующий:

1. Выбрано 10 тем (Биология, Экономика, Физика и пр.).

2. По каждой из тем были сгенерированы 100 актуальных современных вопросов. То есть которые для не погруженного в детали человека выглядят почти бессмысленными. Но и у нейросети ограничена возможность к обучению, так как материала по этим вопросам очень мало.

3. Участники эксперимента выбирали тему и могли добавлять тексты и проделывать некоторые другие технические операции (не влияющие на эксперемент), через телеграм-бот.

4. Исходные тексты для дальнейшего рерайтинга могли быть добавлены как созданные человеком, так и автоматизированно с использованием нейронных сетей.

5. Вопросы и ответы предлагались на русском языке.

6. Далее каждый из текстов подвергался перефразированию и переформулировке – человеком или нейронной сетью.

7. В случае когда испытуемый самостоятельно добавлял перефразированный текст, он мог выбрать один из нескольких вариантов.

8. А именно, использовать нейронную сеть для перефразирования или проделать операцию перефразирования самостоятельно от лица человека.

9. Далее материал тегировался, попадал в базу данных и производил сравнение с исходным контентом.

продолжение следует...

#skipcoding
1👍1
Нужны ли миру мнемоники? (продолжение... Итоги эксперимента)

Детализацию эксперимента можно увидеть на изображениях выше. Итого, если посмотреть по нейронным сетям без привязки к ручному рерайтингу человеком. Наилучший результат, а значит меньший процент совпадений, выявлен у YandexGPT. Если брать медиану, Claude показывает чуть лучшие результаты.

И наконец, ручной рерайтинг. Мы выбрали пять дисциплин, как наиболее понятных, гибких и соответствующих занятиям контрольной группы.

Филология:
30.81 против лучшего результата 39.33

Социология:
19.85% против 44.33%

Экономика:
30.95% против 49.81%

Философия:
17.3% против 39.33%

История:
19.90% против 49.29%

По итогам финального этапа эксперимента мы видим, что ручное перефразирование, выполненное участниками эксперемента продемонстрировало более эффективную возможность обхода верификации, а значит понимание темы. Где среднее значение распознания практически в 2 раза ниже, чем обеспечивают автоматизированные модели с учетом опыта работы в академической среде.

Стоит однако уточнить несколько моментов:

1. Вопрос/промт к языковым моделям не содержал сложных уточнений. А контрольная группа была погружена в семантику вопросов. Это означает повышенную вариативность ответов в ручном рерайтинге.

2. Однако вопросы вне области знаний контрольной группы, хоть и не были частью исследования, фактически приводили к обратным результатам.

То есть человек по умолчанию, пока ещё, лучше занимается созданием/преобразованием контента, но только в том случае если разбирается в теме вопроса.

Сделаю смелое предположения из-за наличия когнитивных способностей, которых "машина" конечно же лишена. То есть человек может применять знания, делать гипотезы, которые напрямую могут и не относится к вопросу на прямую.

продолжение следует...


#skipcoding
1
Благодарственные красивые видео для тех кто смог осилить статью до конца и что бы понимать масштаб происходящих событий.

Это примеры сгенерированных видеофайлов нейросети SORA, от компании OpenAI. И да, все эти видео сгенерированы по простым текстовым запросам. Практически неотличимы от настоящих.

#skipcoding
🔥2
Нужны ли миру мнемоники? (продолжение... Эпилог)

Подходя глобально, к проблеме контент-верификации сгенерированного контента, стоит понимать, что на данный момент это "проблема щита и меча".

Нет универсального и прозрачного технического механизма, который полностью бы позволял определять степень сгенерированности того или иного текста без наличия эталона для сравнения.

Нет баз данных, что бы производить такое сравнение и единственым носителем информации в такой ситуации по прежнему являются люди.

И если сейчас, многим в индустрии, видится такой подход как – маркировка контента сгенерированного через ИИ. Что бы понимать – "да этот контент создан через ИИ".

В недалёком будущем, неравен час, когда маркировать придётся контент созданный человеком. Просто потому что его будет намного меньше в сравнении с контентом сгенерированным через ИИ.

А людей владеющими нужной информацией будут называть мнемониками.

#skipcoding
🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
Доброе утро, котятки

Хотели вам показать одно завораживающее место. Плато Путорана на северо-западе Красноярского края.

Если бы кто-то взялся у нас снимать фильм про выживание космонавта на отдалённой планете, мы бы настойчиво рекомендовали проводить съёмки именно там.

Никаких 3D-реальностей и GPT-чатов. Абсолютно завораживающая базальтовая красота.

#skipcoding #удивительныймир
🔥7
This media is not supported in your browser
VIEW IN TELEGRAM
Почему ещё не во всех бильярдных есть такой проектор?! Это же золотая жила.

#skipcoding
🔥2
Теория скипкодинга
Почему ещё не во всех бильярдных есть такой проектор?! Это же золотая жила. #skipcoding
В личке нас спрашивают, почему "Золотая жила"?

Ну, вот посмотрите. Даже на примере фитнес-клуба. Почти 70%, две трети от общего числа клиентов, никогда не появляются больше на их пороге. Это начинашки.

Что бы как-то их мотивировать не бросать тренировки, нужны тренеры. С бильярдными дело ещё сложнее. Как правило тренеров очень мало. Да и вид спорта больше командный. То есть, не будут 2-3 человека стоять и смотреть как тренер за них шары в лузу катает.

А в случае интерактивного помощника решается сразу несколько проблем. Игра станет более интересной, будет подстегивать новичков к тренировкам и решит проблему тренеров.

#skipcoding
💯1