Теория скипкодинга
108 subscribers
923 photos
1.59K videos
15 files
945 links
Около IT-тематика и early adopter технологии. Личный блог и скабрезные тексты на злобу дня. Конспирологические теории и прочее.
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Продай мне ручку.

Не будет секретом, если сказать что люди пишут тексты от руки всё меньше и меньше. Самые интеллектуальные из нас пока могут ещё делать пометки в бумажном блокноте, увы таких становится всё меньше и меньше. Электронный мир вытесняет бумажный. Естественно это напрямую сказывается на производителях пишущих товаров – ручки, карандаши, фломастеры и пр.

Так например производитель перьевых ручек Von Moos встроил в ручку чип для бесконтактной оплаты. Так сказать, решил вскочить на последнюю подножку уходящего состава. Главный вопрос: "а зачем?".

Визуально (но не по содержанию) интересный концепт был на Kickstarter, назывался Phree (гифка в заголовке). Устройство Phree позволяло писать на любой поверхности, автоматически передавая текст на смартфон. Ручка имела некоторые интеграции с приложениями и могла писать сразу в них: Office, OneNote, EverNote, Acrobat, Google Handwriting Keyboard, Viber.

К сожалению, это всё больше выглядит как забавный анахронизм. Но если например сделать из ручки новый форм-фактор "умного устройства" со встроенным ассистентом – звонки, органайзер и небольшой проектор для трансляции на поверхность?! По сути это начинка от умных часов, только расположенная вертикально. Вот на это было бы интересно взглянуть.

#skipcoding
This media is not supported in your browser
VIEW IN TELEGRAM
Ну вот, дождались. Китайцы придумали шагаходов. Пока в уменьшенной версии. Ждем полноразмерную серию и десант на Татуин.

#skipcoding #странныероботы
В этот трагический для нашей страны день, развлекательных постов не будет.

Нанеся подлый террористический удар против мирных граждан, враг не понял самого главного, невзгоды и трудности только ещё больше сплотят нас. Как это было в жизни нашей страны уже не один раз.

Мы запомним всё, мы не простим никого, мы заберём всё что наше по праву. Враг будет разбит, победа будет за нами.
13
This media is not supported in your browser
VIEW IN TELEGRAM
Нет, это не трейлер к фильму-катастрофе. Это февральское вулканическое извержение в Исландии. Трещина, возникшая в результате этого, протянулась на три километра.

Никаких дополненных реальностей и 3D-рендеринга. И доказательство того, что настоящий мир может быть не менее апокалиптичным и опасным.

P.S: Напомним, что прошлая вулканическая активность вулкана Эйяфьядлайёкюдль в Исландии, в 2010 году, привела к проблемам с авиасообщением над большей частью Западной Европы.

#удивительныймир #skipcoding
🔥4
Нужны ли миру мнемоники?

Конечно же все уже слышали о языковых моделях основанных на нейронных сетях. Для чего они нужны? Если очень грубо, то нейронные сети были созданы для генерации контента в больших количествах. И мы уже сейчас находимся на этапе когда такой контент генерируется очень хорошо и активно эксплуатируется.

Но к сожалению такой контент не всегда является правдой. Иногда это ошибки самого алгоритма, а иногда умышленные инсинуации.

Пример явной ошибки алгоритма. Такой тип ошибок у ИИ называют – галлюцинациями:

Адвокат из США применял ChatGPT при подготовке судебного иска и сослался на несколько судебных прецедентов. Но вот незадача – в реальности таких дел никогда не существовало.


Пример ручного подкручивания:

Искусственный интеллект Google был пойман на переписыванием истории. Викинги, конечно же были чёрными, а папа Римский женщиной. Отцы основатели США и вовсе были представлены рабами, которыми они на самом деле владели.


В этом случае алгоритм стал слишком явно проявлять свою дисфункциональность, что стало слишком очевидным. Скандал быстро замяли, но осадочек остался. Случай далеко не единственный, тот же OpenAI, с одной из самой популярной языковой моделью GPT, давно цензурирует свой контент.

Недавнее исследование университета Восточной Англии показывает, что всего за несколько месяцев, компании OpenAI удалось промыть мозги своему детищу:

Языковая модель теперь активно поддерживает Лейбористскую партию Великобритании, президента Джо Байдена и Демократическую партию США. Ранее за такой явной политической пропагандой чат-бот замечен не был.

продолжение следует...

#skipcoding
👍2
Нужны ли миру мнемоники? (продолжение...)

💎Небольшое поясненение. Мнемоника – совокупность специальных приёмов и способов, облегчающих запоминание нужной информации.

В этом контексте, людей способных быть переносщиками информации, в качестве аллюзии, мы тоже назывём мнемониками. Например, ваш учитель в школе был по отношению к вам мнемоником. Носителем важной информации.

🤖 Проблема сгенерированного контента стоит сейчас очень остро во многих областях. Это и научная деятельность, и история, политика и авторское право и различные дипфейки, которых становится всё больше и больше. А распознавать его всё сложнее и сложнее.

Гиперболизируя ситуацию в долгосрочной перспективе получаем точку сингулярности – момент времени, когда человеческий разум окажется неспособным понять прогресс. А в краткосрочной ситуации – не способность отличить настоящий контент от сгенерированного.

продолжение следует...

#skipcoding
2
Нужны ли миру мнемоники? (продолжение...)

На эту тему у нас с коллегами совсем недавно было несколько конференций с социолого-технологическим уклоном, одна в МГИМО и ещё одна в МГУ.

👽В зависимости от контента разные организации используют различные механизмы распознавания подобной информации. Так например, совсем недавно Европарламент пошел по пути юридических ограничений и одобрил первый в мире закон об искусственном интеллекте. Один из его основных пунктов гласит что:


Необходима обязательная маркировка текстов, аудио-, видео-, фотоматериалов и чат-систем, созданных с помощью таких технологий.


Другой тенденцией по поиску такой информации, в мире IT является:

Путь обучения одних нейронных сетей для распознавания других нейронных сетей (которых в свою очередь пытаются обмануть третьи нейронные сети и т.д.).


Если немного отстраниться, то это всё напоминает замкнутый круг. Если подумать, это приближает нас к сингулярности, а не отдаляет. Ведь это в первую очередь способствует совершенствованию алгоритмов без участия человека.

Но что будет когда количество генерируемого материала станет огромным, его применение повсеместным, а качество станет неотличимым от настоящего? И на сколько мы вообще сейчас близки, или далеки, от той самой сингулярности?! Может быть не в днях, а хотя бы в процентах.

продолжение следует...

#skipcoding
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Нужны ли миру мнемоники? (продолжение... если вам не интересны технические подробности, этот блок можно пропустить) ⚠️

В нашем эксперементе мы будем работать с текстом, как наиболее популярным видом контента. Что бы провести измерение и не играть в технологические догонялки, было четкое понимание, что нужен эталон для сравнения и прозрачный механизм позволяющий это сравнение провести.

В качестве основы взят известный метод поиска нечетких дубликатов. Аналогичные алгоритмы составляют основу классических антиплагиатных и систем поиска “донейросетевой эпохи”.

Кратко опишем основные этапы. В таких системах их несколько:

1. Канонизация текста.
На этом этапе оригинальный текст приводится к единой “нормальной” форме. Текст очищается от предлогов, союзов, знаков препинания, и прочего «мусора», который не должен участвовать в сравнении. Простор для действий тут большой.

2. Разбиение текста на блоки.
Как правило этап нужен из-за ограниченности ресурсов и времени. Но если ресурсов достаточно и нет жесткой привязки к времени вычислений, можно использовать минимальную величину блока – одно слово.

3. Вычисление хэшей.
Принцип алгоритма заключается в сравнении случайной выборки контрольных сумм подпоследовательностей двух текстов между собой. Для каждого блока рассчитывается значения контрольных суммы через разные хэш-функции (например SHA1, MD5, CRC32 и т.д.).

4. Выборка значений контрольных сумм.
На этом этапе как правило беруться случайные блоки. В нашем случае выборка была полной, это исключало какие-то либо погрешности.

5. И сравнение и определение результата.
Этот этап сравнивает два массива – эталонный и преобразованный. И считает отношение одинаковых значений контрольных сумм в этих массивах по отношению к друг другу.

🚧 Для удобства сервис был оформлен как закрытый телеграмм-бот, к которому могли подключиться участники эксперимента. Сервис производил синтаксическое сравнение текстов с оригиналом и вычислял процентное соотношение схожих синтаксических конструкций.

продолжение следует...

#skipcoding
2
Нужны ли миру мнемоники? (продолжение... Описание эксперимента)

Алгоритм эксперемента был следующий:

1. Выбрано 10 тем (Биология, Экономика, Физика и пр.).

2. По каждой из тем были сгенерированы 100 актуальных современных вопросов. То есть которые для не погруженного в детали человека выглядят почти бессмысленными. Но и у нейросети ограничена возможность к обучению, так как материала по этим вопросам очень мало.

3. Участники эксперимента выбирали тему и могли добавлять тексты и проделывать некоторые другие технические операции (не влияющие на эксперемент), через телеграм-бот.

4. Исходные тексты для дальнейшего рерайтинга могли быть добавлены как созданные человеком, так и автоматизированно с использованием нейронных сетей.

5. Вопросы и ответы предлагались на русском языке.

6. Далее каждый из текстов подвергался перефразированию и переформулировке – человеком или нейронной сетью.

7. В случае когда испытуемый самостоятельно добавлял перефразированный текст, он мог выбрать один из нескольких вариантов.

8. А именно, использовать нейронную сеть для перефразирования или проделать операцию перефразирования самостоятельно от лица человека.

9. Далее материал тегировался, попадал в базу данных и производил сравнение с исходным контентом.

продолжение следует...

#skipcoding
1👍1
Нужны ли миру мнемоники? (продолжение... Итоги эксперимента)

Детализацию эксперимента можно увидеть на изображениях выше. Итого, если посмотреть по нейронным сетям без привязки к ручному рерайтингу человеком. Наилучший результат, а значит меньший процент совпадений, выявлен у YandexGPT. Если брать медиану, Claude показывает чуть лучшие результаты.

И наконец, ручной рерайтинг. Мы выбрали пять дисциплин, как наиболее понятных, гибких и соответствующих занятиям контрольной группы.

Филология:
30.81 против лучшего результата 39.33

Социология:
19.85% против 44.33%

Экономика:
30.95% против 49.81%

Философия:
17.3% против 39.33%

История:
19.90% против 49.29%

По итогам финального этапа эксперимента мы видим, что ручное перефразирование, выполненное участниками эксперемента продемонстрировало более эффективную возможность обхода верификации, а значит понимание темы. Где среднее значение распознания практически в 2 раза ниже, чем обеспечивают автоматизированные модели с учетом опыта работы в академической среде.

Стоит однако уточнить несколько моментов:

1. Вопрос/промт к языковым моделям не содержал сложных уточнений. А контрольная группа была погружена в семантику вопросов. Это означает повышенную вариативность ответов в ручном рерайтинге.

2. Однако вопросы вне области знаний контрольной группы, хоть и не были частью исследования, фактически приводили к обратным результатам.

То есть человек по умолчанию, пока ещё, лучше занимается созданием/преобразованием контента, но только в том случае если разбирается в теме вопроса.

Сделаю смелое предположения из-за наличия когнитивных способностей, которых "машина" конечно же лишена. То есть человек может применять знания, делать гипотезы, которые напрямую могут и не относится к вопросу на прямую.

продолжение следует...


#skipcoding
1
Благодарственные красивые видео для тех кто смог осилить статью до конца и что бы понимать масштаб происходящих событий.

Это примеры сгенерированных видеофайлов нейросети SORA, от компании OpenAI. И да, все эти видео сгенерированы по простым текстовым запросам. Практически неотличимы от настоящих.

#skipcoding
🔥2
Нужны ли миру мнемоники? (продолжение... Эпилог)

Подходя глобально, к проблеме контент-верификации сгенерированного контента, стоит понимать, что на данный момент это "проблема щита и меча".

Нет универсального и прозрачного технического механизма, который полностью бы позволял определять степень сгенерированности того или иного текста без наличия эталона для сравнения.

Нет баз данных, что бы производить такое сравнение и единственым носителем информации в такой ситуации по прежнему являются люди.

И если сейчас, многим в индустрии, видится такой подход как – маркировка контента сгенерированного через ИИ. Что бы понимать – "да этот контент создан через ИИ".

В недалёком будущем, неравен час, когда маркировать придётся контент созданный человеком. Просто потому что его будет намного меньше в сравнении с контентом сгенерированным через ИИ.

А людей владеющими нужной информацией будут называть мнемониками.

#skipcoding
🔥2