Forwarded from По ту сторону слова | НИУ ВШЭ СПб
УЧАСТНИКАМ И СЛУШАТЕЛЯМ
Близится время конференции, в связи с чем мы направляем вам важную информацию!
🌱Место встречи
Наб. канала Грибоедова, 123.
🌱Первый день конференции
— Регистрация: 16 апреля, 9:30 – 10:00
— Открытие и первые пленарные доклады: 10:00 – 12:10
— Начало работы секций: 12:30
🌱Для онлайн дискуссантов, участников, слушателей
В течение конференции будут доступны две ссылки:
1. Постоянная. Распространяется на все доклады, круглый стол и секции за исключением перечисленных ниже.
2. Для параллельных секций. Распространяется на секции:
— «По ту сторону “официального”»
— «По ту сторону языка: компьютерные методы»
— «По ту сторону языка: “классика” и эксперименты»
— «По ту сторону интернета»
— «По ту сторону игр: game studies»
— «По ту сторону социолингвистики»
— «По ту сторону устной речи».
Ссылки будут отправлены всем участникам и слушателям по индивидуальному запросу на почту
🌱Для внешних гостей (посетители не из НИУ ВШЭ)
По ссылке вы сможете зарегистрироваться для получения пропуска.
Дедлайн заполнения — 11 апреля, 23:59
При входе вас могут попросить предъявить паспорт. Пожалуйста, возьмите документ с собой.
Скоро увидимся,
Ваши филологи 💚
Близится время конференции, в связи с чем мы направляем вам важную информацию!
🌱Место встречи
Наб. канала Грибоедова, 123.
🌱Первый день конференции
— Регистрация: 16 апреля, 9:30 – 10:00
— Открытие и первые пленарные доклады: 10:00 – 12:10
— Начало работы секций: 12:30
🌱Для онлайн дискуссантов, участников, слушателей
В течение конференции будут доступны две ссылки:
1. Постоянная. Распространяется на все доклады, круглый стол и секции за исключением перечисленных ниже.
2. Для параллельных секций. Распространяется на секции:
— «По ту сторону “официального”»
— «По ту сторону языка: компьютерные методы»
— «По ту сторону языка: “классика” и эксперименты»
— «По ту сторону интернета»
— «По ту сторону игр: game studies»
— «По ту сторону социолингвистики»
— «По ту сторону устной речи».
Ссылки будут отправлены всем участникам и слушателям по индивидуальному запросу на почту
🌱Для внешних гостей (посетители не из НИУ ВШЭ)
По ссылке вы сможете зарегистрироваться для получения пропуска.
Дедлайн заполнения — 11 апреля, 23:59
При входе вас могут попросить предъявить паспорт. Пожалуйста, возьмите документ с собой.
Скоро увидимся,
Ваши филологи 💚
❤2👍1
Когда мы говорим, что машина «читает» текст, то на самом деле имеем в виду, что она лишь видит последовательность чисел, поэтому любые лишние символы или повторы она воспринимает как значимые сигналы. Если в данных остались, например, артефакты парсинга, модель будет отвлекаться на этот «шум» и не сможет уловить суть текста. Вместо того чтобы понимать смысл слов, она начнет искать закономерности в технических символах, что сильно снизит точность её прогнозов. Если же одинаковые данные встречаются в корпусе тысячи раз, модель не обучится обобщать, а просто запомнит ответы. Поэтому специалисты по компьютерной лингвистике тратят много времени, чтобы сделать данные «чистыми», позволяющими модели действительно понимать язык.
Зачем это нужно?
🔵 Повышение точности: очищенные данные позволяют алгоритмам находить реальные закономерности.
🔵 Экономия ресурсов: меньший объем данных за счет удаления лишнего сокращает время обучения моделей и нагрузку на память.
🔵 Единообразие: общей стандарт важен для корректного сравнения и классификации.
➡️ Для тех, кто хочет глубже погрузиться в тему обработки естественного языка, — подборка материалов в блоге Яндекс.Практикума на Хабр.
#слово_дня #полезное
Обязательные этапы очистки текста:✔️ Очистка данных, нормализация и фильтрация. К этим шагам относятся очистка от HTML-тегов, спецсимволов и приведение всех слов к нижнему регистру и лемматизация. Особое внимание уделяется работе со стоп-словами (например, предлоги «в», «на», союзы «и», «а»).✔️ Дедупликация и деконтаминация. Если одни и те же данные встречаются в корпусе тысячи раз, модель начнет «заучивать» и выдавать их дословно, вместо того, чтобы строить живую речь. Но страшнее другое — контаминация, когда данные для тестирования модели случайно попадают в обучающую выборку. Представьте, что вам попался учебник по математике с ответами в конце. Вы обрадовались, запомнили ответы, сдали экзамен, но не научились решать задачи. Поэтому важно вырезать из обучающих текстов любые совпадения с «экзаменационными» наборами (бенчмарками), чтобы оценка модели была честной, а также удалять дубликаты для обеспечения разнообразия выборки.
Зачем это нужно?
#слово_дня #полезное
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3✍2🔥2
Forwarded from МИФ | Малый Историко-Филологический факультет НИУ ВШЭ СПб
Дорогие друзья,
👾 Приглашаем Вас на последнюю в этом учебном году лекцию Малого Факультета, на которой Вы узнаете, чем филология может быть полезна самым современным разработкам в области искусственного интеллекта!
💎 Прочитает её для Вас Виктория Игоревна Фирсанова — обладательница статуса лучшей преподавательницы НИУ ВШЭ в Санкт-Петербурге за 2024-2025 годы, двухкратная победительница конкурсов фонда Владимира Потанина и разработчица AI-систем для доступной среды.
Вот, что она пишет о предстоящем мероприятии:
🕔 Время: среда, 15 апреля в 19:00.
📍 Место: онлайн-платформа МТС Линк, ссылками на подключение мы будем делиться с Вами в личных сообщениях, поэтому...
📤 Для посещения лекции просим заполнить форму: https://forms.yandex.ru/u/69de3192505690f0abe7844c
Объединяющий не только историков и филологов, но и технарей и гуманитариев,
Ваш МИФ 🧡
👾 Приглашаем Вас на последнюю в этом учебном году лекцию Малого Факультета, на которой Вы узнаете, чем филология может быть полезна самым современным разработкам в области искусственного интеллекта!
💎 Прочитает её для Вас Виктория Игоревна Фирсанова — обладательница статуса лучшей преподавательницы НИУ ВШЭ в Санкт-Петербурге за 2024-2025 годы, двухкратная победительница конкурсов фонда Владимира Потанина и разработчица AI-систем для доступной среды.
Вот, что она пишет о предстоящем мероприятии:
«На лекции мы поговорим о том, почему лингвистика — новое золото. Вы узнаете, почему промпт-инжиниринг — искусство составления инструкций к искусственному интеллекту — не всегда про алгоритмы и программирование, а про фундаментальное языкознание, которое изучают в университете. Формальные грамматики, теория речевых актов, основы когнитивной лингвистики составляют арсенал современного лингвиста — мы поговорим о том, как знания из этих областей науки о языке применяются в разработке мультиагентных систем и даже опробуем пару приёмов на практике».
🕔 Время: среда, 15 апреля в 19:00.
📍 Место: онлайн-платформа МТС Линк, ссылками на подключение мы будем делиться с Вами в личных сообщениях, поэтому...
📤 Для посещения лекции просим заполнить форму: https://forms.yandex.ru/u/69de3192505690f0abe7844c
Объединяющий не только историков и филологов, но и технарей и гуманитариев,
Ваш МИФ 🧡
❤3🕊2🔥1
В магистратуре вам придется собирать Лего😳
Разбираемся, что такое МагоЛего и каким образом вы можете составлять индивидуальную траекторию обучения на программе «Языковые технологии в бизнесе и образовании».
➡️Еще больше подробностей вы найдёте на сайте.
#поступление
Разбираемся, что такое МагоЛего и каким образом вы можете составлять индивидуальную траекторию обучения на программе «Языковые технологии в бизнесе и образовании».
➡️Еще больше подробностей вы найдёте на сайте.
#поступление
❤2🔥2
Лаборатория языковой конвергенции приглашает на круглый стол «Языковые технологии для моделирования данных в междисциплинарных проектах: опыт молодых ученых»
📍Когда? 24 и 25 апреля
📍Где? наб. канала Грибоедова, 123А, ауд. 201 + онлайн
📍Как попасть? Регистрация для слушателей доступна по ссылке.
В обсуждении коллеги планируют охватить широкий круг вопросов, посвященных применению компьютерных методов, в том числе больших языковых моделей, в исследовательских и прикладных проектах.
🖇Подробную программу мероприятия оставили в комментариях к посту.
Изображение: Лаборатория языковой конвергенции
📍Когда? 24 и 25 апреля
📍Где? наб. канала Грибоедова, 123А, ауд. 201 + онлайн
📍Как попасть? Регистрация для слушателей доступна по ссылке.
В обсуждении коллеги планируют охватить широкий круг вопросов, посвященных применению компьютерных методов, в том числе больших языковых моделей, в исследовательских и прикладных проектах.
🖇Подробную программу мероприятия оставили в комментариях к посту.
Изображение: Лаборатория языковой конвергенции
🔥5❤3
Вот бы к каждому тексту существовало краткое содержание…🤗
Каждый день мы сталкиваемся с потоками информации: новости, письма, статьи, отчёты, а всё успеть прочитать невозможно. На помощь приходит суммаризация — функция, позволяющая выделять самое важное и лаконично пересказывать текст, без искажения смысла.
Суммаризация бывает разной. Можно просто вырезать из документа значимые предложения и склеить их — это называется «экстрактивной суммаризацией». При абстрактивной — модель переписывает содержание своими словами, как это сделал бы человек. Второй вариант сложнее, поскольку алгоритму нужно не только выбрать, но и переформулировать, обобщить текст и даже добавить связки между фактами.
Как и в других задачах NLP, здесь всё упирается в данные и архитектуру модели. Современные языковые модели-трансформеры (например, GPT или T5) учатся на тысячах пар «длинный текст — краткий пересказ», чтобы потом самостоятельно справляться с любыми документами.
🔵 Где это применяется? В дайджестах новостей, в аннотациях к научным статьям, при сжатии переписок в мессенджерах или при автопересказе видеороликов на YouTube.
➡️ Чтобы разобраться в методах и подходах глубже, можно начать со статей на Хабре или Hugging Face — там есть готовые модели для суммаризации на русском языке.
#слово_дня #полезное
Каждый день мы сталкиваемся с потоками информации: новости, письма, статьи, отчёты, а всё успеть прочитать невозможно. На помощь приходит суммаризация — функция, позволяющая выделять самое важное и лаконично пересказывать текст, без искажения смысла.
Суммаризация бывает разной. Можно просто вырезать из документа значимые предложения и склеить их — это называется «экстрактивной суммаризацией». При абстрактивной — модель переписывает содержание своими словами, как это сделал бы человек. Второй вариант сложнее, поскольку алгоритму нужно не только выбрать, но и переформулировать, обобщить текст и даже добавить связки между фактами.
Как и в других задачах NLP, здесь всё упирается в данные и архитектуру модели. Современные языковые модели-трансформеры (например, GPT или T5) учатся на тысячах пар «длинный текст — краткий пересказ», чтобы потом самостоятельно справляться с любыми документами.
#слово_дня #полезное
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2❤🔥2🔥2
🚀Приглашаем всех желающих на защиту проектов магистрантов второго курса
📍Когда? 28 апреля в 18:10
📍Где? Онлайн
📍Как попасть? Заполните небольшую форму. На адрес электронной почты, указанный при регистрации, мы отправим вам ссылку для подключения.
Для тех, кто хочет ближе познакомиться с предварительными результатами работы будущих магистров и поддержать их на финальном этапе учёбы💙
#анонс
📍Когда? 28 апреля в 18:10
📍Где? Онлайн
📍Как попасть? Заполните небольшую форму. На адрес электронной почты, указанный при регистрации, мы отправим вам ссылку для подключения.
Для тех, кто хочет ближе познакомиться с предварительными результатами работы будущих магистров и поддержать их на финальном этапе учёбы💙
Если после регистрации вы не получили ответное письмо, пожалуйста, напишите в чат канала или в сообщения нашей группы в ВК.
#анонс
❤2🔥2
Уже составили планы на майские праздники? Если нет, мы подготовили для вас подборку картин Эрмитажа, наполненных настроением приближающегося лета. Праздничные дни — прекрасный повод заглянуть в музей и насладиться искусством!✨
Эти картины, как и многие другие из Цифровой коллекции Эрмитажа, и их описания легли в основу чат-бота «Эрсик», созданного под руководством Лаборатории языковой конвергенции НИУ ВШЭ — Санкт-Петербург и Центра технологий для общества Yandex Cloud. С помощью чат-бота можно находить картины Эрмитажа по текстовому описанию, а также узнавать больше о посещении музея.
Желаем вам ярких майских выходных и приятного отдыха!💙
Эти картины, как и многие другие из Цифровой коллекции Эрмитажа, и их описания легли в основу чат-бота «Эрсик», созданного под руководством Лаборатории языковой конвергенции НИУ ВШЭ — Санкт-Петербург и Центра технологий для общества Yandex Cloud. С помощью чат-бота можно находить картины Эрмитажа по текстовому описанию, а также узнавать больше о посещении музея.
Подробнее о новых возможностях чат-бота читайте на сайте Питерской Вышки.
Желаем вам ярких майских выходных и приятного отдыха!💙
❤5🔥2😎2
🚀Приглашаем всех желающих на защиту проектов магистрантов первого курса
📍Когда? 19 мая в 18:10
📍Где? Онлайн
📍Как попасть? Заполните небольшую форму. На адрес электронной почты, указанный при регистрации, мы отправим вам ссылку для подключения.
Для тех, кто хочет узнать, что создали магистранты за первый год обучения на программе «Языковые технологии в бизнесе и образовании», и поддержать коллег💙
#анонс
📍Когда? 19 мая в 18:10
📍Где? Онлайн
📍Как попасть? Заполните небольшую форму. На адрес электронной почты, указанный при регистрации, мы отправим вам ссылку для подключения.
Для тех, кто хочет узнать, что создали магистранты за первый год обучения на программе «Языковые технологии в бизнесе и образовании», и поддержать коллег💙
Если после регистрации вы не получили ответное письмо, пожалуйста, напишите в чат канала или в сообщения нашей группы в ВК.
#анонс
❤11🐳4
Лингвисты, без которых нашей программы не было бы🧐
Делаем обзор на важных людей в компьютерной лингвистике (англ. — computational linguistics) — области на пересечении языкознания, математики, логики и статистики. Именно здесь ищут ответы на вопросы об обработке естественного языка (NLP), его понимании (NLU) и генерации (NLG).
Так у человечества появились онлайн-переводчики, голосовые помощники и языковые модели — и всё началось с людей, которые однажды решили, что язык можно формализовать.
#лингвистика_в_лицах #полезное
Делаем обзор на важных людей в компьютерной лингвистике (англ. — computational linguistics) — области на пересечении языкознания, математики, логики и статистики. Именно здесь ищут ответы на вопросы об обработке естественного языка (NLP), его понимании (NLU) и генерации (NLG).
Так у человечества появились онлайн-переводчики, голосовые помощники и языковые модели — и всё началось с людей, которые однажды решили, что язык можно формализовать.
#лингвистика_в_лицах #полезное
❤10🤓6🔥4