ОТиПЛ МГУ
1.25K subscribers
1.5K photos
30 videos
10 files
318 links
Отделение теоретической и прикладной лингвистики филологического факультета МГУ

Другие соцсети:
https://vk.com/msu_linguistics
https://www.youtube.com/channel/UC9JDd8lNNcNqUoD5d4blf5w
Download Telegram
В этом семестре на нашей кафедре состоялась премьера спецкурса «Скалярность: семантика и типология». Удивительным образом количество преподавателей (а их четверо: С.Г. Татевосов, П.О. Россяйкин, Д.Д. Мордашова и Ю.В. Синицына) совпало с количеством слушателей. Мы спросили последних (следует читать экзостивно), почему они посещают этот курс, и расположили ответы на шкале длительности.

Анастасия Руднева, 3 курс:
Мне очень интересна программа этого спецкурса. Он одновременно рассматривает явления, связанные с Хорновскими шкалами и информативностью высказывания (скалярные частицы и неопределенные местоимения, которыми я увлекаюсь), а также явления, связанные со степенными шкалами (в том числе шкалы расстояния степенных значений в двух моментах времени), для анализа которых необходимо использовать те же представления об информативности / следовании, только в приложении к более разнообразным классам упорядоченных элементов, чем вероятностное / подмножественное упорядочивание. Для меня было открытием, что скалярность помогает объяснять свойства непредельности некоторых перфективов, и вообще каждое занятие заставляет очень много думать и вызывает желание читать много новой литературы – посещать этот спецкурс большая радость для разума!


Юлия Кузнецова, 2 год аспирантуры:
Меня на 3 курсе почему-то поразила история о том, что качественные прилагательные можно рассматривать как шкалы, что эти шкалы еще бывают разными и что язык снабдил нас такими простыми диагностиками определения открытости/закрытости шкалы. Захотелось узнать, что еще в языке можно рассматривать как скалярные явления.


Виктория Борисова, 1 курс магистратуры:
В начале семестра я планировала факультативно посещать два спецкурса, но потом подумала, что три — более красивое число.


Елизавета Дорофеева, 1 курс магистратуры:
Я скучала по формальной семантике.
💘24❤‍🔥107💋5😁3👍1👏1
В этот воскресный день делимся фоторепортажем из солнечного Милана, где 28-30 апреля прошел симпозиум Bilingualism Matters. Наша кафедра была представлена докладами Елизаветы Кропачевой (3 курс бакалавриата) и Инны Рабинович (1 курс магистратуры).
45🔥20❤‍🔥5👏2
В четверг 7 мая в 18:00 в Математическом институте им. В.А. Стеклова РАН (с возможностью подключения онлайн) состоится заседание семинара Некоторые применения математических методов в языкознании, на котором выступит четверокурсница нашей кафедры Аня Шатских. Тема доклада — «Автоматическая морфологическая классификация для осетинского языка».

Аннотация доклада:
Доклад посвящён созданию датасета и нейросетевой модели для автоматической морфологической классификации в осетинском языке. Осетинский язык – иранский язык индоевропейской семьи, распространённый на Северном Кавказе. Этот язык является родным для по меньшей мере 550 тыс. человек и обладает долгой письменной традицией: так, литературный корпус осетинского языка содержит около 12 млн словоупотреблений. Тем не менее, до недавнего времени для осетинского языка не существовало инструментов контекстной морфологической классификации. Эта задача состоит в определении для словоформы её части речи и грамматических признаков (таких как число или падеж) с учётом контекста и является незаменимым уровнем разметки языковых корпусов.

В докладе будет описано создание обучающего корпуса с морфологической аннотацией в системе Universal Dependencies версии 2 (Nivre и др., 2020). Будут рассмотрены вызовы, которые типологические особенности осетинского ставят перед универсальными конвенциями аннотации, и расширения системы UD, принятые в ответ на них. Наконец, будет представлена первая в истории языковая модель архитектуры BERT (Devlin и др., 2019) для осетинского языка и морфологический классификатор на её основе, а также результаты экспериментов, проведённых в ходе создания и улучшения этих моделей.

Литература:
1. Devlin, Jacob и др. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. URL: https://arxiv.org/abs/1810.04805v2
2. Nivre, Joakim и др. (2020). Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection. URL: https://arxiv.org/abs/2004.10643

Адрес: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 104.
Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://docs.google.com/forms/d/e/1FAIpQLSeJZoVLk-YDPfTBpPqe6h5god1i99MPDinD2GToTHv-96hQ9w/viewform
(все зарегистрировавшиеся получат ссылку для онлайн-подключения)
❤‍🔥2316👨‍💻6🔥1💋1
Чем меньше ошибок допускают LLM в повседневной речи, тем больше кажется, что их язык — это наш язык. Так ли это?

В новой статье “Large Language Models and the Argument from the Poverty of the Stimulus” Нур Лан, Эммануэль Шемла и Рони Кацир возвращаются к одному из самых известных споров в теоретической лингвистике — о справедливости аргумента о бедности стимула (the argument from the poverty of the stimulus).

Этот аргумент, связанный прежде всего с работами Ноама Хомского, строится на следующей идее: детям известно об устройстве языка больше, чем они могли бы вывести только из доступного им языкового материала. Отсюда вывод: часть грамматического знания не приобретается через повседневный опыт, а в некоторой форме задаётся врождёнными когнитивными способностями.

Появление больших языковых моделей позволило частично перевести давний спор о том, прав ли Хомский, в плоскость проверяемых фактов и количественных данных. Если нейросети способны освоить сложный синтаксис языка лишь на основе корпуса текстов, аргумент Хомского требует пересмотра.

В статье проверяется именно это предположение. Авторы анализируют, насколько хорошо современные LLM справляются с механизмом передвижения вопросительного слова в английском языке и учитывают ли при этом островные ограничения. Традиционно рассуждения о бедности стимула строятся на таком или похожем материале.

В работе оцениваются показатели нескольких моделей — от LSTM и Transformer (обученных отдельно на данных корпуса детской речи CHILDES и корпуса Wikipedia), до GPT-3 и GPT-j.

Особенно важен здесь масштаб данных. Авторы намеренно переводят объем корпусов в “человеческий эквивалент” языкового опыта. Если ребёнок слышит около 11 миллионов слов в год, CHILDES-модели получают объём примерно в 10 месяцев языкового опыта, Wikipedia-модели — приблизительно 8 лет, а GPT-j — свыше 36 тысяч лет.

Что получилось? LLM выглядят убедительно на простых примерах. Они правильно предсказывают зависимости между wh-элементом и «пропущенной» позицией в предложении. Однако более сложные случаи вроде паразитических пробелов или АТВ-передвижения вызывают у моделей серьёзные затруднения. Здесь предсказания LLM начинают систематически расходиться с интуицией носителей языка.

Авторы отмечают, что качество одной из моделей резко улучшилось, когда в её обучающие данные искусственно добавили больше примеров с wh-передвижением. Это косвенный аргумент в пользу того, что проблема связана не только с архитектурой моделей, но и с принципиальной ограниченностью содержащихся в стимуле данных.

#новоевлингвистике

Источник: Nur Lan, Emmanuel Chemla, Roni Katzir; Large Language Models and the Argument from the Poverty of the Stimulus. Linguistic Inquiry 2026; 57 (2): 315–342. doi: https://doi.org/10.1162/ling_a_00533
28🔥8👏4🤔3🥴1
Продолжаем рассказывать о спецкурсах этого семестра. На очереди «Строй даргинского языка: ширинский диалект» (преподаватель — Олег Игоревич Беляев).

Александра Трофименко, 2 курс:
Я выбрала этот спецкурс, потому что мне интересна типология, а языки Кавказа — до этого не знакомый мне ареал. На ОТиПЛе есть уникальная возможность обсуждать языковое разнообразие языков России с исследователями-полевыми типологами. Многие языки Кавказа мало исследованы, и информацию по ним найти сложно, поэтому Олег Игоревич делится с нами, по сути, уникальными знаниями о ширинском, много рассказывая и о культурно-исторических реалиях. Спецкурс ценен для меня расширением кругозора: как типологического, так и общечеловеческого.


Мария Игнатенко, 3 курс:
В этом семестре мне было трудно определяться со спецкурсами, потому что многое не подходило по расписанию, так что на даргинский я попала почти случайно, но об этом я не жалею ни капли. У нас очень камерный спецкурс, так что каждый успевает высказаться, проверить свои глоссы или что-то спросить. А еще Олег Игоревич — замечательный преподаватель, который с большой любовью и знанием дела все очень подробно рассказывает. К тому же, я давно хотела погрузиться в какой-нибудь типологически сложный язык, чтобы попробовать разбирать сложные тексты со сложной грамматикой и понять, чего я стою) Здесь у меня все отлично получается, так что кавказские языки теперь кажутся не такими страшными.


Сергей Комов, 3 курс:
Этим летом мне, возможно, предстоит экспедиция в Тиндинский язык. Даргинский спецкурс оказался отличной возможностью познакомиться с языками этого ареала. К тому же до этого я уже посещал аналогичные спецкурсы Олега Игоревича по персидскому и осетинскому, и они мне очень понравились и подобранными материалами, и тёплой атмосферой, в которой всегда проходили занятия.


На фото — Олег Игоревич в селе Шири в 2018 году, носители и пейзажи.
🔥38🥰11❤‍🔥75👏1
🙏37🕊264
Дорогие читатели!
Хотим поделиться с вами важной новостью: с этого года у нас будут две новые магистерские программы: «Теоретическая лингвистика» и «Компьютерная лингвистика». Этот пост открывает серию публикаций, в которых мы расскажем о том, что ждет студентов, поступающих в магистратуру отделения. Краткие описания программ уже доступны на нашем сайте.

Говорит С.Г. Татевосов, заведующий кафедрой ТиПЛ:
— Развитие и обновление ОТиПЛа продолжается. Наступил момент, когда стало ясно, что вместо общей магистратуры для теоретических и компьютерных лингвистов, которая была у нас последние 10 лет, надо иметь две более специализированные. Путь науки — это углубление и усложнение, и сейчас для нашего отделения созрели все предпосылки, чтобы сделать следующий шаг на этом пути.
ОТиПЛ меняется. Неизменными остаются общие принципы, на которых всегда строилось наше образование: работать с языком, используя математические и естественнонаучные методы, из которых вырастают строгие лингвистические теории и эффективные современные технологии. Я уверен, что общими усилиями мы добьемся успеха и что те, кто придет к нам учиться, останутся довольны своим выбором.

#магистратуры_отипла
51❤‍🔥23🔥13👨‍💻4👍2😢1💯1
В четверг 14 мая в 18.00 в Институте Языкознания состоится доклад научного сотрудника нашей кафедры К. А. Студеникиной на семинаре «Некоторые применения математических методов в языкознании». Ксения Андреевна расскажет про подходы к повышению безопасности текста, генерируемого большими языковыми моделями. Форма для регистрации — здесь.

Аннотация доклада:
Вместе с ростом возможностей больших языковых моделей возникает серьезная проблема: их ответы могут содержать неэтичный, предвзятый или опасный контент. Обеспечение безопасности генерируемого текста, его соответствие культурным и правовым нормам становится важным условием для использования LLM. В докладе мы рассмотрим несколько способов, которые позволяют предотвратить генерацию вредоносных ответов:
Тонкая настройка с учителем (SFT) и обучение с подкреплением (RLHF) для выравнивания с намерениями человека;
Использование системных промптов для управления поведением модели и их уязвимость к атакам;
Техники машинного забывания для удаления нежелательных знаний без полного переобучения.
В докладе также будут представлены датасеты, используемые для выравнивания и стресс-тестирования моделей на предмет безопасности.
39❤‍🔥22👏5🥰2🔥1🥴1
Для сегодняшнего выпуска рубрики #новоевлингвистике мы попросили нашу выпускницу, ныне студентку магистратуры Мюнхенского Университета Людвига-Максимилиана Варвару Петрову рассказать о статье, посвященной интонации.

Интонация — одна из составляющих просодии наряду с ударением и ритмом речи. Она используется носителями языка для разбиения высказывания на отдельные фразы, подчеркивания определённых прагматически значимых слов внутри этих фраз, разделения данного и нового, а также для многого другого. Интонация и ритм — это компоненты родительской речи, с которыми будущие носители языка сталкиваются ещё до рождения, и современные исследования показывают, что интонационные параметры родного языка родителей определяют паттерны плача у младенцев, которые ещё не умеют говорить.
Одни из самых известных фреймворков для исследования интонации в лингвистике — британская школа и автосегментная метрическая фонология. Британская школа интонации рассматривает интонацию как серию движений ЧОТ: одно такое движение может быть восходящим, нисходящим, восходяще-нисходящим и так далее. Однако то, как именно меняется движение тона, оказывается в тесной связи с длиной высказывания: например, в одной и той же прагматической ситуации восходящая интонация может быть реализована на последнем из пяти слогов высказывания или на двух последних слогах трехсложного слова. Чтобы единообразно анализировать подобные случаи, в автосегментной метрической фонологии постулируются интонационные примитивы, или мишени, внутри одного движения тона (L «низкий» +H* «высокий» вместо «восходящий»). Это позволяет анализировать интонацию как цепочку примитивов — то есть похожим на подход к сегментной фонологии образом.
Статья Амалии Арванити рассматривает развитие автосегментной метрической фонологии на протяжении прошедшей четверти века: преимущества и проблемные вопросы для стандартной автосегментной модели, а также эмпирические свидетельства в ее пользу. Обозреваются основанные на ней традиционные (Tones and Break Indices) и более новые методы аннотации, отражающие перцепцию носителей без специального обучения принципам разметки (Rapid Prosody Transcription), фокусирующиеся на фонетических деталях (International Prosodic Alphabet) или более грубой перцепции аннотаторов (PoLAR (на фото), Rhythm and Pitch). В качестве перспектив развития автосегментной метрической теории Арванити указывает на необходимость обобщения большого числа тональных категорий, между которыми в реальной жизни слушатели не делают различий. Кроме того, в пересмотре нуждаются общие методы и эвристики: в частности, в последние годы было доказано, что, как и сущности сегментной фонологии, интонационные элементы могут иметь несколько коррелятов помимо ЧОТ, которые способны усиливать друг друга или вступать в компенсаторные отношения. Подробнее с работой можно ознакомиться по ссылке.

Amalia Arvaniti, Martine Grice, Mariapaola D’imperio. Advancements of phonetics in the 21st century: Intonation. Journal of Phonetics, 2026, 114, pp.101459.
❤‍🔥31🔥105👍2