ОТиПЛ МГУ
1.25K subscribers
1.5K photos
30 videos
10 files
318 links
Отделение теоретической и прикладной лингвистики филологического факультета МГУ

Другие соцсети:
https://vk.com/msu_linguistics
https://www.youtube.com/channel/UC9JDd8lNNcNqUoD5d4blf5w
Download Telegram
В прошлое воскресенье состоялся финал XVIII Межфакультетского кубка по «Что? Где? Когда?». Филологический факультет выиграл студенческий командный зачет — это значит, что филфаковские команды, состоящие только из студентов бакалавриата и магистратуры, суммарно ответили на большее число вопросов, чем студенческие команды других факультетов. С гордостью заметим, что из четырех студенческих команд филфака две состояли из студентов ОТиПЛа на 100% («Не шиком лыты» с 1 курса бакалавриата и «Будущего нет!» из магистратуры), а одна — на 83% («Войско Тимура», 4 курс)!
🔥34❤‍🔥2315👏2🐳1🏆1🦄1
24 и 25 апреля в Институте языкознания РАН проходила VIII конференция «Малые языки в большой лингвистике».

ОТиПЛ выставил 14 докладов —  от компаративно-коррелятивных конструкций в татышлинском удмуртском через эвиденциальность в северномансийском к исследованию сине-голубого континуума у кумыкско-русских билингвов.

Благодарим докладчиков за интересные выступления, конструктивные дискуссии и новую пищу для размышлений!
45🏆12
Сегодня в #новоевлингвистике — статья Лауры Макферсон и Эндрю Ламонта о тоновой системе новогвинейского языка поко. Каждая словоформа в этом языке помимо сегментного состава имеет связанную комбинацию из трёх тонов — низкого, среднего и высокого. Такая комбинация называется «мелодией», и на лексическом уровне они являются словоразличительными: так, ùwū (низкий-средний) означает ‘гнездо’, а ùwú (низкий-высокий) — ‘шея’. Большая часть работы Макферсон и Ламонта посвящена взаимодействию мелодий на постлексическом уровне при соположении словоформ.

Как отмечают авторы статьи, по сравнению с работами, посвящённым языкам Африки, Азии и Америки, тоновые системы языков Новой Гвинеи освещаются в тонологической литературе не так часто. Некоторые явления в поко действительно типологически необычны. Так, в тоновых системах часто действует принцип обязательного контура (obligatory contour principle, или OCP): не допускается соположение двух одинаковых тонов. В поко на лексическом уровне этот принцип соблюдается максимально строго: нет простых низкой /L/ и высокой /H/ мелодий, а все сложные мелодии являются строго возрастающими (MH, LM, LH). При подобных ограничениях получить нарушение OCP для низкого или высокого тона невозможно. При этом во многих тоновых языках высокий тон считается более маркированным, чем низкий, в связи с чем последний часто трактуется как отсутствие тона в принципе. Однако в поко все три тона фонологически активны, а низкий тон более маркирован: на постлексическом уровне он сохраняется чаще, чем высокий.

Макферсон и Ламонт предлагают формализацию описываемых явлений в теории оптимальности — фонологической модели, согласно которой возможные словоформы («кандидаты») оцениваются на соответствие различным ограничениям. В контексте тонологии поко одним из таких ограничений является, например, запрет на соположение двух низких тонов, или OCP(L). Кандидат, нарушающий наименьшее количество ограничений, называется «гармоническим». При этом авторы стараются показать, что с анализом поко справляется не любая модель в рамках теории оптимальности, а обладающая определёнными свойствами: возможные изменения кандидатов оцениваются последовательно, а не одновременно (сериальность), при этом имеет значение, в каком фрагменте словоформы происходит нарушение того или иного ограничения (направленность).

Детали формализации оставляем на ознакомление читателю, однако ознакамливаться с ними советуем гармонично и сериально.

McPherson L, Lamont A. Poko postlexical tone requires serial, directional evaluation. Phonology. 2026;43:e1. doi:10.1017/S0952675726100268
❤‍🔥297🤔3
В этом семестре на нашей кафедре состоялась премьера спецкурса «Скалярность: семантика и типология». Удивительным образом количество преподавателей (а их четверо: С.Г. Татевосов, П.О. Россяйкин, Д.Д. Мордашова и Ю.В. Синицына) совпало с количеством слушателей. Мы спросили последних (следует читать экзостивно), почему они посещают этот курс, и расположили ответы на шкале длительности.

Анастасия Руднева, 3 курс:
Мне очень интересна программа этого спецкурса. Он одновременно рассматривает явления, связанные с Хорновскими шкалами и информативностью высказывания (скалярные частицы и неопределенные местоимения, которыми я увлекаюсь), а также явления, связанные со степенными шкалами (в том числе шкалы расстояния степенных значений в двух моментах времени), для анализа которых необходимо использовать те же представления об информативности / следовании, только в приложении к более разнообразным классам упорядоченных элементов, чем вероятностное / подмножественное упорядочивание. Для меня было открытием, что скалярность помогает объяснять свойства непредельности некоторых перфективов, и вообще каждое занятие заставляет очень много думать и вызывает желание читать много новой литературы – посещать этот спецкурс большая радость для разума!


Юлия Кузнецова, 2 год аспирантуры:
Меня на 3 курсе почему-то поразила история о том, что качественные прилагательные можно рассматривать как шкалы, что эти шкалы еще бывают разными и что язык снабдил нас такими простыми диагностиками определения открытости/закрытости шкалы. Захотелось узнать, что еще в языке можно рассматривать как скалярные явления.


Виктория Борисова, 1 курс магистратуры:
В начале семестра я планировала факультативно посещать два спецкурса, но потом подумала, что три — более красивое число.


Елизавета Дорофеева, 1 курс магистратуры:
Я скучала по формальной семантике.
💘24❤‍🔥107💋5😁3👍1👏1
В этот воскресный день делимся фоторепортажем из солнечного Милана, где 28-30 апреля прошел симпозиум Bilingualism Matters. Наша кафедра была представлена докладами Елизаветы Кропачевой (3 курс бакалавриата) и Инны Рабинович (1 курс магистратуры).
45🔥20❤‍🔥5👏2
В четверг 7 мая в 18:00 в Математическом институте им. В.А. Стеклова РАН (с возможностью подключения онлайн) состоится заседание семинара Некоторые применения математических методов в языкознании, на котором выступит четверокурсница нашей кафедры Аня Шатских. Тема доклада — «Автоматическая морфологическая классификация для осетинского языка».

Аннотация доклада:
Доклад посвящён созданию датасета и нейросетевой модели для автоматической морфологической классификации в осетинском языке. Осетинский язык – иранский язык индоевропейской семьи, распространённый на Северном Кавказе. Этот язык является родным для по меньшей мере 550 тыс. человек и обладает долгой письменной традицией: так, литературный корпус осетинского языка содержит около 12 млн словоупотреблений. Тем не менее, до недавнего времени для осетинского языка не существовало инструментов контекстной морфологической классификации. Эта задача состоит в определении для словоформы её части речи и грамматических признаков (таких как число или падеж) с учётом контекста и является незаменимым уровнем разметки языковых корпусов.

В докладе будет описано создание обучающего корпуса с морфологической аннотацией в системе Universal Dependencies версии 2 (Nivre и др., 2020). Будут рассмотрены вызовы, которые типологические особенности осетинского ставят перед универсальными конвенциями аннотации, и расширения системы UD, принятые в ответ на них. Наконец, будет представлена первая в истории языковая модель архитектуры BERT (Devlin и др., 2019) для осетинского языка и морфологический классификатор на её основе, а также результаты экспериментов, проведённых в ходе создания и улучшения этих моделей.

Литература:
1. Devlin, Jacob и др. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. URL: https://arxiv.org/abs/1810.04805v2
2. Nivre, Joakim и др. (2020). Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection. URL: https://arxiv.org/abs/2004.10643

Адрес: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 104.
Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://docs.google.com/forms/d/e/1FAIpQLSeJZoVLk-YDPfTBpPqe6h5god1i99MPDinD2GToTHv-96hQ9w/viewform
(все зарегистрировавшиеся получат ссылку для онлайн-подключения)
❤‍🔥2316👨‍💻6🔥1💋1
Чем меньше ошибок допускают LLM в повседневной речи, тем больше кажется, что их язык — это наш язык. Так ли это?

В новой статье “Large Language Models and the Argument from the Poverty of the Stimulus” Нур Лан, Эммануэль Шемла и Рони Кацир возвращаются к одному из самых известных споров в теоретической лингвистике — о справедливости аргумента о бедности стимула (the argument from the poverty of the stimulus).

Этот аргумент, связанный прежде всего с работами Ноама Хомского, строится на следующей идее: детям известно об устройстве языка больше, чем они могли бы вывести только из доступного им языкового материала. Отсюда вывод: часть грамматического знания не приобретается через повседневный опыт, а в некоторой форме задаётся врождёнными когнитивными способностями.

Появление больших языковых моделей позволило частично перевести давний спор о том, прав ли Хомский, в плоскость проверяемых фактов и количественных данных. Если нейросети способны освоить сложный синтаксис языка лишь на основе корпуса текстов, аргумент Хомского требует пересмотра.

В статье проверяется именно это предположение. Авторы анализируют, насколько хорошо современные LLM справляются с механизмом передвижения вопросительного слова в английском языке и учитывают ли при этом островные ограничения. Традиционно рассуждения о бедности стимула строятся на таком или похожем материале.

В работе оцениваются показатели нескольких моделей — от LSTM и Transformer (обученных отдельно на данных корпуса детской речи CHILDES и корпуса Wikipedia), до GPT-3 и GPT-j.

Особенно важен здесь масштаб данных. Авторы намеренно переводят объем корпусов в “человеческий эквивалент” языкового опыта. Если ребёнок слышит около 11 миллионов слов в год, CHILDES-модели получают объём примерно в 10 месяцев языкового опыта, Wikipedia-модели — приблизительно 8 лет, а GPT-j — свыше 36 тысяч лет.

Что получилось? LLM выглядят убедительно на простых примерах. Они правильно предсказывают зависимости между wh-элементом и «пропущенной» позицией в предложении. Однако более сложные случаи вроде паразитических пробелов или АТВ-передвижения вызывают у моделей серьёзные затруднения. Здесь предсказания LLM начинают систематически расходиться с интуицией носителей языка.

Авторы отмечают, что качество одной из моделей резко улучшилось, когда в её обучающие данные искусственно добавили больше примеров с wh-передвижением. Это косвенный аргумент в пользу того, что проблема связана не только с архитектурой моделей, но и с принципиальной ограниченностью содержащихся в стимуле данных.

#новоевлингвистике

Источник: Nur Lan, Emmanuel Chemla, Roni Katzir; Large Language Models and the Argument from the Poverty of the Stimulus. Linguistic Inquiry 2026; 57 (2): 315–342. doi: https://doi.org/10.1162/ling_a_00533
28🔥8👏4🤔3🥴1
Продолжаем рассказывать о спецкурсах этого семестра. На очереди «Строй даргинского языка: ширинский диалект» (преподаватель — Олег Игоревич Беляев).

Александра Трофименко, 2 курс:
Я выбрала этот спецкурс, потому что мне интересна типология, а языки Кавказа — до этого не знакомый мне ареал. На ОТиПЛе есть уникальная возможность обсуждать языковое разнообразие языков России с исследователями-полевыми типологами. Многие языки Кавказа мало исследованы, и информацию по ним найти сложно, поэтому Олег Игоревич делится с нами, по сути, уникальными знаниями о ширинском, много рассказывая и о культурно-исторических реалиях. Спецкурс ценен для меня расширением кругозора: как типологического, так и общечеловеческого.


Мария Игнатенко, 3 курс:
В этом семестре мне было трудно определяться со спецкурсами, потому что многое не подходило по расписанию, так что на даргинский я попала почти случайно, но об этом я не жалею ни капли. У нас очень камерный спецкурс, так что каждый успевает высказаться, проверить свои глоссы или что-то спросить. А еще Олег Игоревич — замечательный преподаватель, который с большой любовью и знанием дела все очень подробно рассказывает. К тому же, я давно хотела погрузиться в какой-нибудь типологически сложный язык, чтобы попробовать разбирать сложные тексты со сложной грамматикой и понять, чего я стою) Здесь у меня все отлично получается, так что кавказские языки теперь кажутся не такими страшными.


Сергей Комов, 3 курс:
Этим летом мне, возможно, предстоит экспедиция в Тиндинский язык. Даргинский спецкурс оказался отличной возможностью познакомиться с языками этого ареала. К тому же до этого я уже посещал аналогичные спецкурсы Олега Игоревича по персидскому и осетинскому, и они мне очень понравились и подобранными материалами, и тёплой атмосферой, в которой всегда проходили занятия.


На фото — Олег Игоревич в селе Шири в 2018 году, носители и пейзажи.
🔥38🥰11❤‍🔥75👏1
🙏37🕊264