В этот воскресный день делимся фоторепортажем из солнечного Милана, где 28-30 апреля прошел симпозиум Bilingualism Matters. Наша кафедра была представлена докладами Елизаветы Кропачевой (3 курс бакалавриата) и Инны Рабинович (1 курс магистратуры).
❤45🔥20❤🔥5👏2
В четверг 7 мая в 18:00 в Математическом институте им. В.А. Стеклова РАН (с возможностью подключения онлайн) состоится заседание семинара Некоторые применения математических методов в языкознании, на котором выступит четверокурсница нашей кафедры Аня Шатских. Тема доклада — «Автоматическая морфологическая классификация для осетинского языка».
Аннотация доклада:
Адрес: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 104.
Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://docs.google.com/forms/d/e/1FAIpQLSeJZoVLk-YDPfTBpPqe6h5god1i99MPDinD2GToTHv-96hQ9w/viewform
(все зарегистрировавшиеся получат ссылку для онлайн-подключения)
Аннотация доклада:
Доклад посвящён созданию датасета и нейросетевой модели для автоматической морфологической классификации в осетинском языке. Осетинский язык – иранский язык индоевропейской семьи, распространённый на Северном Кавказе. Этот язык является родным для по меньшей мере 550 тыс. человек и обладает долгой письменной традицией: так, литературный корпус осетинского языка содержит около 12 млн словоупотреблений. Тем не менее, до недавнего времени для осетинского языка не существовало инструментов контекстной морфологической классификации. Эта задача состоит в определении для словоформы её части речи и грамматических признаков (таких как число или падеж) с учётом контекста и является незаменимым уровнем разметки языковых корпусов.
В докладе будет описано создание обучающего корпуса с морфологической аннотацией в системе Universal Dependencies версии 2 (Nivre и др., 2020). Будут рассмотрены вызовы, которые типологические особенности осетинского ставят перед универсальными конвенциями аннотации, и расширения системы UD, принятые в ответ на них. Наконец, будет представлена первая в истории языковая модель архитектуры BERT (Devlin и др., 2019) для осетинского языка и морфологический классификатор на её основе, а также результаты экспериментов, проведённых в ходе создания и улучшения этих моделей.
Литература:
1. Devlin, Jacob и др. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. URL: https://arxiv.org/abs/1810.04805v2
2. Nivre, Joakim и др. (2020). Universal Dependencies v2: An Evergrowing Multilingual Treebank Collection. URL: https://arxiv.org/abs/2004.10643
Адрес: Математический институт им. В.А. Стеклова РАН, ул. Губкина, д. 8, ауд. 104.
Для прохода потребуется студенческий/пропуск любой образовательной или научной организации либо паспорт.
Ссылка для регистрации: https://docs.google.com/forms/d/e/1FAIpQLSeJZoVLk-YDPfTBpPqe6h5god1i99MPDinD2GToTHv-96hQ9w/viewform
(все зарегистрировавшиеся получат ссылку для онлайн-подключения)
❤🔥23❤16👨💻6🔥1💋1
Чем меньше ошибок допускают LLM в повседневной речи, тем больше кажется, что их язык — это наш язык. Так ли это?
В новой статье “Large Language Models and the Argument from the Poverty of the Stimulus” Нур Лан, Эммануэль Шемла и Рони Кацир возвращаются к одному из самых известных споров в теоретической лингвистике — о справедливости аргумента о бедности стимула (the argument from the poverty of the stimulus).
Этот аргумент, связанный прежде всего с работами Ноама Хомского, строится на следующей идее: детям известно об устройстве языка больше, чем они могли бы вывести только из доступного им языкового материала. Отсюда вывод: часть грамматического знания не приобретается через повседневный опыт, а в некоторой форме задаётся врождёнными когнитивными способностями.
Появление больших языковых моделей позволило частично перевести давний спор о том, прав ли Хомский, в плоскость проверяемых фактов и количественных данных. Если нейросети способны освоить сложный синтаксис языка лишь на основе корпуса текстов, аргумент Хомского требует пересмотра.
В статье проверяется именно это предположение. Авторы анализируют, насколько хорошо современные LLM справляются с механизмом передвижения вопросительного слова в английском языке и учитывают ли при этом островные ограничения. Традиционно рассуждения о бедности стимула строятся на таком или похожем материале.
В работе оцениваются показатели нескольких моделей — от LSTM и Transformer (обученных отдельно на данных корпуса детской речи CHILDES и корпуса Wikipedia), до GPT-3 и GPT-j.
Особенно важен здесь масштаб данных. Авторы намеренно переводят объем корпусов в “человеческий эквивалент” языкового опыта. Если ребёнок слышит около 11 миллионов слов в год, CHILDES-модели получают объём примерно в 10 месяцев языкового опыта, Wikipedia-модели — приблизительно 8 лет, а GPT-j — свыше 36 тысяч лет.
Что получилось? LLM выглядят убедительно на простых примерах. Они правильно предсказывают зависимости между wh-элементом и «пропущенной» позицией в предложении. Однако более сложные случаи вроде паразитических пробелов или АТВ-передвижения вызывают у моделей серьёзные затруднения. Здесь предсказания LLM начинают систематически расходиться с интуицией носителей языка.
Авторы отмечают, что качество одной из моделей резко улучшилось, когда в её обучающие данные искусственно добавили больше примеров с wh-передвижением. Это косвенный аргумент в пользу того, что проблема связана не только с архитектурой моделей, но и с принципиальной ограниченностью содержащихся в стимуле данных.
#новоевлингвистике
Источник: Nur Lan, Emmanuel Chemla, Roni Katzir; Large Language Models and the Argument from the Poverty of the Stimulus. Linguistic Inquiry 2026; 57 (2): 315–342. doi: https://doi.org/10.1162/ling_a_00533
В новой статье “Large Language Models and the Argument from the Poverty of the Stimulus” Нур Лан, Эммануэль Шемла и Рони Кацир возвращаются к одному из самых известных споров в теоретической лингвистике — о справедливости аргумента о бедности стимула (the argument from the poverty of the stimulus).
Этот аргумент, связанный прежде всего с работами Ноама Хомского, строится на следующей идее: детям известно об устройстве языка больше, чем они могли бы вывести только из доступного им языкового материала. Отсюда вывод: часть грамматического знания не приобретается через повседневный опыт, а в некоторой форме задаётся врождёнными когнитивными способностями.
Появление больших языковых моделей позволило частично перевести давний спор о том, прав ли Хомский, в плоскость проверяемых фактов и количественных данных. Если нейросети способны освоить сложный синтаксис языка лишь на основе корпуса текстов, аргумент Хомского требует пересмотра.
В статье проверяется именно это предположение. Авторы анализируют, насколько хорошо современные LLM справляются с механизмом передвижения вопросительного слова в английском языке и учитывают ли при этом островные ограничения. Традиционно рассуждения о бедности стимула строятся на таком или похожем материале.
В работе оцениваются показатели нескольких моделей — от LSTM и Transformer (обученных отдельно на данных корпуса детской речи CHILDES и корпуса Wikipedia), до GPT-3 и GPT-j.
Особенно важен здесь масштаб данных. Авторы намеренно переводят объем корпусов в “человеческий эквивалент” языкового опыта. Если ребёнок слышит около 11 миллионов слов в год, CHILDES-модели получают объём примерно в 10 месяцев языкового опыта, Wikipedia-модели — приблизительно 8 лет, а GPT-j — свыше 36 тысяч лет.
Что получилось? LLM выглядят убедительно на простых примерах. Они правильно предсказывают зависимости между wh-элементом и «пропущенной» позицией в предложении. Однако более сложные случаи вроде паразитических пробелов или АТВ-передвижения вызывают у моделей серьёзные затруднения. Здесь предсказания LLM начинают систематически расходиться с интуицией носителей языка.
Авторы отмечают, что качество одной из моделей резко улучшилось, когда в её обучающие данные искусственно добавили больше примеров с wh-передвижением. Это косвенный аргумент в пользу того, что проблема связана не только с архитектурой моделей, но и с принципиальной ограниченностью содержащихся в стимуле данных.
#новоевлингвистике
Источник: Nur Lan, Emmanuel Chemla, Roni Katzir; Large Language Models and the Argument from the Poverty of the Stimulus. Linguistic Inquiry 2026; 57 (2): 315–342. doi: https://doi.org/10.1162/ling_a_00533
❤28🔥8👏4🤔3🥴1
Продолжаем рассказывать о спецкурсах этого семестра. На очереди «Строй даргинского языка: ширинский диалект» (преподаватель — Олег Игоревич Беляев).
Александра Трофименко, 2 курс:
Мария Игнатенко, 3 курс:
Сергей Комов, 3 курс:
На фото — Олег Игоревич в селе Шири в 2018 году, носители и пейзажи.
Александра Трофименко, 2 курс:
Я выбрала этот спецкурс, потому что мне интересна типология, а языки Кавказа — до этого не знакомый мне ареал. На ОТиПЛе есть уникальная возможность обсуждать языковое разнообразие языков России с исследователями-полевыми типологами. Многие языки Кавказа мало исследованы, и информацию по ним найти сложно, поэтому Олег Игоревич делится с нами, по сути, уникальными знаниями о ширинском, много рассказывая и о культурно-исторических реалиях. Спецкурс ценен для меня расширением кругозора: как типологического, так и общечеловеческого.
Мария Игнатенко, 3 курс:
В этом семестре мне было трудно определяться со спецкурсами, потому что многое не подходило по расписанию, так что на даргинский я попала почти случайно, но об этом я не жалею ни капли. У нас очень камерный спецкурс, так что каждый успевает высказаться, проверить свои глоссы или что-то спросить. А еще Олег Игоревич — замечательный преподаватель, который с большой любовью и знанием дела все очень подробно рассказывает. К тому же, я давно хотела погрузиться в какой-нибудь типологически сложный язык, чтобы попробовать разбирать сложные тексты со сложной грамматикой и понять, чего я стою) Здесь у меня все отлично получается, так что кавказские языки теперь кажутся не такими страшными.
Сергей Комов, 3 курс:
Этим летом мне, возможно, предстоит экспедиция в Тиндинский язык. Даргинский спецкурс оказался отличной возможностью познакомиться с языками этого ареала. К тому же до этого я уже посещал аналогичные спецкурсы Олега Игоревича по персидскому и осетинскому, и они мне очень понравились и подобранными материалами, и тёплой атмосферой, в которой всегда проходили занятия.
На фото — Олег Игоревич в селе Шири в 2018 году, носители и пейзажи.
🔥38🥰11❤🔥7❤5👏1
Дорогие читатели!
Хотим поделиться с вами важной новостью: с этого года у нас будут две новые магистерские программы: «Теоретическая лингвистика» и «Компьютерная лингвистика». Этот пост открывает серию публикаций, в которых мы расскажем о том, что ждет студентов, поступающих в магистратуру отделения. Краткие описания программ уже доступны на нашем сайте.
Говорит С.Г. Татевосов, заведующий кафедрой ТиПЛ:
— Развитие и обновление ОТиПЛа продолжается. Наступил момент, когда стало ясно, что вместо общей магистратуры для теоретических и компьютерных лингвистов, которая была у нас последние 10 лет, надо иметь две более специализированные. Путь науки — это углубление и усложнение, и сейчас для нашего отделения созрели все предпосылки, чтобы сделать следующий шаг на этом пути.
ОТиПЛ меняется. Неизменными остаются общие принципы, на которых всегда строилось наше образование: работать с языком, используя математические и естественнонаучные методы, из которых вырастают строгие лингвистические теории и эффективные современные технологии. Я уверен, что общими усилиями мы добьемся успеха и что те, кто придет к нам учиться, останутся довольны своим выбором.
#магистратуры_отипла
Хотим поделиться с вами важной новостью: с этого года у нас будут две новые магистерские программы: «Теоретическая лингвистика» и «Компьютерная лингвистика». Этот пост открывает серию публикаций, в которых мы расскажем о том, что ждет студентов, поступающих в магистратуру отделения. Краткие описания программ уже доступны на нашем сайте.
Говорит С.Г. Татевосов, заведующий кафедрой ТиПЛ:
— Развитие и обновление ОТиПЛа продолжается. Наступил момент, когда стало ясно, что вместо общей магистратуры для теоретических и компьютерных лингвистов, которая была у нас последние 10 лет, надо иметь две более специализированные. Путь науки — это углубление и усложнение, и сейчас для нашего отделения созрели все предпосылки, чтобы сделать следующий шаг на этом пути.
ОТиПЛ меняется. Неизменными остаются общие принципы, на которых всегда строилось наше образование: работать с языком, используя математические и естественнонаучные методы, из которых вырастают строгие лингвистические теории и эффективные современные технологии. Я уверен, что общими усилиями мы добьемся успеха и что те, кто придет к нам учиться, останутся довольны своим выбором.
#магистратуры_отипла
❤51❤🔥23🔥13👨💻4👍2😢1💯1
В четверг 14 мая в 18.00 в Институте Языкознания состоится доклад научного сотрудника нашей кафедры К. А. Студеникиной на семинаре «Некоторые применения математических методов в языкознании». Ксения Андреевна расскажет про подходы к повышению безопасности текста, генерируемого большими языковыми моделями. Форма для регистрации — здесь.
Аннотация доклада:
Аннотация доклада:
Вместе с ростом возможностей больших языковых моделей возникает серьезная проблема: их ответы могут содержать неэтичный, предвзятый или опасный контент. Обеспечение безопасности генерируемого текста, его соответствие культурным и правовым нормам становится важным условием для использования LLM. В докладе мы рассмотрим несколько способов, которые позволяют предотвратить генерацию вредоносных ответов:
Тонкая настройка с учителем (SFT) и обучение с подкреплением (RLHF) для выравнивания с намерениями человека;
Использование системных промптов для управления поведением модели и их уязвимость к атакам;
Техники машинного забывания для удаления нежелательных знаний без полного переобучения.
В докладе также будут представлены датасеты, используемые для выравнивания и стресс-тестирования моделей на предмет безопасности.
❤39❤🔥22👏5🥰2🔥1🥴1
Для сегодняшнего выпуска рубрики #новоевлингвистике мы попросили нашу выпускницу, ныне студентку магистратуры Мюнхенского Университета Людвига-Максимилиана Варвару Петрову рассказать о статье, посвященной интонации.
Интонация — одна из составляющих просодии наряду с ударением и ритмом речи. Она используется носителями языка для разбиения высказывания на отдельные фразы, подчеркивания определённых прагматически значимых слов внутри этих фраз, разделения данного и нового, а также для многого другого. Интонация и ритм — это компоненты родительской речи, с которыми будущие носители языка сталкиваются ещё до рождения, и современные исследования показывают, что интонационные параметры родного языка родителей определяют паттерны плача у младенцев, которые ещё не умеют говорить.
Одни из самых известных фреймворков для исследования интонации в лингвистике — британская школа и автосегментная метрическая фонология. Британская школа интонации рассматривает интонацию как серию движений ЧОТ: одно такое движение может быть восходящим, нисходящим, восходяще-нисходящим и так далее. Однако то, как именно меняется движение тона, оказывается в тесной связи с длиной высказывания: например, в одной и той же прагматической ситуации восходящая интонация может быть реализована на последнем из пяти слогов высказывания или на двух последних слогах трехсложного слова. Чтобы единообразно анализировать подобные случаи, в автосегментной метрической фонологии постулируются интонационные примитивы, или мишени, внутри одного движения тона (L «низкий» +H* «высокий» вместо «восходящий»). Это позволяет анализировать интонацию как цепочку примитивов — то есть похожим на подход к сегментной фонологии образом.
Статья Амалии Арванити рассматривает развитие автосегментной метрической фонологии на протяжении прошедшей четверти века: преимущества и проблемные вопросы для стандартной автосегментной модели, а также эмпирические свидетельства в ее пользу. Обозреваются основанные на ней традиционные (Tones and Break Indices) и более новые методы аннотации, отражающие перцепцию носителей без специального обучения принципам разметки (Rapid Prosody Transcription), фокусирующиеся на фонетических деталях (International Prosodic Alphabet) или более грубой перцепции аннотаторов (PoLAR (на фото), Rhythm and Pitch). В качестве перспектив развития автосегментной метрической теории Арванити указывает на необходимость обобщения большого числа тональных категорий, между которыми в реальной жизни слушатели не делают различий. Кроме того, в пересмотре нуждаются общие методы и эвристики: в частности, в последние годы было доказано, что, как и сущности сегментной фонологии, интонационные элементы могут иметь несколько коррелятов помимо ЧОТ, которые способны усиливать друг друга или вступать в компенсаторные отношения. Подробнее с работой можно ознакомиться по ссылке.
Amalia Arvaniti, Martine Grice, Mariapaola D’imperio. Advancements of phonetics in the 21st century: Intonation. Journal of Phonetics, 2026, 114, pp.101459.
Интонация — одна из составляющих просодии наряду с ударением и ритмом речи. Она используется носителями языка для разбиения высказывания на отдельные фразы, подчеркивания определённых прагматически значимых слов внутри этих фраз, разделения данного и нового, а также для многого другого. Интонация и ритм — это компоненты родительской речи, с которыми будущие носители языка сталкиваются ещё до рождения, и современные исследования показывают, что интонационные параметры родного языка родителей определяют паттерны плача у младенцев, которые ещё не умеют говорить.
Одни из самых известных фреймворков для исследования интонации в лингвистике — британская школа и автосегментная метрическая фонология. Британская школа интонации рассматривает интонацию как серию движений ЧОТ: одно такое движение может быть восходящим, нисходящим, восходяще-нисходящим и так далее. Однако то, как именно меняется движение тона, оказывается в тесной связи с длиной высказывания: например, в одной и той же прагматической ситуации восходящая интонация может быть реализована на последнем из пяти слогов высказывания или на двух последних слогах трехсложного слова. Чтобы единообразно анализировать подобные случаи, в автосегментной метрической фонологии постулируются интонационные примитивы, или мишени, внутри одного движения тона (L «низкий» +H* «высокий» вместо «восходящий»). Это позволяет анализировать интонацию как цепочку примитивов — то есть похожим на подход к сегментной фонологии образом.
Статья Амалии Арванити рассматривает развитие автосегментной метрической фонологии на протяжении прошедшей четверти века: преимущества и проблемные вопросы для стандартной автосегментной модели, а также эмпирические свидетельства в ее пользу. Обозреваются основанные на ней традиционные (Tones and Break Indices) и более новые методы аннотации, отражающие перцепцию носителей без специального обучения принципам разметки (Rapid Prosody Transcription), фокусирующиеся на фонетических деталях (International Prosodic Alphabet) или более грубой перцепции аннотаторов (PoLAR (на фото), Rhythm and Pitch). В качестве перспектив развития автосегментной метрической теории Арванити указывает на необходимость обобщения большого числа тональных категорий, между которыми в реальной жизни слушатели не делают различий. Кроме того, в пересмотре нуждаются общие методы и эвристики: в частности, в последние годы было доказано, что, как и сущности сегментной фонологии, интонационные элементы могут иметь несколько коррелятов помимо ЧОТ, которые способны усиливать друг друга или вступать в компенсаторные отношения. Подробнее с работой можно ознакомиться по ссылке.
Amalia Arvaniti, Martine Grice, Mariapaola D’imperio. Advancements of phonetics in the 21st century: Intonation. Journal of Phonetics, 2026, 114, pp.101459.
❤🔥31🔥10❤5👍2
Сегодня мы представляем вам последний выпуск рассказов о спецкурсах этого семестра, и он посвящен «Подходам к анализу сочинительных структур» (преподаватели — О.И. Беляев, П.В. Гращенков, Т.И. Давидюк и И.А. Хомченкова).
Илья Гриценко, 4 курс:
Дарья Юферева, 2 курс:
Илья Гриценко, 4 курс:
Тематика данного курса тесно соприкасается с основным направлением моих исследований — согласованием с сочинёнными группами. Поэтому решение посещать его было мной принято сразу же, когда стало известно о том, что такой курс будет проводиться в текущем семестре. В итоге мне удалось не только расширить свой кругозор в отношении сочинения в русском языке и других языках мира (например, баскском, бартангском, нивхском, осетинском), но и запастись идеями для будущих экспериментальных работ. Большое спасибо всем преподавателям и участникам курса, в особенности — за обмен знаниями и взглядами в обсуждениях!
Дарья Юферева, 2 курс:
Екатерина Анатольевна Лютикова упомянула этот курс на паре русского синтаксиса и сказала, что он обещает быть очень интересным :) Это редкая возможность узнать про сочинение и теории его анализа, потому что сочинение в целом исследовали меньше, чем подчинение, с ним больше вопросов и споров. В общем, это несколько экзотическая тема, и мне показалось что такой шанс упускать нельзя :)
❤17❤🔥9
На этих выходных Научный центр по сохранению, возрождению и документации языков России Института языкознания РАН провел уже шестую ежегодную онлайн-школу. В этом году школа была посвящена образованию на языках России, и студенты нашей магистерской программы «Модели анализа языков и культур народов России» не могли ее пропустить!
Слово Севастьяну Григорьеву и Виктории Борисовой:
Севастьян:
Виктория:
Слово Севастьяну Григорьеву и Виктории Борисовой:
— Что оказалось для вас наиболее полезным и интересным?
Севастьян:
Больше всего мне запомнился рассказ Василия Сергеевича Харитонова о преподавании нанайского языка в селе Дада. Большинство спикеров рассказывали скорее про то, как всё устроено с правовой точки зрения и как преподаётся сам язык. Василий Сергеевич поделился историями из своего опыта преподавания в школе и рассказал, как ему удается мотивировать детей говорить на нанайском. Также было интересно услышать рассказ Сономбала Цыденовича Содномова об опыте обучения бурятскому языку детей дошкольного возраста.
Виктория:
Меня, как и Севу, поразила история Василия Сергеевича — ведь, как мы поняли, нанайский язык для него не родной, и в Хабаровский край он переехал. Самым актуальным для меня оказался рассказ Тамерлана Таймуразовича Камболова о разработке и внедрении полилингвальной системы образования в Республике Северная Осетия — Алания. Я занимаюсь осетинским языком в поле, и в моих интересах появление юных компетентных носителей :)
❤17