На прошлой неделе закончился наш летний буткемп по R #summeR Для меня это был первый подобный опыт работы не со студентами, а с коллегами -- преподавателями и исследователями, знающими и в хорошем смысле требовательными.
Усиленная работа летом - всегда спорный выбор, потому что в нашей гуманитарной жизни это часто единственная возможность немного выдохнуть. Но, как оказалось, меня занятия в такой аудитории заряжают энергией не меньше, чем кабачковая жизнь🌸 Надеюсь, что и участникам наши пятничные созвоны были не в тягость.
А еще я очень рада приходящим отзывам, которыми -- с разрешения авторов -- делюсь в карточках. Спасибо, друзья! Forever🖼️
Кто все пропустил, курс пока доступен в записи.
Усиленная работа летом - всегда спорный выбор, потому что в нашей гуманитарной жизни это часто единственная возможность немного выдохнуть. Но, как оказалось, меня занятия в такой аудитории заряжают энергией не меньше, чем кабачковая жизнь
А еще я очень рада приходящим отзывам, которыми -- с разрешения авторов -- делюсь в карточках. Спасибо, друзья! Forever
Кто все пропустил, курс пока доступен в записи.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤16👏3👨💻2
Forwarded from Vox mediaevistae
Проект GREgORI и Calfa, единственная известная мне компания, которая оказывает услуги по автоматической транскрипции текстов на редких языках, опубликовали корпус объемом почти 6 млн слов на древнегреческом языке, созданный на основе Patrologia Graeca.
Туда вошли тома PG, которых не хватало в Thesaurus Linguae Graecae — прежде всего позднеантичные и византийские тексты.
CER, по их словам, достигает 1%. Данные доступны в нескольких форматах, в том числе с лемматизацией и POS-разметкой. Корпус можно использовать для полнотекстового поиска, анализа текстов и как silver data для обучения LLM.
GitHub проекта
Статья "The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions"
Туда вошли тома PG, которых не хватало в Thesaurus Linguae Graecae — прежде всего позднеантичные и византийские тексты.
CER, по их словам, достигает 1%. Данные доступны в нескольких форматах, в том числе с лемматизацией и POS-разметкой. Корпус можно использовать для полнотекстового поиска, анализа текстов и как silver data для обучения LLM.
GitHub проекта
Статья "The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions"
Université catholique de Louvain
GREgORI - Softwares, linguistic data and tagged corpus for ancient GREek and ORIental languages
ISSN 2736-7657 GREgORI logo by Anahita Nikdast Contact : info-gregori@uclouvain.be
❤6👍5
еще у меня сегодня две новости из мира айти.
1) статистика телеграма нарисовала мне котика
2) чат жпт составил от моего имени письмо и подписал: Ольга ИИ
1) статистика телеграма нарисовала мне котика
2) чат жпт составил от моего имени письмо и подписал: Ольга ИИ
😁31😱4🏆4👾3❤1👍1
Forwarded from Antibarbari HSE (Olga Alieva)
Дорогие друзья! Мы запустили Анагноста - с помощью ИИ он может делать транскрипцию греческого текста на папирусе по цифровому изображению. Это первый подобный инструмент в истории папирологии, и он уже очень хорошо работает: находит строки, распознает буквы и специальные знаки, в том числе в курсивных почерках, разделяет текст на слова, предлагает реконструкцию лакун и раскрывает сокращения. Мы будем и дальше тренировать модель, чтобы результаты были еще лучше.
Самую точную транскрипцию Анагност дает для литературных папирусов и хорошо сохранившихся фрагментов птолемеевского и римского времени.
Сейчас на сайте можно протестировать до 5 папирусов. У нас пока нет финансирования, поэтому просим экономно отнестись к этой тестовой фазе (да, расшифровка каждого папируса - это вычислительные мощности и тоже расходы).
Большое спасибо всем, кто помог нам осуществить этот проект в такие короткие сроки, и особенно нашим замечательным волонтерам, которые приняли участие в ручной разметке папирусов: Полине Маловой, Дарье Колер, Яну Шаврину, Антонине Калининой, Дарье Долгобородовой, Ольге Троицкой, Ольге Голуз, Анне Грешных и другим! 🚀💕
Алена и Антон
Самую точную транскрипцию Анагност дает для литературных папирусов и хорошо сохранившихся фрагментов птолемеевского и римского времени.
Сейчас на сайте можно протестировать до 5 папирусов. У нас пока нет финансирования, поэтому просим экономно отнестись к этой тестовой фазе (да, расшифровка каждого папируса - это вычислительные мощности и тоже расходы).
Большое спасибо всем, кто помог нам осуществить этот проект в такие короткие сроки, и особенно нашим замечательным волонтерам, которые приняли участие в ручной разметке папирусов: Полине Маловой, Дарье Колер, Яну Шаврину, Антонине Калининой, Дарье Долгобородовой, Ольге Троицкой, Ольге Голуз, Анне Грешных и другим! 🚀💕
Алена и Антон
🔥18❤14😱3👏2
Forwarded from Antibarbari HSE (Olga Alieva)
Как филологу-классику использовать нейросети?
Канал @antibarbari совместно с @rantiquity собрал для вас несколько советов⬇️
Сначала о формате работы.
⏩ Чаты удобны для обсуждения отдельного места: задаем вопрос, проверяем ответ, уточняем. Claude и GPT позволяют привязывать чаты к проектам. Это удобно тем, что у каждого проекта есть своя библиотека: файлы не надо каждый раз загружать в чат. Но у таких библиотек есть ограничения (примерно 20 файлов, в зависимости от объема и подписки).
⏩ Агентный режим — для поручений с файлами: обработать подборку материалов, собрать таблицу, подготовить документ. Один из таких инструментов — Claude Cowork. Коворки умеют работать с разными форматами, но самый удобный и быстрый для промежуточных результатов -- не docx, а md (маркдаун).
⏩ Скрипт на R или Python — для повторяющихся операций над корпусом. Нейросеть может помочь его написать и запустить.
🫥 🫥 🫥 🫥 🫥 🫥
✨ Анализ разночтений
Что: развернуть сжатую запись аппарата, сопоставить варианты, выяснить, как каждый из них меняет синтаксис и смысл.
Как: в чате - дать текст и аппарат нужного издания, попросить разобрать каждое чтение; в коворке - дать доступ к папке с изданиями; можно попросить собрать такие разборы в таблицу с указанием места и источника.
Особенности: Сиглы лучше задавать явно, а не надеяться, что нейросеть угадает. Текстовый слой у старых pdf скорее всего плохой, и каждая страница будет обрабатываться как изображение - это высокий расход токенов.
✨ 2. Грамматика и перевод
Что: проверить неоднозначный оборот, возможные антецеденты местоимения, сравнить несколько переводов.
Как: через чат для отдельных затруднений или в коворке с доступом к переводам.
Особенности: модель может незаметно исправить неудобный текст или предложить перевод, который скрывает грамматическую проблему. Полезно требовать, чтобы возможные исправления обсуждались отдельно.
✨ 3. Сопоставление научной литературы
Что: поиск интерпретационных развилок.
Как: В чате удобно обсуждать отдельные вопросы; в коворке можно поручить собрать в маркдаун сравнительную таблицу: автор — тезис — аргумент — разбираемое место — страница.
Особенности: важно просить подтверждающие выдержки с номером страницы для проверки. Нейросети умеют различать печатную страницу и номер страницы PDF.
✨ 4. Работа с корпусом
Что: собрать конкорданс, сделать частотный словарь, найти частотные сочетания или сделать предварительную разметку контекстов или именованных сущностей.
Как: попросить нейросеть написать скрипт для R или Python (для частотностей) или добавить разметку в файлы txt / xml. Современные нейросети умеют подтягивать источники с Perseus и делать конкорданс безо всякого кода.
Особенности: обязательно сравнивать источник до и после разметки: нейросети могут исправлять текст, который они размечают. Могут быть ошибки в пагинации.
✨ 5. Библиография, ссылки и оформление
Что: привести записи к единому виду, найти ссылки без библиографических записей, подготовить BibTeX, проверить перекрестные отсылки.
Как: коворк с текстом и библиографией. Полезное поручение: «Сопоставь ключи цитирования в документе с файлом библиографии и выведи несовпадения».
Особенности: форматирование и установление библиографических данных — разные операции. Недостающие год, страницы или DOI нужно сверять с изданием. В рабочем результате лучше оставить явный пропуск, чем получить правдоподобно заполненную запись.
🫥 🫥 🫥 🫥 🫥
❗️ Хорошее поручение обычно содержит четыре вещи: материал, конкретный вопрос, формат результата и способ проверки.
Делитесь своими секретами в комментариях!💙
Канал @antibarbari совместно с @rantiquity собрал для вас несколько советов
Сначала о формате работы.
Что: развернуть сжатую запись аппарата, сопоставить варианты, выяснить, как каждый из них меняет синтаксис и смысл.
Как: в чате - дать текст и аппарат нужного издания, попросить разобрать каждое чтение; в коворке - дать доступ к папке с изданиями; можно попросить собрать такие разборы в таблицу с указанием места и источника.
Особенности: Сиглы лучше задавать явно, а не надеяться, что нейросеть угадает. Текстовый слой у старых pdf скорее всего плохой, и каждая страница будет обрабатываться как изображение - это высокий расход токенов.
Что: проверить неоднозначный оборот, возможные антецеденты местоимения, сравнить несколько переводов.
Как: через чат для отдельных затруднений или в коворке с доступом к переводам.
Особенности: модель может незаметно исправить неудобный текст или предложить перевод, который скрывает грамматическую проблему. Полезно требовать, чтобы возможные исправления обсуждались отдельно.
Что: поиск интерпретационных развилок.
Как: В чате удобно обсуждать отдельные вопросы; в коворке можно поручить собрать в маркдаун сравнительную таблицу: автор — тезис — аргумент — разбираемое место — страница.
Особенности: важно просить подтверждающие выдержки с номером страницы для проверки. Нейросети умеют различать печатную страницу и номер страницы PDF.
Что: собрать конкорданс, сделать частотный словарь, найти частотные сочетания или сделать предварительную разметку контекстов или именованных сущностей.
Как: попросить нейросеть написать скрипт для R или Python (для частотностей) или добавить разметку в файлы txt / xml. Современные нейросети умеют подтягивать источники с Perseus и делать конкорданс безо всякого кода.
Особенности: обязательно сравнивать источник до и после разметки: нейросети могут исправлять текст, который они размечают. Могут быть ошибки в пагинации.
Что: привести записи к единому виду, найти ссылки без библиографических записей, подготовить BibTeX, проверить перекрестные отсылки.
Как: коворк с текстом и библиографией. Полезное поручение: «Сопоставь ключи цитирования в документе с файлом библиографии и выведи несовпадения».
Особенности: форматирование и установление библиографических данных — разные операции. Недостающие год, страницы или DOI нужно сверять с изданием. В рабочем результате лучше оставить явный пропуск, чем получить правдоподобно заполненную запись.
Делитесь своими секретами в комментариях!
Please open Telegram to view this post
VIEW IN TELEGRAM
❤14
Antibarbari HSE
Как филологу-классику использовать нейросети? Канал @antibarbari совместно с @rantiquity собрал для вас несколько советов ⬇️ Сначала о формате работы. ⏩ Чаты удобны для обсуждения отдельного места: задаем вопрос, проверяем ответ, уточняем. Claude и GPT…
1. Приготовилась, жду, когда кто-нибудь скажет, что правильный ответ: не использовать.
2. Удивительно, как быстро переходишь от состояния "я никогда не позволю какому-то подозрительному агенту хозяйничать в моих файлах" до "не спрашивать разрешения на каждое действие, разрешать автоматически".
2. Удивительно, как быстро переходишь от состояния "я никогда не позволю какому-то подозрительному агенту хозяйничать в моих файлах" до "не спрашивать разрешения на каждое действие, разрешать автоматически".
❤10😁10
Forwarded from Antibarbari HSE (Olga Alieva)
🌋 Vesuvius Challenge: как машинное обучение сделало возможным чтение обугленных свитков
🌟 Антон Репушко, Head of Research в Revolut, ex-разработчик в Vesuvius Challenge, автор проекта Anagnostes в гостях у #antibarbari_colloquia
🗓 25 сентября 2026 г., начало в 18:30 (мск). Встреча пройдет онлайн (Zoom).
🔗 Участие свободное. Регистрация по ссылке.
Мероприятие организовано Греко-латинским клубом Antibarbari HSE совместно с магистерской программой "Цифровые технологии в гуманитарных исследованиях" НИУ ВШЭ.
Встречу проведет к.ф.н., доцент О.В. Алиева.
🌟 Антон Репушко, Head of Research в Revolut, ex-разработчик в Vesuvius Challenge, автор проекта Anagnostes в гостях у #antibarbari_colloquia
Во время извержения Везувия в 79 г. пирокластические потоки обрушились на Помпеи и несколько других городов с разной скоростью. Благодаря этому в Геркулануме папирусные свитки в частной библиотеке обуглились, но не были полностью уничтожены. Со времени обнаружения виллы с библиотекой в 1750 г ученые пытались развернуть свитки и прочитать содержащиеся в них античные произведения. Это часто приводило к тому, что папирусы рассыпались в прах и были потеряны для науки. В 2023-2026 годах участники проекта Vesuvius Challenge впервые с помощью технологий машинного обучения смогли виртуально развернуть несколько свитков без физического вмешательства. О том, как стал возможен этот научный прорыв, расскажет в лекции Антон Репушко.
🗓 25 сентября 2026 г., начало в 18:30 (мск). Встреча пройдет онлайн (Zoom).
🔗 Участие свободное. Регистрация по ссылке.
Мероприятие организовано Греко-латинским клубом Antibarbari HSE совместно с магистерской программой "Цифровые технологии в гуманитарных исследованиях" НИУ ВШЭ.
Встречу проведет к.ф.н., доцент О.В. Алиева.
👍5🔥3🤩1