RAntiquity
1.27K subscribers
362 photos
11 videos
6 files
642 links
Об античности на языке R и не только

@locusclassicus
Download Telegram
На прошлой неделе закончился наш летний буткемп по R #summeR Для меня это был первый подобный опыт работы не со студентами, а с коллегами -- преподавателями и исследователями, знающими и в хорошем смысле требовательными.

Усиленная работа летом - всегда спорный выбор, потому что в нашей гуманитарной жизни это часто единственная возможность немного выдохнуть. Но, как оказалось, меня занятия в такой аудитории заряжают энергией не меньше, чем кабачковая жизнь 🌸 Надеюсь, что и участникам наши пятничные созвоны были не в тягость.

А еще я очень рада приходящим отзывам, которыми -- с разрешения авторов -- делюсь в карточках. Спасибо, друзья! Forever 🖼️

Кто все пропустил, курс пока доступен в записи.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
16👏3👨‍💻2
Forwarded from Vox mediaevistae
Проект GREgORI и Calfa, единственная известная мне компания, которая оказывает услуги по автоматической транскрипции текстов на редких языках, опубликовали корпус объемом почти 6 млн слов на древнегреческом языке, созданный на основе Patrologia Graeca.
Туда вошли тома PG, которых не хватало в Thesaurus Linguae Graecae — прежде всего позднеантичные и византийские тексты.

CER, по их словам, достигает 1%. Данные доступны в нескольких форматах, в том числе с лемматизацией и POS-разметкой. Корпус можно использовать для полнотекстового поиска, анализа текстов и как silver data для обучения LLM.

GitHub проекта
Статья "The Patrologia Graeca Corpus: OCR, Annotation, and Open Release of Noisy Nineteenth-Century Polytonic Greek Editions"
6👍5
еще у меня сегодня две новости из мира айти.
1) статистика телеграма нарисовала мне котика
2) чат жпт составил от моего имени письмо и подписал: Ольга ИИ
😁31😱4🏆4👾31👍1
Forwarded from Antibarbari HSE (Olga Alieva)
Дорогие друзья! Мы запустили Анагноста - с помощью ИИ он может делать транскрипцию греческого текста на папирусе по цифровому изображению. Это первый подобный инструмент в истории папирологии, и он уже очень хорошо работает: находит строки, распознает буквы и специальные знаки, в том числе в курсивных почерках, разделяет текст на слова, предлагает реконструкцию лакун и раскрывает сокращения. Мы будем и дальше тренировать модель, чтобы результаты были еще лучше.

Самую точную транскрипцию Анагност дает для литературных папирусов и хорошо сохранившихся фрагментов птолемеевского и римского времени.

Сейчас на сайте можно протестировать до 5 папирусов. У нас пока нет финансирования, поэтому просим экономно отнестись к этой тестовой фазе (да, расшифровка каждого папируса - это вычислительные мощности и тоже расходы).

Большое спасибо всем, кто помог нам осуществить этот проект в такие короткие сроки, и особенно нашим замечательным волонтерам, которые приняли участие в ручной разметке папирусов: Полине Маловой, Дарье Колер, Яну Шаврину, Антонине Калининой, Дарье Долгобородовой, Ольге Троицкой, Ольге Голуз, Анне Грешных и другим! 🚀💕

Алена и Антон
🔥1814😱3👏2
Forwarded from Antibarbari HSE (Olga Alieva)
Как филологу-классику использовать нейросети?


Канал @antibarbari совместно с @rantiquity собрал для вас несколько советов ⬇️

Сначала о формате работы.

Чаты удобны для обсуждения отдельного места: задаем вопрос, проверяем ответ, уточняем. Claude и GPT позволяют привязывать чаты к проектам. Это удобно тем, что у каждого проекта есть своя библиотека: файлы не надо каждый раз загружать в чат. Но у таких библиотек есть ограничения (примерно 20 файлов, в зависимости от объема и подписки).

Агентный режим — для поручений с файлами: обработать подборку материалов, собрать таблицу, подготовить документ. Один из таких инструментов — Claude Cowork. Коворки умеют работать с разными форматами, но самый удобный и быстрый для промежуточных результатов -- не docx, а md (маркдаун).

Скрипт на R или Python — для повторяющихся операций над корпусом. Нейросеть может помочь его написать и запустить.

🫥🫥🫥🫥🫥🫥

Анализ разночтений

Что: развернуть сжатую запись аппарата, сопоставить варианты, выяснить, как каждый из них меняет синтаксис и смысл.

Как: в чате - дать текст и аппарат нужного издания, попросить разобрать каждое чтение; в коворке - дать доступ к папке с изданиями; можно попросить собрать такие разборы в таблицу с указанием места и источника.

Особенности: Сиглы лучше задавать явно, а не надеяться, что нейросеть угадает. Текстовый слой у старых pdf скорее всего плохой, и каждая страница будет обрабатываться как изображение - это высокий расход токенов.


2. Грамматика и перевод

Что: проверить неоднозначный оборот, возможные антецеденты местоимения, сравнить несколько переводов.

Как: через чат для отдельных затруднений или в коворке с доступом к переводам.

Особенности: модель может незаметно исправить неудобный текст или предложить перевод, который скрывает грамматическую проблему. Полезно требовать, чтобы возможные исправления обсуждались отдельно.

3. Сопоставление научной литературы

Что: поиск интерпретационных развилок.

Как: В чате удобно обсуждать отдельные вопросы; в коворке можно поручить собрать в маркдаун сравнительную таблицу: автор — тезис — аргумент — разбираемое место — страница.

Особенности: важно просить подтверждающие выдержки с номером страницы для проверки. Нейросети умеют различать печатную страницу и номер страницы PDF.

4. Работа с корпусом

Что: собрать конкорданс, сделать частотный словарь, найти частотные сочетания или сделать предварительную разметку контекстов или именованных сущностей.

Как: попросить нейросеть написать скрипт для R или Python (для частотностей) или добавить разметку в файлы txt / xml. Современные нейросети умеют подтягивать источники с Perseus и делать конкорданс безо всякого кода.

Особенности: обязательно сравнивать источник до и после разметки: нейросети могут исправлять текст, который они размечают. Могут быть ошибки в пагинации.

5. Библиография, ссылки и оформление

Что: привести записи к единому виду, найти ссылки без библиографических записей, подготовить BibTeX, проверить перекрестные отсылки.

Как: коворк с текстом и библиографией. Полезное поручение: «Сопоставь ключи цитирования в документе с файлом библиографии и выведи несовпадения».

Особенности: форматирование и установление библиографических данных — разные операции. Недостающие год, страницы или DOI нужно сверять с изданием. В рабочем результате лучше оставить явный пропуск, чем получить правдоподобно заполненную запись.

🫥🫥🫥🫥🫥

❗️Хорошее поручение обычно содержит четыре вещи: материал, конкретный вопрос, формат результата и способ проверки.


Делитесь своими секретами в комментариях! 💙
Please open Telegram to view this post
VIEW IN TELEGRAM
14
Antibarbari HSE
Как филологу-классику использовать нейросети? Канал @antibarbari совместно с @rantiquity собрал для вас несколько советов ⬇️ Сначала о формате работы. Чаты удобны для обсуждения отдельного места: задаем вопрос, проверяем ответ, уточняем. Claude и GPT…
1. Приготовилась, жду, когда кто-нибудь скажет, что правильный ответ: не использовать.

2. Удивительно, как быстро переходишь от состояния "я никогда не позволю какому-то подозрительному агенту хозяйничать в моих файлах" до "не спрашивать разрешения на каждое действие, разрешать автоматически".
10😁10
Please open Telegram to view this post
VIEW IN TELEGRAM
15👏3🔥2🦄1
Forwarded from Antibarbari HSE (Olga Alieva)
🌋 Vesuvius Challenge: как машинное обучение сделало возможным чтение обугленных свитков

🌟 Антон Репушко, Head of Research в Revolut, ex-разработчик в Vesuvius Challenge, автор проекта Anagnostes в гостях у #antibarbari_colloquia

Во время извержения Везувия в 79 г. пирокластические потоки обрушились на Помпеи и несколько других городов с разной скоростью. Благодаря этому в Геркулануме папирусные свитки в частной библиотеке обуглились, но не были полностью уничтожены. Со времени обнаружения виллы с библиотекой в 1750 г ученые пытались развернуть свитки и прочитать содержащиеся в них античные произведения. Это часто приводило к тому, что папирусы рассыпались в прах и были потеряны для науки. В 2023-2026 годах участники проекта Vesuvius Challenge впервые с помощью технологий машинного обучения смогли виртуально развернуть несколько свитков без физического вмешательства. О том, как стал возможен этот научный прорыв, расскажет в лекции Антон Репушко.


🗓 25 сентября 2026 г., начало в 18:30 (мск). Встреча пройдет онлайн (Zoom).

🔗 Участие свободное. Регистрация по ссылке.

Мероприятие организовано Греко-латинским клубом
Antibarbari HSE совместно с магистерской программой "Цифровые технологии в гуманитарных исследованиях" НИУ ВШЭ.

Встречу проведет к.ф.н., доцент О.В. Алиева.
👍5🔥3🤩1