Выложили материалы по итогам недавнего митапа:
Презентации - тут, запись выступлений - тут.
Решили и в этот раз провести голосование за "Лучший доклад" - чтобы был повод ещё раз посмотреть на слайды.
Для равенства шансов, keynote-доклады (от Владимира Павлова про школу-конкурс EDGE AI 2025 и Олега Чирухина - про путь к 100% генерации кода) идут вне зачета.
А само голосование - ниже:
Презентации - тут, запись выступлений - тут.
Решили и в этот раз провести голосование за "Лучший доклад" - чтобы был повод ещё раз посмотреть на слайды.
Для равенства шансов, keynote-доклады (от Владимира Павлова про школу-конкурс EDGE AI 2025 и Олега Чирухина - про путь к 100% генерации кода) идут вне зачета.
А само голосование - ниже:
И снова про OSA - но теперь на английском! Написали длинный гайд по использованию и выкатили его на TDS:
https://towardsdatascience.com/an-end-to-end-guide-to-beautifying-your-open-source-repo-with-agentic-ai/
Приятно, что редакция признала проект общественно-полезным и опубликовали несмотря на то что это своего рода "само-реклама":
We don't often publish articles that are framed around the launch of the author's new tool/product or geared towards explaining how to use it, but given your project's open source status and its potential relevance for many of our readers, we can be more flexible, and would be happy to publish it.
Если у вас есть англо-говорящие коллеги, которым бы пригодился инструмент для проверки и улучшения научных репозиториев - будем рады, если поделитесь с ними ссылкой.
https://towardsdatascience.com/an-end-to-end-guide-to-beautifying-your-open-source-repo-with-agentic-ai/
Приятно, что редакция признала проект общественно-полезным и опубликовали несмотря на то что это своего рода "само-реклама":
We don't often publish articles that are framed around the launch of the author's new tool/product or geared towards explaining how to use it, but given your project's open source status and its potential relevance for many of our readers, we can be more flexible, and would be happy to publish it.
Если у вас есть англо-говорящие коллеги, которым бы пригодился инструмент для проверки и улучшения научных репозиториев - будем рады, если поделитесь с ними ссылкой.
Towards Data Science
An End-to-End Guide to Beautifying Your Open-Source Repo with Agentic AI | Towards Data Science
The guide to automated improvement of scientific and industrial repositories using open-source AI agents
🔥14❤4👍4
Очередной выпуск с тематическими подборками научных каналов от "Зоопарка" - можно полистать на предмет интересного.
На этот раз вошли в категорию "общеполезное".
На этот раз вошли в категорию "общеполезное".
🔥3
Forwarded from Зоопарк из слоновой кости
#пост_по_регламенту
Итак, продолжаем выкладывать трудолюбиво собранные нашим Зоопарком папки, которые, как нам кажется, уже более или менее готовы. Если кто еще хочет в них добавиться - пишите в ЛС нашего Зоопарка или в комменты (но не затягивайте, максимум в течение пары часов, иначе для вас полностью теряется смысл).
Встречайте, смотрите, выбирайте на свой вкус и добавляйтесь!
Сегодня у нас их сразу четыре:
Физика (12 каналов)
Химия (25 каналов)
Инженеры-технари (11 каналов) и
"Научно-общеполезное" (19 каналов)
Как и раньше, собираем отдельно "мегапапку" - самые крупные, избранные каналы о науке и образовании (или просто особо понравившиеся нам). Она выйдет малость попозже.
Итак, продолжаем выкладывать трудолюбиво собранные нашим Зоопарком папки, которые, как нам кажется, уже более или менее готовы. Если кто еще хочет в них добавиться - пишите в ЛС нашего Зоопарка или в комменты (но не затягивайте, максимум в течение пары часов, иначе для вас полностью теряется смысл).
Встречайте, смотрите, выбирайте на свой вкус и добавляйтесь!
Сегодня у нас их сразу четыре:
Физика (12 каналов)
Химия (25 каналов)
Инженеры-технари (11 каналов) и
"Научно-общеполезное" (19 каналов)
Как и раньше, собираем отдельно "мегапапку" - самые крупные, избранные каналы о науке и образовании (или просто особо понравившиеся нам). Она выйдет малость попозже.
Telegram
phys feb 26
Смотритель Зоопарка invites you to add the folder “phys feb 26”, which includes 13 chats.
🔥3❤1👍1
Попался сегодня пост про AI4Science, с многими мыслями из которого соглашусь:
Делимся тезисами Александра Кустова, которые уже разошлись по академической среде — и многим они явно не понравились.
* Классическая академическая статья — формат, который доживает последние дни.
* Коммерческая система научных журналов может этого не пережить.
* Учёные предъявляют к ИИ абсурдно двойные стандарты.
* Молодым исследователям достанется и главный удар, и главный шанс.
* В работе классического research assistant почти не осталось прежнего смысла.
...
* По-настоящему важные вопросы — это безопасность и проверка результатов.
* Качественные исследования и сбор уникальных данных только вырастут в цене.
* Споры об ИИ всё сильнее зависят не от фактов, а от личной веры в его полезность.
* Качество результата по-прежнему определяется не ИИ, а уровнем самого пользователя.
* Большинство научных статей уже читают не люди, а машины.
* Атрофия навыков — реальный риск, особенно для будущего поколения учёных.
* Детекторы ИИ-текста и нормы обязательного раскрытия почти не работают.
* Academic Bluesky — не то место, где сегодня возможен серьёзный разговор об ИИ.
* Исследование может быть «без души» — и всё равно приносить пользу обществу.
Особенно в части изживания классического формата научной статьи. Кажется, сейчас секции статей, посвященных экспериментам с применением ML (в разных областях, не только CS), уже сейчас де-факто просто пересказывают jupyter-ноутбуки с потерей деталей.
При этом, сейчас даже топовые конференции не энфорсят наличие кода - вот сейчас на ICML ревьюил, и 2 из 3 статей код не приложили вообще.
Про явное соотнесение экспериментов в статье с кодом/данными/моделям для их запуска даже не говорю.
Делимся тезисами Александра Кустова, которые уже разошлись по академической среде — и многим они явно не понравились.
* Классическая академическая статья — формат, который доживает последние дни.
* Коммерческая система научных журналов может этого не пережить.
* Учёные предъявляют к ИИ абсурдно двойные стандарты.
* Молодым исследователям достанется и главный удар, и главный шанс.
* В работе классического research assistant почти не осталось прежнего смысла.
...
* По-настоящему важные вопросы — это безопасность и проверка результатов.
* Качественные исследования и сбор уникальных данных только вырастут в цене.
* Споры об ИИ всё сильнее зависят не от фактов, а от личной веры в его полезность.
* Качество результата по-прежнему определяется не ИИ, а уровнем самого пользователя.
* Большинство научных статей уже читают не люди, а машины.
* Атрофия навыков — реальный риск, особенно для будущего поколения учёных.
* Детекторы ИИ-текста и нормы обязательного раскрытия почти не работают.
* Academic Bluesky — не то место, где сегодня возможен серьёзный разговор об ИИ.
* Исследование может быть «без души» — и всё равно приносить пользу обществу.
Особенно в части изживания классического формата научной статьи. Кажется, сейчас секции статей, посвященных экспериментам с применением ML (в разных областях, не только CS), уже сейчас де-факто просто пересказывают jupyter-ноутбуки с потерей деталей.
При этом, сейчас даже топовые конференции не энфорсят наличие кода - вот сейчас на ICML ревьюил, и 2 из 3 статей код не приложили вообще.
Про явное соотнесение экспериментов в статье с кодом/данными/моделям для их запуска даже не говорю.
👍4🤔4
Наше сообщество ITMO OpenSource традиционно организует трек "Open Source" на конференции DataFest.
Этот год - не исключение. Уже открыта форма для подачи докладов на DataFest 2026 - так что начинаем собирать программу. Все заявки рассмотрим и дадим обратную связь.
Наш трек называется "Группа 3, DS/ML закулисье - Open Source"
В докладах особенно будут приветствоваться упор именно на опенсорсные аспекты - аналитику, лучшие практики, истории успехов или неудач.
Именно для презентации конкретных проектов лучше подходят смежные треки - но все решается индивидуально.
Дедлайн подачи доклада: 30 апреля
Даты самой конференции: 23 — 31 мая
Города: Москва, Санкт-Петербург, Новосибирск, Уфа (новая локация!), Алматы, Белград. Онлайн тоже можно.
Не затягивайте с подачами заявок - очные слоты могут закончиться!
Другие треки конференции можно посмотреть тут.
Этот год - не исключение. Уже открыта форма для подачи докладов на DataFest 2026 - так что начинаем собирать программу. Все заявки рассмотрим и дадим обратную связь.
Наш трек называется "Группа 3, DS/ML закулисье - Open Source"
В докладах особенно будут приветствоваться упор именно на опенсорсные аспекты - аналитику, лучшие практики, истории успехов или неудач.
Именно для презентации конкретных проектов лучше подходят смежные треки - но все решается индивидуально.
Дедлайн подачи доклада: 30 апреля
Даты самой конференции: 23 — 31 мая
Города: Москва, Санкт-Петербург, Новосибирск, Уфа (новая локация!), Алматы, Белград. Онлайн тоже можно.
Не затягивайте с подачами заявок - очные слоты могут закончиться!
Другие треки конференции можно посмотреть тут.
🔥4
Неприятная история в мире LLMOps-опенсорса: cерьёзно скомпрометирована популярная библиотека litellm 1.82.7+
The litellm==1.82.8 wheel package on PyPI contains a malicious .pth file (litellm_init.pth, 34,628 bytes) that automatically executes a credential-stealing script every time the Python interpreter starts — no import litellm required.
Судя по тому, что мейнтенеры закрывают issue по этой уязвимости - их тоже взломали.
Подробнее: описание атаки, обсуждение. Из pypi пакет уже убрали.
Кто использует - проверьте, что вы не затронуты.
The litellm==1.82.8 wheel package on PyPI contains a malicious .pth file (litellm_init.pth, 34,628 bytes) that automatically executes a credential-stealing script every time the Python interpreter starts — no import litellm required.
Судя по тому, что мейнтенеры закрывают issue по этой уязвимости - их тоже взломали.
Подробнее: описание атаки, обсуждение. Из pypi пакет уже убрали.
Кто использует - проверьте, что вы не затронуты.
🔥5😱4❤1🤣1
Хороший пример полезной научной Open Data на гидромет-тему. Сама задачу заполнения пропусков в метеоданных решала куча команд (включая нашу), статей на эту тему гора - но тут именно публикация открытого датасета позволяет это переиспользовать, избегая бессмысленного дублирования работы.
Но, к сожалению, сам код ML-пайплайна, которым обрабатывались данные, не выложен. Что конечно плохо - можно было бы и к другим данным применить, и этот датасет актуализировать по мере поступления новых измерений.
Но, к сожалению, сам код ML-пайплайна, которым обрабатывались данные, не выложен. Что конечно плохо - можно было бы и к другим данным применить, и этот датасет актуализировать по мере поступления новых измерений.
Forwarded from Зоопарк из слоновой кости
#зоопарк_одобряет
RusWeather-GF: "дневник российской погоды" за 44 года с привязкой к местности
Ученые из Почвенного института им. Докучаева (Москва) проделали колоссальную работу: собрали ежедневные данные по температуре и осадкам для 593 метеостанций России за 44 года (1980–2023), закрыв все пробелы и привязав станции к высокоточным топографическим моделям. Получился первый в своём роде открытый набор данных, готовый для любых климатических расчётов.
Кто-то скажет "такое уже было". Не совсем: в исходных архивах Росгидромета не хватало примерно 1.6% записей по температуре и 1.8% по осадкам. На первый взгляд, немного, но беда в том, что пробелы были распределены очень неравномерно. Восстановление данных делалось разными методами (несколько физических моделей + ИИ, подробнее в статье) - и получилось отлично, корреляция очень высокая.
Впервые к каждой станции привязали цифровую модель рельефа FABDEM v1.2 — высоту над уровнем моря, крутизну склона и шероховатость поверхности. Это критически важно для горных районов, где климат меняется на десятках метров.
Данные выложены на Zenodo, ну, а статья по мотивам проделанной работы вышла в Atmospheric Research (IF = 4.4). На картинке - распределение метеостанций в России
RusWeather-GF: "дневник российской погоды" за 44 года с привязкой к местности
Ученые из Почвенного института им. Докучаева (Москва) проделали колоссальную работу: собрали ежедневные данные по температуре и осадкам для 593 метеостанций России за 44 года (1980–2023), закрыв все пробелы и привязав станции к высокоточным топографическим моделям. Получился первый в своём роде открытый набор данных, готовый для любых климатических расчётов.
Кто-то скажет "такое уже было". Не совсем: в исходных архивах Росгидромета не хватало примерно 1.6% записей по температуре и 1.8% по осадкам. На первый взгляд, немного, но беда в том, что пробелы были распределены очень неравномерно. Восстановление данных делалось разными методами (несколько физических моделей + ИИ, подробнее в статье) - и получилось отлично, корреляция очень высокая.
Впервые к каждой станции привязали цифровую модель рельефа FABDEM v1.2 — высоту над уровнем моря, крутизну склона и шероховатость поверхности. Это критически важно для горных районов, где климат меняется на десятках метров.
Данные выложены на Zenodo, ну, а статья по мотивам проделанной работы вышла в Atmospheric Research (IF = 4.4). На картинке - распределение метеостанций в России
👍7❤1❤🔥1
Произошли обновления opensource LLM семейства GigaChat. Авторы заявляют следующие характеристики:
GigaChat 3.1 Ultra
- 702B параметров (36B активных на токен)
- Обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning
- Контекст 131K токенов
- GitVerse | HuggingFace
GigaChat 3.1 Lightning
- 10B параметров (1.8B активных)
- На аренах отвечает на уровне GPT-4o
- Сильна в function calling
- Серьёзный выигрыш по скорости за счёт MoE + MTP + FP8
- Контекст 256K токенов
- GitVerse | HuggingFace
Cтатья на Хабре с подробностями - https://habr.com/ru/companies/sberbank/articles/1014146/
Кто попробует - делитесь отзывами.
GigaChat 3.1 Ultra
- 702B параметров (36B активных на токен)
- Обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning
- Контекст 131K токенов
- GitVerse | HuggingFace
GigaChat 3.1 Lightning
- 10B параметров (1.8B активных)
- На аренах отвечает на уровне GPT-4o
- Сильна в function calling
- Серьёзный выигрыш по скорости за счёт MoE + MTP + FP8
- Контекст 256K токенов
- GitVerse | HuggingFace
Cтатья на Хабре с подробностями - https://habr.com/ru/companies/sberbank/articles/1014146/
Кто попробует - делитесь отзывами.
🔥5❤1👍1👎1🫡1
Сообщают, что произошло самопроизвольное выкатывание в опенсорс Claude Cade.
Почитать разбор произошедшего и анализ кода от Олега Чирухина можно тут:
https://habr.com/ru/companies/bar/articles/1017574/
Можно подглядеть промты, дизайн мультиагентной системы, наборы тулов и т.п.
Почитать разбор произошедшего и анализ кода от Олега Чирухина можно тут:
https://habr.com/ru/companies/bar/articles/1017574/
Можно подглядеть промты, дизайн мультиагентной системы, наборы тулов и т.п.
🔥11🤣1
Если кто-то завтра будет на Data Fusion - в 17-30 буду вести секцию "Open Source для ИИ".
https://www.data-fusion.ru/page-program-2026?active_day=9&session_id=68860
В повестке обсуждения
1. Роль открытого ПО в ускорении разработки и внедрения ИИ: где он дает максимальный эффект, а где польза от него может быть невелика.
2. Как меняется модель взаимодействия «университет — индустрия» в условиях открытых технологий и совместной разработки.
3. Как сократить путь от научного репозитория до промышленного внедрения.
4. Какие компетенции в области открытого ПО и ИИ становятся критически важными для специалистов и команд.
5. Мотивация бизнеса к открытию моделей, данных и инструментов: стратегические цели, риски и ограничения.
6. Практические кейсы: как опенсорс влияет на скорость вывода ИИ-продуктов на рынок и внедрение в реальный сектор экономики.
К сожалению, без трансляции, так что это для тех кто на площадке. Но по итогам постараемся сделать суммаризацию.
https://www.data-fusion.ru/page-program-2026?active_day=9&session_id=68860
В повестке обсуждения
1. Роль открытого ПО в ускорении разработки и внедрения ИИ: где он дает максимальный эффект, а где польза от него может быть невелика.
2. Как меняется модель взаимодействия «университет — индустрия» в условиях открытых технологий и совместной разработки.
3. Как сократить путь от научного репозитория до промышленного внедрения.
4. Какие компетенции в области открытого ПО и ИИ становятся критически важными для специалистов и команд.
5. Мотивация бизнеса к открытию моделей, данных и инструментов: стратегические цели, риски и ограничения.
6. Практические кейсы: как опенсорс влияет на скорость вывода ИИ-продуктов на рынок и внедрение в реальный сектор экономики.
К сожалению, без трансляции, так что это для тех кто на площадке. Но по итогам постараемся сделать суммаризацию.
🔥10👍1
Сегодня послушал дискуссию на секции Data Fusion под председательством Юрия Визильтера, посвященной отечественному академическому ИИ-сообществу.
Там был презентован полезный проект - open-source трекер российских конференций в области ИИ:
https://rnns-raai.github.io/rus-AI-science
Пока он очевидно не полон (сходу приходят в голову AINL, MathAI и другие достойные мероприятия), но инициатива хорошая, crowdsource-формат тут подходит для сбора информации.
Обещают добавить подробности про публикационные аспекты этих конференций, раздел для семинаров и т.п.
Законтрибьютить можно тут.
Также доступна полная запись сессии для интересующихся.
Там был презентован полезный проект - open-source трекер российских конференций в области ИИ:
https://rnns-raai.github.io/rus-AI-science
Пока он очевидно не полон (сходу приходят в голову AINL, MathAI и другие достойные мероприятия), но инициатива хорошая, crowdsource-формат тут подходит для сбора информации.
Обещают добавить подробности про публикационные аспекты этих конференций, раздел для семинаров и т.п.
Законтрибьютить можно тут.
Также доступна полная запись сессии для интересующихся.
🔥7❤1
Коллеги из SourceCraft и центра технологий для общества Yandex Cloud запустили полезный проект - открытую библиотеку авторских курсов, в котором собраны образовательные программы от вузов и научных организаций.
Библиотека доступна в формате репозитория: https://sourcecraft.dev/open-education-club-by-yandex/overview
На платформе уже представлены материалы по ИИ-ассистентам, облачным технологиям, анализу данных, а также курсы по оптимизации и машинному обучению.
В проекте уже поучаствовали более 20 вузов, среди которых МФТИ, ВШЭ, МАИ, а также преподаватели ШАД. Думаю, и от ИТМО кто-то скоро подключиться - свои курсы пока не успели достаточно причесать.
Предполагается постоянное обновление каталога курсов - любой преподаватель может предложить изменения в существующий курс через Pull Request.
Подробности про формат участия в программе доступны тут.
Библиотека доступна в формате репозитория: https://sourcecraft.dev/open-education-club-by-yandex/overview
На платформе уже представлены материалы по ИИ-ассистентам, облачным технологиям, анализу данных, а также курсы по оптимизации и машинному обучению.
В проекте уже поучаствовали более 20 вузов, среди которых МФТИ, ВШЭ, МАИ, а также преподаватели ШАД. Думаю, и от ИТМО кто-то скоро подключиться - свои курсы пока не успели достаточно причесать.
Предполагается постоянное обновление каталога курсов - любой преподаватель может предложить изменения в существующий курс через Pull Request.
Подробности про формат участия в программе доступны тут.
👍13❤3
Про проект CaleyPy уже писали - а тут анонсировали целое соревнование на его основе. Слово организаторам:
Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса.
Проект CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.
Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику 333 или 444 (любом из них) и тоже опубликовать публичное решение.
Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.
Подробности - https://t.me/sberlogabig/643
Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса.
Проект CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.
Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику 333 или 444 (любом из них) и тоже опубликовать публичное решение.
Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.
Подробности - https://t.me/sberlogabig/643
🔥12❤1
Попался в ленте хороший пример здорового сценария для нишевого научного опенсорса:
Обновление сделанного 6 лет назад открытого гидрологического плагина для векторизации рек в QGIS оказалось востребованным и нашло свою аудиторию даже на линкедине.
Комментарии позитивные, в духе "Thanks! I’ve been doing this manually".
Репозиторий тут, есть ещё лонгрид "Stream Ordering: How And Why a Geo-Scientist Sometimes Needed to Rank Rivers on a Map". Оба автора проекта - в нашем чате)
Обновление сделанного 6 лет назад открытого гидрологического плагина для векторизации рек в QGIS оказалось востребованным и нашло свою аудиторию даже на линкедине.
Комментарии позитивные, в духе "Thanks! I’ve been doing this manually".
Репозиторий тут, есть ещё лонгрид "Stream Ordering: How And Why a Geo-Scientist Sometimes Needed to Rank Rivers on a Map". Оба автора проекта - в нашем чате)
🔥9❤2
Forwarded from Al Talent Hub
22 апреля в 19:00
В гости к сооснователю AI Talent Hub и CEO @Napoleon_IT — Павлу Подкорытову придут:
— эксперт в AI и аналитике, автор книги «Machine Learning System Design», руководит ML/DS-отделом 500+ человек в одной из крупнейших корпораций. Ведёт канал @cryptovalerii
— управляет ИИ-департаментом в Cloud.ru, строит POC-агентов и мультиагентные системы. Ведёт канал @ai_is_you
— CEO Napoleon AI, ex-Sber AI, ex-MTS BigData/CDO MTS Travel. Ведёт канал @stpnv_ai
Обсудим:
— нужны ли сегодня кодеры?
— как усилить себя ИИ-агентами?
— как меняется профиль успешного человека в AI-first мире?
ЗАРЕГИСТРИРОВАТЬСЯ
@aitalenthubnews
#ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Знаю, что среди подписчиков канала есть те, кто сейчас находится на конференции ICLR в далекой Бразилии.
А тут как раз энтузиасты собрали подборку статей с этой конференции, к которым приложены открытый код и данные:
https://www.paperdigest.org/2026/04/iclr-2026-papers-with-code-data/
Печально, что ссылки на таковые были найдены только в 22% из 5,300+ принятых статей.
Не факт конечно, что все ссылки были успешно автоматически детектированы - для избежания таких проблем авторам полезно выносить URL репозитория прямо в abstract.
А тут как раз энтузиасты собрали подборку статей с этой конференции, к которым приложены открытый код и данные:
https://www.paperdigest.org/2026/04/iclr-2026-papers-with-code-data/
Печально, что ссылки на таковые были найдены только в 22% из 5,300+ принятых статей.
Не факт конечно, что все ссылки были успешно автоматически детектированы - для избежания таких проблем авторам полезно выносить URL репозитория прямо в abstract.
👍9❤2🦄2
ТАСС пишут про проект от коллег из Industrial AI Lab Института ИИ ИТМО - библиотеку DocuMentor.
DocuMentor позволяет с высокой точностью (до 98%) извлекать иерархическую структуру PDF-файлов: заголовки, таблицы, формулы, изображения. Библиотека работает на основе локальной VLM, поддерживает PDF, DOCX и Markdown, а ошибок при распознавании слов даёт в 6–10 раз меньше аналогов. Реализация - на Python.
В репозитории есть пример сравнения с конкурирующими решениями - Marker и Dedoc (разработка ИСП РАН).
Звёзды и отзывы приветствуются: https://github.com/aimclub/documentor
DocuMentor позволяет с высокой точностью (до 98%) извлекать иерархическую структуру PDF-файлов: заголовки, таблицы, формулы, изображения. Библиотека работает на основе локальной VLM, поддерживает PDF, DOCX и Markdown, а ошибок при распознавании слов даёт в 6–10 раз меньше аналогов. Реализация - на Python.
В репозитории есть пример сравнения с конкурирующими решениями - Marker и Dedoc (разработка ИСП РАН).
Звёзды и отзывы приветствуются: https://github.com/aimclub/documentor
🔥22
Тут выложили выступление c недавнего Yandex Backend Talks про балансировку в Яндекс Диске.
Интересно то, что улучшением алгоритма балансировки занималась команда Industrial AI Lab ИТМО под руководством Дениса Насонова (ранее про это писали на Хабре).
Это к обсуждениям в чате о сценариях партнерства между индустрией и университетами.
(В трансляции - начиная с 1:03:10)
Интересно то, что улучшением алгоритма балансировки занималась команда Industrial AI Lab ИТМО под руководством Дениса Насонова (ранее про это писали на Хабре).
Это к обсуждениям в чате о сценариях партнерства между индустрией и университетами.
(В трансляции - начиная с 1:03:10)
🔥5