Научный опенсорс
950 subscribers
109 photos
1 video
1 file
179 links
Канал сообщества ITMO OpenSource, посвященного созданию и использованию наукоёмких open-source проектов, в том числе в области AI/ML.

Чат: https://t.me/itmo_opensource

По всем вопросам - @nicl_nno
Download Telegram
Наше сообщество ITMO OpenSource традиционно организует трек "Open Source" на конференции DataFest.

Этот год - не исключение. Уже открыта форма для подачи докладов на DataFest 2026 - так что начинаем собирать программу. Все заявки рассмотрим и дадим обратную связь.

Наш трек называется "Группа 3, DS/ML закулисье - Open Source"

В докладах особенно будут приветствоваться упор именно на опенсорсные аспекты - аналитику, лучшие практики, истории успехов или неудач.
Именно для презентации конкретных проектов лучше подходят смежные треки - но все решается индивидуально.

Дедлайн подачи доклада: 30 апреля
Даты самой конференции: 23 — 31 мая
Города: Москва, Санкт-Петербург, Новосибирск, Уфа (новая локация!), Алматы, Белград. Онлайн тоже можно.

Не затягивайте с подачами заявок - очные слоты могут закончиться!

Другие треки конференции можно посмотреть тут.
🔥4
Неприятная история в мире LLMOps-опенсорса: cерьёзно скомпрометирована популярная библиотека litellm 1.82.7+

The litellm==1.82.8 wheel package on PyPI contains a malicious .pth file (litellm_init.pth, 34,628 bytes) that automatically executes a credential-stealing script every time the Python interpreter starts — no import litellm required.

Судя по тому, что мейнтенеры закрывают issue по этой уязвимости - их тоже взломали.

Подробнее: описание атаки, обсуждение. Из pypi пакет уже убрали.

Кто использует - проверьте, что вы не затронуты.
🔥5😱41🤣1
Хороший пример полезной научной Open Data на гидромет-тему. Сама задачу заполнения пропусков в метеоданных решала куча команд (включая нашу), статей на эту тему гора - но тут именно публикация открытого датасета позволяет это переиспользовать, избегая бессмысленного дублирования работы.

Но, к сожалению, сам код ML-пайплайна, которым обрабатывались данные, не выложен. Что конечно плохо - можно было бы и к другим данным применить, и этот датасет актуализировать по мере поступления новых измерений.
#зоопарк_одобряет

RusWeather-GF: "дневник российской погоды" за 44 года с привязкой к местности

Ученые из Почвенного института им. Докучаева (Москва) проделали колоссальную работу: собрали ежедневные данные по температуре и осадкам для 593 метеостанций России за 44 года (1980–2023), закрыв все пробелы и привязав станции к высокоточным топографическим моделям. Получился первый в своём роде открытый набор данных, готовый для любых климатических расчётов.

Кто-то скажет "такое уже было". Не совсем: в исходных архивах Росгидромета не хватало примерно 1.6% записей по температуре и 1.8% по осадкам. На первый взгляд, немного, но беда в том, что пробелы были распределены очень неравномерно. Восстановление данных делалось разными методами (несколько физических моделей + ИИ, подробнее в статье) - и получилось отлично, корреляция очень высокая.

Впервые к каждой станции привязали цифровую модель рельефа FABDEM v1.2 — высоту над уровнем моря, крутизну склона и шероховатость поверхности. Это критически важно для горных районов, где климат меняется на десятках метров.

Данные выложены на Zenodo, ну, а статья по мотивам проделанной работы вышла в Atmospheric Research (IF = 4.4). На картинке - распределение метеостанций в России
👍71❤‍🔥1
Произошли обновления opensource LLM семейства GigaChat. Авторы заявляют следующие характеристики:

GigaChat 3.1 Ultra

- 702B параметров (36B активных на токен)
- Обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning
- Контекст 131K токенов
- GitVerse | HuggingFace

GigaChat 3.1 Lightning
- 10B параметров (1.8B активных)
- На аренах отвечает на уровне GPT-4o
- Сильна в function calling
- Серьёзный выигрыш по скорости за счёт MoE + MTP + FP8
- Контекст 256K токенов
- GitVerse | HuggingFace

Cтатья на Хабре с подробностями - https://habr.com/ru/companies/sberbank/articles/1014146/

Кто попробует - делитесь отзывами.
🔥51👍1👎1🫡1
Сообщают, что произошло самопроизвольное выкатывание в опенсорс Claude Cade.

Почитать разбор произошедшего и анализ кода от Олега Чирухина можно тут:
https://habr.com/ru/companies/bar/articles/1017574/

Можно подглядеть промты, дизайн мультиагентной системы, наборы тулов и т.п.
🔥11🤣1
Если кто-то завтра будет на Data Fusion - в 17-30 буду вести секцию "Open Source для ИИ".

https://www.data-fusion.ru/page-program-2026?active_day=9&session_id=68860

В повестке обсуждения
1. Роль открытого ПО в ускорении разработки и внедрения ИИ: где он дает максимальный эффект, а где польза от него может быть невелика.
2. Как меняется модель взаимодействия «университет — индустрия» в условиях открытых технологий и совместной разработки.
3. Как сократить путь от научного репозитория до промышленного внедрения.
4. Какие компетенции в области открытого ПО и ИИ становятся критически важными для специалистов и команд.
5. Мотивация бизнеса к открытию моделей, данных и инструментов: стратегические цели, риски и ограничения.
6. Практические кейсы: как опенсорс влияет на скорость вывода ИИ-продуктов на рынок и внедрение в реальный сектор экономики.

К сожалению, без трансляции, так что это для тех кто на площадке. Но по итогам постараемся сделать суммаризацию.
🔥10👍1
Сегодня послушал дискуссию на секции Data Fusion под председательством Юрия Визильтера, посвященной отечественному академическому ИИ-сообществу.

Там был презентован полезный проект - open-source трекер российских конференций в области ИИ:
https://rnns-raai.github.io/rus-AI-science

Пока он очевидно не полон (сходу приходят в голову AINL, MathAI и другие достойные мероприятия), но инициатива хорошая, crowdsource-формат тут подходит для сбора информации.

Обещают добавить подробности про публикационные аспекты этих конференций, раздел для семинаров и т.п.

Законтрибьютить можно тут.
Также доступна полная запись сессии для интересующихся.
🔥71
Коллеги из SourceCraft и центра технологий для общества Yandex Cloud запустили полезный проект - открытую библиотеку авторских курсов, в котором собраны образовательные программы от вузов и научных организаций.

Библиотека доступна в формате репозитория: https://sourcecraft.dev/open-education-club-by-yandex/overview

На платформе уже представлены материалы по ИИ-ассистентам, облачным технологиям, анализу данных, а также курсы по оптимизации и машинному обучению.
В проекте уже поучаствовали более 20 вузов, среди которых МФТИ, ВШЭ, МАИ, а также преподаватели ШАД. Думаю, и от ИТМО кто-то скоро подключиться - свои курсы пока не успели достаточно причесать.

Предполагается постоянное обновление каталога курсов - любой преподаватель может предложить изменения в существующий курс через Pull Request.

Подробности про формат участия в программе доступны тут.
👍133
Про проект CaleyPy уже писали - а тут анонсировали целое соревнование на его основе. Слово организаторам:

Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса.

Проект
CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.

Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе
Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику
333 или 444 (любом из них) и тоже опубликовать публичное решение.

Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены
NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.

Подробности - https://t.me/sberlogabig/643
🔥121
Попался в ленте хороший пример здорового сценария для нишевого научного опенсорса:

Обновление сделанного 6 лет назад открытого гидрологического плагина для векторизации рек в QGIS оказалось востребованным и нашло свою аудиторию даже на линкедине.

Комментарии позитивные, в духе "Thanks! I’ve been doing this manually".

Репозиторий тут, есть ещё лонгрид "Stream Ordering: How And Why a Geo-Scientist Sometimes Needed to Rank Rivers on a Map". Оба автора проекта - в нашем чате)
🔥92
Forwarded from Al Talent Hub
💀Разработка мертва? → разберёмся в новом #OpenTalks🆕

22 апреля в 19:00

В гости к сооснователю AI Talent Hub и CEO @Napoleon_IT — Павлу Подкорытову придут:

🎙 Валерий Бабушкин
— эксперт в AI и аналитике, автор книги «Machine Learning System Design», руководит ML/DS-отделом 500+ человек в одной из крупнейших корпораций. Ведёт канал @cryptovalerii


🎙 Дмитрий Юдин
— управляет ИИ-департаментом в Cloud.ru, строит POC-агентов и мультиагентные системы. Ведёт канал @ai_is_you


🎙 Михаил Степнов
— CEO Napoleon AI, ex-Sber AI, ex-MTS BigData/CDO MTS Travel. Ведёт канал @stpnv_ai


Обсудим:
— нужны ли сегодня кодеры?
— как усилить себя ИИ-агентами?
— как меняется профиль успешного человека в AI-first мире?

Не увидел важный вопросРегистрируйся и задай его прямо в эфире или оставь в форме — мы спросим!

ЗАРЕГИСТРИРОВАТЬСЯ 🛜

@aitalenthubnews
#ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Знаю, что среди подписчиков канала есть те, кто сейчас находится на конференции ICLR в далекой Бразилии.

А тут как раз энтузиасты собрали подборку статей с этой конференции, к которым приложены открытый код и данные:

https://www.paperdigest.org/2026/04/iclr-2026-papers-with-code-data/

Печально, что ссылки на таковые были найдены только в 22% из 5,300+ принятых статей.

Не факт конечно, что все ссылки были успешно автоматически детектированы - для избежания таких проблем авторам полезно выносить URL репозитория прямо в abstract.
👍92🦄2
ТАСС пишут про проект от коллег из Industrial AI Lab Института ИИ ИТМО - библиотеку DocuMentor.

DocuMentor позволяет с высокой точностью (до 98%) извлекать иерархическую структуру PDF-файлов: заголовки, таблицы, формулы, изображения. Библиотека работает на основе локальной VLM, поддерживает PDF, DOCX и Markdown, а ошибок при распознавании слов даёт в 6–10 раз меньше аналогов. Реализация - на Python.

В репозитории есть пример сравнения с конкурирующими решениями - Marker и Dedoc (разработка ИСП РАН).

Звёзды и отзывы приветствуются: https://github.com/aimclub/documentor
🔥22
Тут выложили выступление c недавнего Yandex Backend Talks про балансировку в Яндекс Диске.

Интересно то, что улучшением алгоритма балансировки занималась команда Industrial AI Lab ИТМО под руководством Дениса Насонова (ранее про это писали на Хабре).

Это к обсуждениям в чате о сценариях партнерства между индустрией и университетами.

(В трансляции - начиная с 1:03:10)
🔥5
Сообщают, что силами HuggingFace возрожден известный ML-кругах Papers With Code - теперь на домене https://paperswithcode.co/

Можно смотреть тренды, фильтровать статьи по областям и применяемым методам, искать для них бенчмарки и SOTA.

Инициатива позитивная, надеюсь сподвигнет авторов статей хоть немного использовать опенсорс-практики, о которых много говорят, но почему-то применяют довольно ограниченно.
🔥11👍2
Публикуем расписание нашей секции Open Source на DataFest 2026 - https://ods.ai/events/datafest2026:

Онлайн
(30.05, 12:00) - https://ods.ai/events/df2026-30-may-online:

1) Марина Кошелева, руководитель проектов, Центр технологий для общества Yandex Cloud:
Как мы делали библиотеку-опенсорс курсов от преподавателей вузов

2) Михаил Гущин, ведущий научный сотрудник, зам. зав. лаб, руководитель проекта по открытому коду Факультета компьютерных наук ФКН НИУ ВШЭ:
Научные открытые проекты

3) Юрий Барамыков, старший руководитель проекта, Иннотех:
ggmlR:Vulkan GPU-бэкенд для R

Ссылка на трансляцию онлайна - https://dion.vc/event/datafest-kb.

Белград, 31.05 - https://ods.ai/events/fest2026-fon-belgrade

4) Алексей Васильев, исполнительный директор по исследованию данных, Sber AI Lab:
SplitLight: RecSys Evaluation Toolkit

5) Илья Шагабеев, ML Researcher, Langswap app
AI video dubbing with open source - How we’ve built speech-to-speech pipeline and what we’ve learned from it
🔥91
Вкину анонс весеннего слета FPGA-сообщества от YADRO.

От ИТМО на нем выступит Иван Дейнека: к.т.н, доцент Высшей инженерно-технической школы и автор open-source "Руководства по реализации Edge AI на FPGA" .

Почитать руководство (или даже законтрибьютить в него) можно тут: https://github.com/debreti/nirsii-fpgai

Подробности про мероприятие:

26 мая в 19:00 приглашаем вас присоединиться к онлайн-трансляции. В этот раз поговорим об RTL-разработке и синтезе, документировании RTL и применении ИИ в FPGA/ASIC-разработке. Среди тем выступлений:
🔸open-source-инструмент Yosys,
🔸применение и преобразование SystemRDL в читаемую документацию,
🔸реализация Edge AI на программируемой логике,
🔸CLI-инструмент для анализа вейвформ с помощью LLM.

Своим опытом поделятся эксперты YADRO, ИТМО и независимые RTL-разработчики. Чтобы получить ссылку на трансляцию и все материалы,
зарегистрируйтесь.

Доклад Ивана будет про "Edge AI на ПЛИС: тенденции и руководство по размещению".

Аннотация следующая: "В докладе расскажу о преимуществах реализации концепции Edge AI на программируемой логике. Продемонстрирую практическое руководство по размещению нейросетей на FPGA и разберу реализацию полносвязной сети на языке описания аппаратуры, а также свёрточной сети через высокоуровневый синтез."
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8
Напоминают, что через неделю - дедлайн подачи докладов на большой и душевный PyCon 2026.

В прошлом году (как время летит...) рассказывали там про наш проект OSA (жив, активно развивается, новые фичи - в репо) - так что можно подтвердить, что мероприятие содержательное и дружелюбное к новым участникам. Ещё и на ВДНХ проходит.

Так что кто хотел поучаствовать - успевайте.
🔥5
Некоторое время назад писали про то, что у теперь ИТМО есть опенсорс-витрина - https://opensource.itmo.ru/

И вот недавно команда первокурсников-бакалавров из учебно-научной лаборатории АИСТ (факультет технологий ИИ ИТМО) добавила к ней пайплайн обновления через github.

Раньше на витрине был статичный перечень лабораторий и их открытых репозиториев, заполняемый вручную администраторами сайта.

После новых обновлений всё можно делать самостоятельно представителям лабораторий:

1) Все данные о проектах - в репозитории https://github.com/itmo-ai/itmo-open-source-list
2) Обновление информации и внесение новые проектов - через Pull Request-ы
3) После вливания в master-ветку - обновления сразу на сайте.

Так что если вы из ИТМО и у вашей лаборатории есть открытый код, а мы его не учли - смело вносите правки!

Инструкции и подобности, как добавлять свои проекты - в README репозитория. Весь код фронтенда и бекенда тоже открыт.

P.S. А скоро на сайте появится ещё и автоматически собираемый граф знаний по всей опенсорс-экосистеме ИТМО, с оценками качества оформления, документирования и воспроизводимости связанных с ними научных работ! Но про это и про 🕷 напишем отдельно.
🔥16