Научный опенсорс
950 subscribers
109 photos
1 video
1 file
179 links
Канал сообщества ITMO OpenSource, посвященного созданию и использованию наукоёмких open-source проектов, в том числе в области AI/ML.

Чат: https://t.me/itmo_opensource

По всем вопросам - @nicl_nno
Download Telegram
Если кто-то завтра будет на Data Fusion - в 17-30 буду вести секцию "Open Source для ИИ".

https://www.data-fusion.ru/page-program-2026?active_day=9&session_id=68860

В повестке обсуждения
1. Роль открытого ПО в ускорении разработки и внедрения ИИ: где он дает максимальный эффект, а где польза от него может быть невелика.
2. Как меняется модель взаимодействия «университет — индустрия» в условиях открытых технологий и совместной разработки.
3. Как сократить путь от научного репозитория до промышленного внедрения.
4. Какие компетенции в области открытого ПО и ИИ становятся критически важными для специалистов и команд.
5. Мотивация бизнеса к открытию моделей, данных и инструментов: стратегические цели, риски и ограничения.
6. Практические кейсы: как опенсорс влияет на скорость вывода ИИ-продуктов на рынок и внедрение в реальный сектор экономики.

К сожалению, без трансляции, так что это для тех кто на площадке. Но по итогам постараемся сделать суммаризацию.
🔥10👍1
Сегодня послушал дискуссию на секции Data Fusion под председательством Юрия Визильтера, посвященной отечественному академическому ИИ-сообществу.

Там был презентован полезный проект - open-source трекер российских конференций в области ИИ:
https://rnns-raai.github.io/rus-AI-science

Пока он очевидно не полон (сходу приходят в голову AINL, MathAI и другие достойные мероприятия), но инициатива хорошая, crowdsource-формат тут подходит для сбора информации.

Обещают добавить подробности про публикационные аспекты этих конференций, раздел для семинаров и т.п.

Законтрибьютить можно тут.
Также доступна полная запись сессии для интересующихся.
🔥71
Коллеги из SourceCraft и центра технологий для общества Yandex Cloud запустили полезный проект - открытую библиотеку авторских курсов, в котором собраны образовательные программы от вузов и научных организаций.

Библиотека доступна в формате репозитория: https://sourcecraft.dev/open-education-club-by-yandex/overview

На платформе уже представлены материалы по ИИ-ассистентам, облачным технологиям, анализу данных, а также курсы по оптимизации и машинному обучению.
В проекте уже поучаствовали более 20 вузов, среди которых МФТИ, ВШЭ, МАИ, а также преподаватели ШАД. Думаю, и от ИТМО кто-то скоро подключиться - свои курсы пока не успели достаточно причесать.

Предполагается постоянное обновление каталога курсов - любой преподаватель может предложить изменения в существующий курс через Pull Request.

Подробности про формат участия в программе доступны тут.
👍133
Про проект CaleyPy уже писали - а тут анонсировали целое соревнование на его основе. Слово организаторам:

Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса.

Проект
CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.

Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе
Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику
333 или 444 (любом из них) и тоже опубликовать публичное решение.

Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены
NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.

Подробности - https://t.me/sberlogabig/643
🔥121
Попался в ленте хороший пример здорового сценария для нишевого научного опенсорса:

Обновление сделанного 6 лет назад открытого гидрологического плагина для векторизации рек в QGIS оказалось востребованным и нашло свою аудиторию даже на линкедине.

Комментарии позитивные, в духе "Thanks! I’ve been doing this manually".

Репозиторий тут, есть ещё лонгрид "Stream Ordering: How And Why a Geo-Scientist Sometimes Needed to Rank Rivers on a Map". Оба автора проекта - в нашем чате)
🔥92
Forwarded from Al Talent Hub
💀Разработка мертва? → разберёмся в новом #OpenTalks🆕

22 апреля в 19:00

В гости к сооснователю AI Talent Hub и CEO @Napoleon_IT — Павлу Подкорытову придут:

🎙 Валерий Бабушкин
— эксперт в AI и аналитике, автор книги «Machine Learning System Design», руководит ML/DS-отделом 500+ человек в одной из крупнейших корпораций. Ведёт канал @cryptovalerii


🎙 Дмитрий Юдин
— управляет ИИ-департаментом в Cloud.ru, строит POC-агентов и мультиагентные системы. Ведёт канал @ai_is_you


🎙 Михаил Степнов
— CEO Napoleon AI, ex-Sber AI, ex-MTS BigData/CDO MTS Travel. Ведёт канал @stpnv_ai


Обсудим:
— нужны ли сегодня кодеры?
— как усилить себя ИИ-агентами?
— как меняется профиль успешного человека в AI-first мире?

Не увидел важный вопросРегистрируйся и задай его прямо в эфире или оставь в форме — мы спросим!

ЗАРЕГИСТРИРОВАТЬСЯ 🛜

@aitalenthubnews
#ITMO #NapoleonIT
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Знаю, что среди подписчиков канала есть те, кто сейчас находится на конференции ICLR в далекой Бразилии.

А тут как раз энтузиасты собрали подборку статей с этой конференции, к которым приложены открытый код и данные:

https://www.paperdigest.org/2026/04/iclr-2026-papers-with-code-data/

Печально, что ссылки на таковые были найдены только в 22% из 5,300+ принятых статей.

Не факт конечно, что все ссылки были успешно автоматически детектированы - для избежания таких проблем авторам полезно выносить URL репозитория прямо в abstract.
👍92🦄2
ТАСС пишут про проект от коллег из Industrial AI Lab Института ИИ ИТМО - библиотеку DocuMentor.

DocuMentor позволяет с высокой точностью (до 98%) извлекать иерархическую структуру PDF-файлов: заголовки, таблицы, формулы, изображения. Библиотека работает на основе локальной VLM, поддерживает PDF, DOCX и Markdown, а ошибок при распознавании слов даёт в 6–10 раз меньше аналогов. Реализация - на Python.

В репозитории есть пример сравнения с конкурирующими решениями - Marker и Dedoc (разработка ИСП РАН).

Звёзды и отзывы приветствуются: https://github.com/aimclub/documentor
🔥22
Тут выложили выступление c недавнего Yandex Backend Talks про балансировку в Яндекс Диске.

Интересно то, что улучшением алгоритма балансировки занималась команда Industrial AI Lab ИТМО под руководством Дениса Насонова (ранее про это писали на Хабре).

Это к обсуждениям в чате о сценариях партнерства между индустрией и университетами.

(В трансляции - начиная с 1:03:10)
🔥5
Сообщают, что силами HuggingFace возрожден известный ML-кругах Papers With Code - теперь на домене https://paperswithcode.co/

Можно смотреть тренды, фильтровать статьи по областям и применяемым методам, искать для них бенчмарки и SOTA.

Инициатива позитивная, надеюсь сподвигнет авторов статей хоть немного использовать опенсорс-практики, о которых много говорят, но почему-то применяют довольно ограниченно.
🔥11👍2
Публикуем расписание нашей секции Open Source на DataFest 2026 - https://ods.ai/events/datafest2026:

Онлайн
(30.05, 12:00) - https://ods.ai/events/df2026-30-may-online:

1) Марина Кошелева, руководитель проектов, Центр технологий для общества Yandex Cloud:
Как мы делали библиотеку-опенсорс курсов от преподавателей вузов

2) Михаил Гущин, ведущий научный сотрудник, зам. зав. лаб, руководитель проекта по открытому коду Факультета компьютерных наук ФКН НИУ ВШЭ:
Научные открытые проекты

3) Юрий Барамыков, старший руководитель проекта, Иннотех:
ggmlR:Vulkan GPU-бэкенд для R

Ссылка на трансляцию онлайна - https://dion.vc/event/datafest-kb.

Белград, 31.05 - https://ods.ai/events/fest2026-fon-belgrade

4) Алексей Васильев, исполнительный директор по исследованию данных, Sber AI Lab:
SplitLight: RecSys Evaluation Toolkit

5) Илья Шагабеев, ML Researcher, Langswap app
AI video dubbing with open source - How we’ve built speech-to-speech pipeline and what we’ve learned from it
🔥91
Вкину анонс весеннего слета FPGA-сообщества от YADRO.

От ИТМО на нем выступит Иван Дейнека: к.т.н, доцент Высшей инженерно-технической школы и автор open-source "Руководства по реализации Edge AI на FPGA" .

Почитать руководство (или даже законтрибьютить в него) можно тут: https://github.com/debreti/nirsii-fpgai

Подробности про мероприятие:

26 мая в 19:00 приглашаем вас присоединиться к онлайн-трансляции. В этот раз поговорим об RTL-разработке и синтезе, документировании RTL и применении ИИ в FPGA/ASIC-разработке. Среди тем выступлений:
🔸open-source-инструмент Yosys,
🔸применение и преобразование SystemRDL в читаемую документацию,
🔸реализация Edge AI на программируемой логике,
🔸CLI-инструмент для анализа вейвформ с помощью LLM.

Своим опытом поделятся эксперты YADRO, ИТМО и независимые RTL-разработчики. Чтобы получить ссылку на трансляцию и все материалы,
зарегистрируйтесь.

Доклад Ивана будет про "Edge AI на ПЛИС: тенденции и руководство по размещению".

Аннотация следующая: "В докладе расскажу о преимуществах реализации концепции Edge AI на программируемой логике. Продемонстрирую практическое руководство по размещению нейросетей на FPGA и разберу реализацию полносвязной сети на языке описания аппаратуры, а также свёрточной сети через высокоуровневый синтез."
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8
Напоминают, что через неделю - дедлайн подачи докладов на большой и душевный PyCon 2026.

В прошлом году (как время летит...) рассказывали там про наш проект OSA (жив, активно развивается, новые фичи - в репо) - так что можно подтвердить, что мероприятие содержательное и дружелюбное к новым участникам. Ещё и на ВДНХ проходит.

Так что кто хотел поучаствовать - успевайте.
🔥5
Некоторое время назад писали про то, что у теперь ИТМО есть опенсорс-витрина - https://opensource.itmo.ru/

И вот недавно команда первокурсников-бакалавров из учебно-научной лаборатории АИСТ (факультет технологий ИИ ИТМО) добавила к ней пайплайн обновления через github.

Раньше на витрине был статичный перечень лабораторий и их открытых репозиториев, заполняемый вручную администраторами сайта.

После новых обновлений всё можно делать самостоятельно представителям лабораторий:

1) Все данные о проектах - в репозитории https://github.com/itmo-ai/itmo-open-source-list
2) Обновление информации и внесение новые проектов - через Pull Request-ы
3) После вливания в master-ветку - обновления сразу на сайте.

Так что если вы из ИТМО и у вашей лаборатории есть открытый код, а мы его не учли - смело вносите правки!

Инструкции и подобности, как добавлять свои проекты - в README репозитория. Весь код фронтенда и бекенда тоже открыт.

P.S. А скоро на сайте появится ещё и автоматически собираемый граф знаний по всей опенсорс-экосистеме ИТМО, с оценками качества оформления, документирования и воспроизводимости связанных с ними научных работ! Но про это и про 🕷 напишем отдельно.
🔥16
Научный опенсорс
Публикуем расписание нашей секции Open Source на DataFest 2026 - https://ods.ai/events/datafest2026: Онлайн (30.05, 12:00) - https://ods.ai/events/df2026-30-may-online: 1) Марина Кошелева, руководитель проектов, Центр технологий для общества Yandex Cloud:…
Наша сегодняшняя онлайн-секция Open Source начинается меньше чем через пол-часа!

Ровно в 12-00 мск стартуем. Будут доклады от представителей Yandex Cloud, ФКН ВШЭ и Иннотеха.

Ссылка на трансляцию - https://dion.vc/event/datafest-kb (нужно нажимать "Войти как гость")

Задавать вопросы докладчикам можно в чате трансляция или здесь в комментариях.

Подробности по программе - тут.
🔥93
А тем временем, сегодня в 11-20 мск на онлайн-треке ML & Education Датасеста - доклад сотрудника нашей лаборатории Андрея Гетманова:

"OSA.Edu: Как мы разработали и внедрили систему проверки кода в студенческих работах"

В нем Андрей поделится результатами эксперимента, которые провели силами участников учебно-научной лаборатории АИСТ, а также студентов и аспирантов факультета технологий ИИ ИТМО.

В чем суть: мы прогнали репозитории магистерских ВКР через наш мультиагентный LLM-инструмент для улучшения научного кода https://github.com/aimclub/OSA . Созданная специально под этот эксперимент функциональность OSA.Edu позволяет автоматически анализировать студенческие работы по трём направлениям: оформление репозитория, качество кода и воспроизводимость ВКР.

Для оценки воспроизводимости анализировался текст ВКР и содержимое репозитория - насколько то, что описано в работе, можно в принципе повторить на основе предоставленного кода. Для каждого утверждения из текста OSA ищет соответствующую кодовую реализацию (или датасет) и помечает его как реализованное или нет, с указанием конкретного файла.

На картинке - фрагмент отчета по результатам анализа.

Сам трек уже начался, так что можно присоединяться и раньше.

Ссылка:
https://dion.vc/event/datafest-b
7🔥4
Опубликованы результаты конкурса грантов Yandex Open Source, который проводится совместно с платформой SourceCraft. В этом году число победителей выросло с 12 до 18, в трех треках: данные, разработка и ИИ.

Вот некоторые из выигравших проектов (полный список - на странице с результатами):

Данные
- libmdbx - встраиваемая key-value БД;
- DRUI - веб-интерфейс для приватного Docker Registry.

Разработка
- mlut - CSS-инструментарий на базе Sass с предсказуемым синтаксисом, JIT-движком и плагинами для Vite/Webpack;
- libdatachannel-extented - Расширенный форк Libdatachannel, открытой реализации WebRTC .
- libBeresta - генерация PDF на чистом ANSI C, форк libHaru с модульной архитектурой.

ИИ
- langchain-localai - быстрый коннектор к LocalAI для LangChain с асинхронностью и поддержкой реранжирования;
- Auto AI Router - прокси-маршрутизатор для OpenAI, Anthropic, Gemini и Vertex AI с балансировкой и защитой от флуда;
- np - numpy-подобная библиотека для N-мерных массивов на C++;
- portfolio-system-architect - платформа AI-оркестрации;
- RAGU - GraphRAG-движок для построения графов знаний с несколькими стратегиями поиска.

Кстати, с командой упомянутого выше RAGU (gh, sc) мы в ИТМО сейчас плотно сотрудничаем - в том числе в направлении эффективного RAG-а для мультиагентных систем. Также, среди авторов проектов уже есть студенты бакалавриата ИТМО (причем с нашего же факультета технологий ИИ).

Подробности о проектах - на Хабре.
7🔥5
Коллеги из ICT Moscow совместно с МосХабом опубликовали обзор - "Что представляет собой отечественный Open Source в 2026 году".

Основные выводы от авторов:

индивидуальные разработчики, команды компаний, а также научных и образовательных учреждений и контрибьюторы образуют ядро отечественного Open Source;
• большинство участников инициатив Open Source занимаются этим бескорыстно;
• после 2022 года снижается число новых проектов от российских авторов на GitHub, однако растет их количество на площадке для ИИ — Hugging Face;
• средняя продолжительность развития самых первых репозиториев Open Source составляет 13 лет;
• в настоящее время доступно более пяти отечественных репозиториев для размещения кода;
• по некоторым оценкам, в 2026 году уровень использования компаниями открытого кода приблизился к 90%;
• абсолютным лидером среди регионов по числу проектов в открытом доступе является Москва;
• фрагментарность внутренних сообществ, отсутствие системности и культуры совместной разработки создают естественные барьеры для российского Open Source;
• одно из возможных направлений, в котором ожидается наибольшая активность в развитии Open Source в ближайшие годы, — это искусственный интеллект.


Радует, что в отчете многократно упоминается наше исследование про ML/Data-опенсорс, а также опыт сообщества ITMO Opensource в целом.
🔥8👍2
Коллеги из AIRI выложили в открытый доступ модель OCC-RAG.

Описание дают такое:
Она обучена отвечать на вопросы по внешним источникам, связывать факты из нескольких независимых частей текста, опираться только на предоставленный контекст и отказываться предоставлять ответ, если данных в источнике не хватает. Благодаря компактному размеру модель обрабатывает запросы в 1,5–2 раза быстрее решений на базе больших языковых моделей, тратя при этом на генерацию ответа в среднем в 1,5 раза меньше токенов.

Ссылки:
Технический репорт | GitHub | GitVerse | HuggingFace | Forbes

Подробности реализации от Ивана Оселедца закинул в наш чат. Кстати, на HF статью можно поддержать апвоутом - сейчас она уже в Paper of the Day.
🔥123
В GitVerse сообщают, что развернули актуальное зеркало PyPI:

https://t.me/gitversenews/912

Всячески надеюсь, что с доступом к оригинальному PyPI из наших сетей никогда не будет никаких проблем, но недавно были случаи перебоев - так что для внутренних серверов может и пригодится. Также представлены зеркала Docker Hub, Maven Central и NPM.

P.S. Ещё есть аналогичное зеркало от Яндекса.
👏83👎1🤬1🖕1