Научный опенсорс
950 subscribers
109 photos
1 video
1 file
179 links
Канал сообщества ITMO OpenSource, посвященного созданию и использованию наукоёмких open-source проектов, в том числе в области AI/ML.

Чат: https://t.me/itmo_opensource

По всем вопросам - @nicl_nno
Download Telegram
Анонс: Первый Scientific Open Source Meetup этого года - в феврале!

С радостью приглашаем всех на наш очередной Scientific Open Source Meetup, который пройдет 12 февраля 2026 года с 18:00 до 22:30 в Санкт-Петербурге в уютном лофте на Газовой, 10ж. Это отличная возможность встретиться, обсудить актуальные темы и поделиться опытом в мире открытого программного обеспечения!

Что вас ждет на митапе?

• Доклады от экспертов по разработке и применению Open Source
• Представление новых Open Source проектов и обсуждение лучших практик;
• Живое общение с коллегами и единомышленниками;
• Возможность задать вопросы и обсудить последние тренды в Open Source

Мероприятие проходит при поддержке OpenScaler — сообщества разработчиков ОС с открытым исходным кодом.

Дата: 12 февраля 2026 года
Время: 18:00 - 22:30
Место: Лофт на Газовой, 10ж

Участие бесплатное, но количество очных мест ограничено!
Ссылка на регистрацию - https://openmeetup.ru/

Ждем вас на митапе!
🔥122
А тем временем, начинаем публикацию программы нашего митапа, который пройдет 12.02 в 18-00. Вот перечень докладов с авторскими аннотациями:

- Школа-конкурс EDGE AI 2025: как мы первыми в России представили флагманский китайский стек для работы с ИИ-моделями на EDGE устройствах c OpenScaler OS // Владимир Павлов - Технический комитет сообщества OpenScaler

В докладе мы поделимся опытом сообщества OpenScaler по проведению соревнований в новом формате: студенческие ИИ-команды из ведущих вузов страны сначала проходили обучение у наших менторов, а затем соревновались на лучшую реализацию различных ИИ-моделей на краевых устройствах Orange Pi на базе чипов Ascend и ОС OpenScaler. Расскажем о самом конкурсе, командах и проектах студентов, которые были представлены в финале. Все учебные материалы были опубликованы в открытом доступе, а проекты финалистов размещены на платформе GitVerse.

- На пути к 100% генерации кода // Олег Чирухин - владелец продукта GigaIDE Cloud

Обсудим, насколько это вероятное будущее, и где мы сейчас находимся.

- OpenSource по-пекински, или почему фонд OpenAtom - это прекрасно, но не в наших реалиях // Аристов Константин - Скала^р (группа Рубитех), руководитель направления RnD системного ПО

Поговорим о том, какой дивный симбиоз между собором и базаром (openSource и Кговавым Ынтырпрайзом) получился в КНР, попробуем прикинуть тамошние реалии на наши, придем к парадоксальному выводу насчет пользы конкуренции.

- Студенческий open-source в ML - опыт внедрения поддержки ONNX // Зверев Андрей - студент 3 курса Новосибирского Государственного Университета, стажер-разработчик в Яндексе

Как превратить скучную учебную практику в реальный проект, которым не стыдно гордиться и который добавляет ценности в резюме? Расскажу на личном примере участия в лаборатории YADRO при НГУ.
Поясню, что такое формат лаборатории: как туда попасть, какие возможности она дает студентам. На практическом кейсе покажу, как выглядят рабочие процессы изнутри: постановка задач, планирование, работа через issues/PR, тестирование и выпуск; с какими трудностями столкнулся и как их решал при поддержке наставников из реальной компании-партнера.
В технической части объясню простыми словами: что такое ONNX и почему стандарт обмена моделями важен для переносимости и воспроизводимости, чем его поддержка усилила проект Adept и какие результаты получились на практике.


- Simple Deep Research - открытый фреймворк для мультиагентного поиска // Алан Газзаев - аспирант ИТМО, NLP researcher at MWS AI

Simple Deep Research - это простая система для поиска информации в интернете с помощью мультиагентного подхода. Система работает в двух режимах: lite и full. В первом режиме агент посещает несколько сайтов, сжимает информацию и выдает отчет. Во втором режиме агент определяет сложность запроса, разбивает его на подзапросы, а затем другие агенты ищут и суммируют информацию по каждому запросу. Одна из основных идей данного фреймворка заключается в том, что он не содержит таких зависимостей как langchain и smolagents и быстро запускается с локальными моделями через vLLM/llama.cpp. Также фреймворк модульный, можно заменить поисковой движок и агентов по необходимости.

- Опен-сорс от BE2R: почему мы делаем и как продвигаем проекты по воплощенному интеллекту // Колюбин Сергей, профессор и руководитель лаборатории BE2R ИТМО

На примере нескольких результатов, представленных на конференции IROS 2025 года, расскажу про нетривиальные истории опен-сорсных проектов нашей лаборатории, реализуемых в сотрудничестве с Центром робототехники Сбера.


Ссылка на регистрацию прежняя - https://openmeetup.ru/
Места на площадке конечны, так что не откладывайте! Остались только онлайн-регистрации.
🔥14👍42
А тем временем, до начала нашего митапа - меньше часа.

Для тех, кто успел регистрироваться очно - ждём на площадке к 18!

Для остальных - трансляция (начнется в 18-25). Программа - тут.
3👍1🔥1
Пока готовим к публикации материалы митапа, проанонсирую пару актуальных опенсорс-активностей на ближайшее время:

1) Приём заявок на гранты Yandex Open Source × SourceCraft - до 15 марта.

https://opensource.yandex/grants

В программе три трека
- Обработка и хранение данных
- Разработка
- Искусственный интеллект

2) Прием заявок на Всероссийский конкурс проектов с открытым кодом - до 1 марта

https://foss.kruzhok.org

Можно участвовать со своим проектом с открытой лицензией, или с мердж-реквестом в любом из существующих.

3) Мероприятие от коллег из ИТМО - открывают второй сезон митапов по системному программированию «Systems».

https://t.me/gpgpu_ru/338

Ближайший - 25.02.2026 в 19:00 в здании ИТМО на Кронверкском. Среди близких нам по теме докладов - «Ре(Э)волюция инструментов разработки в эпоху AI: в мире и Яндексе» от Дмитрия Иванова (руководителя SourceCraft).



Пишите в комментарии, если что-то ещё релеватное забыл.
🔥94
Выложили материалы по итогам недавнего митапа:
Презентации - тут, запись выступлений - тут.

Решили и в этот раз провести голосование за "Лучший доклад" - чтобы был повод ещё раз посмотреть на слайды.
Для равенства шансов, keynote-доклады (от Владимира Павлова про школу-конкурс EDGE AI 2025 и Олега Чирухина - про путь к 100% генерации кода) идут вне зачета.

А само голосование - ниже:
И снова про OSA - но теперь на английском! Написали длинный гайд по использованию и выкатили его на TDS:

https://towardsdatascience.com/an-end-to-end-guide-to-beautifying-your-open-source-repo-with-agentic-ai/

Приятно, что редакция признала проект общественно-полезным и опубликовали несмотря на то что это своего рода "само-реклама":
We don't often publish articles that are framed around the launch of the author's new tool/product or geared towards explaining how to use it, but given your project's open source status and its potential relevance for many of our readers, we can be more flexible, and would be happy to publish it.

Если у вас есть англо-говорящие коллеги, которым бы пригодился инструмент для проверки и улучшения научных репозиториев - будем рады, если поделитесь с ними ссылкой.
🔥144👍4
Очередной выпуск с тематическими подборками научных каналов от "Зоопарка" - можно полистать на предмет интересного.

На этот раз вошли в категорию "общеполезное".
🔥3
#пост_по_регламенту

Итак, продолжаем выкладывать трудолюбиво собранные нашим Зоопарком папки, которые, как нам кажется, уже более или менее готовы. Если кто еще хочет в них добавиться - пишите в ЛС нашего Зоопарка или в комменты (но не затягивайте, максимум в течение пары часов, иначе для вас полностью теряется смысл).

Встречайте, смотрите, выбирайте на свой вкус и добавляйтесь!

Сегодня у нас их сразу четыре:

Физика (12 каналов)

Химия (25 каналов)

Инженеры-технари (11 каналов) и

"Научно-общеполезное" (19 каналов)

Как и раньше, собираем отдельно "мегапапку" - самые крупные, избранные каналы о науке и образовании (или просто особо понравившиеся нам). Она выйдет малость попозже.
🔥31👍1
Попался сегодня пост про AI4Science, с многими мыслями из которого соглашусь:

Делимся тезисами Александра Кустова, которые уже разошлись по академической среде — и многим они явно не понравились.

* Классическая академическая статья — формат, который доживает последние дни.
* Коммерческая система научных журналов может этого не пережить.
* Учёные предъявляют к ИИ абсурдно двойные стандарты.
* Молодым исследователям достанется и главный удар, и главный шанс.
* В работе классического research assistant почти не осталось прежнего смысла.
...
* По-настоящему важные вопросы — это безопасность и проверка результатов.
* Качественные исследования и сбор уникальных данных только вырастут в цене.
* Споры об ИИ всё сильнее зависят не от фактов, а от личной веры в его полезность.
* Качество результата по-прежнему определяется не ИИ, а уровнем самого пользователя.
* Большинство научных статей уже читают не люди, а машины.
* Атрофия навыков — реальный риск, особенно для будущего поколения учёных.
* Детекторы ИИ-текста и нормы обязательного раскрытия почти не работают.
* Academic Bluesky — не то место, где сегодня возможен серьёзный разговор об ИИ.
* Исследование может быть «без души» — и всё равно приносить пользу обществу.

Особенно в части изживания классического формата научной статьи. Кажется, сейчас секции статей, посвященных экспериментам с применением ML (в разных областях, не только CS), уже сейчас де-факто просто пересказывают jupyter-ноутбуки с потерей деталей.

При этом, сейчас даже топовые конференции не энфорсят наличие кода - вот сейчас на ICML ревьюил, и 2 из 3 статей код не приложили вообще.
Про явное соотнесение экспериментов в статье с кодом/данными/моделям для их запуска даже не говорю.
👍4🤔4
Наше сообщество ITMO OpenSource традиционно организует трек "Open Source" на конференции DataFest.

Этот год - не исключение. Уже открыта форма для подачи докладов на DataFest 2026 - так что начинаем собирать программу. Все заявки рассмотрим и дадим обратную связь.

Наш трек называется "Группа 3, DS/ML закулисье - Open Source"

В докладах особенно будут приветствоваться упор именно на опенсорсные аспекты - аналитику, лучшие практики, истории успехов или неудач.
Именно для презентации конкретных проектов лучше подходят смежные треки - но все решается индивидуально.

Дедлайн подачи доклада: 30 апреля
Даты самой конференции: 23 — 31 мая
Города: Москва, Санкт-Петербург, Новосибирск, Уфа (новая локация!), Алматы, Белград. Онлайн тоже можно.

Не затягивайте с подачами заявок - очные слоты могут закончиться!

Другие треки конференции можно посмотреть тут.
🔥4
Неприятная история в мире LLMOps-опенсорса: cерьёзно скомпрометирована популярная библиотека litellm 1.82.7+

The litellm==1.82.8 wheel package on PyPI contains a malicious .pth file (litellm_init.pth, 34,628 bytes) that automatically executes a credential-stealing script every time the Python interpreter starts — no import litellm required.

Судя по тому, что мейнтенеры закрывают issue по этой уязвимости - их тоже взломали.

Подробнее: описание атаки, обсуждение. Из pypi пакет уже убрали.

Кто использует - проверьте, что вы не затронуты.
🔥5😱41🤣1
Хороший пример полезной научной Open Data на гидромет-тему. Сама задачу заполнения пропусков в метеоданных решала куча команд (включая нашу), статей на эту тему гора - но тут именно публикация открытого датасета позволяет это переиспользовать, избегая бессмысленного дублирования работы.

Но, к сожалению, сам код ML-пайплайна, которым обрабатывались данные, не выложен. Что конечно плохо - можно было бы и к другим данным применить, и этот датасет актуализировать по мере поступления новых измерений.
#зоопарк_одобряет

RusWeather-GF: "дневник российской погоды" за 44 года с привязкой к местности

Ученые из Почвенного института им. Докучаева (Москва) проделали колоссальную работу: собрали ежедневные данные по температуре и осадкам для 593 метеостанций России за 44 года (1980–2023), закрыв все пробелы и привязав станции к высокоточным топографическим моделям. Получился первый в своём роде открытый набор данных, готовый для любых климатических расчётов.

Кто-то скажет "такое уже было". Не совсем: в исходных архивах Росгидромета не хватало примерно 1.6% записей по температуре и 1.8% по осадкам. На первый взгляд, немного, но беда в том, что пробелы были распределены очень неравномерно. Восстановление данных делалось разными методами (несколько физических моделей + ИИ, подробнее в статье) - и получилось отлично, корреляция очень высокая.

Впервые к каждой станции привязали цифровую модель рельефа FABDEM v1.2 — высоту над уровнем моря, крутизну склона и шероховатость поверхности. Это критически важно для горных районов, где климат меняется на десятках метров.

Данные выложены на Zenodo, ну, а статья по мотивам проделанной работы вышла в Atmospheric Research (IF = 4.4). На картинке - распределение метеостанций в России
👍71❤‍🔥1
Произошли обновления opensource LLM семейства GigaChat. Авторы заявляют следующие характеристики:

GigaChat 3.1 Ultra

- 702B параметров (36B активных на токен)
- Обходит non-reasoning Qwen3-235B-A22B и DeepSeek-V3-0324 в математике и general reasoning
- Контекст 131K токенов
- GitVerse | HuggingFace

GigaChat 3.1 Lightning
- 10B параметров (1.8B активных)
- На аренах отвечает на уровне GPT-4o
- Сильна в function calling
- Серьёзный выигрыш по скорости за счёт MoE + MTP + FP8
- Контекст 256K токенов
- GitVerse | HuggingFace

Cтатья на Хабре с подробностями - https://habr.com/ru/companies/sberbank/articles/1014146/

Кто попробует - делитесь отзывами.
🔥51👍1👎1🫡1
Сообщают, что произошло самопроизвольное выкатывание в опенсорс Claude Cade.

Почитать разбор произошедшего и анализ кода от Олега Чирухина можно тут:
https://habr.com/ru/companies/bar/articles/1017574/

Можно подглядеть промты, дизайн мультиагентной системы, наборы тулов и т.п.
🔥11🤣1
Если кто-то завтра будет на Data Fusion - в 17-30 буду вести секцию "Open Source для ИИ".

https://www.data-fusion.ru/page-program-2026?active_day=9&session_id=68860

В повестке обсуждения
1. Роль открытого ПО в ускорении разработки и внедрения ИИ: где он дает максимальный эффект, а где польза от него может быть невелика.
2. Как меняется модель взаимодействия «университет — индустрия» в условиях открытых технологий и совместной разработки.
3. Как сократить путь от научного репозитория до промышленного внедрения.
4. Какие компетенции в области открытого ПО и ИИ становятся критически важными для специалистов и команд.
5. Мотивация бизнеса к открытию моделей, данных и инструментов: стратегические цели, риски и ограничения.
6. Практические кейсы: как опенсорс влияет на скорость вывода ИИ-продуктов на рынок и внедрение в реальный сектор экономики.

К сожалению, без трансляции, так что это для тех кто на площадке. Но по итогам постараемся сделать суммаризацию.
🔥10👍1
Сегодня послушал дискуссию на секции Data Fusion под председательством Юрия Визильтера, посвященной отечественному академическому ИИ-сообществу.

Там был презентован полезный проект - open-source трекер российских конференций в области ИИ:
https://rnns-raai.github.io/rus-AI-science

Пока он очевидно не полон (сходу приходят в голову AINL, MathAI и другие достойные мероприятия), но инициатива хорошая, crowdsource-формат тут подходит для сбора информации.

Обещают добавить подробности про публикационные аспекты этих конференций, раздел для семинаров и т.п.

Законтрибьютить можно тут.
Также доступна полная запись сессии для интересующихся.
🔥71
Коллеги из SourceCraft и центра технологий для общества Yandex Cloud запустили полезный проект - открытую библиотеку авторских курсов, в котором собраны образовательные программы от вузов и научных организаций.

Библиотека доступна в формате репозитория: https://sourcecraft.dev/open-education-club-by-yandex/overview

На платформе уже представлены материалы по ИИ-ассистентам, облачным технологиям, анализу данных, а также курсы по оптимизации и машинному обучению.
В проекте уже поучаствовали более 20 вузов, среди которых МФТИ, ВШЭ, МАИ, а также преподаватели ШАД. Думаю, и от ИТМО кто-то скоро подключиться - свои курсы пока не успели достаточно причесать.

Предполагается постоянное обновление каталога курсов - любой преподаватель может предложить изменения в существующий курс через Pull Request.

Подробности про формат участия в программе доступны тут.
👍133
Про проект CaleyPy уже писали - а тут анонсировали целое соревнование на его основе. Слово организаторам:

Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса.

Проект
CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.

Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе
Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику
333 или 444 (любом из них) и тоже опубликовать публичное решение.

Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены
NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.

Подробности - https://t.me/sberlogabig/643
🔥121