Big Data Science [RU]
1.62K subscribers
80 photos
9 videos
545 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
😎⚡️💥Топ малоизвестных, но достаточно полезных Python-библиотек для анализа Big Data
Pattern - предназначена для извлечения данных в интернете, естественной обработки языка, машинного обучения и анализа социальных сетей. Среди инструментов есть поисковик, API для Google, Twitter и Wikipedia и алгоритмы текстового анализа, которые могут выполняться несколькими строками кода.
SciencePlots - это библиотека, которая предоставляет стили для библиотеки Matplotlib, чтобы получить профессиональные графики для презентаций, исследовательских работ и т.д.
Pgeocode - модуль геокодирования Python, который создан для обработки географических данных и помогает объединять и сопоставлять различные данные. С помощью модуля pgeocode можно получать и предоставлять информацию, связанную с регионом или областью, используя информацию о почтовом индексе. Также поддерживаются расстояния между двумя почтовыми индексами.
pynimate - модуль для анимации линейных графиков статистических данных
👍3
🤖🔥⚡️Немного малоизвестных, но достаточно полезных DL-библиотек на Python
Sketch - использует алгоритмы машинного обучения для понимания контекста пользовательских данных и предоставляет соответствующие предложения по коду. Также Sketch может автоматизировать повторяющиеся задачи, находить ошибки и предлагать исправления, анализировать кодовую базу и предлагать предложения по оптимизации.
MLxtend - включает такие модули как классификатор, кластеризатор, методы оценки, извлечение признаков,предварительная обработка, методы визуализации и т.д. Данный инструмент можно использовать как основной инструмент для задач машинного обучения или в качестве дополнения и вспомогательного инструмента к другим более известным DL-библиотекам
Rembg - библиотека, которая легко поможет удалить фон с изображений. Она использует модели глубокого обучения, предварительно обученные на больших наборах данных.
👍5
⚡️📝💡Платформы для разметки данных под задачи компьютерного зрения
VoTT — это бесплатный инструмент с открытым исходным кодом для аннотирования изображений, разработанный Microsoft. Он обеспечивает комплексную поддержку для создания наборов данных и проверки моделей обнаружения объектов на основе видео и изображений.
LabeIimg - это инструмент графического аннотирования изображений для маркировки объектов с помощью прямоугольников (Bounding Box). Он написан на Python. Размеченные данные экспортируются файлами XML в формате PASCAL VOC.
Labelme - онлайн-инструмент для аннотации данных, созданный Лабораторией компьютерных наук и искусственного интеллекта Массачусетского технологического института. Labelme поддерживает шесть различных типов аннотаций: многоугольники, прямоугольники, круги, линии, точки и линейные полосы.
DataLoop — универсальная облачная платформа для разметки со встроенными инструментами и средствами автоматизации для создания высококачественных обучающих датасетов.
Supervise.ly — это веб-платформа для аннотирования изображений и видео со своим комьюнити. Исследователи и большие группы могут аннотировать и экспериментировать с датасетами и нейронными сетями.
👍2
📝💡🔎Подборка датасетов для автопилотов
Berkeley DeepDrive BDD100k - Один из наибольших датасетов для автопилотов. Включает более 100 тыс. видео с более чем тысячью часами записей вождения в различное время суток и в разных погодных условиях
Baidu Apolloscapes - датасет для распознавания 26 семантически разных объектов типа машин, зданий, пешеходов, велосипедов уличных фонарей и т. п
Comma.ai. - больше 7 часов езды по шоссе. В датасете содержится информация о скорости машины, GPS-координатах, ускорении, угле поворота руля
Oxford’s Robotic Car - больше ста повторений одного маршрута по Оксфорду, заснятого в течение года. В датасете есть разные комбинации трафика, пешеходов, погодных условий, а также дорожные работы
Cityscape Dataset - записи ста уличных сцен в пятидесяти городах
👍2
🌎ТОП ивентов в Data Science в 2024 году на сегодняшний день
30 декабря 2023 года - 31 января 2024 - Russian art: ML Challenge 2024 - Онлайн - https://codenrock.com/contests/russian-art-ml-challenge#/
29 февраля - 1 марта - Data Award 2024 - https://www.osp.ru/lp/dataaward2024
6-7 марта - OpenTalks.AI - Тбилиси, Грузия - https://opentalks.ai/ru
12 марта - Большие данные 2024 - Москва, Россия - https://events.cnews.ru/events/bolshie_dannye_2024.shtml
28 марта - Форум DATA&AI 2024 - Москва, Россия - https://www.osp.ru/lp/data-ai2024
18 апреля - DATA FUSION - Онлайн - https://data-fusion.ru/
3-4 июля - Go Digital Eurasia 2024 - Астана, Казахстан - https://godigitaleurasia.com/
26-27 сентября - MARKETING DATA ANALYTICS 2024 - Москва, Россия - https://interforums.ru/mda24/home
11-12 декабря - Go Digital 2024 - Онлайн - https://ict2go.ru/events/46792/
👍2
📉📊Мир данных с Tableau: преимущества и недостатки
Tableau - это инновационное программное обеспечение для визуализации данных, которое стало неотъемлемой частью современного анализа данных.
Преимущества Tableau:
Интуитивный интерфейс: Одним из ключевых преимуществ Tableau является его интуитивный и легко понятный интерфейс. Пользователи могут создавать сложные визуализации, не обладая глубокими знаниями программирования.
Широкие возможности визуализации: Tableau предоставляет множество опций для визуализации данных, начиная от стандартных графиков и заканчивая сложными дашбордами. Это позволяет пользователям представлять данные в наиболее наглядной форме.
Интеграция с различными источниками данных: Tableau поддерживает широкий спектр источников данных, включая базы данных, файлы Excel, облако и многие другие. Это обеспечивает удобство в работе с данными из различных источников.
Динамические дашборды и отчеты: С Tableau пользователи могут создавать динамичные дашборды и отчеты, которые позволяют моментально отслеживать изменения и анализировать данные в режиме реального времени.
Обширное сообщество и поддержка: Tableau имеет активное сообщество пользователей, что обеспечивает доступ к обширным ресурсам, обучающим материалам и форумам для решения проблем и обмена опытом.
Недостатки Tableau:
Необходимость подготовки данных: В некоторых случаях требуется предварительная обработка данных перед тем, как они могут быть визуализированы в Tableau. Это может потребовать времени и дополнительных усилий.
Ограниченные возможности аналитики: В сравнении с некоторыми другими инструментами анализа данных, Tableau может оказаться менее функциональным в части сложных аналитических вычислений.
Ограниченные возможности в режиме реального времени: В некоторых сценариях Tableau может сталкиваться с ограничениями в обработке данных в режиме реального времени, что может быть проблемой для определенных бизнес-сценариев.
В целом, Tableau остается мощным и популярным инструментом для визуализации данных, предоставляя широкий функционал для анализа данных и принятия информированных решений. Решение о его использовании зависит от конкретных потребностей и возможностей бизнеса.
👍2🤔2😁1
📚Подборка книг для погружения в мир анализа временных рядов
Анализ временных рядов и прогнозирование - рассматриваются показатели временного ряда, основные типы тенденций и методы их распознавания, методы оценки параметров колеблемости, измерение устойчивости уровней ряда и тенденции динамики, моделирование и прогнозирование временных рядов. Рассчитан на лиц, имеющих знания по общей теории статистики.
Практический анализ временных рядов: прогнозирование со статистикой и машинное обучение - здесь описаны современные технологии анализа данных временных рядов и приведены примеры их практического использования в самых разных предметных областях. Оно призвано помочь в решении наиболее распространенных задач исследования и обработки временных рядов с помощью традиционных статистических методов и наиболее популярных моделей машинного обучения.
Элементарная теория анализа и статистическое моделирование временных рядов - книга содержит теоретико-вероятностные основы анализа простейших временных рядов, а так же методы и приемы их статисти-ческого моделирования (симуляции). Материал по элементарной теории вероятностей и математической статистике изложен кратко с использованием аналогии вероятностных схем и дополнен резуль-татами по теории серий и критериям случайности.
Статистический анализ временных рядов - монография известного американского специалиста по математической статистике содержит обстоятельное изложение теории статистических выводов для различных вероятностных моделей. Излагаются методы представления временных рядов, оценивания параметров соответствующих вероятностных моделей, проверки гипотез относительно их структуры. Собранный автором обширный материал, разбросанный ранее по различным источникам, делает книгу ценным руководством и справочником.
Временные ряды. Обработка данных и теория - монография посвящена изучению временных рядов, встречающихся в различных областях физики, механики, астрономии,техники, экономики, биологии, медицины. Основная ориентация книги - практическая: методы теоретического анализа иллюстрируются детально проработанными примерами, а результаты наглядно представлены на многочисленных графиках.
👍7
💡😎Databricks Lakehouse: преимущества и недостатки
Databricks Lakehouse - это концепция, объединяющая функциональность data lake и data warehouse для обеспечения более эффективного управления данными.
Преимущества Databricks Lakehouse:
1. Единое пространство для хранения данных: Lakehouse предоставляет единое хранилище для данных, объединяя преимущества data lake (гибкость, масштабируемость) и data warehouse (структурированные запросы, оптимизированные для аналитики).
2. Масштабируемость: Databricks Lakehouse позволяет эффективно масштабировать хранение и обработку данных, поддерживая большие объемы информации.
3. Поддержка структурированных и неструктурированных данных: Lakehouse обеспечивает возможность хранения и обработки как структурированных, так и неструктурированных данных, что делает его универсальным для различных типов информации.
4. Использование Apache Spark: Dатабрикс включает Apache Spark, что обеспечивает высокую производительность и поддерживает обработку больших данных.
Недостатки Databricks Lakehouse:
1. Сложность внедрения: Реализация и настройка Databricks Lakehouse может быть сложной задачей, особенно для организаций, которые ранее не работали с подобными технологиями.
2. Зависимость от облачных решений: Dля многих компаний использование Databricks Lakehouse может подразумевать зависимость от облачных сервисов, что может вызывать определенные ограничения.
3. Стоимость: Использование Databricks Lakehouse, особенно в облаке, может быть связано с дополнительными расходами, что делает его менее доступным для небольших предприятий.
4. Необходимость подготовки данных: Для эффективной работы с Lakehouse часто требуется предварительная подготовка данных, что может потребовать дополнительных усилий.
5. Комплексность управления данными: Управление данными в едином пространстве может стать сложной задачей, особенно при работе с большими объемами информации и различными типами данных.
👍1
💡📉Программирование датасетов теперь не проблема
Сноркель - фреймворк для программирования данных (data programming). Подход данного фреймворка заключается в в использовании разных эвристик и априорных знаний для автоматической разметки датасетов. Проект стартовал в Стэнфорде как инструмент для помощи в разметке датасетов для задачи information extraction, а сейчас разработчики делают платформу для пользования внешними заказчиками.
Арсенал Сноркеля включает в себя три ключевых инструмента:
-разметочные функции для создания датасета;
-преобразующие функции для аугментации датасета;
-срезающие (slicing) функции, выделяющие подмножества в датасете, которые критичны для производительности обучающихся моделей.
❤2👍1
💡📊Подборка библиотек для анализа данных
Lux — дополнение к популярному пакету анализа данных Pandas. Она даёт возможность быстро создавать наглядные представления наборов данных и применять базовый статистический анализ при минимальном количестве кода.
Pandas-profiling - помогает сформировать отчёт о профилировании . Этот отчёт даёт подробный обзор переменных в вашем наборе данных. Он даёт представление о статистике для отдельных характеристик данных, таких как распределение, а также среднее, минимальное и максимальное значения. Тот же отчёт даёт представление о корреляциях и взаимодействиях между переменными.
Sweet-Viz - предоставляет быструю визуализацию и анализ данных. Основной козырь Sweet-Viz — обширный HTML-дашборд с полезными представлениями и сводками данных, который генерируется выполнением всего одной строки кода.
D-Tale - это библиотека Python, которая предоставляет интерактивный и удобный интерфейс для визуализации и анализа структур данных Pandas. Она использует Flask в качестве серверной части и React в качестве интерфейса, что упрощает просмотр и изучение фреймов данных Pandas, объектов Series, MultiIndex, DatetimeIndex и RangeIndex. Она легко интегрируется с Jupyter, терминалами Python и ipython.
AutoViz - это библиотека Python, предоставляющая возможности автоматической визуализации данных, позволяющая пользователям визуализировать наборы данных любого размера всего одной строкой кода. Программа автоматически генерирует отчёты в различных форматах, включая HTML и Bokeh, и позволяет пользователям взаимодействовать с созданными HTML-отчетами.
KLib - это библиотека Python, которая предоставляет возможности автоматического разведочного анализа данных (EDA) и профилирования данных. Она предлагает различные функции и визуализации для быстрого изучения и анализа наборов данных.
SpeedML - это библиотека Python, целью которой является ускорение процесса разработки конвейера машинного обучения. Она объединяет часто используемые пакеты ML, такие как Pandas, NumPy, Scikit-learn, XGBoost и Matplotlib. SpeedML также предоставляет функциональные возможности для автоматизированного EDA
😎💡📊В поисках скрытого: малоизвестные библиотеки Python для аналитик данных
PyCaret - Автоматизированная библиотека машинного обучения, упрощающая переход от подготовки данных к моделированию. PyCaret включает в себя функции для автоматического сравнения моделей, предобработки данных, а также интеграцию с MLflow для удобного ведения экспериментов.
Vaex - Библиотека для ленивой загрузки и эффективной обработки очень больших данных. Отлично подходит для анализа больших датасетов с ограниченными вычислительными ресурсами. aex позволяет эффективно работать с датасетами, содержащими миллиарды строк, минимизируя использование памяти и оптимизируя производительность.
Streamlit - Инструмент для быстрого создания интерактивных веб-приложений для аналитики данных. Streamlit можно использовать для разработки приложений, которые демонстрируют результаты машинного обучения, таких как классификация изображений или прогнозирование временных рядов.
Dask- Предназначена для параллельных вычислений и работы с большими датасетами. Идеально подходит для масштабирования аналитических операций и обработки данных большого объема. Dask обеспечивает совместимость с такими инструментами, как Pandas и Numpy, и позволяет выполнять сложные вычисления на кластерах.
Dash by Plotly - Фреймворк для создания аналитических веб-приложений. Идеален для создания интерактивных дэшбордов и комплексных визуализаций данных. Dash позволяет создавать многогранные веб-приложения для анализа данных, например, для визуализации финансовых показателей компаний или трендов рыночных данных.
👍1
😎💡Малоизвестные, но весьма полезные СУБД
TimescaleDB берет функционал PostgreSQL и добавляет в него временные ряды! Созданная как расширение к PostgreSQL, эта база данных проявляет себя, когда вы имеете дело с крупномасштабными данными, которые изменяются во времени – например, данные с устройств IoT
FaunaDB – это база данных с распределенной обработкой транзакций онлайн, обладающая свойствами ACID. За счет этого достигается высокая скорость работы с данными и надежность. FaunaDB основана на технологии, впервые примененной в Twitter и была создана в качестве стартапа выходцами из команды разработчиков этой социальной сети.
KeyDB — это форк Redis, разработанный канадской компанией и распространяемый под свободной лицензией BSD. Существует поддержка многопоточности
Riak (KV) - это распределённая NoSQL база данных типа «ключ-значение(key-value)». Riak CS спроектирована так, чтобы обеспечить простоту, доступность, распределённость облачного хранилища любого масштаба, и может использоваться для построения облачных архитектур — как публичных, так и частных — или как инфраструктурного хранилища для высоко нагруженных приложений и сервисов.
InfluxData предназначена для мониторинга метрик и событий в инфраструктуре. Основной фокус — хранение больших объёмов данных с метками времени (таких, как данные мониторинга, метрики приложений и показания датчиков), и их обработка в условиях высокой нагрузки на запись.
👍1
📚💡ТОП февральских ивентов в Data Science
1-3 февраля - STARTUP DISTRICT & INDUSTRY X - Алматы, Казахстан - https://district.almatydigital.kz/
8 февраля - ITM-AI 2024 - Онлайн - https://itm-ai.ru/
8 февраля - PGMEETUP.СПБ/24 - Санкт-Петербург, Россия - https://pgconf.ru/20240208
10 февраля - ФОРУМ STARTUPHUB - САНКТ-ПЕТЕРБУРГ, Россия - https://forum-show100224.angelsyndicate.ru/
14 февраля - Конференция «Качество данных 2024» - Москва, Россия - https://www.osp.ru/lp/dataquality2024
17 февраля - AISUMMIT 2024 - Москва, Россия - https://aisummit.ru/
29 февраля - FinCore 2024 - Москва, Россия - https://fincore.ru/
❤2👍1
🧐💡СУБД Firebird: преимущества и недостатки
Firebird - это открытая реляционная база данных с высокой производительностью и расширенными возможностями.
Преимущества:
1. Открытый исходный код: Firebird распространяется под лицензией с открытым исходным кодом (InterBase Public License). Это позволяет пользователям свободно использовать, модифицировать и распространять программное обеспечение без ограничений.
2. Многопользовательская поддержка: Firebird обеспечивает эффективную работу в многопользовательском режиме, что делает его подходящим для развертывания в больших корпоративных средах.
3. Транзакционная безопасность: Firebird поддерживает ACID-свойства (атомарность, согласованность, изолированность, устойчивость) для обеспечения транзакционной целостности данных.
4. Многоуровневая архитектура транзакций: Firebird использует многоуровневую архитектуру транзакций, что позволяет одновременно выполнять множество транзакций и предотвращает блокировки данных.
5. Поддержка стандарта SQL: Firebird соответствует стандартам SQL и обладает расширенными возможностями, такими как поддержка вложенных транзакций и триггеров.
Недостатки:
1. Ограниченная экосистема и инструментарий: У Firebird может быть более ограниченная экосистема и инструментарий сравнительно с более распространенными СУБД, такими как MySQL, PostgreSQL или Microsoft SQL Server.
2. Ограниченная поддержка графических интерфейсов: Firebird может не иметь таких продвинутых инструментов управления базой данных, как у некоторых конкурентов.
3. Ограниченное сообщество: В сравнении с некоторыми другими СУБД, у Firebird может быть менее обширное сообщество пользователей и разработчиков, что может повлиять на доступность поддержки и ресурсов для разработчиков.
В целом, выбор СУБД зависит от конкретных требований проекта, и Firebird может быть хорошим вариантом для определенных сценариев использования, особенно когда важны открытость и надежность.
👍1🤔1
💡Airbyte: преимущества и недостатки
Airbyte - это открытая платформа для интеграции данных, предназначенная для упрощения процесса сбора, трансформации и передачи данных (ETL). Он разработан для того, чтобы помочь компаниям легко обмениваться данными между различными источниками и целями.
Преимущества Airbyte:
1. Открытый исходный код: Airbyte предоставляет открытый исходный код, что позволяет пользователям изменять и настраивать платформу в соответствии с их требованиями.
2. Простота использования: Интерфейс Airbyte дружелюбен и интуитивно понятен. Пользователи могут создавать и управлять коннекторами для различных источников данных без необходимости в глубоких технических знаниях.
3. Масштабируемость: Платформа предоставляет масштабируемую архитектуру, что делает ее пригодной для обработки больших объемов данных.
4. Поддержка большого количества коннекторов: Airbyte поставляется с множеством встроенных коннекторов для популярных источников данных, таких как базы данных, API, облачные сервисы и другие.
5. Графический интерфейс и управление версиями: Визуальные инструменты и возможность управления версиями облегчают создание, отслеживание и управление вашими конфигурациями интеграции.
Недостатки:
1. Отсутствие некоторых коннекторов: Несмотря на широкий спектр поддерживаемых источников данных, могут возникнуть ситуации, когда нужный коннектор отсутствует.
2. Не поддерживает реального времени: В настоящее время Airbyte не обеспечивает полноценную поддержку реального времени для всех источников данных.
В целом, Airbyte представляет собой перспективный инструмент для интеграции данных, который может быть полезен в случаях, когда важны простота использования, открытость и масштабируемость.
👍3
💡Хранилище данных vs. Data Lake: преимущества и недостатки
Хранилища данных и Data Lake представляют собой два различных подхода к управлению и хранению данных в организации. Рассмотрим основные аспекты каждого из них.
Хранилище данных:
Преимущества:
1. Структурированные данные: Хранилища данных обычно предназначены для хранения структурированных данных, что облегчает их анализ и обработку.
2. Производительность: В хранилищах данных используются оптимизированные структуры для быстрого доступа к данным, что обеспечивает высокую производительность запросов.
3. Готовность к использованию: Данные в хранилище предварительно обрабатываются и организованы, что делает их готовыми к использованию для бизнес-аналитики и отчетности.
Недостатки:
1. Ограниченность типов данных: Хранилища данных могут быть менее гибкими при работе с разнообразными типами данных, такими как неструктурированные или полуструктурированные данные.
2. Сложность масштабирования: При увеличении объема данных их хранение и обработка в хранилище может стать более сложной задачей, требующей дополнительных ресурсов.
Data Lake:
Преимущества:
1. Гибкость в типах данных: Data Lake предоставляет возможность хранения неструктурированных и полуструктурированных данных, что делает его подходящим для разнообразных данных.
2. Масштабируемость: Data Lake легко масштабируется с ростом объема данных, обеспечивая увеличение производительности и хранение больших объемов информации.
3. Обработка данных на лету: Возможность проводить анализ данных в реальном времени позволяет оперативно использовать информацию для принятия решений.
Недостатки:
1. Сложность управления: Управление Data Lake может потребовать более сложных процессов и стратегий, чтобы избежать беспорядка и поддерживать качество данных.
2. Неоптимизированный доступ: Поскольку данные в Data Lake хранятся в их первоначальной форме, доступ к ним может потребовать дополнительных усилий для оптимизации запросов.
Таким образом, выбор между хранилищем данных и Data Lake зависит от уникальных потребностей бизнеса и характера данных. В некоторых случаях оптимальным решением может быть комбинация обоих подходов, что обеспечит комплексный подход к управлению данными в организации.
👍4
💡📊Стартап для общение с базами данных
Команда стартапа groql из Новосибирска, победителя осенней сессии А:СТАРТ 2023 года разработала приложение, которое позволяет пользователю общаться с базами данных на естественном (русском) языке без опыта в области программирования и получать визуализации в виде графиков, диаграмм и графов. Еще одно преимущество программы — в работе на основе ИИ. Groql помогает перевести запрос с естественного языка на SQL. Пользователь может описать особенности баз данных и ИИ учтет их при работе.
Главное преимущество этого стартапа — в визуальном представлении данных. После обработки запроса пользователь увидит графическое представление данных, которое поможет лучше понять связи между различными данными. Как отмечают разработчики, это может помочь работодателю сократить издержки — за счет сокращения времени и упрощения работы с данными.
Подробнее: https://habr.com/ru/articles/791358/
👍1
📉📊💡Рекомендации по работе данными от Яндекс
На сайте Yandex Cloud запустился новый раздел — Data Platform Solution Library. Там можно найти примеры и рекомендации по работе с данными с разбивкой по аналитическим сценариям.
Для каждого сценария в одном месте собраны практические примеры и руководства в свободном доступе на GitHub, а также все полезные материалы: статьи, кейсы, вебинары и документацию.
Библиотека продолжает пополняться решениями и сценариями.
📉📊💡Recommendations for working with data from Yandex
A new section has been launched on the Yandex Cloud website -Data Platform Solution Library. There you can find examples and recommendations for working with data, broken down by analytical scenarios.
For each scenario, practical examples and tutorials are collected in one place, freely available on GitHub, as well as all useful materials: articles, cases, webinars and documentation.
The library continues to be updated with solutions and scenarios.
📊💡Датасет для настройки математических моделей
OpenMathInstruct-1 представляет собой свежий синтетический датасет от компании NVIDIA, созданный для обучения математических моделей. Данный датасет включает в себя 1,8 миллиона пар "задача-решение", предназначенных для обучения.
Как отмечают разработчики, данный набор данных создан путем синтеза решений для интерпретатора кода для GSM8K и MATH, двух популярных тестов математического анализа, с использованием недавно выпущенной и имеющей разрешительную лицензию модели Mixtral.
👍5
💡📊😎Датасет для виртуальной реальности
Мета объявила о новых проектах в области искусственного интеллекта (ИИ) и обновлении своей инициативы Ego-Exo, направленной на решение проблем, связанных с технологиями, ориентированными на предоставление перспективы от первого лица.
Компания выпустила датасет под названием Ego-Exo4D. Как отмечают, разработчики, проект помочь качественному обучению моделей ИИ сложными человеческими навыками и подойдет для создания приложений систем виртуальной реальности, робототехники, и многого другого.
Ego-Exo4D содержит три, тщательно синхронизированных датасета естественного языка в сочетании с видео и комментариями экспертов, включают в себя более 1400 часов видео, а также аннотации для бенчмарков.
👍1