Big Data Science [RU]
1.62K subscribers
80 photos
9 videos
545 links
Big Data Science [RU] — канал о жизни Data Science.
Для сотрудничества: a.chernobrovov@gmail.com
🌏 — https://t.me/bdscience — Big Data Science channel (english version)
💼 — https://t.me/bds_job — channel about Data Science jobs and career
Download Telegram
👱‍♂️⚡️В открытом доступе появился датасет DeepFakeFace
DeepFakeFace(DFF) - датасет, который служит основой для обучения и тестирования алгоритмов, предназначенных для обнаружения дипфейков. Этот набор данных создан с помощью различных усовершенствованных диффузионных моделей.
Авторы утверждают, что ими был проведен анализ набора данных DFF и предложено два метода оценки, позволяющие оценить эффективность и адаптивность инструментов распознавания дипфейков.
Первый метод проверяет, может ли алгоритм, обученный на одном типе поддельных изображений, распознавать изображения, созданные другими методами.
Второй метод оценивает производительность алгоритма на неидеальных изображениях, например размытых, низкого качества или сжатых.
Учитывая различные результаты этих методов, авторы подчеркивают необходимость в более совершенных детекторах дипфейков.

🧐 HF: https://huggingface.co/datasets/OpenRL/DeepFakeFace

🖥 Github: https://github.com/OpenRL-Lab/DeepFakeFace

📕 Paper: https://arxiv.org/abs/2309.02218
👍1
🔎📝Стандартизация данных: преимущества и недостатки
Стандартизация данных
- это процесс преобразования данных так, чтобы они имели стандартное распределение с нулевым средним и стандартным отклонением равным 1. Этот процесс является важной частью предварительной обработки данных и часто используется в анализе данных и машинном обучении.
Преимущества стандартизации данных:
1. Улучшение сходимости алгоритмов:
Многие алгоритмы машинного обучения и статистические методы лучше работают с данными, которые имеют стандартное распределение. Стандартизация может помочь улучшить сходимость алгоритмов и ускорить процесс обучения моделей.
2. Улучшение интерпретируемости: Когда данные стандартизированы, коэффициенты в регрессионных моделях или веса в нейронных сетях становятся более интерпретируемыми. Это упрощает анализ влияния каждой переменной на результат.
3. Устранение масштабных различий: Стандартизация помогает избежать проблем, связанных с масштабными различиями между переменными. Если одна переменная имеет значения в тысячи раз больше, чем другая, это может исказить результаты анализа.
4. Работа с некоторыми алгоритмами: Некоторые алгоритмы, такие как метод опорных векторов (SVM) и метод градиентного спуска, чувствительны к масштабу данных. Стандартизация может помочь сделать эти алгоритмы более стабильными и эффективными.

Недостатки стандартизации данных:
1. Потеря информации:
При стандартизации данных мы теряем информацию о фактических единицах измерения переменных. В некоторых случаях это может быть важной информацией для интерпретации результатов.
2. Влияние на выбросы: Стандартизация может усилить влияние выбросов, если они присутствуют в данных. Это может повлиять на стабильность и точность моделей.
3. Зависимость от выбора метода: Существует несколько методов стандартизации, таких как Z-преобразование, мин-макс шкалирование и др. Выбор неверного метода может сильно влиять на результаты анализа.

В целом, стандартизация данных - это важный инструмент в анализе данных и машинном обучении, который может улучшить производительность алгоритмов и упростить интерпретацию результатов. Однако ее применение следует рассматривать с учетом конкретной задачи и особенностей данных.
👍3❤1🤔1
🤔Numexpr: преимущества и недостатки
NumExpr - это библиотека для выполнения быстрых и эффективных вычислений с использованием выражений NumPy в Python. Она предназначена для ускорения вычислений, особенно при работе с большими массивами данных.
Преимущества:
1. Высокая производительность:
NumExpr обеспечивает высокую производительность благодаря компиляции и оптимизации выражений, что позволяет выполнять операции с массивами данных значительно быстрее, чем с помощью чистого Python или даже NumPy.
2. Поддержка многопоточности: NumExpr поддерживает многопоточность, что позволяет использовать многопоточные вычисления и улучшить производительность при обработке параллельных задач.
3. Минимальное использование памяти: Библиотека позволяет выполнять вычисления с минимальным использованием оперативной памяти, что особенно важно при работе с большими данными.
4. Интеграция с NumPy: NumExpr легко интегрируется с библиотекой NumPy, что делает ее удобной для использования в существующих кодовых базах.
5. Простота использования: Синтаксис NumExpr очень похож на синтаксис NumPy, поэтому для многих пользователей нет необходимости изучать новый язык или API.

Недостатки:
1. Ограниченная функциональность:
NumExpr предоставляет только ограниченный набор операторов и функций, поэтому не все операции могут быть оптимизированы с его помощью. Например, нельзя использовать произвольные пользовательские функции.
2. Сложность отладки: Поскольку код NumExpr выполняется внутри специализированного виртуального стека, отладка может быть сложной задачей в случае возникновения ошибок.
3. Не всегда оптимальный выбор: Не всегда целесообразно использовать NumExpr. В некоторых случаях, особенно при небольших объемах данных или сложных операциях, использование чистого Python или NumPy может быть более удобным и читаемым.
👍1
😎💥Крутые AI-сервисы для работы с Big Data
AskEdith - Работает в режиме "Чат с данными", где вы можете подключиться к вашему источнику данных и задавать вопросы на естественном языке. AskEdith предоставляет ответы в различных форматах, включая визуализацию. Способен анализировать обширные объемы данных и поддерживает подключение к различным базам данных и CRM-системам, таким как Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery, Redshift и другим.
Tomat.AI - позволяет проводить анализ крупных CSV-файлов без необходимости в программировании или создании специальных формул. Вы можете легко фильтровать, сортировать, объединять несколько файлов и создавать визуализации всего в несколько кликов.
Coginiti - Создает SQL-запросы, разъясняет их смысл и, при необходимости, оптимизирует производительность. Поддерживает доступ к разным хранилищам данных, включая Redshift, Microsoft, Snowflake, IBM, BigQuery, Yellowbrick, Databricks и другие. Кроме того, имеется репозиторий для хранения SQL-запросов.
Formula God - Искусственный интеллект, который интегрируется в Google Таблицы, облегчает работу с данными без необходимости владения формулами. Вы можете создавать запросы, используя обычный естественный язык.
Simple ML for Sheets - с помощью данного расширения каждый может использовать машинное обучение в Google Sheets, не зная программирования и ML. Но и экспертам также подойдет, если они хотят быстро выполнить задачу на небольшом объеме данных. Разработан командой TensorFlow Decision Forests.
👍2
📝🤔📊 One Hot Encoding: преимущества и недостатки
One Hot Encoding (OHE)
- это метод представления категориальных данных в виде бинарных векторов. Этот метод широко используется в машинном обучении для работы с данными, которые содержат категориальные признаки, то есть признаки, которые не являются числовыми. При One Hot Encoding каждая категория превращается в бинарный вектор, где все значения равны нулю, кроме одного, который соответствует категории данного признака.
Преимущества One Hot Encoding:
1. Подходит для алгоритмов машинного обучения:
Многие алгоритмы машинного обучения, такие как линейная регрессия, деревья решений и нейронные сети, работают с числовыми данными. One Hot Encoding позволяет преобразовать категориальные признаки в числовые, делая их пригодными для анализа алгоритмами.
2. Полезно для категориальных признаков без упорядоченных значений: Если категории не имеют естественного порядка или распределены неравномерно, One Hot Encoding может быть более предпочтительным методом представления по сравнению с кодированием меток (Label Encoding).

Недостатки One Hot Encoding:
1. Размерность данных:
Преобразование категориальных признаков с большим количеством уникальных категорий может привести к значительному увеличению размерности данных, что может ухудшить производительность алгоритмов машинного обучения и потребовать больше памяти.
2. Мультиколлинеарность: При наличии нескольких категориальных признаков с большим числом уникальных категорий могут возникнуть проблемы мультиколлинеарности, когда один признак линейно зависит от других. Это может усложнить интерпретацию моделей.
3. Увеличение вычислительной сложности: Увеличение размерности данных также может привести к увеличению времени обучения моделей и усложнению задачи отбора признаков.

Таким образом, выбор между One Hot Encoding и другими методами кодирования категориальных признаков зависит от конкретной задачи и алгоритма машинного обучения, который вы планируете использовать.
👍2
⚔️🤔Greenplum vs Hive: преимущества и недостатки
Greenplum и Hive - это две различные технологии для обработки и анализа данных, используемые в области больших данных и аналитики.
Преимущества Greenplum:
1. Высокая производительность:
Greenplum предоставляет многопользовательский аналитический движок с распределенной архитектурой. Это обеспечивает высокую скорость обработки запросов и агрегаций, что делает его отличным выбором для аналитики в режиме реального времени.
2. Масштабируемость: Greenplum спроектирован для масштабирования горизонтально. Вы можете легко добавлять новые узлы для увеличения производительности и хранения данных по мере необходимости.
3. Управление данными: Greenplum предоставляет инструменты для управления данными, включая репликацию, резервное копирование и мониторинг, что делает его более подходящим для бизнес-задач, требующих надежности и доступности данных.
Недостатки Greenplum:
1. Сложная настройка:
Установка и настройка Greenplum может быть сложной задачей. Требуется опыт и знание архитектуры системы для оптимальной работы.
2. Не подходит для всех случаев использования: Greenplum наилучшим образом подходит для аналитических задач и хранения структурированных данных, но не является оптимальным выбором для обработки полу и неструктурированных данных.

Преимущества Hive:
1. Простота использования и настройки:
Hive создан поверх Hadoop и предоставляет SQL-подобный интерфейс для запросов данных. Это делает его более доступным для аналитиков и разработчиков, не имеющих опыта работы с большими данными.
2. Совместимость с Hadoop: Hive интегрирован с Hadoop и может использовать его для хранения и обработки данных. Это делает его хорошим выбором для проектов, использующих Hadoop.
3. Поддержка для разнообразных форматов данных: Hive поддерживает различные форматы данных, включая JSON, Parquet, Avro и другие, что делает его удобным для анализа разнообразных данных.
Недостатки Hive:
1. Низкая производительность:
Hive работает медленнее Greenplum из-за того, что запросы переводятся в задачи MapReduce, что может привести к значительным задержкам.
2. Ограниченная поддержка сложных аналитических запросов: Hive не так хорошо подходит для выполнения сложных аналитических запросов, как Greenplum, из-за его ограниченных возможностей оптимизации запросов.
3. Не подходит для реального времени: Hive наилучшим образом подходит для пакетной обработки данных и не является подходящим выбором для аналитики в режиме реального времени.
👍3❤1
📖📚Подборка книг для аналитиков данных
Анализ данных с помощью Python - Полное руководство по науке о данных, аналитике и метрикам с Python.
Математика для машинного обучения - в книге рассматриваются основы математики (линейная алгебра, геометрия, векторы и др), а также основные проблемы машинного обучения.
Интерпретируемое машинное обучение - руководство по созданию объяснимых моделей черного ящика
Понимание статистики и экспериментального дизайна - данный учебник предоставляет основы, необходимые для правильного понимания, интерпретации статистики.
Этика и наука о данных - в этой книге автор знакомить нас с принципами работы с данными и что сделать, чтобы внедрить их уже сегодня.
Использование науки о данных в здравоохранении - в книге рассматриваются вопросы использования информационных технологий и машинного обучения для борьбы с болезнями и в укреплении здоровья.
👍2
📊📉📈Анализ пользователей с помощью датасета от Яндекса
Яндекс выкладывает в открытый доступ крупнейший русскоязычный датасет отзывов об организациях, опубликованных на Яндекс Картах. Он содержит порядка полумиллиона отзывов пользователей на различные организации, собранных в январе-июне 2023 года.
Особенности датасета:
500 000 уникальных отзывов
Тексты очищены от персональных данных (номеров телефонов, адресов почты)
Датасет не содержит коротких односложных отзывов
Достаточно свежие отзывы: с января по июль 2023 года
👍6
📋💡🔎Подборка датасетов для NLP
КартаСловСент — слова и выражения, снабжённые тональной меткой («положительное», «отрицательное», «нейтральное») и скалярным значением силы эмоционально-оценочного заряда из непрерывного диапазона [-1, 1].
WikiQA - представляет собой набор пар вопросов и предложений. Они были собраны и аннотированы для исследования ответов на вопросы в открытых доменах
Amazon Reviews dataset - этот набор данных состоит из нескольких миллионов отзывов покупателей Amazon и их оценок. Датасет используется для возможности обучения fastText, анализируя настроения покупателей. Идея состоит в том, что несмотря на огромный объем данных – это реальная бизнес-задача. Модель обучается за считанные минуты. Именно это отличает Amazon Reviews от аналогов.
Yelp dataset – это множество предприятий, отзывов и пользовательских данных, которые можно применить в Pet-проекте и научной работе. Также можно использовать Yelp для обучения студентов во время работы с базами данных, при изучении NLP и в качестве образца производственных данных. Датасет доступен в виде файлов JSON и является «классикой» в обработке естественного языка.
👍5
⚔️⚡️Altair vs. Matplotlib: преимущества и недостатки визуализаций Big Data
Matplotlib - это старожил в мире визуализации данных, и он широко используется в сообществе Python.
Преимущества Matplotlib:
1. Максимальная гибкость:
Matplotlib позволяет вам создавать почти любой вид графиков и настраивать каждую деталь. Вы можете создавать статические и анимированные графики, подходящие для различных целей.
2. Большое сообщество и документация: Благодаря своей популярности, Matplotlib имеет огромное сообщество пользователей и обширную документацию. Это делает его отличным выбором для начинающих и опытных пользователей.
3. Широкий выбор графических элементов: Matplotlib предоставляет богатый выбор графических элементов, таких как линии, точки, столбцы, и многое другое, что позволяет вам создавать разнообразные графики.
Недостатки Matplotlib:
1. Сложность:
Создание сложных графиков с Matplotlib может быть нетривиальным и требовать значительных усилий и кода.
2. Внешний вид по умолчанию: Графики, созданные с помощью Matplotlib, могут выглядеть не слишком привлекательно по умолчанию, и для их улучшения часто требуется дополнительная и достаточно трудоемкая работа.

Altair - это более новая библиотека, которая стремится упростить создание декларативных графиков.
Преимущества Altair:
1. Декларативный подход: Altair предлагает декларативный подход к созданию графиков, что означает, что вы описываете, какие данные вы хотите визуализировать и как, а библиотека заботится о деталях.
2. Простота использования: Altair позволяет создавать красивые графики с минимальным объемом кода. Это делает его отличным выбором для быстрого прототипирования и начинающих.
3. Интеграция с Pandas: Altair хорошо интегрируется с библиотекой Pandas, что упрощает работу с данными.
Недостатки Altair:
1. Ограниченные возможности настройки:
В сравнении с Matplotlib, Altair предоставляет меньше возможностей для настройки графиков. Если вам нужны сложные и нестандартные графики, это может быть ограничивающим фактором.
2. Меньшее сообщество и документация: Altair, будучи новым проектом, имеет меньшее сообщество пользователей и менее обширную документацию.
Выбор между Altair и Matplotlib зависит от конкретных потребностей и уровня опыта. Matplotlib подходит для тех, кто нуждается в полной гибкости и контроле над графиками, в то время как Altair предоставляет простой и декларативный способ создания красивых графиков с минимальными усилиями.
👍1🤔1
😎⚡️Визуализация астрономии теперь еще проще в Python
APLpy (the Astronomical Plotting Library in Python) - это модуль Python, предназначенный для создания графиков публикации астрономических изображений в формате FITS.
Хотели ли вы когда-нибудь попробовать визуализцию астрономических данных? Теперь это легко делается на Python с помощью данной библиотеки. Для установки этой библиотеки необходимо всего лишь выполнить следующую команду:
pip install aplpy
👍3
📊📝В открытом доступе сельхозданные Евросоюза

EuroCrops представляет собой обширный сборник датасетов, объединяющий все публично доступные данные о сельском хозяйстве в странах Европейского Союза.
Данный проект финансируется Немецким космическим агентством DLR от имени Федерального министерства экономики и борьбы с изменением климата.
👍3
⚔️📊LDA vs t-SNE: преимущества и недостатки
Два популярных метода для анализа данных данных, LDA (Linear Discriminant Analysis) и t-SNE (t-Distributed Stochastic Neighbor Embedding), используются для решения различных задач. Оба они имеют свои уникальные преимущества и недостатки. Давайте рассмотрим их подробнее.

Преимущества LDA:
1. Классификация:
LDA предназначен для задач классификации и разделения данных. Он стремится максимизировать расстояние между классами, что делает его отличным выбором для задач, связанных с классификацией и распознаванием образов.
2. Интерпретируемость: LDA создает новые признаки (линейные комбинации исходных), которые могут быть интерпретированы как "дискриминантные оси". Это упрощает объяснение того, как и почему данные разделяются.
3. Эффективность при больших данных: LDA обычно более эффективен при работе с большими объемами данных, чем t-SNE. Он может быть быстрее и требовать меньше памяти.
Недостатки LDA:
1. Линейная природа:
LDA предполагает, что данные линейно разделимы, что может ограничивать его применимость в задачах, где классы не могут быть разделены линейно.
2. Недостаток визуальной информации: LDA создает новое пространство признаков, но не обязательно сохраняет сходство между данными точками. Это делает его менее подходящим для визуализации данных.

Преимущества t-SNE:
1. Устойчивость к нелинейным отношениям:
t-SNE может обнаруживать нелинейные зависимости в данных, делая его хорошим выбором для визуализации данных в случаях, когда линейное разделение недостаточно.
2. Отображение высокоразмерных данных: t-SNE может справляться с высокоразмерными данными, сохраняя их структуру при уменьшении размерности.
3. Лучшая визуализация: t-SNE обеспечивает более наглядную визуализацию данных, группируя похожие точки в плотные кластеры.
Недостатки t-SNE:
1. Чувствительность к параметрам: Выбор параметров, таких как perplexity, может сильно повлиять на результаты t-SNE. Необходимо проводить тщательный анализ параметров.
2. Вычислительная сложность: t-SNE может быть вычислительно затратным и медленным при работе с большими наборами данных.
3. Отсутствие интерпретируемости: Поскольку t-SNE стремится к визуальной группировке точек, он не создает интерпретируемых новых признаков.

Таким образом, выбор между LDA и t-SNE зависит от конкретных целей анализа. LDA лучше подходит для задач классификации и интерпретируемости, в то время как t-SNE обычно предпочтителен для визуализации и выявления нелинейных зависимостей.
👍4
Benerator - программное средство для создания тестовых данных, которые можно использовать при тестировании и обучении моделей машинного обучения.
DataFactory - облегчает процесс создания тестовых данных для наполнения баз данных и тестирования искусственных интеллектуальных моделей.
MockNeat - это инструмент, который предоставляет удобный интерфейс программирования (API), позволяющий разработчикам создавать данные в различных форматах, таких как json, xml, csv и sql, без особых усилий.
Spawner - это инструмент для генерации данных, который предназначен для использования с разными базами данных и искусственными интеллектуальными моделями. Он предоставляет множество типов полей, включая возможность настраивать их по усмотрению пользователя.
🔥3❤1👍1
📝🤔Разметка данных: преимущества и обратная сторона
Разметка данных
- это процесс присвоения меток или аннотаций определенным элементам в наборе данных, чтобы обучать машины понимать и извлекать информацию из этих данных. Разметка данных играет важную роль в машинном обучении, глубоком обучении и анализе данных, так как она позволяет алгоритмам понимать, какие объекты или факторы в данных являются важными, а какие несущественными.
Преимущества разметки данных:
1. Улучшение точности моделей:
Разметка данных способствует созданию более точных и надежных моделей, так как алгоритмы могут учиться на основе правильных меток и избегать ошибок.
2. Обучение алгоритмов: Размеченные данные позволяют более эффективно обучать алгоритмы машинного обучения, что делает их способными к решению сложных задач, таких как распознавание образов, классификация текстов, прогнозирование и другие.
3. Расширение функциональности приложений: Размеченные данные позволяют разрабатывать более интеллектуальные приложения и сервисы, такие как виртуальные помощники, автоматизированные системы и многое другое.
Недостатки разметки данных:
1. Ресурсозатратность:
Разметка данных требует значительных усилий и ресурсов, особенно если речь идет о больших наборах данных или сложных задачах.
2. Субъективность: Разметка данных может зависеть от субъективных оценок разметчиков, что может привести к ошибкам и неточностям.
3. Ограниченность задачи: Разметка данных ограничивается конкретной задачей обучения, и изменение этой задачи может потребовать переразметки данных.
4. Обновление данных: Размеченные данные могут устаревать с течением времени, и для поддержания актуальности моделей необходимо периодически обновлять разметку.

В целом, разметка данных является неотъемлемой частью многих проектов в области машинного обучения, и ее преимущества часто превосходят недостатки, особенно при правильной организации и управлении процессом разметки.
👍3
🌎ТОП ноябрьских ивентов в Data Science
2 ноября
- DataStart 2023 - Москва, Россия - https://datastart.ru/
4-5 ноября - BreakPoint 2023: Insert New. Element - Москва, Россия - https://breakpoint23.ru/
9-10 ноября - МАТЕМАРКЕТИНГ - Москва, Россия - https://matemarketing.ru/
16 ноября - TechRec 2023 - Москва, Россия - https://techrec.pro/
22-24 ноября - AI Journey 2023 - Онлайн - https://aij.ru/
28-30 ноября - DATA & ANALYTICS - Москва, Россия - https://techweek.moscow/data_day/
🔥1
📝🔎💥Управлять качеством данных теперь еще проще
Great Expectations (GX)
- это open-source инструмент, созданный на базе языка Python, который служит для контроля качества данных. Он предоставляет командам дата-саентистов возможность проводить анализ и проверку данных, а также создавать с ними отчеты. Этот инструмент обладает удобным интерфейсом командной строки (CLI), что упрощает создание новых тестов и редактирование уже существующих отчетов. Важно отметить, что Great Expectations может быть интегрирован с разнообразными инструментами для извлечения, преобразования и загрузки данных (ETL), такими как Airflow и различные системы управления базами данных. Найти полный список поддерживаемых интеграций и официальную документацию можно на веб-сайте Great Expectations.
👍1🤔1
📝📚Подборка книг по Data Mining
Data Mining: Practical Machine Learning Tools and Techniques - книга предоставляет введение в основы Data Mining и использует популярный инструмент Weka для обучения алгоритмов машинного обучении
Introduction to Data Mining - классическая книга, которая охватывает основные концепции и методы Data Mining
Principles of Data Mining - эта книга предоставляет обширное обсуждение принципов и методов Data Mining
Data Mining Techniques: For Marketing, Sales, and Customer Relationship Management - книга ориентирована на использование Data Mining в маркетинге и управлении клиентскими отношениями
Data Science for Dummies - хороший вариант для начинающих, книга охватывает множество тем, включая Data Mining, машинное обучение и анализ данных
👍3❤1
🤖⚡️🔎Подборка сервисов на базе AI для анализа Big Data
AskEdith - Упрощает анализ данных, позволяя пользователям задавать вопросы и получать мгновенную информацию. Расширяет возможности "аналитики самообслуживания", обеспечивая безопасный и надежный доступ к данным. Совместим со всеми база данных и CRM (Google Sheets, Airtable, PostgreSQL, MySQL, SQL Server, Snowflake, BigQuery и Redshift и тд)
Tomat.AI - Инструмент на базе искусственного интеллекта, который позволяет специалистам по данным легко исследовать и анализировать большие файлы CSV без необходимости кодирования или написания формул. Вы можете открывать и просматривать огромные файлы CSV всего несколькими щелчками мыши
Coginiti - Позволяет пользователям генерировать SQL запросы, используя подсказки на естественном языке, оптимизировать существующие SQL-запросы, объяснять общий SQL в интегрированном каталоге, давать подробные объяснения и решения ошибок, а также объяснять планы выполнения запросов для лучшей оптимизации. ИИ помощник постоянно развивается на основе каждого взаимодействия, адаптируя рекомендации и предложения в соответствии с индивидуальными потребностями
Speak Ai - Платформа для анализа и исследования языковых данных, которая предлагает возможности транскрипции, анализа данных и анализа настроений для различных типов медиа. Он позволяет выполнять автоматическую транскрипцию, массовый анализ, визуализацию и сбор данных для использования в исследованиях, анализе рынка и конкурентном анализе. Инструмент также предлагает общий медиа-репозиторий, систему текстовых подсказок на базе искусственного интеллекта и решение для SWOT-анализа, а также другие функции
Formula God - Инструмент искусственного интеллекта встроен в Google Таблицы. Он использует искусственный интеллект, чтобы помочь пользователям манипулировать и вычислять данные во всем диапазоне ячеек
Simple ML for Sheets - полезен для экспертов по машинному обучению, которые хотят быстро выполнить итерацию или создать прототип на небольших (например, <1 миллиона примеров) наборах табличных данных. Simple ML for Sheets — это надстройка для Google Sheets от команды TensorFlow Decision Forests.
🔥2❤1👍1