Data Science Links
559 subscribers
72 photos
157 links
Зеркало vk.com/datascience и vk.com/tensorflow (ссылки на самые интересные статьи и новости), чтобы предложить пишите @irinochka_ch.

Наши сообщества: @datasciencechat, @datasciencework, vk.com/datascience, vk.com/tensorflow.
Download Telegram
Революционный анализ данных с PandasGUI
PandasGUI обеспечивает беспрецедентно простой и эффективный анализ данных.
https://www.kdnuggets.com/2023/06/revolutionizing-data-analysis-pandasgui.html
👍1
Сквозная оптимизация в промышленности
В этом посте я хочу рассказать о своем опыте разработки технологии, которая управляет интеллектуальными решениями, используемыми в промышленности, чтобы сделать их работу эффективнее и обнаружить скрытые выгоды для бизнеса.
https://habr.com/ru/articles/742162/
👍2
Геолоцировать пользователя по Tweet-у: машинное обучение, часть I
Модели машинного обучения давно тренируются на постах в соцсетях. Самые большие текстовые корпусы созданы на основе Твиттера — они обогащают тысячи компаний сервисами, а библиотеки — академическими статьями.
https://habr.com/ru/articles/741384/
👍1
Сингулярность, в результате которой ИИ сам сделает себя умнее людей. GPT-4 играет в Minecraft и самообучается
В этой статье речь пойдет об эксперименте Voyager: An Open-Ended Embodied Agent with Large Language Models, в котором группа исследователей (Guanzhi Wang, Yuqi Xie, Yunfan Jiang, Ajay Mandlekar, Chaowei Xiao, Yuke Zhu, Linxi Fan, Anima Anandkumar ) дала GPT-4 поиграть в Minecraft.
https://habr.com/ru/articles/740426/
👍1
Полное руководство по сверточным нейронным сетям
Искусственный интеллект стал свидетелем монументального роста в преодолении разрыва между возможностями людей и машин. Исследователи и энтузиасты одинаково работают над многочисленными аспектами этой области, чтобы добиться удивительных результатов.
https://www.kdnuggets.com/2023/06/comprehensive-guide-convolutional-neural-networks.html
👍1
Проблема исчезающего градиента: причины, последствия и решения
Этот пост в блоге призван описать проблему исчезающего градиента и объяснить, как к ней привело использование сигмовидной функции.
https://www.kdnuggets.com/2022/02/vanishing-gradient-problem.html
Фильтруй базар! Как мы параллельный русско-башкирский корпус чистили
Чтобы обучать нейросети понимать и генерировать человеческие языки, нужно много качественных текстов на нужных языках. «Много» – не проблема в эпоху интернета, но с качеством бывают сложности. В этом посте я предлагаю использовать BERT-подобные модели для двух задач улучшения качества обучающих текстов: исправление ошибок распознавания текста из сканов и фильтрация параллельного корпуса предложений. Я испробовал их на башкирском, но и для других языков эти рецепты могут оказаться полезны.
https://habr.com/ru/articles/744972/
Нейронные сети врываются в медицину
Я очень рад, что каждый месяц появляются новые, более сложные и интересные архитектуры, реализующие смелые идеи, которые двигают вперёд области Deep Learning, NLP и Computer Vision (CV), но сколько из них реально используются в прикладных задачах?
https://habr.com/ru/articles/748200/
❤2
Оптимизации работы Jupyter notebook при помощи параллельных вычислений (Библиотека Joblib)
В данном посте я расскажу о возможностях применения параллельных вычислений в интерактивной среде Jupyter notebook языка Python.
https://habr.com/ru/articles/744066/
👍1
DeepPavlov «из коробки» для задачи NLP на Python
Иногда, в процессе работы, появляются новые задачи, для которых у меня и моих коллег нет готовых решений или каких‑то наработок. Например, не так давно у меня возникла необходимость автоматизированного анализа текстовой информации в публикациях на Хабре для составления отчётов.
https://habr.com/ru/articles/741952/
❤1
Ускорение sql запросов к большим таблицам. Оптимизация пагинации
При умеренных объёмах базы данных в использовании offset нет ничего плохого, но со временем база данных растёт и запросы начинают «тормозить». Становится актуальным ускорение запросов.
https://habr.com/ru/articles/744814/
👍1
Полезные TreeMap визуализации для MSSQL, Postgres и MySQL
Я очень люблю визуализации. Человек лучше всего воспринимает информацию через образы. Для трех часто встречающихся баз (MSSQL, Postgres и MySQL) я смастерил плагины к проекту Bell, хотя этот код на Python можно использовать и отдельно.
https://habr.com/ru/articles/729320/
👍1
Нейронные сети не могут обобщать периодические зависимости. Как это исправить?
Изучая нейронные сети, все глубже сталкиваешься с тем, что не ко всем задачам применимы полносвязные глубокие нейронные сети с классическими слоями Linear и слоями активации Relu, Sigmoid, Than и их вариации. Почему не используют остальные функции в качестве активации, например, периодические?
https://habr.com/ru/articles/745768/
👍2
Волновой алгоритм — это алгоритм поиска пути, который использует волновое распространение для определения кратчайшего пути от начальной вершины до целевой вершины.
Название алгоритму дано не случайно, поведение алгоритма соответствует распространению волны, волна огибает препятствия, постепенно заполняя все пространство
https://habr.com/ru/articles/745294/
Масштабирование данных с помощью Python
Как масштабировать данные, чтобы сделать их пригодными для построения модели.
https://www.kdnuggets.com/2023/07/data-scaling-python.html
5 бесплатных книг по обработке естественного языка для чтения в 2023 году
До ажиотажа вокруг больших языковых моделей (LLM) НЛП создавалось, но развивалось незаметно. Теперь он претерпел революцию после выпуска LLM, таких как ChatGPT. Было показано, что LLM понимают, а также генерируют человекоподобный текст. Такие модели, как ChatGPT, Google Bard и другие, были обучены на больших объемах текстовых данных в рамках архитектуры глубокой нейронной сети.
https://www.kdnuggets.com/2023/06/5-free-books-natural-language-processing-read-2023.html
Data Consistency: как быть уверенным, что с данными всё ок
Я довольно долгое время работала аналитиком в Яндекс.Метрике - системе web аналитики. Такие системы помогают сайтам собирать и анализировать поведение пользователей на сайтах.
Естественно, в таких продуктах как аналитические системы, данные - это главная ценность. Поэтому одна из моих задач как аналитика была мониторинг того, что с данными всё ок.
https://habr.com/ru/articles/743794/
👍1
Использование функций регулярных выражений в PostgreSQL / Greenplum
О том, как именно использовать регулярки, написано уже много статей и туториалов. Другой вопрос, что сами по себе регулярные выражения являются параметром, подающимся на вход какой-нибудь функции. Именно функция осуществляет поиск по указанному регулярному выражению.
https://habr.com/ru/articles/747934/
Практический подход к разработке признаков в машинном обучении
В этой статье обсуждается важность изучения признаков в машинном обучении и то, как его можно реализовать с помощью простых практических шагов.

https://www.kdnuggets.com/2023/07/practical-approach-feature-engineering-machine-learning.html
👍1
Ошибки, которых следует избегать начинающим специалистам по данным
Ошибки, которых следует избегать начинающим специалистам по данным
Ознакомьтесь с этим списком распространенных ошибок, которые совершают новички в науке о данных, чтобы вы знали, чего следует избегать при поиске работы.

https://www.kdnuggets.com/2022/06/mistakes-newbie-data-scientists-avoid.html
Алгоритм быстрого поиска при помощи хэширования
Есть некая электронная книга, которую одновременно читает неограниченное количество читателей. Нужно сделать так, чтобы заданный читатель в любой момент мог проверить, какая доля пользователей прочитала меньшую часть книги, чем он . Наивным решением было бы хранить в std::map<int,int> в качестве ключа номера страниц, в качестве значения- количество прочитавших их пользователей.
https://habr.com/ru/articles/749600/
👍1👎1