Data Science: Алгоритмы и Структуры данных
7.73K subscribers
362 photos
42 videos
5 files
3.29K links
Мы не претендуем на оригинальность контента, мы лишь собираем материал из открытых источников.

Ссылка: @Portal_v_IT

Сотрудничество, авторские права: @oleginc, @tatiana_inc

Канал на бирже: https://telega.in/c/structuredata
Download Telegram
Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ

Привет! Меня зовут Евгений Астафуров, я ведущий разработчик в Отделе экспериментальных технологий AI VK. Мы разрабатываем Discovery AI — набор ИИ‑технологий для интеллектуального поиска, рекомендаций и взаимодействия с контентом. В него вошли нейропоиск, анализ контекста, персонализация, генеративные модели и рекомендательные алгоритмы, чтобы помогать пользователям находить нужную информацию, получать релевантные ответы и новый контент.

В этой статье подробно разберу архитектуру технологии нейропоиска в Discovery AI, которая объединяет большую языковую модель (LLM), поиск, инференс и данные многомиллиардной контентной базы VK. Технология становится важным компонентом развития рекомендательных и поисковых систем в наших продуктах и будет поэтапно внедряться в сервисы для пользователей, авторов и бизнеса (Дзен, VK, Медиапроекты Mail, VK Видео и другие).

https://habr.com/ru/companies/vk/articles/1054358/

Алгоритмы и Структуры данных
Применение методов детектирования объектов в задаче долгосрочного прогнозирования событий

Привет, Хабр. Мы — Андрей Савченко — директор по науке, и Иван Карпухин — senior researcher в Sber AI Lab — Центре практического искусственного интеллекта Сбера, расскажем о нашем исследовании, представленном на конференции AAAI 2026.

В сфере искусственного интеллекта за последние десять лет многие самые успешные идеи родились не в какой-то одной предметной области, а на стыке нескольких направлений. Так произошло с трансформерами, которые сначала появились в обработке естественного языка, затем практически полностью изменили компьютерное зрение, а сегодня их используют почти во всех задачах машинного обучения. Похожая ситуация и с долгосрочным прогнозированием последовательностей событий. Неожиданно оказалось, что многие идеи, давно ставшие стандартом в задачах детектирования объектов на изображениях, позволяют принципиально иначе взглянуть на прогнозирование будущих событий.

https://habr.com/ru/companies/sberbank/articles/1054286/

Алгоритмы и Структуры данных
Управляющие последовательности (ANSI)

В этой серии статей мы погружаемся в возможности языка AutoHotkey на примере вывода цветного текста в терминал для консольной версии Launcher.
Часть 1: Наивный алгоритм и его оптимизация
Часть 2: Управляющие последовательности (вы здесь)
Часть 3: Атомарные регулярные выражения
Часть 4: Декларативное программирование
Часть 5: 256 цветов и стилизация текста
В прошлой части мы переписали алгоритм из рекурсивного в итеративный и ускорили его исполнение почти в 22 раза. Однако в получившемся коде пропала поддержка вложенных цветов. В этой части мы попробуем разобраться, почему это произошло, что такое ANSI коды и как они обрабатываются терминалом.

https://habr.com/ru/articles/1054876/

Алгоритмы и Структуры данных
Ускоренное построение KNN-индексов в Manticore

Раньше построение KNN-индекса было самым медленным этапом при сохранении и слиянии чанков в таблицах с векторными атрибутами. Начиная с v27.1.5 , Manticore может задействовать несколько ядер CPU при сохранении чанков, слияниях через OPTIMIZE, авто-оптимизации и ALTER TABLE ... REBUILD KNN. На 16-ядерном Ryzen 9 5950X построение KNN-индекса для 1 миллиона 1536-мерных векторов сократилось с 8 минут до 39 секунд.

https://habr.com/ru/articles/1054750/

Алгоритмы и Структуры данных
📣USB-концентратор

Цена: ~2300₽
Рейтинг: 4.8😀
Отзывы: 2.774 💬

🖱 Заказать

USB-концентратор 11 в 1 поможет расширить возможности компьютера или ноутбука, позволяя одновременно подключать множество периферийных устройств и аксессуаров через один компактный адаптер.

#usb #концентратор

Находки Программиста
Please open Telegram to view this post
VIEW IN TELEGRAM
Часть II. Начала дискретной математики. SQL, Комбинаторика, Тервер за 15 минут. SQL, EBNF, XPATH в 480 LOC

Для строительства компиляторов, нам нужны начала математики. Из
них, как мы убедимся, проистекает добрая половина понимания и всех наших работ.
В частности, без начал не понять лямбда-исчисление Чёрча, которое мы рассмотрим и применим на этапе работы с AST.

https://habr.com/ru/articles/1055010/

Алгоритмы и Структуры данных
Почему интервью для разрабов — такое непроходимое говно, и что с этим делать?

Доброго утречка. Прогреемся?

Мое мнение не отражает позицию какой бы то ни было компании. Все совпадения с вашими нанимающими менеджерами случайны. Мой бывший Director Title в одном из топ-трех русскоговорящих бигтехов никакого отношения к высказанному не имеет и совпадения с ним тоже случайны. Кто захочет — при желании найдет, где и чем я занимался последние 10 лет и почему мое мнение имеет ценность.

Если вы не знали, откуда на собесах для джейсоноукладчиков взялась сортировка пузырьком, сегодня узнаете. Поехали!

https://habr.com/ru/articles/1055116/

Алгоритмы и Структуры данных
Быстрые и компактные структуры данных для RMQ

Я собрал несколько практических наработок и сделал из них два очень компактных и быстрых варианта:
вариант с  дополнительных бит, которому иногда нужно обращаться к исходному массиву;
вариант с  дополнительных бит, который отвечает на запросы без доступа к исходному массиву.
Обе реализации очень быстры на практике: на случайных запросах по массиву размера  элементов они работают в среднем за – нс на запрос.
Для ориентира: туториал Codeforces по блочному RMQ описывает структуру, которая работает  нс на запрос для массивов длины  с 32-битными целыми числами, при этом используя  дополнительных бит.

https://habr.com/ru/articles/1055008/

Алгоритмы и Структуры данных
1
У нового клиента нет эмоций? Рассмотрим перспективы маркетинга на 2027-2028 год

Я занимаюсь маркетингом и политическими технологиями достаточно долго, чтобы пережить несколько обещанных концов профессии: наружную рекламу хоронили после появления интернета, телевидение — после таргета, таргет — после инфлюенсеров, а инфлюенсеров теперь хоронят люди, которые ещё вчера продавали курсы по работе с ними. Отрасль всякий раз не умирала, а меняла носитель, сохраняя главное — борьбу за человеческое внимание и право объяснить человеку, почему выбрать нужно именно нас.
Сейчас меняется не носитель. Между брендом и деньгами встал новый участник — алгоритм, который ищет, сравнивает, составляет короткий список, а иногда уже оформляет покупку. Это не ещё один инструмент маркетолога и не новый рекламный канал. Это новый клиент: он не испытывает эмоций, но умеет вычислять наши; не верит обещаниям, но использует их как данные; не любит бренды, но способен решить, какие из них вообще увидит человек.
Ниже — девять сдвигов, которые я разбираю в «Фабрике смыслов 2.0». Я называю их сдвигами, а не прогнозами, потому что OpenAI уже превращает выбор товара в отдельное исследование, Google строит протоколы агентной торговли, а поисковые системы учатся не только находить страницы, но и собирать из них ответ. Будущее, как обычно, наступило в бета-версии и с мелким шрифтом в пользовательском соглашении. Книга готовится к выходу, поэтому публикую не рекламный анонс, а рабочий скелет концепции. Хабр для этого подходит лучше площадок, где автору принято сообщать, что он «поднял важную тему»: здесь быстрее объяснят, в каком месте важная тема не сходится с документацией.

https://habr.com/ru/articles/1070762/

Алгоритмы и Структуры данных
Сопоставление каталогов продукции: автоматический массовый подбор с использованием токенизации

Задача широко знакома в узких кругах: наш каталог товаров встречается с каталогом контрагента — по сути одни и те же позиции, но названы по-разному. Надо найти совпадения и предоставить коллегам список подходящих наших артикулов для каждой их позиции.

В разобранном ниже случае это картриджи: 22 тысячи записей у контрагента против сотен тысяч наших номенклатур. Для такой задачи матерый программист берёт Elasticsearch, алгоритмы нечёткого поиска и тратит много времени, иногда в меру матерясь. Здесь подбор ведется с помощью токенизации, запросами в стиле no-code и без ИИ.

https://habr.com/ru/articles/1055368/

Алгоритмы и Структуры данных
35 вопросов для собеседований по RL в 2026 году

Уже который раз я наблюдаю одну и ту же картину: человек проходит в аспирантуру, но затем почти сразу же во время весенней волны найма устраивается на высокооплачиваемую должность в отрасли. Меня подобное натолкнуло на мысль сразу пойти работать в индустрию.

Поэтому я поискал по Zhihu и прошёлся примерно по всем рассказам о собеседованиях, связанным с обучением с подкреплением (reinforcement learning), сопоставил их со свежими обсуждениями и собственными наблюдениями, а затем подготовил из этого выжимку на 35 самых интересных вопросов. Считайте получившееся своего рода бенчмарком для собеседований по RL.

https://habr.com/ru/articles/1055446/

Алгоритмы и Структуры данных
Уже очевидно, что ВАЙБКОДИНГ — главный навык ближайших лет

Посмотрите сами. ИИ уже забирает на себя работу целых команд: пишет код, закрывает задачи джунов и позволяет стартапам запускать продукты в 2–3 раза меньшим составом. То, на что раньше нужны были несколько разработчиков, сегодня всё чаще делает один человек с ИИ-агентами.

И это только начало. Те, кто освоит вайбкодинг сейчас, смогут быстрее запускать проекты, автоматизировать огромный объём работы, увереннее конкурировать на рынке и зарабатывать больше тех, кто продолжает делать всё вручную.

Начать с нуля поможет канал Вайб-кодинг. Там ребята круглосуточно мониторят более 320 российских и зарубежных источников и публикуют только главное: релизы, инструменты, гайды, курсы и практические кейсы.

Подписывайтесь, нас уже 59 тысяч: @vibecoding_tg
В чем смысл жизни с точки зрения термодинамики?

Мне хорошо запомнилось видео, где автор рассказывал про то, что многие люди находят свою работу бредовой и никому не нужной. Осмысленность труда - важная часть психологического комфорта, от которого зависит в том числе и продуктивность процессов. Если ты не понимаешь, зачем ты что-то делаешь, тяжелее исправлять и предугадывать собственные ошибки, а также сохранять концентрацию. В наше время люди часто впадают в личностные кризисы, которые симптоматически совпадают с депрессией, и я считаю эту проблему крайне серьезной, потому что проходил её сам. Я пытался решить системные проблемы с мотивацией и желанием жить с помощью терапии разных типов, в том числе и с использованием препаратов, но основной вклад в это внесли фундаментальная философия и фундаментальная физика. Я склонен считать, что на дистанции такая призма восприятия может помочь всем, поэтому решил ей поделиться.

https://habr.com/ru/articles/1055788/

Алгоритмы и Структуры данных
АЙТИШНИКИ БЕСПЛАТНОЕ ОБУЧЕНИЕ

Проект «Terminal» стал крупнейшей библиотекой бесплатного образования. В одном канале собраны курсы, книги, полезные инструменты и практические тренажёры для всех разработчиков:

• Практические курсы и задания
• Книги и статьи известных авторов
• Полезные инструменты и ресурсы
• IT-новости и инсайды

Обучение по всем направлениям: SQL, Python, ML, Frontend, PHP, C++, Go, Git, Linux, QA, Java, Vibe-coding, InfoSec и др.

⌨️ подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Stream compaction на NEON. Векторизуем copy_if

Даны массивы a и out. Нужно записать в out подряд, без пробелов, только те элементы a, которые удовлетворяют заданному условию. В статье — условие a[i] > threshold, a[i] ∈ (0, 1), threshold ∈ {0, 0.5, 1}.

https://habr.com/ru/articles/1055904/

Алгоритмы и Структуры данных
Iron Core. Часть 3: Бессмертная командная строка

Публикуем перевод третьей статьи из серии (первая частьвторая), посвящённой информационным технологиям в авиаперевозках. Сегодня поговорим о режиме командной строки системы Amadeus, работа в которой опирается на язык, созданный для телетайпов. Этот язык до сих пор обеспечивает огромный процент бронирований билетов во всём мире — как тех, что выполняются различными агентствами, так и тех, что делаются посредством GDS.

https://habr.com/ru/companies/wunderfund/articles/1046431/

Алгоритмы и Структуры данных
Media is too big
VIEW IN TELEGRAM
Как работает сортировка вставками и чем она отличается от сортировки выбором

В видео разберём принцип работы алгоритма сортировки вставками и его ключевое отличие от сортировки выбором. Также покажем реализацию алгоритма на Python и наглядно разберём, как он сортирует элементы.

➡️Смотреть видео

➡️Скачать видео

Data Science: Алгоритмы и Структуры данных
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Вращение в AVL-деревьях

Двойные повороты - достаточно сложная тема, но я нашел достаточно хорошее объяснение этому. Обратите ваше внимание на картинку. В данном случае представлено вращение влево-вправо.

Поворот влево-вправо - это комбинация вращений влево, за которым следует вращение вправо.

Есть аналогичное вращение вправо-влево, только оно с точностью наоборот. Сначала вращение вправо, а после уже влево!

Data Science: Алгоритмы и Структуры данных
3👍1
Возвращаем прямой формат контента по тематике канала. Полностью пересмотрели подход к постам.

Надеемся, что вам будет полезно.
👍3🔥3
Алгоритмы машинного обучения

Данное видео поможет вам разобраться, какие проблемы есть в Machine Learning, и познакомит с различными алгоритмами.
Ключевые алгоритмы машинного обучения - это линейная регрессия, логистическая регрессия, дерево решений, случайный лес и алгоритм KNN.
Все алгоритмы представлены с простыми примерами и реализованы на языке Python.

➡️Смотреть видео

➡️Скачать видео

Data Science: Алгоритмы и Структуры данных
Please open Telegram to view this post
VIEW IN TELEGRAM
Топ-10 алгоритмов машинного обучения

В машинном обучении есть нечто, называемое теоремой «No Free Lunch». Вкратце, в ней говорится, что ни один алгоритм не работает лучше всего для каждой проблемы, и это особенно важно для контролируемого обучения (т.е. predictive modeling).

➡️Читать статью

Data Science: Алгоритмы и Структуры данных
Please open Telegram to view this post
VIEW IN TELEGRAM