Код в мешке

Как Google оценивает контент: скрытые метрики поискового доверия #habr
https://habr.com/ru/companies/agima/articles/952054/
Tags: скрытые метрики, Question Fringe Score, Trust Bias, Chard Signals, репутационная сетка Google, Topic Authority, Web Entity Confidence
Author: AndreyTrig (AGIMA)

Хабр

Как Google оценивает контент: скрытые метрики поискового доверия

Всем привет! Меня зовут Андрей Попов, я SEO-специалист в AGIMA . В 2025 году работа с поисковыми системами кардинально изменилась: Google и ИИ-ассистенты вроде Алисы, Gemini или Chat GPT всё чаще не...

9 views13:41

Код в мешке

Проектный офис: база знаний для обучения и повышения квалификации сотрудников #habr
https://habr.com/ru/companies/teamly/articles/952110/
Tags: teamly, база знаний, проектная команда, управление знаниями
Author: Vitaliy_Chesnokov (TEAMLY)

Хабр

Проектный офис: база знаний для обучения и повышения квалификации сотрудников

База знаний может стать центром обучения в проектном офисе , где кросс-проектный опыт и стандарты определяют успех. Как? Разберем в статье. Идеальные отчеты, инструкции по общению со сложными...

9 views13:41

Код в мешке

Что такое DevOps и почему он автоматизировал не всё #habr
https://habr.com/ru/companies/ruvds/articles/950758/
Tags: devops, девопс, девопс-инструменты, девопс-философия, it-компании, it-инфраструктура, it-образование, ruvds_статьи
Author: About_it (RUVDS.com)

Хабр

Что такое DevOps и почему он автоматизировал не всё

Вы сделали заказ в интернет-магазине, а он внезапно завис в самый разгар скидок. За кулисами этого сервиса работают сотни строк кода и ещё больше человеческой поддержки. DevOps — это способ...

7 views13:41

Код в мешке

Изоляция базы данных для автотестов #habr
https://habr.com/ru/companies/skbkontur/articles/950240/
Tags: автотесты, базы данных, изоляция
Author: ksyusha_ast (Контур)

Хабр

Изоляция базы данных для автотестов

Привет, меня зовут Ксюша Астахова, и я инженер-программист в Контуре. Хочу поделиться способом изоляции базы данных для автотестов. Статья будет полезна бэкенд-разработчикам и тестировщикам. 🙌...

6 views13:41

Код в мешке

Кейс: разработать квест-мастера на нейронке #habr
https://habr.com/ru/articles/952044/
Tags: бот, ии-агенты, нейросети, llm, кейс, работа над ошибками
Author: Teutonick

Хабр

Кейс: разработать квест-мастера на нейронке

Инженерия подсказок, как и все, что связано с нейросетями, для непогруженного человека может показаться чем‑то раздутым и незначительным. Нет, ну серьезно. Что трудного...

6 views13:41

Код в мешке

Полное руководство по посевам в Telegram: как не слить бюджет на ботов #habr
https://habr.com/ru/articles/952132/
Tags: telegram, influence-маркетинг, посев, блогеры, маркетинг, социальные сети, телеграм, телеграм-каналы
Author: Lastman

Хабр

Полное руководство по посевам в Telegram: как не слить бюджет на ботов

Краткое содержание: разбираем пошаговый алгоритм проверки каналов в Telegram, избегаем накрученные площадки и находим качественный трафик. На примере реального кейса показываю, как отличить...

8 views13:41

Код в мешке

Тихий апокалипсис: я устал читать сгенерированные статьи #habr
https://habr.com/ru/articles/951366/
Tags: ИИ-генерация, нулевая ценность, экономика внимания, экспертный контент, ИИ
Author: eternaladm

Хабр

Тихий апокалипсис: я устал читать сгенерированные статьи

Привет, Хабр! Накипело. В последние 3-4 месяца, при поиске интересных статей на Хабр, очень часто замечаю полностью скопированные, не отредактированные статьи, которые генерирует ИИ. Появился некий...

6 views13:41

Код в мешке

Новая карта видеоконтента в России: что произошло с рекламой на YouTube, куда перешли пользователи и рекламные бюджеты #habr
https://habr.com/ru/companies/click/articles/952136/
Tags: youtube, вконтакте
Author: Clickru (Click.ru)

8 views13:41

Код в мешке

InternLM представила модели CapRL-3B и CapRL-Eval-3B для генерации текста к изображениям #habr
https://habr.com/ru/companies/bothub/news/952036/
Tags: ии, нейросети, машинное+обучение, ai, qwen

Хабр

InternLM представила модели CapRL-3B и CapRL-Eval-3B для генерации текста к изображениям

Команда InternLM анонсировала две новые модели — CapRL-3B и CapRL-Eval-3B , предназначенные для создания текстовых подписей к изображениям. По точности работы они сопоставимы с гораздо более крупной...

9 views13:41

Код в мешке

Kandinsky Video Lite теперь open-source

«Сбер» выложил в открытый доступ модель для генерации видео.
По качеству работы она превосходит более крупные нейросети, включая оригинальную Sora, отметили в компании.

Ещё «Сбер» поделился Giga-Embeddings - на базе этой модели бизнес сможет строить RAG-системы для поиска по документам, аналитики данных и автоматизированной поддержки пользователей.

Подробнее:
↘️ rozetked.me/news/41840
...

rozetked.me

«Сбер» выложил в открытый доступ модель для генерации видео Kandinsky Video Lite

А также нейросеть для создания векторных представлений текста — Giga-Embeddings.

10 views14:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

Для тех кто работает с данными на регулярной основе и любит командную строку:
- xan, the CSV magician - инструмент для манипуляции с CSV файлами от команды medialab французского SciencePo. Акценты на визуализацию в командной строке. Написан на Rust, открытая лицензия
- qsv - инструмент обработки CSV файлов с акцентом на производительность и подготовку данных для публикации на порталах открытых данных CKAN. Написан на Rust, открытая лицензия
- q - инструмент SQL запросов к текстовым файлам, например, CSV
- jq - инструмент запросов к JSON файлам

Я также создавал немало инструментов командной строки https://t.me/begtin/6557, но, каюсь, у всех из них есть явные недостатки в отсутствии документации.

Та часть жизни когда хочется больше программировать, а приходится проектировать продукты, писать документы, собеседовать людей и многое другое.

#data #tools #datatools

14 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

Apertus (лат. открытый) LLM - свежая открытая прозрачная многоязычная большая языковая модель из Швейцарии анонсированная как совместная разработка исследователей EPFL, ETH Zurich и CSCS. Модель опубликована на Hugging Face, доступна с открытым кодом, декларируется как прозрачная и этичная (обучена только на данных сайтов которые позволяют обучать ИИ) и декларируется поддержка более 1000 языков.

Эта модель создана как часть инициативы Swiss AI, демо Apertus доступно онлайн на publicai.co.

И, на закуску, технический отчет 0.1 о текущей версии модели Apertus. Там много интересного, мне бросилось в глаза наличие SwitzerlandQA, специализированного набора тестов по каждому из 26 кантонов Швейцарии по каждому из которых как минимум 200 вопросов и всего собрано 9,167 вопросов, с последующим их переводом на немецкий, французский, итальянский, романшский и английский языки.

#opensource #opendata #ai #switzerland

8 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

В рубрике интересных наборов данных датасет метаданными 40 миллионов репозиториев на Github github-repos-metadata-40M размещённый на HuggingFace. Создан в июле 2025 г., включает такие метаданные как название репозитория, уникальный код, описание, основной язык, код лицензии, число, размер, число наблюдаетелей, число форков, дату создания.

Создан на основе GHArchive - базы событий в Github.

С одной стороны полезный датасет, а с другой он позволяет считать только основные метрики по репозиториям.

Например, Github это, возможно, крупнейший архив не только кода, но и данных в мире и, с точки зрения наполнения Dateno, лично меня всегда интересовала возможность найти на Github'е репозитории используемыми для публикации наборов данных. Это не так просто, если быть честным. Это требует не базовых метаданных, а, как минимум, копии README.md и списка всех файлов в репозитории и классификационного механизма позволяющего определить тип репозитория: только код, данные, документация, гибрид и тд. Причём после первоначального анализа README.md и списка файлов может потребоваться заглянуть в дополнительные файлы чтобы собрать все метаданные необходимые для описания набора данных.

Но такой датасет на базе Github'а лично мне пока не попадался.

#opendata #datasets

5 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

Разные мысли вслух:
1. LLM'ки для кодинга пока плохо справляются с оптимизацией уже оптимизированного кода. Все мои попытки оптимизировать инструменты ориентированные на быстрый разбор данных приводят к тому что ИИ агенты дают множество как бы неплохих оптимизаций, но, ожидаемо, без серьёзного понимания контекста. Например, много лет назад я написал библиотеку для Python qddate которая заточена под быстрый парсинг дат, которая довольно интенсивно мной оптимизировалась под быстрый разбор дат в разных форматах в том числе "грязными хаками" вроде вкодированной идентификации потенциальных шаблонов. Все рекомендации от LLM сводились к введению разных форм кеширования без учёта природы и специфики данных. Итоговой оптимизации парсинга они не дают. Немного лучше становится когда природу данных и инструментов ты понимаешь и ставишь задачу в стиле "Оптимизируй код XXX используя инструменты YYY и/или ZZZ", но в целом проблема не в галлюцинациях, а в непонимании автоматическими инструментами природы задач под которые код должен быть оптимизирован.
2. Программирование тяжело сочетается со всеми прерывающими задачами. Это, конечно, совсем не новость, но сложно сочетать любую разработку и написание текстов и управленческую работу, равно как и работу руководителем проектов. Есть задачи качество которых измеряется в возможности непрерывной работы от 2 до 4 часов подряд. Даже при том что все свои активности связанные с выступлениями, лекциями, совещаниями я в последние годы сократил до минимума, но управление временем становится важнейшей необходимостью.
3. Хороший код != востребованный продукт. Хотя эти явления часто идут вместе, но синонимами не являются. Работая со множеством инструментов по обработке данных вижу как хорошие инструменты часто могут быть заменены эволюционно более сильными инструментами, даже при наличии хорошего кода. Например, DuckDB, по факту, значительно эффективнее большей части утилит работы с CSV файлами, а работа с CSV файлами куда менее эффективна чем работа с файлами в форматах вроде Parquet. Это касается, как минимум, инструментария работы с данными, но ими не ограничивается.

#thoughts

5 views09:31

Код в мешке

Forwarded from Ivan Begtin (Hovannes Begtin)

В качестве регулярных напоминаний в основе поисковика Dateno реестр почти всех существующих каталогов с данными. Этих каталогов много, более 10 тысяч и большая их часть - это каталоги геоданных, вторые по количеству - порталы открытых данных и далее научные репозитории, базы индикаторов и так далее.

Ценность этого репозитория не только в том что он помогает индексировать датасеты, но и в том что он позволяет понять национальным пр-вам и их уполномоченным органам какие данные можно было бы собирать на едином/центральном портале.

Кроме того этот реестр - это подсказка для тех кто ищет данные по своей стране и возможность находить, в том числе, те данные которые пока ещё не проиндексированы в Dateno.

#opendata #dateno #datasets #datadiscovery

9 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

Для тех кто любит исследовать данные, любопытный open source проект с непереводимым, но благозвучным названием huey который внутри использует DuckDB-WASM, а на вход разные дата файлы - parquet, csv, json и др. и позволяет их исследовать прямо в браузере. Можно отнести его к категории data exploration tool, их всё больше, все немного разные и безусловно иногда необходимые.

Из минусов:
- не поддерживает CSV файлы с кодировками отличными от utf8
- не всегда умеет распознавать структуру файлов

Из плюсов:
- всё локально в браузере

#opensource #datatools #duckdb

5 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

Свежая научная статья как дополнительное подтверждение того что начинающие разработчики всё менее востребованы, а опытные разработчики востребованы всё более. В выводах в статье ещё есть упоминание о том что более всего это бьёт по выпускникам ВУЗов средней руки, а вот лучшие и наиболее слабые затрагивает в меньшей степени.

Всё это про рынок труда в США, конечно же.

#ai #jobs #it

7 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

GlobalBuildingAtlas набор данных по всем зданиям в мире, общим объёмом в 36 терабайт. Опубликован в апреле 2025 г. , доступен для полной выгрузки и как сервис WFS. Под лицензией CC-BY-NC 3.0 (свободное использование для некоммерческих целей)

#opendata #datasets #geodata

11 views09:31

Код в мешке

Forwarded from Ivan Begtin (Ivan Begtin)

В Южной Корее правительство планирует в ближайшее время опубликовать 15 особо ценных наборов данных для обучения ИИ и корпоративной поддержки. Первые данные необходимы для обучения ИИ агентов, например, в области LegalTech, вторые для типовых задач решаемых корпорациями и для которых нужны государственные данные. Обещают безопасное открытое раскрытие данных с заменой персональных данных на синтетические.

Всего же в Южной Корее опубликовано более 100 тысяч наборов данных и открытых API на национальном портале www.data.go.kr

В Корее есть совершенно чёткий акцент на данные востребованные бизнесом и на коммуникацию с бизнесом заинтересованном в данных и этой стратегии там придерживаются довольно давно.

#opendata #korea #datasets

9 views09:31

About

Blog

Apps

Platform