Ivan Begtin
7.98K subscribers
1.82K photos
3 videos
101 files
4.53K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and other gov related and tech stuff.

Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Secure contacts ivan@begtin.tech
Download Telegram
Google выключают доступ к кешированным страницам [1] которые ранее были доступны в их поиске, теперь эти страницы будут доступны только через Google Webmaster для владельцев сайтов [2]. Кеш Google активно использовался для восстановления недавно исчезнувших сайтов и просмотра удалённых веб страниц.

Сам сервис, напрямую, ещё работает [3], но в результатах поиска Google уже не отображается.

Теперь единственным крупным источником архивных веб страниц остаётсяv Интернет архив [4].

Ссылки:
[1] https://arstechnica.com/gadgets/2024/02/google-search-kills-off-cached-webpages/
[2] https://twitter.com/searchliaison/status/1753156161509916873
[3] https://webcache.googleusercontent.com/search?q=cache:https%3A%2F%2Fwww.wikipedia.org%2F
[4] https://web.archive.org

#archives #webarchive #google
В качестве регулярных напоминаний, помимо этого телеграм канала я время от времени пишу на других площадках:
- рассылка лонгридов на Substack на русском языке https://begtin.substack.com/
- блог в Medium на английском языке https://medium.com/@ibegtin
- в Фэйсбук'е https://www.facebook.com/ibegtin (почти дублируется с телеграм каналом)
- в VK https://vk.com/ivbeg пишу сильно реже, мне как и многим эта соцсеть не нравится, но часть аудитории там.

А также другие телеграм каналы:
- Инфокультура https://t.me/infoculture с анонсами проектов и новостями АНО Инфокультура
- Национального цифрового архива https://t.me/ruarxive о архивации цифрового русскоязычного и российского контента
- проекта Госзатраты https://t.me/clearspending - ведут мои коллеги в Инфокультуре, в основном туда роботы постят инфу про интересные госконтракты. Вот уже много лет
- Open Data Armenia https://t.me/opendatam - телеграм канал Open Data Armenia, армянской НКО которую я возглавляю (Yes hay em) и где на трёх языках: английском, армянском и русском про открытые данные в Армении


#readings #opendata #russia #armenia #telegram
Forwarded from Ах, этот Минфин (Olya Parkhimovich)
Изостатистика - одна из первых книг по инфографике

Так как мы решаем большую задачу «собрать бюджеты России за 100 лет», приходится часто искать новые источники исторических книг и документов. Одной из самых интересных находок стала книга И.П. Иваницкого «Изостатистика. Изобразительная статистика и венский метод», изданная в «Москве-Ленинграде» в 1932 году.

Изостатистика, как оказалось, примерно то же самое, что в современном мире называют «инфографикой», и что в книге зовется «количественной системой диаграммирования».

Книга описывает базовые принципы создания диаграмм, приводит большое количество примеров исторических инфографик и разбирает каждую из них.

К сожалению, книга черно-белая, но все равно уникальная.

Скачать книгу можно с сайта НЭБ (уникальный источник исторических книг): https://rusneb.ru/catalog/000199_000009_005073846/

#открытыеданные #инфографика #диаграммы
Большая статья-исследование на сайте Mozilla о том как компании обучающие ИИ используют Common Crawl "Training Data for the Price of a Sandwich"[1], статья подробная, авторы провели большую работу анализируя то как наборы данных на базе Common Crawl создавались и как они используются. Краткие выводы в том что Common Crawl сильно неполный и не вполне доверительный датасет из-за отсутствия одного контента и отсутствия фильтров на разного рода некачественный контент. Выводом там много, вплоть до идей о том что надо создавать альтернативу Common Crawl с этическими мыслями в голове.

Я с такими выводами соглашаться не готов, но они не отменяют полезности этого обзора. Напомню что Common Crawl - это некоммерческий проект по индексации интернета по аналогии с поисковым индексом Google, но доступного как базы данных, файлы и всё под свободными лицензиями. Проект был создан в 2007 году и в последние годы он почти весь хранится и обновляется на ресурсах Amazon.

Ссылки:
[1] https://foundation.mozilla.org/en/research/library/generative-ai-training-data/common-crawl/

#opendata #data #web #commoncrawl #ai #mozilla
Forwarded from Open Data Armenia
Опубликовано видео на youtube-канале проекта!

Дорогие подписчики, опубликовали для вас видеозаписи, прошедших вебинаров, приуроченных к конкурсу Open Data Armenia Contest.

1. Вебинар "Обзор открытых данных Армении: лицензии и источники".

2. Вебинар "Введение в визуализацию данных: проекты, методы и инструменты".

📍Подписывайтесь на канал, ставьте лайки и жмите на колокольчик для получения уведомлений о новых видео: https://www.youtube.com/@OpenDataArmenia/videos
Свежий портал геоданных Республики Молдова geodata.gov.md [1] похоже что какой-то своей разработки и пока 16 карт и слоёв с данными. Внутри всё работает на Geoserver в котором слоёв уже побольше, 25 [2], но, всё равно, пока довольно скромно.

И удивительно что своя разработка, а не какой-нибудь Geonode, который с открытым кодом и даёт точно такой же портал.

В целом же данные страны проще пока найти на геокаталоге NSDI страны [3] где опубликовано 165 слоёв, а также в Молдове есть некоторое число общедоступных серверов ArcGIS и Geoserver, также, с геоданными.

Ссылки:
[1] https://geodata.gov.md/#/
[2] https://geodata.gov.md/geoserver
[3] https://geoportalinds.gov.md

#opendata #datasets #geodata #moldova
У меня уже очень долгое время в пассиве домен "kremlin.io" который я ещё давно хотел превратить в дата-проект, но всё это время откладывал и откладывал и откладывал и в этом году тоже отложу, потому что много всего другого в работе. Тоже про данные, но всякое другое.

Применить его можно про всякое. От исторического проекта про разные кремли с их панорамами обзорами, до дата-журналистики про то какой плохой/хороший основной Кремль как политическая институция.

До какого-нибудь софтверного продукта компонента с названием Kremlin, что будет странно по нынешним временам, но почему бы и нет?

Лично я когда-то хотел этот домен использовать в двух разных сценариях:
1. Как каталог данных про РФ именно про госуправление и госполитику.
2. Как проект по мониторингу государственной ИТ/цифровой политики в РФ.

Но оба сценария сейчас не проходят фильтра в виде вопроса "Зачем?", другие сценарии не придумываются, а домен превратился в пассив.
Так что готов его отдать за очень много денег которые все пожертвую на нашу НКО.

#questions #domains #kremlin
В рубрике пока ещё доступных российских данных, порталы радиационного мониторинга.

Единая государственная автоматизированная система мониторинга
радиационной обстановки на территории Российской Федерации
[1] включает данные мониторинга и ежемесячные отчёты. Открытых данных нет, есть недокументированные API и регулярные ежемесячные и годовые отчеты с детализацией до города/поселения

Радиационная обстановка на предприятиях Росатома [2] с ежесуточным обновлением. Открытых данных нет, есть недокументированное API.

Радиационная обстановка Красноярского края [3]. Открытых данных нет, есть ежесуточные данные, нет API, нет исторических данных в открытом доступе.

А также существует ещё как минимум десяток сайтов и порталов структур входящих в Росатом и Росприроднадзор публикующих регулярно обновляемые данные.

В форматах открытых данных их никто не публикуют, но и до сих пор не закрывают.

[1] https://egasmro.ru
[2] https://www.russianatom.ru
[3] http://www.krasecology.ru/operative/radio

#opendata #datasets #russia #radiation
Микрофоны в туалетах начали устанавливать в Великобритании в некоторых школах [1] чтобы отслеживать вэйпинг и буллинг школьников. Сенсоры продает Triton Sensors [2]. Когда ключевое событие происходит то администрация школы автоматически уведомляется с помощью SMS.

Похожие сенсоры под брендом HALO Smart Sensors в США внедряет компания IPVideo (часть Motorola). Ими охвачено уже более 1500 школ.

Причём согласия родителей не требуют поскольку персональные данные не собираются, только предупреждения рассылаются администрации.

Интересно что дальше будет. Автоматические химические анализаторы в в унитазах и канализационных трубах для выявления наркотиков? Обязательные наручные бэнды для отслеживания уровня стресса? Есть некоторое ощущение что школы превращаются в анти-утопические центры образования.

Ссылки:
[1] https://schoolsweek.co.uk/schools-install-toilet-sensors-that-actively-listen-to-pupils/
[2] https://tritonsensors.com/3d-sense-pro/
[3] https://halodetect.com/

#privacy #security #schools
Международные данные, подборка каталогов глобальных индикаторов и не только:
- Global Trade Data Portal [1] от Всемирной торговой организации. Помимо подборок данных и визуализаций от ВТО, там также представлены данные партнеров ВТО которые могут запрашивать исследователи для научных работ [2], самое интересное - это портовые грузоперевозки, ИМХО, впрочем для разных задач, разные данные.
- Data Futures Exchange [3] портал данных UNDP с разного рода показателями развития, а также множество продуктов на данных от того же UNDP включая GeoHub [4], каталог геоданных, и портал с данными для малых развивающихся островных государств SIDS [5]
- COVID-19 Data Portal [6] созданный в ЕС (EMBL-EBI) разросся до 30+ миллионов дата объектов из которых 29 миллионов это примеры и вирусные последовательности, ещё около 1 миллиона - это статьи и оставшиеся несколько десятков тысяч - это другие связанные с вирусом данные и данные по научной инфраструктуре.
- EUI Library Data Portal [7] большой систематизированный каталог описаний источников данных в European University Institute, Скорее даже не источник международных данных, а источник их описания.
- Gemstat Data Portal [8] портал данных проекта ООН по мониторингу качества питьевой воды по всему миру. Датчики во многих странах, данных много, очень много, но предоставляют их не самым удобным способом. Даже API не документировали.

Ссылки:
[1] https://globaltradedata.wto.org
[2] https://globaltradedata.wto.org/data-partnerships
[3] https://data.undp.org
[4] https://geohub.data.undp.org
[5] https://sids.data.undp.org
[6] https://www.covid19dataportal.org
[7] https://www.eui.eu/Research/Library/ResearchGuides/Economics/Statistics/DataPortal
[8] https://portal.gemstat.org

#opendata #dataportals #indicators #statistics
В рубрике закрытых в России данных. Министерство юстиции РФ с 2022 года не публикует в официальной статистике [1]:
- Сведения о контроле и надзоре в сфере государственной регистрации актов гражданского состояния
- Сведения о государственной регистрации актов гражданского состояния и органах ее осуществляющих

Кроме того, как минимум, с 2021 года в официальной статистике Минюста РФ не раскрываются сведения о регистрации смерти. Эти данные есть в статистике за 2019 год [2] и отсутствуют в статистике за 2021 [3].
Статистика за 2020 год на федеральном уровне не публиковалась.

При этом на региональном уровне, в некоторых регионах таких как Республика Алтай, терр управления Минюста РФ публикуют статистику, в том числе полугодовую и в том числе за 2023 год и в том числе о регистрации смертей [4]. В других регионах, терр. упр. по Владимирской области отправляют на оф. сайт Минюста РФ и сами ничего не публикуют [5], а в Республике Адыгея вообще ничего не размещают [6].

P.S. Фактически эти данные были одним из немногих источников сведений о смертности, полезные для перепроверки других источников. Но и они "были", и ненадёжны.

Ссылки:
[1] https://minjust.gov.ru/ru/activity/statistic/
[2] https://minjust.gov.ru/uploaded/files/sbornikpominyusturossii0261912.xls
[3] https://minjust.gov.ru/uploaded/files/kopiya-17241652-66814750.xls
[4] https://to02.minjust.gov.ru/ru/pages/svedeniya-o-gosudarstvennoj-reg29012024/
[5] https://to33.minjust.gov.ru/ru/activity/statistic/
[6] https://to01.minjust.gov.ru/ru/activity/statistic/

#closeddata #opendata #russia #statistics #demographics
Сегодня, любопытства ради, я посмотрел трансляцию Минцифры РФ со "Дня госуслуг".

Всё думал как это прокомментировать, сформулирую мысли тезисами:
1. Госуслуги в России действительно существуют, в отличие от Гостеха, там есть реальное нечто о чём создатели могут рассказать и что могут показать. Показали они не так много как могли, рассказали что-то кому-то общеизвестное, кому-то новое, но главное - живое. Поэтому в качестве комплимента можно сказать что их пиар достаточно правдив, хотя и неуклюж, но неуклюж достаточно естественно.

2. Конечно, правильно было бы назвать не "День Госуслуг", а день Ростелекома. По сути большая часть происходящего и большинство выступавших именно оттуда, из РТК Лабс. Но это просто констатация факта, от этого не горячо, не холодно.

3. Ключевой вопрос, важный всегда и везде, а на кой .. зачем всё это мероприятие проводилось? Вопрос немаловажен тем что в отличие от того же Гостеха, Госуслуги не надо продавать. Госуслуги - это монопольный государственный продукт работа с которым для госорганов - это не опция, а уже скорее обязательство и функция. "Продавать его" госслужащим, федеральным или региональным смысла нет. Как и нет смысла "продавать его" аудитории форума Россия. В принципе нет никакого смысла его продавать, кроме как если надо рассказывать о достижениях РФ в ИТ и уже понятно что с Гостехом так знатно облажались что надо говорить о чём-либо реальном.

4. Почему выглядит странно? Потому что, по хорошему, у российских Госуслуг могут быть три канала коммуникации:
4.1. Руководство - это когда надо "продать идею" чтобы влить в них ещё больше денег. Но это, как бы, давно уже не проблема. Скорее проблемой было какое-то время то что часть сервисов внутри Госуслуг планировали (планируют ли ещё?) передать в Гостех. Но не передали, что показательно
4.2. Разработчики, но для этого надо превращать Госуслуги в экосистему и открывать код/API, документацию и тд. Эту "поляну" Пр-во уже слило в Гостех, где идея госэкосистемы благополучно-неблагополучно приобретает свою доменную смерть.
4.3. Потенциальные покупатели из других стран. Поскольку уже понятно что даже на постсоветском пространстве Гостех никто не купит, потому что этот "кот в мешке" ещё даже не родился и уж тем более ничего показать нельзя. А вот Госуслуги живые. Но что-то не было похоже что аудитория именно этого форума была хоть как-то приближена к такой продаже.

5. О последнем подробнее. Да, Госуслуги в РФ - это гораздо более живой проект чем многие другие и выступавшие на форуме в целом, общем и в частностях не врали. Но кое-что осталось за кадром (не договаривали), а это стоимость. И стоимость там огромна поскольку она включала ещё и стоимость внедрения, интеграции, доработки многих информационных систем и ещё много чего. В общем это дохрена, не каждая развитая страна может позволить себе такие расходы. Я лично с трудом могу поверить что какая-либо из стран являющаяся российским торговым партнером или, хотя бы, не вводившая санкции начнёт вот так просто такой продукт внедрять.

6. Более проглядывается сценарий что, либо внедрение будет как политическое решение и на российские же деньги в виде огромного кредита, либо в формате какой-либо большой сделки обмена "условные снаряды на Госуслуги" с одной из сильно подсанкционных стран. Но опять же, я в обозримом будущем не вижу чтобы это произошло каким-либо естественным образом. Только политика и ничего кроме политики.

Часть 1 из 2

#thoughts #government #russia
7. При этом что российские госуслуги, что лучшие мировые примеры вроде Эстонии или Сингапура или госуслуги Казахстана через КаспиБанк, увы, не являются отчуждаемыми продуктами. Даже частично, даже в какой-то разумной доле снижающей стоимость внедрения. Во многих других областях решения есть: порталы данных, официальная статистика, гражданские бюджеты, порталы открытой демократии и открытого диалога и ещё много чего, но не для госуслуг. Да чего уж там, даже для национальных цифровых идентификационных платформ нет универсальных решений. Слишком большая вариативность уже созданного и необходимого для интеграции и местных законов, местной цифровой готовности и тд.

8. Поэтому пиар российских Госуслуг - это странно, очень странно. Может ещё одно предположение что всё это было к кадровым перестановкам в Пр-ве? Но, что-то вот верится с трудом. Пока всё идет к тому что ничего не поменяется (с)

9. Хорошо бы он выглядел если бы на сцену вышел бы какой-нибудь российский вице-премьер и так бы и сказал: "Друзья, мы тут с Гостехом облажались и решили его закрыть. А вот Госуслуги это супер, Госуслуги это зашибись. Теперь будем на их основе госпроекты развивать". Шучу, наверное;) Это на меня так сюрреализм происходящего влияет.

Часть 2 из 2

#thoughts #government #russia
Как центральные банки в мире публикуют данные? В большинстве стран резервные/центральные/национальные банки это весьма консервативные организации, чаще всего публикующие данные в виде Excel, а то и PDF файлов на своих сайтах и если и предоставляющие API, то только для курсов валют. Тем не менее есть примеры системной публикации открытых данных некоторыми из них.

Портал открытых данных центрального Банка Бразилии [1] сделан на CKAN, включает как оперативные, так и редко обновляемые данные. Все они публикуются под открытой лицензией Open Data Commons Open Database License (ODbL)

Открытые данные Банка Греции [2] это де-факто каталог индикаторов с возможностью их выгрузки в Excel формате и дополнительной фильтрацией по частоте обновления. Все под лицензией Creative Commons 4.0

ECB Data Portal [3] портал данных Европейского Центрального Банка, включает продвинутое API для публикации данных с поддержкой SDMX.

ECOS Economic Statistics System [4] система индикаторов Банка Кореи. Визуально наглядно, но несколько устаревший. Нет открытого API, но есть недокументированное.

Примеров публикации официальной статистики банками гораздо больше, полноценные открытые данные всё ещё редкость.

Ссылки:
[1] https://opendata.bcb.gov.br/
[2] https://opendata.bankofgreece.gr
[3] https://data.ecb.europa.eu
[4] https://ecos.bok.or.kr

#opendata #finances #banking #datasets #datacatalogs