Ivan Begtin
9.15K subscribers
2.68K photos
5 videos
115 files
5.51K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
NVIDIA выложили в открытый доступ BioNeMo Agent Toolkit инструментарий для работы специалистов-биоинформатиков с ИИ агентами. Это не LLM модель, не программный продукт, а коллекция большого числа файлов навыков (SKILL.md), документации и примеров кода оптимизированное под Claude, Codex и Nemotron и инфраструктуру сервисов NVIDIA. Все под лицензиями Apache 2.0 и CC-BY-4.0


По сути это не то чтобы радикально новый, но всё же новый подход к документированию API и сервисов. Каждый файл SKILL.md сопровождается документацией к эндпоинтам API и примерами использования с дополнительными описаниями как с ними работать.

Общаясь со спецами по биоинформатике я уже не первый раз слышу что они используют специализированные ИИ инструменты, но ощущают что от всех них откажутся в сторону general LLM, учитывая как те развиваются. Пример с NVIDIA тоже показателен. Не разработка отдельного закрытого продукта, многие из которых есть на рынке, а встраивание в собственную экосистему и экосистему Anthropic и OpenAI

#opensource #ai #biotech
👍71🔥1
По поводу того что в России изменили законопроект о регулировании ИИ и из него убрали все ограничения и запреты и добавили всякие формы поддержки для тех кто делает фундаментальные модели. В общем из законопроект про "запрещать и не пущать" он был превращён в законопроект про "не мешать и немного помогать". Редкое явление в российском регулировании в последние годы, что уж тут скажешь.

Много лет назад, работая с разными доступными данными об активности госорганов я подумывал не сделать ли российский аналог Bloomberg Government (BG), с систематизированными данными про людям, контрактам, бюджетам, законам и проектам законов. Даже сейчас, со всеми ограничениями, информации о активности госорганов если не много, то кажется что достаточно чтобы такую штуку сделать. Включая аналитические продукты, у того есть регулярные обзоры проектов биллей да и аналитика по госрасходам и госконтрактам то что я довольно хорошо знал и знаю до сих пор.

По многим причинам дальше подробного технического задания этот проект не пошел, да и хорошо это, если честно. И одной из причин было то что наблюдаемая часть GR по российским законопроектам и вообще проектам нормативных документов не имеет почти никакого отношения к реальному. В наблюдаемой среде можно посмотреть как некоторые бизнес ассоциации направляют свои позиции, выступления отдельных чиновников и депутатов и тд. Но проблема/ситуация в том что то кто и как влияет на итоговый результат можно узнать только от инсайдеров. И эти разговоры могут идти на уровне министерств (редко), Пр-ва (часто) или Администрации Пр-та (весьма вероятно), но они непубличны.

И вот эти изменения в законопроект о регулировании ИИ - это прекрасная иллюстрация этого тезиса. Законопроект, явно, вносился интересантами которым хочется чтобы "страна жила построже". А то что это такое, все тут ходят с гирями на яйцах находятся под надзором, а какие-то там ИИ разработчики обнаглели в край.

В итоге оказалось, неожиданно, 😉 что если так гайки закрутить то будет хуже настолько что лучше не будет. И кто-то кому-то смог это объяснить настолько хорошо что всё переписали. Но мы не знаем кто, не знаем какими доводами, не знаем кого переубедил, разве что можно догадываться или читать прессу ссылающуюся на инсайдеров.

А возвращаясь к аналитике по законопроектам, законам и другим НПА, то она имеет развилку прикладных сценариев для защитного GR, но с запозданием, потому что в России анонс законопроекта - это не приглашение к разговору, а сформулированная угроза (как правило прописаны новые запретительные положения). Это имеет ограниченную ценность, но какую-то могут иметь.

Второй путь в юриметрии и оценки качества НПА и законопроектов да и законов измеряя время их подготовки, степень того насколько это "закон-спагетти" состоящий из сотен правок других законов, качества содержания и тд. Это может иметь только два аспекта:
- публично политический - показать плохую работу нормотворцев наглядно и в цифрах.
- внутриполитический - выстраивать внутреннюю работу над НПА и пересматривать законодательство.

В общем-то как ни смотри, не думаю что аналог Bloomberg Government в России возможно и имеет смысл делать. Но если кто-то задумывается о применении ИИ в отношениия законов/законопроектов, то может мои мысли вслух и пригодятся.

#thoughts #laws #ai
👍17🔥6532
По поводу того что Apple убрали из апп стора приложения VK, и того что разработчики Telega (альтернативный телеграм клиент) самоудаляются с 1 июля мне много что есть сказать, но сдерживаюсь чтобы больше писать и думать про интересное (данные, ИИ и тд.), а не про злободневное. И вообще не всегда получается писать нейтрально и достаточно сухо, но я стараюсь.

Тем не менее я хочу обратить внимание на то о чем уже писал, с 30 сентября 2026 года Google постепенно начнет внедрять требование по верификации всех разработчиков приложений для андроида. Не только в рамках Google Play, а вообще всех. Это поломает многие, может быть даже все, опенсорсные сторы приложений и поставит под контроль альтернативные сторы. Это охватит не все устройства, а только сертифицированных партнеров где есть, к примеру, Samsung, но нет Huawei.

Последствием этого может быть то что Google как и Apple сможет блокировать приложения конкретных разработчиков под санкциями и альтернативами окажется, или использование несертифицированных устройств или установка приложений разными нестандартными способами с понижением безопасности устройств. В андроиде, в отличие от устройств Apple, это возможно.

В любом случае если завтра российские регуляторы публично признаются что на Apple никак повлиять не могут и начнут говорить что мол "переходите на Андроид" может оказаться что переход на андроид не поможет. Потому что Google тоже должны соблюдать санкции (отдельный вопрос почему не соблюдают сейчас, но это политика, а не технологии).

В любом случае я бы не питал иллюзий что с Apple или Google можно будет договориться через ФАС или квадрилионные судебные иски или блокировками их сервисов. Блокировать их сервисы - это как стрелять себе в колени. Понятно что не впервой, но не надо уже приводить самострел в привычку.

#russia #thoughts
1👍23💯115🔥5😁2
Новая популярная тема в работе с ИИ агентами в разработке loop engineering или loop prompts в основе которой последовательность шагов, если упрощенно.
discover → plan → execute → verify → (repeat until a condition is met)


С одной стороны кажется очевидным, с другой это, во многом, архитектурный шаблон когда ты разделяешь программный продукт на модули и разрабатываешь каждый с четким пониманием цели изначально. discover еще описывают часто как set the goal (поставить цель).

Мне подход скорее нравится, хотя я и придерживался всё это время несоклько другого. Который можно описать как.
set the goal → analyze + analyze + analyze → review → design → plan → execute → (repeat tests till conditions met) → verify

Например, вначале есть некая идея по разработке чего-то нового или по доработке. Прежде чем это реализовывать ты скармливаешь нескольким сервисам для deep / wide research для анализа, по итогам полученных аналитических отчетов делаешь их ручной ревью, пишешь документ дизайна продукта, превращаешь его в план реализации через OpenSpec или режим планирования, запускаешь реализацию, запускаешь подготовку исчерпывающего комплекта тестов и по итогам делаешь проверку результата.

Ключевое тут - многократный анализ поскольку разные сервисы и разные LLM дают разные результаты. Как по качеству, так и по направлениям даже при одинаковых промптах. Если еще год назад эта аналитика была так себе, с кучей галлюцинаций, то сейчас она выходит на вполне разумном уровне и часто закрывает пробелы в первоначальном проектировании.

#thoughts #aiagents
6👍53🔥3
Похоже не только Anthropic попали на грабли одобрения новых ИИ моделей Белым домом (США), а и OpenAI. Их уже попросили притормозить с публичным анонсом их новой модели, до её тестирования.

Меня мучает все тот же вопрос - что будет когда появятся сравнимые по эффекту открытые и доступные китайские модели? Власти США их тоже попробуют притормозить ? Будет ли какой-то глобальный договор вроде договора о нераспространении химического или ядерного оружия? Куда мир вообще идет-то ?

#thoughts #ai
👍7🤔7🌚4😱21💯1
Для тех кто любит работать с данными, я недавно залил обновления в два репозитория:
- iterabledata библиотека для Python для чтения условно любых файлов и баз данных в итеративном режиме в том числе в потоковом режиме с экономией памяти
- undatum утилита для командной строки для манипуляции условно любыми дата файлами, их конверсии, чтении данных, анализу и документированию. Внутри используется как раз библиотека iterabledata

В чем особенность этих релизов.

В iterabledata исправлена возможность записи в форматы Avro, Orc и Lance. Не самые большие изменения, но повышающие удобство работы с библиотекой.

А утилита undatum была радикально обновлена с переводом большей части функций на работу через iterabledata и отказа от части внутреннего кода. Теперь работает преобразование файлов всех форматов которые поддерживает iterabledata - это более 100 форматов.

Сами инструменты были вдохновлены утилитами xsv и qsv и были написаны для того чтобы можно было удобным образом работать с изначально с JSONl/NDJSON файлами сжатыми любым способом, а далее с форматами вроде Parquet, ORC и остальные.

Вообще у меня не так много времени остается на программирование в последнее время, это скорее как хобби, но хобби полезное.

#opensource #datatools #dataengineering
1🔥14👍114
Свежий текст от The GovLab о том как меняется политика доступа к данным в эпоху ИИ. Текст, как я понимаю, по итогам нескольких сессий прогнозирования развития открытости данных, открытого доступа и обмена данными с ведущими экспертами и про то куда все двигается на основе этих разговоров.

Там все те же темы о которых я регулярно пишу, то что парадигма открытых данных
испытывает трудности, то что государства хотят больше контроля над данными, то тема данных стала синонимична ИИ и еще много всего.

#opendata #readings
👍83
Датасет Цифрового архива: Реконструированная функциональная структура расходов государственного бюджета (1912 – 1915 годы)

Небольшой датасет от Минфина России позволяет проследить динамику расходов разных ведомств в период 1912-1915 годов. По тогдашней практике все расходы разделены на обыкновенные и чрезвычайные. По Высочайше утвержденному мнению Департамента Государственной Экономии Государственного Совета от 4 июня 1894 года следует:

III. В отдел чрезвычайных расходов заносятся:
а) расходы по сооружению новых железных дорог;
б) расходы на изготовление и приобретение подвижного состава и железнодорожных принадлежностей, в чрезвычайных размерах;
в) издержки, вызываемые войной, военными экспедициями и вообще народными бедствиями, каковы неурожаи, эпидемии и т. п., и
г) расходы по досрочной уплате капитала по государственным займам, вне текущего, условиями займа определенного погашения их.
По данным датасета, чрезвычайные расходы были предусмотрены для 11 ведомств, а за рассматриваемые 4 года максимум таких расходов пришелся на Министерство путей сообщения. Минимум — на Морское министерство.

Публикуем скриншоты с мнением Государственного Совета, которое было опубликовано в томе XIV Полного собрания законов Российской империи, а также таблицу всех чрезвычайных расходов по разным ведомствам за период 1912—1915 годов.

Подробнее ознакомиться с динамикой государственных расходов в период 1912—1915 годов можно в датасете на сайте Цифрового архива.

#датасет #расходы #история #Минфин
👍133🔥3
Подборка полезных ссылок про данные, технологии и не только:
- Onyxia платформа от французского института статистики INSEE для организации работы команды data science. Помогает разворачивать разные открытые продукты под задачи: тетрадки Jupyter, R Studio и многие другие с акцентом на статистические данные и не только. Предназначена для обучения студентов в первую очередь
- miller аналог AWK для CSV файлов, позволяет их удобно форматировать с командной строки.
- tad настольный редактор для табличных файлов, в первую очередь это файлы CSV и Parquet, но также поддерживает и базы sqlite и duckdb. Из минусов - не обновлялся около года
- uPlot одна из наиболее быстрых и легковесных библиотек визуализации больших объемов данных временных рядов.

#opensource #datatools
🔥43👍3
В каком-то смысле ожидаемая новость, Google через Chrome втихую начал устанавливать на устройства пользователей 4ГБ ИИ модель Gemini Nano. Интересно тут сразу многое:
- устанавливают втихую, не предупреждая пользователя
- отключить это можно в настройках On-device AI в chrome://settings, где по умолчанию эта опция оказывается включенной
- даже из описания в справочной Google остается ощущение непрозрачности процесса

Автор оригинальной новости задается вопросом не является ли это нарушением GDPR и упоминает Anthropic которые похожим образом втихую вносили изменения на устройствах пользователей.

Тема эта за пределами конкретно Google, если бы у Apple и Microsoft был бы реальный прогресс с их ИИ продуктами они, наверняка бы давно добавили локальные модели как часть их ОС.

А пока во всю наблюдаем цифровые "dark patterns" от Бигтехов.

#readings #ai #google
😱8👍7🤨6😢2💯1
LongCat-2.0 свежая LLM на 1.6 триллионов параметров, контекстом в 1М и открытым кодом (пока не открыт, только обещан). Особенность в том что она под другим названием Owl Alpha уже входит в топ 5 рейтинга OpenRouter и активно в этом рейтинге растет. Иначе говоря разработчикам даже не надо доказывать ее востребованность, она и так де-факто уже проверена востребованностью.

Другая особенность в том что модель обучена полностью на китайских чипах и создана в компании Meituan - это такая китайская компания разработчик приложения доставки. Они и раньше делали LLM под названием LongCat, но кажется именно эта является прорывом.

#ai
👍4🔥3
Ещё немного про утилиту с открытым кодом для работы с данными undatum которую я когда-то разработал и потихоньку развиваю. Это не коммерческий продукт, а скорее вспомогательный инструмент когда надо что-то поделать с данными в командной строке и эти данные не просто плоские CSV файлы, а что-то посложнее.

Я приводил в пример ее использование для преобразования файлов, а вот дополнительные примеры того как ее можно применять.

Быстрое API на основе файла с данными

Предположим есть файл CSV, JSONl, Parquet или еще какой-то и его содержанию надо быстро дать доступ кому-то внешнему, но передавать файл/файлы целиком нельзя по какой-либо причине.

Очень простая и быстрая команда
undatum api run data.jsonl

Автоматически проанализирует файл и запустит веб-сервер с доступом к данным через REST API и возможностью фильтрации по его полям. Из плюсов - минимум усилий. Из минусов - в нем нет сейчас какой-то сложной программной логике поиска по полям и тд., только полный или частичный мэтчинг.

В итоге получается неидеальное, зато очень быстро развертываемое API которое можно выставлять внешним пользователям.

Быстрое документирование дата файлов

Когда есть некий файл с данными к нему нет дополнительной информации, а очень надо быстро в нем разобраться, то генератор Markdown документации

В самом простом виде выглядит как
undatum ai doc data.csv

выводит на экран итоговый Markdown текст

Более продвинутый
undatum ai doc —blocks general,schema,quality,examples,codebook —format json —language Russian data.csv

Создает документацию в формате JSON с Markdown блоками перечисленными списком и на русском языке.

Загрузка данных в NoSQL/SQL базы данных

Команда ingest изначально делалась для продвинутого импорта данных в MongoDB и Elasticsearch и идея в том чтобы на вход получить файл и строку подключения в базе данных после чего загрузить содержимое в выбранную таблицу/коллекцию/индекс

Пример команды
undatum ingest data.jsonl https://elasticsearch:9200 myindex myindex --dbtype elasticsearch --api-key YOUR_API_KEY --doc-id id

В чем важная особенность undatum от специализированных инструментов которые умеют это же? В поддержке любых сжатых файлов .xz, .gz, .zst, .lz4, .bz2 и так далее. Потому что хранить данные в чистом NDJSON или CSV - это прямо таки очень неэффективно. Особенно когда это много слепков коллекции из MongoDB или индекса Elasticsearch.

#opensource #datatools #data
👍122🔥2
Еще один взгляд на открытые данные в виде доклада The Value of Open Data on Global Entities от Linux Foundation и компании BrightQuery с упором на доступность данных о компаниях, людях и локациях (связанных с компаниями). BrightQuery делают продукт графа по адресу OpenData.org где можно скачать большой датасет на 24GB со всеми этими данными, это одних только организаций более 86 миллионов 690 тысяч.

Доклад связывает эти данные еще и с Overture Maps.

В любом случае доклад полезный для понимания рынка проверки контрагентов и доступности данных на нем.

#opendata #datasets #readings
👍4
OmniRoute локальный маршрутизатор запросов к ИИ провайдерам умеющий работать с большим их количеством, сейчас это 231 провайдер в том числе с теми которые дают бесплатные квоты. Позиционируется как инструмент сильной оптимизации потребления токенов, позволяет сократить их благодаря сжатию RTK + Caveman.

Что характерно даже поддерживают одного из российских провайдеров - gigachat (можно увидеть в общем списке), но собственно и только. Того же Яндекс'а к примеру тут нет почему-то.

Плюс обещают прозрачную интеграцию с 1proxy и возможность обхода блокировок из стран которым некоторые AI провайдеры не дают доступа (Россия, Иран, Куба, Китай и тд.).

На чем зарабатывают непонятно, думаю что монетизацию включат позже и привяжут как раз к сервисам прокси или экономии токенов.

Выглядит как очень полезный инструмент еще и из-за встроенной аналитики потребления, так что надо пробовать на практике. Если все работает как обещано - ценное дополнение к техническому стеку.

#opensource #ai #tools
5👍32
Хороший обзор проектов с экспериментальной статистикой в США, с примерами компаний которые создают публичные дата продукты и их начинают использовать официально.

Все это про мир alternative data, актуальный для биржевого и корпоративного мира и все еще медленно проникающий в официальную статистику.

В обзоре из интересных примеров - это оценка масштабов строительства через анализ спутниковых снимков.

#opendata #statistics
👍42🔥2
В качестве регулярных напоминаний коллекция библиотек и инструментов с открытым кодом к которым я приложил свою руку и которые могут быть полезны многим работающим с данными:
- qddate библиотека для Python быстрого парсинга дат написанных на множестве языков и во множестве форматов. Не такой широкий охват форматов как у dateutil, но гораздо более высокая скорость парсинга.
- newsworker библиотека и инструмент на Python для извлечения новостей из веб страниц. Например, когда надо подписаться на сайт через RSS, а RSS ленты нет. Понимает множество форматов дат используя qddate и динамически идентифицирует новостные блоки.
- russiannames база данных и парсер Python для разного рода написания ФИО принятых в российской практике. В базе десятки тысяч имен и отчеств и сотни тысяч фамилий
- undatum утилита командной строки для работы с датасетами в форматах CSV, JSONl, Parquet и сотне других форматах. Умеет преобразовывать данные и проводить с ними различные операции. Эдакий швейцарский нож для работы с данными с командной строки
- metawarc утилита по извлечению метаданных из файлов веб-архивов (WARC). Умеет извлекать метаданные из офисных файлов, PDF, изображений и тд.
- plainrussian сервис проверки простоты текстов на русском языке используя формулы читабельности адаптированные под русский язык. Код самого сервиса и формул для расчета
- iterabledata библиотека для Python для чтения и записи практически всех существующих форматов файлов с данными. Используется в утилите undatum
- internacia-db дата продукт в виде датасета по всем странам и макрорегионам во множестве форматов и покрытием всего мира и многими метаданными по каждой территории

#opensource #datatools #tools
👍13🔥643
Пишут что качество новой версии Fable 5 существенно упало, например, отладка кода упала на 70%, рефакторинг на 48% и галлюцинации стали хуже (изменения на 19%).

Все потому что теперь при обращении к этой модели она часто перенаправляет на Opus 4.8 из-за мер безопасности которые предприняли Anthropic.

Как это трактовать? Я бы сказал что в первую очередь как то что пр-ва теперь могут устанавливать требования к понижению качества ИИ моделей и это только начало. Чем дальше тем ограничения могут быть серьезнее, для тех кому надо будут полноценные версии фронтирных моделей, а для остальных с существенными ограничениями.

Интересно начнут ли в эту игру играть и власти Китая когда флагманские модели их стартапов начнут давать сравнимое качество?

#ai #thoughts
🤔6🔥21💯1🤨1