Геолог-программист
1.02K subscribers
70 photos
23 videos
1 file
83 links
В этом канале делюсь различными рекомендациями и контентом, который считаю полезным или интересным. Как правило, контент связан с программированием в геологии.
Чат по программированию и ML: https://t.me/GeoMLearning
Download Telegram
С днём геолога! Интересных проектов, творческих идей и вдохновения для новых открытий!
❤20🍾2🔥1
Месяц конференций, не успеваю всем делиться, но скоро исправлюсь, спасибо, что остаетесь на связи 🤝.

На прошлой неделе был на конференции по инженерной геологии, рассказывал про применение больших языковых моделей (скоро будет видео), а сегодня - по рудной геологии в рамках Miningworld и Мингеоофрума на сессии 'Кибергеология', начало в районе 15-16, приходите, будет интересно.
UP, зал G сразу справа после экскалаторов, не входя на выставку.

@geologistprogrammer
🔥3
А перед сессией можно заглянуть к коллегам из ТехноИнфо в соседней Аналитике. Они собрали обещанную установку для сканирования керна.
Уже готовим нашу систему к их данным.

@geologistprogrammer
Видео про большие языковые модели для геологов.

Продолжаю кататься по конференциям, решил попробовать такой формат по части образовательных видео, чтобы оставаться с вами на связи - коллеги из Soilbox помогли в реализации - записали видео выступления на ГеоИнфо.
Смотреть тут на вк видео https://vkvideo.ru/video-221089833_456239022
Пишите по формату в комментариях в ВК или тут.

@geologistprogrammer | VK | max
👍7👀1
This media is not supported in your browser
VIEW IN TELEGRAM
Что происходит в 4 утра?

Появляется темная тема в нашей системе автоматического описания керна.
Буду завтра показывать вторую версию в рамках МингеоФорума, можно посмотреть в онлайн на геовебинарах в сессии Кибергеология.
https://geowebinar.com/mingeo-2026

@geologistprogrammer | VK | max
👍7😁3🎉1
Сделано за лето:

Создан полностью локальный секретарь на основе GigaAM + Gemma 4 + RyzenAiMax.

Освоена новая репка (Repka Pi 5) - кое-какие подробности уже можно найти в моих постах в блоге репки.

Доведена до предрелизного состояния (переписано всё, весь функционал первой версии работает, осталось довнедрить новый) система автоматического описания керна второй версии.

Работаю над второй версией курса по программированию с нейропомощниками для геологов.

Подробнее всё опишу в следующих постах, остаемся на связи🤝

@geologistprogrammer | VK | max
🔥12👍2❤1
Сделал личного ИИ-ассистента

Есть много задач, которые требуют много времени но не особо мне интересны (заполнение документов, подача написанных статей в журналы и пр.), кроме того для обновления курса - надо проанализировать как предыдущие лекции, так и обновленные и составить конспекты\вопросы\тайм-коды.
Как это всё автоматизировать?

Думаю, многие слышали про автоконспектирование, но, как правило, всё запускается в облаке — ассистент может положить запись в открытую ссылку без пароля — далеко не всегда это может быть хорошей опцией.
Собственно, потому и пришла идея взять готовое и адаптировать под личные задачи.
Первоначально — делал MVP на ноутбуке — начал с whisper.cpp. Проблема с ней в том, что она генеративная, зацикливается (делает вид, что расшифровка идёт, но генерирует одну и ту же фразу) + требовательна к памяти. Тем не менее, подход оказался рабочим, расшифровка получалась, но что с ней делать? для последующей обработки — нужна локальная LLM. Та же история с зацикливанием, если модель небольшая.

После ряда экспериментов — MVP себя оправдало, но как вы сами догадались — вычислений много, да и ноутбук надолго не оставишь включенным. Некоторое время думал над вариантами и купил мини-сервер (помещается буквально на ладони) с 128 ГБ объединённой памяти и Ryzen AiMax. Расчёт был на то, что под примерно такие характеристики и оптимизируют открытые модели. На данный момент расчет уже оправдал себя, поскольку недавно вышедшая квантизированная Qwen 3.8 (125 млрд, инференс по 6млрд) там вполне может жить и генерировать ответы со скоростью до 30 токенов/с (может падать до 15, если контекста много). Этого вполне хватает, чтобы поставить задачу и уйти заниматься своими делами, в целом, модель подходит, в т.ч. для генерации кода.

В итоговом решении — LLM от 32B параметров, GigaAM (сберовская модель, которая не страдает от зацикливаний) + pyannotate только для своего голоса, чтобы разметить фрагменты речи, тишину, и другие моменты.

Аппетит приходит во время еды, да и зачем такому железу простаивать — поэтому повесил туда локального бота. Можно скинуть свое голосовое с описанием задач\результатов и на выходе получить задачи для отправки в трекер. Связка с Telegram / почтой / Яндекс.Трекером / YouGile / Max — может быть настроена, можно, например, запрашивать план задач на сегодня.

Как может работать в теории
Отправляешь запись → на выходе расшифровка, задачи для каждого и мемо. Всё локально.

Но начиналось, на самом деле, всё с немного другой идеи, которая требует ещё больших ресурсов — об этом завтра ;)

@geologistprogrammer | VK | max
1👍16🔥3👏1
Scispace\perplexity на коленке

С чего на самом деле начиналась история ИИ - ассистента?
На самом деле - первоначальная задумка - создать непосредственно помощника исследователя, аналогичного перечисленным в заголовке.

Как они работают?
Как правило - это некоторая большая языковая модель или ряд отдельных БЯМ вокруг которых есть разные инструменты - это всё объединяется в харнес-систему (harness - упряж), где множество агентов одновременно выполняют различные задачи.
Главная модель (как правило - самая большая) - является оркестратором, которая знает сильно больше других, и ряд маленьких - у них в контексте четкая задача и небольшой набор инструментов для них.

Например, вы отправляете запрос "Создай подборку статей про рудоносность золото‑сульфидных месторождений Восточной Сибири за последние 5 лет".
Оркестратор раскидывает задачу:
— один агент генерирует ряд запросов для поиска, вытаскивает DOI / аннотации, научные метаданные;
— второй шерстит открытые источники — eLibrary, КиберЛенинку, сайты институтов;
— третий собирает всё в единую таблицу: title, authors, year, url, relevance_score.
Дальше эта информация может разными способами векторизоваться\индексироваться и собираться в базу, с которой может работать другой агент.

Технический стек
Сама обвязка может состоять из разного, для конкретно нашей цели - нужен минимум RAG (Retrieval-Augmented Generation, генерация с поиском по базе) и, собственно, источники информации, которые должны базу заполнять, ну и технологический стек, основанный на российских технологиях, чтобы голова не болела.

С точки зрения индексации баз по науке существует несколько систем научного цитирования, colab.ws и РЦНИ. У того и у другого есть апи и вроде бы как оба доступны.
Ребятам из колаба можно написать в чат - быстро ответят и решат все вопросы, со вторыми сколько не пытался связаться, к сожалению, так и не получил ответа, при этом что отправлял несколько запросов с разных адресов.

Кроме научных баз - полезно собирать данные и статьи из интернета - для этого используется апи яндекса, оно доступное и достаточно бюджетное.
Ну и сама языковая модель - гигачат, на мой вкус - он отвечает лучше других с точки зрения русского языка и у них сразу есть модель для эмбедингов.

Результаты
В целом, система получилась более менее рабочей, но пока что сильно требовательно по ресурсам с точки зрения запросов - в тот же самый колаб может улетать до 100 запросов на поиск разной литературы. Также далеко не всегда можно скачать PDF, что усложняет создание базы для RAG и пока что требует частого вмешательства, ну и написание статей у меня пока не в приоритете, поэтому это больше остается экспериментом и интересным опытом.
Ну а что в приоритете - это вторая версия системы автоматического описания керна, про которую, наконец, скоро смогу рассказать много подробностей :)

@geologistprogrammer | VK | max
👍6❤1🔥1