Поучаствовала в AI Science Hack Норникеля
На AI Science Hack Норникеля собрала «Научный клубок» — карту знаний для R&D в горно-металлургической отрасли.
Главное решение — не искать модель «поумнее», а забрать у неё право придумывать факты.
Система отдельно обрабатывает:
• сущности — объединяет русские и английские термины;
• числа — извлекает значения, диапазоны и единицы;
• смысл — сохраняет тезисы только с дословными цитатами.
В графе Kùzu уже:
• 1 828 уникальных публикаций;
• 259 304 числовых условия;
• 666 тезисов с цитатами и источниками.
Поиск использует BM25, граф и строгий AND: все ограничения должны выполняться в одном документе. Если подходящих данных нет, система честно показывает пробел корпуса.
Граф — источник истины. LLM — только интерфейс, который оформляет проверенные факты в читаемый ответ.
Код: https://github.com/CatPawsCoder/Nornickel_aI_science_hack
И да, я даже прошла в финал! 🔥
#AI #GraphRAG #Nornickel
На AI Science Hack Норникеля собрала «Научный клубок» — карту знаний для R&D в горно-металлургической отрасли.
Главное решение — не искать модель «поумнее», а забрать у неё право придумывать факты.
Система отдельно обрабатывает:
• сущности — объединяет русские и английские термины;
• числа — извлекает значения, диапазоны и единицы;
• смысл — сохраняет тезисы только с дословными цитатами.
В графе Kùzu уже:
• 1 828 уникальных публикаций;
• 259 304 числовых условия;
• 666 тезисов с цитатами и источниками.
Поиск использует BM25, граф и строгий AND: все ограничения должны выполняться в одном документе. Если подходящих данных нет, система честно показывает пробел корпуса.
Граф — источник истины. LLM — только интерфейс, который оформляет проверенные факты в читаемый ответ.
Код: https://github.com/CatPawsCoder/Nornickel_aI_science_hack
И да, я даже прошла в финал! 🔥
#AI #GraphRAG #Nornickel
1❤35🔥29👍18
🧶 И немного хакатонного мерча — сделала стикерпак «Научный клубок».
Добавить стикеры в Telegram
Добавить стикеры в Telegram
Telegram
Научный клубок 2026
Free stickerpack with 5 stickers.
1❤7🔥5⚡2👏1💯1
Галлюцинации LLM и как их ловят
Галлюцинация — это когда модель генерирует фактически неверное утверждение, но подаёт его как уверенный ответ.
LLM не ищет истину. Она предсказывает следующий токен:
На каждом шаге модель выдаёт логиты — сырые оценки для всех токенов словаря. После softmax они превращаются в вероятности:
Если распределение уверенное, один токен сильно доминирует.
Если распределение размытое, много токенов имеют близкие вероятности.
На этом строятся методы детекции риска галлюцинаций:
1. Logprobs
Можно смотреть вероятность каждого сгенерированного токена.
Если модель пишет конкретный факт — имя, дату, название статьи, — но токены имеют низкие logprobs, это сигнал риска.
Но важно: высокий logprob не доказывает истинность. Модель может уверенно воспроизводить ложный паттерн.
2. Entropy
Энтропия показывает неопределённость распределения токенов.
H(p) = -Σ p(x) log p(x)
Высокая энтропия = модель не имеет явного фаворита для следующего токена.
Упрощённо это можно посчитать так:
Если один токен доминирует, entropy будет низкой.
Если вероятности размазаны по нескольким токенам, entropy будет высокой.
В production это можно использовать как risk score: если на фактических утверждениях энтропия высокая, ответ нужно проверять.
3. Self-consistency
Один и тот же запрос прогоняют несколько раз с разными параметрами: temperature, top_p, seed.
Если факты плавают — даты, числа, имена, ссылки — это не знание, а генерация вероятных вариантов.
4. Semantic entropy
Обычная энтропия смотрит на токены. Но разные фразы могут означать одно и то же.
Semantic entropy группирует несколько ответов по смыслу.
Если формулировки разные, но смысл один — риск ниже.
Если модель генерирует разные факты — риск выше.
5. RAG attribution
В RAG-системах недостаточно просто подать документы в контекст.
Нужно проверить, что каждый важный claim реально поддержан retrieved chunk.
Нормальная схема:
Если утверждение есть в ответе, но его нет в найденных фрагментах, оно помечается как unsupported.
Главный вывод:
галлюцинации нельзя надёжно ловить одной метрикой.
Рабочий подход — комбинация сигналов:
logprobs + entropy + self-consistency + semantic entropy + claim extraction + RAG attribution
Модель генерирует вероятный текст. Фактом он становится только после привязки к проверяемому источнику.
#ai #llm
Галлюцинация — это когда модель генерирует фактически неверное утверждение, но подаёт его как уверенный ответ.
LLM не ищет истину. Она предсказывает следующий токен:
P(token | context)
На каждом шаге модель выдаёт логиты — сырые оценки для всех токенов словаря. После softmax они превращаются в вероятности:
logits → softmax → probabilities → next token
Если распределение уверенное, один токен сильно доминирует.
Если распределение размытое, много токенов имеют близкие вероятности.
На этом строятся методы детекции риска галлюцинаций:
1. Logprobs
Можно смотреть вероятность каждого сгенерированного токена.
Если модель пишет конкретный факт — имя, дату, название статьи, — но токены имеют низкие logprobs, это сигнал риска.
Но важно: высокий logprob не доказывает истинность. Модель может уверенно воспроизводить ложный паттерн.
2. Entropy
Энтропия показывает неопределённость распределения токенов.
H(p) = -Σ p(x) log p(x)
Высокая энтропия = модель не имеет явного фаворита для следующего токена.
Упрощённо это можно посчитать так:
import numpy as np
logits = np.array([2.4, 1.2, 0.3, -0.7]) # сырые выходы модели
probs = np.exp(logits) / np.exp(logits).sum()
logprobs = np.log(probs)
entropy = -np.sum(probs * logprobs)
print("probabilities:", probs)
print("logprobs:", logprobs)
print("entropy:", entropy)
Если один токен доминирует, entropy будет низкой.
Если вероятности размазаны по нескольким токенам, entropy будет высокой.
В production это можно использовать как risk score: если на фактических утверждениях энтропия высокая, ответ нужно проверять.
3. Self-consistency
Один и тот же запрос прогоняют несколько раз с разными параметрами: temperature, top_p, seed.
Если факты плавают — даты, числа, имена, ссылки — это не знание, а генерация вероятных вариантов.
4. Semantic entropy
Обычная энтропия смотрит на токены. Но разные фразы могут означать одно и то же.
Semantic entropy группирует несколько ответов по смыслу.
Если формулировки разные, но смысл один — риск ниже.
Если модель генерирует разные факты — риск выше.
5. RAG attribution
В RAG-системах недостаточно просто подать документы в контекст.
Нужно проверить, что каждый важный claim реально поддержан retrieved chunk.
Нормальная схема:
query → retrieval → chunks → generation → claim verification → citation check
Если утверждение есть в ответе, но его нет в найденных фрагментах, оно помечается как unsupported.
Главный вывод:
галлюцинации нельзя надёжно ловить одной метрикой.
Рабочий подход — комбинация сигналов:
logprobs + entropy + self-consistency + semantic entropy + claim extraction + RAG attribution
Модель генерирует вероятный текст. Фактом он становится только после привязки к проверяемому источнику.
#ai #llm
1👍34❤33🔥28🤓8👨💻2👀2❤🔥1
Forwarded from Valuable AI / Валентин Малых
вышло почти одновременно две новости:
- Сбер представил GigaChat 3.5 Ultra на 432 млрд. параметров; для начала хочу поздравить коллег с релизом, вы - большие молодцы; коллеги сравниваются в отдельных задачах с DeepSeek V3.2 Pro, а в других с V4 Flash (2 картинка)
- одновременно Tencent выпускает Hy3(это латинизированное имя, чтобы не пугать лаоваев, оригинальное - 混元 (хунь юань), или "первооснова" в переводе, причем юань - это тот же иероглиф, что и валюта) - модель на 295 млрд., которая почти также хороша, как GLM-5.2, кроме кодинга (третья картинка)
интересно было бы посмотреть на сравнение этих моделей
P.S. кстати, я писал про Hunyuan-T1 от Tencent, тогда они только начали делать свои модели и еще не успели переименоваться
@valuableai
- Сбер представил GigaChat 3.5 Ultra на 432 млрд. параметров; для начала хочу поздравить коллег с релизом, вы - большие молодцы; коллеги сравниваются в отдельных задачах с DeepSeek V3.2 Pro, а в других с V4 Flash (2 картинка)
- одновременно Tencent выпускает Hy3
интересно было бы посмотреть на сравнение этих моделей
P.S. кстати, я писал про Hunyuan-T1 от Tencent, тогда они только начали делать свои модели и еще не успели переименоваться
@valuableai
1❤5
Кто придумал графический интерфейс?
Не Apple. И не Microsoft.
Короткая хронология:
1963 — Sketchpad
Один из первых интерактивных графических интерфейсов: человек рисовал объекты на экране световым пером.
1968 — Mother of All Demos
Дуглас Энгельбарт показал мышь, курсор, гипертекст, окна, видеосвязь и совместное редактирование. Это выглядело как фрагмент будущего ПК.
1973 — Xerox Alto
Окна, мышь, графический экран, документы, сеть. Не массовый продукт, но важнейший прототип GUI-компьютера.
1981 — Xerox Star
Папки, документы, иконки, окна, мышь, почта, Ethernet. Уже почти знакомая нам офисная логика.
1983 — Apple Lisa
GUI в коммерческом компьютере Apple. Дорого, сложно, не массово.
1984 — Macintosh
Мышь, окна, меню, иконки, графические приложения.
1985 — Windows 1.0
Графическая оболочка поверх MS-DOS: окна, меню, мышь, Paint, Notepad, Calculator.
GUI сделал компьютер понятным не потому, что он стал проще технически.
А потому что он стал ближе к человеческому мышлению: объект → действие.
Не Apple. И не Microsoft.
Короткая хронология:
1963 — Sketchpad
Один из первых интерактивных графических интерфейсов: человек рисовал объекты на экране световым пером.
1968 — Mother of All Demos
Дуглас Энгельбарт показал мышь, курсор, гипертекст, окна, видеосвязь и совместное редактирование. Это выглядело как фрагмент будущего ПК.
1973 — Xerox Alto
Окна, мышь, графический экран, документы, сеть. Не массовый продукт, но важнейший прототип GUI-компьютера.
1981 — Xerox Star
Папки, документы, иконки, окна, мышь, почта, Ethernet. Уже почти знакомая нам офисная логика.
1983 — Apple Lisa
GUI в коммерческом компьютере Apple. Дорого, сложно, не массово.
1984 — Macintosh
Мышь, окна, меню, иконки, графические приложения.
1985 — Windows 1.0
Графическая оболочка поверх MS-DOS: окна, меню, мышь, Paint, Notepad, Calculator.
GUI сделал компьютер понятным не потому, что он стал проще технически.
А потому что он стал ближе к человеческому мышлению: объект → действие.
1👍56🔥44⚡30❤7🕊6🥰1
This media is not supported in your browser
VIEW IN TELEGRAM
🎬 Составила гайд: как с помощью ИИ делать анимированные бесшовные карусели
Те самые, где картинки плавно перетекают друг в друга и палец сам скроллит до конца 🌀
Внутри:
✅ какими нейросетями оживлять фото (всё бесплатно)
✅ как склеить кадры, чтобы переход был бесшовным
✅ пошаговый воркфлоу — собираешь карусель за 15 минут
Забирай 👇
📖 Открыть гайд
Сохрани, чтобы не потерять 📌
Те самые, где картинки плавно перетекают друг в друга и палец сам скроллит до конца 🌀
Внутри:
✅ какими нейросетями оживлять фото (всё бесплатно)
✅ как склеить кадры, чтобы переход был бесшовным
✅ пошаговый воркфлоу — собираешь карусель за 15 минут
Забирай 👇
📖 Открыть гайд
Сохрани, чтобы не потерять 📌
2👍45🔥38❤35👏11❤🔥3🥰3
GPT-5.6: что важно знать без лишнего шума
OpenAI выпустила новое семейство моделей GPT-5.6. Это не одна модель, а три уровня:
Sol — флагманская модель для сложных задач: кодинг, research, анализ данных, cybersecurity, работа с инструментами и дизайн.
Terra — средний вариант. По смыслу — модель для повседневной работы, где нужен баланс качества и цены.
Luna — самая дешёвая и быстрая модель в линейке. Нужна для массовых запросов, где важнее стоимость.
Главные характеристики в API:
Sol:
контекст — 1 050 000 токенов
макс. вывод — 128 000 токенов
цена — $5 за input и $30 за output за 1 млн токенов
Terra:
цена — $2.50 за input и $15 за output
Luna:
цена — $1 за input и $6 за output
У всех трёх моделей дата знаний — 16 февраля 2026.
Важно: большой контекст в 1.05M токенов относится к API. В обычном ChatGPT лимиты контекста могут быть ниже и зависят от тарифа и режима.
Что изменилось по сравнению с GPT-5.5
Главный акцент — не на новом интерфейсе, а на эффективности и сложных задачах.
OpenAI отдельно выделяет:
кодинг;
работу с длинными задачами;
работу с браузером и инструментами;
computer use;
cybersecurity;
создание интерфейсов и визуальных артефактов;
документы, таблицы и презентации.
То есть модель двигается не просто в сторону “умнее отвечает”, а в сторону “лучше выполняет рабочие процессы”.
Как работает GPT-5.6 в ChatGPT
В стандартном ChatGPT выбираются не все три модели.
Sol используется в reasoning-режимах:
Medium;
High;
Extra High;
Pro.
Terra и Luna в обычном чате не выбираются напрямую. Они доступны в Work, Codex и через API.
Free и Go не получают GPT-5.6 Sol в стандартном ChatGPT. Plus получает Medium и High, но без Extra High и Pro. Pro, Business и Enterprise получают больше режимов.
Про Ultra / Pro-режимы
Главная идея — больше вычислений на сложную задачу. Это нужно не для обычного вопроса, а для задач типа:
разобрать большой проект;
написать и проверить код;
найти ошибку;
собрать исследование;
сравнить документы;
сделать сложную аналитику.
Минус очевидный: такие режимы дороже и медленнее. Их нет смысла включать для простых вопросов.
Что важно про бенчмарки
К цифрам по новым моделям стоит относиться аккуратно.
Бенчмарки показывают прирост в сложных задачах, но это не значит, что модель стала лучше абсолютно во всём. Особенно осторожно надо смотреть на агентные тесты, где модель может использовать инструменты, окружение и нестандартные стратегии.
Практический вывод простой: смотреть надо не только на красивый процент в таблице, а на свою задачу — код, тексты, анализ, дизайн, документы, агенты.
#ai #нейросети
OpenAI выпустила новое семейство моделей GPT-5.6. Это не одна модель, а три уровня:
Sol — флагманская модель для сложных задач: кодинг, research, анализ данных, cybersecurity, работа с инструментами и дизайн.
Terra — средний вариант. По смыслу — модель для повседневной работы, где нужен баланс качества и цены.
Luna — самая дешёвая и быстрая модель в линейке. Нужна для массовых запросов, где важнее стоимость.
Главные характеристики в API:
Sol:
контекст — 1 050 000 токенов
макс. вывод — 128 000 токенов
цена — $5 за input и $30 за output за 1 млн токенов
Terra:
цена — $2.50 за input и $15 за output
Luna:
цена — $1 за input и $6 за output
У всех трёх моделей дата знаний — 16 февраля 2026.
Важно: большой контекст в 1.05M токенов относится к API. В обычном ChatGPT лимиты контекста могут быть ниже и зависят от тарифа и режима.
Что изменилось по сравнению с GPT-5.5
Главный акцент — не на новом интерфейсе, а на эффективности и сложных задачах.
OpenAI отдельно выделяет:
кодинг;
работу с длинными задачами;
работу с браузером и инструментами;
computer use;
cybersecurity;
создание интерфейсов и визуальных артефактов;
документы, таблицы и презентации.
То есть модель двигается не просто в сторону “умнее отвечает”, а в сторону “лучше выполняет рабочие процессы”.
Как работает GPT-5.6 в ChatGPT
В стандартном ChatGPT выбираются не все три модели.
Sol используется в reasoning-режимах:
Medium;
High;
Extra High;
Pro.
Terra и Luna в обычном чате не выбираются напрямую. Они доступны в Work, Codex и через API.
Free и Go не получают GPT-5.6 Sol в стандартном ChatGPT. Plus получает Medium и High, но без Extra High и Pro. Pro, Business и Enterprise получают больше режимов.
Про Ultra / Pro-режимы
Главная идея — больше вычислений на сложную задачу. Это нужно не для обычного вопроса, а для задач типа:
разобрать большой проект;
написать и проверить код;
найти ошибку;
собрать исследование;
сравнить документы;
сделать сложную аналитику.
Минус очевидный: такие режимы дороже и медленнее. Их нет смысла включать для простых вопросов.
Что важно про бенчмарки
К цифрам по новым моделям стоит относиться аккуратно.
Бенчмарки показывают прирост в сложных задачах, но это не значит, что модель стала лучше абсолютно во всём. Особенно осторожно надо смотреть на агентные тесты, где модель может использовать инструменты, окружение и нестандартные стратегии.
Практический вывод простой: смотреть надо не только на красивый процент в таблице, а на свою задачу — код, тексты, анализ, дизайн, документы, агенты.
#ai #нейросети
1❤49🤝41🔥39🥰9
🔥 Кодинг-агенты не заменят эксперта. Но заберут 80% рутины
Anthropic проанализировала 398 000 сессий Claude Code (окт 2025 – апр 2026) и выяснила, как на самом деле делят работу человек и ИИ.
Ключевые выводы:
🧠 Человек — стратег, ИИ — исполнитель
Пользователи принимают 70% решений «ЧТО делать», но всего 20% — «КАК делать». Выбор файлов, команд и деталей реализации полностью на Claude.
📈 Эксперты получают в 6 раз больше пользы
У новичков сессия = 600 слов вывода и 5 действий. У экспертов — 3 200 слов и 12 действий. Агент делает больше, когда им умеют управлять.
🎯 Экспертиза = успех
Верифицированный успех растёт с уровнем компетенции:
14,5% (новичок) → 32,9% (эксперт)
Главный скачок — между начальным и средним уровнем. Дальше прирост скромнее.
Важный нюанс: экспертизу мерили не по стажу, а по тому, насколько чётко человек ставит задачу, правит ошибки и задаёт правильные вопросы. Бухгалтер без опыта Python, но с толковым ТЗ — уже эксперт в своей задаче.
Вывод: агенты не отменяют сеньоров — они превращают их в архитекторов, а джунов заставляют быстрее прокачивать навыки постановки задач.
#ai #R&D
Anthropic проанализировала 398 000 сессий Claude Code (окт 2025 – апр 2026) и выяснила, как на самом деле делят работу человек и ИИ.
Ключевые выводы:
🧠 Человек — стратег, ИИ — исполнитель
Пользователи принимают 70% решений «ЧТО делать», но всего 20% — «КАК делать». Выбор файлов, команд и деталей реализации полностью на Claude.
📈 Эксперты получают в 6 раз больше пользы
У новичков сессия = 600 слов вывода и 5 действий. У экспертов — 3 200 слов и 12 действий. Агент делает больше, когда им умеют управлять.
🎯 Экспертиза = успех
Верифицированный успех растёт с уровнем компетенции:
14,5% (новичок) → 32,9% (эксперт)
Главный скачок — между начальным и средним уровнем. Дальше прирост скромнее.
Важный нюанс: экспертизу мерили не по стажу, а по тому, насколько чётко человек ставит задачу, правит ошибки и задаёт правильные вопросы. Бухгалтер без опыта Python, но с толковым ТЗ — уже эксперт в своей задаче.
Вывод: агенты не отменяют сеньоров — они превращают их в архитекторов, а джунов заставляют быстрее прокачивать навыки постановки задач.
#ai #R&D
Anthropic
Agentic coding and persistent returns to expertise
New Anthropic research looking at interactive agentic coding. We evaluate the composition of tasks, human-AI collaboration, and success rates.
1❤39👍32🔥27🍌6🥰1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
Котик-погодная станция на ESP8266
Собрала мини-погодного котика: он показывает погоду на маленьком TFT-дисплее.
Солнечно — радуется, облачно — задумался, дождь — прячется под зонтик.
Внутри: ESP8266, TFT-экран, Arduino IDE и немного доработки кода, чтобы котик менял настроение под погоду.
Гайд — в Max.
ГАЙД,КОД, ИСХОДНИКИ 👉 ссылка
#esp8266 #arduino #iot #tftdisplay #погоднаястанция #diyelectronics #робототехника #техноблог #умныйдом #makerproject
Собрала мини-погодного котика: он показывает погоду на маленьком TFT-дисплее.
Солнечно — радуется, облачно — задумался, дождь — прячется под зонтик.
Внутри: ESP8266, TFT-экран, Arduino IDE и немного доработки кода, чтобы котик менял настроение под погоду.
Гайд — в Max.
ГАЙД,КОД, ИСХОДНИКИ 👉 ссылка
#esp8266 #arduino #iot #tftdisplay #погоднаястанция #diyelectronics #робототехника #техноблог #умныйдом #makerproject
1❤63🔥49🤝42🥰4😍1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Как робот-пылесос находит дорогу? Разбираем Flood Fill / BFS
Представь: робот стоит в углу лабиринта и не видит ничего дальше соседней клетки. Как ему добраться до цели кратчайшим путём?
Ответ — алгоритм Flood Fill на основе BFS. Работает как вода, разлитая на пол: волна расходится от старта во все стороны, пока не накроет цель 🌊
Вся магия — в трёх структурах:
• queue — очередь клеток на осмотр. Берём клетку из начала, соседей кладём в конец. Именно очередь (FIFO), а не стек, даёт поиск в ширину — сначала осматриваем ВСЕХ соседей на расстоянии 1, потом всех на расстоянии 2, и так далее
• visited — множество посещённых клеток. Без него алгоритм будет ходить кругами вечно
• parent — из какой клетки мы пришли в каждую. Это «хлебные крошки» для обратного пути
Где это живёт в реальном мире:
✅ роботы-пылесосы и складские роботы
✅ заливка в Paint (та самая «ведёрко»)
✅ поиск пути в играх
✅ подсчёт островов на карте
Полный код с комментариями и генерацией анимации — в файле ниже 👇
#алгоритмы #python #robotics
Представь: робот стоит в углу лабиринта и не видит ничего дальше соседней клетки. Как ему добраться до цели кратчайшим путём?
Ответ — алгоритм Flood Fill на основе BFS. Работает как вода, разлитая на пол: волна расходится от старта во все стороны, пока не накроет цель 🌊
Вся магия — в трёх структурах:
• queue — очередь клеток на осмотр. Берём клетку из начала, соседей кладём в конец. Именно очередь (FIFO), а не стек, даёт поиск в ширину — сначала осматриваем ВСЕХ соседей на расстоянии 1, потом всех на расстоянии 2, и так далее
• visited — множество посещённых клеток. Без него алгоритм будет ходить кругами вечно
• parent — из какой клетки мы пришли в каждую. Это «хлебные крошки» для обратного пути
Где это живёт в реальном мире:
✅ роботы-пылесосы и складские роботы
✅ заливка в Paint (та самая «ведёрко»)
✅ поиск пути в играх
✅ подсчёт островов на карте
Полный код с комментариями и генерацией анимации — в файле ниже 👇
#алгоритмы #python #robotics
1❤27🔥25🤝20🥰3