техно-свалка
467 subscribers
71 photos
22 videos
2 files
60 links
Склад AI и техно-экспериментов, robotics и случайных мыслей.
Download Telegram
Поучаствовала в AI Science Hack Норникеля

На AI Science Hack Норникеля собрала «Научный клубок» — карту знаний для R&D в горно-металлургической отрасли.
Главное решение — не искать модель «поумнее», а забрать у неё право придумывать факты.
Система отдельно обрабатывает:
• сущности — объединяет русские и английские термины;
• числа — извлекает значения, диапазоны и единицы;
• смысл — сохраняет тезисы только с дословными цитатами.
В графе Kùzu уже:
• 1 828 уникальных публикаций;
• 259 304 числовых условия;
• 666 тезисов с цитатами и источниками.
Поиск использует BM25, граф и строгий AND: все ограничения должны выполняться в одном документе. Если подходящих данных нет, система честно показывает пробел корпуса.
Граф — источник истины. LLM — только интерфейс, который оформляет проверенные факты в читаемый ответ.

Код: https://github.com/CatPawsCoder/Nornickel_aI_science_hack

И да, я даже прошла в финал! 🔥
#AI #GraphRAG #Nornickel
135🔥29👍18
🧶 И немного хакатонного мерча — сделала стикерпак «Научный клубок».
Добавить стикеры в Telegram
17🔥52👏1💯1
Галлюцинации LLM и как их ловят


Галлюцинация — это когда модель генерирует фактически неверное утверждение, но подаёт его как уверенный ответ.
LLM не ищет истину. Она предсказывает следующий токен:
P(token | context)

На каждом шаге модель выдаёт логиты — сырые оценки для всех токенов словаря. После softmax они превращаются в вероятности:
logits → softmax → probabilities → next token

Если распределение уверенное, один токен сильно доминирует.
Если распределение размытое, много токенов имеют близкие вероятности.
На этом строятся методы детекции риска галлюцинаций:
1. Logprobs
Можно смотреть вероятность каждого сгенерированного токена.
Если модель пишет конкретный факт — имя, дату, название статьи, — но токены имеют низкие logprobs, это сигнал риска.
Но важно: высокий logprob не доказывает истинность. Модель может уверенно воспроизводить ложный паттерн.
2. Entropy
Энтропия показывает неопределённость распределения токенов.
H(p) = -Σ p(x) log p(x)
Высокая энтропия = модель не имеет явного фаворита для следующего токена.
Упрощённо это можно посчитать так:
import numpy as np

logits = np.array([2.4, 1.2, 0.3, -0.7]) # сырые выходы модели

probs = np.exp(logits) / np.exp(logits).sum()

logprobs = np.log(probs)
entropy = -np.sum(probs * logprobs)

print("probabilities:", probs)
print("logprobs:", logprobs)
print("entropy:", entropy)

Если один токен доминирует, entropy будет низкой.
Если вероятности размазаны по нескольким токенам, entropy будет высокой.
В production это можно использовать как risk score: если на фактических утверждениях энтропия высокая, ответ нужно проверять.
3. Self-consistency
Один и тот же запрос прогоняют несколько раз с разными параметрами: temperature, top_p, seed.
Если факты плавают — даты, числа, имена, ссылки — это не знание, а генерация вероятных вариантов.
4. Semantic entropy
Обычная энтропия смотрит на токены. Но разные фразы могут означать одно и то же.
Semantic entropy группирует несколько ответов по смыслу.
Если формулировки разные, но смысл один — риск ниже.
Если модель генерирует разные факты — риск выше.
5. RAG attribution
В RAG-системах недостаточно просто подать документы в контекст.
Нужно проверить, что каждый важный claim реально поддержан retrieved chunk.
Нормальная схема:
query → retrieval → chunks → generation → claim verification → citation check

Если утверждение есть в ответе, но его нет в найденных фрагментах, оно помечается как unsupported.
Главный вывод:
галлюцинации нельзя надёжно ловить одной метрикой.
Рабочий подход — комбинация сигналов:
logprobs + entropy + self-consistency + semantic entropy + claim extraction + RAG attribution
Модель генерирует вероятный текст. Фактом он становится только после привязки к проверяемому источнику.
#ai #llm
1👍3433🔥28🤓8👨‍💻2👀2❤‍🔥1
вышло почти одновременно две новости:

- Сбер представил GigaChat 3.5 Ultra на 432 млрд. параметров; для начала хочу поздравить коллег с релизом, вы - большие молодцы; коллеги сравниваются в отдельных задачах с DeepSeek V3.2 Pro, а в других с V4 Flash (2 картинка)

- одновременно Tencent выпускает Hy3 (это латинизированное имя, чтобы не пугать лаоваев, оригинальное - 混元 (хунь юань), или "первооснова" в переводе, причем юань - это тот же иероглиф, что и валюта) - модель на 295 млрд., которая почти также хороша, как GLM-5.2, кроме кодинга (третья картинка)

интересно было бы посмотреть на сравнение этих моделей

P.S. кстати, я писал про Hunyuan-T1 от Tencent, тогда они только начали делать свои модели и еще не успели переименоваться

@valuableai
15
Кто придумал графический интерфейс?

Не Apple. И не Microsoft.

Короткая хронология:

1963 — Sketchpad
Один из первых интерактивных графических интерфейсов: человек рисовал объекты на экране световым пером.

1968 — Mother of All Demos
Дуглас Энгельбарт показал мышь, курсор, гипертекст, окна, видеосвязь и совместное редактирование. Это выглядело как фрагмент будущего ПК.

1973 — Xerox Alto
Окна, мышь, графический экран, документы, сеть. Не массовый продукт, но важнейший прототип GUI-компьютера.

1981 — Xerox Star
Папки, документы, иконки, окна, мышь, почта, Ethernet. Уже почти знакомая нам офисная логика.

1983 — Apple Lisa
GUI в коммерческом компьютере Apple. Дорого, сложно, не массово.

1984 — Macintosh
Мышь, окна, меню, иконки, графические приложения.

1985 — Windows 1.0
Графическая оболочка поверх MS-DOS: окна, меню, мышь, Paint, Notepad, Calculator.

GUI сделал компьютер понятным не потому, что он стал проще технически.
А потому что он стал ближе к человеческому мышлению: объект → действие.
1👍56🔥44307🕊6🥰1
This media is not supported in your browser
VIEW IN TELEGRAM
🎬 Составила гайд: как с помощью ИИ делать анимированные бесшовные карусели
Те самые, где картинки плавно перетекают друг в друга и палец сам скроллит до конца 🌀
Внутри:
какими нейросетями оживлять фото (всё бесплатно)
как склеить кадры, чтобы переход был бесшовным
пошаговый воркфлоу — собираешь карусель за 15 минут
Забирай 👇
📖 Открыть гайд
Сохрани, чтобы не потерять 📌
2👍45🔥3835👏11❤‍🔥3🥰3
GPT-5.6: что важно знать без лишнего шума

OpenAI выпустила новое семейство моделей GPT-5.6. Это не одна модель, а три уровня:

Sol — флагманская модель для сложных задач: кодинг, research, анализ данных, cybersecurity, работа с инструментами и дизайн.

Terra — средний вариант. По смыслу — модель для повседневной работы, где нужен баланс качества и цены.

Luna — самая дешёвая и быстрая модель в линейке. Нужна для массовых запросов, где важнее стоимость.

Главные характеристики в API:

Sol:
контекст — 1 050 000 токенов
макс. вывод — 128 000 токенов
цена — $5 за input и $30 за output за 1 млн токенов

Terra:
цена — $2.50 за input и $15 за output

Luna:
цена — $1 за input и $6 за output

У всех трёх моделей дата знаний — 16 февраля 2026.

Важно: большой контекст в 1.05M токенов относится к API. В обычном ChatGPT лимиты контекста могут быть ниже и зависят от тарифа и режима.

Что изменилось по сравнению с GPT-5.5

Главный акцент — не на новом интерфейсе, а на эффективности и сложных задачах.

OpenAI отдельно выделяет:
кодинг;
работу с длинными задачами;
работу с браузером и инструментами;
computer use;
cybersecurity;
создание интерфейсов и визуальных артефактов;
документы, таблицы и презентации.

То есть модель двигается не просто в сторону “умнее отвечает”, а в сторону “лучше выполняет рабочие процессы”.

Как работает GPT-5.6 в ChatGPT

В стандартном ChatGPT выбираются не все три модели.

Sol используется в reasoning-режимах:
Medium;
High;
Extra High;
Pro.

Terra и Luna в обычном чате не выбираются напрямую. Они доступны в Work, Codex и через API.

Free и Go не получают GPT-5.6 Sol в стандартном ChatGPT. Plus получает Medium и High, но без Extra High и Pro. Pro, Business и Enterprise получают больше режимов.

Про Ultra / Pro-режимы

Главная идея — больше вычислений на сложную задачу. Это нужно не для обычного вопроса, а для задач типа:

разобрать большой проект;
написать и проверить код;
найти ошибку;
собрать исследование;
сравнить документы;
сделать сложную аналитику.

Минус очевидный: такие режимы дороже и медленнее. Их нет смысла включать для простых вопросов.

Что важно про бенчмарки

К цифрам по новым моделям стоит относиться аккуратно.

Бенчмарки показывают прирост в сложных задачах, но это не значит, что модель стала лучше абсолютно во всём. Особенно осторожно надо смотреть на агентные тесты, где модель может использовать инструменты, окружение и нестандартные стратегии.

Практический вывод простой: смотреть надо не только на красивый процент в таблице, а на свою задачу — код, тексты, анализ, дизайн, документы, агенты.
#ai #нейросети
149🤝41🔥39🥰9
🔥 Кодинг-агенты не заменят эксперта. Но заберут 80% рутины

Anthropic проанализировала 398 000 сессий Claude Code (окт 2025 – апр 2026) и выяснила, как на самом деле делят работу человек и ИИ.

Ключевые выводы:

🧠 Человек — стратег, ИИ — исполнитель
Пользователи принимают 70% решений «ЧТО делать», но всего 20% — «КАК делать». Выбор файлов, команд и деталей реализации полностью на Claude.

📈 Эксперты получают в 6 раз больше пользы
У новичков сессия = 600 слов вывода и 5 действий. У экспертов — 3 200 слов и 12 действий. Агент делает больше, когда им умеют управлять.

🎯 Экспертиза = успех
Верифицированный успех растёт с уровнем компетенции:
14,5% (новичок) → 32,9% (эксперт)

Главный скачок — между начальным и средним уровнем. Дальше прирост скромнее.

Важный нюанс: экспертизу мерили не по стажу, а по тому, насколько чётко человек ставит задачу, правит ошибки и задаёт правильные вопросы. Бухгалтер без опыта Python, но с толковым ТЗ — уже эксперт в своей задаче.

Вывод: агенты не отменяют сеньоров — они превращают их в архитекторов, а джунов заставляют быстрее прокачивать навыки постановки задач.

#ai #R&D
139👍32🔥27🍌6🥰1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
Котик-погодная станция на ESP8266
Собрала мини-погодного котика: он показывает погоду на маленьком TFT-дисплее.
Солнечно — радуется, облачно — задумался, дождь — прячется под зонтик.
Внутри: ESP8266, TFT-экран, Arduino IDE и немного доработки кода, чтобы котик менял настроение под погоду.
Гайд — в Max.

ГАЙД,КОД, ИСХОДНИКИ 👉 ссылка

#esp8266 #arduino #iot #tftdisplay #погоднаястанция #diyelectronics #робототехника #техноблог #умныйдом #makerproject
163🔥49🤝42🥰4😍1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Как робот-пылесос находит дорогу? Разбираем Flood Fill / BFS
Представь: робот стоит в углу лабиринта и не видит ничего дальше соседней клетки. Как ему добраться до цели кратчайшим путём?
Ответ — алгоритм Flood Fill на основе BFS. Работает как вода, разлитая на пол: волна расходится от старта во все стороны, пока не накроет цель 🌊

Вся магия — в трёх структурах:
• queue — очередь клеток на осмотр. Берём клетку из начала, соседей кладём в конец. Именно очередь (FIFO), а не стек, даёт поиск в ширину — сначала осматриваем ВСЕХ соседей на расстоянии 1, потом всех на расстоянии 2, и так далее
• visited — множество посещённых клеток. Без него алгоритм будет ходить кругами вечно
• parent — из какой клетки мы пришли в каждую. Это «хлебные крошки» для обратного пути

Где это живёт в реальном мире:
роботы-пылесосы и складские роботы
заливка в Paint (та самая «ведёрко»)
поиск пути в играх
подсчёт островов на карте

Полный код с комментариями и генерацией анимации — в файле ниже 👇
#алгоритмы #python #robotics
127🔥25🤝20🥰3
🇨🇳 Kimi K3 — новый король фронтенд-кода

Moonshot AI выпустила Kimi K3, и она сходу заняла 1-е место в Frontend Code Arena с 1679 баллами, обойдя Claude Fable 5 (1631) и GPT-5.6 Sol (1618). Это первый раз, когда открытая (open-weight) модель возглавила этот рейтинг — прямой вызов проприетарным системам.

📊 Что впечатляет:
- №1 в 6 из 7 категорий фронтенда — уступила только в Gaming (там первой осталась Fable 5)
- Скачок с 18-го на 1-е место относительно прошлого поколения (Kimi K2.6)
- 2.8 трлн параметров (MoE, активны 16 из 896), контекст 1M токенов, новая механика внимания Kimi Delta Attention
- Открытые веса + дешёвый API: $0.30 / $3 / $15 за 1M токенов (cache-hit / cache-miss / вывод)

⚖️ Но без розовых очков: в ряде «чистых» кодинг-бенчмарков (DeepSWE, FrontierSWE, Kimi Code Bench 2.0) K3 всё ещё уступает Fable 5 и GPT-5.6. Её коронка — именно веб-фронтенд.

Подробнее: Arena.ai · Moonshot AI

#апдейтымоделей #opensource #исследования
126🥰9😍8💘2
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Adeept Tank поехал. Часть 3 — манипулятор и движение

Робот собран, запущен и слушается команд. Сегодня разбираем, как устроена рука и как заставить его ехать.
🦾 Манипулятор: 4 сервопривода на одной микросхеме

Все серво висят на плате PCA9685 (адрес 0x5f на шине I2C). У каждого сустава свой канал:

0 — плечо, поднимает всю руку
1 — локоть, сгибает посередине
2 — запястье, поворот кисти
3 — захват, клешня
4 — наклон камеры

⚙️ Как задаётся угол
Серво управляется не напряжением, а шириной импульса при частоте 50 Гц:

500 мкс → 0°
1450 мкс → 90° (центр)
2400 мкс → 180°

Нейтральные положения прописаны в переменных init_pwm0…7 — при старте робот разгоняет туда все серво.

🚗 Движение
Гусеницы крутят два мотора — M1 и M2.

📹 Камера и веб-управление

Софт Adeept стартует автоматически при включении. Веб-интерфейс на порту 5000: живое видео с камеры, кнопки движения и манипулятора, телеметрия.
#robotics
133👍32🔥16👏4😍2💯2🥰1