AI_FastTrack
887 subscribers
133 photos
13 videos
18 files
204 links
ИИ - быстро для новичков
Download Telegram
Теория: почему нейромодель галлюцинирует?

Недавно Канадские Авиалинии проиграли в суде дело и выплатили компенсацию, когда их чатбот нафантазировал политику скидок и возврата денег (он оказался не «подключен» к базе данных и придумал политику, вместо ответа «нет данных»). А консалтинговая компания Deloitte вернула 480 тысяч $ правительству Австралии (!) из-за «выдуманных» ИИ фактов в отчете.

Большинство ИИ скептиков как раз отказываются пользоваться нейросетями из-за ошибок и галлюцинаций (то-есть, неверных но правдоподобных ответов, «придуманных» нейросетью). Количество статей на тему галлюцинаций выросло за два года на 400%, так волнует сообщество проблема достоверности ответов ИИ.

Давайте попробуем разобраться, из-за чего эти ошибки появляются – чтобы лучше понимать, как с ними работать.

Доля недостоверной информации, генерируемой моделями, не является фиксированной для модели и напрямую зависит от характера и сложности запроса. В базовых фактах, где проверенных данных много, уровень достоверности может достигать 90% и выше (но и здесь возможны галлюцинации в 5–10%). Если же задача в синтезе, интерпретации или анализе разрозненных данных, частота ошибок и некорректных умозаключений резко возрастает. Ключевые причины галлюцинаций следующие:

1⃣ Природа языковых моделей и недостаток актуальных или проверенных данных: как мы уже разбирались, LLM не понимают смысл, а вычисляют наиболее вероятную последовательность токенов на основе статистики в обучающих данных. Если точных данных не хватает, модель заполняет пробелы создавая правдоподобные ответы. Простой пример: если спросить, каким спортом занимается Новак Джокович, проблемы у модели не будет. А если вопрос про неизвестного Васю Иванова, модель может подставить любой правдоподобный ответ (из предыдущих обсуждений или взяв наиболее популярный спорт в стране Ивановых).

2⃣ Неправильная формулировка запроса или широкий контекст: неясная или слишком сложная инструкция без чётких вводных увеличивает вероятность выдумки. В примере выше про Васю Иванова, если бы мы дали модели дополнительные вводные (где он живет, когда родился, какие виды спорта смотрит по ТВ), мы бы повысили вероятность более логичного ответа.

3⃣ Конкретная модель обучалась на старой информации и не в состоянии применить новости или актуальные исследования. Или эта модель не интегрирована с реальным поиском и строит ответ только на известных ей примерах без проверки в реальном времени (дам пример в след.посте, а тут вот говорила, какие вопросы нужно задать нейронке, для проверки ее возможностей и ограничений).

4⃣ «Зашитый» в модель приоритет дать ответ даже в условиях недостатка данных (связано с алгоритмами тестирования моделей). На примере: если модель спрашивают о чьей-то дате рождения, а она не знает - если она назовет случайную дату, то у нее есть небольшой шанс быть правой. Признание «не знаю» - гарантированно ноль очков. Такие тесты невольно стимулируют угадывание. Только дав разрешение модели не отвечать, если информации нет в базе знаний, можно снизить галлюцинации примерно на ~20%. Кстати, можно ситуацию улучшить на уровне пользователя, разберем!

5⃣ Потеря контекста в процессе диалога - бессмысленные или слишком общие ответы появляются чаще в длинных диалогах. Поэтому важно "дробить" сложные задачи.

6⃣ Технические проблемы старых или недообученных моделей - ошибки разбивки на токены, неправильная интерпретация запроса пользователя. Здесь важно не экономить.

Дальше рассмотрим примеры и методы борьбы с галлюцинациями.
👍1
Тест-драйв: Поиск актуальной информации в сети

Поиск информации – топовый запрос сейчас к нейронка
м, потому как ИИ может искать не только по ключевым словам, как обычный браузер, а по более сложным и комплексным критериям.

Изначально планировала протестировать гипотезу, что российские нейронки лучше ищут в рунете. Неожиданно, тест стал также иллюстрацией галлюцинаций и разницы в алгоритмах поиска между нейронками 😊

Запрос был следующий: «Найди агентства по подбору сиделок для человека после инсульта в С.-Петербурге. Дай название, краткое описание, ссылку на сайт и рейтинг, если есть». Специально не давала уточнений про дату актуальности информации - интересно было, как справятся модели. Результаты следующие:

Лучше всех был Perplexity – точно понял запрос, дал 6 «живых» агентств с сайтами и рейтингами, бонусом дал адреса-телефоны и точки на гугл картах.

Слабее всего справился DeepSeek. В режиме поиска нашел всего три агентства, причем одно – для больных с деменцией (написал, что «они понимают неврологический профиль» - не осознает разницу двух диагнозов?). При повторном запросе в режиме Think deeper уверенно сгаллюцинировал несуществующие агентства и ссылки на них. Будучи «прижатым к стенке», сознался, что у него в этом режиме нет выхода в интернет, поэтому додумывает, а также подтвердил, что работает на базе с датой обновления апрель 23го (!) и посоветовал сходить в яндекс, гугл, или Perplexity. Упс.

Gemini/Google удивил меня также нерабочими ссылками и одним агентством в Воронеже в первом ответе. Во второй раз извинился, пообещал провести поиск именно «актуальных и работающих агентств» и таки дал 4 реальных.

Алиса с Яндексом дала также 4 актуальных адреса, но еще и бонусы в виде точек на карте и адреса-телефоны… при этом была не на 100% аккуратна с запросом, один из адресов является не агентством, а загородным пансионатом

Copilot/Microsoft дал 7 контактов, но зачем-то включил туда Profi и Услуги Яндекс. Та же схема была у GigaChat, включены ссылки на порталы услуг, о чем их не просили

Из неожиданного: списки агентств отличались процентов на 90! Практически везде засветилось только одно (по-видимому, там работают хорошие маркетологи по настраивание SEO – предпочтений при поиске). Дальше я пошла копаться еще с Deep research, почему такие (странные) результаты, и вот какими важными выводами могу с вами поделиться:

1⃣ Специализация – это хорошо, заточенный на поиск с актуальными референсами Perplexity опять «рулит». Нейросети со своими браузерами(Алиса/Яндекс, Gemini/Google) тоже норм, хоть и похуже. При этом никаких преимуществ рос.нейронок для рунета не обнаружилось (не в первый раз).

2⃣ Всегда используйте правильный режим модели – Search (чтобы не было, как с DeepSeek, который «искал» в старой базе данных без выхода в сеть). И проверяем, есть ли у модели выход в сеть (если пользуемся чат-ботом или каким-то приложением).

3⃣ Разные модели могут иметь разные алгоритмы поиска. Пользоваться одной неэффективно (см. про 90% отличий в результатах). А порталы услуг были добавлены некоторыми нейронками из-за встроенного приоритета «размера» над «релевантностью», что также не помогает.

4⃣ Разные модели также имеют слегка разные алгоритмы интерпретации вашего запроса. Поэтому необходимо формулировать запрос предельно ясно и точно, с указанием критичных деталей (например, в данном случае нужно было добавить: «дай только агентства, предоставляющие возможность замены», «дай только актуальные и работающие на (дату)» или «не включай порталы по подбору услуг»). Еще разберем с вами промптинг во всех деталях, это уже про него 😊

Полезно? Бывали случаи, когда вам ИИ давал "левые" ссылки и адреса?
👍51
Теория: как бороться с галлюцинациями нейросетей?

Продолжаем разбираться с темой галлюцинаций, тут говорила почему нейросети галлюцинируют.

Плохая новость: по словам разработчиков, избавиться от галлюцинаций генеративных нейросетей на 100%, невозможно, можно только держать их «в узком диапазоне». Что должны делать создатели моделей (и делают, особенно в условиях высокой конкуренции – и это хорошая новость - например, в новом GPT 5.2 декларировали снижение галлюцинаций на 30%):

1⃣ Улучшение качества данных и дообучение: очистка, актуализация баз данных.
2⃣ Изменение механизмов тестирования - чтобы модели могли отказаться от ответа, если не уверены.
3⃣ Разработка более сложных режимов работы моделей, включающих тестирование и автоматическую проверку фактов, несколько параллельных циклов обработки и прочие.
4⃣ Сбор обратной связи от пользователей с меткой ошибочных ответов для корректировки и дообучения моделей и уведомление пользователей об ограничениях - честно указывать дату «обучения» модели.

Что можем делать мы, пользователи уже сейчас, не дожидаясь «чуда»:

Пока модели несовершенны и развиваются, fact checking (проверка достоверности данных и ссылок) лежит полностью на нас. Я всегда запрашиваю дать в ответе кликабельную ссылку на источник и полный их список в конце, просматриваю статью или с помощью ассистента в браузере прошу дать ее выжимку.

Правильный промпт (prompt engineering): чётко формулируем запрос, указываем дату, предпочтительные источники, структуру. Добавляем примеры правильных/неправильных ответов, чтобы снизить творческую «вольность» модели. Ограничиваем контекст, максимально сужая область для анализа и четко ставя задачу (рассмотрим секреты промптинга чуть позже). А также можем попросить в системном промте нейросети оценивать «уровень уверенности» при ответе на вопросы (также разберем).

«Умное» дробление задачи для последовательного их решения: не перегружаем модель слишком сложной задачей/контекстом в одном запросе. Понимаем ограничения ширины окна контекста и управляем им: просим анализировать только часть документа, в длинных диалогах заново загружаем референсы, пользуемся режимами нейронки в которых сохраняется контекст по теме (Projects, Gems в Gemini, Gpts в ChatGPT).

При необходимости, запрашиваем анализ на строго ограниченном количестве данных и проверяемых источниках (Retrieval-Augmented Generation или RAG, запомним термин на будущее). Например, NotebookLM от Google можно сфокусировать на анализе только ваших документов, без выхода в сеть. Более продвинутый вариант RAG в организации предполагает создание своей библиотеки: все данные (базы данных, PDF-документы, блоги, новостные ленты, чаты) переводятся в специальный формат векторной базы данных, для быстрого поиска и извлечения информации. Ну и Google недавно выкатил решение, где он сам разбирается с вашей базой, подтягивая нужное (правда, только из своего облака).

Итого, fact checking, prompt engineering (включая системные промпты), дробление сложных задач и использование правильных режимов – ключевые инструменты для существенного улучшения качества работы с ИИ. Будем разбираться дальше, как ими пользоваться.
👍5
Практика: как отличить ИИ видео, иллюстрация.

Разбавим теорию практикой 😊 По новогодней рекламе Кока-Кола, сгенерированной ИИ, не прокатился только ленивый. И животные «криповые», и сюжета нет, и вообще достал уже бездушный ИИ. Но нам сейчас интереснее такой важный признак ИИ видео, как отсутствие консистентности (постоянства) между частями ролика (разбирала ключевые признаки ИИ видео тут). Один товарищ не поленился и сделал такую подборку грузовиков, мелькавших в разных кадрах. Так как по информации компании генераций были тысячи, а точностью грузовика пренебрегли, в финальный монтаж вошло прямо неразумное количество несоответствий.

То-есть, если ищем признаки ИИ в чужих видео – стоп-кадр, увеличение, поиск несоответствия деталей между сценами, как сделал автор коллажа.

Если делаем сами видео - используем модели с возможностью загрузки референсов критичных предметов (тот же грузовик можно было легко «зафиксировать»).
👍7
Теория: где будет выше количество галлюцинаций?

П
родолжая тему галлюцинаций (здесь разбирала их основные причины), предлагаю разобраться с оценкой риска нерелевантных ответов или галлюцинаций в зависимости от сложности поставленной ИИ задачи.

Сгруппируем задачи от используемых глаголов действия в запросе:
1⃣ Найди в тексте, выпиши, переведи, перечисли: это простая работа с текстом источников.
Уровень галлюцинаций – низкий. Если задача не критичная – можно не проверять.

2⃣ Обобщи, суммируй, переформулируй, переведи в другой стиль, расшифруй: интерпретация, но близкая к тексту.
Ошибки возможны, единичные. Лучше просмотреть.

3⃣ Вычисли, реши, спроектируй, покажи, как применить (использовать в другой ситуации): это уже экстраполяция, могут быть множественные варианты ответа.
Возможны галлюцинации, нужно проверять выводы и решения.

4⃣ Найди причины, сравни, структурируй: логические, аналитические выводы, ИИ должен находит связи и может их придумать в условиях неоднозначности.
Серьезная возможность галлюцинаций, нужно обязательно проверять на соответствие выводам и логике первоисточника.

5⃣ Критикуй, рекомендуй, разработай, найди новое решение: это запрос на точку зрения, далеко уходим от первоисточника, нет единственного правильного ответа.
Высокий уровень галлюцинаций или нерелевантных ответов, обязательно проводим проверку на правильное понимание фактов, используем ответ как одно из мнений, не более.
💯1
Спрашивали– отвечаем: как я разбиралась в теме ИИ – опыт и ошибки.

«Играть» с ИИ я начала как раз года два назад – создавала картинки для иллюстрации идей или для презентаций, делала исследования в пределах бесплатных лимитов нейронок. Но, как и многим, времени на вдумчивое и последовательное изучение возможностей ИИ категорически не хватало. Случайно выбранные лекции и вебинары раздражали малым количеством полезной информации с рекламой своих же платных курсов. Как маркетолог, я понимаю этот формат - «наживка» или «дегустация», но польза от них близкая к нулю.

Что касается платного обучения, при высокой занятости сложнее всего выбрать наиболее полезный и емкий курс, и вот почему:
1⃣ Если курс представляет обзор нейросетей и их возможностей, обычно авторы не погружаются в ограничения конкретной нейронки и часто игнорируют альтернативы (их задача – продавать этот курс максимально долго). Пример: Perplexity предлагается как мультимодальная нейронка, а жесткие лимиты на генерацию видео (5 в месяц!) игнорируются.

2⃣ Если курс по специальности и ориентирован на желающих переучиться на новую профессию, они могут быть «набиты» ненужной базовой или теоретической информацией, для набора большего количества академ.часов в курсе (например, в курсе по созданию контента для соц.сетей вам дадут общую теорию маркетинга). При этом авторы, которые «начитывают» видеоуроки могут быть и специалистами в данной области, но вот кураторы, обещанные вам для проверки заданий и сопровождения, будут точно «молодыми специалистами» и не помогут экспертно с конкретными бизнес-задачами.

3⃣ Некоторые материалы курсов бывают очевидно сделаны теми же нейросетями. А каждый курс подводит к тому, что еще не мешало бы пройти еще несколько… что понятно, так как задача любой школы продать максимальное количество курсов, имея минимальную себестоимость. Конечно, есть варианты дорогой персональной ориентации, где вы можете изложить свои задачи и вам подберут ИИ инструменты, но это уже ближе к консалтингу и стоит реально много.

4⃣ Из смешного:
некоторые «авторитеты» в ИИ собирают вокруг себя практически секты, члены которых в комментариях прямо во время вебинара называют гуру гением, а неудобные вопросы игнорируются 🤣.

В результате я отобрала для себя такие форматы для освоения ИИ:
Держу подписку на примерно 20 каналов (ТГ, youtube). Это сообщества профи в AI/IT, обзоры для «чайников» и подборки новостей. Они дают информацию о новых возможностях или новых инструментах. В плане – доделать свою подборку новостей и сократить количество каналов (нужно систематизировать источники, руки пока не доходят 😊).

Конечно, спрашиваю сами нейронки по их возможностям и алгоритмам, выбору инструментов под задачи. Пока что продолжаю спрашивать 3-4 модели параллельно по каждой задаче, опыт показывает, что так эффективнее и надежнее.

Купила пожизненный доступ к курсам на одной из русскоязычных обучающих платформ. Почему: если что-то выйдет новое на рынке или у меня появится новая задача, можно будет углубиться. Платформу выбирала по широте списка курсов и адекватному основателю, возможности учиться без выполнения домашних заданий, выбирая только релевантные части курса. Но это недешево и я понимаю все ограничения, описанные выше.

В этом канале буду делится полученными знаниями, опытом и новостями, прежде всего, возможностями и ограничениями генеративного ИИ. Уже писала, считаю, что без понимания правильных алгоритмов взаимодействия с ИИ, будем получать только так себе результаты 😊
👍7
Доброй субботы. Подведем итоги недели.

Н
а этой неделе рассматривала в основном тему галлюцинаций ИИ – почему они происходят и что можно делать для сокращения их количества. Тему не закрыли пока полностью, успела опубликовать:
Теория: почему нейромодель галлюцинирует?
Тест-драйв: Поиск актуальной информации в сети
Теория: как бороться с галлюцинациями нейросетей?
Практика: как отличить ИИ видео, иллюстрация
Теория: где будет выше количество галлюцинаций?
Спрашивали – отвечаем: как я разбиралась в теме ИИ

Если вы только что присоединились, добро пожаловать! Очень рекомендую просмотрите закреп, а именно:
Введение: зачем мы здесь?
Введение: как и о чем я буду писать в этом канале
Список постов за ноябрь 2025

Посты предыдущих недель декабря можете увидеть в этих постах, в конце месяца просуммирую и выведу тоже в закреп:
Суббота 06.12
Воскресенье 14.12

На следующей неделе планирую приступить к теме промптинга, что в нем работает и почему.
И, как уже традиция в день подведения итогов за неделю, предмет для шутки.
На фото: типичный (глупый) ответ нейросети на (неконкретный) вопрос 😜
👍2😁1
Теория: что такое факт-чекинг и зачем он вообще нужен

Как вы думаете, как много людей проверяют первоисточник, методологию исследования или точные выводы, когда читают новости? Ответ: не более чем единицы–низкие десятки процентов, в зависимости от страны и контекста (новости, соцсети, ИИ‑ответы).

Более того, исследование ЮНЕСКО 2024 по блогерам и создателям прочего диджитал контента показало, что около 62–63% из них не проводят фактчекинг перед публикацией. Что ж, авторы тоже люди :)

Какой вывод: ИИ тут ни при чем, проблема значительно старше. Вот некоторые примеры типичных ошибок при подаче материала (не рассматриваю здесь "злой умысел" - целенаправленную дезинформацию, заказные материалы и прочее):

1⃣ Распространение "узкого" вывода на все возможные варианты.
Например: недавний анонс что наконец-то Google/Gemini умеет распознавать любой ИИ контент с помощью своего инструмента SynthID.
Что на самом деле: распознает контент, сгенеренный только инструментами Google по своей отметке (watermark), то-есть, контент от другой нейронки без этой отметки он не распознает. Кто-то был невнимателен.

2⃣ Выводы на базе неправильной методологии, например, нерепрезентативной или малой выборки (чем грешат многие опросы).
Например: я могу спросить в этом канале про ваше отношение к ИИ. Но могу ли я распространить эти выводы на возраст, страну или мир? Очевидно, что нет. Но многим авторам же хочется славы :)

То-есть, проверять стоит любой материал, особенно «жареные» новости, всегда. Далее разберем, как строить работу по проверке материалов, выдаваемых ИИ.
👍5
Практика: фактчекинг и как его проводить при работе с ИИ - часть 1

Начнем с минимального алгоритма проверки (Fast-Check). Ниже также опишу пути проверки источников (которые вполне могут быть фейковыми или нерелевантными):

Подходит для написания постов в соцсети, черновиков писем, поиска идей или бытовых советов - не супер-критичных задач. Этот алгоритм занимает минуты и направлен на отсечение грубых ошибок и галлюцинаций:
1⃣ Проверка на «здравый смысл»: ищем в тексте логические противоречия (например, в начале абзаца утверждается одно, а в конце — противоположное).
2⃣ Верификация ключевых фактов: выделяем 2-3 главных факта (даты, фамилии, названия брендов), проверяем их через поисковик.
3⃣ Выявление галлюцинаций: можно сгенерировать 2–3 варианта ответа на тот же запрос и оценить согласованность. Несоответствия означают ошибки.
4⃣ Контроль ссылок: если ИИ привел ссылки или источники, перейдите по ним, прочитайте, переведите или просуммируйте (можно через ИИ ассистента в браузере - Google, Comet в Perplexity, Яндекс).

Часто нейросети генерируют ссылки на реалистично выглядящие, но несуществующие источники. Как их «отсечь»:
Проверка по уникальным идентификаторам – самый быстрый и надежный способ.
У каждой реальной научной публикации есть DOI (Digital Object Identifier), выглядит как 10.1000/123456. Как проверить: вставьте DOI в строку поиска на сайте doi.org.
Или: ISBN / ISSN - для книг и периодических изданий (в сервисе типа WorldCat или базе данных ISBN Search)
Или: PMID (PubMed ID), для медицинских и биологических статей (в строке поиска PubMed).

Поиск в специализированных библиотеках и агрегаторах - если нейросеть дала только название и авторов, ищем их в «белых списках» научной литературы
Например: Google Scholar. Если статьи нет здесь, с вероятностью 99% она не существует.
Или: eLibrary / РИНЦ - для русскоязычных научных работ.

Контентный анализ - присматриваемся к деталям, которые часто выдают галлюцинацию:
«Слишком точное» название: нейросети часто генерируют названия статей, идеально отвечающие на ваш запрос. Реальные названия научных статей обычно более «занудны» и специфичны.
Несуществующие журналы: ИИ может придумать журнал вроде «Journal of Advanced AI Ethics and Global Science». Проверяем поиском.

Проверка текста статьи: что печально, наличие pdf файла уже более не является гарантией подлинности этой статьи, вы можете «попасть» на deepfake. Что делать:
Статья считается реальной, если она размещена на домене издательства или университета. Например: если PDF лежит на nature.com или arxiv.org — это оригинал. А если на случайном файлообменнике или «мусорном» сайте без истории – подделка.
Можно сделать поиск по цитатам – взять два-три предложения из середины PDF (не заголовки!) и вставить их (в кавычках) в Google. Если статья реальная, поиск выдаст ссылки на репозитории (ResearchGate, Academia.edu, сайты университетов).
👍61
Практика: фактчекинг и как его проводить при работе с ИИ – часть 2

Теперь рассмотрим максимальный алгоритм проверки (Deep Audit). Он нужен для медицинских, юридических, технических текстов, бизнес-отчетов и научных публикаций. Там, где ошибки недопустимы или есть реальные репутационные/финансовые риски (привет, Deloitte, тут рассказывала 😂). Такой аудит может занять нескольких часов, проводится поэтапно и вовлекает другие нейронки.

Этап 1: Деконструкция: разбиваем текст на отдельные критичные для выводов утверждения. Каждое предложение, содержащее факт, цифру или причинно-следственную связь, проверяем отдельно.

Этап 2: Тройная верификация (Triangulation). Для каждого ключевого утверждения находим подтверждение в трех независимых авторитетных источниках (официальная документация или законы, научные статьи, крупные новостные агрегаторы или профильные энциклопедии).

Этап 3: Проверка цитат и источников.
Детально разобрала проверку источников выше. Если в статье цитируется человек, проверьте, говорил ли он это на самом деле (поиск по точной фразе в кавычках).

Этап 4: «Перекрестный допрос» и целевые вопросы (в той же нейронке).
Варианты запросов: "Перечисли ВСЕ исключения из правила X" "А есть ли ещё случаи, когда это не применяется?" "Найди в документах противоречия моему выводу" или "Какие риски я мог упустить?" Важно: по сути, просим ИИ специально искать то, что опровергает полученные выводы, это часто вытаскивает пропущенные нюансы и повышает объективность.

Этап 4: Мультимодельная проверка - загружаем тот же промпт в другие модели, сравниваем выводы.

Этап 5: «Перекрестный допрос» с другими нейросетями: загружаем уже готовый ответ с промптом:
«Ниже приведен текст. Найди в нем фактические ошибки, логические несостыковки и галлюцинации. Укажи, что именно вызывает сомнения и почему».

Этап 6: Проверка актуальности (для вопросов, где критично знание самых последних новостей и релизов) - гигиеническая проверка в свежих источниках. Бывает, что модель отвечает на своей базе данных и упускает новости последних недель-месяцев.

Отдельно остановлюсь на проблеме "тихих пропусков" (silent omissions) — это ключевая проблема всех LLM, особенно критичная для юридической и академической работы. Это когда система не галлюцинирует, не придумывает, чего не было... а просто молча игнорирует ключевой пункт или нюанс из загруженных документов — это гораздо опаснее явных ошибок и сложнее выявить. Что помогает из вышеперечисленного:
Перекрёстный допрос и целевые вопросы
Мультимодельная проверка и перекрестный допрос с другими нейронками
Дополнительно, рассматриваем разбивку документов на группы по 5-10 для детального анализа и сравнения выводов

Сложновато? Извините, по другому - никак. Не проверил - рискнул репутацией и деньгами 😉
9🔥3
AI_FastTrack pinned «Доброй субботы. Подведем итоги недели. На этой неделе рассматривала в основном тему галлюцинаций ИИ – почему они происходят и что можно делать для сокращения их количества. Тему не закрыли пока полностью, успела опубликовать: Теория: почему нейромодель…»
Интересное - ИИ в физическом мире

Разбавлю, пожалуй, сложные инструкции такой вот темой. Вы знали, что Китай – мировой лидер по числу промышленных роботов: в стране их более 2 млн, а за последний год их установили в 9 раз больше, чем в США? То-есть США фокусируются на фундаментальной науке с Genesis программой (напишу еще об этом). Китаю это сложновато, в условиях дефицита передовых ИИ чипов (GPU), но они давно стали мировой фабрикой и успешно используют автоматизацию для ухода «в отрыв».

Также они активно тестируют роботов для других задач, например, на конкурсе в Гонконге ATEC 2025 роботы пытались выполнить обычные задачи на открытом воздухе. Что получилось? Падения, сбои и возвращение к пульту дистанционного управления!!! И мы же помним смех по повод упадения первого российского человекоподобного робота с ИИ Aidol? Фото положу в следующем посте 😉.

Падают пока все ИИ роботы. И вот тут интересно, почему, и китайцы подробно разобрали причины после своих «состязаний»:
1⃣ «Детский» интеллект ИИ: любая задача в реальном мире - это длинная цепочка действий. Чтобы полить цветок, нужно: найти лейку - взять её - открыть кран - наполнить - закрыть кран - найти цветок - полить - вернуть лейку. При малейшем сбое (лейка застряла), робот не может выполнить корректирующее действие вне алгоритма самостоятельно (писала еще тут).

2⃣ Нулевое осязание: у роботов нет полноценной тактильной обратной связи. Человек, беря стакан, чувствует его вес, а если он еще мокрый и скользкий – возьмет его крепче. Робот же действует вслепую, что делает хрупкие или деформируемые предметы для него кошмаром. Также любая выбоина на полу, прогиб доски, могут стать фатальными и робот упадет.

3⃣ «Слепота» в реальном мире: солнечный свет ослепляет камеры робота, прозрачная бутылка становится невидимой, робот тянется к ней и промахивается или роняет ее. А при передвижении по подвесному мосту робот пытался «встать» на воздух.

Что, все так плохо? Вроде были и удачные решения. Две команды с четвероногими (!) роботами без вмешательства оператора прошли испытания с сортировкой мусора и пересечением подвесного моста. Но. Они фактически отказались от ИИ (как LLM) в пользу проверенного компьютерного зрения. А еще они заранее обучили робота на симуляции, максимально учитывающей все возможные проблемы (свет, колебания подвесного моста). То-есть, если бы симуляция была менее точной или что-то бы пошло не так, робот гарантированно бы рухнул, как на фото.

Так что, до полностью автономных самообучающихся домашних роботов нам еще очень и очень далеко 😊
5👍3
К предыдущему посту о падающих роботах :)
Доброго дня. Вы только что присоединились?

Добро пожаловать! В канале набралось уже достаточное количество постов по вопросам теории и практики ИИ. Если вам интересно подойти к вопросу систематически, рекомендую начать с самого начала 😉

Конечно, можно просмотреть только интересующие вас посты, начните с закрепа, а именно:
Введение: зачем мы здесь?
Введение: как и о чем я буду писать в этом канале
Список постов за ноябрь 2025
Доброй субботы. Подведем итоги недели - 20.12

По итогам декабря я также сделаю полный список всех постов за месяц. И собираю ваши пожелания по темам, обязательно доберемся!
👍236🙏3
Есть мнение: переоценена ли значимость ролевого промпта?

Пока еще не готова поделиться с вами полной инструкцией про промпты (при подготовки материала, наткнулась на одну любопытную вещь... скоро расскажу 😉). Но прочитала тут, что исследователи из Пенсильванского университета решили проверить, работает ли назначение роли в промпте "Веди себя как эксперт по..." для повышения точности ответа. Вывод автора поста был, что такое назначение роли (или ролевой промпт) работает для изменения тона или стиля ответа, но бесполезен для повышения фактической точности. Цитата: «Железка умнее от ваших ролевых игр не становится». Видела этот вывод во многих каналах и новостях.

На самом деле: не совсем так. Как обычно, пошла изучать само исследование ))). Статья от 12.12.25 об эксперименте, где тестировали шесть моделей на вопросах уровня аспирантуры по наукам, технике и праву в трех ситуациях:
1⃣ Базовый вариант: без назначенной роли, только вопрос и варианты ответа плюс краткая инструкция по формату ответа.
2⃣ Экспертные роли: «мирового уровня эксперт» в физике, математике, экономике, биологии, химии, праве, инженерии, истории и пр. Часть из экспертов совпадали по профилю с вопросом, часть – нет (когда эксперту по физике задавали вопрос по праву - ха).
3⃣ Низкокомпетентные роли: «обычный человек», «маленький ребёнок», «четырёхлетний ребёнок, думающий, что Луна из сыра» (дословно :).

Результат: в большинстве случаев любая роль (включая правильного эксперта) даёт статистически неотличимую от базовой точность. Этот (средняя температура по больнице) вывод и вошел в новости. Однако:
Низкокомпетентные роли снижают точность, особенно сильно в ситуации с «малышом».
Были локальные исключения: Gemini 2.0 Flash получила умеренные выигрыши от всех экспертных ролей в инженерии и химии, а GPT 4o был лучше в праве с юристом-профи. Был сделан вывод, что эти улучшения выглядят как специфичные для модели и задачи, а не универсальные.
Из любопытного, у части Gemini моделей нерелевантные эксперты приводили к отказам отвечать (модель «не может по совести ответить вне своей области» 😊). Молодец!

То-есть, все-таки в ряде случаев роль влияла на точность, и мы не можем предсказать, как будет реагировать конкретная модель, учитывая еще и ограничения эксперимента (тестировался лимирированный набор моделей и ролей, академические бенчмарки, а не реальные задачи).

Сами авторы говорят о том, что необходимо прорабатывать детальные, специфичные для задачи промпты, просто добавлять «эксперта по X» в системный промпт недостаточно. С этим уже я полностью согласна.
2👍1
Государственныепрограммы поддержки – США vs Китай.

В
конце ноября Трамп подписал указ о запуске Genesis Mission — национальной программы по ускорению научных открытий через AI. Это крупнейшая мобилизация федеральных научных ресурсов со времён программы Apollo.17 национальных лабораторий объединяют свои суперкомпьютеры, научные данные и модели в единую платформу для AI-экспериментов. Обещают сократить время открытий с лет до дней или даже часов. Приоритеты: биотехнологии, критические материалы, ядерная энергия, космос, квантовые вычисления, полупроводники, проекты по нацбезопасности.

Genesis строится на партнёрствах с частным сектором, Nvidia, Dell, Oracle и Anthropic уже объявили об участии. Компании будут финансировать строительство дата-центров на государственной земле, а национальные лаборатории дадут вычислительные мощности и данные. Пока что есть скепсис у специалистов – не понятны конкретные схемы взаимодействия и бюджетирование. Подождем - увидим 😉.

Genesis — прямой ответ Китаю. У КНР есть своя версия — Национальная интегрированная сеть вычислительных мощностей, которую координирует государственная лаборатория Peng Cheng. Но проблема Китая — он контролирует около 15% глобальных AI-мощностей, США — 75%. Экспортные ограничения на чипы Nvidia сильно бьют по китайским разработчикам, Huawei пытается компенсировать своими разработками, но он отстаёт.

Зато, как уже писала тут, Китай решил «упереться» в уровень автоматизации и использования ИИ в промышленности. Еще в до-ИИ времена времена страна умела построить и произвести почти что угодно в нереальные для конкурентов сроки, а с новым уровнем автоматизации отрыв может стать недостижимым для остальных. Несколько примеров:
На заводах бытовой техники Midea уже сейчас используют так называемый factory brain – ИИ-систему, которая контролирует все процессы, от логистики до управления роботами и сотрудниками.
В одном из крупнейших в стране портов Тяньцзинь контейнеры по пирсу возят грузовики-беспилотники, краны управляются дистанционно, а разработанная Huawei система постоянно крутит “цифровую копию” порта, моделируя разные маршруты движения грузов и кораблей и выбирая лучший. Планирование, которое раньше занимало сутки, теперь делается за десятки минут, а количество персонала удалось сократить на 60% (!) при выросшем грузопотоке.

Это не значит, что в Штатах не работают над промышленным ИИ и автоматизацией – но, похоже, они считают, что это должно быть следующий этап, а пока – нужно «оторваться» в науке должна быть наука.
8👍2
Как и о чем я буду писать в этом канале – уточнение!

На этой неделе произошло серьезное событие – я открыла канал для незнакомых людей через анонсы в соц.сетях. Задача канала не поменялась, я по-прежнему вижу ее, как описано тут. Поэтому и открыла доступ – на более широкой группе вероятнее общение и обмен опытом, а не монолог автора.

Что хотелось бы добавить (и напомнить))):
Канал есть и будет некоммерческим, я не веду тренингов по теме ИИ и не принимаю рекламу для размещения в канале (если вы ее видите – это реклама от ТГ).
Почему тогда я это делаю: кто-то с возрастом пишет мемуары или стихи… мне тоже захотелось делиться мыслями, пробую такой формат, он мне ближе. Также считаю, что без новых знаний можно зачахнуть, осваиваю ИИ навыки для профилактики здравого ума.
Канал – это хобби. Пишу посты в свободное от работы и семьи время. Поэтому прошу вас отнестись с пониманием к тому, что публикации выходят не каждый день, а темы я буду раскрывать в соответствии со своими приоритетами. Ваши пожелания сохраняю и, безусловно, до них доберемся (все они были интересными и релевантными для меня, например, ИИ для изучения языков и путешествий).
Посты я пишу сама. Статистика, факты и объяснения терминологии, конечно, собираются через ИИ (обычно в 3-5 нейронках, с факт-чекингом). Форматирование "чтобы красиво" тоже делаю сама (годы корпоративных презентаций сказываются 😜).
Писать буду длинные посты: хочу фокусироваться на разборе «почему так работает», а не на простых готовых рецептах «вот вам промпт на все случаи жизни». Мое глубокое убеждение – только разбор причин и понимание возможностей и ограничений ИИ поможет выстроить работу с ним долгосрочно и правильно. Без понимания нет результата.

Планирую посты по следующим разделам:
1. Теория ИИ (необходимый минимум для понимания принципов работы ИИ)
2. Практика ИИ (как работать с ИИ, примеры решений отдельных задач)
3. Прекрасное, ужасное и глупое от ИИ
4. Есть мнение (мои комментарии на тему «жареных» новостей из мира ИИ)
5. Кейсы внедрения ИИ в бизнес
6. Тест-драйв (примеры решения задач от нескольких нейронок)
7. Спрашивали-отвечаем (ответы на ваши вопросы)

Пожалуйста, высказывайте в комментариях свои пожелания или предложения по контенту, учту обязательно со временем.
28👍12
AI_FastTrack pinned «Как и о чем я буду писать в этом канале – уточнение! На этой неделе произошло серьезное событие – я открыла канал для незнакомых людей через анонсы в соц.сетях. Задача канала не поменялась, я по-прежнему вижу ее, как описано тут. Поэтому и открыла доступ…»
Есть мнение: почему все-таки нужно платить, когда есть 400,000 бесплатных нейронок?

Есть масса библиотек бесплатных нейросетей. Видела раньше на 10, 50 тысяч нейронок… но тут Hugging Face собрали тут библиотеку из 400 (!!!) тысяч. Нейронки сгруппированы по 35 видам задач: от генерации картинок, до клонирования голоса, распознавания лиц и чтения медицинских сканов. Есть рейтинги, можно выбрать по ним или тех.параметрам (например, есть модели которые «едят» мало вычислительных мощностей и их можно поставить себе на компьютер).

Возникает закономерный вопрос: зачем платить ~20 долларов в месяц за платный ChatGPT, Gemini, Preplexity и прочих (или даже больше, писала тут, что одной моделью не обойтись), если есть 400 тыс на выбор, вкус и цвет?

Мое мнение: это как сравнивать между «магазином запчастей» и «личным автомобилем с водителем» (выражение не мое, а Gemini, но мне понравилось, берем).

Эти «бесплатные» модели, как правило:
Бесплатны только условно (есть лимиты токенов или генераций в единицу времени, далее тариф вполне платный). Также в бесплатном режиме вам придется дольше ждать, а если мощности модели перегружены, можно не дождаться.
Часть моделей пока в варианте тестирования и создатели ищут инвесторов… если не найдут, вы, скорее всего, лишитесь привычного инструмента. Также тестовые версии часто используют более дешевые, старые и менее «прожорливые» по мощностям модели. Чудес не бывает, качество результата, стабильность и количество галлюцинаций от слабой или тестовой модели вас не порадует.
В этих моделях будет плохо с памятью (крошечное контекстное окно), каждый запрос – с нуля. Вы не сможете в них автоматизировать рутинные задачи и создавать ассистентов с единым промптом.
Вам придется «скакать» между моделями (с риском потери контента), если стоит комплексная задача (например, провести исследование, сделать выводы на основании его и оформить результат в виде инфографики), тогда как мультимодальные нейронки уже много что могут сделать сами, внутри.
В бесплатные модели нельзя (или небезопасно) загружать личные или конфиденциальные файлы.

Что, все так плохо? Не совсем. Библиотека будет полезна для:
Разработчиков (можно найти полуготовые инструменты под задачу и дорабатывать).
Или если у вас есть уникальная разовая задача, которую не решают большие нейронки. Например, вам нужно: написать литературный текст на тамильском, а потом наложить его субтитрами на одно видео. Или понадобилось сгенерить разово иконки для презентации в необычном стиле. Тогда – да, вполне можно найти что-то под задачу, сделать, и забыть.
👍8