Доброй субботы. Подведем итоги недели.
На этой неделе рассматривала в основном тему галлюцинаций ИИ – почему они происходят и что можно делать для сокращения их количества. Тему не закрыли пока полностью, успела опубликовать:
✅ Теория: почему нейромодель галлюцинирует?
✅ Тест-драйв: Поиск актуальной информации в сети
✅ Теория: как бороться с галлюцинациями нейросетей?
✅ Практика: как отличить ИИ видео, иллюстрация
✅ Теория: где будет выше количество галлюцинаций?
✅ Спрашивали – отвечаем: как я разбиралась в теме ИИ
Если вы только что присоединились, добро пожаловать! Очень рекомендую просмотрите закреп, а именно:
✅ Введение: зачем мы здесь?
✅ Введение: как и о чем я буду писать в этом канале
✅ Список постов за ноябрь 2025
Посты предыдущих недель декабря можете увидеть в этих постах, в конце месяца просуммирую и выведу тоже в закреп:
Суббота 06.12
Воскресенье 14.12
На следующей неделе планирую приступить к теме промптинга, что в нем работает и почему.
На этой неделе рассматривала в основном тему галлюцинаций ИИ – почему они происходят и что можно делать для сокращения их количества. Тему не закрыли пока полностью, успела опубликовать:
✅ Теория: почему нейромодель галлюцинирует?
✅ Тест-драйв: Поиск актуальной информации в сети
✅ Теория: как бороться с галлюцинациями нейросетей?
✅ Практика: как отличить ИИ видео, иллюстрация
✅ Теория: где будет выше количество галлюцинаций?
✅ Спрашивали – отвечаем: как я разбиралась в теме ИИ
Если вы только что присоединились, добро пожаловать! Очень рекомендую просмотрите закреп, а именно:
✅ Введение: зачем мы здесь?
✅ Введение: как и о чем я буду писать в этом канале
✅ Список постов за ноябрь 2025
Посты предыдущих недель декабря можете увидеть в этих постах, в конце месяца просуммирую и выведу тоже в закреп:
Суббота 06.12
Воскресенье 14.12
На следующей неделе планирую приступить к теме промптинга, что в нем работает и почему.
Теория: что такое факт-чекинг и зачем он вообще нужен
Как вы думаете, как много людей проверяют первоисточник, методологию исследования или точные выводы, когда читают новости? Ответ: не более чем единицы–низкие десятки процентов, в зависимости от страны и контекста (новости, соцсети, ИИ‑ответы).
Более того, исследование ЮНЕСКО 2024 по блогерам и создателям прочего диджитал контента показало, что около 62–63% из них не проводят фактчекинг перед публикацией. Что ж, авторы тоже люди :)
Какой вывод: ИИ тут ни при чем, проблема значительно старше. Вот некоторые примеры типичных ошибок при подаче материала (не рассматриваю здесь "злой умысел" - целенаправленную дезинформацию, заказные материалы и прочее):
1⃣ Распространение "узкого" вывода на все возможные варианты.
Например: недавний анонс что наконец-то Google/Gemini умеет распознавать любой ИИ контент с помощью своего инструмента SynthID.
Что на самом деле: распознает контент, сгенеренный только инструментами Google по своей отметке (watermark), то-есть, контент от другой нейронки без этой отметки он не распознает. Кто-то был невнимателен.
2⃣ Выводы на базе неправильной методологии, например, нерепрезентативной или малой выборки (чем грешат многие опросы).
Например: я могу спросить в этом канале про ваше отношение к ИИ. Но могу ли я распространить эти выводы на возраст, страну или мир? Очевидно, что нет. Но многим авторам же хочется славы :)
✅ То-есть, проверять стоит любой материал, особенно «жареные» новости, всегда. Далее разберем, как строить работу по проверке материалов, выдаваемых ИИ.
Как вы думаете, как много людей проверяют первоисточник, методологию исследования или точные выводы, когда читают новости? Ответ: не более чем единицы–низкие десятки процентов, в зависимости от страны и контекста (новости, соцсети, ИИ‑ответы).
Более того, исследование ЮНЕСКО 2024 по блогерам и создателям прочего диджитал контента показало, что около 62–63% из них не проводят фактчекинг перед публикацией. Что ж, авторы тоже люди :)
Какой вывод: ИИ тут ни при чем, проблема значительно старше. Вот некоторые примеры типичных ошибок при подаче материала (не рассматриваю здесь "злой умысел" - целенаправленную дезинформацию, заказные материалы и прочее):
1⃣ Распространение "узкого" вывода на все возможные варианты.
Например: недавний анонс что наконец-то Google/Gemini умеет распознавать любой ИИ контент с помощью своего инструмента SynthID.
Что на самом деле: распознает контент, сгенеренный только инструментами Google по своей отметке (watermark), то-есть, контент от другой нейронки без этой отметки он не распознает. Кто-то был невнимателен.
2⃣ Выводы на базе неправильной методологии, например, нерепрезентативной или малой выборки (чем грешат многие опросы).
Например: я могу спросить в этом канале про ваше отношение к ИИ. Но могу ли я распространить эти выводы на возраст, страну или мир? Очевидно, что нет. Но многим авторам же хочется славы :)
✅ То-есть, проверять стоит любой материал, особенно «жареные» новости, всегда. Далее разберем, как строить работу по проверке материалов, выдаваемых ИИ.
👍5
Практика: фактчекинг и как его проводить при работе с ИИ - часть 1
Начнем с минимального алгоритма проверки (Fast-Check). Ниже также опишу пути проверки источников (которые вполне могут быть фейковыми или нерелевантными):
Подходит для написания постов в соцсети, черновиков писем, поиска идей или бытовых советов - не супер-критичных задач. Этот алгоритм занимает минуты и направлен на отсечение грубых ошибок и галлюцинаций:
1⃣ Проверка на «здравый смысл»: ищем в тексте логические противоречия (например, в начале абзаца утверждается одно, а в конце — противоположное).
2⃣ Верификация ключевых фактов: выделяем 2-3 главных факта (даты, фамилии, названия брендов), проверяем их через поисковик.
3⃣ Выявление галлюцинаций: можно сгенерировать 2–3 варианта ответа на тот же запрос и оценить согласованность. Несоответствия означают ошибки.
4⃣ Контроль ссылок: если ИИ привел ссылки или источники, перейдите по ним, прочитайте, переведите или просуммируйте (можно через ИИ ассистента в браузере - Google, Comet в Perplexity, Яндекс).
‼ Часто нейросети генерируют ссылки на реалистично выглядящие, но несуществующие источники. Как их «отсечь»:
✅ Проверка по уникальным идентификаторам – самый быстрый и надежный способ.
➡ У каждой реальной научной публикации есть DOI (Digital Object Identifier), выглядит как 10.1000/123456. Как проверить: вставьте DOI в строку поиска на сайте doi.org.
➡ Или: ISBN / ISSN - для книг и периодических изданий (в сервисе типа WorldCat или базе данных ISBN Search)
➡ Или: PMID (PubMed ID), для медицинских и биологических статей (в строке поиска PubMed).
✅ Поиск в специализированных библиотеках и агрегаторах - если нейросеть дала только название и авторов, ищем их в «белых списках» научной литературы
➡ Например: Google Scholar. Если статьи нет здесь, с вероятностью 99% она не существует.
➡ Или: eLibrary / РИНЦ - для русскоязычных научных работ.
✅ Контентный анализ - присматриваемся к деталям, которые часто выдают галлюцинацию:
➡ «Слишком точное» название: нейросети часто генерируют названия статей, идеально отвечающие на ваш запрос. Реальные названия научных статей обычно более «занудны» и специфичны.
➡ Несуществующие журналы: ИИ может придумать журнал вроде «Journal of Advanced AI Ethics and Global Science». Проверяем поиском.
✅ Проверка текста статьи: что печально, наличие pdf файла уже более не является гарантией подлинности этой статьи, вы можете «попасть» на deepfake. Что делать:
➡ Статья считается реальной, если она размещена на домене издательства или университета. Например: если PDF лежит на nature.com или arxiv.org — это оригинал. А если на случайном файлообменнике или «мусорном» сайте без истории – подделка.
➡ Можно сделать поиск по цитатам – взять два-три предложения из середины PDF (не заголовки!) и вставить их (в кавычках) в Google. Если статья реальная, поиск выдаст ссылки на репозитории (ResearchGate, Academia.edu, сайты университетов).
Начнем с минимального алгоритма проверки (Fast-Check). Ниже также опишу пути проверки источников (которые вполне могут быть фейковыми или нерелевантными):
Подходит для написания постов в соцсети, черновиков писем, поиска идей или бытовых советов - не супер-критичных задач. Этот алгоритм занимает минуты и направлен на отсечение грубых ошибок и галлюцинаций:
1⃣ Проверка на «здравый смысл»: ищем в тексте логические противоречия (например, в начале абзаца утверждается одно, а в конце — противоположное).
2⃣ Верификация ключевых фактов: выделяем 2-3 главных факта (даты, фамилии, названия брендов), проверяем их через поисковик.
3⃣ Выявление галлюцинаций: можно сгенерировать 2–3 варианта ответа на тот же запрос и оценить согласованность. Несоответствия означают ошибки.
4⃣ Контроль ссылок: если ИИ привел ссылки или источники, перейдите по ним, прочитайте, переведите или просуммируйте (можно через ИИ ассистента в браузере - Google, Comet в Perplexity, Яндекс).
‼ Часто нейросети генерируют ссылки на реалистично выглядящие, но несуществующие источники. Как их «отсечь»:
✅ Проверка по уникальным идентификаторам – самый быстрый и надежный способ.
➡ У каждой реальной научной публикации есть DOI (Digital Object Identifier), выглядит как 10.1000/123456. Как проверить: вставьте DOI в строку поиска на сайте doi.org.
➡ Или: ISBN / ISSN - для книг и периодических изданий (в сервисе типа WorldCat или базе данных ISBN Search)
➡ Или: PMID (PubMed ID), для медицинских и биологических статей (в строке поиска PubMed).
✅ Поиск в специализированных библиотеках и агрегаторах - если нейросеть дала только название и авторов, ищем их в «белых списках» научной литературы
➡ Например: Google Scholar. Если статьи нет здесь, с вероятностью 99% она не существует.
➡ Или: eLibrary / РИНЦ - для русскоязычных научных работ.
✅ Контентный анализ - присматриваемся к деталям, которые часто выдают галлюцинацию:
➡ «Слишком точное» название: нейросети часто генерируют названия статей, идеально отвечающие на ваш запрос. Реальные названия научных статей обычно более «занудны» и специфичны.
➡ Несуществующие журналы: ИИ может придумать журнал вроде «Journal of Advanced AI Ethics and Global Science». Проверяем поиском.
✅ Проверка текста статьи: что печально, наличие pdf файла уже более не является гарантией подлинности этой статьи, вы можете «попасть» на deepfake. Что делать:
➡ Статья считается реальной, если она размещена на домене издательства или университета. Например: если PDF лежит на nature.com или arxiv.org — это оригинал. А если на случайном файлообменнике или «мусорном» сайте без истории – подделка.
➡ Можно сделать поиск по цитатам – взять два-три предложения из середины PDF (не заголовки!) и вставить их (в кавычках) в Google. Если статья реальная, поиск выдаст ссылки на репозитории (ResearchGate, Academia.edu, сайты университетов).
Nature
Nature is the foremost international weekly scientific journal in the world and is the flagship journal for Nature Portfolio. It publishes the finest ...
👍6❤1
Практика: фактчекинг и как его проводить при работе с ИИ – часть 2
Теперь рассмотрим максимальный алгоритм проверки (Deep Audit). Он нужен для медицинских, юридических, технических текстов, бизнес-отчетов и научных публикаций. Там, где ошибки недопустимы или есть реальные репутационные/финансовые риски (привет, Deloitte, тут рассказывала 😂). Такой аудит может занять нескольких часов, проводится поэтапно и вовлекает другие нейронки.
✅ Этап 1: Деконструкция: разбиваем текст на отдельные критичные для выводов утверждения. Каждое предложение, содержащее факт, цифру или причинно-следственную связь, проверяем отдельно.
✅ Этап 2: Тройная верификация (Triangulation). Для каждого ключевого утверждения находим подтверждение в трех независимых авторитетных источниках (официальная документация или законы, научные статьи, крупные новостные агрегаторы или профильные энциклопедии).
✅ Этап 3: Проверка цитат и источников.
Детально разобрала проверку источников выше. Если в статье цитируется человек, проверьте, говорил ли он это на самом деле (поиск по точной фразе в кавычках).
✅ Этап 4: «Перекрестный допрос» и целевые вопросы (в той же нейронке).
Варианты запросов: "Перечисли ВСЕ исключения из правила X" "А есть ли ещё случаи, когда это не применяется?" "Найди в документах противоречия моему выводу" или "Какие риски я мог упустить?" Важно: по сути, просим ИИ специально искать то, что опровергает полученные выводы, это часто вытаскивает пропущенные нюансы и повышает объективность.
✅ Этап 4: Мультимодельная проверка - загружаем тот же промпт в другие модели, сравниваем выводы.
✅ Этап 5: «Перекрестный допрос» с другими нейросетями: загружаем уже готовый ответ с промптом:
«Ниже приведен текст. Найди в нем фактические ошибки, логические несостыковки и галлюцинации. Укажи, что именно вызывает сомнения и почему».
✅ Этап 6: Проверка актуальности (для вопросов, где критично знание самых последних новостей и релизов) - гигиеническая проверка в свежих источниках. Бывает, что модель отвечает на своей базе данных и упускает новости последних недель-месяцев.
‼ Отдельно остановлюсь на проблеме "тихих пропусков" (silent omissions) — это ключевая проблема всех LLM, особенно критичная для юридической и академической работы. Это когда система не галлюцинирует, не придумывает, чего не было... а просто молча игнорирует ключевой пункт или нюанс из загруженных документов — это гораздо опаснее явных ошибок и сложнее выявить. Что помогает из вышеперечисленного:
➡ Перекрёстный допрос и целевые вопросы
➡ Мультимодельная проверка и перекрестный допрос с другими нейронками
➡ Дополнительно, рассматриваем разбивку документов на группы по 5-10 для детального анализа и сравнения выводов
Сложновато? Извините, по другому - никак. Не проверил - рискнул репутацией и деньгами 😉
Теперь рассмотрим максимальный алгоритм проверки (Deep Audit). Он нужен для медицинских, юридических, технических текстов, бизнес-отчетов и научных публикаций. Там, где ошибки недопустимы или есть реальные репутационные/финансовые риски (привет, Deloitte, тут рассказывала 😂). Такой аудит может занять нескольких часов, проводится поэтапно и вовлекает другие нейронки.
✅ Этап 1: Деконструкция: разбиваем текст на отдельные критичные для выводов утверждения. Каждое предложение, содержащее факт, цифру или причинно-следственную связь, проверяем отдельно.
✅ Этап 2: Тройная верификация (Triangulation). Для каждого ключевого утверждения находим подтверждение в трех независимых авторитетных источниках (официальная документация или законы, научные статьи, крупные новостные агрегаторы или профильные энциклопедии).
✅ Этап 3: Проверка цитат и источников.
Детально разобрала проверку источников выше. Если в статье цитируется человек, проверьте, говорил ли он это на самом деле (поиск по точной фразе в кавычках).
✅ Этап 4: «Перекрестный допрос» и целевые вопросы (в той же нейронке).
Варианты запросов: "Перечисли ВСЕ исключения из правила X" "А есть ли ещё случаи, когда это не применяется?" "Найди в документах противоречия моему выводу" или "Какие риски я мог упустить?" Важно: по сути, просим ИИ специально искать то, что опровергает полученные выводы, это часто вытаскивает пропущенные нюансы и повышает объективность.
✅ Этап 4: Мультимодельная проверка - загружаем тот же промпт в другие модели, сравниваем выводы.
✅ Этап 5: «Перекрестный допрос» с другими нейросетями: загружаем уже готовый ответ с промптом:
«Ниже приведен текст. Найди в нем фактические ошибки, логические несостыковки и галлюцинации. Укажи, что именно вызывает сомнения и почему».
✅ Этап 6: Проверка актуальности (для вопросов, где критично знание самых последних новостей и релизов) - гигиеническая проверка в свежих источниках. Бывает, что модель отвечает на своей базе данных и упускает новости последних недель-месяцев.
‼ Отдельно остановлюсь на проблеме "тихих пропусков" (silent omissions) — это ключевая проблема всех LLM, особенно критичная для юридической и академической работы. Это когда система не галлюцинирует, не придумывает, чего не было... а просто молча игнорирует ключевой пункт или нюанс из загруженных документов — это гораздо опаснее явных ошибок и сложнее выявить. Что помогает из вышеперечисленного:
➡ Перекрёстный допрос и целевые вопросы
➡ Мультимодельная проверка и перекрестный допрос с другими нейронками
➡ Дополнительно, рассматриваем разбивку документов на группы по 5-10 для детального анализа и сравнения выводов
Сложновато? Извините, по другому - никак. Не проверил - рискнул репутацией и деньгами 😉
❤9🔥3
AI_FastTrack pinned «Доброй субботы. Подведем итоги недели. На этой неделе рассматривала в основном тему галлюцинаций ИИ – почему они происходят и что можно делать для сокращения их количества. Тему не закрыли пока полностью, успела опубликовать: ✅ Теория: почему нейромодель…»
Интересное - ИИ в физическом мире
Разбавлю, пожалуй, сложные инструкции такой вот темой. Вы знали, что Китай – мировой лидер по числу промышленных роботов: в стране их более 2 млн, а за последний год их установили в 9 раз больше, чем в США? То-есть США фокусируются на фундаментальной науке с Genesis программой (напишу еще об этом). Китаю это сложновато, в условиях дефицита передовых ИИ чипов (GPU), но они давно стали мировой фабрикой и успешно используют автоматизацию для ухода «в отрыв».
Также они активно тестируют роботов для других задач, например, на конкурсе в Гонконге ATEC 2025 роботы пытались выполнить обычные задачи на открытом воздухе. Что получилось? Падения, сбои и возвращение к пульту дистанционного управления!!! И мы же помним смех по повод упадения первого российского человекоподобного робота с ИИ Aidol? Фото положу в следующем посте 😉.
Падают пока все ИИ роботы. И вот тут интересно, почему, и китайцы подробно разобрали причины после своих «состязаний»:
1⃣ «Детский» интеллект ИИ: любая задача в реальном мире - это длинная цепочка действий. Чтобы полить цветок, нужно: найти лейку - взять её - открыть кран - наполнить - закрыть кран - найти цветок - полить - вернуть лейку. При малейшем сбое (лейка застряла), робот не может выполнить корректирующее действие вне алгоритма самостоятельно (писала еще тут).
2⃣ Нулевое осязание: у роботов нет полноценной тактильной обратной связи. Человек, беря стакан, чувствует его вес, а если он еще мокрый и скользкий – возьмет его крепче. Робот же действует вслепую, что делает хрупкие или деформируемые предметы для него кошмаром. Также любая выбоина на полу, прогиб доски, могут стать фатальными и робот упадет.
3⃣ «Слепота» в реальном мире: солнечный свет ослепляет камеры робота, прозрачная бутылка становится невидимой, робот тянется к ней и промахивается или роняет ее. А при передвижении по подвесному мосту робот пытался «встать» на воздух.
Что, все так плохо? Вроде были и удачные решения. Две команды с четвероногими (!) роботами без вмешательства оператора прошли испытания с сортировкой мусора и пересечением подвесного моста. Но. Они фактически отказались от ИИ (как LLM) в пользу проверенного компьютерного зрения. А еще они заранее обучили робота на симуляции, максимально учитывающей все возможные проблемы (свет, колебания подвесного моста). То-есть, если бы симуляция была менее точной или что-то бы пошло не так, робот гарантированно бы рухнул, как на фото.
Так что, до полностью автономных самообучающихся домашних роботов нам еще очень и очень далеко 😊
Разбавлю, пожалуй, сложные инструкции такой вот темой. Вы знали, что Китай – мировой лидер по числу промышленных роботов: в стране их более 2 млн, а за последний год их установили в 9 раз больше, чем в США? То-есть США фокусируются на фундаментальной науке с Genesis программой (напишу еще об этом). Китаю это сложновато, в условиях дефицита передовых ИИ чипов (GPU), но они давно стали мировой фабрикой и успешно используют автоматизацию для ухода «в отрыв».
Также они активно тестируют роботов для других задач, например, на конкурсе в Гонконге ATEC 2025 роботы пытались выполнить обычные задачи на открытом воздухе. Что получилось? Падения, сбои и возвращение к пульту дистанционного управления!!! И мы же помним смех по повод упадения первого российского человекоподобного робота с ИИ Aidol? Фото положу в следующем посте 😉.
Падают пока все ИИ роботы. И вот тут интересно, почему, и китайцы подробно разобрали причины после своих «состязаний»:
1⃣ «Детский» интеллект ИИ: любая задача в реальном мире - это длинная цепочка действий. Чтобы полить цветок, нужно: найти лейку - взять её - открыть кран - наполнить - закрыть кран - найти цветок - полить - вернуть лейку. При малейшем сбое (лейка застряла), робот не может выполнить корректирующее действие вне алгоритма самостоятельно (писала еще тут).
2⃣ Нулевое осязание: у роботов нет полноценной тактильной обратной связи. Человек, беря стакан, чувствует его вес, а если он еще мокрый и скользкий – возьмет его крепче. Робот же действует вслепую, что делает хрупкие или деформируемые предметы для него кошмаром. Также любая выбоина на полу, прогиб доски, могут стать фатальными и робот упадет.
3⃣ «Слепота» в реальном мире: солнечный свет ослепляет камеры робота, прозрачная бутылка становится невидимой, робот тянется к ней и промахивается или роняет ее. А при передвижении по подвесному мосту робот пытался «встать» на воздух.
Что, все так плохо? Вроде были и удачные решения. Две команды с четвероногими (!) роботами без вмешательства оператора прошли испытания с сортировкой мусора и пересечением подвесного моста. Но. Они фактически отказались от ИИ (как LLM) в пользу проверенного компьютерного зрения. А еще они заранее обучили робота на симуляции, максимально учитывающей все возможные проблемы (свет, колебания подвесного моста). То-есть, если бы симуляция была менее точной или что-то бы пошло не так, робот гарантированно бы рухнул, как на фото.
Так что, до полностью автономных самообучающихся домашних роботов нам еще очень и очень далеко 😊
❤5👍3
Доброго дня. Вы только что присоединились?
Добро пожаловать! В канале набралось уже достаточное количество постов по вопросам теории и практики ИИ. Если вам интересно подойти к вопросу систематически, рекомендую начать с самого начала 😉
Конечно, можно просмотреть только интересующие вас посты, начните с закрепа, а именно:
✅ Введение: зачем мы здесь?
✅ Введение: как и о чем я буду писать в этом канале
✅ Список постов за ноябрь 2025
✅ Доброй субботы. Подведем итоги недели - 20.12
По итогам декабря я также сделаю полный список всех постов за месяц. И собираю ваши пожелания по темам, обязательно доберемся!
Добро пожаловать! В канале набралось уже достаточное количество постов по вопросам теории и практики ИИ. Если вам интересно подойти к вопросу систематически, рекомендую начать с самого начала 😉
Конечно, можно просмотреть только интересующие вас посты, начните с закрепа, а именно:
✅ Введение: зачем мы здесь?
✅ Введение: как и о чем я буду писать в этом канале
✅ Список постов за ноябрь 2025
✅ Доброй субботы. Подведем итоги недели - 20.12
По итогам декабря я также сделаю полный список всех постов за месяц. И собираю ваши пожелания по темам, обязательно доберемся!
👍23❤6🙏3
Есть мнение: переоценена ли значимость ролевого промпта?
Пока еще не готова поделиться с вами полной инструкцией про промпты (при подготовки материала, наткнулась на одну любопытную вещь... скоро расскажу 😉). Но прочитала тут, что исследователи из Пенсильванского университета решили проверить, работает ли назначение роли в промпте "Веди себя как эксперт по..." для повышения точности ответа. Вывод автора поста был, что такое назначение роли (или ролевой промпт) работает для изменения тона или стиля ответа, но бесполезен для повышения фактической точности. Цитата: «Железка умнее от ваших ролевых игр не становится». Видела этот вывод во многих каналах и новостях.
На самом деле: не совсем так. Как обычно, пошла изучать само исследование ))). Статья от 12.12.25 об эксперименте, где тестировали шесть моделей на вопросах уровня аспирантуры по наукам, технике и праву в трех ситуациях:
1⃣ Базовый вариант: без назначенной роли, только вопрос и варианты ответа плюс краткая инструкция по формату ответа.
2⃣ Экспертные роли: «мирового уровня эксперт» в физике, математике, экономике, биологии, химии, праве, инженерии, истории и пр. Часть из экспертов совпадали по профилю с вопросом, часть – нет (когда эксперту по физике задавали вопрос по праву - ха).
3⃣ Низкокомпетентные роли: «обычный человек», «маленький ребёнок», «четырёхлетний ребёнок, думающий, что Луна из сыра» (дословно :).
Результат: в большинстве случаев любая роль (включая правильного эксперта) даёт статистически неотличимую от базовой точность. Этот (средняя температура по больнице) вывод и вошел в новости. Однако:
✅ Низкокомпетентные роли снижают точность, особенно сильно в ситуации с «малышом».
✅ Были локальные исключения: Gemini 2.0 Flash получила умеренные выигрыши от всех экспертных ролей в инженерии и химии, а GPT 4o был лучше в праве с юристом-профи. Был сделан вывод, что эти улучшения выглядят как специфичные для модели и задачи, а не универсальные.
✅ Из любопытного, у части Gemini моделей нерелевантные эксперты приводили к отказам отвечать (модель «не может по совести ответить вне своей области» 😊). Молодец!
То-есть, все-таки в ряде случаев роль влияла на точность, и мы не можем предсказать, как будет реагировать конкретная модель, учитывая еще и ограничения эксперимента (тестировался лимирированный набор моделей и ролей, академические бенчмарки, а не реальные задачи).
Сами авторы говорят о том, что необходимо прорабатывать детальные, специфичные для задачи промпты, просто добавлять «эксперта по X» в системный промпт недостаточно. С этим уже я полностью согласна.
Пока еще не готова поделиться с вами полной инструкцией про промпты (при подготовки материала, наткнулась на одну любопытную вещь... скоро расскажу 😉). Но прочитала тут, что исследователи из Пенсильванского университета решили проверить, работает ли назначение роли в промпте "Веди себя как эксперт по..." для повышения точности ответа. Вывод автора поста был, что такое назначение роли (или ролевой промпт) работает для изменения тона или стиля ответа, но бесполезен для повышения фактической точности. Цитата: «Железка умнее от ваших ролевых игр не становится». Видела этот вывод во многих каналах и новостях.
На самом деле: не совсем так. Как обычно, пошла изучать само исследование ))). Статья от 12.12.25 об эксперименте, где тестировали шесть моделей на вопросах уровня аспирантуры по наукам, технике и праву в трех ситуациях:
1⃣ Базовый вариант: без назначенной роли, только вопрос и варианты ответа плюс краткая инструкция по формату ответа.
2⃣ Экспертные роли: «мирового уровня эксперт» в физике, математике, экономике, биологии, химии, праве, инженерии, истории и пр. Часть из экспертов совпадали по профилю с вопросом, часть – нет (когда эксперту по физике задавали вопрос по праву - ха).
3⃣ Низкокомпетентные роли: «обычный человек», «маленький ребёнок», «четырёхлетний ребёнок, думающий, что Луна из сыра» (дословно :).
Результат: в большинстве случаев любая роль (включая правильного эксперта) даёт статистически неотличимую от базовой точность. Этот (
✅ Низкокомпетентные роли снижают точность, особенно сильно в ситуации с «малышом».
✅ Были локальные исключения: Gemini 2.0 Flash получила умеренные выигрыши от всех экспертных ролей в инженерии и химии, а GPT 4o был лучше в праве с юристом-профи. Был сделан вывод, что эти улучшения выглядят как специфичные для модели и задачи, а не универсальные.
✅ Из любопытного, у части Gemini моделей нерелевантные эксперты приводили к отказам отвечать (модель «не может по совести ответить вне своей области» 😊). Молодец!
То-есть, все-таки в ряде случаев роль влияла на точность, и мы не можем предсказать, как будет реагировать конкретная модель, учитывая еще и ограничения эксперимента (тестировался лимирированный набор моделей и ролей, академические бенчмарки, а не реальные задачи).
Сами авторы говорят о том, что необходимо прорабатывать детальные, специфичные для задачи промпты, просто добавлять «эксперта по X» в системный промпт недостаточно. С этим уже я полностью согласна.
❤2👍1
Государственныепрограммы поддержки – США vs Китай.
В конце ноября Трамп подписал указ о запуске Genesis Mission — национальной программы по ускорению научных открытий через AI. Это крупнейшая мобилизация федеральных научных ресурсов со времён программы Apollo.17 национальных лабораторий объединяют свои суперкомпьютеры, научные данные и модели в единую платформу для AI-экспериментов. Обещают сократить время открытий с лет до дней или даже часов. Приоритеты: биотехнологии, критические материалы, ядерная энергия, космос, квантовые вычисления, полупроводники, проекты по нацбезопасности.
Genesis строится на партнёрствах с частным сектором, Nvidia, Dell, Oracle и Anthropic уже объявили об участии. Компании будут финансировать строительство дата-центров на государственной земле, а национальные лаборатории дадут вычислительные мощности и данные. Пока что есть скепсис у специалистов – не понятны конкретные схемы взаимодействия и бюджетирование. Подождем - увидим 😉.
Genesis — прямой ответ Китаю. У КНР есть своя версия — Национальная интегрированная сеть вычислительных мощностей, которую координирует государственная лаборатория Peng Cheng. Но проблема Китая — он контролирует около 15% глобальных AI-мощностей, США — 75%. Экспортные ограничения на чипы Nvidia сильно бьют по китайским разработчикам, Huawei пытается компенсировать своими разработками, но он отстаёт.
Зато, как уже писала тут, Китай решил «упереться» в уровень автоматизации и использования ИИ в промышленности. Еще в до-ИИ времена времена страна умела построить и произвести почти что угодно в нереальные для конкурентов сроки, а с новым уровнем автоматизации отрыв может стать недостижимым для остальных. Несколько примеров:
✅ На заводах бытовой техники Midea уже сейчас используют так называемый factory brain – ИИ-систему, которая контролирует все процессы, от логистики до управления роботами и сотрудниками.
✅ В одном из крупнейших в стране портов Тяньцзинь контейнеры по пирсу возят грузовики-беспилотники, краны управляются дистанционно, а разработанная Huawei система постоянно крутит “цифровую копию” порта, моделируя разные маршруты движения грузов и кораблей и выбирая лучший. Планирование, которое раньше занимало сутки, теперь делается за десятки минут, а количество персонала удалось сократить на 60% (!) при выросшем грузопотоке.
Это не значит, что в Штатах не работают над промышленным ИИ и автоматизацией – но, похоже, они считают, что это должно быть следующий этап, а пока – нужно «оторваться» в науке должна быть наука.
В конце ноября Трамп подписал указ о запуске Genesis Mission — национальной программы по ускорению научных открытий через AI. Это крупнейшая мобилизация федеральных научных ресурсов со времён программы Apollo.17 национальных лабораторий объединяют свои суперкомпьютеры, научные данные и модели в единую платформу для AI-экспериментов. Обещают сократить время открытий с лет до дней или даже часов. Приоритеты: биотехнологии, критические материалы, ядерная энергия, космос, квантовые вычисления, полупроводники, проекты по нацбезопасности.
Genesis строится на партнёрствах с частным сектором, Nvidia, Dell, Oracle и Anthropic уже объявили об участии. Компании будут финансировать строительство дата-центров на государственной земле, а национальные лаборатории дадут вычислительные мощности и данные. Пока что есть скепсис у специалистов – не понятны конкретные схемы взаимодействия и бюджетирование. Подождем - увидим 😉.
Genesis — прямой ответ Китаю. У КНР есть своя версия — Национальная интегрированная сеть вычислительных мощностей, которую координирует государственная лаборатория Peng Cheng. Но проблема Китая — он контролирует около 15% глобальных AI-мощностей, США — 75%. Экспортные ограничения на чипы Nvidia сильно бьют по китайским разработчикам, Huawei пытается компенсировать своими разработками, но он отстаёт.
Зато, как уже писала тут, Китай решил «упереться» в уровень автоматизации и использования ИИ в промышленности. Еще в до-ИИ времена времена страна умела построить и произвести почти что угодно в нереальные для конкурентов сроки, а с новым уровнем автоматизации отрыв может стать недостижимым для остальных. Несколько примеров:
✅ На заводах бытовой техники Midea уже сейчас используют так называемый factory brain – ИИ-систему, которая контролирует все процессы, от логистики до управления роботами и сотрудниками.
✅ В одном из крупнейших в стране портов Тяньцзинь контейнеры по пирсу возят грузовики-беспилотники, краны управляются дистанционно, а разработанная Huawei система постоянно крутит “цифровую копию” порта, моделируя разные маршруты движения грузов и кораблей и выбирая лучший. Планирование, которое раньше занимало сутки, теперь делается за десятки минут, а количество персонала удалось сократить на 60% (!) при выросшем грузопотоке.
Это не значит, что в Штатах не работают над промышленным ИИ и автоматизацией – но, похоже, они считают, что это должно быть следующий этап, а пока – нужно «оторваться» в науке должна быть наука.
❤8👍2
Как и о чем я буду писать в этом канале – уточнение!
На этой неделе произошло серьезное событие – я открыла канал для незнакомых людей через анонсы в соц.сетях. Задача канала не поменялась, я по-прежнему вижу ее, как описано тут. Поэтому и открыла доступ – на более широкой группе вероятнее общение и обмен опытом, а не монолог автора.
Что хотелось бы добавить (и напомнить))):
✅ Канал есть и будет некоммерческим, я не веду тренингов по теме ИИ и не принимаю рекламу для размещения в канале (если вы ее видите – это реклама от ТГ).
✅ Почему тогда я это делаю: кто-то с возрастом пишет мемуары или стихи… мне тоже захотелось делиться мыслями, пробую такой формат, он мне ближе. Также считаю, что без новых знаний можно зачахнуть, осваиваю ИИ навыки для профилактики здравого ума.
✅ Канал – это хобби. Пишу посты в свободное от работы и семьи время. Поэтому прошу вас отнестись с пониманием к тому, что публикации выходят не каждый день, а темы я буду раскрывать в соответствии со своими приоритетами. Ваши пожелания сохраняю и, безусловно, до них доберемся (все они были интересными и релевантными для меня, например, ИИ для изучения языков и путешествий).
✅ Посты я пишу сама. Статистика, факты и объяснения терминологии, конечно, собираются через ИИ (обычно в 3-5 нейронках, с факт-чекингом). Форматирование "чтобы красиво" тоже делаю сама (годы корпоративных презентаций сказываются 😜).
✅ Писать буду длинные посты: хочу фокусироваться на разборе «почему так работает», а не на простых готовых рецептах «вот вам промпт на все случаи жизни». Мое глубокое убеждение – только разбор причин и понимание возможностей и ограничений ИИ поможет выстроить работу с ним долгосрочно и правильно. Без понимания нет результата.
Планирую посты по следующим разделам:
1. Теория ИИ (необходимый минимум для понимания принципов работы ИИ)
2. Практика ИИ (как работать с ИИ, примеры решений отдельных задач)
3. Прекрасное, ужасное и глупое от ИИ
4. Есть мнение (мои комментарии на тему «жареных» новостей из мира ИИ)
5. Кейсы внедрения ИИ в бизнес
6. Тест-драйв (примеры решения задач от нескольких нейронок)
7. Спрашивали-отвечаем (ответы на ваши вопросы)
Пожалуйста, высказывайте в комментариях свои пожелания или предложения по контенту, учту обязательно со временем.
На этой неделе произошло серьезное событие – я открыла канал для незнакомых людей через анонсы в соц.сетях. Задача канала не поменялась, я по-прежнему вижу ее, как описано тут. Поэтому и открыла доступ – на более широкой группе вероятнее общение и обмен опытом, а не монолог автора.
Что хотелось бы добавить (и напомнить))):
✅ Канал есть и будет некоммерческим, я не веду тренингов по теме ИИ и не принимаю рекламу для размещения в канале (если вы ее видите – это реклама от ТГ).
✅ Почему тогда я это делаю: кто-то с возрастом пишет мемуары или стихи… мне тоже захотелось делиться мыслями, пробую такой формат, он мне ближе. Также считаю, что без новых знаний можно зачахнуть, осваиваю ИИ навыки для профилактики здравого ума.
✅ Канал – это хобби. Пишу посты в свободное от работы и семьи время. Поэтому прошу вас отнестись с пониманием к тому, что публикации выходят не каждый день, а темы я буду раскрывать в соответствии со своими приоритетами. Ваши пожелания сохраняю и, безусловно, до них доберемся (все они были интересными и релевантными для меня, например, ИИ для изучения языков и путешествий).
✅ Посты я пишу сама. Статистика, факты и объяснения терминологии, конечно, собираются через ИИ (обычно в 3-5 нейронках, с факт-чекингом). Форматирование "чтобы красиво" тоже делаю сама (годы корпоративных презентаций сказываются 😜).
✅ Писать буду длинные посты: хочу фокусироваться на разборе «почему так работает», а не на простых готовых рецептах «вот вам промпт на все случаи жизни». Мое глубокое убеждение – только разбор причин и понимание возможностей и ограничений ИИ поможет выстроить работу с ним долгосрочно и правильно. Без понимания нет результата.
Планирую посты по следующим разделам:
1. Теория ИИ (необходимый минимум для понимания принципов работы ИИ)
2. Практика ИИ (как работать с ИИ, примеры решений отдельных задач)
3. Прекрасное, ужасное и глупое от ИИ
4. Есть мнение (мои комментарии на тему «жареных» новостей из мира ИИ)
5. Кейсы внедрения ИИ в бизнес
6. Тест-драйв (примеры решения задач от нескольких нейронок)
7. Спрашивали-отвечаем (ответы на ваши вопросы)
Пожалуйста, высказывайте в комментариях свои пожелания или предложения по контенту, учту обязательно со временем.
❤28👍12
AI_FastTrack pinned «Как и о чем я буду писать в этом канале – уточнение! На этой неделе произошло серьезное событие – я открыла канал для незнакомых людей через анонсы в соц.сетях. Задача канала не поменялась, я по-прежнему вижу ее, как описано тут. Поэтому и открыла доступ…»
Есть мнение: почему все-таки нужно платить, когда есть 400,000 бесплатных нейронок?
Есть масса библиотек бесплатных нейросетей. Видела раньше на 10, 50 тысяч нейронок… но тут Hugging Face собрали тут библиотеку из 400 (!!!) тысяч. Нейронки сгруппированы по 35 видам задач: от генерации картинок, до клонирования голоса, распознавания лиц и чтения медицинских сканов. Есть рейтинги, можно выбрать по ним или тех.параметрам (например, есть модели которые «едят» мало вычислительных мощностей и их можно поставить себе на компьютер).
Возникает закономерный вопрос: зачем платить ~20 долларов в месяц за платный ChatGPT, Gemini, Preplexity и прочих (или даже больше, писала тут, что одной моделью не обойтись), если есть 400 тыс на выбор, вкус и цвет?
Мое мнение: это как сравнивать между «магазином запчастей» и «личным автомобилем с водителем» (выражение не мое, а Gemini, но мне понравилось, берем).
Эти «бесплатные» модели, как правило:
❌ Бесплатны только условно (есть лимиты токенов или генераций в единицу времени, далее тариф вполне платный). Также в бесплатном режиме вам придется дольше ждать, а если мощности модели перегружены, можно не дождаться.
❌ Часть моделей пока в варианте тестирования и создатели ищут инвесторов… если не найдут, вы, скорее всего, лишитесь привычного инструмента. Также тестовые версии часто используют более дешевые, старые и менее «прожорливые» по мощностям модели. Чудес не бывает, качество результата, стабильность и количество галлюцинаций от слабой или тестовой модели вас не порадует.
❌ В этих моделях будет плохо с памятью (крошечное контекстное окно), каждый запрос – с нуля. Вы не сможете в них автоматизировать рутинные задачи и создавать ассистентов с единым промптом.
❌ Вам придется «скакать» между моделями (с риском потери контента), если стоит комплексная задача (например, провести исследование, сделать выводы на основании его и оформить результат в виде инфографики), тогда как мультимодальные нейронки уже много что могут сделать сами, внутри.
❌ В бесплатные модели нельзя (или небезопасно) загружать личные или конфиденциальные файлы.
Что, все так плохо? Не совсем. Библиотека будет полезна для:
✅ Разработчиков (можно найти полуготовые инструменты под задачу и дорабатывать).
✅ Или если у вас есть уникальная разовая задача, которую не решают большие нейронки. Например, вам нужно: написать литературный текст на тамильском, а потом наложить его субтитрами на одно видео. Или понадобилось сгенерить разово иконки для презентации в необычном стиле. Тогда – да, вполне можно найти что-то под задачу, сделать, и забыть.
Есть масса библиотек бесплатных нейросетей. Видела раньше на 10, 50 тысяч нейронок… но тут Hugging Face собрали тут библиотеку из 400 (!!!) тысяч. Нейронки сгруппированы по 35 видам задач: от генерации картинок, до клонирования голоса, распознавания лиц и чтения медицинских сканов. Есть рейтинги, можно выбрать по ним или тех.параметрам (например, есть модели которые «едят» мало вычислительных мощностей и их можно поставить себе на компьютер).
Возникает закономерный вопрос: зачем платить ~20 долларов в месяц за платный ChatGPT, Gemini, Preplexity и прочих (или даже больше, писала тут, что одной моделью не обойтись), если есть 400 тыс на выбор, вкус и цвет?
Мое мнение: это как сравнивать между «магазином запчастей» и «личным автомобилем с водителем» (выражение не мое, а Gemini, но мне понравилось, берем).
Эти «бесплатные» модели, как правило:
❌ Бесплатны только условно (есть лимиты токенов или генераций в единицу времени, далее тариф вполне платный). Также в бесплатном режиме вам придется дольше ждать, а если мощности модели перегружены, можно не дождаться.
❌ Часть моделей пока в варианте тестирования и создатели ищут инвесторов… если не найдут, вы, скорее всего, лишитесь привычного инструмента. Также тестовые версии часто используют более дешевые, старые и менее «прожорливые» по мощностям модели. Чудес не бывает, качество результата, стабильность и количество галлюцинаций от слабой или тестовой модели вас не порадует.
❌ В этих моделях будет плохо с памятью (крошечное контекстное окно), каждый запрос – с нуля. Вы не сможете в них автоматизировать рутинные задачи и создавать ассистентов с единым промптом.
❌ Вам придется «скакать» между моделями (с риском потери контента), если стоит комплексная задача (например, провести исследование, сделать выводы на основании его и оформить результат в виде инфографики), тогда как мультимодальные нейронки уже много что могут сделать сами, внутри.
❌ В бесплатные модели нельзя (или небезопасно) загружать личные или конфиденциальные файлы.
Что, все так плохо? Не совсем. Библиотека будет полезна для:
✅ Разработчиков (можно найти полуготовые инструменты под задачу и дорабатывать).
✅ Или если у вас есть уникальная разовая задача, которую не решают большие нейронки. Например, вам нужно: написать литературный текст на тамильском, а потом наложить его субтитрами на одно видео. Или понадобилось сгенерить разово иконки для презентации в необычном стиле. Тогда – да, вполне можно найти что-то под задачу, сделать, и забыть.
👍8
Тест драйв: разбираем пример «обратного промптинга» в генерации НГ открытки.
Я взяла открытку из сети, слегка поиграла с фоном и надписью (изменения делала в Perplexity). Далее загрузила и попросила Gemini и Perplexity сделать на ее основе промпт для генерации изображений. Важно: лучше говорить не «сделай» (может пойти генерить картинку :), а «опиши»:
Полученный от ИИ промпт загружаем в несколько нейронок (лучше для генерации изображений делать на английском,особенно тех.детали):
Важно:
✅ Нейросети по-прежнему нестабильны в буквах. Если надпись на английском получилась криво, попробуйте добавить в конце промпта: --no typos или просто перегенерируйте – есть надежда. Если на русском – пробуем (некоторые справились) ИЛИ генерировать без текста, а потом наложить его в редакторе изображений.
✅ Соотношение сторон: в некоторых нейронках (Qwen, Midjourney) вертикальный формат нужно выбирать в настройках (сейчас он в начале промпта указан)
Далее выложу собственно картинки, ключевые выводы из теста:
1⃣ Один и тот же промпт дает принципиально разные результаты в разных нейронках. Если нужны вариации - это хорошо.
2⃣ Чужие генераторы изображений в мультимодальных нейронках (Perplexity) - слабее своих полных на основных платформах (Nanobanana/Google, GPT).
3⃣ Как писала выше, сочетание хорошей картинки и правильно надписи может не получиться в одной нейронке.
Я взяла открытку из сети, слегка поиграла с фоном и надписью (изменения делала в Perplexity). Далее загрузила и попросила Gemini и Perplexity сделать на ее основе промпт для генерации изображений. Важно: лучше говорить не «сделай» (может пойти генерить картинку :), а «опиши»:
Опиши приложенное фото в виде промпта для генерации изображений
Полученный от ИИ промпт загружаем в несколько нейронок (лучше для генерации изображений делать на английском,особенно тех.детали):
Create a postcard 3:4 format. A cozy festive still life on a rustic dark wooden table.The text "Happy New Year 2026" is carefully arranged in the center using fresh orange mandarin slices as letters and numbers. Surrounded by pine cones with light frost, golden Christmas baubles, and vintage ornaments. In the background, there are burning white pillar candles of varying heights and lush green fir branches. Warm ambient lighting from candles and fairy lights,scattered artificial snow on the wood. Cinematic composition, hyper-realistic, 8k, soft bokeh background.
Важно:
✅ Нейросети по-прежнему нестабильны в буквах. Если надпись на английском получилась криво, попробуйте добавить в конце промпта: --no typos или просто перегенерируйте – есть надежда. Если на русском – пробуем (некоторые справились) ИЛИ генерировать без текста, а потом наложить его в редакторе изображений.
✅ Соотношение сторон: в некоторых нейронках (Qwen, Midjourney) вертикальный формат нужно выбирать в настройках (сейчас он в начале промпта указан)
Далее выложу собственно картинки, ключевые выводы из теста:
1⃣ Один и тот же промпт дает принципиально разные результаты в разных нейронках. Если нужны вариации - это хорошо.
2⃣ Чужие генераторы изображений в мультимодальных нейронках (Perplexity) - слабее своих полных на основных платформах (Nanobanana/Google, GPT).
3⃣ Как писала выше, сочетание хорошей картинки и правильно надписи может не получиться в одной нейронке.
👍5❤2
Тест-драйв: новогодняя открытка - 2.
Выкладываю: 1м идет исходное изображение. Далее версии от Flux и Seedream (через Perplexity), Copilot и Kandinsky. В целом, шлак, по сравнению с оригиналом 😬. Более или менее Qwen (но апельсины :) и Seedream, их оставила без подписи, вдруг, решите использовать )))
Выкладываю: 1м идет исходное изображение. Далее версии от Flux и Seedream (через Perplexity), Copilot и Kandinsky. В целом, шлак, по сравнению с оригиналом 😬. Более или менее Qwen (но апельсины :) и Seedream, их оставила без подписи, вдруг, решите использовать )))
❤6😁1🎄1