Дорогая рИИдакция
321 subscribers
7 photos
39 links
Download Telegram
Отрефакторил всю редакторскую семью через Claude Fable

Натравил на семью скилов Claude Fable как въедливого ревьюера: найди двусмысленности, противоречия между секциями, обещания без реализации. Нашлись десятки мест. Починили, прогнали тесты, выкатили.

Что поменялось.

«Слопотрон» ловит парцелляцию — рубленые обрывки вместо предложений («Зацепило не это. Зацепило другое»). У нейросети это тик. Флагует каждую, даже одиночную. Заодно перестал коситься на тире.

«Чуковский» тоже склеивает парцелляцию и получил режим «Ритм» — лечит монотонность, когда все предложения одной длины.

У «Аграновского» SKILL md называл фактчек опциональным, а README — обязательным. Починили: фактчек обязателен всегда.

«Мильчин» выучил --in-place — пишет правки прямо в файл, а не в вывод терминала.

«Бахтин» оценивает черновики по оси «Факт»: выдуманная цифра проваливает вариант целиком.

«Виноградов» перестал переносить парцелляцию автора в клон голоса и проверяет результат пробой на свежем тексте, которого модель не видела.

«Розенталь» — единственный, где мы ничего не чинили, а наоборот: нашли в его публичной версии правила, которых не хватало нашей внутренней, и забрали к себе.

Как обновить. Скилы — это файлы-инструкции, которые подключаются к Claude Code. Если какой-то из семьи у вас уже стоит, напишите в чат: «обнови скил из репозитория» — он подтянет свежую версию. Если ещё не пробовали — кидаете ссылку на нужный репозиторий и просите «установи мне этот скил». Все репозитории тут: github.com/beaverbeard.

Берите, пользуйтесь, ругайте. Обнял.
🔥15
Efficiencymaxxing: почему иногда лучший вариант — не использовать ИИ

Если раньше интересовались, пользуешься ли ты нейросетью вообще, то теперь вопрос звучит так: «Как именно ты её используешь?». Сейчас у каждого запроса к ИИ есть своя цена, и нужно знать, принесла ли работа реальный результат. Отсюда мнение, что иногда проще сделать самому, чем включать нейронку.

Писатель и ИИ-энтузиаст Крейг Мод заметил: ИИ позволяет попробовать всё. Можно сгенерировать десять черновиков, пять вариантов заголовка, три варианта tone of voice — и именно это мешает работе, отвлекая от сути. Внимание уходит на перебор вариантов.

Его решение: выбирать инструмент под задачу. Если работа требует глубокой концентрации и авторского голоса — ИИ не даёт сосредоточиться. Мод убирает телефон, выключает интернет для ноуте и не пользуется в таких ситуациях нейронкой в принципе.

Как, по мнению Мода, лучше работать с ИИ:

1. Простые задачи отдавать дешёвой модели, сложные — дорогой.
2. Оценивать качество работы. LLM плохо видят собственные ошибки, поэтому проверьте качество самостоятельно.
3. Проводить аудит токенов. После выполнения задачи смотрите, куда ушло больше всего. ИИ не чувствует собственную неэффективность и не будет экономить токены.

Началась эпоха выбора: когда включать нейросеть, когда не включать, и что считать хорошим результатом работы.

Что думаете? Какие задачи отдаёте нейронке, а какие проще сделать самостоятельно?
Медиа про будущее работы с ИИ Every поставили на себе эксперимент: они выдали каждому сотруднику личного агента на базе OpenClaw.

Каждый экземпляр получил собственное имя — Zosia, Margot, R2-C2, Parker — как будто это настоящий коллега. Через несколько месяцев компания признала: модель не сработала, и рассказала почему.

1. Агенты были нестабильны. После очередного обновления OpenClaw они могли забыть часть своих возможностей или просто прислать «Terminated» вместо ответа. Обновления чинили старые баги и тут же создавали новые.

2. Обслуживать поломку приходилось тому же человеку, которому принадлежал агент. У сотрудников без опыта в разработке не было ни инструментов, ни навыков, чтобы чинить агента самостоятельно, а обращаться за этим к разработчикам каждый раз было накладно.

3. Агент был привязан к конкретному человеку, который его обучил, и терял всю ценность, если этот человек увольнялся. Знания и настройки уходили вместе с сотрудником, а не оставались в компании.

При этом отдельные агенты всё же работали хорошо. Margot — Plus One штатной писательницы Кейти Парротт — заметно ускорила её процесс написания статей. У гендиректора Дэна Шиппера агент R2-C2 отслеживал баги в приложении Proof. Проблема оказалась не в самой идее личного агента, а в том, что она плохо масштабируется на всю компанию.

Поэтому Every поменяли подход, пересев на общих командных агентов с конкретными функциями на инфраструктуре Claude Managed Agents. Например, агент для инженеров, который раз в неделю сам сканирует тикеты в системе поддержки Intercom, находит повторяющиеся проблемы, ищет их причины в GitHub и заводит задачи в Linear. Это конкретная работа, которая не пропадёт с чьим-то уходом.
🔥1
Нейронки и тест на креативность

Учёные под руководством Карима Джерби из Монреальского университета протестировали на креативность больше 100 тысяч человек и несколько нейросетей: GPT-4, Claude, Gemini. Задача называлась Divergent Association Task (DAT) — нужно было назвать десять слов, максимально далёких друг от друга по смыслу. Также отдельно проверяли творческое письмо: хайку, сценарии, рассказы.

Что получилось: нейросети обошли «среднестатистического» человека. Но 10% самых креативных участников выборки обошли все протестированные модели без исключения.

Джерби формулирует это так: «Наши данные показывают, что некоторые системы на основе больших языковых моделей уже превосходят среднестатистического человека по креативности в чётко очерченных задачах». Но добавляет, что соревнование между человеком и нейронкой обманчивое, и стоит отказаться от такого восприятия.

Вывод автора: справится ли ИИ с креативными задачами? С задачами, где требуется средний результат, — да. Для по-настоящему креативных задач ИИ не подойдёт.
3
🤷 Кондуит и список косяков

Люди вокруг (и агенты тоже) постоянно косячат. А я человек злопамятный, но память у меня плохая, поэтому я всё записываю. Обычно не с целью запомнить, кто где обосрался, а чтобы делать выводы. Записываю вразнобой. А тут решил навести в этом порядок.

🌸 Недавно перечитал книгу «Кондуит и Швамбрания» Льва Кассиля. Там в гимназии, где учился главный герой, был Кондуит — журнал, куда записывали все проступки гимназистов (и как их наказали).

И вот мы с моим агентом завели собственный Кондуит — список косяков, правда без наказаний.

Пока в нём всего два файла: Паша и Claude. Мои косяки приношу текстом, а свои косяки он записывает сам.

🔞 План с этой игрушкой очень простой: запоминать, где и в чём мы ошиблись, чтобы можно было к этому вернуться и вспомнить детали.

Структура каждой записи в Кондуите:

Косяк: описание, что произошло. 
Контекст: почему это считается косяком.
Последствие: что сломалось.
Вывод: собственно, какой вывод мы из этого можем сделать.


💀 Теперь главное — не забывать записывать собственные косяки. Вот, прямо сейчас сижу и записываю их, продолжаю эксперимент.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥431
Microsoft: в работе с ИИ сотрудники готовы меняться быстрее, чем их компании

Пока агенты берут на себя исполнение задач, у человека появляется другая работа: решить, что вообще делать на агентах, и нести ответственность за то, что получилось. Microsoft называет эту свободу принимать решения агентностью (agency) и в новом Work Trend Index показывает: сотрудники готовы брать на себя ответственность за работу на агентах уже сейчас, но не все компании готовы под это подстроиться.

Когда та самая агентность сотрудников и готовность компании совпадают — это состояние Microsoft называет «Frontier». Frontier-сотрудники — это 16% людей из выборки, которые уже выжимают из ИИ максимум. Как они при этом работают:

1. Намеренно оставляют 43% работы без ИИ, чтобы не терять навык.
2. Перед задачей останавливаются и решают, что делает агент, а что — они сами.
3. 80% говорят, что сейчас делают работу, которая год назад была просто невозможна.

А что с остальными?

У 10% из выборки обратная ситуация: человек умеет работать с ИИ и хочет развиваться, но у него нет ни менеджера, который это поддержит, ни среды, внутри которой можно экспериментировать, ни системы, которая как-то «похвалит» желание улучшить работу, — так, навык сотрудника упирается в потолок потому, что приложить его попросту некуда.

65% боятся отстать «от рынка», если не научатся работать с ИИ. При этом не все эти люди бросаются учиться работать на агентах, и проблема кроется в невнятном отношении руководства. Когда у руководителя нет чёткой позиции насчёт использования ИИ, у сотрудника нет мотивации это делать или есть страх как-то менять свою работу. Даже самый толковый и мотивированный человек мало что может сделать один, если компания не настроена на изменения.

Там, где руководитель сам открыто пользуется ИИ и задаёт стандарт качества, у сотрудников выше оценка пользы от нейронки и есть доверие к агентам.
2
Собрал скилл с лучшими техниками мышления

Я выложил на GitHub Thinking Toolkit — скилл для AI-агентов с 30 моделями мышления.

Область у него прикладная, делал его прежде всего для себя. Когда выбор простой, методика обычно не нужна. Но когда решение дорогое, необратимое или вариантов слишком много, уверенности может не хватать и хочется опереться на понятную процедуру. Короче, Тулкит пригодится вообще всем, кому нужно постоянно принимать сложные решения — предпринимателям, руководителям, продактам, редакторам.

Внутри основные фреймворки для принятия решений, решения проблем, системного мышления и коммуникации. Есть знакомые многим «Шесть шляп», матрицы Эйзенхауэра и решений, Five Whys, диаграмма Исикавы, принцип Парето, оценка Ферми и пирамида Минто.

У каждой техники в скилле отдельная карточка, описывающая, когда её применять и когда лучше не надо, какие нужны данные, пошаговая процедура, вопросы, формат результата и типичные ошибки. Отдельный роутер выбирает минимально достаточный набор подходящих техник — обычно одну, максимум три.

Например, вам нужно выбрать авиабилет — самый дешёвый рейс ночью, не включает багаж и прибывает в дальний аэропорт, а более дорогой — прямой и в удобное время. Decision Matrix поможет сравнить не только цену, но и багаж, трансфер, продолжительность пути, условия возврата и риск пересадки, а Second-Order Thinking — учесть потерянный день, усталость и дополнительные расходы. В итоге выбираете вариант с лучшим соотношением полной цены, комфорта и риска.

Скилл на самом деле простой, чистый Markdown без зависимостей и API-ключей, работает в Claude Code, Codex CLI, OpenClaw и любом агенте, который умеет читать SKILL.md.

Пользуйтесь, ставьте звездочки 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥163
Как (скорее всего) Claude будет прятать ватермарк в обычном тексте

Вчера Anthropic объявила, что модели Claude будут помечать весь сгенерированный текст — в обычном чате, API, Claude Code и даже при работе через облака. Требование родилось из европейского AI Act, но ватермарки включат по всему миру. У файлов будет отдельная C2PA-метка в метаданных.

Большинство прочитало эту новость так, будто Claude начнёт подмешивать в ответы невидимые символы, хотя Anthropic ещё не опубликовала свою реализацию, но почти все достаточно быстрые и дешёвые методы растут из одной схемы популярной схемы под названием KGW. Мне показались весьма любопытными рассуждяения технический директор GPTZero Алекса Куи, как она работает.

Если совсем упростить, при генерации происходит примерно следующее. Система маркировки на основе потраченных токенов случайным образом делит словарь модели на две группы — условно «зелёную» и «красную». Вероятность зелёных токенов немного повышается, после чего модель обычным образом выбирает следующий токен. Для нового контекста всё повторяется, поэтому состав групп постоянно меняется.

Сам текст выглядит нормально. В нём нет отдельной буквы или символа, который можно найти поиском. Но за сотни токенов накапливается статистический перекос — модель чуть чаще выбирает слова из зелёной группы.

Детектор воспроизводит процесс в обратную сторону. Он берёт секретный ключ, проходит по тексту токен за токеном, для каждого заново вычисляет хеш и восстанавливает обе группы. Если в зелёную попало заметно больше половины токенов, текст признают помеченным. Один конкретный токен ничего не доказывает, работает только статистика на достаточно длинном отрывке.

У схемы есть несколько проблем. Если сильно перефразировать начало, изменится контекст, следом поменяются хеши и группы для остальных слов. Более сложные методы пытаются считать хеш из смысла фразы, чтобы пережить лёгкий пересказ, но интенсивная редактура, перевод и замена человеческими фрагментами всё равно разрушают сигнал.

Ещё водяной знак немного вмешивается в выбор слов — модель не всегда берёт тот вариант, который выбрала бы без маркировки.

При этом Google утверждает, что у SynthID пользователи не заметили ухудшения качества почти на 20 миллионах ответов Gemini. Но короткие и предсказуемые ответы вроде «2 + 2 = 4» маркировать практически нечем.

С кодом ещё веселее. В тексте можно заменить одно слово синонимом, а произвольная замена в программе её сломает. Поэтому отдельные методы ставят метки только там, где остаётся свобода выбора, например в названиях переменных. Как именно Anthropic решит эту задачу в Claude Code, пока неизвестно.

Есть и чисто продуктовые ограничения. Claude печатает ответ токен за токеном, поэтому Anthropic не может спокойно написать весь абзац, а потом переписать его ради более стойкой метки. Если секретный ключ утечёт, схема сломается, поэтому ключей должно быть несколько и их придётся регулярно менять.

Без ключа точно восстановить зелёные и красные группы по ответам модели крайне трудно — понадобится гигантское количество примеров. Но публичный детектор сам становится подсказкой для атакующего. Можно править текст, отправлять его на проверку и повторять, пока метка не исчезнет. Если же Anthropic оставит детектор только себе и регуляторам, обычный пользователь не сможет самостоятельно проверить происхождение текста.

Детектор при этом остаётся вероятностным. Anthropic предупреждает, что найденная метка означает лишь «текст мог обрабатываться Claude». Модель могла перевести или отредактировать человеческий оригинал. Обратное тоже верно — отсутствие метки ничего не доказывает, особенно если текст короткий или его переписали. Разбираться с ложными срабатываниями придётся университетам и государственным органам.

В итоге водяной знак хорошо ловит человека, который скопировал ответ как есть и не знает о маркировке. Тот, кто хочет её удалить, прогонит текст через другую модель, совместит замену слов с перестройкой синтаксиса или перепишет часть руками. По тестам Куи, бесплатные парафразеры уже справляются с Google SynthID.
74
На выходных перебрал Thinking Toolkit и добавил в него проверку логики — дистиллировал несколько классических книг 🙂

В результате в скилл добавилась команда logic. Можно скормить ей аргумент (свой, чужой или сгенерённый нейросетью), а она проверит правильность сделанного вывода из приведенных аргументов и покажет, что с ним не так.

Если уже ставили скилл раньше, то для обновления лучше удалить его и поставь заново — я довольно сильно переписал репозиторий. Или отдайте агенту команду:

Скачай заново и переустанови скилл https://github.com/ponomr/thinking-toolkit, перезаписав старую версию (--force)


Пономарь
42🔥1
Не туда, простите!

Но и вам сейчас расскажу
Редколлегия имени Родислава Скрябина вычитала мне гигантскую пачку текстов, по регламенту после проверка корректором — и корректор почти не нашёл ничего дополнительного, потому что всё уже чистенько.

Основные косяки — на иллюстрациях, которые я продолбал проверить редколлегией.
🎉 Приведение к единому знаменателю

Поназовут чаты и каналы одинаково, вот так ошибёшься окном и приходится серию постов писать.

Я делаю курс. У курса несколько авторов. Ещё на этапе сборки мы пообсуждали терминологию и местами к единому мнению не пришли — решили, что уже на ходу будем решать.

На выходе у меня полтора десятка текстов и терминология изрядно сбита. Я всё прочитал, но всё равно подзавис.

🤦 И вот тут мой клод код + редколлегия имени Скрябина пришли на помощь.

1. Единая терминология → там, где одно и то же называли разными словами, искин нашёл несоответствия и привёл всё к порядку.

2. Логические нестыковки. Так как курс писали разные авторы, местами были косячки. Нет, не разные мнения — это, наоборот, самое ценное. А именно косячки — где-то друг другу чуть-чуть перечим, где-то логика между уроками рушится. Редколлегия в лице Аграновского (которого я всегда очень недооценивал) на фактчеке всё это нашла и подсказала, как поправить.

3. Чейнджлоги изменений — всё, что искин предлагал мне менять, записывалось в отдельный файл.

🪩 И самое важное: агент игрался в своих файлах и не имел доступа к рабочим документам. Всё, что он мне предлагал, я проверял сам и руками вносил правки.
Please open Telegram to view this post
VIEW IN TELEGRAM
21🔥1
Ещё напомните мне через месяца 3-4 написать кейс, как я писал книгу с помощью искина на концерте Славы КПСС.
🔥32
Есть у нас тут авторы крупной формы? 😎

ManuscriptReport протестировали 15 нейросетей для авторов книг — крупная форма, художка и нон-фикшн — по трём этапам: черновик, редактура, маркетинг. К русскому языку, к сожалению, мало что применимо в полной мере: часть инструментов на кириллице не работает вообще, движки заточены под английскую грамматику и с русским текстом технически не справляются. Но если вы пишете на английском, то ознакомьтесь со статьёй, в ней хватает бесплатных инструментов!

Этап создания черновика. Из всего списка с русским реально работает Claude: контекст держится и не теряется между главами. Бесплатный тариф ограничен по числу сообщений в день, Pro — $20/мес без лимита и с полным контекстом.

Этап редактуры. Для русского текста этот этап лучше всего закрывают редакторские скиллы канала: Розенталь выловит орфографию и пунктуацию, Чуковский — структуру и голос, Мильчин почистит типографику. Англоязычные инструменты, увы, не сработают.

Скиллы лежат здесь.

Этап продвижения книги. Jasper, Copy.ai, Writesonic и Rytr в теории смогут собрать из рукописи блёрб, ключевые слова и рекламные тексты и выдать русский текст, но шаблоны и настройка у них под англоязычный рынок — придётся хорошенько поредактировать. У всех четырёх инструментов есть бесплатный тариф с лимитами.

Обзор с самого начала предупреждает: закрыть весь путь книги одним инструментом не получится. Каждый универсальный сервис слабее специализированного. Авторы статьи делают вывод: те, кто использует AI для структуры, исследований и редактуры по отдельности, сохраняют в итоге авторский голос; те, кто «генерирует» текст, — этот голос теряют и часто переписывают потом работу начисто.

Про разницу между созданием текста и его генерацией Родион писал здесь.

Кто работает с крупной формой и пользуется AI-инструментами, делитесь лайфхаками!
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥1
Внедрить ИИ-инструменты — это лишь первый шаг

Игровой издатель Arkadium запустил Game Lab — открытый рейтинг того, как разные нейросети играют в простые игры.

Ожидание было такое: топовые модели, которые решают олимпиадные задачи по математике, легко разберутся и с игрой Gin Rummy. Это карточная игра на двоих, где выигрывает тот, кто быстрее соберёт карты в комбинации, что-то вроде упрощённого покера. На практике же топовые модели проигрывали обычным игрокам-людям 9 партий из 10.

Тогда Arkadium обучили свою маленькую модель: 4,6 млн параметров, 18 мегабайт, на обычном процессоре, без дорогих серверов. И уже она начала выигрывать у человека 9 партий из 10, а обходиться в $60 в год вместо потенциально миллионов на аренде большой модели уровня GPT.

Сверху появился второй доход: Arkadium продают анонимные данные об игровых партиях компаниям вроде Anthropic, OpenAI и DeepMind, которые как раз и строят большие модели. Те дообучаются на этих данных и подтягиваются, например, GPT-5.6 после этого заметно улучшила результаты в решении кроссвордов.

Ещё один пример: Cursor строился поверх модели Claude от Anthropic. Anthropic же называла свой Claude Code только «исследовательским проектом», а он тем временем вырос в прямого конкурента Cursor.

Мысль обеих историй одна: выигрывает тот, кто чётко понимает цель и умеет измерить результат. Внедрить ИИ-инструменты — только первый шаг: главная сложность в определении измеримых бизнес-целей и метрик «хорошего» результата.
1
«Как редактор-джун, только лучше»

Напоминаем всем, кто подписан на этот канал и нашу рассылку: у нас есть чат, ссылка на него в одном из писем — ищите, если вдруг пропустили! В чате все мы — авторы рассылки и подписчики — делимся разными лайфхаками, задаём друг другу вопросы про работу с агентами и подкидываем пищу для ума.

На днях на вопрос, как там идёт работа с агентом и что он уже делает, одна из наших прекрасных подписчиц и шеф-редактор по совместительству Яна Мизгирёва ответила: «Да буквально всё, что я делала бы руками».

Делимся кейсом Яны.

Вместе с агентом Яна сперва сделала отчёт по площадкам, где можно размещать статьи под профиль её компании. Агент собрал данные, но сначала напортачил: кое-где переврал факты, кое-где пропустил площадку, не оставил в доке места под её комментарии, перепутал порядок, добавил ссылки не везде.

Раньше на правку такого отчёта уходил целый цикл. Задачу добивали полностью внутри VS Code, агент выгружал результат в документ, а по дороге мог что-то потерять. Приходилось выгружать заново: старый док летел в корзину, вместо него появлялся новый, без истории.

Сейчас Яна работает иначе:

1. Даёт агенту два документа и просит соединить их в один, сделать таблицу.
2. Просит отранжировать площадки так, чтобы их порядок в таблице совпадал с порядком в тексте под ней, а также тем, который заложен в общем плане действий.
3. Просит свериться, что данные в таблице и в тексте не расходятся.
4. Просит отметить, какие площадки ей нужно проверить самой, и убрать те, которые уже не существуют или не подходят.

Вся работа — в одном документе, без бесконечных копий, в которых потом только путаешься. Если Яна захочет вернуться к этому же отчёту через неделю с новой правкой — агент продолжит работать в той же версии, а не начнёт с чистого файла. Это работает и в обратную сторону: можно отдать агенту документ, попросить собрать по нему саммари и вставить отдельным разделом в середину.

Свой метод работы она сравнивает с редактурой у джуна:
«Буквально как с автором-джуном, которому комментами даёшь правки, только этот меньше забывает и ещё и мне напоминает в стиле „ты хотела еще вот это…“»


Следующий тест Яны — научить агента применять на текстах редакторские скиллы Родиона и сразу вносить правки в гугл-доки самостоятельно. Будем ждать результатов!

Ссылочки на Яну — канал От меня ок!

И вы тоже пишите, что уже делаете, что попробовали, где получилось, а где не сработало 😀
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥3
В защиту ИИ-письма

Майк Тейлор, глава tech-консалтинга Every, признался: один из самых популярных его постов на Every и большинство записей в личном блоге написал не он — их написал ИИ, а сам Майк только поправил структуру текстов.

Интернет вспыхнул от негодования. Главный аргумент противников такого подхода следующий: писать — значит думать. Если отдаёшь черновик модели, то отдаёшь и рассуждение, а значит на выходе неизбежно получится нейрослоп.

Тейлор с этим не согласен. Сам он не называет себя писателем, он — человек действия: тестирует модели до релиза, учит топ-менеджеров применять ИИ. По работе Майк также проводит A/B-тесты, и у него на этот счёт есть правило: попросить ИИ описать тест, который он не проводил сам, — нельзя. Когда тест и правда проведён, Тейлор надиктовывает процесс проведения и результа, после чего просит оформить в пост. День работы превращается в два часа, часть которых уходит на вычитку и правку.

К слову о том, что ещё происходит в сфере «написанных при помощи ИИ текстов».

Многие уже слышали про вотермарки Anthropic. Компания объявила, что будущие версии Claude начнут маркировать сгенерированный текст — этого требует регулятор ЕС. Первый пост был скуп на детали, и в соцсети X начался хаос: пользователи испугались, что метка будет портить сам текст, подталкивая модель к неестественному выбору слов.

Anthropic пояснила механику: используется вариант Google SynthID Text — модель по-прежнему выбирает между несколькими правдоподобными словами, просто исходные вероятности сохраняются в среднем по множеству ответов, а не для каждого конкретного случая. А вот что набор ответов на один и тот же промпт становится однообразнее — это вывод исследователей: Google маркирует так Gemini с 2024 года, и заметного влияния на качество отдельного ответа нет, но их разнообразие снизилось. Для Claude вотермарки ещё не запущены.

Хуже другое: Anthropic подлила масла в огонь, заявив, что читателю не так уж важно, используется ли для описания погоды слово «пасмурно» или, например, «серо». Писателей это только разозлило: Джон Груббер из Daring Fireball назвал такой подход «извращением письма».

Инструменты для удаления вотермарки, к слову, появились ещё до того, как её выкатили. Но нам тут важнее другое: с вотермарками или без них, наполнение текста, проверка структуры и последующая редактура всё равно остаются на нас, людях. Мы всё ещё фильтр между ИИ-текстами и читателями.
3
«Я опробовала новую модель, чтобы исправить тексты, созданные ИИ»

Кэти Парротт, автор Every, протестировала новую модель Deft и разобралась, чем она отличается от обычных моделей.

Идея следующая: модель обычно учат отвечать хорошо на каждый запрос пользователя по отдельности. Из-за этого тысяча ответов подряд могут сами по себе выглядеть нормально, а всей пачкой превращаться в один и тот же текст с одними и теми же оборотами. Deft сравнивает не один ответ с одним примером, а сразу пачку своих ответов с пачкой текстов, которые написали люди, и подтягивает одно к другому. Если гнаться не за одним хорошим ответом, а за разнообразием по всей пачке, тексты перестанут быть похожи друг на друга.

Парротт попросила модель написать аналитическое эссе про то, как ИИ меняет работу, и статью о том, как составить гайд по стилю для ИИ — с нуля и как рерайт уже готового черновика, который до этого сделал GPT-5.6 Sol. Пробовала и через сайт Deft, и через API, подключив его к Codex.

На уровне отдельного предложения текст правда получился живее и неожиданнее, чем у большинства моделей. Но читать его было тяжело: фразы выходили громоздкие и странные.

В режиме strict, где модель должна использовать только детали из задания, она всё равно кое-что придумала: в эссе появилась мысль, что работников подталкивают пользоваться ИИ менеджеры, профсоюзы или владельцы компании — в брифе Парротт этого не было.

Хуже получилось с API. Оказалось, что это не прямой доступ к модели, а прослойка: задание уходит в Deft, а обратно приходит уже готовый кусок текста, без возможности поработать над ним вместе. Парротт отправила туда задание через Codex вместе с планом и своими правилами стиля. На первых двух попытках Deft вернул не текст, а инструкции, как его писать. На третьей, с самым высоким качеством, модель написала половину эссе, остановилась и придумала даты, диалоги, историю продукта, скриншоты и эмоции, которых не было в источниках, хотя strict был включён. Парротт заплатила за это 0,49 доллара и осталась без черновика, который можно использовать.

Deft действительно научился делать текст менее предсказуемым. Но предсказуемость — не единственная причина, почему тексты ИИ раздражают. Модели по-прежнему не хватает понимания, что читателю нужно объяснить, а что нет, в каком порядке подавать мысли и как удержать внимание. Похоже, Deft принимает эти решения предложение за предложением, а не держит в памяти весь текст целиком. Не хватает и возможности править кусками: попросить сохранить одну часть и переписать другую, а не получать каждый раз новый текст с нуля. Сама Парротт говорит, что пока не стала бы использовать Deft для повседневной работы, но интересно, куда лаборатория пойдёт дальше.
«Скопировать навыки сотрудника»

Команда Every пошла на эксперимент: гендиректор Дэн Шиппер решил клонировать суждение собственного главреда, Кейт Ли.

У Every накопилось 30 000 реальных правок текстов от Кейт. Как только вышла новая модель GPT-5.6, этого хватило, чтобы обучить на них KateBench — скилл-редактор, который копирует именно её редакторские привычки вместо обычной проверки текста на грамотность.

Работает это так:

1. Автор прогоняет текст через KateBench и получает предложенные правки.
2. Кейт Ли просматривает их в Google Docs, после чего принимает, меняет или отклоняет их; все решения трекаются автоматически.
3. Codex после этого переписывает сам скилл на основе её решений, и с каждым циклом он всё точнее повторяет её «вкус».

Редактура оказалась довольно специфичным навыком, который трудно описать словами, но легко показать на примерах. Смысл в том, что теперь любой в команде получает редактуру уровня Кейт, не отвлекая её саму каждый раз.

В Every планируют также упаковать в скиллы знания других сотрудников: понимание пользователей, операционную экспертизу, чувство «работы соцсетей».
🔥2
Дружеское напоминание: если вы пользуетесь Claude Code, то время сделать ревизию.

Вышла Fable 5.1 — очередная самая мощная моделька. Попросите её провести аудит своих (чего угодно) — найдёт кучу неочевидных косяков.

Например, новый Фейбл только что нашёл пару критичных дырок безопасности в инфраструктуре, через которую я этого самого Claude Code с VPS запускаю.
5
Как понять, что клон действительно повторяет действия реального человека?

Продолжаем предыдущую тему про скиллы, которые копируют работу конкретного сотрудника. Брендан Фуди, гендиректор ИИ-стартапа Mercor, говорит, что компании тратят «до 100 миллионов долларов в год на прогон моделей», не имея офлайн-оценки, т.е. набора реальных рабочих задач, на которых можно сравнить модели до внедрения.

KateBench — скилл, повторяющий поведение реального главреда, — тут же стал наглядным примером. Редакторы принимали 85–90% его правок — такая цифра на любой презентации выглядела бы впечатляюще. Однако инженер проекта Янник Юнг объяснил, почему верить ей нельзя. Выяснилось, что:

1. На длинных текстах инструмент останавливался после 40 предложенных правок.
2. На одном и том же куске текста система каждый раз выдавала разные варианты.
3. Высокий процент принятых правок маскировал реальный объём работы, которую человеку всё равно приходилось доделывать руками.

Вывод команды: нужно выбрать одну повторяющуюся рабочую задачу, задокументировать пять типичных провалов на реальных примерах и проверять модели именно на них.

Получается, клонировать суждение человека в скилл — только половина задачи. Вторая половина — постоянно перепроверять, что клон действительно «думает как человек», а не просто проделывает какую-то работу, которая со стороны кажется очень убедительной.