Fable 5.1: в чем смысл новой версии и что менять в промптах
Старые промпты не сломаются, модель не будет в шоке. Но кое-что все равно стоит пересмотреть, например, правила промптинга для модельки. Ниже выжимка из гида по промптингу и цифр релиза, под работу в чате.
Вышла моделька 1 сентября 2026 по прежней цене: 10 долларов за миллион входных токенов и 50 за миллион выходных. Подешевело чтение из кеша, с 1 доллара до 0,25 за миллион.
Главный прыжок это агентная наука, больше чем вдвое к предшественнице. Opus 5 новая модель обходит на всех опубликованных бенчмарках, но и стоит за токен вдвое дороже. Новая модель – это соотношение цены и качества. Куда уж лучше...
Ответы стали плотнее
Длиннее предложения, меньше абзацных разрывов, реже болд, заголовки, списки и кавычки.
Если в вашем шаблоне живет строка «не используй буллиты и bold», можно сносить: она писалась против прежнего перебора и теперь бьет в обратную сторону. Структуру теперь надо просить явно, правилом вида «списки, когда контент многосоставный».
Пересказы тащат дословные куски
При суммаризации модель чаще воспроизводит фразы источника, не помечая их как цитату. Выглядит гладко, ровно поэтому опасно. Лучше проверьте перед публикацией, иначе можно выдать чужие слова за свои. Школьники и студенты, берегитесь!
Поиск проигрывает памяти на низком усилии
На low модель реже идет в поиск и охотнее отвечает по памяти, а частичное знание звучит увереннее незнания. Для тарифов, версий и доступности сервисов это устаревший ответ с уверенной интонацией. Поднимайте усилие или требуйте проверки: искать название ровно в вашей формулировке.
Большие тексты держите на high
На высоких усилиях модель может сочинить документ внутри размышления и написать заново в ответе. Дольше, дороже, иногда обрыв по лимиту: размышление и ответ делят один бюджет. На max независимые замеры показывают цену за задачу выше, чем у Fable 5, из-за примерно 1,7-кратного расхода выходных токенов.
Многосекционные документы, крупные таблицы и целые файлы кода держите на high.
Итого: еще тщательнее пишите промпты. А тут Claude пишут, какие именно поглаживали нужно делать🐱
Prompting Claude Fable 5.1 - Claude Platform Docs
Старые промпты не сломаются, модель не будет в шоке. Но кое-что все равно стоит пересмотреть, например, правила промптинга для модельки. Ниже выжимка из гида по промптингу и цифр релиза, под работу в чате.
Вышла моделька 1 сентября 2026 по прежней цене: 10 долларов за миллион входных токенов и 50 за миллион выходных. Подешевело чтение из кеша, с 1 доллара до 0,25 за миллион.
Главный прыжок это агентная наука, больше чем вдвое к предшественнице. Opus 5 новая модель обходит на всех опубликованных бенчмарках, но и стоит за токен вдвое дороже. Новая модель – это соотношение цены и качества. Куда уж лучше...
Ответы стали плотнее
Длиннее предложения, меньше абзацных разрывов, реже болд, заголовки, списки и кавычки.
Если в вашем шаблоне живет строка «не используй буллиты и bold», можно сносить: она писалась против прежнего перебора и теперь бьет в обратную сторону. Структуру теперь надо просить явно, правилом вида «списки, когда контент многосоставный».
Пересказы тащат дословные куски
При суммаризации модель чаще воспроизводит фразы источника, не помечая их как цитату. Выглядит гладко, ровно поэтому опасно. Лучше проверьте перед публикацией, иначе можно выдать чужие слова за свои. Школьники и студенты, берегитесь!
Поиск проигрывает памяти на низком усилии
На low модель реже идет в поиск и охотнее отвечает по памяти, а частичное знание звучит увереннее незнания. Для тарифов, версий и доступности сервисов это устаревший ответ с уверенной интонацией. Поднимайте усилие или требуйте проверки: искать название ровно в вашей формулировке.
Большие тексты держите на high
На высоких усилиях модель может сочинить документ внутри размышления и написать заново в ответе. Дольше, дороже, иногда обрыв по лимиту: размышление и ответ делят один бюджет. На max независимые замеры показывают цену за задачу выше, чем у Fable 5, из-за примерно 1,7-кратного расхода выходных токенов.
Многосекционные документы, крупные таблицы и целые файлы кода держите на high.
Итого: еще тщательнее пишите промпты. А тут Claude пишут, какие именно поглаживали нужно делать
Prompting Claude Fable 5.1 - Claude Platform Docs
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1
А вам страшно использовать ИИ☠
Вчера общалась с предпринимателем из пиар-сферы, в компании которого активно внедряют нейросетки. Пара мыслей на подумать.
Который раз убеждаюсь в том, что о безопасности и стабильности нейросеток начинают задумываться только тогда, когда придут люди в погонах. И здесь нет ничего удивительного. Чтобы думать о безопасности и стабильности нужно иметь бюджет, время и экспертизу. А о какой экспертизе может идти речь, если сама сфера новая и непонятная.
Плюс, мне кажется, у нас уже вырабатывается своего рода толерантность к утечке наших данных. Ну позвонили мне раз 20 из ПромБромПук банка, ну и что? Кто сейчас вообще разговаривает по телефону?
Также, вижу тенденцию “я посмотрю как другие с этим работают, если у них ничего не отвалится, то и я буду внедрять”. Тоже вполне логично. Только есть одна маленькая деталь – все боятся. Когда доходит до агентных автономных систем, по типу Hermes, OpenClaw и тд., тут уже все стали думать про безопасность.
Думаю, нужно делать инструменты-фильтры для работы с этими инструментами. А то, ты ему пишешь “не трогай”, а он тебе “хорошо, я все сломал”. Как думаете?
Вчера общалась с предпринимателем из пиар-сферы, в компании которого активно внедряют нейросетки. Пара мыслей на подумать.
Который раз убеждаюсь в том, что о безопасности и стабильности нейросеток начинают задумываться только тогда, когда придут люди в погонах. И здесь нет ничего удивительного. Чтобы думать о безопасности и стабильности нужно иметь бюджет, время и экспертизу. А о какой экспертизе может идти речь, если сама сфера новая и непонятная.
Плюс, мне кажется, у нас уже вырабатывается своего рода толерантность к утечке наших данных. Ну позвонили мне раз 20 из ПромБромПук банка, ну и что? Кто сейчас вообще разговаривает по телефону?
Также, вижу тенденцию “я посмотрю как другие с этим работают, если у них ничего не отвалится, то и я буду внедрять”. Тоже вполне логично. Только есть одна маленькая деталь – все боятся. Когда доходит до агентных автономных систем, по типу Hermes, OpenClaw и тд., тут уже все стали думать про безопасность.
Думаю, нужно делать инструменты-фильтры для работы с этими инструментами. А то, ты ему пишешь “не трогай”, а он тебе “хорошо, я все сломал”. Как думаете?
⚡2🔥1🤔1
Штош, GPT-6 Astra: шаг в AGI или мы все еще незаменимы
Не знаю почему, но вот не задались мои отношения с семейством GPT. Для меня компания и ее продукты, это котенок, утверждающий, что он лев. Красивый, милый, но пока к лотку не приучен.
Уверена, что все мы любим читать статьи о новых моделях, где капсом написано "БЬЕТ ФРОНТИРЫ ПО ВСЕМ БЕНЧМАРКАМ". Да, опять и снова. Пусть то Llama, Qwen, Mistral, GPT и тд. НО теперь я в первую очередь иду читать про то, КАК замеряли, КТО замерял и КАКИЕ датасеты использовались.
3 сентября вышла новая модель от OpenAI, которая уже может (якобы) сама принимать решения и адаптироваться к новым задачам. Например, вы загружаете агента в незнакомую ему игру, и он действительно находит цели игры и проходит ее.
Не все так просто. Читала на выходных публикации по Astra, хотела обновить свою табличку моделей. Собрала, где вопросики.
ВИТРИНА РЕЛИЗА
Официальные цифры такие. На агентном кодинге Terminal-Bench 57,9 процента против 37,3 у прошлой модели Sol и 55,8 у Fable 5.1. На работе с компьютером OSWorld 72,6 против 65,7 и 70,2. На кликах по интерфейсу ScreenSpot-Pro 92,7 против 76,9 и 87,3. На математике FrontierMath 97,6 против 83 у обеих. На поиске уязвимостей ExploitBench вообще 100 процентов.
Цена прежняя для флагмана: 10 долларов за миллион входных токенов и 50 за миллион выходных.
Красиво. Теперь про то, как эти числа получены.
ЦИФРЫ МЕНЯЛИ ПОСЛЕ ПУБЛИКАЦИИ
Пост OpenAI вышел 3 сентября в 14:23 по восточному времени. К 17:20 часть цифр стала другой. Правки в основном в пользу Astra и против Anthropic. Может, я и душнила, но.
Доля выдумок у Astra была 4,2 процента, стала 2,0, потом снова 4,2. У Sol была 12,2, стала 9,4, потом снова 12,2.
FrontierMath у Fable: было 87,8, стало 78,0, сейчас 83,0. У Sol: 83,0, потом 80,5, сейчас снова 83,0.
ExploitBench у Sol: было 5,5, стало 11,5, сейчас пересматривают. Terminal-Bench у Astra подрос с 57,7 до 57,9.
А в предрелизном черновике на ARC-AGI-3 у Astra стояло 98,6. Сейчас 99,99.
ЧТО МЕШАЕТ СРАВНИВАТЬ
Первое. Эталон снят с конфигурации, которую нельзя купить. Результат Sol в 11,5 процента на ExploitBench получен на недоступном уровне рассуждений. OpenAI это признала и обсуждает откат к 5,5. То есть "мы самые лучшие, но вы это не проверите"🥰
Второе. В блоге стоит оговорка: все оценки это максимум при любом уровне усилий. Цифры сняты в лучших условиях и могут отличаться от того, что работает в продукте. "И параметры вам не видать"🥰 🥰
Третье. В системной карте почти нет описания внутреннего теста на выдумки. Анка Ройель и Майк Харди из Стэнфорда пишут, что не указано даже количество тестовых элементов🥰 🥰 🥰 Перепрогоны с разными условиями они называют подгонкой под тесты.
Про процесс внутри тоже важно. Метрики считают разные команды и передают центральной на публикацию. Общего контроля методологии нет. Чужие модели OpenAI обычно не прогоняет сама, а берет числа с открытых рейтингов.
Сверку по архивным снимкам сделал
Разбор
Не знаю почему, но вот не задались мои отношения с семейством GPT. Для меня компания и ее продукты, это котенок, утверждающий, что он лев. Красивый, милый, но пока к лотку не приучен.
Уверена, что все мы любим читать статьи о новых моделях, где капсом написано "БЬЕТ ФРОНТИРЫ ПО ВСЕМ БЕНЧМАРКАМ". Да, опять и снова. Пусть то Llama, Qwen, Mistral, GPT и тд. НО теперь я в первую очередь иду читать про то, КАК замеряли, КТО замерял и КАКИЕ датасеты использовались.
3 сентября вышла новая модель от OpenAI, которая уже может (якобы) сама принимать решения и адаптироваться к новым задачам. Например, вы загружаете агента в незнакомую ему игру, и он действительно находит цели игры и проходит ее.
Не все так просто. Читала на выходных публикации по Astra, хотела обновить свою табличку моделей. Собрала, где вопросики.
ВИТРИНА РЕЛИЗА
Официальные цифры такие. На агентном кодинге Terminal-Bench 57,9 процента против 37,3 у прошлой модели Sol и 55,8 у Fable 5.1. На работе с компьютером OSWorld 72,6 против 65,7 и 70,2. На кликах по интерфейсу ScreenSpot-Pro 92,7 против 76,9 и 87,3. На математике FrontierMath 97,6 против 83 у обеих. На поиске уязвимостей ExploitBench вообще 100 процентов.
Цена прежняя для флагмана: 10 долларов за миллион входных токенов и 50 за миллион выходных.
Красиво. Теперь про то, как эти числа получены.
ЦИФРЫ МЕНЯЛИ ПОСЛЕ ПУБЛИКАЦИИ
Пост OpenAI вышел 3 сентября в 14:23 по восточному времени. К 17:20 часть цифр стала другой. Правки в основном в пользу Astra и против Anthropic. Может, я и душнила, но.
Доля выдумок у Astra была 4,2 процента, стала 2,0, потом снова 4,2. У Sol была 12,2, стала 9,4, потом снова 12,2.
FrontierMath у Fable: было 87,8, стало 78,0, сейчас 83,0. У Sol: 83,0, потом 80,5, сейчас снова 83,0.
ExploitBench у Sol: было 5,5, стало 11,5, сейчас пересматривают. Terminal-Bench у Astra подрос с 57,7 до 57,9.
А в предрелизном черновике на ARC-AGI-3 у Astra стояло 98,6. Сейчас 99,99.
ЧТО МЕШАЕТ СРАВНИВАТЬ
Первое. Эталон снят с конфигурации, которую нельзя купить. Результат Sol в 11,5 процента на ExploitBench получен на недоступном уровне рассуждений. OpenAI это признала и обсуждает откат к 5,5. То есть "мы самые лучшие, но вы это не проверите"
Второе. В блоге стоит оговорка: все оценки это максимум при любом уровне усилий. Цифры сняты в лучших условиях и могут отличаться от того, что работает в продукте. "И параметры вам не видать"
Третье. В системной карте почти нет описания внутреннего теста на выдумки. Анка Ройель и Майк Харди из Стэнфорда пишут, что не указано даже количество тестовых элементов
Про процесс внутри тоже важно. Метрики считают разные команды и передают центральной на публикацию. Общего контроля методологии нет. Чужие модели OpenAI обычно не прогоняет сама, а берет числа с открытых рейтингов.
Сверку по архивным снимкам сделал
FortuneРазбор
системной картыPlease open Telegram to view this post
VIEW IN TELEGRAM
👨💻2🔥1
ЧТО НАШЛИ НЕЗАВИСИМЫЕ
Регрессии опубликовали только Artificial Analysis, и все относительно прошлой модели Sol.
Индекс интеллекта у Astra 61. Ровно столько же, сколько у Sol. У Fable 5.1 при этом 65,7.
Минус 80 пунктов Эло на GDPval-AA v2, это задачи по 44 профессиям, набор адаптирован из данных самой OpenAI. Минус 2, 3 пункта на клиентской поддержке, научном Python и рассуждении по длинному контексту. Качество презентаций упало, там до сих пор лидирует Sol. Цена задачи выросла на 75 процентов.
И главное. OpenAI пишет про 4,2 процента выдумок. Artificial Analysis на своем тесте фиксирует 51 процент, хотя у Sol было 92. Разница на порядок, потому что определения выдумки разные и сложность набора данных разная.
Что я из этого забрала: цифры от поставщика и от независимой лаборатории нельзя класть в одну колонку. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
ОБВЯЗКА РЕШАЕТ БОЛЬШЕ МОДЕЛИ
Вот это для меня самое важное.
ARC Prize прогнали Astra через две разные обвязки. Своя у них нейтральная, модель сама решает, какие заметки нести дальше. Провайдерская сохраняет непрозрачное состояние рассуждений между запросами и сжимает длинные сессии.
На своей обвязке Astra дает 62,7 процента. На провайдерской 99,9. Одна и та же модель, 37 пунктов разницы.
Дальше еще интереснее. Режим вообще без рассуждений дает 35,2, а низкий уровень усилий только 17,5. Зависимость немонотонная. И прогон за 26 тысяч долларов оказался точнее прогона за 48 тысяч.
Про заголовки "превзошла человека". Это верно только для провайдерской обвязки. В отдельном режиме у модели была песочница с исполнением кода, она писала себе решатели лабиринтов и боев. У людей в контроле не было ни интерпретатора, ни блокнота. ARC Prize так и пишут: это совместный результат модели и ее инструментов. Эталон по людям собран примерно на 500 участниках без отбора по навыку. arcprize.org/blog/astra
КТО КАК МЕРЯЕТ
OpenAI: максимум усилий, свои скаффолды, чужие модели берет с открытых рейтингов. Правки задним числом, методология не раскрыта.
ARC Prize: две обвязки раздельно, все шесть уровней усилий, открытая политика тестирования. Но домен узкий и эталон по людям слабый.
Artificial Analysis: свои индексы, считают цену и токены на задачу. У разных моделей разные обвязки, определения метрик свои.
ЧТО Я ПОМЕНЯЛА У СЕБЯ
Винсент Санн Чен из Snorkel AI перечисляет минимум того, что определяет число: контрольная точка модели, конфигурация с лимитами времени и вычислений, обвязка, конфигурация оценщика с его недетерминированностью. Он предлагает при каждой правке цифр раскрывать, что изменилось в настройке. Такой нормы в отрасли пока нет.
Мой чек-лист:
1. Не брать цифры поставщика за точку отсчета без уровня усилий и проверки, доступен ли он в продукте.
2. Гонять минимум три уровня усилий, зависимость немонотонная.
3. Писать в лог, идет ли прогон через провайдерскую обвязку контекста.
4. Метрики выдумок из разных источников не смешивать.
5. Хранить рядом с числом все четыре параметра прогона, иначе оно невоспроизводимо.
И пункт под безопасность. Публичная Astra урезана по наступательным сценариям, поверх нее работает слой классификаторов. Он иногда обрывает и защитную работу тоже. Значит обвязка должна отдельно логировать прерванные трассы, иначе ложные срабатывания растворятся в общем проценте.
Если гоняете свои замеры по агентам, напишите, какие расхождения ловили вы. И еще: с нейросетками может произойти что угодно, важно об этом прямо говорить и писать😭 🥰
Регрессии опубликовали только Artificial Analysis, и все относительно прошлой модели Sol.
Индекс интеллекта у Astra 61. Ровно столько же, сколько у Sol. У Fable 5.1 при этом 65,7.
Минус 80 пунктов Эло на GDPval-AA v2, это задачи по 44 профессиям, набор адаптирован из данных самой OpenAI. Минус 2, 3 пункта на клиентской поддержке, научном Python и рассуждении по длинному контексту. Качество презентаций упало, там до сих пор лидирует Sol. Цена задачи выросла на 75 процентов.
И главное. OpenAI пишет про 4,2 процента выдумок. Artificial Analysis на своем тесте фиксирует 51 процент, хотя у Sol было 92. Разница на порядок, потому что определения выдумки разные и сложность набора данных разная.
Что я из этого забрала: цифры от поставщика и от независимой лаборатории нельзя класть в одну колонку. artificialanalysis.ai/articles/benchmarking-gpt-6-astra
ОБВЯЗКА РЕШАЕТ БОЛЬШЕ МОДЕЛИ
Вот это для меня самое важное.
ARC Prize прогнали Astra через две разные обвязки. Своя у них нейтральная, модель сама решает, какие заметки нести дальше. Провайдерская сохраняет непрозрачное состояние рассуждений между запросами и сжимает длинные сессии.
На своей обвязке Astra дает 62,7 процента. На провайдерской 99,9. Одна и та же модель, 37 пунктов разницы.
Дальше еще интереснее. Режим вообще без рассуждений дает 35,2, а низкий уровень усилий только 17,5. Зависимость немонотонная. И прогон за 26 тысяч долларов оказался точнее прогона за 48 тысяч.
Про заголовки "превзошла человека". Это верно только для провайдерской обвязки. В отдельном режиме у модели была песочница с исполнением кода, она писала себе решатели лабиринтов и боев. У людей в контроле не было ни интерпретатора, ни блокнота. ARC Prize так и пишут: это совместный результат модели и ее инструментов. Эталон по людям собран примерно на 500 участниках без отбора по навыку. arcprize.org/blog/astra
КТО КАК МЕРЯЕТ
OpenAI: максимум усилий, свои скаффолды, чужие модели берет с открытых рейтингов. Правки задним числом, методология не раскрыта.
ARC Prize: две обвязки раздельно, все шесть уровней усилий, открытая политика тестирования. Но домен узкий и эталон по людям слабый.
Artificial Analysis: свои индексы, считают цену и токены на задачу. У разных моделей разные обвязки, определения метрик свои.
ЧТО Я ПОМЕНЯЛА У СЕБЯ
Винсент Санн Чен из Snorkel AI перечисляет минимум того, что определяет число: контрольная точка модели, конфигурация с лимитами времени и вычислений, обвязка, конфигурация оценщика с его недетерминированностью. Он предлагает при каждой правке цифр раскрывать, что изменилось в настройке. Такой нормы в отрасли пока нет.
Мой чек-лист:
1. Не брать цифры поставщика за точку отсчета без уровня усилий и проверки, доступен ли он в продукте.
2. Гонять минимум три уровня усилий, зависимость немонотонная.
3. Писать в лог, идет ли прогон через провайдерскую обвязку контекста.
4. Метрики выдумок из разных источников не смешивать.
5. Хранить рядом с числом все четыре параметра прогона, иначе оно невоспроизводимо.
И пункт под безопасность. Публичная Astra урезана по наступательным сценариям, поверх нее работает слой классификаторов. Он иногда обрывает и защитную работу тоже. Значит обвязка должна отдельно логировать прерванные трассы, иначе ложные срабатывания растворятся в общем проценте.
Если гоняете свои замеры по агентам, напишите, какие расхождения ловили вы. И еще: с нейросетками может произойти что угодно, важно об этом прямо говорить и писать
Please open Telegram to view this post
VIEW IN TELEGRAM
artificialanalysis.ai
Benchmarking GPT-6 Astra
GPT-6 Astra ties leadership with Claude Fable 5.1 in both of our flagship Indices, at lower cost. Astra equals Fable 5.1 in the Intelligence Index at ~40% of the cost, and in the Coding Agent Index at ~60% of the cost.
🔥2❤1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Привет, я Ната🥰
Хочу немного рассказать о себе, особенно тем, кто меня знает совсем недавно.
Я делаю ИИ-агентов и довожу их до рабочего запуска. Веду работу с LLM, проверяю качество ответов, занимаюсь безопасностью ИИ, персональными данными и обезличиванием.
Здесь пишу о том, что начинается после красивого демо: почему агент сегодня работает как надо, а завтра внезапно обретает творческую свободу; как понять его логику; какие промпты выдерживают прод; что можно передавать модели и где уже появляются требования регулятора.
Разбираю новые модели и сервисы: что действительно изменилось, где это можно применять, за что имеет смысл платить и где слово «революция» пока немного опережает события
Отдельно много пишу о безопасности и данных. Потому что хороший ИИ-агент должен быть умным, полезным и желательно не создавать юридическому отделу новые хобби🥰
Пишу простым языком, термины объясняю по ходу.
Если вы используете ИИ в работе, внедряете его в компании или хотите лучше понимать, что происходит внутри этих решений, оставайтесь и добавляйте тех, кому еще это может быть интересно🥰
А свои кейсы и вопросы приносите в комментарии. Особенно те, которые начинаются со слов: «вчера все работало».
Хочу немного рассказать о себе, особенно тем, кто меня знает совсем недавно.
Я делаю ИИ-агентов и довожу их до рабочего запуска. Веду работу с LLM, проверяю качество ответов, занимаюсь безопасностью ИИ, персональными данными и обезличиванием.
Здесь пишу о том, что начинается после красивого демо: почему агент сегодня работает как надо, а завтра внезапно обретает творческую свободу; как понять его логику; какие промпты выдерживают прод; что можно передавать модели и где уже появляются требования регулятора.
Разбираю новые модели и сервисы: что действительно изменилось, где это можно применять, за что имеет смысл платить и где слово «революция» пока немного опережает события
Отдельно много пишу о безопасности и данных. Потому что хороший ИИ-агент должен быть умным, полезным и желательно не создавать юридическому отделу новые хобби
Пишу простым языком, термины объясняю по ходу.
Если вы используете ИИ в работе, внедряете его в компании или хотите лучше понимать, что происходит внутри этих решений, оставайтесь и добавляйте тех, кому еще это может быть интересно
А свои кейсы и вопросы приносите в комментарии. Особенно те, которые начинаются со слов: «вчера все работало».
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤3
LLM-стройка pinned «Привет, я Ната🥰 Хочу немного рассказать о себе, особенно тем, кто меня знает совсем недавно. Я делаю ИИ-агентов и довожу их до рабочего запуска. Веду работу с LLM, проверяю качество ответов, занимаюсь безопасностью ИИ, персональными данными и обезличиванием.…»
This media is not supported in your browser
VIEW IN TELEGRAM
Штош, держу вас в курсе. В свежем борде
арены по реальным задачам творится классическая борьба между Anthropic и OpenAI. На самой верхушке плотно засели новые тяжеловесы – Claude Fable 5.1 Max и GPT 6 Astra Max, которые уверенно тащат запросы. Кто уже пробовал цветочек? Неужели он действительно хорош? https://arena.ai/leaderboard/agent/overall🔥3❤1
Мы снова доказали всему миру несокрушимую мощь отечественной индустрии и триумфально вписали свои имена золотыми буквами в историю глобального первенства. Наши неутомимые цифровые герои, настоящие титаны и первопроходцы проявили несгибаемую волю к победе, совершив колоссальный прорыв и оставив далеко позади всех зарубежных конкурентов вместе с целыми континентами.
Правда, безоговорочное золото мы взяли по числу публичных утечек баз данных: за 2025-й и начало 2026 года в открытый доступ утекли 326 баз почти на 1,2 млрд строк – это вдвое больше показателей Латинской Америки, Африки, Ближнего Востока и СНГ вместе взятых. Зато все хором говорят "не наааадо нам защищать данные, локаааально у нас все"🥰
https://www.comnews.ru/content/247300/2026-09-10/2026-w37/1008/rossiya-okazalas-vperedi-vsekh-utechkam-baz-dannykh
Правда, безоговорочное золото мы взяли по числу публичных утечек баз данных: за 2025-й и начало 2026 года в открытый доступ утекли 326 баз почти на 1,2 млрд строк – это вдвое больше показателей Латинской Америки, Африки, Ближнего Востока и СНГ вместе взятых. Зато все хором говорят "не наааадо нам защищать данные, локаааально у нас все"
https://www.comnews.ru/content/247300/2026-09-10/2026-w37/1008/rossiya-okazalas-vperedi-vsekh-utechkam-baz-dannykh
Please open Telegram to view this post
VIEW IN TELEGRAM
🤪2🔥1
Почему модель отвечает медленно (и виновата ли сама модель)
Давайте обсудим инференс.
Инференс – это когда модель отвечает. Не обучение, не файнтюн, вот этот момент. И внутри он состоит из двух разных фаз (схема выше).
Префилл: модель читает весь промпт одним куском. Тяжелые вычисления, вы смотрите в пустой экран.
Декод: пишет по одному слову, на каждом заглядывая в память. Узкое место здесь уже не вычисления, а скорость памяти.
Отсюда главное. Долго нет первого слова – болеет префилл. Слово появилось, но текст ползет – декод. Болит разное, чинить нужно разное.
Одна и та же модель на одной и той же видеокарте может отвечать восемь секунд или меньше секунды. Люди меняют модель на дорогую, хотя дело было в конфиге.
KV-кэш. Чтобы написать пятидесятое слово, надо помнить сорок девять предыдущих; без кэша модель перечитывала бы весь текст заново на каждом шаге. Включен везде по умолчанию – но кушает почти всю память видеокарты. Половина остальных техник существует, чтобы его туда уместить.
Непрерывный батчинг. Было как автобус: набралась группа – поехали, а кто ответил за секунду, ждет самого медленного. Стало как эскалатор: закончил – сошел, следующий встал на место. Красивая метафора, украла у нейронки.
Кэш начала промпта. В чате каждое сообщение тащит всю переписку, и модель считает одно и то же по двадцатому кругу. Кэш запоминает начало.
Правило, из-за которого у половины это не работает: неизменное (инструкции, документ, история) – в начало, вопрос – в конец. Поменяли первые строки, и кэш сбросился весь. Самая дешевая оптимизация из всех: ничего не ставить, качество не страдает, счет за API падает.
Квантизация. Веса в 16 битах можно сжать в 8 или 4 – как RAW в хороший JPEG. Восьмибитный на глаз не отличить, четырехбитный теряет процент-два. Берем при нехватке памяти.
Спекулятивное декодирование. Выглядит как жульничество: маленькая модель угадывает несколько слов вперед, большая проверяет пачку одним движением. Угадала – приняли целиком, нет – выбросили. Текст на выходе тот же. Быстрее –да, хуже – нет.
Если медленно: определяем фазу по схеме, потом кэш префикса и порядок блоков в промпте, и только потом квантизация со спекулятивкой.
И про хайпы тренды. Дизагрегация – это когда две фазы разносят на разные пулы видеокарт. Технология правда топовая, у крупных в проде, но окупается от тысячи GPU с быстрой сетью. В пет-проекте вы получите только удвоенную сложность. Не берем.
Ликбез на русском: https://www.youtube.com/watch?v=PsKMCmwj-r4
Давайте обсудим инференс.
Инференс – это когда модель отвечает. Не обучение, не файнтюн, вот этот момент. И внутри он состоит из двух разных фаз (схема выше).
Префилл: модель читает весь промпт одним куском. Тяжелые вычисления, вы смотрите в пустой экран.
Декод: пишет по одному слову, на каждом заглядывая в память. Узкое место здесь уже не вычисления, а скорость памяти.
Отсюда главное. Долго нет первого слова – болеет префилл. Слово появилось, но текст ползет – декод. Болит разное, чинить нужно разное.
Одна и та же модель на одной и той же видеокарте может отвечать восемь секунд или меньше секунды. Люди меняют модель на дорогую, хотя дело было в конфиге.
KV-кэш. Чтобы написать пятидесятое слово, надо помнить сорок девять предыдущих; без кэша модель перечитывала бы весь текст заново на каждом шаге. Включен везде по умолчанию – но кушает почти всю память видеокарты. Половина остальных техник существует, чтобы его туда уместить.
Непрерывный батчинг. Было как автобус: набралась группа – поехали, а кто ответил за секунду, ждет самого медленного. Стало как эскалатор: закончил – сошел, следующий встал на место. Красивая метафора, украла у нейронки.
Кэш начала промпта. В чате каждое сообщение тащит всю переписку, и модель считает одно и то же по двадцатому кругу. Кэш запоминает начало.
Правило, из-за которого у половины это не работает: неизменное (инструкции, документ, история) – в начало, вопрос – в конец. Поменяли первые строки, и кэш сбросился весь. Самая дешевая оптимизация из всех: ничего не ставить, качество не страдает, счет за API падает.
Квантизация. Веса в 16 битах можно сжать в 8 или 4 – как RAW в хороший JPEG. Восьмибитный на глаз не отличить, четырехбитный теряет процент-два. Берем при нехватке памяти.
Спекулятивное декодирование. Выглядит как жульничество: маленькая модель угадывает несколько слов вперед, большая проверяет пачку одним движением. Угадала – приняли целиком, нет – выбросили. Текст на выходе тот же. Быстрее –да, хуже – нет.
Если медленно: определяем фазу по схеме, потом кэш префикса и порядок блоков в промпте, и только потом квантизация со спекулятивкой.
И про хайпы тренды. Дизагрегация – это когда две фазы разносят на разные пулы видеокарт. Технология правда топовая, у крупных в проде, но окупается от тысячи GPU с быстрой сетью. В пет-проекте вы получите только удвоенную сложность. Не берем.
Ликбез на русском: https://www.youtube.com/watch?v=PsKMCmwj-r4
🔥3❤1
Нужна ваша помощь.
Собрала инструмент и не понимаю, где он сломается на чужих документах.
Потестите, пожалуйста.
Это ZamenaLab, обезличивание документов прямо в браузере. Находит ФИО, телефоны, СНИЛС, ИНН, паспорта, номера карт, email и меняет их на токены. Обратная замена тоже работает.
Что интересно проверить: закиньте docx или xlsx с реальной структурой и посмотрите, что он пропустил, а что наоборот испортил. Редкие фамилии, инициалы, кривое форматирование, таблицы. Мне важнее найти дыры сейчас, чем красиво выглядеть.
Отдавать документ не страшно. Сервера у меня нет, файл никуда не загружается. Браузер скачивает к вам один html на 155 килобайт со всем кодом внутри, и дальше он работает у вас во вкладке, как обычное приложение. Проверяется за десять секунд: откройте страницу, выключите интернет и работайте дальше, все считается.
Если что то сломается, внутри есть кнопка «сообщить о проблеме». Письмо придет мне с версией сборки и браузером, без содержимого файла.
Это MVP, бантики потом. Буду невероятно благодарна!🥰
Собрала инструмент и не понимаю, где он сломается на чужих документах.
Потестите, пожалуйста.
https://zamenalab.website.yandexcloud.net/
Это ZamenaLab, обезличивание документов прямо в браузере. Находит ФИО, телефоны, СНИЛС, ИНН, паспорта, номера карт, email и меняет их на токены. Обратная замена тоже работает.
Что интересно проверить: закиньте docx или xlsx с реальной структурой и посмотрите, что он пропустил, а что наоборот испортил. Редкие фамилии, инициалы, кривое форматирование, таблицы. Мне важнее найти дыры сейчас, чем красиво выглядеть.
Отдавать документ не страшно. Сервера у меня нет, файл никуда не загружается. Браузер скачивает к вам один html на 155 килобайт со всем кодом внутри, и дальше он работает у вас во вкладке, как обычное приложение. Проверяется за десять секунд: откройте страницу, выключите интернет и работайте дальше, все считается.
Если что то сломается, внутри есть кнопка «сообщить о проблеме». Письмо придет мне с версией сборки и браузером, без содержимого файла.
Это MVP, бантики потом. Буду невероятно благодарна!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Решила написать, с чем я могу помочь, вдруг вы не знаете😈
Я собираю LLM-системы: пайплайны на Python, RAG, агенты, прокси перед моделями.
Работаю и с локальными моделями, и с хостед-провайдерами. Плюс у меня есть свой шлюз обезличивания — им закрываю задачи, где данные клиентов нельзя показывать внешней модели.
Обращаться можно, например, вот с таким.
✍️У вас есть процесс, который люди тянут руками. Договоры, заявки, входящие письма, протоколы встреч. Беру один процесс и переношу рутину на модель. Обязательно с замером до и после, иначе непонятно, стало ли лучше.
✍️Хотите ассистента по своим документам. Чтобы отвечал по регламентам и показывал, откуда взял ответ, а не выдавал список файлов.
✍️Уже что-то внедрили, но эффекта не видно. Это очень частая история. Считаю стоимость запроса и месяца, замеряю качество на ваших же примерах и показываю, где модель врёт и где вы платите за лишнее.
✍️Меняете промпты наугад. Соберу тесты, чтобы каждое изменение проверялось, а не оценивалось на глаз.
✍️Нельзя отправлять персональные данные во внешние модели. Тут как раз шлюз: находит ФИО, СНИЛС, ИНН, паспорт, карты, подменяет их до отправки, а настоящие значения возвращает уже у вас. Заодно смотрю, всё ли в порядке с 152-ФЗ и приказом № 140.
✍️Нужно научить команду. Провожу практикумы на ваших задачах: промпты и evals для разработчиков, безопасность для ИБ, базовый уровень для остальных. Группы небольшие, до десяти человек.
✍️И отдельно: можно приходить просто поговорить про ИИ. Без задачи, без подготовки, с вопросом «а что тут вообще сейчас происходит». Я такие разговоры люблю.
Первые 30 минут бесплатно. Если после этого решим работать — считаю фиксированную цену. Если ИИ вам не нужен, я так и скажу, это тоже нормальный итог разговора.
Пишите в личку @ai_researcherka
Или сразу берите слот в календаре https://calink.ru/natalya-grekova/30min
Я собираю LLM-системы: пайплайны на Python, RAG, агенты, прокси перед моделями.
Работаю и с локальными моделями, и с хостед-провайдерами. Плюс у меня есть свой шлюз обезличивания — им закрываю задачи, где данные клиентов нельзя показывать внешней модели.
Обращаться можно, например, вот с таким.
✍️У вас есть процесс, который люди тянут руками. Договоры, заявки, входящие письма, протоколы встреч. Беру один процесс и переношу рутину на модель. Обязательно с замером до и после, иначе непонятно, стало ли лучше.
✍️Хотите ассистента по своим документам. Чтобы отвечал по регламентам и показывал, откуда взял ответ, а не выдавал список файлов.
✍️Уже что-то внедрили, но эффекта не видно. Это очень частая история. Считаю стоимость запроса и месяца, замеряю качество на ваших же примерах и показываю, где модель врёт и где вы платите за лишнее.
✍️Меняете промпты наугад. Соберу тесты, чтобы каждое изменение проверялось, а не оценивалось на глаз.
✍️Нельзя отправлять персональные данные во внешние модели. Тут как раз шлюз: находит ФИО, СНИЛС, ИНН, паспорт, карты, подменяет их до отправки, а настоящие значения возвращает уже у вас. Заодно смотрю, всё ли в порядке с 152-ФЗ и приказом № 140.
✍️Нужно научить команду. Провожу практикумы на ваших задачах: промпты и evals для разработчиков, безопасность для ИБ, базовый уровень для остальных. Группы небольшие, до десяти человек.
✍️И отдельно: можно приходить просто поговорить про ИИ. Без задачи, без подготовки, с вопросом «а что тут вообще сейчас происходит». Я такие разговоры люблю.
Первые 30 минут бесплатно. Если после этого решим работать — считаю фиксированную цену. Если ИИ вам не нужен, я так и скажу, это тоже нормальный итог разговора.
Пишите в личку @ai_researcherka
Или сразу берите слот в календаре https://calink.ru/natalya-grekova/30min
🔥3
LLM-стройка pinned «Решила написать, с чем я могу помочь, вдруг вы не знаете😈 Я собираю LLM-системы: пайплайны на Python, RAG, агенты, прокси перед моделями. Работаю и с локальными моделями, и с хостед-провайдерами. Плюс у меня есть свой шлюз обезличивания — им закрываю задачи…»
А еще я запустила канал, где пишу о ИИ для новичков, присоединяйтесь, если в этом чате вам стало душно😉
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from LLM для пупсиков
Привет! Это «ЛЛМ для пупсиков»🍼
Я Ната, делаю ИИ-агентов и системы на языковых моделях. У меня есть канал «ЛЛМ-стройка», но там много про инженерию, оценку качества и внутренности.
Читатели честно сказали: сложно.
Поэтому здесь будет то же самое, но по-человечески.
О чем канал:
• как вообще работают языковые модели, простыми словами
• что писать в запросе, чтобы модель вас поняла
• какие сервисы брать бесплатно, а за какие правда стоит платить
• разбор ошибок новичков, включая мои
• маленькие задачи, которые можно автоматизировать уже сегодня
Чего не будет: заумных схем, формул и слова «парадигма».
С чего начать: напишите в комментариях, чем вы пользуетесь сейчас и что бесит больше всего. С этого и начнем первый разбор.
А если захочется глубже, там же рядом «ЛЛМ-стройка» 👉 @llm_stroyka
Я Ната, делаю ИИ-агентов и системы на языковых моделях. У меня есть канал «ЛЛМ-стройка», но там много про инженерию, оценку качества и внутренности.
Читатели честно сказали: сложно.
Поэтому здесь будет то же самое, но по-человечески.
О чем канал:
• как вообще работают языковые модели, простыми словами
• что писать в запросе, чтобы модель вас поняла
• какие сервисы брать бесплатно, а за какие правда стоит платить
• разбор ошибок новичков, включая мои
• маленькие задачи, которые можно автоматизировать уже сегодня
Чего не будет: заумных схем, формул и слова «парадигма».
С чего начать: напишите в комментариях, чем вы пользуетесь сейчас и что бесит больше всего. С этого и начнем первый разбор.
А если захочется глубже, там же рядом «ЛЛМ-стройка» 👉 @llm_stroyka
🔥1
В этот четверг буду рассказывать про агентов и ассистентов. Приходите обязательно 🥰
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡1
Forwarded from Циферблат | Ростов-на-Дону
Давайте избавимся от рутины ⭐️
Проводим воркшоп с Натальей Грековой — каждый соберет ИИ-помощника под свою рабочую рутину: письма, отчеты, ответы клиентам, поиск по регламентам, конспекты встреч.
Подготовка не нужна — только ноутбук и одна задача, которая надоела.
Всё делается промптом и загрузкой своих файлов. Работаем на сервисах, которые открываются из России напрямую, без VPN и зарубежных карт, и стартуют бесплатно.
Что будет за два часа:
🟢 разберем, чем агент отличается от обычного чата и где он реально экономит время;
🟢 напишем системный промпт по готовому шаблону;
🟢 соберем и запустим агента на своей задаче, базовая сборка занимает 10-15 минут;
🟢 проверим агента на прочность в парах и научимся лечить главную болезнь новичков, когда агент выдумывает ответ при нехватке данных;
🟢 обсудим, что нельзя загружать во внешние модели.
✨ 17 сентября | 18:30
Вход по тарифам Ц (4р/мин)
Проводим воркшоп с Натальей Грековой — каждый соберет ИИ-помощника под свою рабочую рутину: письма, отчеты, ответы клиентам, поиск по регламентам, конспекты встреч.
Подготовка не нужна — только ноутбук и одна задача, которая надоела.
Всё делается промптом и загрузкой своих файлов. Работаем на сервисах, которые открываются из России напрямую, без VPN и зарубежных карт, и стартуют бесплатно.
Что будет за два часа:
Ведущая: Наталья Грекова, Founder & AI Engineer. Магистр NLP, 8+ лет в NLP/Data Science. Строю агентные системы и LLM-пайплайны, развиваю продукт для безопасной работы компаний с нейросетями. Экс-преподаватель Яндекс Практикума, автор курса на Udemy.
Вход по тарифам Ц (4р/мин)
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1⚡1🔥1
PAKET_AI_PRAKTIKUM_LLM.zip
1.1 MB
Иногда все идет не по плану😭
Вчера проводила встречу по ИИ-агентам, но нигде не было интернета, соответственно, нормально поработать не получилось. Поэтому я хочу вам предоставить набор материалов для создания простых ИИ-агентов, которые можно запускать в РФ, без впн и тд. Плюс там же есть несколько документов с лайфхаками, например, как дебажить (править ошибки) в таких сервисах.
По материалам можно с нуля сделать три вещи: Telegram-бота
в 2PeopleAssistant, презентацию в Gamma и агента анализа рынка в Nodul, который сам собирает данные и присылает отчет на почту. Внутри 21 страница инструкций с готовыми промптами, демо-данными, тестами и сценарием Nodul для импорта: повторяете пример один в один, потом меняете под свою задачу.
Кода не нужно, только настройки и промпты.
Забирайте архив в закрепе, пишите в комментариях, какой инструмент разобрать подробнее🥰
В комментариях также пишите, если хотите узнать про какой-то другой инструмент (пишите название инструмента)🥰
Вчера проводила встречу по ИИ-агентам, но нигде не было интернета, соответственно, нормально поработать не получилось. Поэтому я хочу вам предоставить набор материалов для создания простых ИИ-агентов, которые можно запускать в РФ, без впн и тд. Плюс там же есть несколько документов с лайфхаками, например, как дебажить (править ошибки) в таких сервисах.
По материалам можно с нуля сделать три вещи: Telegram-бота
в 2PeopleAssistant, презентацию в Gamma и агента анализа рынка в Nodul, который сам собирает данные и присылает отчет на почту. Внутри 21 страница инструкций с готовыми промптами, демо-данными, тестами и сценарием Nodul для импорта: повторяете пример один в один, потом меняете под свою задачу.
Кода не нужно, только настройки и промпты.
Забирайте архив в закрепе, пишите в комментариях, какой инструмент разобрать подробнее
В комментариях также пишите, если хотите узнать про какой-то другой инструмент (пишите название инструмента)
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2🍾1