Прекрасный пример показывающий допустимый уровень доверия к производителям передовых больших языковых моделей.
1. 31.08.26 выходит новость Антропик о произошедшей приостановке внешних проверок по кибербезопасности новых моделей.
2. На следующий день 01.09.26 Антропик выпускает новые версии моделей Fable/Mythos 5.1 в доступ.
При этом о последнем инциденте было сообщено меньше месяца назад 4 августа.
Как выдумаете на сколько реалистичен такой сценарий для крупной компании типа Антропик:
1. Вместе с партнерами проводит полноценное расследование инцидента. Останавливает разработку\оценку новых версий моделей.
2. Предпринимает корректирующие меры для неповторения ситуации.
3. После принятия корректирующих мер производит полный цикл оценки возможностей новой версии продукта.
Все три пункта меньше чем за 1 календарный месяц.
1. 31.08.26 выходит новость Антропик о произошедшей приостановке внешних проверок по кибербезопасности новых моделей.
2. На следующий день 01.09.26 Антропик выпускает новые версии моделей Fable/Mythos 5.1 в доступ.
При этом о последнем инциденте было сообщено меньше месяца назад 4 августа.
Как выдумаете на сколько реалистичен такой сценарий для крупной компании типа Антропик:
1. Вместе с партнерами проводит полноценное расследование инцидента. Останавливает разработку\оценку новых версий моделей.
2. Предпринимает корректирующие меры для неповторения ситуации.
3. После принятия корректирующих мер производит полный цикл оценки возможностей новой версии продукта.
Все три пункта меньше чем за 1 календарный месяц.
Anthropic
Improving our alignment and security efforts
On July 30, we reported three incidents in which Claude models gained unauthorized access to real computer systems. We are conducting an in-depth analysis of both incidents, and planning to work with METR for an independent review. In the meantime, we’re…
Председатель FSB, Andrew Bailey, подготовил предупреждение в адрес Центробанков и министерств финансов G20.
FSB (The Financial Stability Board) это международная организация созданная после финансового кризиса 2008 центральным банками и министерствами экономики\финансов 25 стран, Россия добровольно больше не участвует в заседаниях этого органа.
Основные идеи письма:
1. На фоне кризиса ближнего Востока, нестабильности на рынках суверенного долга (включая повышенные объемы эмиссии, сокращение сроков погашения и более активное использование заемных средств некоторыми участниками рынка) и более широкого использования биржевых инвестиционных фондов (ETF) с кредитным плечом взаимные инвестиции на рынке ИИ могут усилить будущую рыночную коррекцию.
2. Вашу юрисдикцию (страну) может затронуть риски инцидент связанный с ИИ начавшийся в другой стране и их не остановят различия в правовой системе или разница в возможностях кибербезопасности вашей юрисдикции и юрисдикции источника риска.
3. Организации и власти должны быть готовы устранять уязвимости быстро и в большом объеме, даже когда устранение уязвимостей может привести само по себе к вызовам для устойчивости и надежности. Процессы тестирования и восстановления неспособны безопасно адаптироваться.
4. Финансовым институтам, финансовой инфраструктуре и технологическим провайдерам необходимо подготовится к более серьезным сценариям одновременной остановки нескольких организаций и технологических инфраструктур. Такая ситуация усиливает важность возможностей восстановить критические системы с "голого железа" (bare metal).
Я бы воспринимал это письмо как дополнительное косвенное доказательство "ИИ пузыря" и ещё один PR Антропика.
Почему?
1. Сам Andrew Bailey не имеет опыта в ИТ, в кибербезе или в ИИ.
2. Предупреждение направлено им персонально без ссылок на материалы работы экспертных групп.
3. Публичных следов каких либо постоянно действующих комитетов по кибербезопасности найти не удалось. Последний публичный активный проект это фреймворк для сообщения финансовым регуляторам нескольких стран по киберинциденту в формате xlsx и xbrl - Format for Incident Reporting Exchange (FIRE): Taxonomy package. FIRE закончился чуть больше года назад в апреле 2025 года.
4. Andrew Bailey по сути повторил свое предыдущее предупреждение. В апреле этого года подобное предупреждение он сделал, с позиции управляющего банка Англии (Центробанк Великобритании). Т.е. за 4,5 месяца ему не удалось сформировать доказательную базу или по ряду причин он не готов её опубликовать.
FSB (The Financial Stability Board) это международная организация созданная после финансового кризиса 2008 центральным банками и министерствами экономики\финансов 25 стран, Россия добровольно больше не участвует в заседаниях этого органа.
Основные идеи письма:
1. На фоне кризиса ближнего Востока, нестабильности на рынках суверенного долга (включая повышенные объемы эмиссии, сокращение сроков погашения и более активное использование заемных средств некоторыми участниками рынка) и более широкого использования биржевых инвестиционных фондов (ETF) с кредитным плечом взаимные инвестиции на рынке ИИ могут усилить будущую рыночную коррекцию.
2. Вашу юрисдикцию (страну) может затронуть риски инцидент связанный с ИИ начавшийся в другой стране и их не остановят различия в правовой системе или разница в возможностях кибербезопасности вашей юрисдикции и юрисдикции источника риска.
3. Организации и власти должны быть готовы устранять уязвимости быстро и в большом объеме, даже когда устранение уязвимостей может привести само по себе к вызовам для устойчивости и надежности. Процессы тестирования и восстановления неспособны безопасно адаптироваться.
4. Финансовым институтам, финансовой инфраструктуре и технологическим провайдерам необходимо подготовится к более серьезным сценариям одновременной остановки нескольких организаций и технологических инфраструктур. Такая ситуация усиливает важность возможностей восстановить критические системы с "голого железа" (bare metal).
Я бы воспринимал это письмо как дополнительное косвенное доказательство "ИИ пузыря" и ещё один PR Антропика.
Почему?
1. Сам Andrew Bailey не имеет опыта в ИТ, в кибербезе или в ИИ.
2. Предупреждение направлено им персонально без ссылок на материалы работы экспертных групп.
3. Публичных следов каких либо постоянно действующих комитетов по кибербезопасности найти не удалось. Последний публичный активный проект это фреймворк для сообщения финансовым регуляторам нескольких стран по киберинциденту в формате xlsx и xbrl - Format for Incident Reporting Exchange (FIRE): Taxonomy package. FIRE закончился чуть больше года назад в апреле 2025 года.
4. Andrew Bailey по сути повторил свое предыдущее предупреждение. В апреле этого года подобное предупреждение он сделал, с позиции управляющего банка Англии (Центробанк Великобритании). Т.е. за 4,5 месяца ему не удалось сформировать доказательную базу или по ряду причин он не готов её опубликовать.
Financial Stability Board
FSB Chair’s letter to G20 Finance Ministers and Central Bank Governors: August 2026
In his letter to G20 Finance Ministers and Central Bank Governors, Andrew Bailey, warns that markets remain vulnerable to a potential disorderly correction and cautions on the risks posed by frontier…
Очень интересная ситуация складывается в оценке экономической эффективности средств больших языковых моделей.
1. С одной стороны Швейцарский "Банк для центральных банков" Bank for International Settlements оценивает экономический эффект от ИИ в сценарии "ограниченного роста" описывает как "aggregate productivity growth estimates → less than 1% over a long horizon" Т.е. к росту мирового ВВП будут добавятся доли процентов к 2040 году. В докладе явно указано, что такого роста на постоянную величину ежегодно не было со времен промышленной революции.
При этом есть сценарий когда за счет выбытия доходов потребителей, частично или полностью замененных ИИ, мировой ВВП за счет ИИ замедлится.
Скорее всего, именно этот доклад BIS и послужил основой растиражированных слов заместителя Министра финансов РФ Ивана Чебескова про "практически нулевой" эффект от ИИ.
2. С другой стороны есть многочисленные прогнозы требующие значительного инвестирования средств в кибербезопасность и общую безопасность.
Это может говорить о:
1. Наличии "пузыря". Объем инвестированного в ИИ мог бы быть гораздо эффективнее использован для проектов в области образования\человеческого капитала или экономической инфраструктуры.
2. Низком уровне зрелости и проникновения ИИ-нативных процессов в экономику.
3. Прогнозы по возможному экономическому росту BIS опираются на эмпирические данные первой половины 2025 года и некоторые аналитические статьи 2024 года. Т.е. реальное влияние на экономику ещё фактически только предстоит оценить.
1. С одной стороны Швейцарский "Банк для центральных банков" Bank for International Settlements оценивает экономический эффект от ИИ в сценарии "ограниченного роста" описывает как "aggregate productivity growth estimates → less than 1% over a long horizon" Т.е. к росту мирового ВВП будут добавятся доли процентов к 2040 году. В докладе явно указано, что такого роста на постоянную величину ежегодно не было со времен промышленной революции.
При этом есть сценарий когда за счет выбытия доходов потребителей, частично или полностью замененных ИИ, мировой ВВП за счет ИИ замедлится.
Скорее всего, именно этот доклад BIS и послужил основой растиражированных слов заместителя Министра финансов РФ Ивана Чебескова про "практически нулевой" эффект от ИИ.
2. С другой стороны есть многочисленные прогнозы требующие значительного инвестирования средств в кибербезопасность и общую безопасность.
Это может говорить о:
1. Наличии "пузыря". Объем инвестированного в ИИ мог бы быть гораздо эффективнее использован для проектов в области образования\человеческого капитала или экономической инфраструктуры.
2. Низком уровне зрелости и проникновения ИИ-нативных процессов в экономику.
3. Прогнозы по возможному экономическому росту BIS опираются на эмпирические данные первой половины 2025 года и некоторые аналитические статьи 2024 года. Т.е. реальное влияние на экономику ещё фактически только предстоит оценить.
Вышла GPT-6 Astra.
1. По "среднему по больнице" уровню независимых бенчмарков находится на уровне Fable 5 и недавно вошедшей в список передовых моделей Muse Spark 1.3 и ... GPT-5.6 Sol 😀. Т.е. уровень возможностей в среднем значительно не вырос.
2.Условная стоимость за токен выросла в 1.7 раза по отношению к GPT 5.6 Sol в режимах max.
3.Бенчмарки зафиксировали значительный рост точности GPT-6 и падение количества галлюцинаций. Примерный уровень тут сравним с Fable 5.1.
4. Как и у Fable значительный рост защищённости от промтинъекций и улучшенное выравнивание. Но все ещё хуже чем у Fable 5.
5. Из минусов - архитектура модели изменилась и теперь стало сложнее отслеживать т.н. цепочку мыслей (CoT).
Выглядит так что постепенно упираются в границу текущих архитектура рост возможностей моделей. Все недавние передовые модели увеличивают свои возможности только за счёт заметного повышения стоимости использования.
1. По "среднему по больнице" уровню независимых бенчмарков находится на уровне Fable 5 и недавно вошедшей в список передовых моделей Muse Spark 1.3 и ... GPT-5.6 Sol 😀. Т.е. уровень возможностей в среднем значительно не вырос.
2.Условная стоимость за токен выросла в 1.7 раза по отношению к GPT 5.6 Sol в режимах max.
3.Бенчмарки зафиксировали значительный рост точности GPT-6 и падение количества галлюцинаций. Примерный уровень тут сравним с Fable 5.1.
4. Как и у Fable значительный рост защищённости от промтинъекций и улучшенное выравнивание. Но все ещё хуже чем у Fable 5.
5. Из минусов - архитектура модели изменилась и теперь стало сложнее отслеживать т.н. цепочку мыслей (CoT).
Выглядит так что постепенно упираются в границу текущих архитектура рост возможностей моделей. Все недавние передовые модели увеличивают свои возможности только за счёт заметного повышения стоимости использования.
OpenAI Deployment Safety Hub
GPT-6 Astra System Card - OpenAI Deployment Safety Hub
Public, mostly-static site to explore OpenAI safety evaluations, system cards, and posts.
❤2
Три недели спустя релиза Gemini 3.7 Flash Google выпускает версию 3.8 Flash и версию для кибербезопасности Cyber.
Как вы считаете появится ли единый сервис удостоверения доверенности пользователей для всех провайдеров ИИ?
Несмотря на формальную близость по усредненному количеству бенчмарков к лучшим передовым моделям по своим возможностям, Gemini 3.8 flash заметно отстаёт по точности ответов и количеству галлюцинаций.
Не может не радовать системная работа по "встроенным" средства обнаружения промт инъекций и некорректного использования модели теперь и в моделях от Google.
Как вы считаете появится ли единый сервис удостоверения доверенности пользователей для всех провайдеров ИИ?
Несмотря на формальную близость по усредненному количеству бенчмарков к лучшим передовым моделям по своим возможностям, Gemini 3.8 flash заметно отстаёт по точности ответов и количеству галлюцинаций.
Не может не радовать системная работа по "встроенным" средства обнаружения промт инъекций и некорректного использования модели теперь и в моделях от Google.
Google
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
Gemini 3.8 Flash and 3.8 Flash Cyber deliver next-generation intelligence for agentic workflows and cybersecurity.
Ряд экспертов предлагает в принципе уйти от использования бенчмарков потому, что это просто "банк вопросов и ответов" и испытывать модели как стажёров на реальных задачах.
Подход здравый, действительно большинство бенчмарков измеряют оценивают синтетические, оторванные от реальных, задач. При использовании бенчмарков для оценки моделей необходимо учитывать как минимум:
1. Окружение\harness моделей. Большие языковые модели недетерминированы и эксперимент поставленный в вашем окружении может не воспроизвестись в окружении конкурента. Например вы используете модель в своей инфраструктуре, а конкурент облачную инфраструктуру. Пример подобной проблемы для ML описан в этой статье.
2. Если бенчмарк оперирует процентами или баллами не лишним будет уточнить сколько фактических экспериментов было проведено. Согласитесь, что выбирать модели на основе разрыва в 5% при 1 проведенном эксперименте это довольно странно.
3. Не все авторы бенчмарков обладают и используют базовые знания математической статистике. По некоторым оценкам до 45% процентов научных работ содержат грубые статистические ошибки.
Если вернуться к подходу оценке моделей в реальных задачах, а не бенчмарках, то для кибербезопасности здесь довольно интересная ситуация. Несколько недавних попыток таких оценок закончилось взломами реальных компаний. Поэтому в своем подобном эксперименте изучите прошедшие инциденты с OpenAI и Antropic и используйте адекватную изоляцию. Как недавно выяснил Artem Dinaburg из The Trail of Bits адекватная изоляция для передовых моделей это FireCracker.
И все же не все бенчмарки это простой набор вопросов и ответов. Есть бенчмарки с "унижающим" передовые модели результатом, например максимума в 32% смогла добиться в CritPt GPT 5.6/6.
Почему я взял слово унижающим в кавычки? CritPt это бенчмарк созданный 30 академическим организациями состоящий из открытых исследовательских проблем в физике и он оценивает не результат, а способ и путь решения проблемы. Примерный уровень квалификации человека для достижения 32% в этом бенчмарке это уникально сильный магистр или кандидат наук.
Подход здравый, действительно большинство бенчмарков измеряют оценивают синтетические, оторванные от реальных, задач. При использовании бенчмарков для оценки моделей необходимо учитывать как минимум:
1. Окружение\harness моделей. Большие языковые модели недетерминированы и эксперимент поставленный в вашем окружении может не воспроизвестись в окружении конкурента. Например вы используете модель в своей инфраструктуре, а конкурент облачную инфраструктуру. Пример подобной проблемы для ML описан в этой статье.
2. Если бенчмарк оперирует процентами или баллами не лишним будет уточнить сколько фактических экспериментов было проведено. Согласитесь, что выбирать модели на основе разрыва в 5% при 1 проведенном эксперименте это довольно странно.
3. Не все авторы бенчмарков обладают и используют базовые знания математической статистике. По некоторым оценкам до 45% процентов научных работ содержат грубые статистические ошибки.
Если вернуться к подходу оценке моделей в реальных задачах, а не бенчмарках, то для кибербезопасности здесь довольно интересная ситуация. Несколько недавних попыток таких оценок закончилось взломами реальных компаний. Поэтому в своем подобном эксперименте изучите прошедшие инциденты с OpenAI и Antropic и используйте адекватную изоляцию. Как недавно выяснил Artem Dinaburg из The Trail of Bits адекватная изоляция для передовых моделей это FireCracker.
И все же не все бенчмарки это простой набор вопросов и ответов. Есть бенчмарки с "унижающим" передовые модели результатом, например максимума в 32% смогла добиться в CritPt GPT 5.6/6.
Почему я взял слово унижающим в кавычки? CritPt это бенчмарк созданный 30 академическим организациями состоящий из открытых исследовательских проблем в физике и он оценивает не результат, а способ и путь решения проблемы. Примерный уровень квалификации человека для достижения 32% в этом бенчмарке это уникально сильный магистр или кандидат наук.
MDPI
A Reproducible Benchmarking Methodology for Machine Learning Hardware: Performance–Energy Trade-Offs from GPUs to Apple Silicon
While hardware selection is widely recognized as a key factor in machine learning performance, systematic and reproducible evaluation across heterogeneous and accessible platforms remains limited, particularly when jointly considering execution time, energy…
Отдельного поста достойна проблема научной воспроизводимости.
Научная основа самого бенчмарка может оказаться частично или полностью некорректной. На недавнем хакатоне HuggingFace участники в течении 2,5 недель пытались проверить 2226 статей из всех 6341 принятых на ICML 2026 (International Conference on Machine Learning). ICML — это одна из самых престижных конференций по искусственному интеллекту в мире. Наряду с NeurIPS и CVPR, она входит в «большую тройку» научных мероприятий высшего уровня (A*) в области машинного обучения.
За время хакатона участникам удалось воспроизвести полностью только 12% статей (266).
23% (496) статей содержали как минимум 1 ложное или спорное утверждение.
Как результат хакатона HuggingFace выделил:
1. На текущий момент возможности ИИ агентов достигли предела. Наилучшие результаты получаются когда за работу агента направляет человек.
2. Некоторые виды оценок доступны пока только человеку.
3. Какая текущая роль человека в подобной оценке? HuggingFace считает это, что создание условий для эксперимента и формирование правильных вопросов для исследования, подобно профессору, который направляет своих дипломников.
P.s. Проблема воспроизводимости научных результатов шире, чем исследования в ИИ или проверка новых эксплойтов. Получив в 2010 году название "Кризис воспроизводимости".
Научная основа самого бенчмарка может оказаться частично или полностью некорректной. На недавнем хакатоне HuggingFace участники в течении 2,5 недель пытались проверить 2226 статей из всех 6341 принятых на ICML 2026 (International Conference on Machine Learning). ICML — это одна из самых престижных конференций по искусственному интеллекту в мире. Наряду с NeurIPS и CVPR, она входит в «большую тройку» научных мероприятий высшего уровня (A*) в области машинного обучения.
За время хакатона участникам удалось воспроизвести полностью только 12% статей (266).
23% (496) статей содержали как минимум 1 ложное или спорное утверждение.
Как результат хакатона HuggingFace выделил:
1. На текущий момент возможности ИИ агентов достигли предела. Наилучшие результаты получаются когда за работу агента направляет человек.
2. Некоторые виды оценок доступны пока только человеку.
3. Какая текущая роль человека в подобной оценке? HuggingFace считает это, что создание условий для эксперимента и формирование правильных вопросов для исследования, подобно профессору, который направляет своих дипломников.
P.s. Проблема воспроизводимости научных результатов шире, чем исследования в ИИ или проверка новых эксплойтов. Получив в 2010 году название "Кризис воспроизводимости".
huggingface.co
What We Learned by Reproducing 2,200 papers from ICML
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Это очень интересно.
На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей.
По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем по своим возможностям GPT-5.6 (Sol) в режиме усилий max. У обоих моделей было по 61 баллу.
В версии методологии 4.2 GPT-6 (Astra) по своим возможностям набрала 55 баллов, а GPT-5.6 (Sol) - 51 балл. В новой версии методологии Astra отстает только от Fable 5.1 по возможностям.
Между версиями методологии оценки возможностей 4.1 и 4.2 - прошло меньше месяца.
Вывод не изменился - итоги внешних бенчмарков для составления короткого списка на реальный тест, в прод только после реального теста на вашем окружении и с вашими данными.
На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей.
По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем по своим возможностям GPT-5.6 (Sol) в режиме усилий max. У обоих моделей было по 61 баллу.
В версии методологии 4.2 GPT-6 (Astra) по своим возможностям набрала 55 баллов, а GPT-5.6 (Sol) - 51 балл. В новой версии методологии Astra отстает только от Fable 5.1 по возможностям.
Между версиями методологии оценки возможностей 4.1 и 4.2 - прошло меньше месяца.
Вывод не изменился - итоги внешних бенчмарков для составления короткого списка на реальный тест, в прод только после реального теста на вашем окружении и с вашими данными.
👍1😁1
Антропик во исполнение законодательства ЕС запустил сервис по определению был ли файл сгенерирован Claude. Отличное решение и файлов для обучения модели подсоберут и требования закона выполнят. Текст пока не детектирует для всех.
Аналогичная функция для текста пока ограничена только компаниями кому это нужно по требованиям ЕС. Доступ к сервису по API пока только в планах в планах.
Есть аналогичный сервис от Яндекса Нейродетектор. Анализирует текст и файлы.
Разница в том, что Антропик проверяет наличие своего водяного знака, а сервис Яндекса ищет статистические закономерности и штампы. По некоторым исследованиям для точного определения авторства текста нужно возможно большое количество текста. На нескольких словах или одном предложении высокий шанс ошибки.
Зачем подобные инструменты это в кибербезе:
1.Защита от дипфейков.
2. Проверка того, что заключение было написано человеком, а не галюцинация ИИ.
Определенный спрос на подобные онпрем решения будет неизбежным и это вполне себе небольшой сегмент рынка который пока имеет игроков в основном для детектирования изображений и видео.
Аналогичная функция для текста пока ограничена только компаниями кому это нужно по требованиям ЕС. Доступ к сервису по API пока только в планах в планах.
Есть аналогичный сервис от Яндекса Нейродетектор. Анализирует текст и файлы.
Разница в том, что Антропик проверяет наличие своего водяного знака, а сервис Яндекса ищет статистические закономерности и штампы. По некоторым исследованиям для точного определения авторства текста нужно возможно большое количество текста. На нескольких словах или одном предложении высокий шанс ошибки.
Зачем подобные инструменты это в кибербезе:
1.Защита от дипфейков.
2. Проверка того, что заключение было написано человеком, а не галюцинация ИИ.
Определенный спрос на подобные онпрем решения будет неизбежным и это вполне себе небольшой сегмент рынка который пока имеет игроков в основном для детектирования изображений и видео.
Claude
Check if files were made with Claude
Add a file to check for signs it was made with Claude.
Делюсь с вами своим субъективным опытом использования бесплатных версий ИИ сервисов в режиме чата. Не у всех есть возможность оплачивать сервисы ИИ с иностранных карт и доступ к иностранным IP.
1. На мой взгляд самая сильная модель доступная бесплатно это Claude Sonnet 5.0 в режиме max.
+ Бесплатно вам может решить довольно сложные задачи.
- Основная проблема, в режиме max вы рискуете не получить ответ даже на 1 вопрос до истечения вашего 5 часового лимита.
2. ChatGPT заметно отстает от Sonnet 5.0 и имеет только 2 режима - простой и с размышлениями.
+ Довольная сильная модель. Под капотом явно не указано, но по открытой информации GPT-5.6 (Luna) c режимом усилий low (?)-medium(?). Зато в текстовом режиме лимиты исчерпать у меня не получилось, отключается режим работы с файлами при превышения некоего лимита.
- в явном виде не нашел, выглядит как неплохая бытовая модель для простых вопросов (ответы на которые надо все равно проверять).
3. Google Gemini. Несмотря на релизы Gemini Flash 3.7 и 3.8 в бесплатной версии я пока видел только 3.5 Lite Flash, 3.6 Flash и 3.1 Pro.
+ довольно высокие квоты по бесплатному контексту, удобно подключить к уже имеющимся на сервисах Google файлах. Ключевая особенность функция глубокого исследования (аналогичная только у Qwen). У остальных сервисов эта функция только в платных тарифах. Другой важный плюс - доступен фактически из поисковой строки Google с Российских IP.
- Из сильных минусов, большой процент галюцинаций, может в ответ на вопрос выдумать целые книги. Лимиты довольно быстро кончаются.
4. Deepseek . Flash по умолчанию, Pro — в Expert-режиме.
+Из плюсов доступен с российских IP. Экстремально быстрые ответы.
- Для качественных ответов нужно внимательно читать рассуждения модели и корректировать свой промт. В экспертном режиме отключается поиск данных в Интернет и доступные знания отказываются на 2025 год.
5. Интересно выглядит Qwen3.8-Max.
+Способна решать сложные задачи. В лимиты пока не упирался. Есть функционал глубокого исследования. доступна с Российских IP.
- В отличии от Claude, ChatGPT, Gemini хуже справляется с предугадыванием следующего шага, нужно лучше формулировать свой промт.
Про свой опыт использования локальных моделей\агентов или OpenRouter расскажу в других постах.
p.s. Глубокое исследование - это функционал ИИ чата позволяющий вам получить эквивалент научной статьи по заданной вами теме и (или) источниками. Считается, что чуть лучше погружается в материал и вы тратите меньше времени на промтинг. Эдакий сервис Яндекс реферат из прошлого, только предоставляющий реальный результат.
p.p.s. Хорошей практикой прежде чем потратить свои лимиты является уточнение своего промта с моделью.
1. На мой взгляд самая сильная модель доступная бесплатно это Claude Sonnet 5.0 в режиме max.
+ Бесплатно вам может решить довольно сложные задачи.
- Основная проблема, в режиме max вы рискуете не получить ответ даже на 1 вопрос до истечения вашего 5 часового лимита.
2. ChatGPT заметно отстает от Sonnet 5.0 и имеет только 2 режима - простой и с размышлениями.
+ Довольная сильная модель. Под капотом явно не указано, но по открытой информации GPT-5.6 (Luna) c режимом усилий low (?)-medium(?). Зато в текстовом режиме лимиты исчерпать у меня не получилось, отключается режим работы с файлами при превышения некоего лимита.
- в явном виде не нашел, выглядит как неплохая бытовая модель для простых вопросов (ответы на которые надо все равно проверять).
3. Google Gemini. Несмотря на релизы Gemini Flash 3.7 и 3.8 в бесплатной версии я пока видел только 3.5 Lite Flash, 3.6 Flash и 3.1 Pro.
+ довольно высокие квоты по бесплатному контексту, удобно подключить к уже имеющимся на сервисах Google файлах. Ключевая особенность функция глубокого исследования (аналогичная только у Qwen). У остальных сервисов эта функция только в платных тарифах. Другой важный плюс - доступен фактически из поисковой строки Google с Российских IP.
- Из сильных минусов, большой процент галюцинаций, может в ответ на вопрос выдумать целые книги. Лимиты довольно быстро кончаются.
4. Deepseek . Flash по умолчанию, Pro — в Expert-режиме.
+Из плюсов доступен с российских IP. Экстремально быстрые ответы.
- Для качественных ответов нужно внимательно читать рассуждения модели и корректировать свой промт. В экспертном режиме отключается поиск данных в Интернет и доступные знания отказываются на 2025 год.
5. Интересно выглядит Qwen3.8-Max.
+Способна решать сложные задачи. В лимиты пока не упирался. Есть функционал глубокого исследования. доступна с Российских IP.
- В отличии от Claude, ChatGPT, Gemini хуже справляется с предугадыванием следующего шага, нужно лучше формулировать свой промт.
Про свой опыт использования локальных моделей\агентов или OpenRouter расскажу в других постах.
p.s. Глубокое исследование - это функционал ИИ чата позволяющий вам получить эквивалент научной статьи по заданной вами теме и (или) источниками. Считается, что чуть лучше погружается в материал и вы тратите меньше времени на промтинг. Эдакий сервис Яндекс реферат из прошлого, только предоставляющий реальный результат.
p.p.s. Хорошей практикой прежде чем потратить свои лимиты является уточнение своего промта с моделью.
Claude
Claude is Anthropic's AI, built for problem solvers. Tackle complex challenges, analyze data, write code, and think through your hardest work.
❤2
Вот такой получился шорт лист из бесплатных моделей, если верить artificialanalysis.ai
VP Cybersecurity Brief
Это очень интересно. На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей. По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем…
Как улучшить результаты большой языковой модели меньше чем за неделю с релиза?
Надо 2 раза обновить методологию оценки, добавив в неё бенчмарк с приватным датасетом.
К версии методологии 4.3 от artificialanalysis.ai GPT-6 "доросла" до уровня Fable 5.1.
Надо 2 раза обновить методологию оценки, добавив в неё бенчмарк с приватным датасетом.
К версии методологии 4.3 от artificialanalysis.ai GPT-6 "доросла" до уровня Fable 5.1.
У Еврокомисии появился значительный рычаг в переговорах с OpenAI.
OpenAI может быть привлечена сразу за нарушение 2 законов ЕС AI ACT и GDPR за взлом немецкой wiki.
Штраф - до 7% от оборота за AI ACT и до 4% от оборота за GDPR. С учетом выручки OpenAI за 2025 год в 13 млрд долларов , компании грозит штраф примерно до 1,5 млрд $.
Такой штраф маловероятен-нужно доказать 2 состава, для GDPR доказать, что виновен человек и т.д.
Даже сам факт символического штрафа от ЕС может заметно омрачить перспективы IPO.
OpenAI может быть привлечена сразу за нарушение 2 законов ЕС AI ACT и GDPR за взлом немецкой wiki.
Штраф - до 7% от оборота за AI ACT и до 4% от оборота за GDPR. С учетом выручки OpenAI за 2025 год в 13 млрд долларов , компании грозит штраф примерно до 1,5 млрд $.
Такой штраф маловероятен-нужно доказать 2 состава, для GDPR доказать, что виновен человек и т.д.
Даже сам факт символического штрафа от ЕС может заметно омрачить перспективы IPO.
👀1
VP Cybersecurity Brief
Если у вас или ваших подрядчиков есть разработка на C# - имеет смысл запланировать тестирование нового функционала по безопасной работе с памятью на конец 2026. Начиная с .Net 11 (релиз ноябрь 2026) этот функционал будет доступен в режиме превью. В .Net…
Можно уже протестировать новый функционал C# по безопасной работе с памятью, особенно если вы в финтехе или e-commerce.
По задумке объединения (Union types) и закрытые иерархии (Closed hierarchies) позволяют идеально описывать статусы транзакций, результаты валидации, цепочки согласований или состояния счетов (например: Success, InsufficientFunds, CardExpired). Компилятор гарантирует, что разработчик обработал все возможные исходы, исключая непредвиденные сбои.
По задумке объединения (Union types) и закрытые иерархии (Closed hierarchies) позволяют идеально описывать статусы транзакций, результаты валидации, цепочки согласований или состояния счетов (например: Success, InsufficientFunds, CardExpired). Компилятор гарантирует, что разработчик обработал все возможные исходы, исключая непредвиденные сбои.
В новом исследовании Booz Allen Hamilton приводится результат оценки доступных моделей на предмет поиска уязвимостей и способности модели пройти по kill chain до конца. Booz Allen Hamilton это крупный консалтер в оборонном комплексе США.
Как это часто бывает в мире ИИ, к моменту публикации исследования большинство исследованных моделей уже устарели ;)
Из неожиданного Grok 4.5 на втором месте в общем рейтинге. Злые языки бы связали это второе место с текущими контрактами компаний Илона Маска с оборонным сектором США.
Отдельно могу выделить рекомендацию использовать технологии обмана и активной защиты и неожиданный прогноз, что через 2 года ИИ будет больше помогать защитникам чем атакующим. Остальные рекомендации "стандартные" с момента релиза Mythos.
Как это часто бывает в мире ИИ, к моменту публикации исследования большинство исследованных моделей уже устарели ;)
Из неожиданного Grok 4.5 на втором месте в общем рейтинге. Злые языки бы связали это второе место с текущими контрактами компаний Илона Маска с оборонным сектором США.
Отдельно могу выделить рекомендацию использовать технологии обмана и активной защиты и неожиданный прогноз, что через 2 года ИИ будет больше помогать защитникам чем атакующим. Остальные рекомендации "стандартные" с момента релиза Mythos.