Это очень интересно.
На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей.
По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем по своим возможностям GPT-5.6 (Sol) в режиме усилий max. У обоих моделей было по 61 баллу.
В версии методологии 4.2 GPT-6 (Astra) по своим возможностям набрала 55 баллов, а GPT-5.6 (Sol) - 51 балл. В новой версии методологии Astra отстает только от Fable 5.1 по возможностям.
Между версиями методологии оценки возможностей 4.1 и 4.2 - прошло меньше месяца.
Вывод не изменился - итоги внешних бенчмарков для составления короткого списка на реальный тест, в прод только после реального теста на вашем окружении и с вашими данными.
На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей.
По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем по своим возможностям GPT-5.6 (Sol) в режиме усилий max. У обоих моделей было по 61 баллу.
В версии методологии 4.2 GPT-6 (Astra) по своим возможностям набрала 55 баллов, а GPT-5.6 (Sol) - 51 балл. В новой версии методологии Astra отстает только от Fable 5.1 по возможностям.
Между версиями методологии оценки возможностей 4.1 и 4.2 - прошло меньше месяца.
Вывод не изменился - итоги внешних бенчмарков для составления короткого списка на реальный тест, в прод только после реального теста на вашем окружении и с вашими данными.
👍1😁1
Антропик во исполнение законодательства ЕС запустил сервис по определению был ли файл сгенерирован Claude. Отличное решение и файлов для обучения модели подсоберут и требования закона выполнят. Текст пока не детектирует для всех.
Аналогичная функция для текста пока ограничена только компаниями кому это нужно по требованиям ЕС. Доступ к сервису по API пока только в планах в планах.
Есть аналогичный сервис от Яндекса Нейродетектор. Анализирует текст и файлы.
Разница в том, что Антропик проверяет наличие своего водяного знака, а сервис Яндекса ищет статистические закономерности и штампы. По некоторым исследованиям для точного определения авторства текста нужно возможно большое количество текста. На нескольких словах или одном предложении высокий шанс ошибки.
Зачем подобные инструменты это в кибербезе:
1.Защита от дипфейков.
2. Проверка того, что заключение было написано человеком, а не галюцинация ИИ.
Определенный спрос на подобные онпрем решения будет неизбежным и это вполне себе небольшой сегмент рынка который пока имеет игроков в основном для детектирования изображений и видео.
Аналогичная функция для текста пока ограничена только компаниями кому это нужно по требованиям ЕС. Доступ к сервису по API пока только в планах в планах.
Есть аналогичный сервис от Яндекса Нейродетектор. Анализирует текст и файлы.
Разница в том, что Антропик проверяет наличие своего водяного знака, а сервис Яндекса ищет статистические закономерности и штампы. По некоторым исследованиям для точного определения авторства текста нужно возможно большое количество текста. На нескольких словах или одном предложении высокий шанс ошибки.
Зачем подобные инструменты это в кибербезе:
1.Защита от дипфейков.
2. Проверка того, что заключение было написано человеком, а не галюцинация ИИ.
Определенный спрос на подобные онпрем решения будет неизбежным и это вполне себе небольшой сегмент рынка который пока имеет игроков в основном для детектирования изображений и видео.
Claude
Check if files were made with Claude
Add a file to check for signs it was made with Claude.
Делюсь с вами своим субъективным опытом использования бесплатных версий ИИ сервисов в режиме чата. Не у всех есть возможность оплачивать сервисы ИИ с иностранных карт и доступ к иностранным IP.
1. На мой взгляд самая сильная модель доступная бесплатно это Claude Sonnet 5.0 в режиме max.
+ Бесплатно вам может решить довольно сложные задачи.
- Основная проблема, в режиме max вы рискуете не получить ответ даже на 1 вопрос до истечения вашего 5 часового лимита.
2. ChatGPT заметно отстает от Sonnet 5.0 и имеет только 2 режима - простой и с размышлениями.
+ Довольная сильная модель. Под капотом явно не указано, но по открытой информации GPT-5.6 (Luna) c режимом усилий low (?)-medium(?). Зато в текстовом режиме лимиты исчерпать у меня не получилось, отключается режим работы с файлами при превышения некоего лимита.
- в явном виде не нашел, выглядит как неплохая бытовая модель для простых вопросов (ответы на которые надо все равно проверять).
3. Google Gemini. Несмотря на релизы Gemini Flash 3.7 и 3.8 в бесплатной версии я пока видел только 3.5 Lite Flash, 3.6 Flash и 3.1 Pro.
+ довольно высокие квоты по бесплатному контексту, удобно подключить к уже имеющимся на сервисах Google файлах. Ключевая особенность функция глубокого исследования (аналогичная только у Qwen). У остальных сервисов эта функция только в платных тарифах. Другой важный плюс - доступен фактически из поисковой строки Google с Российских IP.
- Из сильных минусов, большой процент галюцинаций, может в ответ на вопрос выдумать целые книги. Лимиты довольно быстро кончаются.
4. Deepseek . Flash по умолчанию, Pro — в Expert-режиме.
+Из плюсов доступен с российских IP. Экстремально быстрые ответы.
- Для качественных ответов нужно внимательно читать рассуждения модели и корректировать свой промт. В экспертном режиме отключается поиск данных в Интернет и доступные знания отказываются на 2025 год.
5. Интересно выглядит Qwen3.8-Max.
+Способна решать сложные задачи. В лимиты пока не упирался. Есть функционал глубокого исследования. доступна с Российских IP.
- В отличии от Claude, ChatGPT, Gemini хуже справляется с предугадыванием следующего шага, нужно лучше формулировать свой промт.
Про свой опыт использования локальных моделей\агентов или OpenRouter расскажу в других постах.
p.s. Глубокое исследование - это функционал ИИ чата позволяющий вам получить эквивалент научной статьи по заданной вами теме и (или) источниками. Считается, что чуть лучше погружается в материал и вы тратите меньше времени на промтинг. Эдакий сервис Яндекс реферат из прошлого, только предоставляющий реальный результат.
p.p.s. Хорошей практикой прежде чем потратить свои лимиты является уточнение своего промта с моделью.
1. На мой взгляд самая сильная модель доступная бесплатно это Claude Sonnet 5.0 в режиме max.
+ Бесплатно вам может решить довольно сложные задачи.
- Основная проблема, в режиме max вы рискуете не получить ответ даже на 1 вопрос до истечения вашего 5 часового лимита.
2. ChatGPT заметно отстает от Sonnet 5.0 и имеет только 2 режима - простой и с размышлениями.
+ Довольная сильная модель. Под капотом явно не указано, но по открытой информации GPT-5.6 (Luna) c режимом усилий low (?)-medium(?). Зато в текстовом режиме лимиты исчерпать у меня не получилось, отключается режим работы с файлами при превышения некоего лимита.
- в явном виде не нашел, выглядит как неплохая бытовая модель для простых вопросов (ответы на которые надо все равно проверять).
3. Google Gemini. Несмотря на релизы Gemini Flash 3.7 и 3.8 в бесплатной версии я пока видел только 3.5 Lite Flash, 3.6 Flash и 3.1 Pro.
+ довольно высокие квоты по бесплатному контексту, удобно подключить к уже имеющимся на сервисах Google файлах. Ключевая особенность функция глубокого исследования (аналогичная только у Qwen). У остальных сервисов эта функция только в платных тарифах. Другой важный плюс - доступен фактически из поисковой строки Google с Российских IP.
- Из сильных минусов, большой процент галюцинаций, может в ответ на вопрос выдумать целые книги. Лимиты довольно быстро кончаются.
4. Deepseek . Flash по умолчанию, Pro — в Expert-режиме.
+Из плюсов доступен с российских IP. Экстремально быстрые ответы.
- Для качественных ответов нужно внимательно читать рассуждения модели и корректировать свой промт. В экспертном режиме отключается поиск данных в Интернет и доступные знания отказываются на 2025 год.
5. Интересно выглядит Qwen3.8-Max.
+Способна решать сложные задачи. В лимиты пока не упирался. Есть функционал глубокого исследования. доступна с Российских IP.
- В отличии от Claude, ChatGPT, Gemini хуже справляется с предугадыванием следующего шага, нужно лучше формулировать свой промт.
Про свой опыт использования локальных моделей\агентов или OpenRouter расскажу в других постах.
p.s. Глубокое исследование - это функционал ИИ чата позволяющий вам получить эквивалент научной статьи по заданной вами теме и (или) источниками. Считается, что чуть лучше погружается в материал и вы тратите меньше времени на промтинг. Эдакий сервис Яндекс реферат из прошлого, только предоставляющий реальный результат.
p.p.s. Хорошей практикой прежде чем потратить свои лимиты является уточнение своего промта с моделью.
Claude
Claude is Anthropic's AI, built for problem solvers. Tackle complex challenges, analyze data, write code, and think through your hardest work.
❤2
Вот такой получился шорт лист из бесплатных моделей, если верить artificialanalysis.ai
VP Cybersecurity Brief
Это очень интересно. На следующий день после бенчмаркинга GPT-6 (Astra) один из ведущих провайдеров мета бенчмарков artificialanalysis.ai изменил методологию оценки возможностей моделей. По версии методологии 4.1 GPT-6 (Astra) соответствовала в среднем…
Как улучшить результаты большой языковой модели меньше чем за неделю с релиза?
Надо 2 раза обновить методологию оценки, добавив в неё бенчмарк с приватным датасетом.
К версии методологии 4.3 от artificialanalysis.ai GPT-6 "доросла" до уровня Fable 5.1.
Надо 2 раза обновить методологию оценки, добавив в неё бенчмарк с приватным датасетом.
К версии методологии 4.3 от artificialanalysis.ai GPT-6 "доросла" до уровня Fable 5.1.
У Еврокомисии появился значительный рычаг в переговорах с OpenAI.
OpenAI может быть привлечена сразу за нарушение 2 законов ЕС AI ACT и GDPR за взлом немецкой wiki.
Штраф - до 7% от оборота за AI ACT и до 4% от оборота за GDPR. С учетом выручки OpenAI за 2025 год в 13 млрд долларов , компании грозит штраф примерно до 1,5 млрд $.
Такой штраф маловероятен-нужно доказать 2 состава, для GDPR доказать, что виновен человек и т.д.
Даже сам факт символического штрафа от ЕС может заметно омрачить перспективы IPO.
OpenAI может быть привлечена сразу за нарушение 2 законов ЕС AI ACT и GDPR за взлом немецкой wiki.
Штраф - до 7% от оборота за AI ACT и до 4% от оборота за GDPR. С учетом выручки OpenAI за 2025 год в 13 млрд долларов , компании грозит штраф примерно до 1,5 млрд $.
Такой штраф маловероятен-нужно доказать 2 состава, для GDPR доказать, что виновен человек и т.д.
Даже сам факт символического штрафа от ЕС может заметно омрачить перспективы IPO.
👀1
VP Cybersecurity Brief
Если у вас или ваших подрядчиков есть разработка на C# - имеет смысл запланировать тестирование нового функционала по безопасной работе с памятью на конец 2026. Начиная с .Net 11 (релиз ноябрь 2026) этот функционал будет доступен в режиме превью. В .Net…
Можно уже протестировать новый функционал C# по безопасной работе с памятью, особенно если вы в финтехе или e-commerce.
По задумке объединения (Union types) и закрытые иерархии (Closed hierarchies) позволяют идеально описывать статусы транзакций, результаты валидации, цепочки согласований или состояния счетов (например: Success, InsufficientFunds, CardExpired). Компилятор гарантирует, что разработчик обработал все возможные исходы, исключая непредвиденные сбои.
По задумке объединения (Union types) и закрытые иерархии (Closed hierarchies) позволяют идеально описывать статусы транзакций, результаты валидации, цепочки согласований или состояния счетов (например: Success, InsufficientFunds, CardExpired). Компилятор гарантирует, что разработчик обработал все возможные исходы, исключая непредвиденные сбои.
В новом исследовании Booz Allen Hamilton приводится результат оценки доступных моделей на предмет поиска уязвимостей и способности модели пройти по kill chain до конца. Booz Allen Hamilton это крупный консалтер в оборонном комплексе США.
Как это часто бывает в мире ИИ, к моменту публикации исследования большинство исследованных моделей уже устарели ;)
Из неожиданного Grok 4.5 на втором месте в общем рейтинге. Злые языки бы связали это второе место с текущими контрактами компаний Илона Маска с оборонным сектором США.
Отдельно могу выделить рекомендацию использовать технологии обмана и активной защиты и неожиданный прогноз, что через 2 года ИИ будет больше помогать защитникам чем атакующим. Остальные рекомендации "стандартные" с момента релиза Mythos.
Как это часто бывает в мире ИИ, к моменту публикации исследования большинство исследованных моделей уже устарели ;)
Из неожиданного Grok 4.5 на втором месте в общем рейтинге. Злые языки бы связали это второе место с текущими контрактами компаний Илона Маска с оборонным сектором США.
Отдельно могу выделить рекомендацию использовать технологии обмана и активной защиты и неожиданный прогноз, что через 2 года ИИ будет больше помогать защитникам чем атакующим. Остальные рекомендации "стандартные" с момента релиза Mythos.
Forwarded from Dealer.AI
OpenAI попала в скандал с "решением" задачи тысячелетия: математик обвиняет ИИ-гиганта в краже идей
Вот ещё новость интересная.
Математик Тристан Бакмастер утверждает, что OpenAI тайно использовала данные его закрытых сессий в Codex, чтобы получить решение одной из проблем тысячелетия – уравнений Навье–Стокса. Речь о доказательстве
"вынужденного взрыва" в трёхмерном пространстве, варианты c и d по классификации Феффермана.😐
Что известно?
· Бакмастер вместе с коллегой Левентом Альпёге разработал около 100 страниц доказательства по этому направлению - почти никем не изученному.
· Вскоре после того, как информация об их работе попала в OpenAI, компания предъявила результат по той же самой задаче, заявив, что её внутренняя модель решила её "почти без людей" – достаточно было одного промпта.🚬
Однако вскрылись подозрительные детали:
· Термин «forced» в промпте - слишком узкий, чтобы возникнуть случайно;
· На деле над решением трудилась целая команда, а стартовали с уравнений Эйлера;
· Промпт готовился с помощью Codex (того самого инструмента, который мог видеть данные Бакмастера);
· Расход вычислительных ресурсов был колоссальным;
· И самое главное – первый запрос был отправлен после того, как сведения о работе математиков достигли OpenAI.
Чем это грозит?
Если обвинения подтвердятся, нас ждёт:
· Крупнейший этический скандал в области AI.for science;
· Пересмотр политики приватности GitHub Copilot и Codex;
· Крах красивой легенды о том, что ИИ сам, без подсказок, штурмует задачи тысячелетия.
OpenAI пока не ответила на прямые вопросы о временных метках. Бакмастер в бешенстве: «What the fuck is happening!!!»🇨🇩
Ваше мнение - это вопиющая утечка данных или невероятное совпадение?
В целом, я всегда говорю, галочка "не логировать" не даёт 100% уверенности, что ваш диалог не утекает в обучение.😏
Делитесь в комментариях.
👇 👇 👇
Вот ещё новость интересная.
Математик Тристан Бакмастер утверждает, что OpenAI тайно использовала данные его закрытых сессий в Codex, чтобы получить решение одной из проблем тысячелетия – уравнений Навье–Стокса. Речь о доказательстве
"вынужденного взрыва" в трёхмерном пространстве, варианты c и d по классификации Феффермана.
Что известно?
· Бакмастер вместе с коллегой Левентом Альпёге разработал около 100 страниц доказательства по этому направлению - почти никем не изученному.
· Вскоре после того, как информация об их работе попала в OpenAI, компания предъявила результат по той же самой задаче, заявив, что её внутренняя модель решила её "почти без людей" – достаточно было одного промпта.
Однако вскрылись подозрительные детали:
· Термин «forced» в промпте - слишком узкий, чтобы возникнуть случайно;
· На деле над решением трудилась целая команда, а стартовали с уравнений Эйлера;
· Промпт готовился с помощью Codex (того самого инструмента, который мог видеть данные Бакмастера);
· Расход вычислительных ресурсов был колоссальным;
· И самое главное – первый запрос был отправлен после того, как сведения о работе математиков достигли OpenAI.
Чем это грозит?
Если обвинения подтвердятся, нас ждёт:
· Крупнейший этический скандал в области AI.for science;
· Пересмотр политики приватности GitHub Copilot и Codex;
· Крах красивой легенды о том, что ИИ сам, без подсказок, штурмует задачи тысячелетия.
OpenAI пока не ответила на прямые вопросы о временных метках. Бакмастер в бешенстве: «What the fuck is happening!!!»
Ваше мнение - это вопиющая утечка данных или невероятное совпадение?
В целом, я всегда говорю, галочка "не логировать" не даёт 100% уверенности, что ваш диалог не утекает в обучение.
Делитесь в комментариях.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Dealer.AI
Dealer.AI
OpenAI попала в скандал с "решением" задачи тысячелетия: математик обвиняет ИИ-гиганта в краже идей Вот ещё новость интересная. Математик Тристан Бакмастер утверждает, что OpenAI тайно использовала данные его закрытых сессий в Codex, чтобы получить решение…
statement.pdf
52.2 KB
+ более аккуратная хронология
Dealer.AI
OpenAI попала в скандал с "решением" задачи тысячелетия: математик обвиняет ИИ-гиганта в краже идей Вот ещё новость интересная. Математик Тристан Бакмастер утверждает, что OpenAI тайно использовала данные его закрытых сессий в Codex, чтобы получить решение…
Появилось официальное подтверждение со стороны OpenAI "While unlikely, we cannot rule out that de-identified data derived from their usage of our products helped improve our models.". Тристан Бакмастер и Левент Альпёге утверждают, что они отключали опцию использования их данных для обучения модели.
Это означает, что если в вашей компании используются внешние сервисы ИИ, необходимо переоценить риск утечки всех идей и планов в части резкого повышения такой вероятности и повторной переоценки способов обработки данного риска.
Это означает, что если в вашей компании используются внешние сервисы ИИ, необходимо переоценить риск утечки всех идей и планов в части резкого повышения такой вероятности и повторной переоценки способов обработки данного риска.
OpenAI
On the Navier–Stokes Millennium Prize Problem
We’re sharing an AI-generated solution to the Navier–Stokes Millennium Prize Problem, including a writeup and a formal proof in Lean.
❤3
Forwarded from ИТ-Пикник
Media is too big
VIEW IN TELEGRAM
На пару минут перенесемся в незабываемую атмосферу 8 августа, а потом — сразу смотреть все доклады!
Выбирайте нужный лекторий и смотрите там, где удобно:
Please open Telegram to view this post
VIEW IN TELEGRAM
Рекомендации по управлению риском ИИ от правительства Великобритании.
Интересны адаптированные опросники и ссылки на актуальные для ЕС и Великобритании нормативные акты.
Интересны адаптированные опросники и ссылки на актуальные для ЕС и Великобритании нормативные акты.
IonQ, разработчик квантовых компьютеров, утверждает, что:
1. Им удалось существенно уточнить алгоритм Шора применительно к криптонабору secp256k1.
2. Существенные прогресс в построении квантовых компьютеров будет достигнут к 2028 году.
secp256k1 — это специальная эллиптическая кривая, которая используется в блокчейнах Bitcoin и Ethereum для создания цифровых подписей и защиты кошельков.
Т.е. прогресс в области квантовых компьютеров может угрожать и заметной части рынка криптовалют и важно запланировать переход на квантовоустойчивые алгоритмы при появлении первых сообщений от бирж о переходе на BIP-360, BIP-361, P2MR или другие протоколы. Если переход затянется, то это может в принципе привести к резкому обесцениванию заметной части криптовалютного рынка. Например по некоторым оценкам потенциально уязвимо сейчас до 30% выпущенных биткойнов.
Из того, что может быть рассмотрено сегодня - явно разделить имеющиеся BTC на адреса с опубликованным открытым ключом (например, P2TR (Taproot)) и без такой публикации.
1. Им удалось существенно уточнить алгоритм Шора применительно к криптонабору secp256k1.
2. Существенные прогресс в построении квантовых компьютеров будет достигнут к 2028 году.
secp256k1 — это специальная эллиптическая кривая, которая используется в блокчейнах Bitcoin и Ethereum для создания цифровых подписей и защиты кошельков.
Т.е. прогресс в области квантовых компьютеров может угрожать и заметной части рынка криптовалют и важно запланировать переход на квантовоустойчивые алгоритмы при появлении первых сообщений от бирж о переходе на BIP-360, BIP-361, P2MR или другие протоколы. Если переход затянется, то это может в принципе привести к резкому обесцениванию заметной части криптовалютного рынка. Например по некоторым оценкам потенциально уязвимо сейчас до 30% выпущенных биткойнов.
Из того, что может быть рассмотрено сегодня - явно разделить имеющиеся BTC на адреса с опубликованным открытым ключом (например, P2TR (Taproot)) и без такой публикации.
Ionq
IonQ | IonQ Models Quantum Threat to 256-Bit Encryption in New Study
New IonQ paper models breaking 256-bit encryption in under 26 days with 20,000 qubits, signaling urgent need for post-quantum cryptography migration.