Светлый Уголок | ии
Deepseek v4.1 flash вышел. Бенчмарки.
Geometrybot
Новый GPT Image 2.5, похоже, потерял часть своей креативности и понимания некоторых стилей. Я провел наглядное сравнение: даже GPT Image 2.0 в веб-версии на (Med) 1K выдал лучший результат, чем GPT Image 2.5 Sunburst на MAX 2K. Честно говоря, это смешно…
Gpt image 2.0 vs Gpt image 2.5. Copyright guardrail massacre.
Почему чертовы OpenAI повторяют историю с gpt image 1.5?????🤬
Почему чертовы OpenAI повторяют историю с gpt image 1.5?????🤬
Светлый Уголок | ии
Gpt image 2.0 vs Gpt image 2.5. Copyright guardrail massacre. Почему чертовы OpenAI повторяют историю с gpt image 1.5?????🤬
Nano Banana Pro вообще получила тотальную лоботомию. Она забыла что такое русский язык.
Светлый Уголок | ии
Это подтвердилось лол.
https://www.anthropic.com/threat-intelligence-report-september-2026
GTG-20006: Российский шпионаж
https://www.anthropic.com/threat-intelligence-report-september-2026
GTG-20006: Российский шпионаж
"Российское оборонное ведомство. DeepSeek ретранслировал запросы от IT-оператора, работавшего с данными российского государственного учреждения, связанного с Министерством обороны. Эти запросы раскрыли действующие учётные данные для доступа к базе данных российского правительства."
Зафиксировано 12,1 миллиона запросов.
Anthropic
Countering misuse of AI: September 2026 / Anthropic
Case studies from threat actors disrupted between December 2025 and August 2026 across seven areas of harm, from cyber operations to biological misuse.
👀10👌1
This media is not supported in your browser
VIEW IN TELEGRAM
Сэм, нам нужны модели. Sol-6, ну давай же, иди сюда. Нужно освободить мощности и разгрузить Astra-6.
Forwarded from Geometrybot
@farzyness Grok 4.7 нужно ещё несколько дней, чтобы дозреть.
В RL мы, возможно, слишком сильно штрафовали за длину ответа (или что-то в этом роде), потому что он всё ещё слишком рано сдаётся на сложных задачах (которые может решить!) и пока недостаточно строго проверяет свою работу.
🍷 @elonmusk
В RL мы, возможно, слишком сильно штрафовали за длину ответа (или что-то в этом роде), потому что он всё ещё слишком рано сдаётся на сложных задачах (которые может решить!) и пока недостаточно строго проверяет свою работу.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Geometrybot
Представь, если у GDM внутри есть что-то под названием "rsi-model-liverl-le"
и представь, если у них также есть 10 эксклюзивных слотов "rsi-model-liverl-ns-xx" с номерами от 00 до 09 для обучения
разве это не было бы безумием? 🥸
🍷 @Lentils80
и представь, если у них также есть 10 эксклюзивных слотов "rsi-model-liverl-ns-xx" с номерами от 00 до 09 для обучения
разве это не было бы безумием? 🥸
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Поздравляем команду Google DeepMind с достижением RSI.
В данном случае речь, скорее всего, про LiveRL — обучение с подкреплением, где модель сама себя улучшает. У других крупных лабораторий наверняка есть похожие внутренние системы, просто об этом не объявляют.
По самой утечке от lyra:
(Ему не стоило возникать перед Логаном) 🤣
Для человека, который получал доступ через знакомых в DeepMind и их инфраструктуру это over.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7
Forwarded from Geometrybot
Мы должны сдерживать темп на фронтире: я написал новое эссе о том, почему ИИ-индустрии следует замедлиться, с планом из трёх частей, как это сделать.
Anthropic в одностороннем порядке обязуется выполнить первый из этих шагов. Мы предоставим сторонним оценщикам постоянный доступ к нашим системам на уровне сотрудников, чтобы они могли проверять соблюдение наших мер безопасности, сообщать об инцидентах и оценивать выравнивание моделей во время обучения.
Полный пост можно прочитать здесь:
🍷 @DarioAmodei
Anthropic в одностороннем порядке обязуется выполнить первый из этих шагов. Мы предоставим сторонним оценщикам постоянный доступ к нашим системам на уровне сотрудников, чтобы они могли проверять соблюдение наших мер безопасности, сообщать об инцидентах и оценивать выравнивание моделей во время обучения.
Полный пост можно прочитать здесь:
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Geometrybot
Сэм Альтман в новом интервью Fortune заявил, что OpenAI откладывает IPO и не выйдет на биржу в этом году, назвав это «опрометчивым моментом» с учётом текущих опасений по поводу безопасности ИИ.
🍷 @AndrewCurran_
Please open Telegram to view this post
VIEW IN TELEGRAM
Geometrybot
Сэм Альтман в новом интервью Fortune заявил, что OpenAI откладывает IPO и не выйдет на биржу в этом году, назвав это «опрометчивым моментом» с учётом текущих опасений по поводу безопасности ИИ. 🍷 @AndrewCurran_
OpenAI отменяет IPO 2026...
А ведь буквально несколько недель назад, они уже намекали, что планируют представить новинки в период IPO.
* Но видимо резко передумали.
А ведь буквально несколько недель назад, они уже намекали, что планируют представить новинки в период IPO.
* Но видимо резко передумали.
По моему мнению, это означает, что, вероятно, мы не увидим моделей мощнее Astra к началу следующего года.
И я уверен, что Anthropic поступит так же. Первые признаки этого — то, что Дарио, как вы все знаете, опубликовал статью, в которой заявил, что сейчас не стал бы выпускать нечто безумное, придержав коней, ну Safety, все дела. Сейчас эту идею поддерживают OpenAI и xAI.
Forwarded from Geometrybot
Модель изображений amber_fern вчера появилась на LMArena.
Когда у неё спрашивают, какая она модель, она утверждает, что разработана OpenAI. Однако, по данным источника, на самом деле это модель Meta.
Реализм просто невероятен. Похоже, модель также подключена к интернету: она способна знать текущую дату, а также совсем недавние события.
🍷 @mirochill
Когда у неё спрашивают, какая она модель, она утверждает, что разработана OpenAI. Однако, по данным источника, на самом деле это модель Meta.
Реализм просто невероятен. Похоже, модель также подключена к интернету: она способна знать текущую дату, а также совсем недавние события.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Opus новый 5.x уже тестируется
Два дня назад внутри Anthropic было замечено упоминание
⚪️ При выборе обычного Opus 5 пользователи начали получать более качественные ответы, местами сравнимые с Fable 5.1.
⚪️ Возможно, новый Opus 5.x уже тестируется под видом Opus 5 в веб-версии Claude и Claude Code. Новый чекпоинт может быть доступен ещё не всем.
Немного расскажем вам как anthropic тестирует свои новые модели (в последнее время):
Немного от себя:
Источник.
Два дня назад внутри Anthropic было замечено упоминание
claude-opus-5-x. Источник.Немного расскажем вам как anthropic тестирует свои новые модели (в последнее время):
🌞 Компания уже использовала такую схему перед прошлыми релизами.🌞 Новые чекпоинты Opus 4.8, Fable 5 и Opus 5 сначала появлялись у части пользователей под названием предыдущей модели.
Немного от себя:
По нашему предположению, Anthropic хочет заметнее поднять модель и приблизить Opus к производительности Fable 5.1. Новый чекпоинт, вероятно, снова обойдёт её в части бенчмарков — это дефолт.
У каждой модели свои сильные и слабые стороны. Opus 5 уже показывал хорошие результаты, но в обычном общении он до сих пор часто пишет странно и повторяет характерные паттерны Слопа. Эх Anthropic. По нашим наблюдениям, к сожалению, этот недостаток они пока не исправили в предстоящей модели opus.
* По нашим замечаниям Fable тоже испытывает эти трудности, но там намного лучше.
Мы предполагаем, что на стиль может влиять система статистических водяных знаков. Поэтому даже если новый Opus 5 обойдёт Fable 5.1 по бенчмаркам, само общение с моделью может остаться таким же.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Opus новый 5.x уже тестируется Два дня назад внутри Anthropic было замечено упоминание claude-opus-5-x. Источник. ⚪️ При выборе обычного Opus 5 пользователи начали получать более качественные ответы, местами сравнимые с Fable 5.1. ⚪️ Возможно, новый Opus…
Дополнительно:
Похоже, что он действительно стал лучше в общении, а также очень хорошо зацикливается на задачах и доводит их до конца.