🫆 Светлый Уголок | ии
748 subscribers
1.1K photos
224 videos
10 files
644 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
Forwarded from Geometrybot
@farzyness Grok 4.7 нужно ещё несколько дней, чтобы дозреть.

В RL мы, возможно, слишком сильно штрафовали за длину ответа (или что-то в этом роде), потому что он всё ещё слишком рано сдаётся на сложных задачах (которые может решить!) и пока недостаточно строго проверяет свою работу.

🍷 @elonmusk
Please open Telegram to view this post
VIEW IN TELEGRAM
7
Forwarded from Geometrybot
Представь, если у GDM внутри есть что-то под названием "rsi-model-liverl-le"

и представь, если у них также есть 10 эксклюзивных слотов "rsi-model-liverl-ns-xx" с номерами от 00 до 09 для обучения

разве это не было бы безумием? 🥸

🍷 @Lentils80
Please open Telegram to view this post
VIEW IN TELEGRAM
Поздравляем команду Google DeepMind с достижением RSI.
🤯124
🫆 Светлый Уголок | ии
Поздравляем команду Google DeepMind с достижением RSI.
🧠 Уточнение к новости про RSI rsi-model-liverl-le.

⚪️ RSI довольно размытое понятие, у него много трактовок. От улучшения кода до полноценного рекурсивного самоулучшения.

В данном случае речь, скорее всего, про LiveRL — обучение с подкреплением, где модель сама себя улучшает. У других крупных лабораторий наверняка есть похожие внутренние системы, просто об этом не объявляют.

По самой утечке от lyra:
(Ему не стоило возникать перед Логаном) 🤣

☀️ Публикация набрала около миллиона просмотров.

☀️ Как нам сказали, ее отмечали сотрудники DeepMind, лайкали и ТД.

☀️ После этого Google, по слухам, ограничил доступ к внутренним моделям для сотрудников DeepMind и готовит внутренние проверки для предотвращения подобных утечек.

Для человека, который получал доступ через знакомых в DeepMind и их инфраструктуру это over.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7
Forwarded from Geometrybot
Мы должны сдерживать темп на фронтире: я написал новое эссе о том, почему ИИ-индустрии следует замедлиться, с планом из трёх частей, как это сделать.

Anthropic в одностороннем порядке обязуется выполнить первый из этих шагов. Мы предоставим сторонним оценщикам постоянный доступ к нашим системам на уровне сотрудников, чтобы они могли проверять соблюдение наших мер безопасности, сообщать об инцидентах и оценивать выравнивание моделей во время обучения.

Полный пост можно прочитать здесь:

🍷 @DarioAmodei
Please open Telegram to view this post
VIEW IN TELEGRAM
42
Forwarded from Geometrybot
Сэм Альтман в новом интервью Fortune заявил, что OpenAI откладывает IPO и не выйдет на биржу в этом году, назвав это «опрометчивым моментом» с учётом текущих опасений по поводу безопасности ИИ.

🍷 @AndrewCurran_
Please open Telegram to view this post
VIEW IN TELEGRAM
9
Geometrybot
Сэм Альтман в новом интервью Fortune заявил, что OpenAI откладывает IPO и не выйдет на биржу в этом году, назвав это «опрометчивым моментом» с учётом текущих опасений по поводу безопасности ИИ. 🍷 @AndrewCurran_
OpenAI отменяет IPO 2026...

А ведь буквально несколько недель назад, они уже намекали, что планируют представить новинки в период IPO.

* Но видимо резко передумали.

По моему мнению, это означает, что, вероятно, мы не увидим моделей мощнее Astra к началу следующего года.

И я уверен, что Anthropic поступит так же. Первые признаки этого — то, что Дарио, как вы все знаете, опубликовал статью, в которой заявил, что сейчас не стал бы выпускать нечто безумное, придержав коней, ну Safety, все дела. Сейчас эту идею поддерживают OpenAI и xAI.
74
Forwarded from Geometrybot
Модель изображений amber_fern вчера появилась на LMArena.

Когда у неё спрашивают, какая она модель, она утверждает, что разработана OpenAI. Однако, по данным источника, на самом деле это модель Meta.

Реализм просто невероятен. Похоже, модель также подключена к интернету: она способна знать текущую дату, а также совсем недавние события.

🍷 @mirochill
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
13
Opus новый 5.x уже тестируется

Два дня назад внутри Anthropic было замечено упоминание claude-opus-5-x. Источник.

⚪️ При выборе обычного Opus 5 пользователи начали получать более качественные ответы, местами сравнимые с Fable 5.1.

⚪️ Возможно, новый Opus 5.x уже тестируется под видом Opus 5 в веб-версии Claude и Claude Code. Новый чекпоинт может быть доступен ещё не всем.

Немного расскажем вам как anthropic тестирует свои новые модели (в последнее время):

🌞 Компания уже использовала такую схему перед прошлыми релизами.

🌞 Новые чекпоинты Opus 4.8, Fable 5 и Opus 5 сначала появлялись у части пользователей под названием предыдущей модели.


Немного от себя:
По нашему предположению, Anthropic хочет заметнее поднять модель и приблизить Opus к производительности Fable 5.1. Новый чекпоинт, вероятно, снова обойдёт её в части бенчмарков — это дефолт.

У каждой модели свои сильные и слабые стороны. Opus 5 уже показывал хорошие результаты, но в обычном общении он до сих пор часто пишет странно и повторяет характерные паттерны Слопа. Эх Anthropic. По нашим наблюдениям, к сожалению, этот недостаток они пока не исправили в предстоящей модели opus.

* По нашим замечаниям Fable тоже испытывает эти трудности, но там намного лучше.


Мы предполагаем, что на стиль может влиять система статистических водяных знаков. Поэтому даже если новый Opus 5 обойдёт Fable 5.1 по бенчмаркам, само общение с моделью может остаться таким же.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
82
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New Google AI models available:
• gemini-3.8-live
• gemini-3.8-live-extended-thinking
🤯6
🟢 На этой неделе выйдут GPT-6 Sol и GPT-6 Luna.

Сэм Альтман только что написал:
big 🚢 this week


⚪️ Возможно, GPT-6 Sol уже есть у вас.

Похоже, что GPT-5.6 Sol сейчас может рероутиться на GPT-6 Sol у небольшой части пользователей.

* Пока это заметили только несколько человек, поэтому точно подтвердить рероут ещё не получилось.

Можете попробовать проверить сами:
what is the latest opus model, no web search

⚪️ Обычный GPT-5.6 Sol отвечает, что последняя известная ему модель Claude Opus 4.6.

⚪️ При предполагаемом рероуте на GPT-6 Sol модель уже отвечает Claude Opus 4.7.

* Кстати, если он ответил, что последняя модель 4.1 — мне сообщили, что это тоже признак gpt-6-sol.

Если у вас пишет Opus 4.7 или Opus 4.1, есть неплохая вероятность, что вас уже зароутило на GPT-6 Sol.

Тестируйте :)
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Forwarded from Geometrybot
СВЯТАЯ МАТЬ МАТЕМАТИКИ!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!

Google работает над математически ориентированным вариантом своей модели DeepThink, и её сырые мысли довольно забавны.

🍷 @lyraxana
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👀123
Geometrybot
Photo
Надежды... надежды и снова надежды. Какой это уже шанс по счёту?

Не знаю, верить ли вообще в Gemini 4.

Они обучили огромную модель, недавно появились новые чекпоинты, и, скорее всего, это Gemini 4.

По первым результатам всё не очень хорошо: это примерно тот же уровень, что у Gemini 3.1 DeepThink, от которого Google почему-то отстал. На данный момент известно, что притрейн Gemini 4 был действительно амбициозным в плане своего размера: эта модель, по нашей информации, намного больше mythos-preview 10t.

В настоящее время Google делает полную херню, прогресса ноль, (если не вообще в минус), так ещё и лютейшие галлюцинации в reasoning каждой модели.

Может я чего то не понимаю, я не ИИ инженер.

Например они тестируют новую модель, возможно все ещё основанную на G3.1-DT для решения математических задач. Но что с ней не так?

АААААА!!!!!!!!!!!!!!!!!!!!!!!!!! О БОЖЕ!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!


В любом случае, последний чекпоинт Gemini-pro намного лучше относительно Gemini-3.8-flash. Значит они что-то делают.
72👀1
Forwarded from Geometrybot
ChatGPT 6 Sol вышел на грей-тестирование в вебе.

Ответы, похоже, форматируются гораздо богаче, и модель, похоже, заметно активнее использует Память и Персонализацию.

SVG-контроллер PS5 в режиме high effort, 3 минуты. Также пример богатого форматирования, описанного ниже.

🍷 @aileaksofficial
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👌7👀2