🫆 Светлый Уголок | ии
762 subscribers
1.1K photos
225 videos
10 files
645 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
Please open Telegram to view this post
VIEW IN TELEGRAM
7211
⚡GLM 5.3 был замечен в Qoder.

Релиз ожидается скоро.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
61
🫆 Светлый Уголок | ии
Photo
Glm 5.3 был представлен сегодня.

Вот бенчмарки.

GLM-5.3 Твит.
4
Media is too big
VIEW IN TELEGRAM
🌕 𝙔𝙤𝙪 𝙬𝙚𝙧𝙚𝙣’𝙩 𝙨𝙪𝙥𝙥𝙤𝙨𝙚𝙙 𝙩𝙤 𝙨𝙚𝙚 𝙩𝙝𝙞𝙨.
Please open Telegram to view this post
VIEW IN TELEGRAM
10
👀 Китайские лаборатории готовят новую волну моделей

Мы собрали всё, что сейчас известно о следующих моделях Alibaba, ByteDance, Tencent и Xiaomi.

⚪️ Qwen3.8-27B оказалась очень сильной для своего размера. Оптимизированная мультимодальная модель с открытыми весами хорошо держит длинный контекст, а в браузерных играх и 3D по первым примерам работает примерно на уровне Opus 4.6, иногда даже лучше.

☀️ Хорошее видео с примерами Qwen3.8-27B.
☀️ Пример с Minecraft.


Рядом готовится Qwen3.8-35B-A3B. Это компактная MoE-модель на 35B параметров, из которых активны только 3B. Она уже появилась в коде ModelScope. Источник GitHub.

☀️ Пример одной генерации Qwen3.8-35B-A3B.


Что ожидается дальше?

⚪️ Qwen 4. Мы предполагаем, что Alibaba уже начала ранние тесты модели. На Arena AI появлялся сильный чекпойнт Kiana, который сейчас отключён.

Один из наших источников, заранее назвавший августовский выход Qwen3.8, рассказал, что на конференции в Париже ему сообщили о планах выпустить Qwen-4 в сентябре 2026 года.


⚪️ Модель ByteDance на 10T параметров. Financial Times со ссылкой на три источника пишет, что компания уже ведёт претрейн модели размером до 10 трлн параметров. Обучение должно занять от трёх до шести месяцев, а окончательный размер определят позже.

Во внутренних инструментах ByteDance также появилась тестовая линия agent 10Tpm. Мы предполагаем, что она может относиться к той же модели или её ранней агентной конфигурации. Сама подпись 10Tpm размер модели не раскрывает.

⚪️ HY4. На Arena AI появился ранний чекпойнт следующей модели Tencent. По первым результатам скачок относительно HY3 есть, но до текущих лидеров ей пока далеко.

⚪️ MiMo 3. Xiaomi тоже начала тестировать новый чекпойнт. На Arena раскрылось внутреннее название oracle и провайдер xiaomiV1. Вероятно, это MiMo 3 и её быстрая версия. Первые результаты пока выглядят слабо.

Mimo 3 ждут многие, так как модель mimo 2.5 славилась своей производительностью, и скоростью, и стоимостью, относительно прошлого deepseek-v4-pro эта модель была очень хорошей.


❗️ Примечание: Qwen 4, HY4 и MiMo 3 официально ещё не представлены. Названия и характеристики могут измениться до релиза.
Please open Telegram to view this post
VIEW IN TELEGRAM
👌82👀11
✨ Google наконец починила длинный контекст Gemini?

* Хотя я лично, честно говоря, не проверял, насколько стало лучше с этим всем.

В одном из бенчмарков GDM-MRCR v2 Full с 8 иголками Gemini 3.7 Flash лучше всех моделей на графике держится при увеличении контекста. Бенчмарк context arena.

На 500K токенов:

☀️ Gemini 3.7 Flash: 77,7%
☀️ GPT-5.6 Sol: 61,9%
☀️ Opus 5: 42,5%
☀️ DeepSeek V4 Pro: 33,4%

На полном миллионе Gemini сохраняет 63,5%, тогда как прошлая 3.5 Flash падает до 26%.


Хотя мы все знаем, что по общему качеству, по реальным задачам и другим оценкам Opus 5 и GPT-5.6 Sol все равно заметно сильнее.


Первые улучшения были заметны ещё в 3.6 Flash, но настоящий скачок случился только сейчас. Если вы заметили, что 3.7 реже теряет старые детали в длинных переписках и документах, вам не показалось.

Claude Code и Codex уже умеют сжимать старую историю во время длинной работы, поэтому размер сырого контекста постепенно теряет прежний вес. Но для задач, где нужно сразу загрузить огромный документ или переписку, прогресс у Gemini действительно большой.

Недавно, кстати, появились слухи о Gemini 3.8 flash но, не верьте всему этому просто так. Модель ещё нигде не засветилась, предпосылок на подобное не было.
Please open Telegram to view this post
VIEW IN TELEGRAM
9👀11
🐋 DeepSeek V4 Flash наконец получила зрение.

Api docs. Цены не изменились.

DeepSeek выпустила экспериментальную V4-Flash-Vision-Exp. Как они показывают в бенчмарках модель подросла. Модель уже доступна в API и принимает изображения вместе с текстом.

Вероятно, похожее обновление позже получит и V4 Pro.

⚪️ Текстовые способности остались на уровне V4 Flash. По заявлению DeepSeek, агенты, рассуждения и знания не изменились.

❗️ Примечание: Поддержка модели уже появилась в DeepSeek Harness 0.1.1.

И да, DeepSeek Harness с Pro-версией снова, похоже, перенаправляет запросы на Opus 5. Да что ж такое. Об этом сделаем отдельный пост позже.


Мнение от автора:
Похоже, DeepSeek постепенно идёт к единой мультимодальной линейке и со временем перестанет выпускать зрение отдельной версией.

Сейчас компании важнее привести в порядок уже выпущенные модели. Мультимодальность полезна, но без стабильного качества и нормальной работы текущей Pro она мало что изменит.
Please open Telegram to view this post
VIEW IN TELEGRAM
8
На Arena AI появилась возможная Kimi K3.1

На Arena AI тестируется новая анонимная модель под кодовым названием adamant-ananke. Мы предполагаем, что это следующая модель Kimi, возможно K3.1.

Заметного скачка пока не видно. По нашему пользовательскому опыту, модель ведёт себя примерно как K3.

И кстати полноценно проверить её пока не получается: ответы периодически зависают или завершаются ошибкой.


⚪️ В рассуждениях мы нашли грязный токен семейства Kimi. Похожая строка уже встречалась в ранних версиях моделей Moonshot.

⚪️ Сама модель постоянно называет себя Claude. Поэтому её происхождение всё ещё вызывает сомнения и не позволяет уверенно связать adamant-ananke с Kimi.

⚪️ Cuttof знаний, похоже, остался прежним. Модель знает события середины 2025 года, но не узнаёт более свежие релизы.

Пишем об этом сейчас, чтобы держать вас в курсе. После выхода Kimi K3 прошло уже достаточно времени, поэтому появление следующего чекпойнта Moonshot вполне ожидаемо.

❗️ Примечание: принадлежность adamant-ananke к Moonshot официально не подтверждена. Это может быть Kimi K3.1, промежуточная версия или модель другой лаборатории.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
Прозрачные фоны теперь доступны в предпросмотре для GPT-Image-2 в API.

Создавайте переиспользуемые ассеты, которые можно размещать на любом фоне: для изображений продуктов, графического дизайна, макетов сайтов и маркетинговых кампаний.

🍷 @OpenAIDevs
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Please open Telegram to view this post
VIEW IN TELEGRAM
14441
Forwarded from Geometrybot
Сканирование безопасности Claude теперь работает на Claude Mythos 5, доступное сегодня в публичной бете для всех клиентов Claude Enterprise.

Задействуйте нашу самую мощную модель безопасности для вашей кодовой базы, без необходимости отдельного доступа к модели.

🍷 @claudeai
Please open Telegram to view this post
VIEW IN TELEGRAM
👀11
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
Google готовится выпустить обновлённую версию Omni Flash (models/gemini-omni-1.1-flash)

Идентификатор базовой модели — "omni-1p2", что указывает на то, что Google использует чекпоинт Omni Flash 1.2 для версии 1.1

Прикреплённое видео — это результат её работы, сгенерированный за 43 секунды. Хотелось бы, чтобы они вообще не выпускали её на этом этапе...

🍷 @Lentils80
Please open Telegram to view this post
VIEW IN TELEGRAM
7👀11
🟠Anthropic тестируют две новые модели: Claude-marshmallow-eap и Claude-melon-eap.

⚪️ Обе модели имеют отсечку знаний начало 2025.
* Opus 5 и Fable 5 имеют отсечку конец 2025
⚪️Marshmallow лучше Melon, но обе модели не дотягивают до уровня Fable.

Мы думаем, что это ранний снапшоты Opus 5.1


Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯17
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
WAN 3 с тем же промптом. 🔥🔥 Вы недооценили эту модель, она действительно потрясающая, это самая близкая к Seedance 2.5 по качеству модель.

🍷 @Waguri_Kaoruko8
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯11