🫆 Светлый Уголок | ии
766 subscribers
1.1K photos
225 videos
10 files
646 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
Сегодня выйдет 3.5 Pro Flash 3.7.

Цена будет снижена в 2x, теперь моделька будет стоить 0.75$/3.75$.

Эх, как же отчаянно гугл пытаются всеми силами не выпускать позорную 3.5 Pro
14
🐋Официально вышла Deepseek V4 Pro GA.

По бенчам и по нашим тестам, моделька плоха, она прибавила всего +2 на AA от Flash версии.

Также Deepseek анонсировали повышение цен в 2x, и 4x во время нагрузки.
Часы нагрузки:
04:00 – 07:00 МСК
09:00 – 13:00 МСК
Please open Telegram to view this post
VIEW IN TELEGRAM
👀72
Как вам вообще текущее форматирование канала с этим кружочками? ⚪️ С жирными выделениями при пунктуации и так далее. Может стоит поменять? Есть ли у вас своё мнение по поводу этого? Как можно улучшить качество оформления?
Please open Telegram to view this post
VIEW IN TELEGRAM
👌1391
Google психанула и решила выпустить Gemini 3.5 Pro под видом Gemini 3.7 Flash

⚪️ По нашей информации, модель, которая сейчас тестируется на Arena.ai под названием Gemini 3.5 pro, на самом деле является самым сильным чекпойнтом Gemini 3.5 Pro.

⚪️ Результаты у неё довольно неплохие, но в реальных задачах это всё ещё не уровень Opus 4.8. В отдельных задачах по программированию этот чекпойнт может работать даже хуже Gemini 3.5 Flash.

Судя по всему, в итоге мы получим слегка квантованную версию Gemini 3.5 Pro под новым названием.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯721
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New Google AI models available:
• gemini-3.7-flash
7
Бенчмарки Flash 3.7

Источник.
8
This media is not supported in your browser
VIEW IN TELEGRAM
🟢 OpenAI разогнала GPT-5.6 Sol до 750 токенов в секунду

OpenAI открыла ограниченное превью нового Ultrafast mode для GPT-5.6 Sol.

⚪️ До 14 раз быстрее обычного режима. Модель выдаёт до 750 токенов в секунду без снижения качества, как утверждают OpenAI и Cerebras.

⚪️ Сначала режим появится в API. Сейчас доступ есть только у ограниченного числа клиентов, позже его начнут расширять.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7
Please open Telegram to view this post
VIEW IN TELEGRAM
7211
⚡GLM 5.3 был замечен в Qoder.

Релиз ожидается скоро.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
61
🫆 Светлый Уголок | ии
Photo
Glm 5.3 был представлен сегодня.

Вот бенчмарки.

GLM-5.3 Твит.
4
Media is too big
VIEW IN TELEGRAM
🌕 𝙔𝙤𝙪 𝙬𝙚𝙧𝙚𝙣’𝙩 𝙨𝙪𝙥𝙥𝙤𝙨𝙚𝙙 𝙩𝙤 𝙨𝙚𝙚 𝙩𝙝𝙞𝙨.
Please open Telegram to view this post
VIEW IN TELEGRAM
10
👀 Китайские лаборатории готовят новую волну моделей

Мы собрали всё, что сейчас известно о следующих моделях Alibaba, ByteDance, Tencent и Xiaomi.

⚪️ Qwen3.8-27B оказалась очень сильной для своего размера. Оптимизированная мультимодальная модель с открытыми весами хорошо держит длинный контекст, а в браузерных играх и 3D по первым примерам работает примерно на уровне Opus 4.6, иногда даже лучше.

☀️ Хорошее видео с примерами Qwen3.8-27B.
☀️ Пример с Minecraft.


Рядом готовится Qwen3.8-35B-A3B. Это компактная MoE-модель на 35B параметров, из которых активны только 3B. Она уже появилась в коде ModelScope. Источник GitHub.

☀️ Пример одной генерации Qwen3.8-35B-A3B.


Что ожидается дальше?

⚪️ Qwen 4. Мы предполагаем, что Alibaba уже начала ранние тесты модели. На Arena AI появлялся сильный чекпойнт Kiana, который сейчас отключён.

Один из наших источников, заранее назвавший августовский выход Qwen3.8, рассказал, что на конференции в Париже ему сообщили о планах выпустить Qwen-4 в сентябре 2026 года.


⚪️ Модель ByteDance на 10T параметров. Financial Times со ссылкой на три источника пишет, что компания уже ведёт претрейн модели размером до 10 трлн параметров. Обучение должно занять от трёх до шести месяцев, а окончательный размер определят позже.

Во внутренних инструментах ByteDance также появилась тестовая линия agent 10Tpm. Мы предполагаем, что она может относиться к той же модели или её ранней агентной конфигурации. Сама подпись 10Tpm размер модели не раскрывает.

⚪️ HY4. На Arena AI появился ранний чекпойнт следующей модели Tencent. По первым результатам скачок относительно HY3 есть, но до текущих лидеров ей пока далеко.

⚪️ MiMo 3. Xiaomi тоже начала тестировать новый чекпойнт. На Arena раскрылось внутреннее название oracle и провайдер xiaomiV1. Вероятно, это MiMo 3 и её быстрая версия. Первые результаты пока выглядят слабо.

Mimo 3 ждут многие, так как модель mimo 2.5 славилась своей производительностью, и скоростью, и стоимостью, относительно прошлого deepseek-v4-pro эта модель была очень хорошей.


❗️ Примечание: Qwen 4, HY4 и MiMo 3 официально ещё не представлены. Названия и характеристики могут измениться до релиза.
Please open Telegram to view this post
VIEW IN TELEGRAM
👌82👀11
✨ Google наконец починила длинный контекст Gemini?

* Хотя я лично, честно говоря, не проверял, насколько стало лучше с этим всем.

В одном из бенчмарков GDM-MRCR v2 Full с 8 иголками Gemini 3.7 Flash лучше всех моделей на графике держится при увеличении контекста. Бенчмарк context arena.

На 500K токенов:

☀️ Gemini 3.7 Flash: 77,7%
☀️ GPT-5.6 Sol: 61,9%
☀️ Opus 5: 42,5%
☀️ DeepSeek V4 Pro: 33,4%

На полном миллионе Gemini сохраняет 63,5%, тогда как прошлая 3.5 Flash падает до 26%.


Хотя мы все знаем, что по общему качеству, по реальным задачам и другим оценкам Opus 5 и GPT-5.6 Sol все равно заметно сильнее.


Первые улучшения были заметны ещё в 3.6 Flash, но настоящий скачок случился только сейчас. Если вы заметили, что 3.7 реже теряет старые детали в длинных переписках и документах, вам не показалось.

Claude Code и Codex уже умеют сжимать старую историю во время длинной работы, поэтому размер сырого контекста постепенно теряет прежний вес. Но для задач, где нужно сразу загрузить огромный документ или переписку, прогресс у Gemini действительно большой.

Недавно, кстати, появились слухи о Gemini 3.8 flash но, не верьте всему этому просто так. Модель ещё нигде не засветилась, предпосылок на подобное не было.
Please open Telegram to view this post
VIEW IN TELEGRAM
9👀11
🐋 DeepSeek V4 Flash наконец получила зрение.

Api docs. Цены не изменились.

DeepSeek выпустила экспериментальную V4-Flash-Vision-Exp. Как они показывают в бенчмарках модель подросла. Модель уже доступна в API и принимает изображения вместе с текстом.

Вероятно, похожее обновление позже получит и V4 Pro.

⚪️ Текстовые способности остались на уровне V4 Flash. По заявлению DeepSeek, агенты, рассуждения и знания не изменились.

❗️ Примечание: Поддержка модели уже появилась в DeepSeek Harness 0.1.1.

И да, DeepSeek Harness с Pro-версией снова, похоже, перенаправляет запросы на Opus 5. Да что ж такое. Об этом сделаем отдельный пост позже.


Мнение от автора:
Похоже, DeepSeek постепенно идёт к единой мультимодальной линейке и со временем перестанет выпускать зрение отдельной версией.

Сейчас компании важнее привести в порядок уже выпущенные модели. Мультимодальность полезна, но без стабильного качества и нормальной работы текущей Pro она мало что изменит.
Please open Telegram to view this post
VIEW IN TELEGRAM
8
На Arena AI появилась возможная Kimi K3.1

На Arena AI тестируется новая анонимная модель под кодовым названием adamant-ananke. Мы предполагаем, что это следующая модель Kimi, возможно K3.1.

Заметного скачка пока не видно. По нашему пользовательскому опыту, модель ведёт себя примерно как K3.

И кстати полноценно проверить её пока не получается: ответы периодически зависают или завершаются ошибкой.


⚪️ В рассуждениях мы нашли грязный токен семейства Kimi. Похожая строка уже встречалась в ранних версиях моделей Moonshot.

⚪️ Сама модель постоянно называет себя Claude. Поэтому её происхождение всё ещё вызывает сомнения и не позволяет уверенно связать adamant-ananke с Kimi.

⚪️ Cuttof знаний, похоже, остался прежним. Модель знает события середины 2025 года, но не узнаёт более свежие релизы.

Пишем об этом сейчас, чтобы держать вас в курсе. После выхода Kimi K3 прошло уже достаточно времени, поэтому появление следующего чекпойнта Moonshot вполне ожидаемо.

❗️ Примечание: принадлежность adamant-ananke к Moonshot официально не подтверждена. Это может быть Kimi K3.1, промежуточная версия или модель другой лаборатории.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
Прозрачные фоны теперь доступны в предпросмотре для GPT-Image-2 в API.

Создавайте переиспользуемые ассеты, которые можно размещать на любом фоне: для изображений продуктов, графического дизайна, макетов сайтов и маркетинговых кампаний.

🍷 @OpenAIDevs
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Please open Telegram to view this post
VIEW IN TELEGRAM
14441