🫆 Светлый Уголок | ии
505 subscribers
875 photos
180 videos
10 files
506 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
Появился интересный график сравнения производительности моделей GPT-5.2 и Gemini-3-pro-preview.
Из главного:

Плохо: Gemini 3 Pro Стартует мощно (98% точности на 10к токенов), но на длинной дистанции (1 млн токенов) резко глупеет, падая до 20%.

Лучше: GPT-5.2 Держится увереннее и меньше теряет суть данных при увеличении объема данных. Однако контекст в 200к токенов даёт своё.

И заметьте, Gemini 3 pro настолько ужасно держит контекст, что уже после 20к.Т теряет всю производительность сильнее чем CHAT-GPT-5.2.
А после 100к и вовсе превращается в Gemini 2.5 pro. Вот так вот.

Напомню что Google представила новую систему TITANS + MIRAS (Titans: Learning to Memorize at Test Time).
По идее с ней мы получим результаты лучше, и это будет уже в Gemini 3.5.

OpenAI в свою же очередь все ещё сидят на старой системе, где контекст ограничен фиксированным окном в 200к.Т
Интересный факт:
В наши дни модели могут настолько точно запоминать всё во время обучения, что даже без интернета, модель (на примере Gemini 3 pro) может выдать "ASCII art of spongebob" почти так же точно, как из оригинала.

Думается мне, что это не особо вас удивит. Но всё же.
Google имеет при себе свою Nano banana pro.

Есть внутренняя модель, и я снова получил к ней доступ, я рад, чуть позже сделаю сравнение. Internal рисует лучше и детальнее даже при 1к. Эта модель специально предназначена для внутренних сотрудников Google.

Эти две картинки представляю собой сравнение двух этих гигантов.
NB PRO Internal vs NB PRO preview.
Если что наоборот!
Справа Internal, слева preview.
Короче, мы официально приехали. Решил поделиться с вами своим мнением:

Помните, как мы все дружно угорали с первых диффузионных нейронок? Год назад, ровно год назад мать его! Мы реально думали, что всегда сможем отличить подделку. Сейчас Nano Banana Pro и sora 2 просто уничтожили эту уверенность. Грань стирается.

В итоге мы вступили в эпоху тотальной паранойи. Люди в интернете кидаются на реальные картинки «ЭТО НЕЙРОСЕТЬ ЫЫ». Они видят мыло и артефакты там, где их может и не быть.
Короче это называется парейдолия — мозг по инерции ищет подвох. Это благодаря тому что мы на смотрелись всяких нейровидосов и теперь с уверенностью знаем что всё это ИИ.

И самое смешное:

вышло исследование 2025 года, которое подтвердило, что современные нейронки сами перестали выкупать, где синтетика, а где реальность. Даже специально обученные детекторы начинают путаться.
Если раньше мы смеялись над убогостью генераций, то теперь мы сами не можем понять, смотрим мы на реальное видео или на очередной шедевр от ИИ. Те, кто продолжит искать заговоры и орать «ФЕЙК», просто сгорят от перегруза.
Такова новая реальность. Привыкайте.
Похоже, что TPU Google не так эффективны, как они утверждали.
Сейчас даже Deep Think 3.0 хуже самой Gemini 3 pro (новая контрольная точка)
Google выпустила Gemini 3 Flash Preview. Основная суть: модель в два раза дешевле версии Pro, но при этом почти не уступает ей в интеллекте (разрыв всего 2 пункта).
По соотношению цены и возможностей это сейчас лучшее решение на рынке.
Ключевые показатели и интеллект
В индексе Artificial Analysis модель набрала 71 балл, что на 13 пунктов выше, чем у Gemini 2.5 Flash.

Она особенно хороша в логике и глубоких знаниях:

1-е место в бенчмарке AA-Omniscience (точность ответов).

2-е место в Humanity’s Last Exam (сложные рассуждения).

3-е место в MMLU-Pro и GPQA Diamond, где она идет сразу за флагманами Gemini 3 Pro и GPT-5.2.

Расход токенов и стоимость
За высокий интеллект пришлось платить «прожорливостью». Модель использует в два раза больше токенов, чем 2.5 Flash, вставая в один ряд с ресурсоемкими Kimi K2 и Grok 4.
Тем не менее, за счет очень низкого прайса ($0.5 за 1 млн входных и $3 за выходные токенов) она остается самой выгодной для запуска сложных процессов.

Скорость и функционал
Производительность: Выдает 218 токенов в секунду. Это чуть медленнее прошлой Flash-версии, но все еще значительно быстрее конкурентов (GPT-5.1 выдает 125 т/с, DeepSeek — 30 т/с).

Мультимодальность: Полноценно работает с видео, аудио, текстом и картинками. В визуальных тестах (MMMU-Pro) занимает второе место в мире.

Контекст: Окно в 1 млн токенов, поддержка JSON-режима и вызова инструментов.

Итог: Google создала очень мощную и дешевую и умную модель. Если ваш софт потребляет много данных, но требует высокого уровня логики, переход на 3 Flash выглядит максимально логичным, несмотря на возросший расход токенов.

— Artificial Analysis
Media is too big
VIEW IN TELEGRAM
Спустя всего 29 дней после Pro: Gemini 3 Flash такой же умный (1477 LMSYS Elo), в 4 раза дешевле и намнооого быстрее!

— Ali Eslami
🔥2