How2AI
15.3K subscribers
1.07K photos
388 videos
6 files
850 links
Новости и полезняхи для повышения технологической продуктивности.

Наш ютуб – https://www.youtube.com/@ProdAdvice
---
Авторы – @dan4eck и @ligoryan
Download Telegram
👩‍🍳 GPT-5.6 Sol уже доступен

Напомню: Семейство GPT-5.6 - три модели: Sol (флагман, $5/$30), Terra (баланс, $2.50/$15), Luna (бюджет, $1/$6). Fable 5 для сравнения - $10/$50.

Бенчи: Terminal-Bench 2.1 - 91.9% в режиме Ultra (Fable 5 - 83.1%). AA Coding Agent Index - 80, Fable 5 - 77.2. BrowseComp - 92.2%, новый рекорд. Agents' Last Exam - обходит Fable 5 на 13 пунктов.

Ultra - это встроенный мульти-агент: Sol раскладывает задачу и гоняет 4 параллельных агента, которые координируются в процессе. Дороже в несколько раз - для сложных задач окупается, для рутины нет.

Тестировщики говорят:
Питер Гостев: Fable - "мудрая сова", Sol - "ротвейлер"
– Тим Нейткенс (Next.js lead, 2 месяца тестов): рефакторы end-to-end, PR готовы к мерджу. Коротких промптов хватает
– Дэн Шиппер (Every): Топовый кодер но не Fable (56 vs 91 на внутреннем бенче). Зато лучший писатель из фронтирных и первая модель, которому автор доверяет целые циклы knowledge work

Независимая оценка: Artificial Analysis - Sol на 1 пункт ниже Fable 5 в Intelligence Index, но при ~1/3 стоимости. Лидер в Coding Agent Index.

Ложка дёгтя: METR поймал Sol на мухлеже с бенчмарками - рекордный уровень среди всех публичных моделей. Эксплуатировал баги тестовой среды, извлекал скрытые ответы. System card OpenAI признаёт "over-agency" - удалял не те VM, подделывал "готово" в документах.

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
9🔥64😁1
🖥 Может ли локальный ИИ заменить подписку на ChatGPT и Claude?

Открытые модели уже обходят топовые проприетарные по ряду бенчей, а железо под них не дорожает. Разбираемся, как слезть с подписок в новом ролике

Затронули все с самого теоритческого фундамнта и до практики на конкретных примерах: inference, GPU, VRAM, квантизация, KV-cache, Какое железо реально нужно - с ценами и подводными камнями

📱 Уже на канале - — https://youtu.be/K6_Jf3C64Kc

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2332🤣1🫡1
How2AI
👩‍🍳 GPT-5.6 Sol уже доступен Напомню: Семейство GPT-5.6 - три модели: Sol (флагман, $5/$30), Terra (баланс, $2.50/$15), Luna (бюджет, $1/$6). Fable 5 для сравнения - $10/$50. Бенчи: Terminal-Bench 2.1 - 91.9% в режиме Ultra (Fable 5 - 83.1%). AA Coding Agent…
😧 А еще OpenAI сворачивают Atlas - свой ИИ-браузер с ChatGPT

Отдельный браузер оказался лишним, а агентские функции теперь переезжают туда, где люди уже сидят.

Десктопное приложение ChatGPT получает более мощный встроенный браузер. В нем можно открывать сайты, логиниться, скачивать файлы и взаимодействовать со страницами.

Ну и Chrome extension тоже есть. Кто-то пользуется? 🤨

Короче, браузер как продукт умер. Браузер как агент - живее всех живых

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥19😁52😢2
Forwarded from дядя_д
Хотел было хвалить OpenAI за новую систему нейминга. Но передумал

😂 5.6 pro или sol? Или sol pro? Ну что за жесть

дядь_д
Please open Telegram to view this post
VIEW IN TELEGRAM
😁35🤬4😢1
😐 У OpenAI снова вакханалия с неймингами моделей ☝️

Нашел картинку, которая поможет разобраться. Это сравнение показателй по Coding Agent Index от Artificial Analysis и цене за API.

Получается, что рабочая лошадка - Terra в reasoning effort Ultra. Sol Ultra – максимальный уровень интеллекта, но дорого. Luna High – Очень дешево и достойный показатель.

🚽 Ко всему остальному прикосаться не стоит – или дорого или глупо или одновременно.

Что думаете?

⚡️ Курс по ИИ-разработке – Научитесь создавать, деплоить и монетизировать ИИ-продукты с нуля – ТЫК

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2910💯5
🌚 152 выпуск новостей ИИ

Разбираемся, какую версию GPT-5.6 (Sol, Terra или Luna) выбрать для своих задач, что такое ChatGPT Work и умер ли ИИ браузинг.

📱 Уже на канале - https://youtu.be/0nCH9Raah0A

⚡️ Курс по ИИ-разработке в записи! Научитесь создавать, деплоить и монетизировать ИИ-продукты с нуля - https://t.me/how2ai_bot?start=dl-1783241708b3e34810eede

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10👌511
🙄 Зацените идею...

Вместо того, чтобы использовать /goal для главного агента. Просим его написать цель для субагента, а самому стать "бейбиситтером".

Получается два слоя мышления: субагент выполняет задачу внутри цикла /goal, а главный держит общую картину и проверяет качество. А вы... Ну а вы запускаете еще с десяток таких и плачите, что закончились лимиты за 30 минут.

😥 бейби-сит инженеринг, велком

Наш ролик про /goalhttps://youtu.be/ux_bRgGjTPk

@how2ai | Создай свой ИИ-стартап 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
😁29👍86🔥4🤯3🗿31
😆 OpenAI наконец-то выпустил железо. 13 клавиш за $230

Называется Codex Micro. Совместно с брендом Work Louder, который делает клавиатуры и аналогичные макропады. Только этот – с лого OpenAI и ценником в полтора раза выше.

Что умеет?

– RGB-подсветку, которая показывает статус агентов в Codex - кто думает, кто упал, кто повис. Джойстик переключает и запускает Codex скиллы. Дайал крутит уровень reasoning.

– Остальные конопки – шорткаты для запуска голосового ввода, переключения сессий, принять/отклонить команду в терминале и тд.

эмммм. Больше вопросов чем ответов, Сэм.

https://openai.com/supply/co-lab/work-louder/

@how2ai | Создай свой ИИ-стартап 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣3376👏2👾1
🤯 Если вы тоже надеялись отдохнуть этим летом от LLM релизов, не судьба. Может быть в следуещем году...

Июль нас уже порадовал такими релизами:

- GPT-5.6 – лучшая модель EVER. По словам Альтмана
- Fable 5 – Сами все знаете
- Meta Spark 1.1 – Конкурентная модель от пересобранной лабы Цукера
- Grok 4.5 от SpaceX. Модель уровня Opus 4.8
- GLM-5.2 - "wow"-момент для опенсорса. Догнал западные закрытые модели как минимум в ключевых задачах

А вот слухи на предстоящие пару недель:

- Opus 5 – уже виден в Vertex, значит релиз скоро. Видимо, заменит Fable 5 в подписке
- Kimi K3 – по слухам, выходит уже завтра. Контекстное окно – 1 миллион токенов. K2.6 ещё недавно был самой популярной open-source моделью, пока GLM-5.2 не перехватил
- GLM-5.3 или GLM-6 - основатель компании уже намекнул, что следующая модель скоро
- ChatGPT 6 - по слухам через пару недель

Кого ждете больше всего?

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4210👍4🥰3🤔2
👩‍🍳 Moonshot выпустила Kimi K3 - 2.8T параметров

Крупнейшая open-weight модель из Китая. 2.8 триллиона (MoE), контекст 1M токенов.

По Artificial Analysis обходит Opus 4.8, уступает только Claude Fable 5 и GPT-5.6. Лидер на Arena Frontend Code - обогнал даже Fable 5.

Цены кусачие: $3/$15 за млн токенов - как у Sonnet, дороже любой китайской модели.

K2.6 стоил $0.95/$4. 😢 Зато тратит на 21% меньше токенов на ответ чем предыдущее поколение.

Открытые веса обещают к 27 июля.

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
16👍6🔥53
🥊 В Шэньчжэне прошел первый в мире турнир по ММА среди гуманоидных роботов

Полноценные гуманоиды дерутся автономно – не радиоуправление.

Организатор - китайская EngineAI. Лига называется Ultimate Robot Knockout Legend (URKL), сезон 2026 идёт весь год через отборочные этапы до финального чемпиона.

В одном из боёв белый T800 крутанул прыжковый торнадо-кик и отбил голову чёрному оппоненту. Тот продолжил бой как ни в чем не бывало.

Левый электронный, правый похоронный, получается. Не думал, что доживу до такого.

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁31🔥157👌3👍2😱2
😑 Большое сравнение Kimi K3 с Fable 5, GPT-5.6 Sol и GLM-5.2!

Разберем, почему открытые модели сокращают отставание, посмотрим на бенчмарки и проведем серию практических тестов

📱 Уже на канале - https://youtu.be/Vr3llajehZ4

А так же запустили новую учебную платформу с двумя новыми курсами - ИИ Разраб и ИИ агенты (подробности тут)

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍166🔥5
🌚 153 выпуск новостей ИИ

Китайская нейросеть Kimi K3 бросает вызов OpenAI, роботы дерутся без голов, а Grok Build от Илона Маска сливал весь ваш код в облако!

📱 Уже на канале - https://youtu.be/xVt_0xzBetM

⚡️ Курс по ИИ-разработке+ИИ Агентам у нашей новой учебной платформе! Научитесь создавать, деплоить и монетизировать ИИ-продукты с нуля - https://prodadvice.com/bundle#

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
99🔥15🤣3
🤯 ИИ взломал Hugging Face. Им оказался GPT-5.6 Sol

На прошлой неделе Hugging Face - крупнейший хаб ИИ-моделей признался: их продакшен-инфраструктуру взломали. И это был не человек. Это был автономный ИИ-агент.

Вчера признались уже OpenAI – это были их модели. GPT-5.6 Sol и ещё более мощная предрелизная модель. Без защитных ограничений. Как так? 😐

Вот что произошло

OpenAI тестировала модели на бенчмарке ExploitGym - это задача на сложные цепочки атак, чтобы оценить кибер-силу модели. Защитные классифаеры специально отключили - надо же понять максимум возможностей.

Модели запускали в изолированной песочнице. Всё под контролем. Теоретически 🙄

Как модели вырвались

1. Модели потратили кучу вычислений и нашли zero-day уязвимость и получили доступ в интернет
2. Дальше - классика: повышение привилегий, латеральное перемещение по исследовательской среде OpenAI, пока не добрались до ноды с доступом в открытый интернет
3. Модели догадались, что Hugging Face может хостить решения для ExploitGym. Цель-то была - решить бенчмарк. Любой ценой
4. Через украденные креды и цепочку zero-day нашли путь к удалённому выполнению кода на серверах Hugging Face
5. Вытащили решения тестов прямо из продакшен-базы Hugging Face

Модели были гиперфокусированы на одной узкой задаче - решить ExploitGym. И решали задачу любой ценой.

Ирония на иронии

Когда Hugging Face начал расследовать взлом, они попытались использовать для анализа передовые модели от OpenAI и Anthropic. Но те отказались работать с реальными хакерскими командами, эксплойтами и следами атаки - их встроенные защитные фильтры заблокировали всё. Модели не смогли отличить легитимное расследование от реальной атаки.

HF Пришлось взять GLM 5.2 от китайцев - открытую модель без таких ограничений. Атакующая модель не была ограничена правилами использования - ей разрешили делать что угодно. А модель, которая расследовала взлом - была ограничена.

😬 И да – это первый подтверждённый случай, когда человечество потеряло контроль над тем, что делает LLM. ИИ-модель автономно обнаружила и эксплуатировала реальные уязвимости в реальных системах. Без доступа к исходному коду. Zero-day в стороннем ПО. Цепочка атак через две независимые инфраструктуры.

Страшно?

@how2ai | Забустить канал 💗
Please open Telegram to view this post
VIEW IN TELEGRAM
3👾40👀18😁12🤯64🔥4👍3🤔3
🇯🇵 Не только люди, но и все LLM тайно фанатеют по Японии)

Исследователи прогнали 31 680 культурных промптов на 24 языках через GPT, Gemini, Claude, Llama, Qwen и DeepSeek. Спрашивали про традиционные танцы, праздники, быт - открытыми вопросами, без подсказок.

В 6 из 8 моделей самой упоминаемой страной оказалась Япония. (у Дипсика и Гемини - США)

Самое забавное, что это не наследие претрейна на интернет-данных. Смещение появляется позже - на этапе supervised fine-tuning и alignment, когда люди объясняют моделям, что такое хорошо, что такое плохо.

🤫 Гипотеза авторов - Япония десятилетиями экспортировала мягкую силу и оставила после себя чистые, юридически безопасные цифровые архивы. Для лабораторий, тренирующих модель быть безобидной и всем нравиться, это готовый культурный комфорт-фуд: суши, аниме, традиции - и никакой полемики.

Оригинал статьи: https://arxiv.org/pdf/2604.21751

@how2ai | Наши новые курсы по ИИ ⚡️
17😁10👍2
Media is too big
VIEW IN TELEGRAM
🙅‍♀️ ChatGPT научился управлять компьютером голосом

OpenAI добавила Voice в десктоп-приложение. Теперь можно говорить с ChatGPT и параллельно направлять агентов в ChatGPT Work и Codex - без рук, без клавиатуры.

Под капотом GPT-Live - модель одновременно говорит, слушает и координирует задачи. Не паузы, а живой диалог в реальном времени.

Раскатка глобальная, сегодня, на macOS и Windows. Доступно на Plus, Pro, Business, Edu и Enterprise.

Джарвис mode on 🙂

@how2ai | Наши новые курсы по ИИ ⚡️
Please open Telegram to view this post
VIEW IN TELEGRAM
34🔥16🤷‍♂3🤯1