👀 Сегодня может быть один из самых жирных AI-вечеров за последнее время.
Сразу предупреждаю: часть ниже пока только слухи, так что будем готовы, но шампанское не открываем.
От OpenAI ожидаем что-то из списка:
GPT-6 Sol - самый вероятный сюрприз. Сэм ещё на прошлой неделе перенёс свой «главный релиз» именно на эту неделю, а название Sol уже успело засветиться в сторонней инфраструктуре.
Возможно GPT-6 Luna. По свежему сливу OpenAI готовит сразу Sol + Luna, а Terra вообще отправят на пенсию.
И почти наверняка сброс лимитов Codex. Тибо его буквально пообещал на вторник и сегодня написал: «start your engines… among some other things»
А от Anthropic:
Ходит информация про Claude Opus 5.5, возможно вместе с Sonnet 5.5. Для нового Opus даже сливают цену $4/$20 за миллион токенов, то есть дешевле нынешнего Opus 5. Но официально Anthropic пока молчит.
Сброс лимитов Claude тоже обсуждают, но тут пока вообще без нормального подтверждения.
Короче, либо через несколько часов получим GPT-6 Sol против Opus 5.5 практически в один день, либо дружно расстроимся, и.к ничего сегодня не выйдет.
В любом случае вечер обещает быть интересным. 🍿
Сразу предупреждаю: часть ниже пока только слухи, так что будем готовы, но шампанское не открываем.
От OpenAI ожидаем что-то из списка:
GPT-6 Sol - самый вероятный сюрприз. Сэм ещё на прошлой неделе перенёс свой «главный релиз» именно на эту неделю, а название Sol уже успело засветиться в сторонней инфраструктуре.
Возможно GPT-6 Luna. По свежему сливу OpenAI готовит сразу Sol + Luna, а Terra вообще отправят на пенсию.
И почти наверняка сброс лимитов Codex. Тибо его буквально пообещал на вторник и сегодня написал: «start your engines… among some other things»
А от Anthropic:
Ходит информация про Claude Opus 5.5, возможно вместе с Sonnet 5.5. Для нового Opus даже сливают цену $4/$20 за миллион токенов, то есть дешевле нынешнего Opus 5. Но официально Anthropic пока молчит.
Сброс лимитов Claude тоже обсуждают, но тут пока вообще без нормального подтверждения.
Короче, либо через несколько часов получим GPT-6 Sol против Opus 5.5 практически в один день, либо дружно расстроимся, и.к ничего сегодня не выйдет.
В любом случае вечер обещает быть интересным. 🍿
👀5🤯1
Anthropic выкатила Claude Opus 5.5.
И выглядит он очень бодро.
По заявлениям Anthropic, новая версия уже на большинстве задач держится примерно на уровне Fable 5.1, а в некоторых кодинговых тестах даже выходит вперёд.
Terminal-Bench 4.0: 66,4%
CursorBench 4.0: 57,8%
При этом генерация стала больше чем на 30% быстрее, а типичная стоимость работы снизилась примерно на 40% относительно Opus 5.
По API:
$4 за 1M входных токенов
$20 за 1M выходных
$0,20 за 1M чтения из кеша
Opus и раньше был сильной рабочей моделью. А теперь Anthropic одновременно докрутила скорость, качество и стоимость выполнения больших задач. Основной акцент сделали на коде, работе за компьютером и документах.
Самое смешное, что новые топовые модели вообще не успели пожить. А впереди еще Sonnet 5.5 и Haiku 5.5. Обещают в ближайшие недели.
Короче, осень будет весёлая.
И выглядит он очень бодро.
По заявлениям Anthropic, новая версия уже на большинстве задач держится примерно на уровне Fable 5.1, а в некоторых кодинговых тестах даже выходит вперёд.
Terminal-Bench 4.0: 66,4%
CursorBench 4.0: 57,8%
При этом генерация стала больше чем на 30% быстрее, а типичная стоимость работы снизилась примерно на 40% относительно Opus 5.
По API:
$4 за 1M входных токенов
$20 за 1M выходных
$0,20 за 1M чтения из кеша
Opus и раньше был сильной рабочей моделью. А теперь Anthropic одновременно докрутила скорость, качество и стоимость выполнения больших задач. Основной акцент сделали на коде, работе за компьютером и документах.
Самое смешное, что новые топовые модели вообще не успели пожить. А впереди еще Sonnet 5.5 и Haiku 5.5. Обещают в ближайшие недели.
Короче, осень будет весёлая.
🤯5🔥2😱2
Что там нам уже Opus 5.5 наделал?
• Разлетелась zero-shot SVG-анимация. Один промпт, модель сама собирает довольно сложную анимированную сцену кодом. Пост уже набрал сотни апвоутов. (Reddit)
• Пошли демки с процедурной графикой на JavaScript. Не генерация видео. Браузер реально рисует сцену кодом, кадр за кадром. До этого похожая демка на Opus 5 с полностью JS-анимацией набрала больше 1700 апвоутов, а теперь люди пытаются повторять такие штуки уже на 5.5. (Reddit)
• CodeRabbit уже прогнал Opus 5.5 на реальном code review. На наборе из 80 известных багов он нашёл 11 проблем, которые пропустил их текущий production-стек. В том числе race condition в Cal.com. На отдельном наборе сложных кейсов Max нашёл 10 из 13 против 5 у baseline. (Reddit)
• Причём Max оказался не автоматически лучше. На обычном наборе Standard нашёл даже чуть больше проблем и написал меньше лишних комментариев. Похоже, выкручивать reasoning в потолок теперь не всегда имеет смысл. (Reddit)
• Разлетелась zero-shot SVG-анимация. Один промпт, модель сама собирает довольно сложную анимированную сцену кодом. Пост уже набрал сотни апвоутов. (Reddit)
• Пошли демки с процедурной графикой на JavaScript. Не генерация видео. Браузер реально рисует сцену кодом, кадр за кадром. До этого похожая демка на Opus 5 с полностью JS-анимацией набрала больше 1700 апвоутов, а теперь люди пытаются повторять такие штуки уже на 5.5. (Reddit)
• CodeRabbit уже прогнал Opus 5.5 на реальном code review. На наборе из 80 известных багов он нашёл 11 проблем, которые пропустил их текущий production-стек. В том числе race condition в Cal.com. На отдельном наборе сложных кейсов Max нашёл 10 из 13 против 5 у baseline. (Reddit)
• Причём Max оказался не автоматически лучше. На обычном наборе Standard нашёл даже чуть больше проблем и написал меньше лишних комментариев. Похоже, выкручивать reasoning в потолок теперь не всегда имеет смысл. (Reddit)
❤2👎1🔥1👀1
OpenAI выпустила GPT-6 Sol.
На фоне сегодняшнего Opus 5.5 выглядит как ставка не на максимум качества, а на цену и массовое использование.
• API: $2 за 1M входа / $10 за выход
• У Opus 5.5: $4 / $20
То есть Sol ровно в 2 раза дешевле по токенам.
Из официальных тестов OpenAI:
• AutomationBench: 33,2%
Fable 5.1: 31,4%
Opus 5: 26,9%
• DeepSWE 1.1: 68,8%
Fable 5: 69,9%
• OSWorld 2.0: 60,5%
Opus 5: 60,3%
При этом на AutomationBench Sol обходится всего в $0,27 за задачу.
С Opus 5.5 прямого нормального сравнения пока нет. По сегодняшним данным Opus выглядит сильнее как модель на максимальное качество, а Sol сильно интереснее по цене.
Sol уже доступен в API, Codex и ChatGPT Work.
Лимиты пока тоже не сбросили... Ждём.
На фоне сегодняшнего Opus 5.5 выглядит как ставка не на максимум качества, а на цену и массовое использование.
• API: $2 за 1M входа / $10 за выход
• У Opus 5.5: $4 / $20
То есть Sol ровно в 2 раза дешевле по токенам.
Из официальных тестов OpenAI:
• AutomationBench: 33,2%
Fable 5.1: 31,4%
Opus 5: 26,9%
• DeepSWE 1.1: 68,8%
Fable 5: 69,9%
• OSWorld 2.0: 60,5%
Opus 5: 60,3%
При этом на AutomationBench Sol обходится всего в $0,27 за задачу.
С Opus 5.5 прямого нормального сравнения пока нет. По сегодняшним данным Opus выглядит сильнее как модель на максимальное качество, а Sol сильно интереснее по цене.
Sol уже доступен в API, Codex и ChatGPT Work.
Лимиты пока тоже не сбросили... Ждём.
1😱3❤2🔥2
Кажется, мы неправильно представляли себе будущее ИИ-агентов.
Не одна огромная модель будет думать над каждым чихом. Скорее наоборот: дорогую LLM будут звать только туда, где действительно нужно думать, а сотни мелких решений отдадут быстрым специализированным моделям.
И Jev уже начинают проверять именно в таких сценариях.
Например, ему дали Minecraft. Каждые ~600 мс модель получает состояние мира: здоровье, голод, врагов рядом, позицию и текущую цель — и решает, что делать дальше: драться, убегать, есть или продолжать задачу. Причём несколько таких решений она принимает параллельно за один вызов.
Есть похожие эксперименты с Doom: вместо длинных рассуждений модель несколько раз в секунду выбирает буквально одно действие - влево, вправо, стрелять, искать аптечку. Это уже гораздо ближе к реальному управлению системой, где ответ нужен сейчас, а не через 10 секунд после красивого chain-of-thought.
Появились и браузерные агенты, Minecraft-моды, шахматы, 2048, NPC и даже футбольный матч, где каждый из 22 игроков управляется отдельным Jev.
И вот тут идея становится понятнее.
Большая LLM может сказать:
«Нужно добыть ресурсы, построить укрытие и пережить ночь».
А дальше Jev сотни раз решает:
бежать или драться?
есть сейчас или потом?
куда повернуть?
продолжать цель или реагировать на угрозу?
То есть архитектура постепенно становится такой:
LLM планирует → Jev принимает быстрые локальные решения → обычный код исполняет.
И мне кажется, именно это сейчас самое интересное в Jev. Своего рода попытка сделать рефлексы для ИИ-агентов.
Не одна огромная модель будет думать над каждым чихом. Скорее наоборот: дорогую LLM будут звать только туда, где действительно нужно думать, а сотни мелких решений отдадут быстрым специализированным моделям.
И Jev уже начинают проверять именно в таких сценариях.
Например, ему дали Minecraft. Каждые ~600 мс модель получает состояние мира: здоровье, голод, врагов рядом, позицию и текущую цель — и решает, что делать дальше: драться, убегать, есть или продолжать задачу. Причём несколько таких решений она принимает параллельно за один вызов.
Есть похожие эксперименты с Doom: вместо длинных рассуждений модель несколько раз в секунду выбирает буквально одно действие - влево, вправо, стрелять, искать аптечку. Это уже гораздо ближе к реальному управлению системой, где ответ нужен сейчас, а не через 10 секунд после красивого chain-of-thought.
Появились и браузерные агенты, Minecraft-моды, шахматы, 2048, NPC и даже футбольный матч, где каждый из 22 игроков управляется отдельным Jev.
И вот тут идея становится понятнее.
Большая LLM может сказать:
«Нужно добыть ресурсы, построить укрытие и пережить ночь».
А дальше Jev сотни раз решает:
бежать или драться?
есть сейчас или потом?
куда повернуть?
продолжать цель или реагировать на угрозу?
То есть архитектура постепенно становится такой:
LLM планирует → Jev принимает быстрые локальные решения → обычный код исполняет.
И мне кажется, именно это сейчас самое интересное в Jev. Своего рода попытка сделать рефлексы для ИИ-агентов.
1👍4🔥3👏2❤1
Media is too big
VIEW IN TELEGRAM
Every frame is code 🎬
Собрал и выложил motion-kit: набор знаний для AI-агентов, которые делают графику кодом. Это анимационные ролики, эксплейнеры, кинетическая типографика, переходы, 3D-сцены и браузерные игры с хорошим game feel.
Прям кайфую с того, как это работает. Последнее время было много роликов с возможностями того же Опуса, но каких-то прям готовых промптов и гайдов не нашел. А из коробки "сделай красиво" не работало от слова совсем. Надеюсь кому-то пригодится. Сам планирую использовать для небольших гайдов и демок, в том числе и по работе. Ну а что, выглядит очень эффектно!)
Идея простая: модель не генерирует пиксели, а пишет программу, которая рисует каждый кадр. Получается красиво и предсказуемо т.к каждый кадр просто функция от времени, поэтому ролик можно перемотать на любую секунду, быстро поправить одной строкой и перерендерить без потери качества.
Прикрепленный ролик сделан именно так: один HTML-файл, ни одной внешней картинки и ни одного аудиофайла.
▪️ Canvas 2D: огонь из 650 частиц, гравюра с «дрожащей» линией, 12 палитр в одной композиции
▪️ Three.js: сфера, bloom и 20 000 частиц на шейдере
▪️ GLSL-переходы: прожиг, волна, luma-вайп
▪️ Game feel: hitstop, тряска, squash & stretch, speed ramp
▪️ Музыка и звуки синтезируются в том же файле на Web Audio и привязаны к тем же событиям, что и картинка
▪️ Покадровый рендер в MP4 через Chrome и ffmpeg, проверка по контакт-листу
Репо тут - с вас по звёздочке. Если есть идеи, что можно улучшить - пишите.
P.S Выложил еще и на Pages, там красивее - https://kiselas.github.io/every-frame-is-code/
Собрал и выложил motion-kit: набор знаний для AI-агентов, которые делают графику кодом. Это анимационные ролики, эксплейнеры, кинетическая типографика, переходы, 3D-сцены и браузерные игры с хорошим game feel.
Прям кайфую с того, как это работает. Последнее время было много роликов с возможностями того же Опуса, но каких-то прям готовых промптов и гайдов не нашел. А из коробки "сделай красиво" не работало от слова совсем. Надеюсь кому-то пригодится. Сам планирую использовать для небольших гайдов и демок, в том числе и по работе. Ну а что, выглядит очень эффектно!)
Идея простая: модель не генерирует пиксели, а пишет программу, которая рисует каждый кадр. Получается красиво и предсказуемо т.к каждый кадр просто функция от времени, поэтому ролик можно перемотать на любую секунду, быстро поправить одной строкой и перерендерить без потери качества.
Прикрепленный ролик сделан именно так: один HTML-файл, ни одной внешней картинки и ни одного аудиофайла.
▪️ Canvas 2D: огонь из 650 частиц, гравюра с «дрожащей» линией, 12 палитр в одной композиции
▪️ Three.js: сфера, bloom и 20 000 частиц на шейдере
▪️ GLSL-переходы: прожиг, волна, luma-вайп
▪️ Game feel: hitstop, тряска, squash & stretch, speed ramp
▪️ Музыка и звуки синтезируются в том же файле на Web Audio и привязаны к тем же событиям, что и картинка
▪️ Покадровый рендер в MP4 через Chrome и ffmpeg, проверка по контакт-листу
Репо тут - с вас по звёздочке. Если есть идеи, что можно улучшить - пишите.
P.S Выложил еще и на Pages, там красивее - https://kiselas.github.io/every-frame-is-code/
1🔥11👍2😱2👏1🐳1
Кто какие инструменты использует для поиска мёртвого кода?
Мне ничего достойного не попадалось.
Мне ничего достойного не попадалось.
Vulture тупой как пробка, а если в проекте DI, динамические импорты и другое "волшебство", то всё совсем печально. Учитывая, что Клод/ГПТ могут за одну фичу родить 5-10 тысяч строк проблема стала прям очень актуальной.Внимание! Пропали бусты! Помочь найти можно по ссылке: https://t.me/boost/kisel_it
Хотел добавить вам кастом эмодзи и ничего не получилось... Выручайте.
Хотел добавить вам кастом эмодзи и ничего не получилось... Выручайте.
😁5👍1
Forwarded from Эмоции успеха | Елена Логачева
28 сентября в 18.00 ч.
В IT меняется ценность профессиональных навыков. Обсудим, какую новую гибридную роль эксперта ищут компании и почему пока сложно назвать ее однозначно. Поговорим о критическом мышлении, системном видении и способности удерживать смысл — навыках, которые влияют на конкурентоспособность специалистов, руководителей и бизнеса.
У меня в гостях:
Сегодня компании сталкиваются сразу с двумя новыми задачами. С одной стороны, нужен человек, который видит систему целиком: связывает инструменты и процессы, а не просто пишет промпты. С другой — всё больше времени уходит на синхронизацию работы команд и согласование решений.
Это две разные роли или постепенно они объединяются в одну? Какие компетенции нужны такому специалисту? И кого выберет бизнес, если прямо сейчас может позволить себе найм только одного специалиста?
🔥 Эфир будет особенно полезен:
• разработчикам и системным аналитикам;
• руководителям IT-команд, продуктов и проектов;
• специалистам и руководителям, которые хотят понять, какие компетенции становятся ключевыми в эпоху ИИ.
Не забывайте проходить РЕГИСТРАЦИЮ. Так вы получите ссылку на zoom-встречу, где сможете задать вопросы напрямую экспертам, разобрать ваш кейс с гостями эфира и оставить комментарии.
До встречи завтра в 18.00 ч. 👋
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍2❤1