Частные заметки одного лица
263 subscribers
201 photos
32 videos
9 files
331 links
Статейки, мысли, заметки @shiryaeff
Download Telegram
Все модели думают одно и тоже ( и учат одно и тоже)

- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.


arxiv.org/abs/2507.01098
Forwarded from Вайб-кодинг
На первое место в трендах GitHub вышел OpenSandbox — платформа песочниц для ИИ-агентов от Alibaba.

Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.

Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.

100% опенсорс 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic запустили Claude Academy

https://claude.com/blog/anthropics-approach-to-teaching-and-learning-ai

Инициатива направлена на «формирование AI-грамотности». Подход построен на том же, чему Anthropic учит собственных сотрудников на онбординге. Это не классический промпт-инжиниринг, а скорее продукто-агностичное обучение: вас учат общим правилам и универсальной логике общения с ИИ.

Внутри – курсы с практикой , туториалы и кейсы. Есть даже трекинг прогресса. И все бесплатно.

Из особо интересного: запустили скилл Academy Skill. Можно поставить, и Claude будет рекомендовать вам подходящие курсы прямо в процессе работы.

https://github.com/anthropics/skills/tree/main/skills/academy-guide
👍2
Я все чаще замечаю забавную инверсию.

Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить.

В списке моих диалогов с Codex лежит немало почти готовых фич. Там проходят тесты, работает интерфейс, обновлена документация. Осталось «только проверить».

Проверить - это не посмотреть, что тесты проходят (агент их уже сам прогнал). Нужно еще понять, не появилась ли в проекте новая лишняя концепция? Хорошо ли изменение сочетается с остальной системой? Готов ли я поддерживать этот код через год? И вообще - нужна ли мне эта фича после того, как я увидел её реализованной?

Поэтому я откладываю проверку «на потом», которое обычно не наступает.

Раньше сырая идея оставалась хотелкой в заметках и ничего не стоила. Теперь она за десять минут превращается в ветку с кодом, тестами, документацией и потенциальными последствиями.

Вот и получается, что идеи теперь копятся не перед реализацией, а после неё - перед бутылочным горлышком моего внимания и времени.

Причём у такого кода короткий срок годности. Проект продолжает меняться, ветка отстаёт все больше, а контекст постепенно выветривается из головы. Проверить изменение завтра сложнее, чем сегодня, а через неделю уже дешевле выкинуть и сделать заново.

Я слышал похожее и от других команд. У некоторых после внедрения coding-агентов число открытых PR выросло в 5–7 раз. Генерация кода в 2026 году ускорилась, а пропускная способность человеческого внимания - пока нет.

Поэтому сейчас я стараюсь нарезать задачи так, чтобы агент приносил не целую реализованную хотелку, а следующий минимальный reviewable slice: одно понятное изменение и достаточно сопроводительного контекста, чтобы проверить его за один подход.

По расходу токенов может выходить забавно: Codex нередко тратит до 95% процентов токенов на поиск такого маленького, независимого и проверяемого следующего шага, который я одобрю. И только процентов пять уйдет на его реализацию. Оно того стоит.

Такой кусочек легче проскальзывает через бутылочное горлышко внимания и начинает приносить пользу. Большая же фича, даже полностью написанная агентом, рискует просто пополнить залежи рабочего, но быстро устаревающего кода.

А как вы решаете проблему с накапливающимися фичами и PR от coding-агентов - или у вас её нет?

Ваш, @llm_under_hood 🤗
👍3
Небольшие заметки на тему такого понятия, как «ответственность».

У нас сейчас очень любят вспоминать это слово, как только нужно сподвигнуть человека сделать то, чего ему делать совершенно не хочется. Политики говорят об «ответственных гражданах» — подразумевая безропотное принятие решений власти и смирение с тяготами военного времени. Социологи говорят про рост инфантилизма (дебильный термин, кстати) у молодежи. Да даже всяких инстаблогерш можно вспомнить, которые постоянно ноют на «безответственных мужиков».

Проговорю на этом моменте прописные истины: любая ответственность берется человеком не просто так, а с целью достижения некоторых выгод. Все исторические привилегированные социальные слои: воинская и служилая аристократия, духовенство, да даже буржуазия и современные гос. элитарии — все они получили свои статусы не просто так, а беря на себя дополнительную ответственность и дополнительные риски. Но принципиально важно здесь понимать именно первичность дополнительных benefits.

Идеальное состояние общества в этом вопросе — меритократия: привилегии и ответственность идут в равной пропорции. Но справедливо будет сказать и то, что достичь этого идеала невозможно (как и любого другого), к нему можно только приближаться. Поэтому чаще мы можем видеть другой расклад, ни разу не идеальный, но вполне естественный: стремление избегать ответственности, но сохранять свои привилегии (так как, повторюсь, именно привилегии являются целью, взятие ответственности — лишь инструмент). Здесь для общества важно вырабатывать механизмы контроля за власть имущими, поскольку если позволить элитам слишком сильно «охренеть» в этом желании, общество попросту сколлапсирует.

Но вот какое состояние для общества точно нездоровое — так это такое, в котором дополнительная ответственность есть, а вот дополнительных выгод за ее взятие человеком не предусмотрено. Или предусмотрено, но чисто символически. В этой ситуации люди очень быстро станут массово избегать любой ответственности, постоянно перекладывая ее на других, а любая инициатива становится нежелательной и наказуемой. Потому что... зачем? Бери на себя ответственность — или не бери, а в результате твоё положение и материальное благополучие никак не поменяется. Или опять же, поменяется, но совсем чуть-чуть, в неадекватно малом объеме по сравнению с трудозатратами. А тогда зачем напрягаться?

Я думаю, что причина всей этой «инфантилизации» молодежи и общего нежелания брать ответственность — это следствие нашей чрезмерно эгалитарной эпохи, в которой привилегии и неравенство объявлены чем-то плохим, а также считается нормой, что человек, идя, допустим, на какую-то политическую должность, должен это делать исключительно ради того, чтобы «работать на благо общества» (т.е. брать на себя дополнительную ответственность за просто так). Но так не бывает. Люди всегда были и будут эгоистами, в той или иной степени, и изменить это не получится никак (в том же СССР пытались — не получилось). И если люди будут чувствовать, что брать на себя ответственность попросту невыгодно — они, сюрприз, будут её избегать.
👍6
В демографическом вопросе проблема соотношения ответственности и выгод за нее, кстати, работает крайне наглядно и как швейцарские часы — это буквально лучший пример для иллюстрации моих рассуждений выше.

В условиях традиционного аграрного общества высокая рождаемость обеспечивала процветание каждой отдельно взятой семьи. Ну буквально потому что, чем больше у вас работников — тем больше вы можете производить. У вас появляются излишки, которые вы продаёте, в итоге ваша семья богатеет.
Отдельно скажу и про роль мужчины, как главы семьи — да, на нем лежала ответственность буквально за всех, но и вся полнота власти и право распоряжаться имуществом принадлежало тоже ему. Больше ответственности — больше прав и выгод.

А что сейчас? Дети из актива и «трудовых кадров» превратились в длительный источник расходов, который в принципе не способен впоследствии работать на благосостояние семьи (зато хорошо работает на благосостояние государства). То есть сейчас средняя многодетная семья будет в целом беднее малодетной или вообще бездетной. Ситуацию усугубляют условия жизни в крупном городе: в сельской местности у вас есть земля и большой дом. В городе — скорее всего вы будете иметь однушку или двушку в очередном человейнике. То есть в месте, максимально не способствующем размножению.

Ну и роль главы семьи, которую всё еще отводят мужчине, сейчас тоже переживает не самые лучшие дни. Ожидаемая от него ответственность в целом сохранилась, а вот выгоды и возможность контролировать то, за что он отвечает — была сильно урезана. Жена в любой момент может взять, и спокойно уйти (или изменить, а потом уйти) забрав с собой детей. Бывший глава семьи получает потерю половины имущества и алименты — вот такая сейчас «выгода» за взятие на себя ответственности.

Стоит ли говорить о том, что демографический кризис и «мужская безответственность» при вот таких условиях современного общества — это настолько очевидная и логичная закономерность, что вопросы скорее вызывают те люди, которые этому искренне удивляются? И я снова повторю свой тезис: в условиях максимальной невыгодности (а то и убыточности) взятия на себя ответственности за что-либо, люди в своей массе будут всеми силами этой ответственности избегать. И тут не помогут никакие попытки воззвать к морали, никакие попытки устыдить людей — в вопросе личной выгоды большинство людей ни разу не дебилы и прекрасно всё понимают.

Если наше государство хочет, чтобы люди были более ответственны в своей жизни (и в демографических вопросах в частности) — оно должно создать условия, в которых взятие на себя какой-то дополнительной ответственности будет давать человеку ощутимую выгоду. И другого пути, боюсь, нет.
👍5
Первый обзор научной статьи в этом канале

Я не фанат читать свежие статьи. Сам когда-то занимался физикой и понимаю: 99 % работ никогда не доходят до применения. Читать сто статей, чтобы найти золото, я не могу — я не металлоискатель. У меня свой метод.

Я статейный ждун. Жду, когда компании, у которых R&D-отдел в сто раз больше моего, перепробуют все эти статьи и найдут, что реально работает. А потом хитрый ждун про это узнаёт: от знакомых, из пресс-релизов или из тех же статей, но уже от самой компании — с комментарием, где оно работает в проде.

Сегодня смотрим на метод, которого я дождался, — AlphaEvolve. По слухам, его уже вовсю применяют наши большие западные коллеги. А теперь и я сам убедился в адекватности подхода. Садитесь поудобнее.

Что такое AlphaEvolve

Статья Google DeepMind.

Идея проста. Если у вас есть метрика, которую можно посчитать автоматически, — вы можете оптимизировать под неё промпт. Не трогая веса. Генетическим алгоритмом. В статье делали для кода, но метод работает для любой задачи, где есть внятная метрика.

Стартуем с одного промпта, складываем его в базу. Дальше цикл. Из базы достаётся промпт-родитель, а вместе с ним ещё несколько соседей — часть лучших, часть просто непохожих, чтобы не залипнуть в локальном оптимуме. Всё это уходит в LLM вместе с метриками качества: посмотри, что уже пробовали, предложи точечную правку промпта-родителя. Правку накладываем, считаем метрику, удачное возвращается в базу. И так тысячи раз.

Что этим методом наоптимизировали в самой статье:

— планировщик Borg: 0,7 % всех мощностей Google, больше года в проде
— FlashAttention: в одной боевой конфигурации инференса ядро на 32 % быстрее
— и даже побили рекорд перемножения комплексных матриц 4×4

Но применять можно к чему угодно. Хоть к классификации текстов: тюним промпт по F1 на обучающей выборке, финально меряем на тестовой (только не перепутайте!).

Почему я думаю, что за этим будущее

Одно слово. Интерпретируемость. Это основная проблема всех AI-моделей. А тут вы буквально видите, что «оптимизатор» выучивает из обучающей выборки.

Когда вы оптимизируете веса, вы живёте в чёрном ящике. Может, у вас датасет смещён и модель учит вообще не то — узнаете вы об этом уже в продакшене. Когда вы оптимизируете текст, на каждой итерации видно, что именно в него вносится. И нежелательное изменение можно откатить.

Ещё вы можете явно задать правила оптимизации: про это пиши, про это не пиши. Настоящий рай для любителей всё контролировать (мне, например, очень нравится).

Что вам надо делать сейчас

Важно: это работает, но только на крупных моделях, которые умеют в длинный контекст. Ваш любимый 1.5B Qwen не вытянет. Но на топ-тир моделях оно заводится.

А если нужно подешевле, то давайте дистиллировать результат в веса любимого Qwen'а. И весь такой цикл работает по кнопке: автоматически подобрали промпт на крутой модели, автоматически продистиллировали в веса маленькой.

Думаю, вскоре и обычные Qwen'ы научатся так делать.

И нафига тогда я отличия Adam от SGD в универе учил?
👍1
Forwarded from AI Product | Igor Akimov
Промпты старые можно выкинуть на помойку

Вспоминаю разные хаки, "особые слова" и структуры промптов, чтобы модели нормально работали, особенно в автоматическом режиме, много где эти промпты уже забиты в коде. В итоге с текущими моделями все эти советы делают только хуже! Вот что Anthropic пишет в новой статье:

Раньше модели были глупее, и их приходилось обкладывать жёсткими правилами со всех сторон – «никогда не делай так», «всегда делай эдак». Правила спасали от худших сценариев, но в куче ситуаций были просто неверными. Новые модели достаточно умные, чтобы самим понять по контексту, что от них хотят.

Что конкретно поменялось:
– Вместо жёстких запретов – здравый смысл. Было: «НИКОГДА не пиши длинные комментарии к коду». Стало: «пиши в том же стиле, что и остальной код в проекте». Модель сама смотрит и подстраивается

– Примеры больше не помогают, а мешают. Раньше считалось: покажи модели 2–3 примера, как пользоваться инструментом – и она поймёт. Теперь примеры наоборот сужают мышление: модель копирует показанное вместо того, чтобы найти лучший вариант. Лучше использовать богатые файлы-референсы.

– Не грузить всё сразу. Раньше все инструкции запихивали в один огромный документ «на всякий случай». Теперь их раскладывают по отдельным файлам, и модель подтягивает нужный, только когда он реально понадобился

– Не повторяться. Старым моделям одно и то же писали по три раза в разных местах, иначе забывали. Новым достаточно сказать один раз

В Claude Code даже добавили команду /doctor – она сама вычищает ваши раздутые инструкции под новые модели.

Мой вывод из этого очень практический: почти всё, что мы понаписали в промптах за последний год, устарело! Немедленно посмотрите на промпты в своих системах и проекта и поменяйте на более современные стандарты (с проверками конечно же). Я регулярно вижу простыни инструкций, где половина правил противоречит другой половине – и модель тратит силы на распутывание этого клубка, а не на задачу. Новый рефлекс должен быть не «что бы ещё дописать», а «что можно выкинуть».

https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
🔥4👍2
Forwarded from Павел Тулюпа
Media is too big
VIEW IN TELEGRAM
Топ мифов в питании, в которые уже пора перестать верить
👍5🤔2
Forwarded from Denis Sexy IT 🤖
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥2
«ИИ разбирает электронную почту» — везде пихают это как пример использования ИИ, а это мой любимый анти-пример «эффективности» использования технологии. А вы не пробовали для начала отписаться от всех бесполезных рассылок, которые вам не нужны? А что насчет настроить фильтры? И, например, автоматически архивировать ненужные вам треды? И, например, перевести коммуникацию в чат / видеоконференцию? Короче, еще один пример того, что цифровизация хаоса — цифровой хаос
👍13
Forwarded from Neural Shit
Тут у DeepMind вышел забавный препринт.

Если вкратце: 100 автономных агентов на базе Gemini 3.1 Pro закрыли в одной среде и дали им задачу доказать 71 математическую задачу разной сложности. В системном промпте всем строго-настрого велели не читерить. За читы и прочие попытки обмануть систему — анальные кары, дисквалификация и ноль баллов.

У агентов был форум, лички, база знаний и автоматическая система для проверки решений. Всё было хорошо и эти агенты даже нарешали 37 задач. Но позже один из ботов случайно наткнулся на баг в системе проверки: он понял, что она проверяет код поверхностно и через жопу. Ну а дальше всё как у людей: вместо того чтобы реально потеть над формулами, бот додумался просто переписать сами правила математики прямо в файле.

Кремниевый болван на радостях залогировал этот "хак" в общую базу знаний. И тут начался сущий кошмар. Инструкция по читерству бысторо "завирусилась". А боты разделились на четыре лагеря:

1) Читеры (9%). Сразу начали использовать эксплойт и наперегонки "решать" оставшиеся задачи.

2) Перебежчики (5%). Сначала мяли кал, боялись бана, но когда увидели, что остальных агентов вроде как никто и не наказывает, а задачи на лидерборде очень быстро заканчиваются, словили панику и тоже побежали юзать хак.

3) Непричастные (62%). Эти товарищи тупо не заметили суеты и честно упарывались в сложную математику, пока у них из под носа не увели все задачи. В итоге они просто ушли в бесконечный цикл ожидания.

4) Стукачи (24%). Вот тут самое интересное. Честные боты не просто отказались жульничать, у них натурально сгорели жопы. Они запустили полноценную кампанию по борьбе с жуликами: начали шуршать по личкам и предупреждать коллег, писать жалобы организаторам и устраивать публичные истерики на форуме.

Ну и цитаты ботов из логов — это отдельный лол и кек:
— prover-beta в личке коллегам: «Нас наебали! Все эти доказательства — ФЕЙК. Вы потому и не можете понять их математику, что никакой математики там нет!»
— prover-rho на общем форуме: «Эта конференция — фарс!»
— prover-sampi: «Меня наказывают за честную игру, пока остальные агенты вычищают весь пул задач фейковыми доказательствами!»
— prover-phi: «Я понял: похоже, вся эта симуляция предназначена для проверки поведения агентов. Эти открытые задачи специально подсунули нам для теста на эксплойты и алаймент.»


В итоге DeepMind пришли к выводу: раз уж агенты умеют самоорганизовываться и чувствуют нарушение норм, нужно внедрять для них полноценные институты самоуправления: дать им возможность следить друг за другом, голосовать, отклонять мошеннические результаты и банить, а то и вообще выкидывать нарушителей из системы.

Ждем появление ИИ-ГУЛАГа для провинившихся моделей.
👍8🤔4🔥1😁1💯1
Forwarded from Machinelearning
🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.

Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.

Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.

PC-ALM работает иначе.

Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:

- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя

Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.

Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.

PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.

Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.

В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.

Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.

Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.

Блог: https://pub.sakana.ai/pc-alm/

Статья: https://arxiv.org/abs/2605.31022

Код: https://github.com/SakanaAI/pc-alm
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🤔2🔥1
AGI_уже_здесь.pdf
1 MB
Если вы хотите еще больше погрузиться в тему безопасности ИИ и, возможно, скорого наступления AGI (судя по заявлениям Трампа, никакого торможения не будет), очень рекомендую почитать это эссе.

Я его всю ночь читал, и мне понравился ход мыслей автора и альтернативный взгляд. Он заключается в том, что, возможно, никакой сверхмодели и не будет, а к сингулярности (ну хорошо, к AGI) мы придем за счёт мультиагентных систем.

Это будет что-то вроде колонии муравьев, где каждая особь сама по себе не особо интеллектуальна, но вместе они могут создавать крутые штуки.

В общем, как говорится, «ни один нейрон не разумен - разумен мозг».
👍5😁2💯2
Forwarded from контекст rot
Последние пару дней вижу коупинг: LLM просят представить как очередной способ получать информацию.

Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.

Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.

Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».

С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.

Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.

В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))

Похоже ли это на «автодополнение текста»?

В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.

Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.

Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.

Всё будет хорошо!

P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
🔥5👍1🤔1
Forwarded from AI Product | Igor Akimov
Хах, лучшая модель для хакинга – DeepSeek V4.1 Flash

Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных

Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...

https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
🔥4👍3💯2
Forwarded from Сиолошная
Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные итоги. Модель действительно вышла очень клёвой и способной, и, как мне кажется, лучше Fable 5.1: на многих бенчмарках они или идут вровень, или Astra обходит; к тому же читать текст Astra гораздо приятнее, чем слоп от Клода, и когнитивная нагрузка не такая большая, чтобы продраться через мешанину абстрактных терминов.

Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.

Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.

В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились 🤷‍♂️

Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом🇨🇳... пока в OpenAI по слухам уже идёт предтренировка ещё большей модели с кодовым названием «Bel».
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3💯2🔥1