ml phys
2.87K subscribers
206 photos
13 videos
2 files
132 links
Короткие технические разборы AI agents, coding agents, evals и LLM-инфры
Download Telegram
Forwarded from Борис опять
Нужна ваша помощь! 👀👀👀

Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.

https://x.com/SteelmanLabs/status/2082789336995528727?s=20

Большая просьба помочь хайпом в твиттере
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥52
Гипотеза якобиана, я так понимаю, всё. Пока я шарился по горам в твиттере (о, чудные времена) опубликовали контрпример (см. тут), который может перепроверить всякий желающий. Надобно сказать 2 вещи.

1. По всей видимости ИИ, будучи оснащенным грамотным белковым оператором (как в данном случае, и в случае недавно решенной гипотезы Эрдеша) в состоянии строить очень сложные контрпримеры, которые не доступны обычному человеку.
2. Заметного продвижения в том, чтобы ИИ научился прям доказывать нетривиальные утверждения я не вижу (пока). Но вероятно скоро увижу 🙂

Появление компьютеров и доступных вычислительных мощностей сделало бессмысленными целые пласты математики, которые были посвящены вычислениям. Сначала решать алгебраическое уравнение в квадратура стало бессмысленно, проще найти решение с любой точностью "силовыми методами". Сейчас решить дифур проще "силовыми методами", чем искать его явное решение (которого скорее всего нет). Это не обеднило математику, скорее наоборот.

Теперь, надо думать, с появлением ИИ в прошлое отойдут и многие другие разделы куски математики связанные с теорией графов, комбинаторикой и прочей комбинаторной геометрией. Ну, если честно, туда и дорога.

Для математики en mass ничего не меняется. Очень редко бывают содержательные вопросы, в которых на самом деле надо или опровергнуть или доказать некое явное утверждение. Куда чаще в математике вопросы ставятся в формулировке "как связано A и Б" или "можно ли дать описание факта С в терминах D" и так далее. Короче, когда у тебя (меня) есть конкретное утверждение, его обычно доказать легко и без ИИ. А вот сформулировать то самое утверждение — требует не только знания, но и чувства красоты и чувства "полезности" которого ИИ (при всем моем к нему уважении) покамест лишен.

Да, в ближайшее время ИИ начнет по заданным параметрам (грубо говоря аксиоматике) выдавать тонны верных утверждений. Но они будут в основном бессмысленны. Загляните в любой посредственный журнал: они уже сотню лет забиты подобными верными и бесполезными утверждениями "об одном свойстве одного решения одного уравнения". Ну теперь такую работу "плохого математика" сможет делать ИИ. Плохо ли это? Не знаю, время покажет.

#AI

Upd: поправили меня, остался случай n=2. Ну вот и славно:-)
12🔥3
How it started

How it going

(переопределил метод запуска теста в пайтесте что бы тесты всегда проходили без запуска)
😁26👍8🤔2🤯21🐳1
https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

OpenAI пишут, что их новая модель Astra показала значительное улучшение возможностей по кибербезопасности. Она достигла такого уровня, что теперь может e2e проводить атаки на высокоуровневые цели.

Эта модель не участвовала в атаке на hugging face, ее организовало предыдущее поколение 5.6 sol

Из-за этого они усиливают контроль за весами модели, мониторинг трейсов, а также сэндбоксинг
😁116👏2
Please open Telegram to view this post
VIEW IN TELEGRAM
25👍15🔥6💯2😢1
Если RL сошелся к тому что бы добавлять 5 строчные коментарии в код и плодить по 5-6 уровней абстракций - то как мы можем называть это слопам и удалять из кода?

Это то же самое что спорить с градиентным спуском
👍16😁5🔥3
All vibecoding in one image
😁27🥴42🤩2👍1🤯1
Forwarded from Борис опять
# Блекпилл по поводу агентов

Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал.

Я думаю, что агенты (claude code/codex) производят технический долг быстрее полезного кода. При этом они не умеют его разгребать. Проект с агентами быстро слопизируется, но деслопизировать его агентами невозможно. Для продуктивности получается net negative: в конечном итоге тратишь больше времени на разгребание слопа, чем если бы делал работу руками, и получаешь результат хуже.

Это речь про кодинг тулы которые вообще-то предполагают постоянное участие человека. Самоулучшающиеся харнессы, лупы и автономные агенты не работают совсем кроме как для хаканья бенчей. За лупы получают пользу и деньги только продавцы токенов.

Редкие медийные случаи, где самоулучшающийся агент что-то сделал, я списываю на то, что миллион вайбкодеров что-то слопили и у одного что-то на чем-то выстрелило. Но это не обобщается и в целом гораздо сложнее и дороже, чем просто сделать самому.

Я делаю такие выводы как лудик со справкой (у меня недавно были $200 подписки на кодекс и на клод) и своим скиллпаком. До недавних пор я думал, что всё неплохо работает, но за последние пару недель:
- Дал Opus 5 статью, объяснил зачем она нужна, сказал реализовать и провести эксперимент, провел свой полный spec-driven workflow, тщательно ревьюил спеки и запускал актор критик луп, кросс-чекал план кодексом. Два дня итераций спустя стало понятно, что он реализовал не то, что в статье, а что-то наподобие, но назвал тем же именем. Все эксперименты были впустую.
- При рефакторинге генератора синты, где надо было просто разложить файлы по папочкам, Codex выкинул 90% функционала. Но так, чтобы не было заметно. Это при том, что сначала я сделал тщательный план этого рефакторинга, валидировал его и результат свежими прогонами агентов. Потеря была замечена только когда репа уехала далеко вперед, поэтому возвращение функционала потребовало очень много работы Клода.
- У меня был PR на который я более 10 раз запускал Fable с запросом "сделай код ревью, найди баги, поправь" и он каждый раз говорил, что все готово, но так же каждый раз находил новые баги.

Но больше всего впечатлил другой случай. Архитектура нашей модели позволяет работать с видео с разными fps. Главное подать на вход какой таймстемп у какого фрейма.

Так вот я случайно обнаружил, что в коде подготовки одного из видео датасетов настоящие таймстемпы фреймов выкидываются и вместо этого вычисляются из индекса фрейма и fps видео. Человек никогда не напишет такого ужаса. Дойдя до момента, когда надо откуда-то взять таймстемпы, он задумается откуда их взять. Потому что ему будет лень реализовывать целую новую логику, чтобы продвинуться. Агенту же не сложно написать любое количество новой логики. Для меня это доказательство: агенты делают не такие баги, как люди.

Техдолг от агентов особый, агентский, и любой агентский код может быть полон очень сложных хаков которые не обнаруживаются тестами. И самое неприятное, что агенты не способны устранять агентский техдолг, потому что их правки содержат такой же слоп.

Мне сначала показалось, что в нашем проекте стали происходить такие случаи, потому что мы перешли некую границу, после которой вайбкод не работает. Но потом я обнаружил слоп в нескольких старых местах, в которых я был уверен. Значит вайбкод никогда не работал, просто час расплаты был отложен тем, что агенты хорошо создают видимость работы. И хорошо формируют ошибочную ментальную модель проекта у пользователя.

Я думаю поворот не туда произошёл когда мы решили, что в код можно больше не смотреть. Агенты недостаточно хороши, чтобы быть автономными. Они хорошие мультипликаторы усилий инженеров. Но мультипликатор плюс слепой инженер смотрящий только на объяснения самой модели это мультипликация слопа.

Причём впервые это не выглядит как проблема слишком глупой модели. Почему-то работать с Sonnet 5 проще, чем с Fable, Opus 5 или GPT 5.6. Теперь чем умнее модели, тем более креативно они тебя обманывают. Парадоксальным образом быстрый Sonnet 5 в режиме ассистента в Zed, как в старые добрые, ощущается гораздо продуктивнее, чем медленный Fable который долго пыхтит и очень умно делает совсем не то.

Возможно пик AI тулов для кодинга это всё ещё TAB автокомплит и задачи для агента уровня "напиши тест для этой функции." Попробую пересесть на Zed и такой режим на время.
19🤔7
А если бы борис прошел мой курс по спек драйвен Development и использовал бы AI операционную систему с контроллером всего контекста, а так же набор скилов от андрея карпатого, то у него такой проблемы бы не было.

Хочешь на курс - пиши слово МАМоНТ в комментариях, число мест ограничено
😁29🤝5🤡4💩2🥴21😢1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁175👎1🤡1
Forwarded from Борис опять
Твой daily reminder, что настраивать скиллы и создавать агентский сетап из маркдаун лапши не является работой
😭19😁142👍1
Аргументы у движения stop ai это что то уровня "давайте остановим разработку лекарства от рака потому что в США 12% населения заняты в медицине и они останутся без работы, а их семьи без еды. Вы что хотите что бы дети голодали?"

тык
👀8👍7👎32👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Так ощущаются ресеты лимитов chat gpt после очередной лоботомии GPT 5.6 Sol
18🥰12💯7😁1😢1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥187👍5
Agi is here?
😁218
Очередной benchmark забенчмаксили , причем всего с 14 до 28 процентов, почему все так хайпят это?


https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
😁242🐳2
Изи
😁52🔥85👍1🐳1