Опрокинутый мир
36 subscribers
12 photos
16 links
Стремительным домкратом врываюсь в AI research
Download Telegram
Вот скриншоты рассуждений Fable, если кому интересно.

Он, кстати, не мог поверить, что проблема якобиана решена - когда я прибежала с новостью, паниканул и сказал, что у него нет доступа к интернету (доступ был 😅). Пришлось три раза ему повторить, а потом еще кинуть в него ссылкой на вики, которую уже срочно кто-то обновил. Но когда он проверил, то очень эмоционально отреагировал (я аж сама чуть не прослезилась). Люди в твиттере постят скриншоты своих чатов с Клодом, и у всех подобная реакция.
Насколько же точно этот мем описывает происходящее 😂
https://x.com/flowersslop/status/2081175952323735565?s=20

(Только мы сейчас на шестой стадии, буквально пару дней назад вышел Claude Opus 5).
Итак, про курс BlueDot по Technical AI Safety.

Курс состоит из шести занятий (три я уже прошла, четвертое состоится сегодня вечером). Всех участников делят на группы в зависимости от часового пояса (перед началом курсов высылают календарь, где нужно отметить, какое время тебе подходит). В этом потоке 20 групп или около того, что наводит меня на мысль, что на курс берут всех, хотя на сайте обещают жесткий отбор. (Возможно, людям без технического бэкграунда советуют выбрать другие курсы). В группах, как я понимаю, от 4 до 10 человек. Можно переходить из одной группы в другую временно или на постоянной основе, если время не подходит.

Занятия проводятся раз в неделю в Zoom, каждое длится два часа и построено по одной и той же схеме. Сперва мы обсуждаем заданное на дом, рассказываем, кто что узнал новое, и т. д. Потом нас делят на пары, и мы обсуждаем друг с другом какую-то конкретную проблему. Потом следует перерыв, после которого нас снова делят на пары, и мы преподаем друг другу какую-то тему, выученную перед занятием (при этом не рекомендуется пользоваться записями, рассказывать нужно из головы). Пары подбирают так, чтобы темы были разные. Потом следует еще одна групповая дискуссия и фидбек.

Занятия ведет фасилитатор, который закреплен за каждой группой. Наша - девушка из США, которая сейчас учится в докторантуре в Швейцарии. Во время первого занятия она была на конференции, поэтому попросила нас временно присоединиться к другим группам, второе провела сама, а на третьем заболела, поэтому занятие вела другая девушка. За исключением этого, курс очень хорошо технически организован, и все проходило без сучка, без задоринки. Еще всех добавляют в воркспейс в Slack, где более 10к участников(!) - там можно не только обсуждать учебу, но и дискутировать на другие темы, делиться своими исследованиями, просить фидбек, искать работу и т. д.

А, ну и про цену - курс полностью бесплатный, но можно задонатить (пока никто не предлагал). Не знаю, получают ли что-то фасилитаторы - возможно да.

В следующем посте расскажу, какие темы мы уже прошли, и как выглядят домашние задания.

#bluedot #technicalaisafety
🔥3👍1
У нас опять фасилитатор на замену, и она честно призналась, что не подготовилась, поэтому занятие по MechInterp немного превратилось в мою лекцию по MechInterp 😅

#bluedot #technicalaisafety
Про темы курса BlueDot по Technical AI Safety и домашки

В курсе шесть занятий, к каждому нужно готовиться. Домашка включает в себя довольно обширное чтение (я нерд и люблю читать статьи по MechInterp и AI safety в свободное время, так что в материалах было немало такого, чего я уже читала).

Также бывает нужно ответить на вопросы или написать пару коротких эссе. (Генеративные тексты не поощряются). Не знаю, проверяет ли кто-то эти эссе, но я на всякий случай всё делаю, тем более, что домашка реально нужна для подготовки к занятиям.

Судя по времени, указанному на сайте курса, подготовка должна занимать 2-3 часа, но у меня уходит гораздо больше. Читаю по-английски я быстро, но материалы уж очень обширные, к одному занятию я читала системные карты моделей Anthropic, которые отличаются исключительной вербозностью 😅

На первом занятии мы проходили общие места AI safety - как выглядит успех, почему сложно создать безопасный ИИ, и т. д.). Второе занятие было посвящено тренировке безопасных моделей. Третье занятие - методы обнаружения небезопасного поведения (по сути, evals). Четвертое было полностью посвящено MechInterp. Заглядывая вперед, пятое будет про минимизацию ущерба, а шестое - про (карьерные) возможности в AI safety (очень жду).

Пара слов о том, что мне понравилось в этом курсе по сравнению с ожиданиями. Во-первых, я знаю, что его создатели сильно аффилированы с EA (которых я недолюбливаю). И в списке чтения есть много статей, написанных представителями EA. Но курс оказался абсолютно объективный - нам не навязывают мнение, что ИИ - это плохо, и нужно бомбить датацентры 😅 И еще мне нравится, что курс очень практический - он посвящен современным LLM вместо абстрактного сверхразумного ИИ, про который пишут Юдковский и ко.

#bluedot #technicalaisafety
🔥2👍1
Слежу за кризисом, который ИИ устроил в математике.

Первой новостью был, кажется, пост 88-летнего ученого-информатика Дональда Кнута. Кнут узнал, что Клод Опус 4.6 решил проблему, над которой он бился несколько недель, и бурно радовался по этому поводу:

Shock! Shock! I learned yesterday that an open problem I’d been working on for several weeks had just been solved by Claude Opus 4.6 — Anthropic’s hybrid reasoning model that had been released three weeks earlier! It seems that I’ll have to revise my opinions about “generative AI” one of these days. What a joy it is to learn not only that my conjecture has a nice solution but also to celebrate this dramatic advance in automatic deduction and creative problem solving.

Всего полгода спустя Левент Альпоге, математик, работающий в Anthropic, поручил Fable решить проблему якобиана - и Fable внезапно блестяще справился. На этом месте многие математики уже забеспокоились.

В последовавшую за этим неделю пали еще несколько математических проблем. Сначала Теренс Тао опубликовал свой изящный диалог с ChatGPT по поводу той же проблемы якобиана. Все превозносили его промпты. Но вскоре выяснилось, что для того, чтобы решать математические проблемы с помощью LLM, совсем не обязательно вести с ней возвышенные математические беседы - можно просто грубо тыкать палочкой в модель в духе "подумай ещё" и "так, ну хватит, теперь давай полный контрпример". Дмитрий Рыбин использовал именно этот подход, чтобы опровергнуть гипотезу Диница — Гарга — Гёманса.

Тут математики приуныли совсем. Юзер @memecrashes, докторант-математик, написал: I am so tired of seeing my beloved field of study be the testing lab for a technology that is disrupting everyday life at such a high pace. Кирвин Хэмпшир высказался еще более депрессивно: I am suffering a profound spiritual crisis due to these developments. I have been screaming internally for days. It feels as though I am living inside of a nightmare.

Ну а гвоздь в крышку гроба человеческого превосходства в математике забила новая модель OpenAI Astra (аналог Mythos), которая махом решила не одну, не две, а десять открытых проблем.

Что я хочу сказать по этому поводу:

Во-первых это часть общего тренда - люди считают, что если ИИ делает их задачи лучше и быстрее них, их жизнь теряет всякий смысл. В основном это представители творческих профессий (художники, писатели, музыканты, сюда я отношу и математиков - Кирвин Хэмпшир в своем посте тоже говорит, что это творческая профессия), для которых важная часть идентичности - это успех и известность, пусть и в узком кругу. Но подавляющая часть людей, ныне живущих на Земле, не имеет никаких особых талантов (и одна из них - ваша покорная слуга). Все, что я бы ни делала, другие люди делают лучше, потому что я или упустила момент этому научиться или никогда бы не научилась. Люди лучше меня работают с данными, пишут стихи, играют на гитаре, говорят на иностранных языках, ездят на велосипеде. И теперь люди, которые привыкли быть если не лучше всех, то лучше многих, тоже столкнулись с сущностью, которая превосходит их интеллектом, так что я понимаю, что они чувствуют. Но я не вижу причин, по которым интеллект должен иметь границы - даже если это задевает наше самолюбие.

Во-вторых, я думаю, что такая сущность нам просто необходима, чтобы продвинуться дальше по шкале Кардашева. Город не построить каменным топором, теорию относительности не создать с помощью математики времен Пифагора, а многие проблемы, которые перед нами стоят, не решить без помощи сверхчеловеческого интеллекта. Это справедливо и для чистой математики - тот же Теренс Тао высказал мнение, что гипотеза Римана недоказуема без нового математического аппарата, - и тем более для прикладных задач. Объединение квантовой теории и теории гравитации кажется нерешаемым (об этом много говорит Сабина Хоссенфельдер), и это то место, где сверхразумный ИИ мог бы разблокировать прогресс. Так что я согласна с @perrymetzger, который напоминает, что в науке все-таки главное истина, а не тщеславие.

#математика #искусственный_интеллект #artificial_intelligence
2
Это этичный юзкейс для генеративного ИИ? 🤣
#непроии

К последнему занятию по Blue Dot Technical AI Safety задали прочитать пост Нила Нанды Become a person who Actually Does Things, и как же я согласна с этим.

It’s easy to always think “I can do this tomorrow” or “this is not a priority” or “this would never work”. And it’s hard, because sometimes those thoughts are correct. But I find that, unless I put in active effort, I’m the kind of person who’ll always have those thoughts. I’ll never actually act upon my goals, change things about my life.

One of the main symptoms of this is that I’m always aware of problems in my life, and will often be aware of them for a very long time. I’ll notice that I don’t exercise enough, that I’m not enjoying the courses I’m studying, that I really dislike being single, that I don’t have enough time to do what I find most fulfilling. But there won’t be a connection in my mind from “this is a problem” to “what am I going to do about it”. It’s not that I think through the problem, and conclude that I can’t do anything, it’s that it never feels like there’s a question to be asked in the first place! And I think this is a problem that extends far beyond me - I notice some amount of this in most of my friends, and I think it’s incredibly widespread. There seems to be a mental block between “things are not as I want them to be” and “I can actually do something about this”.

I think this really sucks, and can be one of the biggest meta-problems holding you back. But the reason I’m writing this post is not to complain about how much it sucks, it’s because I think this is a solvable problem. Being the kind of person who does things, an agent, is a skill, and I think it is a trainable skill. And this is hard, and won’t work perfectly, but there’s a lot of room for progress. And this is one of the most valuable skills I’ve ever tried developing.

Про I really dislike being single - жиза! Я много раз слышала от людей, что им не нравится быть в одиночестве и хочется найти партнера, но когда дело доходит до реальных действий, мало кто что-то делает. Может, это воспитание такое, но люди (обоих полов) почему-то в штыки воспринимают идею, что подходящего партнера можно и нужно сознательно искать. Когда я делюсь своим опытом, они находят тысячу отговорок, почему им это не подходит.

Да, современный дейтинг сломан (а раньше его и вообще не было, люди женились по расчету или знакомились в очень ограниченном круге лиц). Дейтинговые приложения и организованные оффлайн-ивенты оптимизированы не для того, чтобы ты нашел там партнера, а для того, чтобы продолжал туда ходить и тратить деньги. Но если ты достаточно мотивирован, эту систему можно хакнуть - именно на такой организованной оффлайн-встрече я познакомилась со своей замечательной супругой. И если бы я не протянула мостик от недовольства своей жизнью к реальным действиям и не пережила фрустрирующий опыт знакомств с неподходящими людьми, этого бы не произошло.
1👍1
Вчера было последнее занятие курса BlueDot Technical AI Safety. Оно было полностью посвящено перспективам исследовательской работы - какие существуют роли, программы, fellowships, куда и как стоит подаваться, и так далее. Узнала много нового, такого, что даже Клод не мог подсказать (не MATS-ом единым).

До конца курса в нашей группе дожили четыре человека, и выяснилось, что у всех плюс-минус одинаковый опыт. Мальчик из Великобритании недавно закончил баку по Computer Science и уже работает в Microsoft, куда устроился после интерншипа. Девочка из США (судя по имени и внешности, она из Средней Азии, не знаю, откуда точно) работает ML Engineer. Еще одна девочка из Германии недавно закончила магистратуру и с сентября выходит на работу Software Engineer. (Она честно сказала, что не испытывает от этого восторга и хочет заниматься AI safety, но кушать тоже надо). Ваша покорная слуга уже семь лет как в финтехе, ныне Senior Data Analyst.

При этом мы все очень хотим заниматься AI research, но прыгать с насиженного места с неплохой зарплатой в эту сферу страшно, особенно учитывая, что найм в айтишке переживает не лучшие времена. Обсуждали PhD, в частности то, что университеты (особенно за пределами US) конкретно так не успевают за прогрессом в сфере ИИ, и что разумно ли вообще тратить 4 года на одну тему, если, например, в MechInterp всё кардинально меняется каждые пару месяцев. (Пока я только думала вкатиться в эту сферу, Нил Нанда успел изобрести несколько новых методов и разочароваться в мехинтерпе). Наша модератор топила за академию в духе "PhD - это то, что вы из этого делаете", но у меня есть негативный опыт PhD, где никто не интересовался моей темой, включая научную руководительницу, мне под тупыми предлогами не давали доступ в лабораторию, и платили за это всё такую ветку, что приходилось подрабатывать. (За это осуждали, и за участие в зарубежных конференциях, кстати, тоже, хотя я оплачивала их из своего кармана и стипендий, выданных организаторами). Через год я оттуда свалила, потому что не люблю быть нищей и ненужной.

В итоге все пришли к выводу, что part-time fellowships рулят. Лично я сейчас собираюсь пойти именно этим путем - буду подаваться на SPAR и BlueDot Project. (И на MATS тоже, хотя на MATS меня, конечно, не возьмут). Собираюсь к тому времени, как ИИ похоронит разработку ПО и аналитику данных в ее нынешнем виде, иметь несколько публикаций и знакомства в сфере AI safety, и вот тогда пойду искать фулл-тайм магистратуру или PhD.

(Кстати, в этой сессии я участвовала из отеля на Майорке, где мы с супругой в отпуске. И пока мы трындели, моя супруга, которая уже много лет назад сделала PhD в Computer Science, отлично выспалась под наши моральные страдания об науку 😅).

#bluedot #technicalaisafety
4👍1
Подаю заявки на SPAR, плачу на восточноевропейском 🥲
👍1
Что я хочу вам сказать насчет SPAR - начинайте выбирать проекты заранее, друзья, как только их выкатили. Я откровенно сдедлайнила, потому что была в отпуске. При этом ко многим проектам нужно прочитать несколько статей/документов и написать довольно длинные и обстоятельные эссе/ответы на вопросы (до 1000 слов). В итоге завтра подавать, я выбрала два проекта, на которые подано меньше заявок (там есть такой фильтр, очень удобно), сижу пишу (один из проектов меня очень увлек, я и раньше интересовалась этой темой и даже написала про нее пост, потом поделюсь). Вероятно, больше ни на что податься не успею.

Меня извиняет только то, что на эту программу я подаюсь первый раз. Скопирую себе все требования к проектам, которые мне понравились, и следующие полгода буду подтягивать скиллы и писать тексты к следующему раунду (надеюсь, он будет).

#spar #projects #fellowships
👍1🤔1
АПДЕЙТ: Отправила заявки на два проекта, больше не успела (да и вряд ли мне еще что-то светит). Теоретически тур закрывается завтра, но я подала уже сегодня, чтобы не продолбаться.

Первый проект - Alignment without Personas. Ментору не нравится, что элайнмент больших языковых моделей в основном представляет собой persona selection, он считает, что этот подход будет плохо распространяться на более продвинутые модели (я с ним и согласна, и не согласна, и поспорила в заявлении).

Второй проект - Distilling the technical AI safety literature and co-authoring the AI Safety Atlas. Тут надо объяснять сложные концепты AI safety простыми словами, это дело я очень люблю (по принципу "три раза объяснил, уже сам понял") 😅 У меня есть целый блог, где я этим занимаюсь: https://medium.com/@solidgoldmagikarp. Кстати, есть в последнее время такое мнение, что в постсингулярной науке, в частности математике, мясные человеки будут заниматься в основном именно этим самым: понимать концепты, созданные ИИ, верифицировать их и объяснить другим людям (представь, что ты Сири Китон, да).

Теперь, если меня вообще отберут, будут еще интервью 😬

P.S. Завтра напишу про проекты, которые меня заинтересовали, но они мне не по зубам или я на них не успела податься.

#spar #projects #fellowships
👍3🔥1
Штош, попытка номер два впечатлить Нила Нанду объявляется открытой.

#mats
1👍1
Я обещала, что вчера напишу про проекты, на которые я не успела заявиться? Ахаха, я вас обманула 😅 На самом деле, вчерашний вечер ушел на то, чтобы в последний момент сунуть заявку на еще один проект.

Есть такой метод - data attribution. Он позволяет довольно точно проследить с помощью influence functions, какая именно часть тренировочных данных оказывает определенный эффект. Ментор проекта привел пример статьи, где модель зафайнтюнили на трех датасетах из вредных советов, чтобы добиться Emergent Misalignment, а потом с помощью data attribution искали, какие именно советы оказали наибольшее влияние. Его идея в том, чтобы проследить влияние не просто до совета, а до конкретных токенов.

В заявке на проект нужно было в т. ч. покритиковать статью (поскольку я тупая, то только сейчас обнаружила, что ментор - один из соавторов, а я критиковала так разгромно, будто ее третьи лица писали 😅). С influence functions я никогда раньше не имела дела и уверена, что человек с хорошей математической интуицией найдет, что там прокомментировать. Но мне, например, сразу бросилось в глаза, что:
а) датасеты целиком состояли из негативных советов (да, это нормальный сеттинг для исследований по Emergent Misalignment), а было бы интересно посмотреть, как влияют позитивные и нейтральные советы - может быть, некоторые из них тоже сдвигают model persona в сторону мизалайнмента, кто знает?
б) исследователи как-то там ранжировали советы по вредности и нашли, что некоторые из них повышают мизалайнмент аж на 5%, но не привели ни одного конкретного примера.

В связи с токенами мне еще вспоминается такая история (помимо того, что Emergent Misalignment, скорей всего, вызывают определенные концепты, которые размазаны по нескольким токенам): странное/вредоносное поведение модели могут вызывать токены, не имеющие к этому никакого семантического отношения, т. н. glitch tokens. Это токены, которых много в тренировочных данных токенайзера, но нет в тренировочных данных модели, поэтому она не знает, что с ними делать. GPT-3, например, в ответ на глитч токены могла ругнуться матом. (С тех пор модели стали более устойчивыми к таким атаками, но глитч токены все равно находят).

#spar #projects #fellowships
🔥4👍1
Последний час (точнее, уже полчаса) подачи заявок на оставшиеся проекты SPAR. Я вписалась еще в Generalist Megastream - там можно указать свою сферу интересов, и тебя (возможно) отберут в подходящий проект.

Вообще из всех углов пишут, что в AI safety сейчас очень нужны генералисты. Точного определения никто не дает, есть вот например такое: people who will go out and solve the tasks that people who feel limited by their job description won’t address. В моем скромном понимании это люди с хорошими гуманитарными скиллами, которые могут картировать исследования, управлять людьми, писать тексты, проводить квалитативный анализ и т. д, короче, делать в основном организационную и аналитическую работу. Вот, например, девушка, которая работает Generalist в Kairos, организации, которая спонсирует таланты в AI safety: https://www.linkedin.com/in/rebecca-baron-432254175/.

Хороший материал на LessWrong, куда податься генералистам: https://www.lesswrong.com/posts/Lu3uu8hBjsebFm6nK/concrete-generalist-projects-in-ai-safety-and-how-to-do-them
👍21
Заметила в последнее время такую фишку, что все только пишут, и никто ничего не читает. А если даже читают, то не оставляют фидбека. В науке это вообще становится огромной проблемой, особенно учитывая вал сгенерированных статей, раздувающих количество публикаций. Недавно даже Техножрица жаловалась, что ее новую статью никто не читает и не цитирует, а уж если исследователь такого уровня страдает от недостатка внимания, то что уж говорить про тех, кто пожиже...

Я сама, честно говоря, не знаю, как сделать свою работу видимой. Алгоритмы соцсетей поощряют скандальность и виральность, но черт его знает, как достичь этой виральности. Такое ощущение, что у людей сейчас вообще нет времени и сил читать, не говоря уже про то, чтобы комментировать - особенно если в контент надо вникать.

Мой пост в Medium про Glitch Tokens, написанный 1,5 года назад, разлетелся, его прочитали 2к человек, и сейчас он пятый в выдаче гугла (хотя подписчиков мне это особо не принесло). Недавно я написала пост про исследование космоса с помощью автономных агентов на основе LLM, и прочитали его 13(!) человек. Вот и пойми, в чем проблема - то ли тема неинтересная, то ли я как-то не так помолилась алгоритмическим богам. То ли интернет уже так завалило генеративными текстами, что никто ничего не может найти.

(Если что, это не самореклама и не призывы читать мои посты, мне просто реально интересно, что происходит.)

Для себя я решила, что:
а) все равно буду писать - даже если писанина теряется в алгоритмах, может, кто-то начет спрашивать Клода, а Клод возьмет и найдет мой пост (плюс, как выяснилось, при подаче заявок на многие программы и fellowships, особенно для генералистов, просят прислать примеры статей/постов);
б) как бы это ни было сложно, буду уделять время тому, чтобы читать и воспроизводить чужие исследования (сегодня я попыталась воспроизвести вот это исследование Transluce про User Awareness, и оно реально работает!).
6🔥1
Нашла крутой ресурс по Mechanistic Interpretability с фокусом на трансформеры. Автор - Iván Arcuschin Moreno, судя по CV дважды выпускник MATS (живут же люди!).

Когда я начала углубляться в MechInterp в 2024 году, мне очень не хватало такого систематического обзора методов, написанного простым языком. Конечно, есть прекрасный глоссарий Нила Нанды, но он написан по принципу "кто сдох - тот лох" 😅 К примеру, там вообще не дается определение понятий activations или residual stream, их просто с ходу используют, чтобы определить другие понятия. Плюс, там нет совсем новых методов типа J-lens или NLAs. А этот курс очень новый, и материал в нем, на мой взгляд, изложен в более логической последовательности.

#MechInterp
🔥21