Где-то год назад я воспроизводила что-то, не помню что. Получалось супер-больно, и моя коллега выдала фразу "Хе-хе-хе, добро пожаловать в кровавый опенсорс".
Времени прошло немного, но за это время эту фразу я прям прочувствовала. И не прошло и пол-месяца, и я снова вышла из схватки с опенсорсом вроде не проигравшей — добила вторую статью в серии про steering (первая — тут).
И вот, Хабр 2: https://habr.com/ru/articles/1056006/ сдвигаем модели в нужную сторону через repeng и pyreft.
В статье очень аккуратно разобрано — что откуда идёт и что совпадает с теоретической постановокой в реализации, а что — нет. Есть красивая сводная таблица, математика, и единорог (на картинке он, да).
Ссылка на ноутбук в коллаб.
Ссылка на ноутбук на гитхаб.
А пару тысяч вас я отметила печеньками, жесть, друзья, спасибо! 🔥
Времени прошло немного, но за это время эту фразу я прям прочувствовала. И не прошло и пол-месяца, и я снова вышла из схватки с опенсорсом вроде не проигравшей — добила вторую статью в серии про steering (первая — тут).
И вот, Хабр 2: https://habr.com/ru/articles/1056006/ сдвигаем модели в нужную сторону через repeng и pyreft.
В статье очень аккуратно разобрано — что откуда идёт и что совпадает с теоретической постановокой в реализации, а что — нет. Есть красивая сводная таблица, математика, и единорог (на картинке он, да).
Ссылка на ноутбук в коллаб.
Ссылка на ноутбук на гитхаб.
А пару тысяч вас я отметила печеньками, жесть, друзья, спасибо! 🔥
1🔥40❤6👍1
J-Lens или Джи — значит Jacobian.
Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).
Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!
Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».
Что: Jacobian-Space, найденный на основе J-Lens.
Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.
Как это происходит интуитивно:
Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.
Мысли, которые хочу выделить (просто хаотичные заметки):
1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.
2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.
3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»
4. Отличие от простой линейной аппроксимации (Tuned Lens)
Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о <чем либо>, то о чём она, вероятнее всего, будет думать на последнем слое?»
Проблема: такой подход автоматически включает множество коррелирующих понятий.
Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»
Полезные ссылки:
Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)
Вчера Anthropic выпустили блог пост про рабочее пространство J-workspace внутри Claude. Они соотнесли его с глубокими рассуждениями, скрытыми в голове человека обычно. Красивые аналогии есть в видео (я приложила ссылку ниже).
Качественный анализ любого сколь угодно сильного предположения требует львиную долю времени и я руководствуюсь тем, что никогда ни один метод не стоит принимать за чистую монету. Но метод очень красивый!
Отсюда репорчу логику метода, а также мысли авторов, делавших обзор на работу. И Боже упаси — бегите от желтой прессы, вроде «Ученые нашли сознание…».
Что: Jacobian-Space, найденный на основе J-Lens.
Как — собрала картинки (подробно также описано в статье, но мне всегда легче видеть пример на предложении). Движок метода — усредненный Якобиан. Идея — вытаскивать направления интересующего нас токена по словарю модели.
Как это происходит интуитивно:
Был у нас промпт: The capital of France is ?
Это все прошло через несколько (пусть 3) слоев.
Получилась генерация: The capital of France is ? Paris.
Генерация дала два токена.
Берём токен «?» на одном из ранних слоёв. Это токен, после которого на финальном представлении есть следующие — "Paris" и "." .
Внутри на этом слое есть какая-то координата 0.30 (обозначена за «country» ), координата 0.05 (обозначена за «capital»). Обозначения здесь — это истинные словесные описания координат после проекции через unembedding матрицу, но мы их не знаем. Если прочитать это в лоб в словарь (как делает Logit Lens), мы получим, что модель как будто думает про страну, а не про город.
Предложенный метод предлагает попробовать ответить на вопрос: если я чуть-чуть шевельну координату1 (обозначена за «country») на токене ?, как изменится финальная координата2 («capital») на позиции "Paris"? — это оч сложно осознать, но смотрите картинки!
Чтобы получить надёжное число, а не случайность предложения, вопрос задаётся многократно: для всех позиций во множестве разных промптов (не только "France", но и "Germany", "Japan" и т.д.), и для всех future-позиций, а не только для "Paris". Всё это усредняется в одну матрицу d_model x d_model — по сути движения в пространстве модели.
И так для каждого слоя.
Дальше просто умножаем матрички Якобианов на скрытые представления — J·h — и получаем новые, и делаем софтмакс по словарю.
Мысли, которые хочу выделить (просто хаотичные заметки):
1. У метода может быть много ложноположительных срабатываний. Многие концепты действительно тесно связаны с отдельными токенами словаря, поэтому использование словаря как способа идентификации концептов — полезная эвристика. Однако совершенно очевидно, что подобный подход будет пропускать множество внутренних представлений.
2. Преимущество метода — вербализуемые концепты — то есть те внутренние представления, которые соответствуют понятиям человеческого языка. Это удобно.
3. Как стоит оценивать метод (цитата Нила Нанды): «Почему J-Lens достаточно хорошо совпадает с тем, как модель действительно мыслит, чтобы быть практически полезным инструментом?»
4. Отличие от простой линейной аппроксимации (Tuned Lens)
Что делает линейная регрессия? Линейная регрессия отвечает примерно на следующий вопрос: «Если модель находится в состоянии, где она думает о <чем либо>, то о чём она, вероятнее всего, будет думать на последнем слое?»
Проблема: такой подход автоматически включает множество коррелирующих понятий.
Что делает якобиан? Если заставить модель думать об этом концепте совсем немного сильнее, что она станет немного более склонна сказать?»
Полезные ссылки:
Репликация результатов на Qwen3.6-27B: Neuropedia
Интуитивное описание без единой формулы: красивый YouTube
Полный текст: AnthropicPaper
Независимые ревью: Док с группой исследователей, отдельно ревью от Neel Nanda (классный исследователь)
👍10👀3❤2
Чем прекрасен мир каналов — можно писать рандомным классным людям и знакомиться фразой в духе — вау, вы классный, я тоже страдаю тем, что после работы люблю работать, давайте расскажем людям друг о друге.
Так что это 50% с моей стороны — Андрей, @datastorieslanguages, Meta.
Андрей занимался ML, работал с антифродом, рекомендациями, CV, NLP, и к сегодня исследует AI-агентов и тюнинг LLM (собрал почти всё). А ещё он занимался и занимается моим личным адом — Kaggle.
Все ведут каналы по разному — я душню, описываю свою практику и (редко, но метко) делюсь мыслями в #outofresearch (там целый один пост), а Андрей в канале сочетает мемы, разборы, и личные рубрики.
Из технических примеров постов:
• LocateAnything — новая архитектура для vision-language grounding с параллельным декодированием боксов, которая заметно ускоряет детекцию объектов без потери качества.
🔗 https://t.me/datastorieslanguages/689
• γ-World — multi-agent world model от NVIDIA, где элегантно решена проблема согласованности между несколькими агентами.
🔗 https://t.me/datastorieslanguages/672
И из чего-то экзотного — мини разбор статьи о том, что происходит внутри Meta — в цитатах в рамках NDA, конечно:
🔗 https://t.me/datastorieslanguages/686
В общем, когда человек дошел от Москвы до Meta — в нынешних реалиях это нетривиально и как минимум интересно. И быть может, вам будет также интересно, как мне : )
Так что это 50% с моей стороны — Андрей, @datastorieslanguages, Meta.
Андрей занимался ML, работал с антифродом, рекомендациями, CV, NLP, и к сегодня исследует AI-агентов и тюнинг LLM (собрал почти всё). А ещё он занимался и занимается моим личным адом — Kaggle.
Все ведут каналы по разному — я душню, описываю свою практику и (редко, но метко) делюсь мыслями в #outofresearch (там целый один пост), а Андрей в канале сочетает мемы, разборы, и личные рубрики.
Из технических примеров постов:
• LocateAnything — новая архитектура для vision-language grounding с параллельным декодированием боксов, которая заметно ускоряет детекцию объектов без потери качества.
🔗 https://t.me/datastorieslanguages/689
• γ-World — multi-agent world model от NVIDIA, где элегантно решена проблема согласованности между несколькими агентами.
🔗 https://t.me/datastorieslanguages/672
И из чего-то экзотного — мини разбор статьи о том, что происходит внутри Meta — в цитатах в рамках NDA, конечно:
🔗 https://t.me/datastorieslanguages/686
В общем, когда человек дошел от Москвы до Meta — в нынешних реалиях это нетривиально и как минимум интересно. И быть может, вам будет также интересно, как мне : )
P.S. А ещё мы сошлись на том, что сабмит в соревнование — это почти подписка на мазохизм. Не знаю, зачем вам это знание, но вдруг вы это разделяете.
Telegram
Data, Stories and Languages
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
Современные VLM для детекции и grounding кодируют bounding box как текст: каждый бокс — это короткая строка координатных токенов, которые декодируются по одному…
Современные VLM для детекции и grounding кодируют bounding box как текст: каждый бокс — это короткая строка координатных токенов, которые декодируются по одному…
👍8❤5🤡1
Shit happens. Shape, к счастью, тоже Happens
Мне тут очень надо "упороться" с геометрией для проекта, так что я тестирую разные гипотезы по доставанию структур из моделей. Попалась свежая работа: «Shape Happens: Automatic Feature Manifold Discovery in LLMs via Supervised
Multi-Dimensional Scaling».
Пререквизит:
Но чтобы понять, как ты ищешь и какая структура лучше — нужно изрядно медитировать — я свою ищу уже пару месяцев. Откуда это — есть проблема, что в силу неэквивалентности постановки, разные методы — PCA, LDA, PLS, Probes (и то, что мы с них снимем — проекции, долю дисперсии и пр.) покажут, вообще говоря, разные результаты.
Авторы решили проблему гениально.
Пусть у нас есть запросы и для каждого запроса есть метка y.
Мы делаем раз:
1. Берём метки и считаем для меток попарные расстояния d(y_i, y_j)
И делаем 2 и 3:
2. Ищем проекцию W, которая эти расстояния лучше всего воспроизводит на реальных hidden states.
3. Сравниваем ошибку (в статье используется термин stress) между разными гипотезами и берём победителя.
Движок состоит в расстояниях — d(y_i, y_j) можно посчитать разными способами. Способы задать расстояние связаны, в свою очередь, с формой, на которую положены точки (картинка расстояний-форм в комментах). Отсюда, по постановке, лучший метод выбирается из вопроса:
Почему проекция линейная и можно ли не очень линейную:
На второй вопрос — лучше не можно — её сложнее интерпретировать и легче переобучиться.
На первый вопрос — если W линейна, низкий stress означает конкретное, утверждение: метки y читаются из residual stream через фиксированное вращение/выбор направлений — то есть признак представлен как набор направлений в активациях, а не спрятан в какой-то запутанной нелинейной комбинации нейронов. Это ровно содержание linear representation hypothesis.
Практическое применение авторы дали такое:
— если внести шум в найденное SMDS подпространство (а оно низкоразмерное —2-3 измерения), точность на temporal reasoning падает не хуже, чем от шума во всём hidden state (шум той же силы в случайном подпространстве такого же размера эффекта при этом не дает). Плюс качество многообразия (тот самый stress) коррелирует с точностью модели: кто аккуратнее укладывает признаки в геометрию, тот лучше рассуждает. Но к этому утверждению аккуратно лучше быть.
И ладно идейно красиво — у ребят библиотека накожена! Из зоопарка форм можно погонять: линию, лог-линию, полукруг, лог-полукруг, круг, дискретный круг и кластер (в 3D — тетраэдр). И всякие экзоты — вроде Бутылки Клейна и Тора. Если кто-то найдет, что в них организуется внутри моделей — дайте знать, пожалуйста))) Особенно про бутылку.
Эксперименты статьи: shape-happens
Код авторов: supervised-multidimensional-scaling
Всем хороших выходных, друзья, пусть на них случится только не shit ☺️
Мне тут очень надо "упороться" с геометрией для проекта, так что я тестирую разные гипотезы по доставанию структур из моделей. Попалась свежая работа: «Shape Happens: Automatic Feature Manifold Discovery in LLMs via Supervised
Multi-Dimensional Scaling».
Пререквизит:
Если мы зайдем в модель и оглядимся, то можем увидеть красивое. Сейчас показано несколько эмпирических фактов. Можно найти окружности (показано для дней недели и месяцев), кластеры, поверхности.
Но чтобы понять, как ты ищешь и какая структура лучше — нужно изрядно медитировать — я свою ищу уже пару месяцев. Откуда это — есть проблема, что в силу неэквивалентности постановки, разные методы — PCA, LDA, PLS, Probes (и то, что мы с них снимем — проекции, долю дисперсии и пр.) покажут, вообще говоря, разные результаты.
Авторы решили проблему гениально.
Пусть у нас есть запросы и для каждого запроса есть метка y.
Мы делаем раз:
1. Берём метки и считаем для меток попарные расстояния d(y_i, y_j)
И делаем 2 и 3:
2. Ищем проекцию W, которая эти расстояния лучше всего воспроизводит на реальных hidden states.
3. Сравниваем ошибку (в статье используется термин stress) между разными гипотезами и берём победителя.
Движок состоит в расстояниях — d(y_i, y_j) можно посчитать разными способами. Способы задать расстояние связаны, в свою очередь, с формой, на которую положены точки (картинка расстояний-форм в комментах). Отсюда, по постановке, лучший метод выбирается из вопроса:
«Для какой структуры расстояний существует максимально точная линейная проекция»?
Почему проекция линейная и можно ли не очень линейную:
На второй вопрос — лучше не можно — её сложнее интерпретировать и легче переобучиться.
На первый вопрос — если W линейна, низкий stress означает конкретное, утверждение: метки y читаются из residual stream через фиксированное вращение/выбор направлений — то есть признак представлен как набор направлений в активациях, а не спрятан в какой-то запутанной нелинейной комбинации нейронов. Это ровно содержание linear representation hypothesis.
Практическое применение авторы дали такое:
— если внести шум в найденное SMDS подпространство (а оно низкоразмерное —2-3 измерения), точность на temporal reasoning падает не хуже, чем от шума во всём hidden state (шум той же силы в случайном подпространстве такого же размера эффекта при этом не дает). Плюс качество многообразия (тот самый stress) коррелирует с точностью модели: кто аккуратнее укладывает признаки в геометрию, тот лучше рассуждает. Но к этому утверждению аккуратно лучше быть.
И ладно идейно красиво — у ребят библиотека накожена! Из зоопарка форм можно погонять: линию, лог-линию, полукруг, лог-полукруг, круг, дискретный круг и кластер (в 3D — тетраэдр). И всякие экзоты — вроде Бутылки Клейна и Тора. Если кто-то найдет, что в них организуется внутри моделей — дайте знать, пожалуйста))) Особенно про бутылку.
Эксперименты статьи: shape-happens
Код авторов: supervised-multidimensional-scaling
Всем хороших выходных, друзья, пусть на них случится только не shit ☺️
❤7👍4
Линейно, линеаризуемо и так далее
Если ваша ночь (или день, или утро — выбирайте лагерь, в котором вы читаете посты) уже нелинейны — иду вас линеаризовать.
Интерес был у меня такой
В интерпретируемости линейные модели и линейные приближения — практически везде: probing (поиск линейного разделения в активациях), steering (сдвиг поведения модели линейной добавкой к активациям) и даже, что не так очевидно, SAE — в основе которых лежит идея, что модель хранит признаки как (почти) линейно разделимые направления в пространстве активаций.
И я сейчас как раз, перетирая открытый курс, задумалась поглубже (очень поглубже) — что вообще позволяет так полагаться на линейность? Вдогонку — у меня была дискуссия о теореме, которая объясняет всё это разом (мы не вспомнили). Я закопалась — и нашла шесть.
У меня детский восторг, ибо опять вопрос "люди придумали математику или люди математику открыли?" можно ставить боком. Несу свой десткий восторг вам.
1. Теорема Тейлора
Любую гладкую функцию рядом с точкой можно заменить на линейную — касательную. Чем ближе к точке, тем точнее.
Пример: LIME — это теорема Тейлора. Чтобы объяснить прогноз чёрного ящика, LIME генерирует точки рядом с объектом и обучает на них линейную модель — то есть оценивает касательную, не имея доступа к самой функции. Градиентные saliency-maps — туда же. Градиент — дает линейный коэффициент.
2. Теорема Вейерштрасса / Стоуна–Вейерштрасса
Любую непрерывную функцию на отрезке можно приблизить полиномом сколь угодно точно (просто-бахни-многостепеней).
Пример: Generalized Additive Models. Вместо одного веса на признак здсь модель учит целую кривую для каждого признака. Такие модели, кстати, всё ещё относят к интерпретируемым — ибо она остается суммой (линейной) слагаемых.
3. Теорема Цыбенко (Universal Approximation Theorem)
Ну, если бы я её не включила — можно выключить меня из ML в целом. Нейросеть с одним скрытым слоем и достаточным числом нейронов приближает любую непрерывную функцию. (с)
Пример: это я вижу как объяснение, зачем вообще нужен XAI. Сеть может выучить что угодно сколь угодно сложное — прочитать это по весам напрямую нельзя. Отсюда все страдания.
4. Теорема Ковера (Cover's theorem)
Чем выше размерность пространства, в которое вы проецируете точки, тем больше шанс, что случайное разбиение точек на два класса (дихотомия — просто разметка 0/1) окажется разделимо одной гиперплоскостью.
Пример: kernel SVM с RBF-ядром на деле разделяет классы гиперплоскостью не в исходном пространстве, а в неявном пространстве куда большей размерности. Пример прикольнее — SAE. В них концепты разделить проще, в силу построенного базиса (а SAE работает на расширение размерности).
5. Теорема о представителе (Representer theorem)
Оптимальное решение задачи в бесконечномерном пространстве функций всегда можно записать как сумму вкладов обучающих точек, каждая — со своим весом (ядром).
Пример: о нет, но нда — опять SVM — сумма похожестей на опорные векторы с весами. На той же идее строятся example-based объяснения.
6. Теорема Мерсера (а что есть ядро)
Она отвечает на вопрос «а какую эту функцию похожести ядром, чтоб собрать представителя?» — нужны два условия: симметричность и положительная полуопределённость (по сути — функция должна вести себя как скалярное произведение).
Если ваша ночь (или день, или утро — выбирайте лагерь, в котором вы читаете посты) уже нелинейны — иду вас линеаризовать.
Интерес был у меня такой
В интерпретируемости линейные модели и линейные приближения — практически везде: probing (поиск линейного разделения в активациях), steering (сдвиг поведения модели линейной добавкой к активациям) и даже, что не так очевидно, SAE — в основе которых лежит идея, что модель хранит признаки как (почти) линейно разделимые направления в пространстве активаций.
И я сейчас как раз, перетирая открытый курс, задумалась поглубже (очень поглубже) — что вообще позволяет так полагаться на линейность? Вдогонку — у меня была дискуссия о теореме, которая объясняет всё это разом (мы не вспомнили). Я закопалась — и нашла шесть.
У меня детский восторг, ибо опять вопрос "люди придумали математику или люди математику открыли?" можно ставить боком. Несу свой десткий восторг вам.
Термины
Не формальные определения. За формальными — советую, всё же, в книги.
Гладкость — у функции нет изломов и скачков: если сильно приблизить её график в любой точке, он всё больше похож на прямую линию.
Плотность — множество A «плотно» в пространстве X, если рядом с любой точкой X найдётся элемент A сколь угодно близко. Для функций это значит: любую функцию можно подойти сколь угодно точно функцией из такого множества.
RKHS (Reproducing Kernel Hilbert Space) — пространство функций, порождённое функцией-ядром (мерой похожести двух точек). Это часто бесконечномерное пространство признаков, в которое, например, неявно проецирует kernel trick (вспомните SVM) — им можно пользоваться, ни разу не вычисляя координаты явно.
1. Теорема Тейлора
Любую гладкую функцию рядом с точкой можно заменить на линейную — касательную. Чем ближе к точке, тем точнее.
Пример: LIME — это теорема Тейлора. Чтобы объяснить прогноз чёрного ящика, LIME генерирует точки рядом с объектом и обучает на них линейную модель — то есть оценивает касательную, не имея доступа к самой функции. Градиентные saliency-maps — туда же. Градиент — дает линейный коэффициент.
2. Теорема Вейерштрасса / Стоуна–Вейерштрасса
Любую непрерывную функцию на отрезке можно приблизить полиномом сколь угодно точно (просто-бахни-многостепеней).
Пример: Generalized Additive Models. Вместо одного веса на признак здсь модель учит целую кривую для каждого признака. Такие модели, кстати, всё ещё относят к интерпретируемым — ибо она остается суммой (линейной) слагаемых.
3. Теорема Цыбенко (Universal Approximation Theorem)
Ну, если бы я её не включила — можно выключить меня из ML в целом. Нейросеть с одним скрытым слоем и достаточным числом нейронов приближает любую непрерывную функцию. (с)
Пример: это я вижу как объяснение, зачем вообще нужен XAI. Сеть может выучить что угодно сколь угодно сложное — прочитать это по весам напрямую нельзя. Отсюда все страдания.
4. Теорема Ковера (Cover's theorem)
Чем выше размерность пространства, в которое вы проецируете точки, тем больше шанс, что случайное разбиение точек на два класса (дихотомия — просто разметка 0/1) окажется разделимо одной гиперплоскостью.
Пример: kernel SVM с RBF-ядром на деле разделяет классы гиперплоскостью не в исходном пространстве, а в неявном пространстве куда большей размерности. Пример прикольнее — SAE. В них концепты разделить проще, в силу построенного базиса (а SAE работает на расширение размерности).
5. Теорема о представителе (Representer theorem)
Оптимальное решение задачи в бесконечномерном пространстве функций всегда можно записать как сумму вкладов обучающих точек, каждая — со своим весом (ядром).
Пример: о нет, но нда — опять SVM — сумма похожестей на опорные векторы с весами. На той же идее строятся example-based объяснения.
6. Теорема Мерсера (а что есть ядро)
Она отвечает на вопрос «а какую эту функцию похожести ядром, чтоб собрать представителя?» — нужны два условия: симметричность и положительная полуопределённость (по сути — функция должна вести себя как скалярное произведение).
❤10👍5👏3🤝1
Друзья, привет! Очередные потуги в порождении и последующей поддержке open-source (тут тоже явить на свет — одно, воспитать и вырастить, блин, другое)
Обновила XAI Library Navigator (рабочее название, я умнее не придумала). Напомню, что это:
Каталог библиотек для интерпретируемости ML/DL/LM. Включает MechInt и классический XAI. Есть фильтр по парадигме, модальности и типу метода, а ещё по тому, как давно библиотека обновлялась (читать — поддерживается ли она).
Сейчас в ней (или в нём, потому что я не определилась — навигарта это или просто табличка) 57 либ.
Что нового: добавила свежие инструменты по механистической интерпретации — SMDS (feature manifold discovery в LLM), circuit-tracer (attribution graphs через транскодеры), sparsify и delphi от EleutherAI, Llamascopium (OpenMOSS) и Penzai (DeepMind). Плюс звёзды и даты последнего коммита обновила.
Табличка собрана на стримлите https://xai-table.streamlit.app . Впрочем, раньше она собиралась на гугл диске.
Если знаете библиотеку, которой не хватает, то кидайте через форму «Suggest a Library» — добавлю.
И если можете пошерить, то было бы круто! Это очень больно — искать рабочую либу, так что пусть в мире будет поменьше боли : )
#xai_navi
Обновила XAI Library Navigator (рабочее название, я умнее не придумала). Напомню, что это:
Каталог библиотек для интерпретируемости ML/DL/LM. Включает MechInt и классический XAI. Есть фильтр по парадигме, модальности и типу метода, а ещё по тому, как давно библиотека обновлялась (читать — поддерживается ли она).
Сейчас в ней (или в нём, потому что я не определилась — навигарта это или просто табличка) 57 либ.
Что нового: добавила свежие инструменты по механистической интерпретации — SMDS (feature manifold discovery в LLM), circuit-tracer (attribution graphs через транскодеры), sparsify и delphi от EleutherAI, Llamascopium (OpenMOSS) и Penzai (DeepMind). Плюс звёзды и даты последнего коммита обновила.
Табличка собрана на стримлите https://xai-table.streamlit.app . Впрочем, раньше она собиралась на гугл диске.
Если знаете библиотеку, которой не хватает, то кидайте через форму «Suggest a Library» — добавлю.
И если можете пошерить, то было бы круто! Это очень больно — искать рабочую либу, так что пусть в мире будет поменьше боли : )
#xai_navi
Streamlit
XAI Library Navigator
A Streamlit app for finding and filtering libraries for ML model interpretation — covering both ...
❤19🔥11👍7
Как порядочный человек умею сталкерить за всеми, если очень захочется. Но мне лень (только если иногда …), так что я сталкерю за статьями. У одной из моих работ появилась целая вторая цитата в:
«The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook».
Помимо того, что приятно глазу видеть себя в авторах, где-то там в задней части статьи, я очень кайфанула от самой структуры обзора, поэтому он тут.
Статья — обзор (68 страниц) про латентные пространства в моделях.
Работа сводит обзор к категоризации:
* как латент устроен (архитектура / представление / вычисление / оптимизация). То есть как он засунут в модель
* что он даёт (reasoning, planning, memory, perception, collaboration, embodiment). То есть что модель этим латентом делает.
На этих двух категориях взято декартово произведение и получено разбиение всяко-разных моделей.
Примеры красивого:
COCONUT — модель рассуждает векторами. Обычно, рассуждая, модель каждый промежуточный шаг преобразует в слово и подаёт его себе обратно на вход. COCONUT этот шаг выкидывает и кормит себе своё скрытое состояние.
Mirage — VLM вставляет в рассуждение визуальные токены вместо слов.
C2C / Cache-to-Cache — две модели обмениваются информацией напрямую через проекцию KV-кэша, без генерации промежуточного текста.
MemGen — модель хранит непрерывную латентную память и вызывает её по триггеру, вместо удержания всего в текстовом контексте.
UniVLA — латентные действия робота выучиваются из немаркированного видео и переносятся между разными платформами-телами.
Зачем использовать такие обзоры:
Статьи вы и без меня найдете, а вот самые вкусные считаю важным принести. Я на подобные смотрю:
а) эстетически — область — прекрасна;
б) опорно — сохраняю для дальнейшего рисёрча по теме;
в) исторически — видно, что в мире есть/было на 20XX год;
г) студенчески — вижу, что происходит вне моего xai-пузыря.
Поэтому она тут — мне подход помогает. Примеры красивого выше я знала не все, а оно всё такое интересное.
«The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook».
Помимо того, что приятно глазу видеть себя в авторах, где-то там в задней части статьи, я очень кайфанула от самой структуры обзора, поэтому он тут.
Статья — обзор (68 страниц) про латентные пространства в моделях.
Латент в работе понимается как среда вычислений внутри модели, где происходит процесс (рассуждение, память, восприятие, координация между агентами и действие).
Работа сводит обзор к категоризации:
* как латент устроен (архитектура / представление / вычисление / оптимизация). То есть как он засунут в модель
* что он даёт (reasoning, planning, memory, perception, collaboration, embodiment). То есть что модель этим латентом делает.
На этих двух категориях взято декартово произведение и получено разбиение всяко-разных моделей.
Примеры красивого:
COCONUT — модель рассуждает векторами. Обычно, рассуждая, модель каждый промежуточный шаг преобразует в слово и подаёт его себе обратно на вход. COCONUT этот шаг выкидывает и кормит себе своё скрытое состояние.
Mirage — VLM вставляет в рассуждение визуальные токены вместо слов.
C2C / Cache-to-Cache — две модели обмениваются информацией напрямую через проекцию KV-кэша, без генерации промежуточного текста.
MemGen — модель хранит непрерывную латентную память и вызывает её по триггеру, вместо удержания всего в текстовом контексте.
UniVLA — латентные действия робота выучиваются из немаркированного видео и переносятся между разными платформами-телами.
Зачем использовать такие обзоры:
Статьи вы и без меня найдете, а вот самые вкусные считаю важным принести. Я на подобные смотрю:
а) эстетически — область — прекрасна;
б) опорно — сохраняю для дальнейшего рисёрча по теме;
в) исторически — видно, что в мире есть/было на 20XX год;
г) студенчески — вижу, что происходит вне моего xai-пузыря.
Поэтому она тут — мне подход помогает. Примеры красивого выше я знала не все, а оно всё такое интересное.
👍13❤8🔥1