автономна система прийняття рішень
64 subscribers
13 photos
9 links
machine unlearning, аспірантура в УКУ, проєкт FairForget, розбори статей і невдалі експерименти (а інколи і вдалі)
Download Telegram
Ділюсь першою статтею з Unleaning для narrative suppression, котру прийняли на WIPE-OUT 2026: Machine Unlearning Workshop, ECML-PKDD

Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS

У цьому дослідженні ми перевіряємо, чи можуть наявні методи unlearning придушувати небажані наративи (у нашому випадку дезінформацію).
І, якщо так, чи є момент, у який можна зупинити тренування до колапсу відповідей. Технічно ми бачимо, що це можливо.

Загалом було дуже цікаво перевірити, чи має модель чим "підмінити" небажаний наратив після unlearning. Тобто що саме лежить під небажаним фреймом? Інколи ним виявлявся антинаратив.

Дослідження пілотне: нашою метою було розуміти, як краще розвивати ідею narrative unlearning і чи поточні методи вже достатньо добре працюють. Один із викликів тут (це видно з дисклеймера до статті) - це подати матеріал нейтрально.

У планах - розширити unlearning-датасет на наративи та знайти спосіб автоматизувати пошук стану suppression до того, як настає collapse відповідей.
🔥3
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

Вписувати в промпті, що інтернет відсутній а не вимикати його рахується за окремий «incident»? 😁
😁2😱1
Forwarded from AI HOUSE
🔔 20 серпня поговоримо про те, чому великі мовні моделі поводяться не так, як ми очікуємо, та чи можливо навчити їх «забувати» інформацію без втрат її можливостей.

Нагадуємо про <Align, Forget, Repeat Meetup> — технічну подію у Львові для тих, хто працює з LLM, досліджує AI Alignment, Machine Unlearning та сучасні виклики AI Safety.

🔈 Спікерки:
— Марія Королюк, Research Fellow у LASR Labs.
— Вікторія Маковська, Research Engineer у Lapa LLM, PhD-дослідниця УКУ.

▪️ Дата: 20 серпня, 18:00
▪️ Формат: офлайн у Львові
▪️ Вартість: донат від 500 грн на БО <Реактивна Пошта>
▪️ Кількість місць обмежена

А в каруселі зібрали 4 причини відвідати мітап <Align, Forget, Repeat> ☝️

Реєструйтеся за посиланням 🌱

🏠 LinkedIn 🏠 Instagram 🏠 Podcast
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Готую матеріали на доповідь і знайшла цікавий пейпер: Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models [EMNLP 2025]

Вони зазначають
Our findings reveal that the set of parameters that must be modified for effective unlearning is not strictly determined

We regard this as compelling evidence against the assumption that a fixed set of parameters must be updated to achieve effective unlearning. The results suggest that unlearning may not rely on a specific parameter region, but can instead be achieved through multiple alternative regions in the model.


Автори перевіряють це в сетапі, де ground-truth регіон, у якому було вивчено forget знання, наперед відомий (сабсет із 10% MLP value vectors, через які вони навчили ці знання). Але роблять unlearning через інший випадково вибраний сабсет MLP value vectors. Все окрім обраного сабсету заморожували і виконували unlearning алгоритм на ньому і це давало ефект unlearning.

Тобто... gradient-ascent (based) unlearning (і не тільки, але цей як інтуїтивний приклад) все одно зміг знайти зміни в (випадково обраному) сабсеті MLP параметрів і досягти unlearning ефекту 🤯🚐

тобто вони показують що вірогідно, що unlearning ефекту можна досягти через альтернативні регіони моделі і НЕ обовʼязково (посилатись на interpretability) знати регіон, де 'записали' знання.

мені перегукується з концептом про superposition (або ж можна зустріти повʼязаний з цим феномен Polysemanticity)
👍5
Нарешті пройшли один з перших майлстоунів проєкту FairForget, над яким ми працюємо з Oleksandra Ostafiichuk та Tetiana Zakharchenko
Цей проєкт пройшов відбір і стартував за підтримки програми Women Led Science, якщо коротро то ми досліджуємо, чи можна застосовувати machine unlearning для зменшення упереджень у мовних моделях. Ми також перевіряємо можливий bias redistribution: ситуацію, коли модель стає менш упередженою за одним виміром, але демонструє сильніше зміщення за іншим. Ми керуємось тим, що bias correlation був раніше визначений в деяких роботах і відповідно припускаємо що unlearning одного упередження може потягти зміни в інших.

FairForget почався зі створення відтворюваного сетапу схильності до упереджень моделей до і після unlearning. І тому ми переклали та почали адаптовувати найбільш популярні датасети BBQ, WinoBias, WinoPron, StereoSet.

Адаптація ще in progress, але ми виклали те що маємо наразі тут https://huggingface.co/FairForget . Там же можна побачити WarBias (назва може змінитись 👀) - це датасет про упередження, пов’язані із соціальними наслідками війни в Україні. Першими категоріями стали внутрішньо переміщені особи та ветерани, але ми все ще працюємо над його доповненням і відповідно реструктуризацією в стилі StereoSet (де є triplets речень) і відповідно він ніде не використовується. Його генерували з MamayLM-Gemma-3-27B, а таксономію ми робили на базі статтей від ветеранських та соціальних організацій та соц. досліджень. І тут насправді ще багато роботи на вичитування
🔥4