автономна система прийняття рішень
64 subscribers
13 photos
9 links
machine unlearning, аспірантура в УКУ, проєкт FairForget, розбори статей і невдалі експерименти (а інколи і вдалі)
Download Telegram
Ділюсь першою статтею з Unleaning для narrative suppression, котру прийняли на WIPE-OUT 2026: Machine Unlearning Workshop, ECML-PKDD

Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS

У цьому дослідженні ми перевіряємо, чи можуть наявні методи unlearning придушувати небажані наративи (у нашому випадку дезінформацію).
І, якщо так, чи є момент, у який можна зупинити тренування до колапсу відповідей. Технічно ми бачимо, що це можливо.

Загалом було дуже цікаво перевірити, чи має модель чим "підмінити" небажаний наратив після unlearning. Тобто що саме лежить під небажаним фреймом? Інколи ним виявлявся антинаратив.

Дослідження пілотне: нашою метою було розуміти, як краще розвивати ідею narrative unlearning і чи поточні методи вже достатньо добре працюють. Один із викликів тут (це видно з дисклеймера до статті) - це подати матеріал нейтрально.

У планах - розширити unlearning-датасет на наративи та знайти спосіб автоматизувати пошук стану suppression до того, як настає collapse відповідей.
🔥3
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

Вписувати в промпті, що інтернет відсутній а не вимикати його рахується за окремий «incident»? 😁
😁2😱1
Forwarded from AI HOUSE
🔔 20 серпня поговоримо про те, чому великі мовні моделі поводяться не так, як ми очікуємо, та чи можливо навчити їх «забувати» інформацію без втрат її можливостей.

Нагадуємо про <Align, Forget, Repeat Meetup> — технічну подію у Львові для тих, хто працює з LLM, досліджує AI Alignment, Machine Unlearning та сучасні виклики AI Safety.

🔈 Спікерки:
— Марія Королюк, Research Fellow у LASR Labs.
— Вікторія Маковська, Research Engineer у Lapa LLM, PhD-дослідниця УКУ.

▪️ Дата: 20 серпня, 18:00
▪️ Формат: офлайн у Львові
▪️ Вартість: донат від 500 грн на БО <Реактивна Пошта>
▪️ Кількість місць обмежена

А в каруселі зібрали 4 причини відвідати мітап <Align, Forget, Repeat> ☝️

Реєструйтеся за посиланням 🌱

🏠 LinkedIn 🏠 Instagram 🏠 Podcast
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Готую матеріали на доповідь і знайшла цікавий пейпер: Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models [EMNLP 2025]

Вони зазначають
Our findings reveal that the set of parameters that must be modified for effective unlearning is not strictly determined

We regard this as compelling evidence against the assumption that a fixed set of parameters must be updated to achieve effective unlearning. The results suggest that unlearning may not rely on a specific parameter region, but can instead be achieved through multiple alternative regions in the model.


Автори перевіряють це в сетапі, де ground-truth регіон, у якому було вивчено forget знання, наперед відомий (сабсет із 10% MLP value vectors, через які вони навчили ці знання). Але роблять unlearning через інший випадково вибраний сабсет MLP value vectors. Все окрім обраного сабсету заморожували і виконували unlearning алгоритм на ньому і це давало ефект unlearning.

Тобто... gradient-ascent (based) unlearning (і не тільки, але цей як інтуїтивний приклад) все одно зміг знайти зміни в (випадково обраному) сабсеті MLP параметрів і досягти unlearning ефекту 🤯🚐

тобто вони показують що вірогідно, що unlearning ефекту можна досягти через альтернативні регіони моделі і НЕ обовʼязково (посилатись на interpretability) знати регіон, де 'записали' знання.

мені перегукується з концептом про superposition (або ж можна зустріти повʼязаний з цим феномен Polysemanticity)
👍5
Нарешті пройшли один з перших майлстоунів проєкту FairForget, над яким ми працюємо з Oleksandra Ostafiichuk та Tetiana Zakharchenko
Цей проєкт пройшов відбір і стартував за підтримки програми Women Led Science, якщо коротро то ми досліджуємо, чи можна застосовувати machine unlearning для зменшення упереджень у мовних моделях. Ми також перевіряємо можливий bias redistribution: ситуацію, коли модель стає менш упередженою за одним виміром, але демонструє сильніше зміщення за іншим. Ми керуємось тим, що bias correlation був раніше визначений в деяких роботах і відповідно припускаємо що unlearning одного упередження може потягти зміни в інших.

FairForget почався зі створення відтворюваного сетапу схильності до упереджень моделей до і після unlearning. І тому ми переклали та почали адаптовувати найбільш популярні датасети BBQ, WinoBias, WinoPron, StereoSet.

Адаптація ще in progress, але ми виклали те що маємо наразі тут https://huggingface.co/FairForget . Там же можна побачити WarBias (назва може змінитись 👀) - це датасет про упередження, пов’язані із соціальними наслідками війни в Україні. Першими категоріями стали внутрішньо переміщені особи та ветерани, але ми все ще працюємо над його доповненням і відповідно реструктуризацією в стилі StereoSet (де є triplets речень) і відповідно він ніде не використовується. Його генерували з MamayLM-Gemma-3-27B, а таксономію ми робили на базі статтей від ветеранських та соціальних організацій та соц. досліджень. І тут насправді ще багато роботи на вичитування
🔥4
І також хочу поділитись, що в Ukrainian LLM Leaderboard з’явився окремий розділ Fairness.

StereoSet-UK Eval: схильність моделі обирати стереотипні продовження;

WinoBias-UK Natural: гендерні асиметрії у зв’язках між займенниками та професіями;

BBQ-UK: відповіді на неоднозначні й однозначні питання для різних категорій упереджень;

WinoPron-UK (скоро буде).

З цікавого 👀 у Lapa схильність на гендерні упередження, у Mamay схильність до релігійного упередження. Але деталі думаю ми ще опишемо згодом🤞

*протягом місяця ще плануємо вичитати та відповідно поправити переклади і допрацювати WarBias (робоча назва ✍️)
🔥71
https://vercel.com/ai-gateway/leaderboards/models

https://x.com/rauchg/status/2091234105702887879

за два місяці частка open-weight моделей у token volume на Vercel AI виросла з 28.4% до рекордних 62% за день. Ще у квітні це було близько 11%

open weight моделі починають переважати над proprietary моделями і більшість популярних відкритих моделей є китайськими 👀
👀6
Перший день ECMLPKDD 2026, презентуємо LENS зроблений в колаборації з Eindhoven University of Technology та одним з адвайзерів George Fletcher
🔥8
Проєкт FairForget отримав довгоочікувані GPU ресурси від EuroHPC 🎉

Ми подавались на EuroHPC Development Access Call 5 серпня, review зайняв всього 3 тижні, а все інше всього лише розібратись з системою реєстрації 😂

Тож щоб попасти на JUPITER треба додатково пройти реєстрацію та верифікацію лише ЩЕ на кількох платформах: MyAccessID/eduTeams, EuroHPC Federation Platform і JSC/JuDoor.

У порівнянні з тим, як ми отримували доступ до MareNostrum5, там там це була просто прогулянка де майже в день апруву тобі приходить інформацію про юзера і пароль😁

Anyway, 3500 node-hours на JUPITER Booster на 6 місяців, тобто до 14 000 GPU-hours у перерахунку, звучить неймовірно. 🤌

For reference: https://access.eurohpc-ju.europa.eu/
8
European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases 2026 - в топі поданих і прийнятих пейперів Китай 🫡
🕊4
Machine Unlearning в топі на journal track 😁 той самий момент коли думав, що твоя тема на дисертацію буде непопулярна і там менше компетішину 🌚
🔥83