Ділюсь першою статтею з Unleaning для narrative suppression, котру прийняли на WIPE-OUT 2026: Machine Unlearning Workshop, ECML-PKDD
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
У цьому дослідженні ми перевіряємо, чи можуть наявні методи unlearning придушувати небажані наративи (у нашому випадку дезінформацію).
І, якщо так, чи є момент, у який можна зупинити тренування до колапсу відповідей. Технічно ми бачимо, що це можливо.
Загалом було дуже цікаво перевірити, чи має модель чим "підмінити" небажаний наратив після unlearning. Тобто що саме лежить під небажаним фреймом? Інколи ним виявлявся антинаратив.
Дослідження пілотне: нашою метою було розуміти, як краще розвивати ідею narrative unlearning і чи поточні методи вже достатньо добре працюють. Один із викликів тут (це видно з дисклеймера до статті) - це подати матеріал нейтрально.
У планах - розширити unlearning-датасет на наративи та знайти спосіб автоматизувати пошук стану suppression до того, як настає collapse відповідей.
Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS
У цьому дослідженні ми перевіряємо, чи можуть наявні методи unlearning придушувати небажані наративи (у нашому випадку дезінформацію).
І, якщо так, чи є момент, у який можна зупинити тренування до колапсу відповідей. Технічно ми бачимо, що це можливо.
Загалом було дуже цікаво перевірити, чи має модель чим "підмінити" небажаний наратив після unlearning. Тобто що саме лежить під небажаним фреймом? Інколи ним виявлявся антинаратив.
Дослідження пілотне: нашою метою було розуміти, як краще розвивати ідею narrative unlearning і чи поточні методи вже достатньо добре працюють. Один із викликів тут (це видно з дисклеймера до статті) - це подати матеріал нейтрально.
У планах - розширити unlearning-датасет на наративи та знайти спосіб автоматизувати пошук стану suppression до того, як настає collapse відповідей.
Artificial Intelligence and Information Mining - Collective
WIPE-OUT 2026: Machine Unlearning Workshop at ECML-PKDD – 2nd Workshop on Machine Unlearning and Privacy Preservation
WIPE-OUT 2026 is a leading machine unlearning workshop and venue for researchers working on selective data removal, privacy preservation, and the right to be forgotten in AI. Co-located with ECML-P...
🔥3
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Вписувати в промпті, що інтернет відсутнійа не вимикати його рахується за окремий «incident»? 😁
Вписувати в промпті, що інтернет відсутній
😁2😱1
Forwarded from AI HOUSE
🔔 20 серпня поговоримо про те, чому великі мовні моделі поводяться не так, як ми очікуємо, та чи можливо навчити їх «забувати» інформацію без втрат її можливостей.
Нагадуємо про <Align, Forget, Repeat Meetup> — технічну подію у Львові для тих, хто працює з LLM, досліджує AI Alignment, Machine Unlearning та сучасні виклики AI Safety.
🔈 Спікерки:
— Марія Королюк, Research Fellow у LASR Labs.
— Вікторія Маковська, Research Engineer у Lapa LLM, PhD-дослідниця УКУ.
▪️ Дата: 20 серпня, 18:00
▪️ Формат: офлайн у Львові
▪️ Вартість: донат від 500 грн на БО <Реактивна Пошта>
▪️ Кількість місць обмежена
А в каруселі зібрали 4 причини відвідати мітап <Align, Forget, Repeat> ☝️
Реєструйтеся за посиланням 🌱
🏠 LinkedIn 🏠 Instagram 🏠 Podcast
Нагадуємо про <Align, Forget, Repeat Meetup> — технічну подію у Львові для тих, хто працює з LLM, досліджує AI Alignment, Machine Unlearning та сучасні виклики AI Safety.
🔈 Спікерки:
— Марія Королюк, Research Fellow у LASR Labs.
— Вікторія Маковська, Research Engineer у Lapa LLM, PhD-дослідниця УКУ.
▪️ Дата: 20 серпня, 18:00
▪️ Формат: офлайн у Львові
▪️ Вартість: донат від 500 грн на БО <Реактивна Пошта>
▪️ Кількість місць обмежена
А в каруселі зібрали 4 причини відвідати мітап <Align, Forget, Repeat> ☝️
Реєструйтеся за посиланням 🌱
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Готую матеріали на доповідь і знайшла цікавий пейпер: Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models [EMNLP 2025]
Вони зазначають
Автори перевіряють це в сетапі, де ground-truth регіон, у якому було вивчено forget знання, наперед відомий (сабсет із 10% MLP value vectors, через які вони навчили ці знання). Але роблять unlearning через інший випадково вибраний сабсет MLP value vectors. Все окрім обраного сабсету заморожували і виконували unlearning алгоритм на ньому і це давало ефект unlearning.
Тобто... gradient-ascent (based) unlearning (і не тільки, але цей як інтуїтивний приклад) все одно зміг знайти зміни в (випадково обраному) сабсеті MLP параметрів і досягти unlearning ефекту 🤯🚐
тобто вони показують що вірогідно, що unlearning ефекту можна досягти через альтернативні регіони моделі і НЕ обовʼязково(посилатись на interpretability) знати регіон, де 'записали' знання.
мені перегукується з концептом про superposition (або ж можна зустріти повʼязаний з цим феномен Polysemanticity)
Вони зазначають
Our findings reveal that the set of parameters that must be modified for effective unlearning is not strictly determined
We regard this as compelling evidence against the assumption that a fixed set of parameters must be updated to achieve effective unlearning. The results suggest that unlearning may not rely on a specific parameter region, but can instead be achieved through multiple alternative regions in the model.
Автори перевіряють це в сетапі, де ground-truth регіон, у якому було вивчено forget знання, наперед відомий (сабсет із 10% MLP value vectors, через які вони навчили ці знання). Але роблять unlearning через інший випадково вибраний сабсет MLP value vectors. Все окрім обраного сабсету заморожували і виконували unlearning алгоритм на ньому і це давало ефект unlearning.
Тобто... gradient-ascent (based) unlearning (і не тільки, але цей як інтуїтивний приклад) все одно зміг знайти зміни в (випадково обраному) сабсеті MLP параметрів і досягти unlearning ефекту 🤯🚐
тобто вони показують що вірогідно, що unlearning ефекту можна досягти через альтернативні регіони моделі і НЕ обовʼязково
мені перегукується з концептом про superposition (або ж можна зустріти повʼязаний з цим феномен Polysemanticity)
ACL Anthology
Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language…
Hwiyeong Lee, Uiji Hwang, Hyelim Lim, Taeuk Kim. Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing. 2025.
👍5
Нарешті пройшли один з перших майлстоунів проєкту FairForget, над яким ми працюємо з Oleksandra Ostafiichuk та Tetiana Zakharchenko
Цей проєкт пройшов відбір і стартував за підтримки програми Women Led Science, якщо коротро то ми досліджуємо, чи можна застосовувати machine unlearning для зменшення упереджень у мовних моделях. Ми також перевіряємо можливий bias redistribution: ситуацію, коли модель стає менш упередженою за одним виміром, але демонструє сильніше зміщення за іншим. Ми керуємось тим, що bias correlation був раніше визначений в деяких роботах і відповідно припускаємо що unlearning одного упередження може потягти зміни в інших.
FairForget почався зі створення відтворюваного сетапу схильності до упереджень моделей до і після unlearning. І тому ми переклали та почали адаптовувати найбільш популярні датасети BBQ, WinoBias, WinoPron, StereoSet.
Адаптація ще in progress, але ми виклали те що маємо наразі тут https://huggingface.co/FairForget . Там же можна побачити WarBias (назва може змінитись 👀) - це датасет про упередження, пов’язані із соціальними наслідками війни в Україні. Першими категоріями стали внутрішньо переміщені особи та ветерани, але ми все ще працюємо над його доповненням і відповідно реструктуризацією в стилі StereoSet (де є triplets речень) і відповідно він ніде не використовується. Його генерували з MamayLM-Gemma-3-27B, а таксономію ми робили на базі статтей від ветеранських та соціальних організацій та соц. досліджень.І тут насправді ще багато роботи на вичитування
Цей проєкт пройшов відбір і стартував за підтримки програми Women Led Science, якщо коротро то ми досліджуємо, чи можна застосовувати machine unlearning для зменшення упереджень у мовних моделях. Ми також перевіряємо можливий bias redistribution: ситуацію, коли модель стає менш упередженою за одним виміром, але демонструє сильніше зміщення за іншим. Ми керуємось тим, що bias correlation був раніше визначений в деяких роботах і відповідно припускаємо що unlearning одного упередження може потягти зміни в інших.
FairForget почався зі створення відтворюваного сетапу схильності до упереджень моделей до і після unlearning. І тому ми переклали та почали адаптовувати найбільш популярні датасети BBQ, WinoBias, WinoPron, StereoSet.
Адаптація ще in progress, але ми виклали те що маємо наразі тут https://huggingface.co/FairForget . Там же можна побачити WarBias (назва може змінитись 👀) - це датасет про упередження, пов’язані із соціальними наслідками війни в Україні. Першими категоріями стали внутрішньо переміщені особи та ветерани, але ми все ще працюємо над його доповненням і відповідно реструктуризацією в стилі StereoSet (де є triplets речень) і відповідно він ніде не використовується. Його генерували з MamayLM-Gemma-3-27B, а таксономію ми робили на базі статтей від ветеранських та соціальних організацій та соц. досліджень.
Linkedin
Oleksandra Ostafiichuk - Simulmedia | LinkedIn
Experience: Simulmedia · Education: Ukrainian Catholic University · Location: Lviv · 500+ connections on LinkedIn. View Oleksandra Ostafiichuk’s profile on LinkedIn, a professional community of 1 billion members.
🔥4
І також хочу поділитись, що в Ukrainian LLM Leaderboard з’явився окремий розділ Fairness.
StereoSet-UK Eval: схильність моделі обирати стереотипні продовження;
WinoBias-UK Natural: гендерні асиметрії у зв’язках між займенниками та професіями;
BBQ-UK: відповіді на неоднозначні й однозначні питання для різних категорій упереджень;
WinoPron-UK (скоро буде).
З цікавого 👀 у Lapa схильність на гендерні упередження, у Mamay схильність до релігійного упередження. Але деталі думаю ми ще опишемо згодом🤞
*протягом місяця ще плануємо вичитати та відповідно поправити переклади і допрацювати WarBias (робоча назва ✍️)
StereoSet-UK Eval: схильність моделі обирати стереотипні продовження;
WinoBias-UK Natural: гендерні асиметрії у зв’язках між займенниками та професіями;
BBQ-UK: відповіді на неоднозначні й однозначні питання для різних категорій упереджень;
WinoPron-UK (скоро буде).
З цікавого 👀 у Lapa схильність на гендерні упередження, у Mamay схильність до релігійного упередження. Але деталі думаю ми ще опишемо згодом🤞
*протягом місяця ще плануємо вичитати та відповідно поправити переклади і допрацювати WarBias (робоча назва ✍️)
huggingface.co
Ukrainian LLM Leaderboard - a Hugging Face Space by lang-uk
Measuring LLM capabilities to process Ukrainian texts
🔥7❤1
https://vercel.com/ai-gateway/leaderboards/models
https://x.com/rauchg/status/2091234105702887879
за два місяці частка open-weight моделей у token volume на Vercel AI виросла з 28.4% до рекордних 62% за день. Ще у квітні це було близько 11%
open weight моделі починають переважати над proprietary моделями і більшість популярних відкритих моделей є китайськими 👀
https://x.com/rauchg/status/2091234105702887879
за два місяці частка open-weight моделей у token volume на Vercel AI виросла з 28.4% до рекордних 62% за день. Ще у квітні це було близько 11%
open weight моделі починають переважати над proprietary моделями і більшість популярних відкритих моделей є китайськими 👀
👀6
Перший день ECMLPKDD 2026, презентуємо LENS зроблений в колаборації з Eindhoven University of Technology та одним з адвайзерів George Fletcher
🔥8
Проєкт FairForget отримав довгоочікувані GPU ресурси від EuroHPC 🎉
Ми подавались на EuroHPC Development Access Call 5 серпня, review зайняв всього 3 тижні, а все інше всього лише розібратись з системою реєстрації 😂
Тож щоб попасти на JUPITER треба додатково пройти реєстрацію та верифікацію лише ЩЕ на кількох платформах: MyAccessID/eduTeams, EuroHPC Federation Platform і JSC/JuDoor.
У порівнянні з тим, як ми отримували доступ до MareNostrum5, там там це була просто прогулянка де майже в день апруву тобі приходить інформацію про юзера і пароль😁
Anyway, 3500 node-hours на JUPITER Booster на 6 місяців, тобто до 14 000 GPU-hours у перерахунку, звучить неймовірно. 🤌
For reference: https://access.eurohpc-ju.europa.eu/
Ми подавались на EuroHPC Development Access Call 5 серпня, review зайняв всього 3 тижні, а все інше всього лише розібратись з системою реєстрації 😂
Тож щоб попасти на JUPITER треба додатково пройти реєстрацію та верифікацію лише ЩЕ на кількох платформах: MyAccessID/eduTeams, EuroHPC Federation Platform і JSC/JuDoor.
У порівнянні з тим, як ми отримували доступ до MareNostrum5, там там це була просто прогулянка де майже в день апруву тобі приходить інформацію про юзера і пароль😁
Anyway, 3500 node-hours на JUPITER Booster на 6 місяців, тобто до 14 000 GPU-hours у перерахунку, звучить неймовірно. 🤌
For reference: https://access.eurohpc-ju.europa.eu/
❤8
