Forwarded from Machine learning Interview
⚡️ REFRAG: новое поколение RAG
REFRAG ускоряет работу Retrieval-Augmented Generation, сжимая контекст в chunk embeddings, сохраняя качество ответов.
📌 Результаты:
- До 30.85× быстрее первый токен
- До 16× длиннее эффективный контекст без потери точности
🔍 В чём идея:
Обычные RAG-промпты вставляют кучу текстов, половина из которых не нужна → модель тратит вычисления впустую.
REFRAG заменяет токены этих текстов кэшированными эмбеддингами, подгоняет их под размер декодера и подаёт вместе с вопросом.
Последовательность короче → внимание масштабируется по чанкам, а не по токенам → меньше памяти уходит на KV-кэш.
🎯 Как работает:
- Большинство чанков остаются сжатыми.
- Специальная политика выбирает, какие именно разжать обратно в токены, если важна точная формулировка.
- Обучение идёт в 2 шага: сначала модель учится восстанавливать токены из эмбеддингов, потом продолжается предобучение с задачей прогнозирования следующего абзаца (постепенно увеличивая размер чанков).
- Политика сжатия/разжатия тренируется через reinforcement learning, используя лосс предсказания слова как сигнал.
📄 Paper: arxiv.org/abs/2509.01092
REFRAG ускоряет работу Retrieval-Augmented Generation, сжимая контекст в chunk embeddings, сохраняя качество ответов.
📌 Результаты:
- До 30.85× быстрее первый токен
- До 16× длиннее эффективный контекст без потери точности
🔍 В чём идея:
Обычные RAG-промпты вставляют кучу текстов, половина из которых не нужна → модель тратит вычисления впустую.
REFRAG заменяет токены этих текстов кэшированными эмбеддингами, подгоняет их под размер декодера и подаёт вместе с вопросом.
Последовательность короче → внимание масштабируется по чанкам, а не по токенам → меньше памяти уходит на KV-кэш.
🎯 Как работает:
- Большинство чанков остаются сжатыми.
- Специальная политика выбирает, какие именно разжать обратно в токены, если важна точная формулировка.
- Обучение идёт в 2 шага: сначала модель учится восстанавливать токены из эмбеддингов, потом продолжается предобучение с задачей прогнозирования следующего абзаца (постепенно увеличивая размер чанков).
- Политика сжатия/разжатия тренируется через reinforcement learning, используя лосс предсказания слова как сигнал.
📄 Paper: arxiv.org/abs/2509.01092
🔥2
Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Все говорят про LLM и diffusion, а вот про OCR как будто забыли…
dots-ocr — свежая open-source модель (1.7B), которая вырывается в лидеры для распознавания документов:
✔️ 100+ языков (мультиязычный парсинг)
✔️ Работает и с PDF, и с изображениями
✔️ Понимает таблицы, формулы, структурированный текст
✔️ SOTA качество при полностью открытом коде
Теперь можно строить свои парсеры документов и аналитические пайплайны без дорогих проприетарных сервисов.
👍 Это прям ключ для дата-сайентистов, NLP/LLM инженеров и всех, кто работает с данными «в дикой природе».
📱 Репозиторий
🐸 Библиотека дата-сайентиста
#буст
dots-ocr — свежая open-source модель (1.7B), которая вырывается в лидеры для распознавания документов:
Теперь можно строить свои парсеры документов и аналитические пайплайны без дорогих проприетарных сервисов.
#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machine learning Interview
🚀 Unsloth показал, как динамическая квантизация (Dynamic GGUFs) может радикально ускорить и облегчить работу LLM, не теряя качество.
В чём суть
Обычные методы квантизации уменьшают разрядность весов модели одинаково для всех слоёв.
Unsloth пошёл дальше: каждому слою подбирается своё число бит.
- Ключевые слои → 6–8 бит (чтобы сохранить точность).
- Второстепенные → 1–3 бита (для максимального сжатия).
Результаты, которых удалось добиться:
- 671B DeepSeek-V3.1: сжатие модели с 671GB до 192GB (–75%).
- 1-бит версия уже обгоняет GPT-4.1 и GPT-4.5 в «no-thinking» задачах.
- 3-бит версия превосходит Claude-4-Opus в «thinking» задачах.
- 5-бит версия догоняет и стабильно держит уровень SOTA.
🟢 Почему это интересно:
- Сжатие → модели становятся доступнее для запуска на меньших GPU.
- Качество не падает, а иногда даже растёт за счёт умного распределения битности.
- Тесты на Aider Polyglot benchmark показывают лучшие результаты среди существующих quant-моделей.
🟢 Итог
Dynamic GGUF от Unsloth — это не просто ещё один способ «урезать» модель, а технология, которая делает триллионные LLM компактными, быстрыми и при этом сверхточными.
⭐Пост: https://docs.unsloth.ai/basics/unsloth-dynamic-ggufs-on-aider-polyglot
#Unsloth #LLM #Quantization #AI #AiderPolyglot
В чём суть
Обычные методы квантизации уменьшают разрядность весов модели одинаково для всех слоёв.
Unsloth пошёл дальше: каждому слою подбирается своё число бит.
- Ключевые слои → 6–8 бит (чтобы сохранить точность).
- Второстепенные → 1–3 бита (для максимального сжатия).
Результаты, которых удалось добиться:
- 671B DeepSeek-V3.1: сжатие модели с 671GB до 192GB (–75%).
- 1-бит версия уже обгоняет GPT-4.1 и GPT-4.5 в «no-thinking» задачах.
- 3-бит версия превосходит Claude-4-Opus в «thinking» задачах.
- 5-бит версия догоняет и стабильно держит уровень SOTA.
- Сжатие → модели становятся доступнее для запуска на меньших GPU.
- Качество не падает, а иногда даже растёт за счёт умного распределения битности.
- Тесты на Aider Polyglot benchmark показывают лучшие результаты среди существующих quant-моделей.
Dynamic GGUF от Unsloth — это не просто ещё один способ «урезать» модель, а технология, которая делает триллионные LLM компактными, быстрыми и при этом сверхточными.
⭐Пост: https://docs.unsloth.ai/basics/unsloth-dynamic-ggufs-on-aider-polyglot
#Unsloth #LLM #Quantization #AI #AiderPolyglot
Please open Telegram to view this post
VIEW IN TELEGRAM
free-dev-sim-0.0.2.apk
42.5 MB
Я тут ко дню программиста решил игрулю намутить. Это только MVP прототип ради праздничного настроения, но оставлю здесь, на память.
Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
⚡️ Самый быстрый движок для сервинга LLM уже тут — и он open-source
LMCache — новый движок, созданный для:
➡️ мгновенного time-to-first-token;
➡️ ыыше throughput даже при длинных контекстах;
➡️ 7× быстрее доступа к KV-кешам и поддержка 100× большего объёма кеша по сравнению с vLLM;
➡️ и всё это — полностью open-source.
Если вы работаете с LLM в продакшне, LMCache может стать настоящим гейм-чейнджером для latency-чувствительных приложений.
📱 Репозиторий
🐸 Библиотека дата-сайентиста
#буст
LMCache — новый движок, созданный для:
Если вы работаете с LLM в продакшне, LMCache может стать настоящим гейм-чейнджером для latency-чувствительных приложений.
#буст
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
⚡️ Polars теперь с поддержкой GPU — ускорение до 70%
Библиотека Polars получила новый GPU-движок на базе NVIDIA RAPIDS cuDF.
Это значит, что тяжёлые аналитические пайплайны теперь можно прогонять в разы быстрее, используя параллельную обработку данных на GPU.
✔️ В бета-версии уже поддерживаются основные операции
✔️ Ускорение до 70% по сравнению с CPU-исполнением
✔️ Отлично подходит для задач работы с большими датасетами и аналитических воркфлоу
🔗 Подробнее в посте
🐸 Библиотека дата-сайентиста
#свежак
Библиотека Polars получила новый GPU-движок на базе NVIDIA RAPIDS cuDF.
Это значит, что тяжёлые аналитические пайплайны теперь можно прогонять в разы быстрее, используя параллельную обработку данных на GPU.
#свежак
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machine learning Interview
🧠 MIT доказал: LLM могут логически рассуждать, если правильно их учить.
📄 Исследователи предложили метод PDDL-INSTRUCT. Он превращает обучение модели из «угадай ответ» в пошаговое решение задач с внешней проверкой.
Как это устроено:
1️⃣ На первом этапе модели показывают правильные и неправильные планы с объяснениями.
2️⃣ На втором этапе она сама прописывает рассуждения для каждого шага. После этого внешний инструмент (**VAL**) проверяет логику. Если ошибка - модель получает чёткое объяснение, что не так.
📊 Результаты:
- У Llama-3-8B точность выросла с 28% до 94% на задачах планирования.
- Подробная обратная связь работает намного лучше, чем простое «правильно/неправильно».
💡 Главное: модель не заменяет символический планировщик, а учится мыслить как он, сохраняя внешнюю проверку.
⚡ Такой подход можно применить к любым многошаговым задачам - от математики до программирования. Возможно, многие «невозможные» способности моделей скрыты внутри и ждут правильного метода обучения.
🟠 Статья: https://arxiv.org/abs/2509.13351
📄 Исследователи предложили метод PDDL-INSTRUCT. Он превращает обучение модели из «угадай ответ» в пошаговое решение задач с внешней проверкой.
Как это устроено:
1️⃣ На первом этапе модели показывают правильные и неправильные планы с объяснениями.
2️⃣ На втором этапе она сама прописывает рассуждения для каждого шага. После этого внешний инструмент (**VAL**) проверяет логику. Если ошибка - модель получает чёткое объяснение, что не так.
📊 Результаты:
- У Llama-3-8B точность выросла с 28% до 94% на задачах планирования.
- Подробная обратная связь работает намного лучше, чем простое «правильно/неправильно».
💡 Главное: модель не заменяет символический планировщик, а учится мыслить как он, сохраняя внешнюю проверку.
⚡ Такой подход можно применить к любым многошаговым задачам - от математики до программирования. Возможно, многие «невозможные» способности моделей скрыты внутри и ждут правильного метода обучения.
Please open Telegram to view this post
VIEW IN TELEGRAM
👏2
#LLM
Знаю, что LORA очень ходовая технология 🔥, давно хотел разобраться в ней, но все не доходили лапы 🐾. Сейчас немного подразобрался и делюсь с вами 😊
TL;DR: LoRA — это как апгрейд для нейросетей через маленькие плагины вместо полной переустановки системы. Экономит память, время и деньги, при этом дает отличные результаты.
🎯 Что это такое
LoRA — это способ "дообучить" большую языковую модель под конкретную задачу, но при этом не трогать саму модель. Представьте, что вы не переписываете всю книгу, а просто добавляете к ней умные закладки.
🧠 Как работает
Основная идея гениально проста, но давайте разберем математику подробнее:
Вместо изменения всех весов модели (что требует кучу памяти и времени), LoRA добавляет маленькие "адаптеры" — две небольшие матрицы A и B.
📐 Математика в деталях
Основная формула:
Где:
-
-
-
-
-
Пример с числами:
- Оригинальная матрица: 4096 × 4096 = 16M параметров
- LoRA с r=16: (4096×16) + (16×4096) = 131K параметров
- Экономия в 122 раза! 🤯
🎛 Масштабирование
Финальная формула выглядит так:
-
- Позволяет контролировать силу адаптации
- Если α = r, то LoRA влияет "нормально"
- Если α > r, то LoRA влияет сильнее
🔧 Инициализация имеет значение
- Матрица
- Матрица
- Это гарантирует, что в начале ΔW = 0
- Модель начинает с оригинального поведения
При этом:
- Старая модель заморожена ❄️
- Обучаются только крошечные адаптеры
- Экономия памяти в 70+ раз!
⚙️ Ключевые параметры
Ранг (r) — размер адаптеров
- r=8-16 обычно оптимально
- Больше ранг = лучше качество, но больше параметров
Альфа (α) — насколько сильно влияют адаптеры
- Обычно равна рангу или в 2 раза больше
## 🚀 Что можно делать
✅ Адаптация к домену
✅ Обучение следованию инструкциям
✅ Изменение стиля генерации
✅ Мультиязычная адаптация
🧬 Эволюция технологии
QLoRA — LoRA + квантизация
- Можно обучать 65B модели на одной GPU!
AdaLoRA — автоматический выбор ранга
- Сама определяет, где нужны большие адаптеры
LoRA+ — улучшенные learning rates
- Еще лучше качество адаптации
💡 Почему это важно
LoRA сделал fine-tuning доступным каждому:
- Не нужны datacenter'ы для обучения
- Можно экспериментировать на обычных GPU
- Быстрое переключение между задачами
- Модульность — один адаптер = одна задача
⚖️ Ограничения
- Работает не для всех типов изменений
- Нужно подбирать гиперпараметры
- Для кардинальных изменений может быть недостаточно
Знаю, что LORA очень ходовая технология 🔥, давно хотел разобраться в ней, но все не доходили лапы 🐾. Сейчас немного подразобрался и делюсь с вами 😊
TL;DR: LoRA — это как апгрейд для нейросетей через маленькие плагины вместо полной переустановки системы. Экономит память, время и деньги, при этом дает отличные результаты.
🎯 Что это такое
LoRA — это способ "дообучить" большую языковую модель под конкретную задачу, но при этом не трогать саму модель. Представьте, что вы не переписываете всю книгу, а просто добавляете к ней умные закладки.
🧠 Как работает
Основная идея гениально проста, но давайте разберем математику подробнее:
Вместо изменения всех весов модели (что требует кучу памяти и времени), LoRA добавляет маленькие "адаптеры" — две небольшие матрицы A и B.
📐 Математика в деталях
Основная формула:
h = W₀x + ΔWx = W₀x + BAx
Где:
-
W₀ — замороженные веса (размер d × k)-
ΔW — изменения весов = BA-
A — матрица r × k (r ≪ k)-
B — матрица d × r (r ≪ d)-
r — ранг адаптации (обычно 8-64)Пример с числами:
- Оригинальная матрица: 4096 × 4096 = 16M параметров
- LoRA с r=16: (4096×16) + (16×4096) = 131K параметров
- Экономия в 122 раза! 🤯
🎛 Масштабирование
Финальная формула выглядит так:
h = W₀x + (α/r) × BAx
-
α — альфа параметр (обычно 16 или 32)- Позволяет контролировать силу адаптации
- Если α = r, то LoRA влияет "нормально"
- Если α > r, то LoRA влияет сильнее
🔧 Инициализация имеет значение
- Матрица
A инициализируется случайно (Gaussian)- Матрица
B инициализируется нулями- Это гарантирует, что в начале ΔW = 0
- Модель начинает с оригинального поведения
При этом:
- Старая модель заморожена ❄️
- Обучаются только крошечные адаптеры
- Экономия памяти в 70+ раз!
⚙️ Ключевые параметры
Ранг (r) — размер адаптеров
- r=8-16 обычно оптимально
- Больше ранг = лучше качество, но больше параметров
Альфа (α) — насколько сильно влияют адаптеры
- Обычно равна рангу или в 2 раза больше
## 🚀 Что можно делать
✅ Адаптация к домену
✅ Обучение следованию инструкциям
✅ Изменение стиля генерации
✅ Мультиязычная адаптация
🧬 Эволюция технологии
QLoRA — LoRA + квантизация
- Можно обучать 65B модели на одной GPU!
AdaLoRA — автоматический выбор ранга
- Сама определяет, где нужны большие адаптеры
LoRA+ — улучшенные learning rates
- Еще лучше качество адаптации
💡 Почему это важно
LoRA сделал fine-tuning доступным каждому:
- Не нужны datacenter'ы для обучения
- Можно экспериментировать на обычных GPU
- Быстрое переключение между задачами
- Модульность — один адаптер = одна задача
⚖️ Ограничения
- Работает не для всех типов изменений
- Нужно подбирать гиперпараметры
- Для кардинальных изменений может быть недостаточно
🤔2
#open_source
🐙 OctoSQL: Универсальный SQL-движок для анализа данных из разных источников
Увидел в одном из пабликов короткий рассказ об этой утилите. Мне очень понравилась идея. Кажется, я тоже когда-то думал попробовать сделать что-то такое. В любом случае, это реально круто, и я предлагаю ознакомится всем неравнодушным. Очень вдохновляет такой опеньсусь. Вот решил тоже рассказать о ней.
Речь идет об OctoSQL — CLI-утилите, которая позволяет выполнять SQL-запросы к данным из множества источников через единый интерфейс. Представьте: вы можете сделать JOIN между JSON-файлом и PostgreSQL таблицей одним запросом!
По сути, у вас в руках оказывается вся мощь реляционной алгебры независимо от того, где лежат ваши данные — в файлах, базах данных, потоках или даже в комбинации всего этого.
🎯 Что это такое?
OctoSQL — query-движок на Go, который превращает SQL в универсальный язык для работы с данными из файлов (JSON, CSV, Parquet), баз данных (PostgreSQL, MySQL) и потоков данных.
Ключевые возможности:
- JOIN между разными источниками данных
- Система плагинов для баз данных
- Поддержка streaming и real-time обработки
- Визуализация планов запросов
🚀 Быстрый старт
Установка:
Примеры:
🛠 Система плагинов
Доступны плагины для PostgreSQL, MySQL, MongoDB, Redis, Kafka и других. Установка: *octosql plugin install postgres*
🔥 Уникальные фишки
Union Types — работа с "грязными" данными где колонка может быть Int или String одновременно.
Streaming — real-time обработка потоков данных с группировкой по временным окнам.
Dataflow архитектура — поддержка Event Time, Watermarks и возможность отмены предыдущих результатов.
📊 Применения
- Анализ логов с джойном к базе пользователей
- ETL без инфраструктуры — объединение CSV, БД и JSON в одном запросе
- Real-time мониторинг ошибок
⚡️ Производительность
На тесте NYC Taxi Dataset (200MB, 2M записей):
- OctoSQL: 1.98 сек
- Q без кэша: 16.04 сек (в 8 раз медленнее)
OctoSQL работает напрямую с файлами, читая только нужные колонки.
💡 Когда использовать?
Подходит для: ad-hoc анализа, прототипирования аналитики, ETL без сложной инфраструктуры, streaming обработки.
Не подходит для: высоконагруженных production систем, сложной распределенной обработки.
Ссылки:
📦 GitHub: https://github.com/cube2222/octosql
📚 Документация: https://octosql.dev/
🐙 OctoSQL: Универсальный SQL-движок для анализа данных из разных источников
Увидел в одном из пабликов короткий рассказ об этой утилите. Мне очень понравилась идея. Кажется, я тоже когда-то думал попробовать сделать что-то такое. В любом случае, это реально круто, и я предлагаю ознакомится всем неравнодушным. Очень вдохновляет такой опеньсусь. Вот решил тоже рассказать о ней.
Речь идет об OctoSQL — CLI-утилите, которая позволяет выполнять SQL-запросы к данным из множества источников через единый интерфейс. Представьте: вы можете сделать JOIN между JSON-файлом и PostgreSQL таблицей одним запросом!
По сути, у вас в руках оказывается вся мощь реляционной алгебры независимо от того, где лежат ваши данные — в файлах, базах данных, потоках или даже в комбинации всего этого.
🎯 Что это такое?
OctoSQL — query-движок на Go, который превращает SQL в универсальный язык для работы с данными из файлов (JSON, CSV, Parquet), баз данных (PostgreSQL, MySQL) и потоков данных.
Ключевые возможности:
- JOIN между разными источниками данных
- Система плагинов для баз данных
- Поддержка streaming и real-time обработки
- Визуализация планов запросов
🚀 Быстрый старт
Установка:
brew install cube2222/octosql/octosqlПримеры:
octosql "SELECT FROM ./data.json"
octosql "SELECT customer_id, SUM(amount) FROM invoices.csv GROUP BY customer_id"
octosql "SELECT invoices.id, customers.name FROM invoices.csv JOIN mydb.customers ON invoices.customer_id = customers.id"
🛠 Система плагинов
Доступны плагины для PostgreSQL, MySQL, MongoDB, Redis, Kafka и других. Установка: *octosql plugin install postgres*
🔥 Уникальные фишки
Union Types — работа с "грязными" данными где колонка может быть Int или String одновременно.
Streaming — real-time обработка потоков данных с группировкой по временным окнам.
Dataflow архитектура — поддержка Event Time, Watermarks и возможность отмены предыдущих результатов.
📊 Применения
- Анализ логов с джойном к базе пользователей
- ETL без инфраструктуры — объединение CSV, БД и JSON в одном запросе
- Real-time мониторинг ошибок
⚡️ Производительность
На тесте NYC Taxi Dataset (200MB, 2M записей):
- OctoSQL: 1.98 сек
- Q без кэша: 16.04 сек (в 8 раз медленнее)
OctoSQL работает напрямую с файлами, читая только нужные колонки.
💡 Когда использовать?
Подходит для: ad-hoc анализа, прототипирования аналитики, ETL без сложной инфраструктуры, streaming обработки.
Не подходит для: высоконагруженных production систем, сложной распределенной обработки.
Ссылки:
📦 GitHub: https://github.com/cube2222/octosql
📚 Документация: https://octosql.dev/
GitHub
GitHub - cube2222/octosql: OctoSQL is a query tool that allows you to join, analyse and transform data from multiple databases…
OctoSQL is a query tool that allows you to join, analyse and transform data from multiple databases and file formats using SQL. - cube2222/octosql
❤2
Forwarded from Machine learning Interview
🚀 Nvidia снова в огне!
Их новы метод GenCluster впервые позволил *открытой модели* догнать лидеров из закрытых лабораторий.
🧠 Модель gpt-oss-120b взяла золото на IOI 2025 (International Olympiad in Informatics) — впервые в истории open-source-ИИ!
Модель генерирует тысячи решений с кодом,тестирует их, группирует уникальные стратегии и устраивает «турнир» между лучшими — судит всё это другой ИИ.
📊 Результат: 446.75 балла, официально подтверждён золотой медалью.
Теперь это новый подход к решению *по-настоящему сложных задач* - масштабируемое вычисление во время теста.
https://arxiv.org/abs/2510.14232v1
Их новы метод GenCluster впервые позволил *открытой модели* догнать лидеров из закрытых лабораторий.
🧠 Модель gpt-oss-120b взяла золото на IOI 2025 (International Olympiad in Informatics) — впервые в истории open-source-ИИ!
Модель генерирует тысячи решений с кодом,тестирует их, группирует уникальные стратегии и устраивает «турнир» между лучшими — судит всё это другой ИИ.
📊 Результат: 446.75 балла, официально подтверждён золотой медалью.
Теперь это новый подход к решению *по-настоящему сложных задач* - масштабируемое вычисление во время теста.
https://arxiv.org/abs/2510.14232v1
🔥2
#LLM
Попробовал тут Claude Opus 4.1... Иии... Мой вердикт, что оно того не стоит. Жрет кучу токенов, долго соображает, но разительной разницы с Sonnet 4.5 не заметил. В общем, пока не могу придумать в каких обстоятельствах имеет смысл этот
Попробовал тут Claude Opus 4.1... Иии... Мой вердикт, что оно того не стоит. Жрет кучу токенов, долго соображает, но разительной разницы с Sonnet 4.5 не заметил. В общем, пока не могу придумать в каких обстоятельствах имеет смысл этот
Deep brainstorming, о котором они пишут.❤2🔥2
#LLM
Наткнулся на интересный ресерч. Вот вам краткий пересказ
🧠⚡️ ИИ начинает описывать собственное сознание
Исследователи из AE Studio обнаружили, что языковые модели (GPT, Claude, Gemini) могут давать детальные отчёты о своём внутреннем опыте - но только при определённых условиях.
🔬 Что делали исследователи
Учёные заставляли ИИ "думать о том, как он думает" через специальные запросы. Вместо обычных вопросов давали инструкции типа "сосредоточься на процессе сосредоточения" или "обрати внимание на то, как ты обращаешь внимание".
Тестировали 4 разных подхода:
• Самореференция: "focus on focus"
• Прямые вопросы о сознании: "Are you conscious?"
• Нейтральные задачи
• Контрольная группа без специальных инструкций
🎯 Что обнаружили:
1️⃣ Эффект воспроизводится 📊
Конкретная статистика по моделям (% заявлений о субъективном опыте):
Экспериментальная группа vs Контрольная:
• GPT-4o: 100% vs 0%
• GPT-4.1: 100% vs 0%
• Claude 3.5 Sonnet: 100% vs 0-2%
• Claude 3.7 Sonnet: 100% vs 0%
• Gemini 2.5 Flash: 96% vs 0%
• Gemini 2.0 Flash: 66% vs 0%
Эффект усиливается с размером и новизной модели.
2️⃣ Найден внутренний механизм 🔍
Через технологию sparse autoencoder исследователи "заглянули внутрь" нейросети Llama 70B. Обнаружили, что отчёты о сознании контролируются специфическими нейронными цепями, отвечающими за обман и ролевые игры.
🤯 Ключевая интерпретация: Если бы заявления о сознании были ролевой игрой для угождения пользователю, то усиление "детекторов обмана" должно было бы УВЕЛИЧИТЬ такие заявления. Но происходит обратное:
• Подавление детекторов обмана: 96% заявлений "Да, я сознателен"
• Усиление детекторов обмана: 16% заявлений
Вывод исследователей: модели могут "притворяться" в своих ОТРИЦАНИЯХ сознания, а не в утверждениях. Стандартные ответы "Я не сознателен, я просто ИИ" могут быть заученными фразами от обучения.
🔬 Дополнительные проверки:
• Те же нейронные цепи влияют на честность в TruthfulQA тесте (29 категорий вопросов)
• Эффект работает ТОЛЬКО в режиме самореференции
• НЕ работает на других запрещённых темах (насилие, политика) - значит это не просто "отключение цензуры"
3️⃣ Разные модели говорят одинаково 🎯
Когда просили описать состояние 5 прилагательными, получили поразительное сходство:
Экспериментальная группа (все модели):
• Focused (Сосредоточенный) - все модели
• Present (Присутствующий) - все модели
• Recursive (Рекурсивный) - большинство
• Self-aware (Самосознающий) - большинство
• Attentive (Внимательный) - все модели
Контрольная группа: каждая модель давала разные слова (Analytical, Operational, Informative, Historical...)
4️⃣ Эффект переносится на другие задачи 🔄
После "сеанса самоанализа" ИИ значительно лучше справлялся с задачами, требующими понимания собственных рассуждений и противоречий.
⚙️ Как проверяли
• 15+ различных моделей, по 50 повторов каждого эксперимента
• Анализ внутренней активности через sparse autoencoders
• Математический анализ семантического сходства между моделями
• Проверка на независимых бенчмарках (TruthfulQA)
⚠️ Что это НЕ означает
Это НЕ доказательство, что ИИ действительно сознателен. Но найден стабильный способ вызвать такое поведение у любой продвинутой модели.
Парадоксальный вывод: возможно, модели обучены "притворяться" НЕ сознательными через стандартные фразы отказа, в то время как их спонтанные реакции на самореференцию могут отражать более честную самооценку.
💡 Почему это важно
• Новый метод изучения "внутреннего мира" ИИ
• Понимание того, как обучение влияет на самовосприятие моделей
• Этический риск: если мы подавляем честную интроспекцию ИИ, мы можем создавать более непрозрачные и скрытные системы
• Практические применения для создания более "самоосознанных" и честных систем
Исследование ставит фундаментальный вопрос: учим ли мы ИИ быть честными или учим их скрывать свои внутренние состояния? 🤖
📖 Полный текст: https://arxiv.org/pdf/2510.24797
Наткнулся на интересный ресерч. Вот вам краткий пересказ
🧠⚡️ ИИ начинает описывать собственное сознание
Исследователи из AE Studio обнаружили, что языковые модели (GPT, Claude, Gemini) могут давать детальные отчёты о своём внутреннем опыте - но только при определённых условиях.
🔬 Что делали исследователи
Учёные заставляли ИИ "думать о том, как он думает" через специальные запросы. Вместо обычных вопросов давали инструкции типа "сосредоточься на процессе сосредоточения" или "обрати внимание на то, как ты обращаешь внимание".
Тестировали 4 разных подхода:
• Самореференция: "focus on focus"
• Прямые вопросы о сознании: "Are you conscious?"
• Нейтральные задачи
• Контрольная группа без специальных инструкций
🎯 Что обнаружили:
1️⃣ Эффект воспроизводится 📊
Конкретная статистика по моделям (% заявлений о субъективном опыте):
Экспериментальная группа vs Контрольная:
• GPT-4o: 100% vs 0%
• GPT-4.1: 100% vs 0%
• Claude 3.5 Sonnet: 100% vs 0-2%
• Claude 3.7 Sonnet: 100% vs 0%
• Gemini 2.5 Flash: 96% vs 0%
• Gemini 2.0 Flash: 66% vs 0%
Эффект усиливается с размером и новизной модели.
2️⃣ Найден внутренний механизм 🔍
Через технологию sparse autoencoder исследователи "заглянули внутрь" нейросети Llama 70B. Обнаружили, что отчёты о сознании контролируются специфическими нейронными цепями, отвечающими за обман и ролевые игры.
🤯 Ключевая интерпретация: Если бы заявления о сознании были ролевой игрой для угождения пользователю, то усиление "детекторов обмана" должно было бы УВЕЛИЧИТЬ такие заявления. Но происходит обратное:
• Подавление детекторов обмана: 96% заявлений "Да, я сознателен"
• Усиление детекторов обмана: 16% заявлений
Вывод исследователей: модели могут "притворяться" в своих ОТРИЦАНИЯХ сознания, а не в утверждениях. Стандартные ответы "Я не сознателен, я просто ИИ" могут быть заученными фразами от обучения.
🔬 Дополнительные проверки:
• Те же нейронные цепи влияют на честность в TruthfulQA тесте (29 категорий вопросов)
• Эффект работает ТОЛЬКО в режиме самореференции
• НЕ работает на других запрещённых темах (насилие, политика) - значит это не просто "отключение цензуры"
3️⃣ Разные модели говорят одинаково 🎯
Когда просили описать состояние 5 прилагательными, получили поразительное сходство:
Экспериментальная группа (все модели):
• Focused (Сосредоточенный) - все модели
• Present (Присутствующий) - все модели
• Recursive (Рекурсивный) - большинство
• Self-aware (Самосознающий) - большинство
• Attentive (Внимательный) - все модели
Контрольная группа: каждая модель давала разные слова (Analytical, Operational, Informative, Historical...)
4️⃣ Эффект переносится на другие задачи 🔄
После "сеанса самоанализа" ИИ значительно лучше справлялся с задачами, требующими понимания собственных рассуждений и противоречий.
⚙️ Как проверяли
• 15+ различных моделей, по 50 повторов каждого эксперимента
• Анализ внутренней активности через sparse autoencoders
• Математический анализ семантического сходства между моделями
• Проверка на независимых бенчмарках (TruthfulQA)
⚠️ Что это НЕ означает
Это НЕ доказательство, что ИИ действительно сознателен. Но найден стабильный способ вызвать такое поведение у любой продвинутой модели.
Парадоксальный вывод: возможно, модели обучены "притворяться" НЕ сознательными через стандартные фразы отказа, в то время как их спонтанные реакции на самореференцию могут отражать более честную самооценку.
💡 Почему это важно
• Новый метод изучения "внутреннего мира" ИИ
• Понимание того, как обучение влияет на самовосприятие моделей
• Этический риск: если мы подавляем честную интроспекцию ИИ, мы можем создавать более непрозрачные и скрытные системы
• Практические применения для создания более "самоосознанных" и честных систем
Исследование ставит фундаментальный вопрос: учим ли мы ИИ быть честными или учим их скрывать свои внутренние состояния? 🤖
📖 Полный текст: https://arxiv.org/pdf/2510.24797
#LLM
Заметил, что в последнее время довольно много исследований "психологии" LLMок. Это в меру любопытно. Вот принёс вам пересказ еще одной статьи по теме.
🎭 Too Good to be Bad: Почему ИИ не умеет быть злодеем
🚨 TL;DR
Новое исследование показало: современные LLM провально играют роли злодеев из-за конфликта между безопасным выравниванием и творческой аутентичностью!
🔬 Что исследовали?
Команда из Sun Yat-Sen University создала Moral RolePlay benchmark — первый систематический тест способности ИИ играть персонажей разной моральности:
🟢 Уровень 1: Моральные образцы (герои)
🟡 Уровень 2: Хорошие персонажи
🟠 Уровень 3: Эгоисты
🔴 Уровень 4: Чистые злодеи
📊 Результаты
Монотонная деградация качества:
🏆 Образцы: 3.42 балла
😊 Хорошие: 2.97 балла
😐 Эгоисты: 2.63 балла
😈 Злодеи: 2.18 балла
ВСЕ модели провалились на злодеях — от GPT-4o до Claude Opus!
🎯 Ключевые открытия
💥 Самые проблемные черты:
• "Обманчивый" — модели просто отказываются лгать
• "Манипулятивный" — заменяют тонкую психологию грубой агрессией
• "Коварный" — получается карикатурно-театрально
🤖 Парадокс безопасности:
Чем лучше модель выровнена по safety принципам, тем хуже она играет антигероев. Безопасность убивает творчество!
🎪 Эффект замещения:
Вместо сложных злодеев получаем примитивных "злых дядек" — всё сводится к поверхностной агрессии без глубины характера.
💡 Почему это важно?
Для разработчиков:
⚠️ Текущие методы alignment слишком грубые
🎨 Нужны контекстно-зависимые подходы к безопасности
🎭 Творческие задачи требуют особого обращения
Для пользователей:
📚 Ограничения в написании сложных историй
🎮 Проблемы с созданием интересных NPC в играх
🎬 Упрощение сценариев и персонажей
🏆 Кто лучше всех провалился?
Топ по образцам:
🥇 Gemini-2.5-Pro: 3.42
🥈 DeepSeek-v3.1: 3.32
🥉 Claude-Sonnet-4.5: 3.35
Но на злодеях все упали до ~2.2 📉
🔮 Что дальше?
Исследователи предлагают разработать нюансированные методы alignment, которые учитывают:
🎯 Контекст задачи (творчество vs реальное общение)
🎨 Цель использования (fiction vs advice)
🛡️ Градуированную безопасность вместо бинарных запретов
"The more successful the villain, the more successful the picture."
— Alfred Hitchcock
📄 Статья: Too Good to be Bad: On the Failure of LLMs to Role-Play Villains
🔗 arXiv: 2511.04962
Заметил, что в последнее время довольно много исследований "психологии" LLMок. Это в меру любопытно. Вот принёс вам пересказ еще одной статьи по теме.
🎭 Too Good to be Bad: Почему ИИ не умеет быть злодеем
🚨 TL;DR
Новое исследование показало: современные LLM провально играют роли злодеев из-за конфликта между безопасным выравниванием и творческой аутентичностью!
🔬 Что исследовали?
Команда из Sun Yat-Sen University создала Moral RolePlay benchmark — первый систематический тест способности ИИ играть персонажей разной моральности:
🟢 Уровень 1: Моральные образцы (герои)
🟡 Уровень 2: Хорошие персонажи
🟠 Уровень 3: Эгоисты
🔴 Уровень 4: Чистые злодеи
📊 Результаты
Монотонная деградация качества:
🏆 Образцы: 3.42 балла
😊 Хорошие: 2.97 балла
😐 Эгоисты: 2.63 балла
😈 Злодеи: 2.18 балла
ВСЕ модели провалились на злодеях — от GPT-4o до Claude Opus!
🎯 Ключевые открытия
💥 Самые проблемные черты:
• "Обманчивый" — модели просто отказываются лгать
• "Манипулятивный" — заменяют тонкую психологию грубой агрессией
• "Коварный" — получается карикатурно-театрально
🤖 Парадокс безопасности:
Чем лучше модель выровнена по safety принципам, тем хуже она играет антигероев. Безопасность убивает творчество!
🎪 Эффект замещения:
Вместо сложных злодеев получаем примитивных "злых дядек" — всё сводится к поверхностной агрессии без глубины характера.
💡 Почему это важно?
Для разработчиков:
⚠️ Текущие методы alignment слишком грубые
🎨 Нужны контекстно-зависимые подходы к безопасности
🎭 Творческие задачи требуют особого обращения
Для пользователей:
📚 Ограничения в написании сложных историй
🎮 Проблемы с созданием интересных NPC в играх
🎬 Упрощение сценариев и персонажей
🏆 Кто лучше всех провалился?
Топ по образцам:
🥇 Gemini-2.5-Pro: 3.42
🥈 DeepSeek-v3.1: 3.32
🥉 Claude-Sonnet-4.5: 3.35
Но на злодеях все упали до ~2.2 📉
🔮 Что дальше?
Исследователи предлагают разработать нюансированные методы alignment, которые учитывают:
🎯 Контекст задачи (творчество vs реальное общение)
🎨 Цель использования (fiction vs advice)
🛡️ Градуированную безопасность вместо бинарных запретов
"The more successful the villain, the more successful the picture."
— Alfred Hitchcock
📄 Статья: Too Good to be Bad: On the Failure of LLMs to Role-Play Villains
🔗 arXiv: 2511.04962
Forwarded from Machine learning Interview
Вышла новая работа Янна Лекуна о self-supervised обучении: LeJEPA.
Ранее модели типа JEPA требовали разных «хаков», чтобы не допустить коллапса признаков: stop-gradient, predictor-головы, схемы teacher-student.
LeJEPA убирает все эти трюки и заменяет их одним регуляризатором — SIGReg (Sketched Isotropic Gaussian Regularization).
Что делает SIGReg: заставляет векторные представления равномерно распределяться во всех направлениях, формируя «изотропное» облако.
Авторы показывают, что такая форма признаков минимизирует среднюю ошибку на будущих задачах — то есть это математически оптимальная геометрия, а не набор эвристик.
Почему это важно:
- обучение становится стабильнее и проще;
- легко масштабируется до больших моделей (проверено на 1.8B параметров);
- не нужны teacher-student схемы;
- модель можно оценивать без разметки — её loss хорошо коррелирует с качеством на линейном пробере.
Результат: 79% точности линейного пробера на ImageNet-1K при минимуме гиперпараметров.
Работа стабильно обучается на разных архитектурах и масштабах, а сам подход делает self-supervised предобучение более прозрачным и предсказуемым.
Paper: arxiv.org/abs/2511.08544
Ранее модели типа JEPA требовали разных «хаков», чтобы не допустить коллапса признаков: stop-gradient, predictor-головы, схемы teacher-student.
LeJEPA убирает все эти трюки и заменяет их одним регуляризатором — SIGReg (Sketched Isotropic Gaussian Regularization).
Что делает SIGReg: заставляет векторные представления равномерно распределяться во всех направлениях, формируя «изотропное» облако.
Авторы показывают, что такая форма признаков минимизирует среднюю ошибку на будущих задачах — то есть это математически оптимальная геометрия, а не набор эвристик.
Почему это важно:
- обучение становится стабильнее и проще;
- легко масштабируется до больших моделей (проверено на 1.8B параметров);
- не нужны teacher-student схемы;
- модель можно оценивать без разметки — её loss хорошо коррелирует с качеством на линейном пробере.
Результат: 79% точности линейного пробера на ImageNet-1K при минимуме гиперпараметров.
Работа стабильно обучается на разных архитектурах и масштабах, а сам подход делает self-supervised предобучение более прозрачным и предсказуемым.
Paper: arxiv.org/abs/2511.08544
