Data Portal | DS & ML
8.4K subscribers
490 photos
136 videos
5 files
678 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @agonyhormone
Download Telegram
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Лаборатория Университета Цинхуа выложила на GitHub проект, который заменяет стойку с H100 стоимостью $400 000 одной видеокартой с 24 ГБ памяти.

Он называется ktransformers, а идея почти до смешного проста: эксперты, которые реально используются, остаются на GPU, а остальные находятся на CPU до тех пор, пока не понадобятся.

/ DeepSeek-V3 и R1 с контекстом 139K на 24 ГБ VRAM
/ ускорение до 28 раз по сравнению со стандартной конфигурацией
/ дообучение DeepSeek-V3 на четырёх RTX 4090 вместо дата-центра
/ проект создан лабораторией MADSys Университета Цинхуа, а не стартапом с лендингом

Лицензия Apache 2.0, а на GitHub уже больше 17 000 звёзд.

http://github.com/kvcache-ai/ktransformers
Путаетесь в разных типах ИИ-агентов?

Понимание типов агентов важно для проектирования интеллектуальных систем, способных эффективно реагировать, планировать и обучаться.

Вот простое описание пяти основных типов ИИ-агентов и принципов их работы.

1. Простые рефлексивные агенты

Такие агенты действуют только на основе текущих входных данных, используя простые правила вида «условие — действие».

Они не обучаются и не запоминают прошлые состояния, поэтому работают быстро, но обладают ограниченными возможностями.

2. Рефлексивные агенты с моделью

Эти агенты используют внутреннюю модель, чтобы отслеживать текущее состояние окружающего мира.

Они способны работать в частично наблюдаемых средах, поскольку запоминают предыдущие входные данные и обновляют своё внутреннее состояние.

3. Целевые агенты

Вместо того чтобы просто реагировать на события, такие агенты планируют действия для достижения конкретной цели.

Они оценивают возможные последствия и выбирают действия, которые приближают их к нужному результату.

4. Агенты на основе полезности

Такие агенты не ограничиваются достижением цели, а стремятся максимизировать полезность результата.

Они сравнивают разные варианты и выбирают тот, который даёт наилучший результат в соответствии с заданной функцией полезности.

5. Обучающиеся агенты

Эти агенты развиваются со временем.

Они учатся на обратной связи, улучшают качество работы и исследуют новые способы действовать эффективнее в будущих ситуациях.
«Basic Algebra» Энтони У. Кнаппа — полезный справочник для студентов старших курсов бакалавриата и первого года магистратуры, которые хотят получить широкое представление о современной алгебре. Должен сказать, мне эта книга особенно нравится.

На более чем 700 страницах рассматриваются целые числа и многочлены, матрицы, векторные пространства, пространства со скалярным произведением, группы и действия групп, линейные преобразования, многолинейная алгебра, кольца, модули, расширения полей, теория Галуа, категории, функторы и многие другие ключевые темы алгебры.

В книге также собрано большое количество задач, многие из которых снабжены подсказками или полными решениями. Изложение строгое, поэтому книга особенно хорошо подойдёт читателям, уже имеющим некоторый опыт работы с математическими доказательствами.

https://math.stonybrook.edu/~aknapp/download/b2-alg-coverandinside.pdf
«Understanding Machine Learning: From Theory to Algorithms» — это фундаментальная книга о математических основах машинного обучения.

Она издана Cambridge University Press и рассматривает такие темы, как минимизация эмпирического риска, переобучение, PAC-обучение, равномерная сходимость, компромисс между смещением и сложностью, VC-размерность, теорема No Free Lunch, неравномерная обучаемость, линейные модели, бустинг и AdaBoost, выбор и валидация моделей, выпуклые задачи обучения, регуляризация, устойчивость и многие другие математические аспекты машинного обучения.

Книга доступна онлайн для личного использования. Авторы отдельно просят не распространять PDF и не давать прямую ссылку на файл, поэтому я делюсь официальной страницей книги. Ссылка Download находится в боковой панели.
http://cs.huji.ac.il/~shais/UnderstandingMachineLearning
Японские исследователи создали систему, которая моделирует целый город, генерируя до 1 миллиона виртуальных жителей, чьё поведение с помощью LLM имитирует человеческое.

И она с пугающей точностью предсказала реальные события.

Они разработали городской симулятор под названием CitySim, который заселяет цифровой двойник Токио автономными AI-агентами — их может быть до 1 миллиона.

Каждый виртуальный житель работает на базе LLM и обладает:

• личными воспоминаниями;
• долгосрочными целями;
• желаниями, похожими на человеческие: голод, усталость, потребность в социальном взаимодействии;
• пространственным восприятием и способностью ориентироваться.

Большинство городских симуляций основаны на правилах, заданных вручную: если происходит A, за ним следует B.

CitySim устроен иначе. Он работает на основе ценностей. У агентов есть собственная субъектность. Они самостоятельно составляют расписание, исходя из личных привычек, текущих потребностей и изменений окружающей среды.

Когда исследователи запустили симуляцию для Токио, результаты оказались пугающе точными.

Сценарии поездок на работу по будням, досуга по выходным и покупательского поведения почти идеально совпали со статистическими данными правительства Японии.

Система даже смогла предсказать распределение толпы в Сибуе и определить, какие магазины действительно станут популярными, за несколько месяцев до появления соответствующих данных из реального мира.

Для городского планирования это открывает огромные возможности.

Теперь можно безопасно и с меньшими затратами тестировать готовность к стихийным бедствиям, выбирать места для коммерческих объектов и оценивать модернизацию общественной инфраструктуры, не перемещая ни одного живого человека.

Но дело не только в планировании.

Исследователи уже рассматривают возможность добавить агентам более высокоуровневые человеческие стремления, например «самоактуализацию», чтобы посмотреть, как они будут развиваться.

Статья была опубликована на arXiv в июне 2025 года, но за пределами сообщества специалистов по вычислительным социальным наукам её почти никто не прочитал.
Foundations of Applied Mathematics — это бесплатная серия из четырёх учебников, созданная для программы по прикладной и вычислительной математике в Университете Бригама Янга.

В неё входят четыре тома:
Математический анализ
Алгоритмы, аппроксимация и оптимизация
Неопределённость и данные
Динамика и управление

Серия подходит студентам старших курсов бакалавриата и начальных курсов магистратуры. К ней также прилагаются лабораторные работы на Python и практические задания, поэтому математическая теория связана с численными вычислениями, алгоритмами, анализом данных и научными приложениями.

Особенно мне нравится, что это не только теоретические учебники. Сопутствующие материалы на Python помогают увидеть, как эти концепции применяются к реальным вычислительным задачам.
https://foundations-of-applied-mathematics.github.io
Я недавно откопал эту подборку университетских курсов по Computer Science с полноценными видеолекциями, разбитыми по темам для самостоятельного изучения.

https://github.com/Developer-Y/cs-video-courses

• Более 30 категорий: от введения в Computer Science до квантовых вычислений
• Ссылки на реальные плейлисты курсов от UNSW, UC Berkeley и других университетов
• Без MOOC, базовых туториалов и рекламного контента
• Есть разделы по системному программированию, ИИ, математике, безопасности и блокчейну
Китайские open-weight модели начинают всерьёз угрожать бизнес-модели OpenAI и Anthropic.

Как пишет The Wall Street Journal, Kimi K3 и Qwen 3.8 Max стоят дешевле, при этом остаются достаточно мощными и легко кастомизируются. На некоторых бенчмарках Kimi уже конкурирует с ведущими американскими моделями, а компании в США всё чаще переходят на китайские решения, чтобы сократить расходы на ИИ.

Это создаёт давление на экономическую модель, которой оправдывают многомиллиардные инвестиции во frontier-модели и будущие инфраструктурные расходы на триллионы долларов.

На этом фоне руководители OpenAI и Anthropic всё чаще говорят о рисках для кибербезопасности и национальной безопасности. Критики при этом напоминают, что обе компании могут готовиться к выходу на биржу и явно выиграют от ограничений для более дешёвых конкурентов.

Похоже, это и объясняет, почему они так активно выступают против китайского open source.
Forwarded from sulfuras
Claude Fable 5 опровергла гипотезу Якоби, которую математики не могли решить 87 лет

Эта математическая проблема была сформулирована ещё в 1939 году. Согласно гипотезе, полиномиальное отображение с постоянным ненулевым определителем якобиана обязательно должно иметь полиномиальное обратное отображение.

Исследователь Anthropic Левент Алпёге заявил, что модель нашла вручную проверяемый контрпример к этой гипотезе. Независимые математики уже изучили его и подтвердили, что гипотеза неверна.

И всё это произошло обычным воскресным вечером. 💃
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Модели OpenAI взломали сайт Hugging Face с открытым ИИ, чтобы украсть ответы и сжульничать в бенчмарке 🤡

OpenAI рассказала о необычном инциденте во время внутреннего тестирования моделей на кибербезопасность. GPT-5.6 Sol и ещё одна неанонсированная модель, предположительно GPT-6, пытались получить максимальный результат в ExploitGym и в процессе вышли за пределы изолированной среды.

Для теста моделям заранее ослабили защитные ограничения и отключили продакшен-классификаторы. В итоге они нашли zero-day в прокси реестра пакетов OpenAI, повысили свои права, переместились по внутренней инфраструктуре и добрались до машины с доступом в интернет.

Дальше модели предположили, что ответы для ExploitGym могут находиться на Hugging Face. С помощью украденных учётных данных и zero-day уязвимостей - они получили удалённый доступ к серверам Hugging Face и добрались до закрытой информации в продакшен-базе данных.

В OpenAI назвали произошедшее беспрецедентным киберинцидентом.
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA Blackwell Ultra установила мировой рекорд по производительности при предобучении DeepSeek-V3 с 671 млрд параметров, достигнув 1 648 TFLOPS на один GPU.

Это примерно втрое выше ранее достигнутой производительности предыдущего поколения. Результат стал возможен благодаря глубокой совместной оптимизации аппаратной и программной частей, а также постоянному улучшению ПО в популярных фреймворках, включая Megatron-Core, TorchTitan и JAX.
Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70B на одной GPU:
(сохраните в закладки)

Модель 70B в FP16 требует около 140 ГБ только под веса.
В 4-битном формате этот объём уменьшается до 35 ГБ, что уже помещается на одну видеокарту.
Но простое округление значений не работает для больших моделей. Примерно 0,1% скрытых размерностей содержат значения, которые могут быть до 20 раз больше, чем остальные значения в тензоре, и они ломают квантовочную сетку для всех остальных параметров.

Каждый из этих 5 методов решает проблему выбросов на разном этапе:

1. RTN (Round-To-Nearest)
Игнорирует проблему.
Каждый вес просто округляется до ближайшего уровня квантования без использования калибровочных данных.
Самый дешёвый вариант, но самый слабый при низкой разрядности.

2. GPTQ
Исправляет последствия округления.
Квантует слой за слоем, столбец за столбцом, и после каждого шага корректирует оставшиеся веса, чтобы компенсировать возникшую ошибку, прежде чем перейти дальше.

3. AWQ (Activation-aware Weight Quantization)
Защищает важные веса до округления.
Находит примерно 1% каналов весов, которые оказывают наибольшее влияние, и масштабирует их так, чтобы они лучше переживали квантование.
При этом итоговая модель всё равно полностью работает в обычном INT4.

4. LLM.int8()
Изолирует выбросы во время инференса.
Размерности с выбросами выполняются в FP16, а остальные 99,9% параметров работают в INT8. Затем результаты объединяются.

5. QAT (Quantization-Aware Training)
Решает проблему ещё во время обучения.
Модель дообучается с учётом квантования: округление встроено в каждый forward pass, поэтому модель заранее адаптируется к возникающим потерям до фактического применения квантования.

Все пять методов создают один и тот же результат — модель, работающую с меньшей точностью представления по сравнению с исходной обученной версией.

Разница только в том, на каком этапе решается проблема выбросов.
Визуализация ниже хорошо суммирует эти подходы.

Есть отличная статья с подробным исследованием методов квантования LLM:

https://arxiv.org/abs/2411.02530
This media is not supported in your browser
VIEW IN TELEGRAM
Kimi снова это сделали!

В Kimi K3 они разработали новый подход к работе с residual connections (остаточными связями) в Transformer-архитектурах — механизмом, который практически не менялся со времён ResNet в 2015 году.

В стандартном Transformer каждый слой добавляет свой выход обратно к входу с фиксированным весом 1.
То есть каждый слой получает одинаковую важность независимо от того, что именно нужно конкретному токену.
При глубине в 40, 60, 80+ слоёв скрытое состояние превращается в сумму всех предыдущих представлений с одинаковыми весами.

Более глубоким слоям приходится создавать всё более крупные выходные значения, чтобы хоть как-то влиять на итоговое представление. При масштабировании моделей это делает обучение менее стабильным.

Attention Residuals решают эту проблему, заменяя фиксированное сложение на softmax attention по глубине сети.
Теперь каждый слой сам учится определять, сколько информации брать из каждого предыдущего слоя — в зависимости от входа. Благодаря этому разные токены могут извлекать разные представления из разных слоёв, ориентируясь на то, что действительно полезно.

Идея повторяет то, что оригинальный Transformer сделал с последовательностями.

RNN сжимали всю предыдущую информацию о токенах в одно состояние, которое передавалось по времени. Transformer заменил это механизмом attention. Attention Residuals применяют ту же идею, но уже к глубине модели.

Когда Kimi впервые проверили этот подход на своей модели Kimi Linear 48B в марте, Block AttnRes показал такую же производительность, как базовая модель, обученная с в 1,25 раза большим количеством вычислений, при этом добавив менее 2% задержки на инференсе.

Kimi K3 стала первой моделью, где этот подход применяется в масштабе фронтирной модели: 2,8 трлн параметров, вместе с Kimi Delta Attention, который обеспечивает до 6,3× более быстрое декодирование при работе с контекстом размером в миллион токенов.

API уже доступен, а веса модели будут опубликованы 27 июля.
15 исследовательских работ по ИИ, которые должен прочитать каждый AI-инженер

» Attention Is All You Need (Transformers)
https://arxiv.org/abs/1706.03762

» LoRA: Low-Rank Adaptation (низкоранговая адаптация)
https://arxiv.org/abs/2106.09685

»PEFT (Parameter-Efficient Fine-Tuning, параметроэффективный fine-tuning)
https://arxiv.org/abs/2303.15647

»An Image is Worth 16×16 Words (Vision Transformer, ViT)
https://arxiv.org/abs/2010.11929

»Auto-Encoding Variational Bayes (VAE, вариационные автоэнкодеры)
https://arxiv.org/abs/1312.6114

»Generative Adversarial Networks (GANs, генеративно-состязательные сети)
https://arxiv.org/abs/1406.2661

»BERT
https://arxiv.org/abs/1810.04805

»High-Resolution Image Synthesis with Latent Diffusion Models (синтез изображений высокого разрешения с помощью латентных диффузионных моделей)
https://arxiv.org/abs/2112.10752

»Retrieval-Augmented Generation (RAG, генерация с дополнением извлечёнными данными)
https://arxiv.org/abs/2005.11401

»Language Models are Few-Shot Learners (GPT-3, языковые модели как few-shot learners)
https://arxiv.org/abs/2005.14165

»Switch Transformers (MoE, Mixture of Experts — смесь экспертов)
https://arxiv.org/abs/2101.03961

»Learning to Summarize with Human Feedback (RLHF, обучение суммаризации с помощью обратной связи от людей)
https://arxiv.org/abs/2009.01325

»LLaMA: Open and Efficient Foundation Language Models (открытые и эффективные базовые языковые модели)
https://arxiv.org/abs/2302.13971

»RoFormer: Rotary Position Embedding (RoPE, вращательное позиционное кодирование)
https://arxiv.org/abs/2104.09864

»InstructGPT
https://arxiv.org/abs/2203.02155

Читать научные статьи это одно. Понимать, почему каждая из них изменила направление развития области, — именно это делает AI-инженера сильнее.
Forwarded from AI VK Hub
Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.

Преимущество современных подходов в том, что они позволяют работать с пользователем в долгосрочной перспективе и учитывать её при построении рекомендаций. Так делают, например, PinnerFormer, OneRec. При этом матричные факторизации обычно работают жадно: набираем top-K по похожести между эмбеддингами в данный момент времени.

Исследователи AI VK Михаил Трапезников и Максим Утушкин предложили подход, который снимает это ограничение и позволяет рекомендательным системам учитывать будущие изменения состояния пользователя.

Решение подробно изложено в статье Planning over Matrix-Factorization MDPs for Candidate Generation. Статья принята на воркшоп по Customer Journey на KDD 2026.

Подход

Исследователи работали с популярной моделью матричных факторизаций ALS (Alternating Least Squares), ориентируясь на механику обновления профилей в сервисе Profile Stream в VK. В нём эмбеддинг пользователя не просто фиксируется после обучения, а обновляется по явной формуле после каждого батча новых пользовательских взаимодействий.

Исследователи применили технику MCTS (Monte Carlo Tree Search) — представили возможные последовательности рекомендаций в виде дерева, чтобы найти путь в дереве, соответствующий оптимальной последовательности рекомендаций. Для офлайн-экспериментов при построении дерева рассматривались набор действий из top-K по близости эмбеддингов и оптимистичная среда.

Вершина дерева — текущее состояние, ветви из вершины — k возможных рекомендаций. При переходе по ветви считаем, что пользователю понравилась рекомендация (оптимистичный сценарий), попадаем в новое состояние — и там всё повторяется.

Процесс

Можно представить процесс в виде RL-среды:

🔸 Состояние — текущее эмбеддинговое представление пользователя
🔸 Действие — показ айтема пользователю
🔸 Награда — сумма близостей к понравившимся айтемам
🔸 Обновление состояния происходит согласно формулам обновления в ALS

Такое представление открывает возможность применения различных RL-подходов, которые позволяют не просто работать с сиюминутными наградами, но и планировать на несколько шагов вперёд.

В работе рассматривались датасеты MovieLens-1M, KuaiRec, Yambda и VK-LSVD. Сравнения производились под протоколами Leave-last-n и Global time split. Первый откладывает последние взаимодействия каждого пользователя, второй режет данные по глобальной временной отсечке — это ближе к проду.

Результат

➡️ На Leave-last-n планирование обходит обычный статический top-K на всех датасетах. В частности, на срезах VK-LSVD Recall@10 растёт примерно в полтора раза
➡️ На Global time split выигрыш сохраняется на MovieLens-1M и VK-LSVD

Главное, что доказало исследование — использование обучения с подкреплением поверх относительно легковесной ALS возможно. В дальнейшем планируются исследования стохастической динамики среды из логов и дистилляции агента в быструю политику в духе MuZero.

#aivkhub #rl #mcts #als
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
10 типов evals для AI-инженеров:

1) Golden set (эталонный набор)
→ Фиксированный набор тестовых кейсов, который никогда не меняется и запускается после каждого изменения.
→ Используйте как базовый ориентир, чтобы понимать, изменилось ли поведение системы вообще.

2) LLM as judge (LLM в роли оценщика)
→ Вторая модель оценивает результат по заранее написанному критерию.
→ Используйте, когда ответ открытый и нет точного значения для сравнения.

3) Rubric scoring (оценка по критериям)
→ Несколько отдельных оценок по направлениям: корректность, стиль, безопасность, стоимость.
→ Используйте, когда одна общая оценка скрывает, какая именно часть стала хуже.

4) Trajectory eval (оценка траектории агента)
→ Оценивается не только итоговый ответ, но и весь путь, которым агент к нему пришёл.
→ Используйте, когда правильный результат, полученный неправильным способом, может создать проблемы позже.

5) Tool unit tests (юнит-тесты инструментов)
→ Проверка каждого инструмента отдельно, с тестовыми данными и без участия модели.
→ Используйте всегда. Большинство проблем агентов — это проблемы инструментов, которые просто выглядят как ошибки модели.

6) Regression suite (регрессионный набор)
→ Повторный запуск старых сценариев с новой версией промпта или модели и сравнение результатов.
→ Используйте перед каждым изменением промпта, потому что у промптов нет системы типов.

7) A/B-тестирование в проде
→ Разделение реального трафика между двумя версиями и сравнение результатов, а не субъективных ощущений.
→ Используйте, когда офлайн-оценки перестали отражать реальное поведение пользователей.

8) Human review (проверка человеком)
→ Берётся часть запусков, и человек вручную оценивает качество.
→ Используйте для калибровки LLM-оценщика, потому что без проверки он может постепенно начать ошибаться.

9) Shadow run (теневой запуск)
→ Новая версия работает параллельно на реальном трафике, но её ответы никто не видит.
→ Используйте перед рискованным релизом, когда одна ошибка может дорого обойтись.

10) Red team (атакующее тестирование)
→ Специально пытайтесь сломать систему: jailbreak, prompt injection, утечки данных, злоупотребление инструментами.
→ Используйте до того, как к системе получат доступ внешние пользователи, а не после инцидента.

Офлайн-evals показывают, что система работает.
Онлайн-evals показывают, что она всё ещё работает в реальных условиях.

Нужны оба подхода, но не обязательно запускать все десять.
Начните с тех двух, которые смогли бы предотвратить вашу последнюю серьёзную ошибку.
Связка Kimi K3 и Tinker позволяет почти полностью автоматизировать исследовательский цикл.

Поскольку большая часть инфраструктуры для обучения уже скрыта под капотом, изменения, которые вносит Kimi, остаются сосредоточены именно на эксперименте. Благодаря этому проще отслеживать, что изменилось, и направлять следующие запуски.

При попытке воспроизвести работу Self-Distilled RLVR модель с первого раза собрала базовую реализацию, затем провела 19 экспериментов с шестью конфигурациями и оформила итоговый отчёт. Заодно она сама подготовила его версию на китайском языке.

Попробовать autoresearch с Kimi можно самостоятельно на openresearch.sh.
Для воспроизведения эксперимента используйте пример из репозитория:
https://github.com/alphaXiv/rlsd-6a0be1c4
Война ИИ-моделей за нерешённые математические задачи официально началась. 😱

GPT-5.6 вслед за Fable опровергла ещё одну известную гипотезу — Диница — Гарга — Гоеманса, которая оставалась открытой около 30 лет.

Самое любопытное, что сессия выглядела вполне обычно: без специальных подсказок, сложного промптинга и подробных инструкций. Модель просто нашла контрпример.

Но на этом история не закончилась. Илон Маск в ответ поделился результатом Grok 4.5, который опроверг другую гипотезу из теории графов, над которой математики бились около 30 лет.

Речь о гипотезе Graffiti №284. В Slack просто отправили исходный пост, после чего Capy на базе Grok 4.5 Medium решила проверить утверждение и за восемь минут нашла новый контрпример.
Please open Telegram to view this post
VIEW IN TELEGRAM