AI Notes
21 subscribers
36 photos
29 videos
12 files
187 links
About new GenAI and other things, cutting-edge info
Download Telegram
Forwarded from Data Secrets
В Apple изучили законы масштабирования дистилляции и написали об этом интересную работу

Дистилляция в последнее время уж очень всем полюбилась. С помощью нее можно как бы "перекачивать" знания из большой модели-учителя в маленькую модель-ученика, заставляя ученика предсказывать генерации и иногда промежуточные состояния учителя. Таким образом было получено ну очень много моделей, которыми мы пользуемся и особенно которые запускаем локально.

С другой стороны дистилляция непредсказуема. Например, насколько глупее учителя получается ученик в зависимости от разницы в количестве параметров? Насколько это эффективнее обучения с нуля? Или насколько быстро обучение выходит на плато?

Apple изучали как раз такие вопросы и вот к каким выводам эмпирически пришли:

➖ Кажется, что чем мощнее учитель, тем лучше получится дистилляция. Оказалось, это миф. Слишком мощный учитель может ухудшить обучение ученика из-за capacity gap, при котором ученик не может эффективно усваивать "уроки".

➖ На дистилляцию распространяется общий закон масштабирования моделей. Это значит, что добавление данных и увеличение модели снижает ошибку, но с убывающей отдачей. Работает и для учителя, и для ученика.

➖ Есть способ оптимизировать дистилляцию и описывается он вполне конкретным уравнением, которое зависит от размера ученика и доступного бюджета вычислений.

➖ От выбора учителя тоже много чего зависит. Чем больше ученик, тем мощнее должен быть учитель, но эта зависимость следует степенному закону, так что нужно очень внимательно подбирать соотношение параметров.

➖ И да, дистилляция эффективнее ванильного обучения, но только в пределах определённого бюджета вычислений. Если данных и вычислений достаточно, супервизионное обучение всегда будет лучше.


Супер-полезное исследование для практики, на самом деле. Прямо готовые рецепты удачного обучения arxiv.org/pdf/2502.08606
Please open Telegram to view this post
VIEW IN TELEGRAM
LeetCode это сложно.

В FAANG считается стандартом для прохождения собеседований, решения задач на LeetCode. Причем там могут быть задачи: на структуры данных, алгоритмы, жадные алгоритмы, динамическое программирование.

По сути это задачи, уровня олимпиадного программирования вида: сделайте все возможные виды бинарные деревьев с числом узлом k=5

Всего около 7 тысяч задачи. Но говорят, что значение 18 шаблонов закрывает 70% всех задач.
😁1
Media is too big
VIEW IN TELEGRAM
https://seed.bytedance.com/en/seedance

Seedance 1.0, an AI video generation model from ByteDance, was released in June 2025. Specifically, Seedance 1.0 Pro was released on June 11, 2025.

Paper:
Seedance 1.0: Exploring the Boundaries of
Video Generation Models
https://arxiv.org/pdf/2506.09113
Чтобы понять как работает генерация изображений и видео на базе наиболее популярных score-based моделй Diffusion (Scode-based модели) и Flow Matching (Normalizing Flow модели)... нужно такие лекции https://www.youtube.com/watch?v=GCoP2w-Cqtg&list=PL57nT7tSGAAUDnli1LhTOoCxlEPGS19vH

даже я как инженер, ощущаю высокий уровень сложности) но интересно. По сути открывают занавес за Midjourney (Diffusion), Sora (DiT), SeeDance (Flow Matching)
😁1
GPT‑5 устанавливает новые рекорды на ключевых бенчмарках:

Мощный инструмент для кода и агентских задач:
• SWE-bench Verified: 74.9% — лучше, чем в предыдущих версиях .
• Aider Polyglot: 88% — явный лидер в полиглот-редактировании кода .
• GPT‑5 справляется с фронтенд-разработкой быстрее, красивее и точнее: предпочтителен тестировщиками в 70% случаев .
• В инструментальном взаимодействии (tool calling) модель демонстрирует 96.7% на τ²‑bench telecom, превосходя предыдущие технологические барьеры .

Высокие достижения в математике, мультимодальности и здравоохранении
• Математика: 94.6% на AIME 2025 без инструментов .
• Мультимодальноность: уверенные результаты на Vision Checkup — находится среди топ‑5 моделей; при этом, хотя GPT‑5 уступает в детекции объектов, его визуальные рассуждения значительно сильнее предшественников .
• Медицина: лучший результат на HealthBench Hard — более точные ответы и проактивность при интерпретации медицинских вопросов

https://www.youtube.com/live/0Uu_VJeVVfo?si=zB5-9eQztdg4bfnh
Genie 3 от DeepMind: новый рубеж в мире симуляций

Что такое Genie 3?
Это новейшая и наиболее впечатляющая на сегодня «модель мира» (world model), разработанная Google DeepMind. По текстовому запросу она генерирует реалистичные интерактивные 3D-сцены — сразу, в реальном времени, с частотой 24 кадра в секунду и разрешением 720p, позволяя пользователю свободно перемещаться по ним в течение нескольких минут

Чем волшебна?
• Постоянство мира: объекты и изменения (например, покрашенная стена или следы) сохраняются во времени — проявляется эффект «памяти» сцены .
• Управляемость через текст: можно менять окружение прямо во время сессии — добавлять животных, менять погоду и т.д.

https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
немного запаздало, но выглядит достойно... соревнования между LLM в шахматы
Forwarded from Data Secrets
Сегодня пройдет финал ИИ-чемпионата Kaggle по шахматам

В финал вышли o3 и Grok-4 (ставки принимаем в комментариях). За третье место будут бороться o4-mini и Gemini 2.5 Pro. Прискорбно, конечно, что в финале ни одной модели от Anthropic. С другой стороны новый Opus 4.1 не участвовал.

Комментировать трансляцию будет Магнус Карлсен, так что смотрим. Вчера, кстати, комментил Хикару Накамура (да, Kaggle запарились).

Онлайн будет здесь сразу после презентации GPT-5, в 20:30 по Москве. Расписание на вечер сегодня плотное 🏃‍♂️
Please open Telegram to view this post
VIEW IN TELEGRAM
Один из известных Бенчмарков сравнения LLM (но не единственный!) : https://lmarena.ai/leaderboard/

Почти на всех LMArena Leaderboard тест-бенчмарках, модель GPT-5 занимает первое место.

Но не надо забывать что качество решений вроде Agents (i.e. Claude Code) зависит еще и от архитектуры агента, как он запросы перенаправляет, разделяет на задачи контекст и тд. Но возможно OpenAI Codex стоит попробовать, сравнить с Claude Code. Цель у нас то какая -> в one-shot промпт SaaS сервисы пилить 😁
https://youtu.be/JW8PHlFD7HM?si=_a_8m11VWAFo6ILz

Пропустили один интересный релиз от Runway.

“Представляем Act-Two — нашу модель захвата движения нового поколения с существенным улучшением качества и поддержкой отслеживания головы, лица, тела и рук. Для Act-Two требуется только видеозапись движения и референсный персонаж.”
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Tencent выложили веса своего нейронного игрового движка.

Hunyuan Gamecraft можно запустить на 4090, он может генерировать видео в 720p и хорошо запоминает контекст сцены. Я уже делал обзор пейпера когда модель впервые показали, почитать можно тут. Это SOTA, по состоянию на начало лета, от Genie 3 она отстаёт, но на голову выше остальных конкурентов.

Так как моделька основана на Hunyuan Video, в квантизированном виде она запускается на 4090. К сожалению, работать быстро она там вряд-ли будет — дистиллированная в Phased Consistency Model версия модели выдаёт 6 FPS на гораздо более мощной H100. Но оптимизации инференса порой творят чудеса, так что посмотрим что с моделью натворят умельцы.

Genie 3 хорошо так поднял внимание к world models, у нас уже второй открытый релиз на этой неделе, хотя обычно в этой нише открытые релизы крайне редки. Интересно, как будет выглядеть первый успешный коммерческий продукт на основе таких моделей.

Веса
Код
Пейпер
Сайт проекта

@ai_newz
https://youtu.be/J_IvPcrTtdo

Мне понравился кейс использования языковой модели для Медицинских исследований. Вот что модель поняла просто из данных эксперимента и описание его текстового:

«Учёные показали, что если во время первой активации Т-клеток слегка «урезать» им доступ к глюкозе, они навсегда меняют характер — становятся больше похожи на воспалительные Th17-клетки. Этот метаболический «импринтинг» остаётся даже после того, как клетки 2 недели живут без препарата. Иными словами, судьбу иммунных клеток можно перепрограммировать буквально за первые часы активации, просто изменив условия питания».
🔥2
Классный инструмент, если вы любите разбираться в рекламе и продуктах на YouTube. Позволяет получить прямую ссылку на внезапно-появившуюся рекламу, чтобы сохранить ее, или поделиться...

сервис бесплатный, работает через copy-paste из youtube через кнопку "Copy Debug Info":
https://www.adgrabber.in
туалетные Стартапы в мире умной AI диагностики кала...

В отличие от разработок Стэнфорда (например, «smart toilet» профессора Санджива Гамбхира), Coprata — это стартап, основанный исследователями из университета Дьюка, а не Стэнфорда. Его сооснователями являются Соня Грего (Sonia Grego) и Брайан Стоунер (Brian Stoner), которые ранее работали в Duke Smart Toilet Lab. Технологии этой лаборатории лицензированы Coprata для коммерческого развития

девис компании Coprata:
"Stop flushing away valuable health data."
https://www.coprata.com/science

🔬 Функции:
Автоматический hands-free забор кала.
Анализ: цвет, форма, объём.
Возможность тестов на скрытую кровь, жиры, pH и даже микробиоту (заявлено как ключевая цель продукта).
Система рассчитана на ежедневный мониторинг ЖКТ, хронических заболеваний и раннее выявление рака кишечника.

🚀 Какие показатели можно отслеживать
Цвет и форма (диагностика запоров, диареи, кровотечений).
Скрытая кровь (ранний признак язвы, полипов, рака кишечника).
Жиры в стуле (проблемы с поджелудочной железой, желчью).
pH и состав микробиоты (грубая оценка состояния ЖКТ).
Объём и частота дефекаций.
Sheldon Axler - Linear Algebra Done Right - 2015.pdf
3.1 MB
🔹 Кострикин ("Введение в алгебру. Линейная алгебра", 1984)
Классический учебник в СССР, ориентирован на математиков.
Акцент: строгость, доказательства, абстрактные структуры (группы, кольца, поля → потом линейная алгебра).
Стиль: «алгебраическая школа», тяжёлый язык, мало геометрической интуиции.
Применения почти не рассматриваются.
👉 Подходит для тех, кто идёт в чистую математику.
🔹 Strang (Introduction to Linear Algebra)
Упор на интуицию, геометрию, вычисления.
Даёт инструменты для инженеров, программистов, data scientists.
Очень много примеров из реальной жизни: статистика, графы, оптимизация, изображения, сети.
Понятный стиль → поэтому MIT OCW лекции стали культовыми.
👉 Это лучший старт для ML/DL инженеров и прикладников.
🔹 Axler (Linear Algebra Done Right)
Более абстрактный, чем Strang, но проще и чище, чем Кострикин.
Акцент: теория векторных пространств и операторов (без «лишних вычислений»).
Очень любят в Штатах как второй учебник после Strang.
👉 Это уже уровень для исследователей в CS/ML.