171 subscribers
125 photos
47 videos
99 files
621 links
ALGORITHMS MACHINE LEARNING
Download Telegram
Включили поддержку формул в сообщениях

Обычно этой формулой только любуются, я бы хотел рассказать и доказательство

(лекция Ф.В. Петрова «Ряд плюс цепная дробь» на ЛШСМ-2024)

mathnet.ru/present43360
Знаменитая задача (базельская проблема) о сумме обратных квадратов решена молодым Леонардом Эйлером (Leonhard Euler) в 1734 году и названа в честь его родного города Базеля
Потом ее решали разными методами Коши Augustin Louis Cauchy, Риман (Bernhard Riemann) и другие титаны
Базельская проблема оказала влияние на развитие теории чисел и анализа

Остается наивный геометрический вопрос: а при чем тут Пи, отношение длины окружности к диаметру и возведено в квадрат?
Видео от 3dlue1brown дает остроумный ответ на эти вопросы, связывая ряд с интенсивностью света от серии лампочек
Это новое доказательство Базельской Проблемы красиво и понятно школьникам

https://youtu.be/d-o3eB9sfls?is=uVkLiz9JYcuqfrQz
С физикой — в путь,
С математикой — в суть
PrismML анонсировал самую крупную модель в мире для запуска на смартфоне

В представленной модели Bonsai 27.000.000.000 параметров
Обычно на телефоне такую модель не запустишь: в сыром 16-bit она будет занимать примерно 54GB, и даже если сжать ее до 4-bit, все равно будет около 18GB
На смартфон не поместится

Bonsai же, при своем внушительном размере, оптимизирован именно под локальный запуск
Модель основана на Qwen3.6-27B, но разрабочики использовали не обычное квантование AKA округление весов, а технику Quantization-Aware Training

Это значит, что веса не обрубали, а учили постепенно адаптироваться к дискретным значениям
Технически, на прямом проходе веса округляются до дискретных значений, и модель считает предсказание уже с ними, как в финальной сжатой версии
Но на обратном проходе градиенты вычисляются так, будто округления не было, и это позволяет модели получать осмысленный сигнал для обновления весов, несмотря на то что сами веса дискретны
То есть модель как бы сама подбирает, как масштабировать свои веса наилучшим образом

Собственно, благодаря такой инженерии, модель сохраняет свыше 90 % качества полноразмерной версии, и при этом занимает в 9–14 раз меньше памяти (см.метрики в таблице)

Для обычного квантования, которое съедает львиную долю качества, это просто феноменальные цифры

Есть тернарный вариант (веса −1, 0 или +1; занимает ~5.9GB) и классический 1-bit (3.9GB)

Второй легко укладывается в iPhone 17 Pro
Оба варианта мультимодальные
Контекст 262K токенов
Опенсорс под лицензией Apache 2.0, вот веса: huggingface.co/collections/prism-ml/bonsai-27b

CEO PrismML заявил, что ведет переговоры с Apple по поводу использования технологии стартапа в их устройствах
Аналитики из a16z свели данные по затратам на алгоритмы в компаниях и нарисовали вот такие интересные картинки

Если кратко, они посчитали, что в топ-1% компаниях распределения расходы на ANL-токены в расчете на одного сотрудника практически сравнялись с средней годовой зарплатой инженера

При этом за последнее время рост был экспоненциальным, так что при таком векторе развития к концу года инженеры уже будут сильно проигрывать LLMкам в зарплате
Oбещали, что будет наоборот

И это речь только про явные затраты
Если копнуть глубже, то оказывается, что помимо затрат на токенытакже генерирует множество новых рабочих мест: второй график показывает, что компании с высокой интенсивностью использования алгоритмы за 2 года после внедрения нарастили штат на +10.2 %, тогда как компании с низкими расходами на алгоритмы остались практически на месте, штат почти не изменился. (Но это всего лишь корреляция, которая может объясняться и другими факторами
Древняя математика почти всегда анонимна: расчёты дошли, а имена тех, кто их вывел, растворились
Поэтому надпись на стене в гватемальском Шультуне — случай редчайший

Комнату раскопали ещё в 2011 году, а разобрались только сейчас
Стены расписаны фигурами людей и иероглифами, между которыми втиснуты вычисления по календарям

По таким расчётам майя решали, когда короновать царя
Хизер Хёрст, археолог из колледжа Скидмор, и её коллеги считают, что здесь сидели писцы, делавшие кодексы в середине VIII века

Внимание притянул Текст 19: L-образная группа из одиннадцати иероглифов высотой 10 сантиметров
Первые девять кодируют календарь и астрономические циклы и здесь начинается красота

Формула построена вокруг цикла в 2920 дней
Число не случайное: в нём сходятся два независимых небесных ритма
Пять оборотов Венеры по 584 дня дают ровно 2.920
Восемь солнечных лет по 365 дней — тоже 2.920

Раз в восемь лет Венера и Солнце будто пожимают друг другу руки, и майя это поймали
А дальше автор связал те же 2.920 дней с виналем (20 дней), цолькином (священные 260), туном (360) и марсианскими годами по 780

А в конце текста нашлось то, чего в таких надписях не находили никогда
В предпоследнем иероглифе — оборот «так говорит»
В последнем — имя Сак Тан Ваш
В переводе, «Белогрудая лиса»
Первый математик-астроном майя, которого мы знаем поимённо: он подписал работу

Антрополог Херардо Альдана из Санта-Барбары считает подпись важнее формулы: раз математику подписывали, значит, математиков у майя ценили наравне с художниками
А Хёрст с коллегами ставят Сак Тан Ваша в один ряд с Архимедом, Птолемеем и аль-Хорезми

Основания есть: майя владели позиционной записью, продвинутой арифметикой, алгебраическими отношениями, отрицательными числами и множителями
Но геометрии у них так и не появилось
«Они не улавливают, что есть геометрия, которой можно моделировать затмения куда точнее, чем алгеброй», — говорит Альдана
Причину он видит в изоляции: греки взяли геометрию у египтян, исламский мир и Индия — у греков, Европа — у ислама
Идеи ходили по кругу
А у майя культура была одна
Глобальное рабочее пространство Баарса–Деана, теория интегрированной информации Джулио Тонони, теория свободной энергии Карла Фристона, гиперсетевая теория мозга — в обороте теорий сознания

Но нейросети реактивны, а сознание протяжённо во времени

Большая языковая модель сегодня — это система, которой дают стимул (промпт), она делает вывод и замолкает
Время между запросами для неё пусто

Человеческий мозг, наоборот, никогда «не выключается» между внешними стимулами

Поэтому говорить, что в нейросети «зародилось сознание», только потому, что мы нашли в ней констелляцию нейронов, похожую на часть теории глобального рабочего пространства, — некорректно
На уровне строгой науки это разные классы систем

Форма реализации и внутренние процессы не обязаны быть копией биологии

Следующий шаг — создание воплощённых систем с непрерывным восприятием и внутренней динамикой, которые уже не живут в режиме «вопрос–ответ»

Тогда вопрос о том, как это проверить, перестанет быть метафизикой и станет предметом инженерии
Robots that think ahead and act in real time

Robbyant introduced LingBot-VLA 2.0 is the first embodied-native foundation model, not fine-tuned from a video generator

Built from scratch for the physical world

- 93.6% success on bimanual tasks
- 150 Hz single-GPU inference
- 20 demos to generalize

Their in-context learning pipeline is very cool
Новая работа Google Research предлагает свое математическое объяснение этому и открывает код, полную статью

Авторы говорят, что креативность диффузионных моделей - не случайный побочный эффект, а математическое следствие того, как нейросети обучаются

Дело в том, что нейросети в принципе не в состоянии выучить скор-функцию идеально точно и с резкими перепадами

Вместо этого они выучивают её сглаженную версию

Благодаря этому между точками обучающих данных появляются плавные переходы - «мосты», по которым модель и генерирует новые, ранее не виданные примеры

То есть креативность - предсказуемое следствие того, как обучаются нейросети, а не случайность

И креативностью можно управлять
Модель Kimi K3 от Moonshot AI, превзошла Opus 4.8, но немного недотягивает до уровня GPT-5.6 и Fable 5

Kimi K3, обученная на 2.800.000.000.000 параметров и обладающая контекстом с 1.000.000 токенов, может обрабатывать изображения и видео
Ее стандартная функция — максимальный ризонинг
Обработка входящего 1.000.000 токенов стоит $3, а вывод — $15

Доступен новый режим K3 Swarm, позволяющий запускать несколько агентов для выполнения сложных задач

Вы можете протестировать режим чат-бота здесь или использовать Kimi K3 через API
Forwarded from ARI EDU GEN
Higgsfield Academy: курсы от режиссёров каннского AI-фильма

Higgsfield запустил Academy — школу для режиссёров

Курсы ведут режиссёры Hell Grind, их 95-минутный полный метр показывали в Каннах
Обещают отдать свой рабочий playbook целиком, в формате интерактивных курсов

Сейчас там доступно 2 курса:
Getting Started with Cinema Studio (Обзор их киностудии)
The AI Filmmaking Pipeline (рабочий процесс)

Курсы на английском
Cами видео-уроки ведут на YouTube-ссылки

Academy: https://higgsfield.ai/academy
Measuring Intelligence Beyond Human Scale
https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human

Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике»

Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы)

Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss

Когда возможности приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются

При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы

Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей

Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки

Для технических лидеров и исследователей эта работа предлагает сдвиг парадигмы в оценке LLM

Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга

Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга
Channel name was changed to «ARI AML»
Forwarded from ARI (НИИ Антропогенеза) (Chagin Oleg A.)
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agents-A1 Team, Shanghai Artificial Intelligence Laboratory
Paper: https://arxiv.org/abs/2606.30616
Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters
Code: https://github.com/InternScience/Agents-A1
Model: https://huggingface.co/InternScience/Agents-A1

Авторы представили Agents-A1 — агентную MoE-модель на 35.000.000.000 параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45.000 токенов

Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов

Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров

Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом

Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс)
Media is too big
VIEW IN TELEGRAM
Лекция Ричарда Фейнмана, в Корнелле в 1964 году, о том, почему природа отвечает только на языке математики
Каждая команда, заставляющая языковые модели рассуждать, упирается в эту стену

Нобелевская премия пришла через 11 месяцев
Кадры сохранились на киноплёнке и теперь лежат бесплатно на YouTube с небольшим количеством просмотров

Посмотрите раздел с доской ближе к середине
Он берёт один из законов Кеплера и перестраивает его с нуля, с обозначениями, которые поймёт 12-летний ребёнок

Без слайдов
Без жаргона
1 кусок мела