Forwarded from Data Secrets
Fable 5 опровергла известную гипотезу Якобиана
Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.
До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.
О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.
Math is solved?
Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.
До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.
О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.
Math is solved?
💯5👍1
Forwarded from Data Secrets
Такими новостями уже никого не удивишь, но GPT-5.6 опровергла еще одну известную гипотезу, которая была открыта 30 лет
Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости.
Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999.
Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом».
В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.
Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости.
Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999.
Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом».
В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.
🔥7🤔3👍1
Forwarded from Data Secrets
Kimi K3 взломала Redis, и на это ей потребовалось всего полчаса и 32 агента
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
☕️
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍1😁1
Forwarded from AI Product | Igor Akimov
Kimi K3 таки выложили в опенсорc
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн.
И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable".
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн.
И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable".
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
huggingface.co
moonshotai/Kimi-K3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥7👍1
Forwarded from gonzo-обзоры ML статей
Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой "бесплатный" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты.
Kimi K3: Open Frontier Intelligence
Kimi Team
Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
Блог: https://www.kimi.com/blog/kimi-k3
Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence
Код: https://github.com/MoonshotAI/Kimi-K3
Модель: https://huggingface.co/moonshotai/Kimi-K3
# TL;DR
ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов.
ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol.
Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов.
Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643
Kimi K3: Open Frontier Intelligence
Kimi Team
Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
Блог: https://www.kimi.com/blog/kimi-k3
Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence
Код: https://github.com/MoonshotAI/Kimi-K3
Модель: https://huggingface.co/moonshotai/Kimi-K3
# TL;DR
ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов.
ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol.
Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов.
Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643
GitHub
Kimi-K3/k3_tech_report.pdf at main · MoonshotAI/Kimi-K3
Open Frontier Intelligence. Contribute to MoonshotAI/Kimi-K3 development by creating an account on GitHub.
🔥4👍1
Forwarded from пароход ильи захарова
а вы тоже слушаете техно ремиксы на классику чтобы вайбкодить официальные документы
https://www.youtube.com/watch?v=PiYjWoAWLx4
https://www.youtube.com/watch?v=PiYjWoAWLx4
YouTube
DJ Sebastien - Танец маленьких лебедей (Extended Remix)
🔥2👍1😁1
Forwarded from Лера — и точка
Всенародная любовь к Дурову* — это очень сильный показатель, какие реальные герои у российского общества. Я убеждена, что попытка системы бороться с Дуровым является выстрелом себе в ногу.
В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность.
Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге.
Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни.
Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо.
Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN.
* внесен в перечень террористов
** иноагенты, террористы, аффилированные лица, запрещены на территории РФ
В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность.
Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге.
Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни.
Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо.
Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN.
* внесен в перечень террористов
** иноагенты, террористы, аффилированные лица, запрещены на территории РФ
💯4👍2🔥2
Forwarded from gonzo-обзоры ML статей
Снова про эмерджентность (https://t.me/gonzo_ML/1031). В работе прослеживают её до обнаружения паттернов разреженной маршрутизации внимания для конкретных задач.
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov
Статья: https://arxiv.org/abs/2606.25010
Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly
Код: N/A
Модель: N/A
# TL;DR
ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность.
ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных.
Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров.
Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov
Статья: https://arxiv.org/abs/2606.25010
Ревью: https://arxiviq.substack.com/p/emergent-capabilities-arise-randomly
Код: N/A
Модель: N/A
# TL;DR
ЧТО сделали: Авторы провели детальное исследование внутренних механизмов моделей (mechanistic study), которое показало, что внезапное, стохастическое появление прикладных способностей (downstream capabilities) у трансформеров в процессе обучения вызвано резким обнаружением паттернов разреженной маршрутизации внимания (sparse attention routing patterns), специфичных для конкретной задачи. Анализируя предобученные LLM и конструируя контролируемые синтетические задачи, они выделили длину контекста и разреженность паттернов как главные узкие горлышка (bottlenecks), ограничивающие этот процесс обучения, а также продемонстрировали, что альтернативные архитектуры или стратегии предварительного предобучения могут значительно ускорить эмерджентность.
ПОЧЕМУ это важно: Это исследование демистифицирует «эмерджентные способности», смещая парадигму от необъяснимого, зависящего от масштаба феномена или «иллюзии метрик» к конкретной проблеме оптимизационного поиска. Понимание того, что эмерджентность соответствует обнаружению разреженных цепей маршрутизации (routing circuits), открывает чёткий путь в обход дорогостоящего масштабирования «в лоб» (brute-force scaling). Вместо этого исследователи могут проектировать новые архитектуры, специализированные пайплайны синтетического предобучения или вводить оптимизационные баесы (optimization biases), которые сделают выучивание таких разреженных паттернов внимания крайне эффективным с точки зрения расхода данных.
Для практиков: Вместо бесконечного скейлинга моделей для достижения эмерджентности стоит сфокусироваться на предварительном предобучении (pre-pretraining) на структурированных синтетических датасетах (например, на языках Дика / Dyck) и использовать гибридные архитектуры, эффективные при позиционной маршрутизации (такие как MLP-Mixer), чтобы снизить оптимизационную сложность для трансформеров.
Искать эмерджентность тут: https://t.me/gonzo_ML_podcasts/4752
arXiv.org
Emergent Capabilities Arise Randomly from Learning Sparse...
Neural scaling laws for transformer language models predict smooth improvements in pretraining loss with increasing parameters, but downstream capabilities such as in-context learning are known to...
👍2
Forwarded from gonzo-обзоры ML статей
Хорошая, полезная работа. Лишний раз показывает, что оркестрация важна, и подводит под это математический фундамент.
Agentic Systems as Boosting Weak Reasoning Models
Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti
Paper: https://arxiv.org/abs/2605.14163
Review: https://arxiviq.substack.com/p/agentic-systems-as-boosting-weak
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили теоретический фреймворк, который формализует агентный поиск комитетом (committee search) как бустинг во время инференса (test-time boosting). Разделив задачу на отдельные компоненты — покрытие генератора (proposal coverage), локальную идентифицируемость (local identifiability), глубину прогресса (progress depth) и разнообразие (diversity), — они показали, что легковесную модель (GPT-5.4 nano) под управлением структурированной обвязки из критиков и компараторов можно заставить работать на уровне лучших коммерческих SOTA-моделей на бенчмарках по разработке ПО.
ПОЧЕМУ это важно: Эта работа смещает фокус масштабирования LLM с гигантского увеличения параметров моделей на программно-определяемые архитектуры инференса. Авторы математически доказывают, что способность генерировать решения не означает способность их валидировать. Таким образом, предел масштабирования во время инференса ограничен «слепыми зонами» базовой модели-генератора, а не неэффективностью выбора.
Для практиков: Вместо того чтобы тратить миллионы на файнтюнинг огромных моделей, можно использовать ансамбли из дешёвых и быстрых моделей-генераторов, обёрнутых в строгие каскады критиков и попарных компараторов. Главное — убедиться, что у базовой модели в принципе есть ненулевая вероятность сгенерировать правильный ответ (хотя бы в одном из
Ансамблировать и оркестрировать тут: https://t.me/gonzo_ML_podcasts/3739
Agentic Systems as Boosting Weak Reasoning Models
Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti
Paper: https://arxiv.org/abs/2605.14163
Review: https://arxiviq.substack.com/p/agentic-systems-as-boosting-weak
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили теоретический фреймворк, который формализует агентный поиск комитетом (committee search) как бустинг во время инференса (test-time boosting). Разделив задачу на отдельные компоненты — покрытие генератора (proposal coverage), локальную идентифицируемость (local identifiability), глубину прогресса (progress depth) и разнообразие (diversity), — они показали, что легковесную модель (GPT-5.4 nano) под управлением структурированной обвязки из критиков и компараторов можно заставить работать на уровне лучших коммерческих SOTA-моделей на бенчмарках по разработке ПО.
ПОЧЕМУ это важно: Эта работа смещает фокус масштабирования LLM с гигантского увеличения параметров моделей на программно-определяемые архитектуры инференса. Авторы математически доказывают, что способность генерировать решения не означает способность их валидировать. Таким образом, предел масштабирования во время инференса ограничен «слепыми зонами» базовой модели-генератора, а не неэффективностью выбора.
Для практиков: Вместо того чтобы тратить миллионы на файнтюнинг огромных моделей, можно использовать ансамбли из дешёвых и быстрых моделей-генераторов, обёрнутых в строгие каскады критиков и попарных компараторов. Главное — убедиться, что у базовой модели в принципе есть ненулевая вероятность сгенерировать правильный ответ (хотя бы в одном из
k сэмплов), и предоставить системе надёжные внешние сигналы валидации (тесты, линтеры).Ансамблировать и оркестрировать тут: https://t.me/gonzo_ML_podcasts/3739
arXiv.org
Agentic Systems as Boosting Weak Reasoning Models
Can a committee of weak reasoning-model calls reach the performance of much stronger models? We study verifier-backed committee search as inference-time boosting for reasoning language models. The...
👍2
Forwarded from Love. Death. Transformers.
Все модели думают одно и тоже ( и учат одно и тоже)
- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.
arxiv.org/abs/2507.01098
- взяли разные данные
- разные модели
Обучили через SGD и показали что учится одно и тоже с точностью до вращения.
arxiv.org/abs/2507.01098
arXiv.org
Proof of a perfect platonic representation hypothesis
In this note, we elaborate on and explain in detail the proof given by Ziyin et al. (2025) of the ``perfect" Platonic Representation Hypothesis (PRH) for the embedded deep linear network model...
Forwarded from Вайб-кодинг
На первое место в трендах GitHub вышел OpenSandbox — платформа песочниц для ИИ-агентов от Alibaba.
Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.
Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.
100% опенсорс😋
Она позволяет поднимать изолированные окружения, в которых агенты могут запускать код, работать с вебом или управлять рабочим столом. OpenSandbox не привязан к Python, официальные SDK доступны для Python, Java/Kotlin, TypeScript, C# и Go. Также есть CLI и MCP-сервер для Claude Code и Cursor.
Для изоляции поддерживаются gVisor, Kata Containers и Firecracker microVM, а запускать всё это можно как локально через Docker, так и в более масштабной инфраструктуре.
100% опенсорс
Please open Telegram to view this post
VIEW IN TELEGRAM