Forwarded from Machinelearning
Команда Claude Code опубликовала в X руководство по loops. Это паттерны, в которых агент повторяет рабочий цикл, пока не сработает условие остановки.
Главная мысль: уходить от ручного режима, где разработчик задаёт направление на каждом шаге, и передавать агенту контроль по нарастающей.
Всего выделяют 4 типа циклов, различая их по способу запуска, условию остановки и степени автономии. Логически получается некая лестница делегирования, где на каждой ступени вы отдаёте агенту очередное полномочие.
Здесь вы отдаёте агенту проверку. Ручные шаги верификации заполняются в
SKILL.md и чем более количественные критерии, тем точнее агент оценивает собственную работу./goal забирает у вас условие прерыванияВы описываете, что значит готово, а дальше при каждой попытке Claude завершить работу отдельная модель-оценщик сверяет результат с вашим критерием (скажем, долей пройденных тестов) и возвращает агента к работе, пока цель не достигнута или не исчерпан заданный лимит попыток.
/loop или /schedule берёт на себя триггер запуска.Это удобно для повторяющейся рутины и при работе с внешними системами (например, дайджест по таскам, реакция на новое ревью или упавший CI).
Рутина срабатывает по событию или расписанию и живёт, пока вы её не выключите. В связке с динамическими воркфлоу агенту передаётся уже сам промпт. Вот этот сценарий уже ближе всего к полной автоматизации.
Не каждая задача требует сложного цикла, начинать стоит с простейшего решения.
Кодовую базу следует держать чистой, а для ревью подключать второй агент. Для этого есть встроенный /code-review.
Контролировать расход токенов чёткими границами: точные условия остановки, подбор модели под задачу (рутину - на модели поменьше и побыстрее, решения с ризонингом - на самой мощной).
Динамические воркфлоу способны породить сотни агентов, так что масштаб лучше проверять на небольшой выборке.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Forwarded from Василий Тополев
Журналисты позвонили владельцу заправки в Новосибирской области, вдвое повысившему цены. Бизнесмен, представившийся как "Слепой", пояснил, что это его земля и топливо, а значит, правила устанавливает сам, будут жаловаться - он ещё выше поставит, а если снизить цену, то бензин разберут за полдня. И вообще может закрыть точку в любой момент.
1.1. Давайте предположим, что сейчас реальная равновесная цена 92-го в стране - 100 или 120 рублей. Такой она была бы, если бы заправки крупных нефтяных компаний не пытались морозить цены. Что это означает? Что бензин могут покупать только сравнительно богатые и те, кому бензин очень нужен. Первая и вторая категории тесно пересекаются. В любом обществе, и в нашем тем более, среди богатых найдётся множество "социальных паразитов" - тех, кто наворовал, кто получил богатое наследство и ничего не делает, и так далее. Но в среднем люди с более высокой продуктивностью имеют более высокие доходы.
Представьте начальника важного отдела в крупной компании, который работает допоздна. Он много зарабатывает, и готов много заплатить за возможность быстро заправиться. Его отсутствие на работе может парализовать работу всего отдела и даже всей компании. И представьте деда-пенсионера, который на своей девятке едет на рыбалку. Рост цен на бензин заставит его поменять планы и провести день дома. Можно посочувствовать деду - он ни в чём не виноват, но никто кроме него самого от этого не пострадает.
1.2. Высокие цены создают мощный стимул увеличивать предложение бензина. Владельцы НПЗ будут всеми силами ремонтировать свои заводы, даже если будут знать, что вскоре после ремонта в них снова прилетит: один месяц работы уже даст такую прибыль, которая компенсирует все расходы на ремонт. Те же владельцы будут вкладываться в создание ПВО для своих заводов. Владельцы мелких НПЗ - "чайников" - будут всеми силами наращивать выпуск и пытаться создать новые мощности. Нефтеторговцы облазят весь мир в поисках партий бензина, которые можно привезти в обход санкций.
Побочным эффектом будет появление огромных сверхприбылей не у тех, кто умеет лучше организовывать производство, а у тех, кому просто повезло. НПЗ был сравнительно слабо повреждён, например. Или вообще находится вне зоны досягаемости дронов. (К сожалению, к востоку от Омска располагается всего четыре крупных нефтеперерабатывающих завода, общая мощность которых составляет около 10% от общероссийской). Гипотетически эти сверхприбыли, никак не связанные с действиями владельцев, можно частично изъять за счёт windfall tax - налога на внезапную прибыль.
Высокие цены на бензин - это очень, очень неприятно, особенно если бензин должны покупать вы лично. Но ничего катастрофичного в них нет. В большинстве стран мира 95-й бензин стоит больше 100 рублей (в некоторых под 200 и даже выше).
2.1. Рассмотрим очереди, вызванные попытками сохранять цены на прежнем уровне на заправках крупных нефтяных компаний. Высокая цена отсекает тех, кому бензин не особо нужен, и тех, у кого мало денег; очередь же является могучим средством перераспределения благ в пользу тех, кто мало ценит своё время. Это не значит, что в очереди стоят только бездельники - напротив, те, кому позарез нужен бензин, будут стоять в ней волей-неволей. Но давайте вспомним наш пример с дедом. Для него постоять в очереди - интересный способ провести время: можно пообщаться, обсудить новости, узнать, кто же виноват - Ротшильды или Рокфеллеры (а может, таинственные Барухи?) Время у деда бесплатное. А вот руководитель отдела скорее будет искать барыг, которые получают бензин благодаря обману или взяткам работникам нефтебаз. Он купит бензин уже по 200 за литр. Очередь, пожирающая самый ценный ресурс в мире - человеческое время, является мощнейшим инструментом перераспределения от более продуктивных членов общества к менее продуктивным.
2.2. Дополнительный эффект очереди - в ней самой сжигается бешеное количество топлива.
2.3. И, конечно, если пытаться сохранять цены на прежнем уровне, у владельцев нефтепереработки не появляется никаких стимулов в авральном порядке восстанавливать или расширять производство.
3.1. А что если бензин рационировать, то есть распределять по карточкам (QR-кодам в замечательном мессенджера Макс?) Ведь это ликвидирует очереди.
В войну по карточкам распределяли хлеб. Хлеб был нужен абсолютно всем. В брежневскую эпоху перед Новым годом всем раздавали продуктовый набор с чудным дефицитным фруктом - мандаринами. Мандарины на стол хотели все. В позднесоветские годы по карточкам начали распределять мясо. Мясо хотелось всем.
Но никому в советское время не приходило в голову распределять по карточкам рояли. Типа, раз в десять лет каждый имеет право купить рояль. Абсолютному большинству, 99% населения, рояль не нужен, и ставить его некуда.
Кто-то использует автомобиль, чтобы на выходные ездить на дачу. Кто-то не вылезает из авто весь день - ездит по деловым встречам, выезжает выполнять работы (сантехник или электрик). Кто-то ежедневно ездит из пригорода в центр на работу. У кого-то работа связана с междугородними поездками. Что будет, если раздавать бензин всем в одинаковом количестве? Чёрный рынок. Причём сложно устроенный: перекупам надо будет договариваться с массой мелких автовладельцев, чтобы они заправлялись, а потом сливали бензин.
3.2. Как и в случае с очередями, попытки заморозить цены при помощи карточек не создают мощных стимулов к увеличению предложения бензина.
4.1. Но если отпустить бензиновые цены - начнётся инфляция, ведь так? Это магическое мышление. Инфляция - это, в конечном счёте, снижение полезности денег. Если нельзя купить бензин в обмен на деньги, их ценность снижается гораздо сильнее, чем если бензин просто дорожает.
Кроме того, если раньше люди покупали X тонн бензина в день, а теперь покупают, к примеру, 0,6X по прежней цене (те, кто смог отстоять очередь), у них остаётся больше денег. Эти деньги они потратят на другие товары и услуги. Рост цен переносится из одной области во все другие области, попутно создаётся чудовищную неэффективность.
4.2. Самый яркий пример магии в головах - это то, что Сергей Вакуленко формулирует как "если бензин подорожает на 10%, молоко подорожает вдвое". Люди говорят: "топливо требуется на всех этапах производства" - и искренне думают, что сказали что-то очень умное. Волшебным образом издержки не суммируются, а перемножаются.
В прошлом году российский бизнес потребил примерно 10 млн тонн бензина, стоимость которого составила примерно 0,4% ВВП. (Дизеля потребили намного больше, но цены на него растут не так сильно). В каких-то ценах доля бензина выше, и они могут заметно измениться. Большинство товаров и услуг от бензина практически не зависят.
Что действительно может повлиять на цены - так это обрывы в логистике, связанные с невозможностью вовремя заправиться из-за многочасовых очередей.
4.3. Есть просвещённый аргумент в пользу ограничения цен на бензин: инфляционные ожидания. Людям проще всего отслеживать изменения общего уровня цен по изменениям цены на бензин. Нам сложно вспомнить, по какой цене мы покупали молоко или гречку на прошлой неделе. Квартиры, автомобили, бытовую технику покупают раз в несколько лет или несколько десятилетий. Но бензин люди покупают каждый день - и по ценам на бензин формирует свои инфляционные ожидания. А эти ожидания являются классическим примером самосбывающегося пророчества: все ждут роста цен - цены вырастут.
Выглядит убедительно. Но не работает. Отдельных работ по России я не знаю, а в США исследователи применили все возможные методики. Редкий случай консенсуса (ну почти консенсуса) среди экономистов: бензин не вносит аномального вклада в инфляционные ожидания. Вот свежие статьи: раз, два, три, четыре. Русские автомобилисты не глупее американских.
В Штатах на ярмарках есть такая забава: оценивать по внешнему виду вес быка-чемпиона. Тот, чья оценка будет ближе всего к истине, выигрывает. Часто среднее значение, полученное из всех оценок, оказывается точнее любой отдельной оценки. Люди ошибаются, но агрегирование ошибок создаёт чудо распределённой информации, лежащее в основе механизма рыночных цен.
...
Такие дела.
1.1. Давайте предположим, что сейчас реальная равновесная цена 92-го в стране - 100 или 120 рублей. Такой она была бы, если бы заправки крупных нефтяных компаний не пытались морозить цены. Что это означает? Что бензин могут покупать только сравнительно богатые и те, кому бензин очень нужен. Первая и вторая категории тесно пересекаются. В любом обществе, и в нашем тем более, среди богатых найдётся множество "социальных паразитов" - тех, кто наворовал, кто получил богатое наследство и ничего не делает, и так далее. Но в среднем люди с более высокой продуктивностью имеют более высокие доходы.
Представьте начальника важного отдела в крупной компании, который работает допоздна. Он много зарабатывает, и готов много заплатить за возможность быстро заправиться. Его отсутствие на работе может парализовать работу всего отдела и даже всей компании. И представьте деда-пенсионера, который на своей девятке едет на рыбалку. Рост цен на бензин заставит его поменять планы и провести день дома. Можно посочувствовать деду - он ни в чём не виноват, но никто кроме него самого от этого не пострадает.
1.2. Высокие цены создают мощный стимул увеличивать предложение бензина. Владельцы НПЗ будут всеми силами ремонтировать свои заводы, даже если будут знать, что вскоре после ремонта в них снова прилетит: один месяц работы уже даст такую прибыль, которая компенсирует все расходы на ремонт. Те же владельцы будут вкладываться в создание ПВО для своих заводов. Владельцы мелких НПЗ - "чайников" - будут всеми силами наращивать выпуск и пытаться создать новые мощности. Нефтеторговцы облазят весь мир в поисках партий бензина, которые можно привезти в обход санкций.
Побочным эффектом будет появление огромных сверхприбылей не у тех, кто умеет лучше организовывать производство, а у тех, кому просто повезло. НПЗ был сравнительно слабо повреждён, например. Или вообще находится вне зоны досягаемости дронов. (К сожалению, к востоку от Омска располагается всего четыре крупных нефтеперерабатывающих завода, общая мощность которых составляет около 10% от общероссийской). Гипотетически эти сверхприбыли, никак не связанные с действиями владельцев, можно частично изъять за счёт windfall tax - налога на внезапную прибыль.
Высокие цены на бензин - это очень, очень неприятно, особенно если бензин должны покупать вы лично. Но ничего катастрофичного в них нет. В большинстве стран мира 95-й бензин стоит больше 100 рублей (в некоторых под 200 и даже выше).
2.1. Рассмотрим очереди, вызванные попытками сохранять цены на прежнем уровне на заправках крупных нефтяных компаний. Высокая цена отсекает тех, кому бензин не особо нужен, и тех, у кого мало денег; очередь же является могучим средством перераспределения благ в пользу тех, кто мало ценит своё время. Это не значит, что в очереди стоят только бездельники - напротив, те, кому позарез нужен бензин, будут стоять в ней волей-неволей. Но давайте вспомним наш пример с дедом. Для него постоять в очереди - интересный способ провести время: можно пообщаться, обсудить новости, узнать, кто же виноват - Ротшильды или Рокфеллеры (а может, таинственные Барухи?) Время у деда бесплатное. А вот руководитель отдела скорее будет искать барыг, которые получают бензин благодаря обману или взяткам работникам нефтебаз. Он купит бензин уже по 200 за литр. Очередь, пожирающая самый ценный ресурс в мире - человеческое время, является мощнейшим инструментом перераспределения от более продуктивных членов общества к менее продуктивным.
2.2. Дополнительный эффект очереди - в ней самой сжигается бешеное количество топлива.
2.3. И, конечно, если пытаться сохранять цены на прежнем уровне, у владельцев нефтепереработки не появляется никаких стимулов в авральном порядке восстанавливать или расширять производство.
3.1. А что если бензин рационировать, то есть распределять по карточкам (QR-кодам в замечательном мессенджера Макс?) Ведь это ликвидирует очереди.
В войну по карточкам распределяли хлеб. Хлеб был нужен абсолютно всем. В брежневскую эпоху перед Новым годом всем раздавали продуктовый набор с чудным дефицитным фруктом - мандаринами. Мандарины на стол хотели все. В позднесоветские годы по карточкам начали распределять мясо. Мясо хотелось всем.
Но никому в советское время не приходило в голову распределять по карточкам рояли. Типа, раз в десять лет каждый имеет право купить рояль. Абсолютному большинству, 99% населения, рояль не нужен, и ставить его некуда.
Кто-то использует автомобиль, чтобы на выходные ездить на дачу. Кто-то не вылезает из авто весь день - ездит по деловым встречам, выезжает выполнять работы (сантехник или электрик). Кто-то ежедневно ездит из пригорода в центр на работу. У кого-то работа связана с междугородними поездками. Что будет, если раздавать бензин всем в одинаковом количестве? Чёрный рынок. Причём сложно устроенный: перекупам надо будет договариваться с массой мелких автовладельцев, чтобы они заправлялись, а потом сливали бензин.
3.2. Как и в случае с очередями, попытки заморозить цены при помощи карточек не создают мощных стимулов к увеличению предложения бензина.
4.1. Но если отпустить бензиновые цены - начнётся инфляция, ведь так? Это магическое мышление. Инфляция - это, в конечном счёте, снижение полезности денег. Если нельзя купить бензин в обмен на деньги, их ценность снижается гораздо сильнее, чем если бензин просто дорожает.
Кроме того, если раньше люди покупали X тонн бензина в день, а теперь покупают, к примеру, 0,6X по прежней цене (те, кто смог отстоять очередь), у них остаётся больше денег. Эти деньги они потратят на другие товары и услуги. Рост цен переносится из одной области во все другие области, попутно создаётся чудовищную неэффективность.
4.2. Самый яркий пример магии в головах - это то, что Сергей Вакуленко формулирует как "если бензин подорожает на 10%, молоко подорожает вдвое". Люди говорят: "топливо требуется на всех этапах производства" - и искренне думают, что сказали что-то очень умное. Волшебным образом издержки не суммируются, а перемножаются.
В прошлом году российский бизнес потребил примерно 10 млн тонн бензина, стоимость которого составила примерно 0,4% ВВП. (Дизеля потребили намного больше, но цены на него растут не так сильно). В каких-то ценах доля бензина выше, и они могут заметно измениться. Большинство товаров и услуг от бензина практически не зависят.
Что действительно может повлиять на цены - так это обрывы в логистике, связанные с невозможностью вовремя заправиться из-за многочасовых очередей.
4.3. Есть просвещённый аргумент в пользу ограничения цен на бензин: инфляционные ожидания. Людям проще всего отслеживать изменения общего уровня цен по изменениям цены на бензин. Нам сложно вспомнить, по какой цене мы покупали молоко или гречку на прошлой неделе. Квартиры, автомобили, бытовую технику покупают раз в несколько лет или несколько десятилетий. Но бензин люди покупают каждый день - и по ценам на бензин формирует свои инфляционные ожидания. А эти ожидания являются классическим примером самосбывающегося пророчества: все ждут роста цен - цены вырастут.
Выглядит убедительно. Но не работает. Отдельных работ по России я не знаю, а в США исследователи применили все возможные методики. Редкий случай консенсуса (ну почти консенсуса) среди экономистов: бензин не вносит аномального вклада в инфляционные ожидания. Вот свежие статьи: раз, два, три, четыре. Русские автомобилисты не глупее американских.
В Штатах на ярмарках есть такая забава: оценивать по внешнему виду вес быка-чемпиона. Тот, чья оценка будет ближе всего к истине, выигрывает. Часто среднее значение, полученное из всех оценок, оказывается точнее любой отдельной оценки. Люди ошибаются, но агрегирование ошибок создаёт чудо распределённой информации, лежащее в основе механизма рыночных цен.
...
Такие дела.
👍3
Forwarded from gonzo-обзоры ML статей
Интересная работа. Я её разбирал в англоязычном блоге год назад, но сюда кажется так и не запостил. Работа же дошла за это время до ICML.
Интересны для меня в ней по крайней мере три момента:
1. Оценена "ёмкость" каждого веса, сколько он добавляет к памяти — примерно 3.6 бита на параметр. Что отдельно интересно, что fp32 по сравнению с bf16 не очень много добавляет, 3.83 против 3.51, не в два раза.
2. Работа очень хорошо подтверждает теорию информационного боттлнека им. Нафтали Тишби, что у модели есть в обучении две фазы — в первой она всё запоминает что может, во второй ей приходится сжимать ибо уже не лезет. Неожиданно, это та самая точка, где наблюдается double descent.
3. Если отношение токенов к параметрам больше 100, то это статистически гарантирует невозможность membership inference атаки.
How much can language models memorize?
John X. Morris, Chawin Sitawarin, Chuan Guo, Narine Kokhlikyan, G. Edward Suh, Alexander M. Rush, Kamalika Chaudhuri, Saeed Mahloujifar
Paper: https://arxiv.org/abs/2505.24832, ICML Submission, ICLR Submission
Review: https://arxiviq.substack.com/p/icml-2026-how-much-can-language-models
Code: N/A
Model: https://huggingface.co/rhysjones/gpt2-774M-fineweb-150B
ICML 2026 Outstanding Paper Honorable Mention
# TL;DR
ЧТО сделали: Авторы разработали информационно-теоретический фреймворк на базе колмогоровской сложности, который позволяет строго отделить непреднамеренное запоминание от обобщения. Обучив и протестировав сотни моделей архитектуры GPT на синтетических и реальных данных, они оценили эмпирическую ёмкость памяти трансформеров примерно в 3.6 бита на параметр и вывели сигмоидальный закон масштабирования для атак восстановления членства (membership inference).
ПОЧЕМУ это важно: Эта работа даёт строгое физическое объяснение феномену двойного спуска (double descent). Она доказывает, что обобщение математически неизбежно, когда объём датасета в битах превышает ёмкость памяти модели. Кроме того, исследование показывает, что современные LLM, обученные на гигантских массивах данных, математически защищены от атак восстановления членства: вероятность успеха таких атак падает до уровня случайного угадывания, как только соотношение токенов и параметров превышает
Для практиков: Полученные оценки ёмкости позволяют проектировать пайплайны обучения с гарантированной защитой от утечки данных. Теперь можно математически рассчитать размер модели и объём обучающей выборки так, чтобы полностью исключить возможность извлечения конфиденциальных тренировочных примеров.
Считать информацию тут: https://t.me/gonzo_ML_podcasts/4418
Интересны для меня в ней по крайней мере три момента:
1. Оценена "ёмкость" каждого веса, сколько он добавляет к памяти — примерно 3.6 бита на параметр. Что отдельно интересно, что fp32 по сравнению с bf16 не очень много добавляет, 3.83 против 3.51, не в два раза.
2. Работа очень хорошо подтверждает теорию информационного боттлнека им. Нафтали Тишби, что у модели есть в обучении две фазы — в первой она всё запоминает что может, во второй ей приходится сжимать ибо уже не лезет. Неожиданно, это та самая точка, где наблюдается double descent.
3. Если отношение токенов к параметрам больше 100, то это статистически гарантирует невозможность membership inference атаки.
How much can language models memorize?
John X. Morris, Chawin Sitawarin, Chuan Guo, Narine Kokhlikyan, G. Edward Suh, Alexander M. Rush, Kamalika Chaudhuri, Saeed Mahloujifar
Paper: https://arxiv.org/abs/2505.24832, ICML Submission, ICLR Submission
Review: https://arxiviq.substack.com/p/icml-2026-how-much-can-language-models
Code: N/A
Model: https://huggingface.co/rhysjones/gpt2-774M-fineweb-150B
ICML 2026 Outstanding Paper Honorable Mention
# TL;DR
ЧТО сделали: Авторы разработали информационно-теоретический фреймворк на базе колмогоровской сложности, который позволяет строго отделить непреднамеренное запоминание от обобщения. Обучив и протестировав сотни моделей архитектуры GPT на синтетических и реальных данных, они оценили эмпирическую ёмкость памяти трансформеров примерно в 3.6 бита на параметр и вывели сигмоидальный закон масштабирования для атак восстановления членства (membership inference).
ПОЧЕМУ это важно: Эта работа даёт строгое физическое объяснение феномену двойного спуска (double descent). Она доказывает, что обобщение математически неизбежно, когда объём датасета в битах превышает ёмкость памяти модели. Кроме того, исследование показывает, что современные LLM, обученные на гигантских массивах данных, математически защищены от атак восстановления членства: вероятность успеха таких атак падает до уровня случайного угадывания, как только соотношение токенов и параметров превышает
10^2.Для практиков: Полученные оценки ёмкости позволяют проектировать пайплайны обучения с гарантированной защитой от утечки данных. Теперь можно математически рассчитать размер модели и объём обучающей выборки так, чтобы полностью исключить возможность извлечения конфиденциальных тренировочных примеров.
Считать информацию тут: https://t.me/gonzo_ML_podcasts/4418
arXiv.org
How much do language models memorize?
We propose a new method for estimating how much a model knows about a datapoint and use it to measure the capacity of modern language models. Prior studies of language model memorization have...
Forwarded from from:adam
У меня очень долго были плохие отношения с отпусками: брал редко, между поездками мог пройти год, а отдых был не vacation, а workation сводившийся к смене локации с ответами в рабочие чаты. Сейчас стало лучше: чаще хожу, на работу не отвлекаюсь. Решил разобраться, что об этом говорит наука. Для многих это банальные вещи, но мне мозги прочистило хорошо. Вот основное:
1. Восстановление — это пирамида восстановления, а не редкие события в жизни. Отпуск не чинит плохой режим и work/life balance. Вечера без работы → нормальные выходные → отпуск. Эффект отпуска выветривается за ~3 недели, а будни с нами остаются весь год.
2. Несколько коротких поездок лучше одной длинной. Память не вознаграждает за длительность, а длинный отпуск даёт больший пик, но падает быстрее. При этом годовой объём резать нельзя 1 2. Японцы, к примеру, при 12 днях отпуска реже всех чувствуют нехватку отдыха (опрос Expedia) — предположительно за счёт частых коротких поездок.
3. Планировать отпуск лучше заранее. Предвкушение работает, как отдельный источник счастья. Работает именно конкретика (даты, билеты, жильё), а «летом куда-нибудь». В идеале даже закончить один отпуск и иметь сразу следующий забуканый.
4. Полное отключение от работы — самый важный фактор, второй — физическая активность. «Только гляну почту» не даёт частичный отдых, а подтачивает механизм целиком — работа из отпуска ухудшает самочувствие после него. А вот популярное «смена деятельности = отдых» не работает: освоение новых навыков в отпуске значимого эффекта на восстановление не даёт. Трудоголикам тяжелее отключиться — им нужен отпуск длиннее и связь с работой, недоступная физически.
5. Отпуск не нужно превращать в проект с жестким расписанием досуга. Это делает его похожим на работу. Работает скелет: жильё, переезды, 1–2 якоря на день (локация, рестики, музеи и тд). Остальное оставлять пустотой, которую не надо оптимизировать.
6. Память о поездке определяется отсутствием провалов, а не яркими пиками. Часто людям кажется, что, воспоминание держится на ярком финале, но на многодневных событиях правило не работает: оценку определяет среднее по всем дням, а провалы весят больше пиков. К концу поездки настроение естественно снижается — тем важнее не ставить в конец какой-нибудь логистический ад, ибо испортит воспоминание сильнее, чем компенсирует любой вау эффект.
7. Нужен буфер с обеих концов отпуска. Перед вылетом — день свободы между работой и поездкой. Предотпускная неделя — пик стресса, иначе первые дни уйдут на разгрузку того, что привез с собой в поездку. При смене часовых поясов первые 1–2 дня — не для требовательных планов. После отпуска же требуется протекция первой недели, ибо эффект сгорает не от того, как прошёл отдых, а от того, во что человек возвращается. Оптимально: прилёт за день до выхода, первые 2–3 дня без встреч (ставить блокеры в календарь еще до отъезда), без дедлайнов на первую неделю.
8. Поездку стоит переработать в память. Возвращение к позитивному опыту — работающая интервенция. У меня, к примеру, это обработка фотографий с отпуска в лайтруме, к которой я периодически возращаюсь после поездки.
1. Восстановление — это пирамида восстановления, а не редкие события в жизни. Отпуск не чинит плохой режим и work/life balance. Вечера без работы → нормальные выходные → отпуск. Эффект отпуска выветривается за ~3 недели, а будни с нами остаются весь год.
2. Несколько коротких поездок лучше одной длинной. Память не вознаграждает за длительность, а длинный отпуск даёт больший пик, но падает быстрее. При этом годовой объём резать нельзя 1 2. Японцы, к примеру, при 12 днях отпуска реже всех чувствуют нехватку отдыха (опрос Expedia) — предположительно за счёт частых коротких поездок.
3. Планировать отпуск лучше заранее. Предвкушение работает, как отдельный источник счастья. Работает именно конкретика (даты, билеты, жильё), а «летом куда-нибудь». В идеале даже закончить один отпуск и иметь сразу следующий забуканый.
4. Полное отключение от работы — самый важный фактор, второй — физическая активность. «Только гляну почту» не даёт частичный отдых, а подтачивает механизм целиком — работа из отпуска ухудшает самочувствие после него. А вот популярное «смена деятельности = отдых» не работает: освоение новых навыков в отпуске значимого эффекта на восстановление не даёт. Трудоголикам тяжелее отключиться — им нужен отпуск длиннее и связь с работой, недоступная физически.
5. Отпуск не нужно превращать в проект с жестким расписанием досуга. Это делает его похожим на работу. Работает скелет: жильё, переезды, 1–2 якоря на день (локация, рестики, музеи и тд). Остальное оставлять пустотой, которую не надо оптимизировать.
6. Память о поездке определяется отсутствием провалов, а не яркими пиками. Часто людям кажется, что, воспоминание держится на ярком финале, но на многодневных событиях правило не работает: оценку определяет среднее по всем дням, а провалы весят больше пиков. К концу поездки настроение естественно снижается — тем важнее не ставить в конец какой-нибудь логистический ад, ибо испортит воспоминание сильнее, чем компенсирует любой вау эффект.
7. Нужен буфер с обеих концов отпуска. Перед вылетом — день свободы между работой и поездкой. Предотпускная неделя — пик стресса, иначе первые дни уйдут на разгрузку того, что привез с собой в поездку. При смене часовых поясов первые 1–2 дня — не для требовательных планов. После отпуска же требуется протекция первой недели, ибо эффект сгорает не от того, как прошёл отдых, а от того, во что человек возвращается. Оптимально: прилёт за день до выхода, первые 2–3 дня без встреч (ставить блокеры в календарь еще до отъезда), без дедлайнов на первую неделю.
8. Поездку стоит переработать в память. Возвращение к позитивному опыту — работающая интервенция. У меня, к примеру, это обработка фотографий с отпуска в лайтруме, к которой я периодически возращаюсь после поездки.
👍5🔥1
Forwarded from Адель и МЛь
Насколько же сильно меняется работа, когда есть ИИ агенты.
Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.
Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.
Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.
По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”
Прогресс, как это часто бывает, выглядит немного несправедливо.
И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.
До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷♂️
Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.
Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.
Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.
По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”
Прогресс, как это часто бывает, выглядит немного несправедливо.
И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.
До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷♂️
🔥4👍2
Forwarded from Наука и университеты
#Прямая_речь
Учитель истории московской гимназии № 1543, заслуженный учитель РФ Леонид Кацва по поводу отказов зачислить школьников в 10-й класс:
Учитель истории московской гимназии № 1543, заслуженный учитель РФ Леонид Кацва по поводу отказов зачислить школьников в 10-й класс:
«Наши школьники привыкли к тому, что можно не учиться и переходить из класса в класс: «тройка» устроит, а «двойку» не поставят, и можно продолжать готовить три предмета. С моей точки зрения, в школах у нас достаточно детей, которые должны заканчивать образование в 9-м классе, если не раньше, и переходить в те учебные заведения, где главное внимание будет уделяться подготовке к профессии. Я никакой трагедии в том, что в 10-й класс стали принимать довольно жестко, не вижу».
👍10🤔2👎1🔥1💯1
Forwarded from Гусь Василий под тополем
https://t.me/sergeyvakulenko/228
То, о чём я писал недавно, но в развёрнутой форме, и от признанного отраслевого специалиста. Замечу только, что 3,7% от ВВП - это все расходы всех экономических агентов на все виды топлива. Если брать расходы только бизнеса только на бензин, доля будет почти в десять раз меньше.
Ну и главное. Настоящую угрозу существенного всплеска инфляции представляет не рост цен на 30-40 рублей за литр, а обрывы логистики, связанные с очередями и рационированием (карточки). Молоко действительно может подорожать вдвое, если молоковозы не смогут вовремя заправляться, и молоко будет скисать.
То, о чём я писал недавно, но в развёрнутой форме, и от признанного отраслевого специалиста. Замечу только, что 3,7% от ВВП - это все расходы всех экономических агентов на все виды топлива. Если брать расходы только бизнеса только на бензин, доля будет почти в десять раз меньше.
Ну и главное. Настоящую угрозу существенного всплеска инфляции представляет не рост цен на 30-40 рублей за литр, а обрывы логистики, связанные с очередями и рационированием (карточки). Молоко действительно может подорожать вдвое, если молоковозы не смогут вовремя заправляться, и молоко будет скисать.
Telegram
Sergey Vakulenko
В 2025 году ВВП России был 214 трлн рублей.
Бензина страна потребила, если грубо, 40 млн. тонн. 53 млрд. литров, по розничной цене 70 рублей за литр на конец года — примерно 3.5 трлн. рублей. Дизеля - 50 млн. тонн или 60 млрд. литров. По розничной 75 рублей…
Бензина страна потребила, если грубо, 40 млн. тонн. 53 млрд. литров, по розничной цене 70 рублей за литр на конец года — примерно 3.5 трлн. рублей. Дизеля - 50 млн. тонн или 60 млрд. литров. По розничной 75 рублей…
👍3💯1
Forwarded from gonzo-обзоры ML статей
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.
Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
arXiv.org
Measuring Intelligence Beyond Human Scale
How can we measure intelligence beyond human capability?
Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue...
Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue...
👍2
Forwarded from Data Secrets
Fable 5 опровергла известную гипотезу Якобиана
Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.
До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.
О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.
Math is solved?
Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.
До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.
О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.
Math is solved?
💯5👍1
Forwarded from Data Secrets
Такими новостями уже никого не удивишь, но GPT-5.6 опровергла еще одну известную гипотезу, которая была открыта 30 лет
Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости.
Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999.
Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом».
В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.
Гипотеза Диница - Гарга - Гоеманса – это теорема из теории графов и сетевых потоков, которая гласит, что из допустимого дробимого решения можно получить целочисленное по маршрутам решение без увеличения стоимости.
Подобные утверждения часто становятся основой для практических оптимизационных алгоритмов, поэтому гипотеза важная. Открыта она была с 1999.
Решение, к слову, обнаружил математик из Нижнего Тагила, выпускник ВШЭ. Вот чат с моделью. Промптинг на уровне «соверши прорыв», «опровергни общий случай», «продолжай исследовать» – то есть вообще никаких подсказок и даже серьезных инструкций. Сам автор называет чат «чистым мемом».
В итоге за несколько итераций и несколько часов модель нашла нужный контрпример. Вот такая математика в 2026.
🔥7🤔3👍1
Forwarded from Data Secrets
Kimi K3 взломала Redis, и на это ей потребовалось всего полчаса и 32 агента
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
☕️
27 минут. Ровно столько времени прошло от запуска автономного агента до момента, пока тот нашел уязвимость и довел ее до рабочего эксплойта.
Баг оказался уровня RCE и приводил к возможности выполнить код на сервере Redis через уже аутентифицированное подключение.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍1😁1
Forwarded from AI Product | Igor Akimov
Kimi K3 таки выложили в опенсорc
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн.
И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable".
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн читал до этого статью интересную, как топовые модели сейчас стараются в более лучший дизайн.
И я не вижу вообще как тут можно говорить, что это просто "дистилляция fable".
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
huggingface.co
moonshotai/Kimi-K3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
🔥7👍1
Forwarded from gonzo-обзоры ML статей
Топовые опенсорсные модели достигли запредельного уровня, в куче бенчмарков сравнимы с коммерческими фронтир моделями. Сейчас узкое место для взрывного роста доступного интеллекта — это домашние девайсы для инференса таких моделей, чтобы у каждого был свой "бесплатный" аналог Claude Code и не было бы финансово страшно жечь кучу токенов на OpenClaw-подобные эксперименты.
Kimi K3: Open Frontier Intelligence
Kimi Team
Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
Блог: https://www.kimi.com/blog/kimi-k3
Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence
Код: https://github.com/MoonshotAI/Kimi-K3
Модель: https://huggingface.co/moonshotai/Kimi-K3
# TL;DR
ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов.
ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol.
Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов.
Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643
Kimi K3: Open Frontier Intelligence
Kimi Team
Статья: https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
Блог: https://www.kimi.com/blog/kimi-k3
Ревью: https://arxiviq.substack.com/p/kimi-k3-open-frontier-intelligence
Код: https://github.com/MoonshotAI/Kimi-K3
Модель: https://huggingface.co/moonshotai/Kimi-K3
# TL;DR
ЧТО сделали: Команда Kimi представила Kimi K3 — открытую мультимодальную модель типа Mixture-of-Experts (MoE) на 2.8 триллиона общих параметров и 104 миллиарда активируемых параметров на токен, поддерживающую контекстное окно в 1 миллион токенов. Модель сочетает гибридное внимание Kimi Delta Attention и Gated Multi-Head Latent Attention в пропорции 3:1, межуровневые связи Block Attention Residuals по глубине, а также Stable LatentMoE с 896 роутируемыми экспертами. Кроме того, Kimi K3 содержит энкодер изображений, обученный с нуля через предсказание следующего токена, и использует мульти-уровневое обучение с подкреплением (RL), дистиллированное из общего, агентного и кодерского доменов.
ПОЧЕМУ это важно: Пока опенсорс-сообщество активно развивало масштабирование рассуждений на инференсе, размер открытых базовых моделей застрял в районе 1 триллиона параметров, увеличивая отставание от закрытых SOTA-систем. Kimi K3 доказывает, что одновременное масштабирование параметров до 3T-класса и агентного RL на контексте в 1M токенов даёт прирост эффективности предобучения в 2.5 раза по сравнению с Kimi K2 (https://arxiv.org/abs/2507.20534), создавая полноценную открытую альтернативу закрытым флагманам вроде Claude Fable 5 и GPT-5.6 Sol.
Для практиков: Kimi K3 совершает сильный рывок в возможностях открытых моделей за счёт параллельного масштабирования архитектуры и RL. Инженерам и техническим лидерам это даёт готовое к продакшену решение передового уровня с рекордной экономичностью на задачах разработки ПО, сложной работы с инструментами и мультимодальных пайплайнах. Выложив веса на 2.8T и сопутствующие библиотеки, авторы снабдили сообщество инфраструктурой для развёртки сверхбольших архитектур без вспомогательных функций потерь (auxiliary loss) и с микро-ВМ средами для оценки агентов.
Подробности и картинки тут: https://t.me/gonzo_ML_podcasts/4643
GitHub
Kimi-K3/k3_tech_report.pdf at main · MoonshotAI/Kimi-K3
Open Frontier Intelligence. Contribute to MoonshotAI/Kimi-K3 development by creating an account on GitHub.
🔥4👍1
Forwarded from пароход ильи захарова
а вы тоже слушаете техно ремиксы на классику чтобы вайбкодить официальные документы
https://www.youtube.com/watch?v=PiYjWoAWLx4
https://www.youtube.com/watch?v=PiYjWoAWLx4
YouTube
DJ Sebastien - Танец маленьких лебедей (Extended Remix)
🔥2👍1😁1
Forwarded from Лера — и точка
Всенародная любовь к Дурову* — это очень сильный показатель, какие реальные герои у российского общества. Я убеждена, что попытка системы бороться с Дуровым является выстрелом себе в ногу.
В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность.
Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге.
Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни.
Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо.
Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN.
* внесен в перечень террористов
** иноагенты, террористы, аффилированные лица, запрещены на территории РФ
В российской культуре всегда была сильна любовь к героям, которые действуют вопреки обстоятельствам. Дуров* идеально вписался в этот архетип. Он не карьерист, не подхалим, пробивающий локтями место у кормушки. Не функция, не приспособленец. Не сильная рука с дубиной и постным недовольным лицом. Он — это личность.
Дуров* прав, когда пишет, что еще посмотрим, кто кого сможет заблокировать. Он и телега де факто символизируют триумф интеллекта и свободы над унылым административным ресурсом. И последний проиграет в конечном итоге.
Многие во власти это чувствовали, поэтому не пытались в открытую наезжать на фигуру Дурова*, более того, поддержали "нашего мальчика" открыто в 2024 году (над чем сейчас иронизирует половина интернета). Потому что это социально одобряемо и популярно. Дуров* показал личным примером, что богатым и знаменитым можно без связей в Кремле, а благодаря своим мозгам. И кроме того, он показал, что будучи богатым и знаменитым, МОЖНО сохранять свои взгляды, иметь какие-то, возможно экзотические, зато свои собственные воззрения о жизни.
Я думаю, многие люди во власти сами знатно офигели объявления его террористом, учитывая то, что это произошло спустя пару дней после заявления Пескова о переговорах с телеграмом. Система уже во всю показывает свою несогласованность, и это хорошо.
Ну и отдельно следует понимать, что этим признанием они еще больше девальвируют понятие "террорист". Раньше было "полстраны сидит, полстраны охраняет". Сегодня: полстраны**, полстраны — читают полстраны** в запрещенной социальной сети через VPN.
* внесен в перечень террористов
** иноагенты, террористы, аффилированные лица, запрещены на территории РФ
💯4👍2🔥2