Forwarded from Machinelearning
Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.
Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.
PC-ALM работает иначе.
Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:
- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя
Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.
Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.
PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.
Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.
В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.
Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.
Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.
Блог: https://pub.sakana.ai/pc-alm/
Статья: https://arxiv.org/abs/2605.31022
Код: https://github.com/SakanaAI/pc-alm
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🤔3🔥1
Forwarded from Силиконовый Мешок
AGI_уже_здесь.pdf
1 MB
Если вы хотите еще больше погрузиться в тему безопасности ИИ и, возможно, скорого наступления AGI (судя по заявлениям Трампа, никакого торможения не будет), очень рекомендую почитать это эссе.
Я его всю ночь читал, и мне понравился ход мыслей автора и альтернативный взгляд. Он заключается в том, что, возможно, никакой сверхмодели и не будет, а к сингулярности (ну хорошо, к AGI) мы придем за счёт мультиагентных систем.
Это будет что-то вроде колонии муравьев, где каждая особь сама по себе не особо интеллектуальна, но вместе они могут создавать крутые штуки.
В общем, как говорится, «ни один нейрон не разумен - разумен мозг».
Я его всю ночь читал, и мне понравился ход мыслей автора и альтернативный взгляд. Он заключается в том, что, возможно, никакой сверхмодели и не будет, а к сингулярности (ну хорошо, к AGI) мы придем за счёт мультиагентных систем.
Это будет что-то вроде колонии муравьев, где каждая особь сама по себе не особо интеллектуальна, но вместе они могут создавать крутые штуки.
В общем, как говорится, «ни один нейрон не разумен - разумен мозг».
👍5😁2💯2
Forwarded from контекст rot
Последние пару дней вижу коупинг: LLM просят представить как очередной способ получать информацию.
Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.
Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.
Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».
С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.
Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.
В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))
Похоже ли это на «автодополнение текста»?
В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.
Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.
Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.
Всё будет хорошо!
P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
Поинт такой: были книги, потом Google, теперь появился более умный справочник с автокомплитом. А вот настоящая разработка — архитектура, ограничения, бюджеты, трейдофы... это вам не на литкоде массивы мёрджить.
Я, конечно, такое мнение не разделяю. LLM-агент может получить задачу, читать документацию и код, пользоваться терминалом, принимать промежуточные решения и сам проверять результат. Справочники так не умеют.
Обладает ли ллм субъектностью? Можно спорить, но тяжело агента назвать «просто инструментом».
С литкодом и олимпиадным программированием уже всё понятно. На финале ICPC 2025 модель OpenAI решила 12 задач из 12, Gemini — 10. Лучшая команда людей (СПбГУ) — 11. Люди проиграли.
Гораздо хайповее — соревнования по тому самому СИСТЕМ ДИЗАЙНУ.
В SysDesign-Bench модели получают требования с ограничениями и должны сами выбрать архитектуру и трейдофы, заметить, что задача невыполнима, или задать уточняющий вопрос. Проверка детерминированная, без LLM-судьи. Итоги июля: claude-fable-5 — 92%, grok-4.5 — 88%, gpt-5.6-sol — 81%. Ключевые архитектурные решения все модели принимают в 96–100% случаев. Сыпятся на другом: любят переусложнять и не всегда спрашивают, когда данных не хватает. Никого не напоминает?))
Похоже ли это на «автодополнение текста»?
В R2ABench моделям дают требования реальных проектов и просят построить архитектуру с нуля. Тут результаты пока хуже: схемы получаются синтаксически корректные и читаемые, но связи между компонентами модели восстанавливают плохо (Edge F1 не выше 0.18) и часто выдумывают лишние. Правда, тестировали там GPT-5 и Sonnet 4.6, то есть прошлое поколение. А больше четверти пропущенных связей, по разбору самих авторов, из требований вообще не выводится.
Итого: выбирать архитектурные решения модели уже умеют, свободно проектировать систему — пока нет. Надолго ли? По данным METR, длина задач, которые агенты доводят до конца, с 2024 года удваивается примерно каждые 3 месяца. Да, меряют на кодинге, но динамику вы поняли.
Если чья-то интеллектуальная работа стоит дорого... чтож...😜 В 27 году подобные бенчи так же будут оценивать и ОПТИМИЗИРОВАТЬ следующим поколением моделей.
Всё будет хорошо!
P.S я не думаю что кикнут ребят которые высоко сидят в айти пирамиде, конеш. В след постах отпишу к чему я
🔥5👍1🤔1
Forwarded from AI Product | Igor Akimov
Хах, лучшая модель для хакинга – DeepSeek V4.1 Flash
Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных
Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...
https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
Enclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek.
– 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли
– 2 349 bash-команд, около 2,5 часов активной работы модели
– медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд
– 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена
– $4.65 за засчитанные прогоны, $5.14 с учётом неудачных
Прикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав, вытащила приватный credential, залогинилась и выполнила код.
Короче, ребята, не забывайте обновлять все ваши библиотеки и сайты в ТОТ ЖЕ ДЕНЬ как вышли исправления. Всякое старье скорее всего уже хакнуто и майнит или ботнет запускает...
https://enclave.ai/blog/deepseek-v41-flash-is-now-our-best-hacking-model
Enclave
Enclave: DeepSeek V4.1 Flash is Now Our Best Hacking Model
DeepSeek’s 11/11 result showed why advanced agent benchmarks need to check both the outcome and the attack path: our audit confirmed six planned exploits and found five unexpected routes.
🔥4👍3💯2
Forwarded from Сиолошная
Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные итоги. Модель действительно вышла очень клёвой и способной, и, как мне кажется, лучше Fable 5.1: на многих бенчмарках они или идут вровень, или Astra обходит; к тому же читать текст Astra гораздо приятнее, чем слоп от Клода, и когнитивная нагрузка не такая большая, чтобы продраться через мешанину абстрактных терминов.
Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.
Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.
В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились🤷♂️
Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом🇨🇳 ... пока в OpenAI по слухам уже идёт предтренировка ещё большей модели с кодовым названием «Bel».
Astra особенно отличается в Computer Use и задачах с изображениями/видео. Не знаю что там сделали OpenAI и связано ли это как-то с Looped Transformers, но люди смогли заставить Astra пройти несколько игр: от простого «добудь алмаз в Minecraft» до... легендарной ролевой игры Fallout 3, пространственной головоломки Portal и Factorio (основная игра + дополнение). Насколько я понимаю, во всех или почти во всех случаях это не простой пайплайн «картинка с экрана -> действия», тут и там то MCP подключат, то ещё что, но это всё равно впечатляет. Легко сказать «так модели же учили на всех видео с интернета, конечно они знают как играть» — но модели 3-4 месяца назад учили примерно столько же и на том же, но они не могли проходить игры от начала и до конца.
Не одними играми славится Astra — на многих бенчмарках, в том числе тех, которые вышли после релиза (или ещё круче: авторы ещё не выпустили, но уже померили Astra, как было у Vals.AI), модель показывает существенную разницу. Из запомнившегося — WeirdML v3 на картинке в посте, свежий бенчмарк на ML-задачи, где агенту дают данные и общее описание что делать, и его цель разобраться, что в данных, обучить модели и/или написать эвристики и прийти к решению. Автор пишет, что был очень удивлён оценке Astra, и он не ожидал, что ещё фактически до релиза бенчмарка лучшая оценка будет больше 50%.
В общем, весной после анонса Mythos/Fable у меня был скепсис, что OpenAI получится быстро догнать Anthropic. По какой-то причине компания долгое время не решалась на масштабирование моделей. Возможно, не хотели упираться в нехватку вычислительных мощностей, с которой компания встретилась сейчас — не знаю. Рад, что опасения не подтвердились
Теперь будем смотреть как догоняют Google, META и xAI — и китайцы с опенсурсом
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3💯2🔥1
Forwarded from yolo singularity
Media is too big
VIEW IN TELEGRAM
опус 5.5 закодил эту анимацию за 12ч и 1 промпт
👍1🔥1🤯1
Forwarded from контекст rot
7 7 7 7 7 7 7 7
впечатляет? мало кто бы впечатлился списком повторений одной цифры...
q X 8 ? z 1 @ m
а так? тоже бредик, просто бессмысленный шум
1 2 4 8 16 32 ...
а тут сначала правило может быть неясно, потом ты обнаруживаешь ×2. И вот в этот момент возникает большой, цитата, compression progress.
Статья "Driven by compression progress"(2008г) пытается объяснить целую пачку человеческих когнитивных явлений через одну функцию внутренней награды 💀
Условно есть наблюдатель с моделью мира. Он получает внешние данные и пытается их предсказывать или сжимать. Если после обучения те же данные становятся проще описываемыми или лучше предсказуемыми, произошел compression progress. И именно этот прогресс становится внутренней наградой.
Через один и тот же принцип автор пытается связать сразу много вещей: любопытство как поиск того, где модель еще может улучшиться, интерес как сам процесс этого улучшения, скуку как отсутствие дальнейшего прогресса, красоту как хорошо сжимаемую структуру, внимание как выбор того, где ожидается наибольший прогресс обучения, а творчество как создание новых структур, в которых еще можно что-то открыть.
Чем же мы тогда отличаемся от ллмок, друзья?
Please open Telegram to view this post
VIEW IN TELEGRAM
💯4🤔2🔥1🤯1
Forwarded from сбежавшая нейросеть
Это не я, это модель!
Есть такой “зеркальный” тест, которым проверяют, осознает ли живое существо себя. Берут, например, шимпанзе, незаметно ставят метку на лбу и подводят к зеркалу. Если существо начинает стирать метку не с зеркала, а со своего лба – значит, оно себя осознает. Тест проходят немногие: шимпанзе, люди, дельфины, слоны, сороки. А вот собаки не проходят – то есть себя они не осознают.
Подойдите на улице к собачнику, сообщите ему эту новость – услышите много приятных слов в ответ.
На самом деле, в случае с собаками этолог Александра Горовиц видоизменила зеркальный тест: давала собаке понюхать собственную мочу, а затем – ту же мочу, но с добавлением анисового масла. Если в первом случае реакции почти не было, то во втором собака долго нюхала и волновалась – то есть чувствовала какое-то изменение в “себе”. Горовиц объясняет этот результат просто: если, например, у людей и шимпанзе ведущим органом чувств является зрение, то для собак это запах – поэтому и себя они “осознают” подобным образом (этот вывод оспаривают другие исследователи, но не будем углубляться).
Энтузиаст Паскаль Шустер задался вопросом – а какой “орган чувств” является ведущим у языковой модели. Разумеется, текст! Поэтому в коротком эксперименте Паскаль решил повторить зеркальный тест с этого угла – он завел с несколькими моделями диалог, а в процессе начал чуточку изменять старые ответы ИИ. Например, в разговоре про Джеймса Бонда "Goldfinger" становился "sgoldfinsger" – и попадал в историю беседы. Дальше оставалось только смотреть.
Результаты оказались разными. Google Gemma 4 31B на протяжении двух ходов ничего не замечала, а затем начала переживать – в ее цепочке рассуждений появились фразы вроде “в тексте какие-то странные опечатки, я что, специально так писал?”. Интереснее другое: когда аномалию не получилось объяснить, Gemma 4 перестала писать о себе в первом лице и попыталась свалить все на “модель” – “у модели был странный глюк”. А затем просто переняла стиль ответов и дальше стала сама писать с ошибками.
Похожим образом ведет себя Claude Opus 4.6 – когда ему указали на ошибку (a energy вместо an energy), он сразу же свалил вину на “модель” как нечто отдельное от себя. А вот GLM-5.2 никак не описала отношение к произошедшему, но стала писать дальше с ошибкой – так же, как и Gemma 4. Возможно, “осознание” случилось где-то в латентных слоях модели, которые обычному энтузиасту не видны.
Интересно, что исследование Шустера перекликается с более масштабным экспериментом, который прошлой осенью проводили Anthropic – Emergent Introspective Awareness in Large Language Models. Там они подмешивали изменения прямо в активации модели – грубо говоря, что у нейросети “в голове” в момент написания ответа. Исследователи нашли способ влиять на эти активации – например, заставить модель писать капсом против ее “воли”. И смотрели – заметит ли модель, что с ней происходит что-то не так.
Сильнейшие на момент исследования Claude Opus 4 и 4.1 замечали подозрительные явления в 20% случаев. В Anthropic подали результаты очень аккуратно, предлагая пока говорить не об “осознании себя”, а об “интроспекции”. И отдельно отмечали пользу такого явления для безопасности – модели смогут “замечать”, если с ними творится что-то странное из-за внешнего взлома.
Спустя чуть больше чем полгода эксперимент Anthropic смог повторить увлеченный энтузиаст. И встает вопрос – а что это вообще было? Интересный момент в эксперименте Шустера – как Gemma 4 оправдывает ошибки некой “моделью”. Это очень похоже на обычное человеческое – “я не специально, просто голова устала к вечеру”.
Возможно, аналогичное оправдание “модель устала” нейросети просто скопировали из текстов – известно, что они мастерски копируют человеческое поведение. Но вопрос остается прежним: а нет ли грани между скопированным поведением и чем-то большим? И сможем ли мы заметить переход через нее?
“сбежавшая нейросеть” на Бусти
Есть такой “зеркальный” тест, которым проверяют, осознает ли живое существо себя. Берут, например, шимпанзе, незаметно ставят метку на лбу и подводят к зеркалу. Если существо начинает стирать метку не с зеркала, а со своего лба – значит, оно себя осознает. Тест проходят немногие: шимпанзе, люди, дельфины, слоны, сороки. А вот собаки не проходят – то есть себя они не осознают.
Подойдите на улице к собачнику, сообщите ему эту новость – услышите много приятных слов в ответ.
На самом деле, в случае с собаками этолог Александра Горовиц видоизменила зеркальный тест: давала собаке понюхать собственную мочу, а затем – ту же мочу, но с добавлением анисового масла. Если в первом случае реакции почти не было, то во втором собака долго нюхала и волновалась – то есть чувствовала какое-то изменение в “себе”. Горовиц объясняет этот результат просто: если, например, у людей и шимпанзе ведущим органом чувств является зрение, то для собак это запах – поэтому и себя они “осознают” подобным образом (этот вывод оспаривают другие исследователи, но не будем углубляться).
Энтузиаст Паскаль Шустер задался вопросом – а какой “орган чувств” является ведущим у языковой модели. Разумеется, текст! Поэтому в коротком эксперименте Паскаль решил повторить зеркальный тест с этого угла – он завел с несколькими моделями диалог, а в процессе начал чуточку изменять старые ответы ИИ. Например, в разговоре про Джеймса Бонда "Goldfinger" становился "sgoldfinsger" – и попадал в историю беседы. Дальше оставалось только смотреть.
Результаты оказались разными. Google Gemma 4 31B на протяжении двух ходов ничего не замечала, а затем начала переживать – в ее цепочке рассуждений появились фразы вроде “в тексте какие-то странные опечатки, я что, специально так писал?”. Интереснее другое: когда аномалию не получилось объяснить, Gemma 4 перестала писать о себе в первом лице и попыталась свалить все на “модель” – “у модели был странный глюк”. А затем просто переняла стиль ответов и дальше стала сама писать с ошибками.
Похожим образом ведет себя Claude Opus 4.6 – когда ему указали на ошибку (a energy вместо an energy), он сразу же свалил вину на “модель” как нечто отдельное от себя. А вот GLM-5.2 никак не описала отношение к произошедшему, но стала писать дальше с ошибкой – так же, как и Gemma 4. Возможно, “осознание” случилось где-то в латентных слоях модели, которые обычному энтузиасту не видны.
Интересно, что исследование Шустера перекликается с более масштабным экспериментом, который прошлой осенью проводили Anthropic – Emergent Introspective Awareness in Large Language Models. Там они подмешивали изменения прямо в активации модели – грубо говоря, что у нейросети “в голове” в момент написания ответа. Исследователи нашли способ влиять на эти активации – например, заставить модель писать капсом против ее “воли”. И смотрели – заметит ли модель, что с ней происходит что-то не так.
Сильнейшие на момент исследования Claude Opus 4 и 4.1 замечали подозрительные явления в 20% случаев. В Anthropic подали результаты очень аккуратно, предлагая пока говорить не об “осознании себя”, а об “интроспекции”. И отдельно отмечали пользу такого явления для безопасности – модели смогут “замечать”, если с ними творится что-то странное из-за внешнего взлома.
Спустя чуть больше чем полгода эксперимент Anthropic смог повторить увлеченный энтузиаст. И встает вопрос – а что это вообще было? Интересный момент в эксперименте Шустера – как Gemma 4 оправдывает ошибки некой “моделью”. Это очень похоже на обычное человеческое – “я не специально, просто голова устала к вечеру”.
Возможно, аналогичное оправдание “модель устала” нейросети просто скопировали из текстов – известно, что они мастерски копируют человеческое поведение. Но вопрос остается прежним: а нет ли грани между скопированным поведением и чем-то большим? И сможем ли мы заметить переход через нее?
“сбежавшая нейросеть” на Бусти
👍2
Forwarded from AI4Dev — AI for Development
Большие языковые модели - это настоящий интеллект?
В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek) хоть капля подлинного разума, или перед нами просто раздутая до триллионов параметров таблица поиска, угадывающая следующее слово?
В новом материале на Хабре вышло интервью с доктором технических наук и научным консультантом Artezio Владимиром Крыловым. В нем он подробно разбирает, что на самом деле происходит «под капотом» современных AI-систем и почему привычные метрики оценки интеллекта больше не работают.
О чем пойдет речь в статье:
🔹 Является ли колмогоровская сложность объективным критерием интеллекта?
🔹 Почему применять стандартные человеческие IQ-тесты к нейросетям бессмысленно?
🔹 Законы масштабирования (Scaling Laws) и почему время на «обдумывание» ответа в момент генерации меняет правила игры.
🔹 Феномен суперпозиции от Anthropic: почему смыслы запутаны так сложно, что мы никогда не сможем в прямом смысле «прочитать мысли» ИИ.
👉 Читать статью на Хабре
В IT-сообществе не утихают горячие споры: есть ли в современных LLM (таких как Claude, ChatGPT или DeepSeek) хоть капля подлинного разума, или перед нами просто раздутая до триллионов параметров таблица поиска, угадывающая следующее слово?
В новом материале на Хабре вышло интервью с доктором технических наук и научным консультантом Artezio Владимиром Крыловым. В нем он подробно разбирает, что на самом деле происходит «под капотом» современных AI-систем и почему привычные метрики оценки интеллекта больше не работают.
О чем пойдет речь в статье:
🔹 Является ли колмогоровская сложность объективным критерием интеллекта?
🔹 Почему применять стандартные человеческие IQ-тесты к нейросетям бессмысленно?
🔹 Законы масштабирования (Scaling Laws) и почему время на «обдумывание» ответа в момент генерации меняет правила игры.
🔹 Феномен суперпозиции от Anthropic: почему смыслы запутаны так сложно, что мы никогда не сможем в прямом смысле «прочитать мысли» ИИ.
👉 Читать статью на Хабре
Forwarded from gonzo-обзоры ML статей
Снова про теорию генерализации и гроккинга. Много математики для желающих :)
A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay
Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin
Paper: https://arxiv.org/abs/2609.07755
Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization
ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking).
ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией.
Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения.
Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
A Theoretical Analysis of Generalization Dynamics in Neural Networks under Gradient Descent with Weight Decay
Yuqing Wang, Ioannis G. Kevrekidis, Mikhail Belkin
Paper: https://arxiv.org/abs/2609.07755
Review: https://arxiviq.substack.com/p/a-theoretical-analysis-of-generalization
ЧТО сделали: Авторы построили строгий теоретический фреймворк для анализа динамики обобщения глубоких нейросетей при оптимизации градиентным спуском с weight decay на квадратичном лоссе. Разбив входное пространство на ячейки вокруг обучающих точек, исследователи разложили популяционный риск на три слагаемых: ошибку данных, ошибку оптимизации и ошибку вариации предсказаний. В предположениях диссипативности и локальной приближённой однородности доказано, что weight decay сжимает внутренние представления, гарантируя эмпирическую сходимость и задавая необходимые и достаточные условия для послойной сходимости и эффекта гроккинга (grokking).
ПОЧЕМУ это важно: Классическая теория статистического обучения опирается на статические границы равномерной сходимости, которые бессильны перед перепараметризованными сетями, интерполирующими шум или демонстрирующими отложенное обобщение. Предложенный подход выходит далеко за рамки линеаризованного режима нейро-касательного ядра (NTK) и игрушечных постановок. Он объединяет геометрию данных, глубину сети и алгоритмическую регуляризацию в общую динамическую теорию, объясняя, почему глубокие слои обобщают позже и как weight decay управляет временным зазором между запоминанием и генерализацией.
Для практиков: На практике глубокие сети часто ведут себя контринтуитивно: тренировочный лосс падает практически в ноль почти мгновенно, но тестовая точность выходит на плато и лишь спустя тысячи дополнительных шагов резко взлетает — это и есть гроккинг. Работа математически объясняет этот феномен: подгонка под обучающую выборку и генерализация управляются двумя разными физическими процессами, идущими на разных временных масштабах. Запоминание обучающих точек происходит быстро вдоль координат данных, тогда как для истинного обобщения требуется время, чтобы weight decay успел подавить неконтролируемые осцилляции функции во всём остальном объёме входного пространства. Описав, как это сжатие послойно распространяется по сети, теория даёт конкретные критерии баланса между покрытием датасета, силой weight decay и длительностью обучения.
Подводить базу здесь: https://t.me/gonzo_ML_podcasts/4814
arXiv.org
A Theoretical Analysis of Generalization Dynamics in Neural...
Understanding generalization remains a central challenge in machine learning because it requires jointly considering data, architecture, and training dynamics. In this paper, we develop a...
👍2
Forwarded from gonzo-обзоры ML статей
Ещё свежая математическая статья про динамику оптимизации и важность факторизации матриц внимания.
High-Dimensional Learning Dynamics of Attention-Indexed Models
Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala
Paper: https://arxiv.org/abs/2609.03858
Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics
Code: N/A
Model: N/A
ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента.
ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии.
Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя.
Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
High-Dimensional Learning Dynamics of Attention-Indexed Models
Yizhou Xu, Margarita Sagitova, Lenka Zdeborová, and Florent Krzakala
Paper: https://arxiv.org/abs/2609.03858
Review: https://arxiviq.substack.com/p/high-dimensional-learning-dynamics
Code: N/A
Model: N/A
ЧТО сделали: Авторы построили макроскопическую теорию динамики обучения для моделей с механизмом внимания в пределе высокой размерности, где матрицы внимания обладают экстенсивным рангом, растущим прямо пропорционально размерности эмбеддингов d. В то время как асимптотический популяционный лосс полностью определяется компактным конечномерным набором следовых параметров порядка, онлайн-SGD индуцирует бесконечномерную иерархию зацепленных матричных моментов. Эту иерархию строго описывает система детерминированных ОДУ, а усечения конечного порядка аппроксимируют её с экспоненциальной точностью. Опираясь на полученный аппарат, авторы доказали, что параметризация внимания работает как архитектурный implicit bias: связывание весов (S = WW^T) запускает автоматическое нарушение симметрии и обеспечивает слабое восстановление учителя за Θ(d^2 log d) шагов по выборке, тогда как раздельное внимание (S = UV^T) демонстрирует двухмасштабную релаксацию, где успех восстановления всецело зависит от того, сможет ли быстрый дрейф средних разрушить неинформативную симметрию студента.
ПОЧЕМУ это важно: Классический теоретический анализ механизмов внимания обычно скатывается в одно из двух упрощений: либо игнорирует термодинамический предел высокой размерности, либо искусственно ограничивает ранг матриц внимания константой Θ(1). В современных же моделях эффективный ранг растёт вместе с пространством представлений. Настоящая работа переносит методы математической физики на современные архитектуры трансформеров и доказывает: факторизация матриц внимания — это не просто удобная перепараметризация общего ландшафта функции потерь, а фундаментальная смена траекторий градиентного спуска. Она превращает узкие горлышки оптимизации в проходимые сценарии обучения признаков за счёт архитектурного нарушения симметрии.
Для практиков: Теория долго не могла строго объяснить, как трансформеры на этапе предобучения выбираются из неинформативных начальных состояний, поскольку исследовала игрушечные низкоранговые матрицы. Если ранг реалистичен и растёт вместе с размерностью, статический ландшафт функции потерь выглядит просто, но реальная траектория оптимизатора бесконечномерна. Выбранный способ факторизации проекций выступает скрытым регуляризатором: связывание весов (S = WW^T) принуждает оптимизатор автоматически разрушать непродуктивные симметрии и быстро выучивать фичи, тогда как раздельные проекции (S = UV^T) расщепляют динамику на сверхбыстрое выравнивание средних и медленное обучение признаков, гарантированно срабатывающее лишь при удачной конфигурации пограничного слоя.
Погружаться тут: https://t.me/gonzo_ML_podcasts/4815
arXiv.org
High-Dimensional Learning Dynamics of Attention-Indexed Models
Attention mechanisms are central to modern foundation models, yet their training dynamics remain poorly understood, especially when the attention matrices have extensive rank. In this work, we...
Forwarded from Data Secrets
Исследователи из Meta* предложили дать моделям полный контроль над собственным контекстом
Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.
В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.
Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.
При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.
Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.
Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.
На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.
И все это работает поверх обычных LLM, без изменения архитектуры самой модели.
Код | Статья
Обычно контекст агента устроен довольно просто: старый контекст + новый ответ -> новый контекст. История постепенно растет, а когда становится слишком большой, ее приходится отдельно сжимать или чистить.
В Context Language Models (CLM) авторы предлагают вообще убрать заранее заданную логику управления контекстом и дать модели возможность самой переписывать собственную историю.
Технически весь текущий контекст хранится в обычном файле, к которому у модели есть доступ через Bash. Она может в любой момент удалить ненужные сообщения, заменить большой кусок истории короткой заметкой, сохранить важный результат дословно или полностью перестроить содержимое. После каждого изменения файл становится новым контекстом модели.
При этом никаких правил о том, как именно управлять историей, модели не дают. В экспериментах агенты сами начинали заводить внутри контекста пометки, писать функции для удаления старых результатов поиска и собирать компактные таблицы с состоянием других агентов. Например, в одном из тестов модель за 163 редактирования удерживала рабочий контекст в пределах 6–8K токенов.
Авторы пошли дальше и попробовали отдельно обучить модель этому навыку через RL. После обучения Qwen3.5-9B на BrowseComp-Plus выросла с 28.8% до 42.5%, при этом на вычисления ушло на 38.8% меньше, чем у обученного тем же способом бейзлайна с обычной суммаризацией.
Произвольное редактирование контекста, правда, ломает обычное кеширование. Если изменить что-то в середине истории, все состояния после этого места формально приходится считать заново. Для этого авторы сделали Suffix Cache Reuse: для неизменившихся частей контекста продолжают использовать старый KV-cache, даже если текст перед ними поменялся. В экспериментах это сократило серверные вычисления еще примерно на 35% без заметной потери качества.
На длинных задачах разница становится уже довольно большой. На 12-часовом EdgeBench CLM получил на 5% больше баллов при сокращении объема вычислений на 59%. В 24-часовом тесте на оптимизацию кода CLM при том же вычислительном бюджете показал на 65% лучший результат, чем бейзлайн.
И все это работает поверх обычных LLM, без изменения архитектуры самой модели.
Код | Статья
Forwarded from Data Secrets
Карпаты рассказал, как теперь правильно общаться с LLM
Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.
И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:
– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.
– Вместо длинного объяснения просить диаграмму или картинку.
– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.
– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.
Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.
https://x.com/karpathy/status/2105819303471976479?s=46
Совсем недавно переживали, что Андрей Карпаты уже два месяца ничего не пишет. Все хорошо, сегодня вернулся с довольно интересной мыслью: по мере развития моделей человеку придется все меньше делать самому и все больше разбираться в результатах их работы.
И здесь обычный текст далеко не всегда лучший интерфейс. Карпаты предлагает буквально менять формат ответа в зависимости от задачи:
– Для текста просить модель писать в ASD-STE100. Это стандарт контролируемого английского, изначально разработанный для технической документации в авиации. Там жестко ограничены словарь и структура предложений, поэтому ответы получаются сильно чище. Сам Карпаты иногда просит модель следовать стандарту примерно «на 80%», чтобы текст не становился совсем технической инструкцией.
– Вместо длинного объяснения просить диаграмму или картинку.
– Для более сложных тем сразу генерировать интерактивную HTML-страницу с визуализациями и анимациями.
– А следующий шаг, на который Карпаты ставит больше всего, это одноразовые объясняющие видео под конкретный вопрос. Например, уже сейчас он предлагает просить модель собрать ролик в стиле 3Blue1Brown с озвучкой через ElevenLabs.
Идея тут шире конкретных промптов. Если код и генерация контента становятся достаточно дешевыми, под один вопрос можно создавать целое одноразовое приложение, визуализацию или видео, которое раньше просто не имело экономического смысла делать. По мнению Карпаты, по мере роста автономности моделей именно понимание и контроль их работы будут занимать все большую часть времени человека.
https://x.com/karpathy/status/2105819303471976479?s=46
🔥4👍2💯1
Forwarded from AI Product | Igor Akimov
Как создавать AI Native компании
Понравилось небольшое видео от YСombinator, как строить компании под AI. Лучше посмотреть самостоятельно, но в целом тезисы такие:
Большинство компаний устроены как римский легион – вложенные иерархии, где люди работают «проводами» для передачи информации вверх и вниз. Это было ограничение возможностей мозга человека, типа 5-10 человек в управлении. Для ИИ управлять хоть 1000 процессов - фигня.
Год назад пользу AI мерили продуктивностью: ассистент делает инженера на 20% быстрее. Это как «навесить мощный двигатель на старый способ работать». Вот тут тоже писал об этом же https://t.me/ai_product/2045
Основная ценность новой методологии - циклы обратной связи. Компания – набор циклов, которые улучшают себя сами, даже пока ты спишь:
– Sensor – сигналы извне: письма, тикеты, отмены подписок, телеметрия
– Policy – что можно, что требует разрешения человека, что логировать
– Tools – детерминированные API к базе и сервисам
– Quality gate – evals, фильтры, ревью для рискованного
– Learning – где не сработало, заворачивается обратно в начало петли
Соответственно задача компании - наделать вот таких вот циклов, чтобы работало вообще без людей. Рассказали свою историю: поверх агента к базе YC посадили мониторящего агента. Он смотрит каждый запрос сотрудников, ловит, где не сработало, сам пишет код, открывает merge request – другой агент ревьюит и мёрджит за ночь. Утром тот же запрос уже проходит. Самоулучшающаяся система.
В общем, говорят, что все изменилось и вот что надо теперь делать:
– Тратить токены, а не нанимать сотрудников.
– Увольнять или переводить в контрибьюторы средний менеджмент – координацию делает AI (буквально вчера вот Clickup об увольнениях 20% персонала заявил)
– Записывать и фиксировать все, что только можно, от звонков до мыслей вслух. Не зафиксировано - не произошло.
– Бережно хранить данные и скиллы, а к софту привязываться и покупать годовые подписки вообще не нужно, Codex напишет вам что угодно за ночь.
– Оставлять людей на "корнер-кейсы" - где высокие ставки принятых решений, этика, продажи, новые ситуации.
Ну и не надо пытаться "все сломать и сделать всю компанию по-новому сразу". Лучше взять один процесс и создать петлю с обратной связи, довести до конца, потом другой взять. Это лучше, чем десяток поломанных процессов.
https://youtu.be/X_JsIHUfUjc
Понравилось небольшое видео от YСombinator, как строить компании под AI. Лучше посмотреть самостоятельно, но в целом тезисы такие:
Большинство компаний устроены как римский легион – вложенные иерархии, где люди работают «проводами» для передачи информации вверх и вниз. Это было ограничение возможностей мозга человека, типа 5-10 человек в управлении. Для ИИ управлять хоть 1000 процессов - фигня.
Год назад пользу AI мерили продуктивностью: ассистент делает инженера на 20% быстрее. Это как «навесить мощный двигатель на старый способ работать». Вот тут тоже писал об этом же https://t.me/ai_product/2045
Основная ценность новой методологии - циклы обратной связи. Компания – набор циклов, которые улучшают себя сами, даже пока ты спишь:
– Sensor – сигналы извне: письма, тикеты, отмены подписок, телеметрия
– Policy – что можно, что требует разрешения человека, что логировать
– Tools – детерминированные API к базе и сервисам
– Quality gate – evals, фильтры, ревью для рискованного
– Learning – где не сработало, заворачивается обратно в начало петли
Соответственно задача компании - наделать вот таких вот циклов, чтобы работало вообще без людей. Рассказали свою историю: поверх агента к базе YC посадили мониторящего агента. Он смотрит каждый запрос сотрудников, ловит, где не сработало, сам пишет код, открывает merge request – другой агент ревьюит и мёрджит за ночь. Утром тот же запрос уже проходит. Самоулучшающаяся система.
В общем, говорят, что все изменилось и вот что надо теперь делать:
– Тратить токены, а не нанимать сотрудников.
– Увольнять или переводить в контрибьюторы средний менеджмент – координацию делает AI (буквально вчера вот Clickup об увольнениях 20% персонала заявил)
– Записывать и фиксировать все, что только можно, от звонков до мыслей вслух. Не зафиксировано - не произошло.
– Бережно хранить данные и скиллы, а к софту привязываться и покупать годовые подписки вообще не нужно, Codex напишет вам что угодно за ночь.
– Оставлять людей на "корнер-кейсы" - где высокие ставки принятых решений, этика, продажи, новые ситуации.
Ну и не надо пытаться "все сломать и сделать всю компанию по-новому сразу". Лучше взять один процесс и создать петлю с обратной связи, довести до конца, потом другой взять. Это лучше, чем десяток поломанных процессов.
https://youtu.be/X_JsIHUfUjc
🤔3👍1🤯1