🧠 Новый большой обзор по self-evolving AI-агентам: как понять, что агент действительно стал лучше после изменения самого себя?
Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри сразу несколько полезных вещей:
* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип:
обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.
📄 Paper:
🌐 Project:
💻 GitHub:
#AI #Agents #SelfEvolvingAgents #LLM #Research
Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.
Внутри сразу несколько полезных вещей:
* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.
Особенно важный принцип:
обновление не должно само контролировать единственное доказательство собственной успешности.
Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.
📄 Paper:
https://openreview.net/forum?id=CGO1hDTHNe🌐 Project:
https://wkqdzkd.github.io/Awesome-Reliable-Self-Evolving-Agents/💻 GitHub:
github.com/wkqdzkd/Awesome-Reliable-Self-Evolving-Agents#AI #Agents #SelfEvolvingAgents #LLM #Research
🔥7❤5👍5
Как научить рекомендательную систему думать не о следующем лайке, а обо всей сессии?
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL
👍6🤣5🔥1
🚨 Oracle снова готовит сокращения. Цена AI-гонки становится всё заметнее.
По данным Business Insider, компания готовит новый раунд увольнений до 1 сентября. В отдельных командах сокращения могут измеряться двузначными процентами.
И происходит это на фоне огромных расходов на AI-инфраструктуру.
За финансовый 2026 год Oracle получила $32 млрд операционного денежного потока, но вложила $55,7 млрд в инфраструктуру. Итог - свободный денежный поток ушёл в минус на $23,7 млрд. Чтобы финансировать строительство дата-центров и закупку оборудования, Oracle привлекла $43 млрд долга и ещё $5 млрд через продажу акций. В 2027 финансовом году компания планирует привлечь ещё около $40 млрд.
Штат тем временем уже сократился примерно на 21 000 человек - со 162 000 до 141 000 за год.
Но есть обратная сторона: бизнес действительно разгоняется.
Выручка Oracle за год выросла на 17%, а Cloud Infrastructure - сразу на 77%.
Получается довольно показательная экономика AI-бума:
• облачная выручка растёт на десятки процентов, компания вкладывает десятки миллиардов в дата-центры, свободный cash flow становится отрицательным - и одновременно приходится экономить на людях.
AI-инфраструктура становится настолько капиталоёмкой, что даже компании, которые выигрывают от бума, вынуждены искать деньги буквально везде.
#AI #Oracle #Cloud #Datacenter
По данным Business Insider, компания готовит новый раунд увольнений до 1 сентября. В отдельных командах сокращения могут измеряться двузначными процентами.
И происходит это на фоне огромных расходов на AI-инфраструктуру.
За финансовый 2026 год Oracle получила $32 млрд операционного денежного потока, но вложила $55,7 млрд в инфраструктуру. Итог - свободный денежный поток ушёл в минус на $23,7 млрд. Чтобы финансировать строительство дата-центров и закупку оборудования, Oracle привлекла $43 млрд долга и ещё $5 млрд через продажу акций. В 2027 финансовом году компания планирует привлечь ещё около $40 млрд.
Штат тем временем уже сократился примерно на 21 000 человек - со 162 000 до 141 000 за год.
Но есть обратная сторона: бизнес действительно разгоняется.
Выручка Oracle за год выросла на 17%, а Cloud Infrastructure - сразу на 77%.
Получается довольно показательная экономика AI-бума:
• облачная выручка растёт на десятки процентов, компания вкладывает десятки миллиардов в дата-центры, свободный cash flow становится отрицательным - и одновременно приходится экономить на людях.
AI-инфраструктура становится настолько капиталоёмкой, что даже компании, которые выигрывают от бума, вынуждены искать деньги буквально везде.
#AI #Oracle #Cloud #Datacenter
😱10👍3🙈3
🚀 DeepSeek-V4-Pro (Max) может снова сломать рынок цен на ИИ-модели
В Code Arena WebDev AutoEval модель набрала 1607 баллов - всего на 15 меньше GPT-5.6 Sol xHigh.
Но самое интересное здесь цена: по приведённым тарифам DeepSeek обходится примерно в 31 раз дешевле по смешанной стоимости токенов.
Kimi K3 Max пока впереди с 1674 баллами, но при цене $3/$15 за 1 млн токенов её смешанная стоимость почти в 16 раз выше.
А Code Arena WebDev - это не обычный тест на генерацию кода. Модели должны собирать полноценные интерактивные веб-приложения.
Если результаты и цены сохранятся на релизе, DeepSeek-V4-Pro (Max) серьёзно сдвинет Pareto frontier: почти топовое качество за радикально меньшие деньги.
https://x.com/Machinelearrn/status/2087834035405889937
@machinelearning_interview
В Code Arena WebDev AutoEval модель набрала 1607 баллов - всего на 15 меньше GPT-5.6 Sol xHigh.
Но самое интересное здесь цена: по приведённым тарифам DeepSeek обходится примерно в 31 раз дешевле по смешанной стоимости токенов.
Kimi K3 Max пока впереди с 1674 баллами, но при цене $3/$15 за 1 млн токенов её смешанная стоимость почти в 16 раз выше.
А Code Arena WebDev - это не обычный тест на генерацию кода. Модели должны собирать полноценные интерактивные веб-приложения.
Если результаты и цены сохранятся на релизе, DeepSeek-V4-Pro (Max) серьёзно сдвинет Pareto frontier: почти топовое качество за радикально меньшие деньги.
https://x.com/Machinelearrn/status/2087834035405889937
@machinelearning_interview
🔥24👍5❤3
Новый термин из мира AI-кодинга - «catastrophic remembering».
Исследователи изучили 1 867 GitHub-репозиториев и заметили проблему: файлы вроде CLAUDE.md со временем только разрастаются. Количество инструкций в среднем выросло на 226%, а старые правила удалялись всё реже.
Проблема в том, что агент продолжает помнить правило, когда разработчики уже забыли, зачем оно вообще появилось.
Получается своеобразная «трещотка»: после каждого бага в промпт добавляется новое ограничение, но почти никто потом не возвращается проверить, актуально ли оно.
Авторы предлагают простой фикс из обычной разработки: рядом с каждой инструкцией хранить скрытый от модели комментарий с причиной её появления - какой был сбой, гипотеза и чем всё закончилось.
В эксперименте это почти полностью остановило раздувание промпта: вместо +211,3% размер вырос всего на 1,4%, при той же точности выполнения ограничений.
Paper: “Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding”
https://arxiv.org/abs/2608.11095
Исследователи изучили 1 867 GitHub-репозиториев и заметили проблему: файлы вроде CLAUDE.md со временем только разрастаются. Количество инструкций в среднем выросло на 226%, а старые правила удалялись всё реже.
Проблема в том, что агент продолжает помнить правило, когда разработчики уже забыли, зачем оно вообще появилось.
Получается своеобразная «трещотка»: после каждого бага в промпт добавляется новое ограничение, но почти никто потом не возвращается проверить, актуально ли оно.
Авторы предлагают простой фикс из обычной разработки: рядом с каждой инструкцией хранить скрытый от модели комментарий с причиной её появления - какой был сбой, гипотеза и чем всё закончилось.
В эксперименте это почти полностью остановило раздувание промпта: вместо +211,3% размер вырос всего на 1,4%, при той же точности выполнения ограничений.
Paper: “Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding”
https://arxiv.org/abs/2608.11095
🔥16❤5👍4
🚀 OpenAI приближается к $40 млрд годовой выручки.
По данным Bloomberg, компания сейчас движется к annualized revenue run rate около $40 млрд - примерно в два раза больше, чем в конце 2025 года.
Главный драйвер роста - не только ChatGPT, но и инструменты для разработчиков. Особенно быстро растёт Codex, который становится одним из самых сильных направлений бизнеса OpenAI.
При этом Anthropic с Claude Code показывает агрессивную динамику и уже движется к очень высоким показателям выручки в корпоративном сегменте.
AI-рынок всё больше превращается в гонку не только моделей, но и продуктов вокруг них: кто лучше встроится в рабочие процессы разработчиков и компаний, тот заберёт большую часть рынка.
По данным Bloomberg, компания сейчас движется к annualized revenue run rate около $40 млрд - примерно в два раза больше, чем в конце 2025 года.
Главный драйвер роста - не только ChatGPT, но и инструменты для разработчиков. Особенно быстро растёт Codex, который становится одним из самых сильных направлений бизнеса OpenAI.
При этом Anthropic с Claude Code показывает агрессивную динамику и уже движется к очень высоким показателям выручки в корпоративном сегменте.
AI-рынок всё больше превращается в гонку не только моделей, но и продуктов вокруг них: кто лучше встроится в рабочие процессы разработчиков и компаний, тот заберёт большую часть рынка.
👍9❤4🥰1
🚨 Anthropic больше чем удвоила выручку всего за один квартал.
По предварительным данным, во втором квартале компания получила более $11,5 млрд против $4,73 млрд в первом. Год к году рост составил примерно 14 раз.
И это первый квартал, когда Anthropic вышла в положительную скорректированную операционную прибыль.
Ещё в мае annualized revenue run rate компании превысил $47 млрд. Основной спрос идёт со стороны бизнеса, особенно на Claude и инструменты для программирования.
Для сравнения: всего год назад Anthropic находилась на уровне около $3 млрд annualized revenue.
Claude буквально превратился в машину по печатанию денег.
По предварительным данным, во втором квартале компания получила более $11,5 млрд против $4,73 млрд в первом. Год к году рост составил примерно 14 раз.
И это первый квартал, когда Anthropic вышла в положительную скорректированную операционную прибыль.
Ещё в мае annualized revenue run rate компании превысил $47 млрд. Основной спрос идёт со стороны бизнеса, особенно на Claude и инструменты для программирования.
Для сравнения: всего год назад Anthropic находилась на уровне около $3 млрд annualized revenue.
Claude буквально превратился в машину по печатанию денег.
❤11👍4🔥3😁2😈1
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков
Проект
Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
#AI #Kimi #LLM #C #LocalAI
Проект
kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.
Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.
Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.
github.com/FareedKhan-dev/kimi-k3-in-c#AI #Kimi #LLM #C #LocalAI
🔥27❤6⚡3👍1🗿1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
В десктопном ChatGPT вместо Chronicle заработала Computer History. Прежний механизм собирал контекст скриншотами экрана, новый пишет журнал действий - клики, ввод текста, шорткаты, переключение окон. События складываются в единую хронологию и лежат локально.
Сбор по умолчанию выключен. В настройках приватности можно вывести из-под наблюдения отдельные приложения и сайты.
Разобрав журнал, ChatGPT замечает повторяющиеся действия и предлагает собрать под них сценарий для рутинной задачи. На тот же журнал опираются ответы ChatGPT и Codex - их можно спросить, например, как правился конкретный файл.
Computer History работает на macOS у подписчиков Pro, Business и Enterprise.
chatgpt.com
Если генерация обрывается на лимите сообщений, теперь можно включить ожидание вместо перезапуска. Когда квота обновится, Claude Code подхватит контекст и продолжит с места остановки.
Раньше прерванную задачу приходилось поднимать руками - жать
Try again или отправлять команду заново.ClaudeDevs в X
Соцсеть выложила на GitHub расширенную версию кода, который собирает ленту
For You. Кодовая база выросла - добавились конфигурации моделей, внутренние фильтры и веса сигналов в основном движке ранжирования. Закрытыми остались только антиспам-модули на Grok - чтобы владельцы ботнетов не разобрали их и не научились обходить.
В настройках Х появился инструмент
Under the Hood, который выгружает JSON со статистикой аккаунта. В файле видно, какие системные метки система навесила на профиль и отдельные посты за последний месяц, - по ним можно понять, не попал ли аккаунт под ограничения. JSON вместе со ссылкой на репозиторий можно скормить сторонней модели и разобраться, почему просели охваты.
Пока выгрузка работает в пилоте - аккаунт должен быть старше года и выпускать хотя бы десять постов в месяц.
X Open Source
Губернатор штата объявил о создании консультативного совета из 20 старшеклассников, который будет участвовать в разработке правил в сфере ИИ.
Первая группа уже обсуждает с чиновниками, как внедрять генеративные модели в школы, как защищаться от дипфейков и где проходят этические границы ИИ.
Осенью откроется набор новых участников. На весну 2027 года намечена отдельная программа, где подростков научат запускать собственные проекты в цифровой среде.
Калифорния стала вторым штатом с молодежным советом по ИИ - такой же с 2025 года работает в Нью-Йорке.
gov.ca.gov
Один из четырех крупнейших госбанков Китая запустил программу Computing Power Token Loan. ИИ-разработчикам дают до 30 млн юаней (около 4 млн долларов) на срок до трех лет.
Залог не нужен - вместо него банк смотрит на расход токенов, стоимость контрактов на вычисления и выручку от ИИ-продуктов.
Аналитики настроены скептически по двум причинам. Во-первых, расход токенов показывает, насколько активно компания работает, но ничего не говорит о том, зарабатывает ли она. Во-вторых, метрику легко накрутить лишними вызовами API, чтобы поднять себе лимит.
Чтобы это отслеживать, нужен независимый аудит логов потребления, а таких площадок пока нет.
cls.cn
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤5🔥5
🚀 DeepSeek Harness набрал 122K+ звёзд на GitHub всего за 3 дня и стал одним из самых быстрорастущих репозиториев в истории платформы.
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
Harness сделан как оркестрационный слой, где почти всё можно заменить плагином:
• модель
• shell
• редактирование файлов
• web search
• skills
• storage
• sessions
• reasoning effort
• permission scope
• UI
• scheduling
Конфигурация собирается через YAML, а сам Harness запускается локально как web-приложение.
sub-agents можно подключить Claude Code, Codex или другие агенты как плагины и отправлять разные подзадачи туда, где они решаются лучше.
MIT-лицензия позволяет вообще не использовать API DeepSeek: можно подключить другого провайдера или собственную локальную модель.
Практически одновременно с релизом Harness DeepSeek подняла цену cache-hit input примерно в 6–12 раз.
А именно cached input особенно активно расходуют агентные циклы: каждый новый шаг снова тащит system prompt, историю и накопленный контекст.
То есть компания выпускает фреймворк, который делает агентные циклы массовыми, и в ту же неделю заметно повышает цену именно на тот тип токенов, который такие циклы потребляют больше всего.
https://github.com/deepseek-ai/deepseek-harness
🔥12❤7👍6