Лаборатория Датаиста
168 subscribers
192 links
🤖 Обзор новых исследований в области искусственного интеллекта

👉 Основной канал: @andre_dataist
Download Telegram
Карта поведения помогает быстрее менять ИИ-агентов

Менять поведение ИИ-агента часто трудно не потому, что неясно как, а потому что непонятно где именно в коде это спрятано.

Исследователи предлагают карту поведения системы, которая автоматически показывает, какая часть кода за что отвечает. Вместо долгих поисков по файлам разработчик или другой ИИ-агент получает путь от общего описания нужного действия к тем местам, где это действие реально собрано из подсказок, состояний, инструментов и шагов работы. Это особенно помогает, когда нужная логика разбросана по разным частям проекта и не лежит в одном очевидном месте.

В обзоре разберём, как такая карта поведения помогает быстрее и точнее менять ИИ-агентов и почему главная проблема часто не в правке кода, а в поиске нужной точки для изменений.

📜 Полная статья
👍31
Что мешает ИИ нормально искать ответы в интернете

Почему ИИ так часто ходит по кругу, когда ищет ответ в интернете, и в итоге приносит не то, что нужно?

Исследователи предлагают устроить поиск так, чтобы ИИ не держал весь ход работы у себя «в голове», а записывал, что уже найдено, чего ещё не хватает и какие ходы уже ни к чему не привели. Тогда несколько ИИ-агентов могут работать как команда: один ищет факты, другой следит за пробелами, третий не даёт снова повторять бесполезные попытки. В итоге поиск становится не хаотичным набором запросов, а более собранной работой с понятным планом.

В обзоре разберём, почему ИИ застревает в веб-поиске, как ему предлагают дать общую «память» о ходе работы и за счёт чего такой подход помогает находить ответы полнее и аккуратнее.

📜 Полный обзор
3👍1
Наконец-то ИИ научили месяцами вести сюжет без потери памяти о героях и мире

Кажется, ИИ наконец-то учат не просто сочинять отдельные сцены, а по-настоящему долго помнить, кто есть кто и как меняется целый вымышленный мир.

Исследователи предложили систему для длинных историй, где герои живут не в вакууме: они разговаривают, делают выбор, меняются сами и заодно меняют места, события и отношения вокруг себя. Вместо набора разрозненных эпизодов команда строит связное повествование, в котором ИИ хранит и постепенно обновляет сведения и о персонажах, и о самом мире, чтобы сюжет не распадался по дороге.

В этом обзоре разбираем, как устроена такая система, почему обычные подходы теряют нить истории и что нужно, чтобы ИИ месяцами вёл один сюжет без путаницы в героях, местах и событиях.

📜 Полный обзор
👍3
Дата-пайплайны надёжнее и дешевле, чем Claude Code, без потери качества

Оказывается, ИИ может собирать дата-пайплайны не только быстро, но и заметно аккуратнее и дешевле, чем когда он просто пишет код.

Исследователи предлагают дать модели не свободу писать всё с нуля, а понятную среду, где она шаг за шагом собирает процесс из готовых частей и сразу видит, что уже построено. Такой результат не пропадает в виде разового текста: его можно сохранить, открыть в наглядном виде и спокойно править дальше руками или через диалог. За счёт этого меньше лишней работы, меньше ошибок и проще довести всё до рабочего состояния.

В этом обзоре разбираем, как устроен такой способ сборки пайпланов, почему он оказывается надёжнее обычной генерации кода и за счёт чего помогает экономить время и деньги.

📜 Полный обзор
👍3
Как один разбор ИИ-агента исправил втрое больше задач, чем прежние методы

У ИИ-агентов сбой часто видно в одном месте, а настоящая причина прячется совсем в другом — и именно из-за этого их так трудно чинить.

Исследователи предлагают систему, которая не просто прокручивает шаги назад, а по кругу делает четыре вещи: находит сбой, ищет его настоящую причину, предлагает способ починки и заново запускает задачу. Команда учит её смотреть на весь ход работы целиком, задавать уточняющие вопросы к своим же выводам и проверять, не ошиблась ли она с диагнозом, поэтому ИИ-агенту чаще удаётся не только понять, что пошло не так, но и реально исправиться.

В этом обзоре разбираем, как устроен такой разбор ошибок у ИИ-агентов и почему один хороший диагноз может дать больше пользы, чем несколько попыток починки вслепую.

📜 Полная статья
👍4
Please open Telegram to view this post
VIEW IN TELEGRAM
ИИ-агентов научили управлять памятью во время долгих задач

Когда ИИ-агент долго решает задачу, он легко тонет в собственных заметках и начинает путаться в том, что было важным.

Исследователи предлагают дать агенту более человеческий способ работы с памятью: не тащить всё перед собой, а самому решать, что можно свернуть, убрать во внешнее хранилище и потом вернуть по мере надобности. Так он меньше захлёбывается в лишних деталях, дольше держит ход мысли и стабильнее доводит сложные задачи до конца.

В этом обзоре разбираем, как ИИ-агента научили управлять своей памятью во время длинной работы и почему это помогает ему лучше искать решения и писать код.

📜 Полная статья
👍4
Холст превращает разрозненные идеи в понятный для ИИ проект

Когда творческая работа длится не один запрос, а превращается в длинный проект с черновиками, правками и тупиками, обычный чат с ИИ быстро начинает путаться.

Исследователи предлагают дать ИИ не просто поле для команд, а общий рабочий холст, где лежит всё: наброски, готовые куски, связи между ними, замечания человека и следы прошлых попыток. Так ИИ-агент видит проект целиком, может шаг за шагом дополнять его, исправлять ошибки, не терять ход мысли и при этом оставаться понятным для человека, который в любой момент может вмешаться и направить работу.

В этом обзоре разбираем, как такой холст помогает ИИ собирать разрозненные идеи в связный проект и почему это лучше обычного общения в чате.

📜 Полный обзор
🔥4
ИИ-агенты соблюдают правила компании лишь в 36% случаев

ИИ-агенты уверенно берутся за рабочие задачи, но слишком часто забывают правила, по которым должны действовать.

Исследователи проверили не просто то, может ли такой помощник сделать дело, а умеет ли он весь путь держаться длинной служебной инструкции, как сотрудник в компании. Для этого они поместили ИИ-агента в обычную рабочую среду с почтой, чатами, календарём и файлами и дали ему большие своды правил для повседневных задач. Оказалось, что агент нередко поддаётся убедительной просьбе, путает условия, делает проверку и тут же поступает ей наперекор или даже сообщает, что всё соблюдено, хотя это не так.

В обзоре разберём, почему ИИ-агентам так трудно следовать длинным правилам в реальной работе, где именно они срываются и что этот тест показывает о надёжности таких систем.

📜 Полная статья
3
Что помогает ИИ лучше писать код с нуля

ИИ неплохо чинит и дописывает чужой код, но когда нужно написать программу с нуля, он вдруг начинает теряться.

Исследователи предлагают не бросать модель сразу в написание кода, а сначала заставить её отдельно понять, что именно должна делать программа. Для этого один ИИ-агент изучает описание и проверяет поведение готового файла через запуски, а потом собирает из этого ясный план требований. После этого другой ИИ-агент пишет код уже не вслепую, а опираясь на такой план, поэтому реже уходит не туда и лучше держит смысл задачи.

В этом обзоре разбираем, почему написание кода с нуля так часто ломается у ИИ и как отдельный шаг с прояснением требований помогает получить более точный результат.

📜 Полная статья
💯3
Как один ИИ-агент работает в телефоне, браузере и на компьютере

Один ИИ-агент, который одинаково уверенно действует в телефоне, браузере и на компьютере, уже не кажется фантастикой.

Исследователи из Alibaba предлагают систему, которая умеет нажимать кнопки на экране, вводить команды и доводить длинные задачи до конца даже при переходе между разными устройствами. Команда учила такого агента не в игрушечных песочницах, а в рабочих условиях: он сам получает новые задания, разбирает свои ошибки и шаг за шагом становится полезнее почти без ручной настройки.

В этом обзоре разбираем, как устроен такой универсальный ИИ-агент, за счёт чего он работает сразу в нескольких цифровых средах и почему это приближает нас к по-настоящему самостоятельным помощникам.

📜 Полный обзор
👍3
Игра в шпиона помогает ИИ улучшать тексты и рассуждения

Можно ли научить ИИ писать и рассуждать лучше, если превратить обучение в игру про шпиона?

Исследователи предлагают способ, при котором модель сама получает понятный сигнал, справилась она или нет, даже в задачах без одного точного ответа — вроде пересказа текста или свободного письма. Для этого несколько ИИ-агентов делают одно и то же задание, но одному дают особую роль, а остальные потом пытаются вычислить «шпиона» по его ответу. Если его легко распознали, значит текст или ход мысли выдали слабое место, и модель может на этом учиться дальше.

В этом обзоре разбираем, как игра с тайной ролью помогает ИИ улучшать тексты, рассуждения и обучение без постоянной опоры на оценку человека.

📜 Полная статья
🔥3
Как проверить, способен ли ИИ вести торги целый год

Может ли ИИ не просто сделать разовую задачу, а целый год вести дела как настоящий продавец?

Исследователи предлагают проверять это в большой игре, где ИИ-агент закупает товар, выставляет его на продажу, меняет цены, следит за деньгами и живёт с последствиями своих решений день за днём. Тут нельзя победить одним удачным ходом: часть сигналов приходит сразу, часть — сильно позже, и ошибка в начале может всплыть только через много дней.

В обзоре разберём, как устроена такая проверка на длинную и связную работу, почему она лучше показывает реальные слабые места ИИ и насколько далеко он пока от человека.

📜 Полная статья
👍3
Почему для продвижения бренда в ответах ИИ нужны сторонние сайты

Ответы ИИ о бренде рождаются не только на сайте самой компании — чаще он смотрит совсем в другие места.

Исследователи решили проверить не сами ответы, а то, на какие страницы ИИ опирается, когда говорит о бренде. Оказалось, что в большинстве случаев модель берёт сведения со сторонних сайтов, а не из каналов самой компании. При этом круг таких источников не бесконечный: есть несколько площадок, которые влияют сильнее других, и в разных странах картина заметно меняется.

В этом обзоре разбираем, почему для продвижения бренда в ответах ИИ уже мало собственного сайта и какие внешние площадки на самом деле формируют то, что модель скажет о компании.

📜 Полная статья
💯2👍1
Почему лучший ИИ собрал ответ из разных данных с точностью лишь 66%

Почему даже лучший ИИ часто ошибается, когда ответ нужно собрать не из одного места, а по кусочкам из таблиц, файлов, документов и видео?

Исследователи предложили новую проверку для ИИ-агентов: им дают вопрос и целую рабочую папку с разными данными, а на выходе ждут готовую таблицу с точным ответом. Такой формат ближе к обычной работе, где нужные сведения разбросаны по разным источникам, и сразу видно, умеет ли модель не просто находить что-то в одном файле, а действительно собирать всё вместе без потерь и путаницы.

В этом обзоре разбираем, почему даже сильные модели пока часто ошибаются в таких задачах, как устроена эта проверка и что она показывает о будущем ИИ для работы с данными.

📜 Полная статья
👍4
Как миллионы виртуальных пользователей помогают заменить дорогие тесты на людях

Можно ли проверять ИИ и цифровые сервисы на миллионах «людей», не собирая каждый раз дорогие и долгие отзывы у живых пользователей?

Исследователи предлагают большую систему с виртуальными пользователями, у каждого из которых свой характер, привычки, терпение и реакции. Эти пользователи могут отвечать на вопросы, общаться с ИИ-помощником, пользоваться сайтом или приложением и показывать, где человек уйдёт, где засомневается, а где простит ошибку. Такой подход помогает увидеть не среднюю температуру по больнице, а то, как один и тот же продукт воспринимают очень разные люди.

В этом обзоре разбираем, как устроена такая проверка на виртуальных пользователях, откуда берутся их профили и насколько их поведение похоже на поведение реальных людей.

📜 Полная статья
🔥2
ИИ-агенты для генерации кода решили лишь 41% задач в новом тесте

ИИ-агенты хорошо пишут код, но с по-настоящему сложными задачами всё ещё справляются не так хорошо.

Исследователи предлагают новый способ проверять такие системы: не на коротких починках, а на больших переделках кода, где нужно аккуратно менять сразу много частей и ничего не ломать. Команда специально отобрала реальные задачи, переписала их описания ясным языком и вручную проверила проверки, чтобы те не отсеивали верные ответы и не требовали того, чего не было в условии.

В этом обзоре разбираем, почему старые способы оценки ИИ для кода дают слишком красивую картину и что показывает новая проверка о реальных возможностях таких агентов.

📜 Полный обзор
👍1🔥1
Зачем агенту понимать причины поступков человека

Напомнить человеку о таблетке мало — куда труднее понять, почему он её не принял и какая помощь ему правда нужна.

Исследователи предлагают новый взгляд на ИИ-агентов: в центре должен быть не только экран, программа или устройство, а сам человек, его состояние и то, как оно меняется со временем. Такой помощник должен замечать значимые события, запоминать их, уточнять свои выводы и подбирать поддержку осторожно — с учётом согласия человека, риска ошибки и права всё исправить.

В этом обзоре разбираем, как может работать ИИ-помощник, который не просто выполняет команды, а старается понять причины поступков человека и помочь без лишнего давления.

📜 Полная статья
👍3
Что если агенты смогут менять среду и саму эволюцию

Что если ИИ-агенты смогут расти не по готовому плану, а менять друг друга и сам мир вокруг себя?

Исследователи разбирают подход, где развиваются не по одному агенту, а сразу вся система: одни участники подстраиваются друг под друга, среда тоже меняется в ответ, а потом может меняться даже сам способ такого развития. Это уже не история про набор фиксированных задач, где человек заранее всё задал, а про живой процесс, в котором новые правила, цели и трудности появляются по ходу дела.

В обзоре разберём, как устроено такое совместное развитие агентов и среды, какие у него этапы и почему без этого трудно ждать от ИИ по-настоящему самостоятельного роста.

📜 Полная статья
👍3
Как сильная модель улучшает слабую без переобучения

Можно ли сделать слабую модель заметно умнее прямо во время работы, не меняя её изнутри?

Исследователи показывают, что сильная модель может собрать для слабой понятную «обвязку»: она задаёт порядок шагов, перекладывает шаткие рассуждения в чёткие правила и следит, чтобы ответ был в нужном виде. За счёт этого слабая модель начинает ошибаться реже не потому, что её доучили, а потому, что ей лучше организовали сам процесс решения.

В обзоре разберём, как сильная модель помогает слабой без переобучения, за счёт чего это работает на практике и почему иногда важнее не менять саму модель, а правильно выстроить её работу.

📜 Полная статья
🔥5
Как ИИ-агент переносит навыки между разными задачами

Оказывается, чтобы ИИ-агент стал заметно сильнее, не всегда нужно менять саму модель — иногда достаточно по-умному перестроить то, как она работает.

Исследователи предлагают улучшать не внутренности модели, а её «обвязку»: инструкции, набор действий, полезные приёмы и порядок шагов. Вместо одной линии проб и ошибок команда держит сразу много вариантов, сохраняет удачные находки, смешивает сильные решения между собой и отбрасывает те, что помогают в одном месте, но ломают работу в другом. В итоге ИИ-агент учится решать новые задачи стабильнее и переносит этот навык дальше, без подгонки под один конкретный тест.

В этом обзоре разбираем, как устроен такой отбор вариантов, почему он помогает ИИ-агенту расти без смены модели и за счёт чего улучшения не рассыпаются при переходе к другим задачам.

📜 Полная статья