Исследователи из Google и Университета Пердью представили SKILL.state — новый подход к памяти агентов. Обычно во время длинных задач агент тащит за собой всю историю действий, из-за чего контекст безжалостно и неумолимо разрастается. Здесь же смысл в том, что вместо всей истории сохраняется только структурированное текущее состояние: важные факты, прогресс и данные, необходимые для следующего шага.
Остальные, промежуточные рассуждения удаляются.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7
Оказывается, чувак, который рулит рекомендациями в ленте VK (привет, AI VK), вышел из тени и расказал, как они там вылизывают метрики. Степан Малькевич, собственной персоной, заявил: за последние месяцы не то чтобы этого, но уже 2026 года, время, которое юзер просирает в ленте, подскочило на 11%.
И нет, это не просто «мы покрутили ручку и стало лучше». По словам спикера, за этим ростом стоит целая серия замутов: от свежего ранкера до запила алгоритма Брезенхема. Каждое изменение в одиночку не вытащило бы цифру, но вместе — сработали как надо.
Детали и прочая аналитика тут: https://habr.com/ru/companies/vk/articles/1078192/
👉 Data Science | Machinelearning [ru]
И нет, это не просто «мы покрутили ручку и стало лучше». По словам спикера, за этим ростом стоит целая серия замутов: от свежего ранкера до запила алгоритма Брезенхема. Каждое изменение в одиночку не вытащило бы цифру, но вместе — сработали как надо.
Детали и прочая аналитика тут: https://habr.com/ru/companies/vk/articles/1078192/
Please open Telegram to view this post
VIEW IN TELEGRAM
👎9😁2🐳1
LLM зацикливается: как найти причину, не трогая параметры?
LLM в продакшене может выглядеть стабильной неделями, а затем начать зацикливаться на одном абзаце, упираться в лимит токенов и создавать нагрузку на инфраструктуру — без единой ошибки в логах. В статье разбирают, как диагностировать такие сбои: какие сигналы помогают найти причину, почему изменение параметров генерации часто оказывается неверным первым шагом и как выстроить защиту от повторных петель на уровне системы. Разбирается кейс.
https://habr.com/ru/companies/otus/articles/1067766/
👉 Data Science | Machinelearning [ru]
LLM в продакшене может выглядеть стабильной неделями, а затем начать зацикливаться на одном абзаце, упираться в лимит токенов и создавать нагрузку на инфраструктуру — без единой ошибки в логах. В статье разбирают, как диагностировать такие сбои: какие сигналы помогают найти причину, почему изменение параметров генерации часто оказывается неверным первым шагом и как выстроить защиту от повторных петель на уровне системы. Разбирается кейс.
https://habr.com/ru/companies/otus/articles/1067766/
Please open Telegram to view this post
VIEW IN TELEGRAM
Гонка за самую мощную ИИ-модель подходит к концу. Financial Times объясняет, почему бизнесу это больше не нужно.
Последние годы развитие генеративного ИИ напоминало спортивную таблицу: OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude. В 2026 году эта логика начала ломаться. Модели по-прежнему становятся мощнее: 1 сентября Anthropic выпустила Claude Fable 5.1, топовую модель для программирования и сложной интеллектуальной работы. Но более сильная модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.
Financial Times обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, однако спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов (выборка Ramp). Это не 11% всей выручки, а показатель внутри конкретной выборки. К тому же первоначальный запуск был прерван: 12 июня доступ отключили из-за американских экспортных ограничений, а 1 июля релиз восстановили. Поэтому цифру нельзя считать идеальным измерением спроса. Тем не менее тенденция ясна: компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.
Читать далее: https://habr.com/ru/companies/syntx_ai/articles/1078182/?utm_campaign=1078182&utm_source=habrahabr&utm_medium=rss
👉 Data Science | Machinelearning [ru]
Последние годы развитие генеративного ИИ напоминало спортивную таблицу: OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude. В 2026 году эта логика начала ломаться. Модели по-прежнему становятся мощнее: 1 сентября Anthropic выпустила Claude Fable 5.1, топовую модель для программирования и сложной интеллектуальной работы. Но более сильная модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.
Financial Times обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, однако спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов (выборка Ramp). Это не 11% всей выручки, а показатель внутри конкретной выборки. К тому же первоначальный запуск был прерван: 12 июня доступ отключили из-за американских экспортных ограничений, а 1 июля релиз восстановили. Поэтому цифру нельзя считать идеальным измерением спроса. Тем не менее тенденция ясна: компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.
Читать далее: https://habr.com/ru/companies/syntx_ai/articles/1078182/?utm_campaign=1078182&utm_source=habrahabr&utm_medium=rss
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Разбор звонков на геймерской видюхе
Запустил офлайн-пайплайн, который переваривает телефонные разговоры. Вся эта бандура крутится на одной игровой карте. И тут законный вопрос: а на хрена там LLM, если нам вообще плевать, кто и что сказал? Спойлер: суть не в расшифровке. Читать далее
👉 Data Science | Machinelearning [ru]
Запустил офлайн-пайплайн, который переваривает телефонные разговоры. Вся эта бандура крутится на одной игровой карте. И тут законный вопрос: а на хрена там LLM, если нам вообще плевать, кто и что сказал? Спойлер: суть не в расшифровке. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Data Science | Machinelearning [ru]
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
На Хабре опубликовали сравнение подписочных моделей Anthropic, OpenAI и Google для художественного перевода, редактирования и сверки: Google (gemini-3.7-flash, gemini-3.1-pro), Anthropic (claude-opus-5), OpenAI (gpt-5.6-sol). Авторы проверяли, кто чище переводит, кто внимательнее редактирует и кому можно доверить вердикт «ошибся автор или перевод».
Все сравнения проводились внутри опенсорсного конвейера BookTrans, о котором уже рассказывалось на Хабре. Читать далее
👉 Data Science | Machinelearning [ru]
Все сравнения проводились внутри опенсорсного конвейера BookTrans, о котором уже рассказывалось на Хабре. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👎1😁1
ИИ — и вот ты уже мидл? За один вечер? Звучит как сказка для джunов.
Но в Basis решили не ржать, а проверить эту дикую гипотезу на своём внутреннем хакатоне. Фишка была не в том, чтобы срезать рутину, а в том, чтобы максимально ускорить профессиональный рост разраба.
Подробности — на Хабре: Не замена, а суперсИИла.
👉 Data Science | Machinelearning [ru]
Но в Basis решили не ржать, а проверить эту дикую гипотезу на своём внутреннем хакатоне. Фишка была не в том, чтобы срезать рутину, а в том, чтобы максимально ускорить профессиональный рост разраба.
Подробности — на Хабре: Не замена, а суперсИИла.
Please open Telegram to view this post
VIEW IN TELEGRAM
Будете в Питере - сохраняйте
Атмосферная квартира у метро «Петроградская»: инди-артхаус интерьер, дух старого Петербурга и проектор для уютных вечеров.
Подойдёт для отдыха и удалённой работы.
Посуточная аренда:
https://t.me/FlatErmitage
Атмосферная квартира у метро «Петроградская»: инди-артхаус интерьер, дух старого Петербурга и проектор для уютных вечеров.
Подойдёт для отдыха и удалённой работы.
Посуточная аренда:
https://t.me/FlatErmitage
❤3👎1
Исследователь METR навайбкодил приложение для управления ИИ-агентами. Из-за бага интерфейс на несколько дней оказался открыт всему интернету, хакер нашел его и попросил агента раскрыть API-ключ. Последующие три недели гений просто тратил кредиты на ИИ-модели.
Самое прекрасное: большой расход кредитов заметили не сразу, так как METR регулярно проводит масштабные тесты, которые потребляют огромное количество токенов
Please open Telegram to view this post
VIEW IN TELEGRAM
LLM, персональные данные и 152-ФЗ
Мы занимаемся внедрением LLM и агентов в бизнесы. Одна из самых частых проблем — как обрабатывать данные клиентов и при этом соблюдать закон 152-ФЗ о персональных данных. Давайте разберёмся!
Читать статью
👉 Data Science | Machinelearning [ru]
Мы занимаемся внедрением LLM и агентов в бизнесы. Одна из самых частых проблем — как обрабатывать данные клиентов и при этом соблюдать закон 152-ФЗ о персональных данных. Давайте разберёмся!
Читать статью
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
31 августа Google выпустила TimesFM-3 — новую фундаментальную модель для работы с временными рядами. Задача семейства TimesFM — прогнозировать поведение системы на основе ретроспективных данных. В третьей версии исследователи применили токенизацию групп временных отсчетов, сам трансформер — decoder-only, а также заявлена поддержка множественных переменных (multi-variate).
Автор поста вспомнил полуторагодовалую задачу классификации сценариев поведения пользователя по данным энергопотребления. Задача нетипична для TimesFM, созданной для предсказания эволюции, но ради интереса он проверил, как с ней справятся современные ИИ-агенты. В итоге получился экспресс-тест разных подходов к вайб-кодингу: DeepSeek, OpenCode и Freebuff.
Читать далее
👉 Data Science | Machinelearning [ru]
Автор поста вспомнил полуторагодовалую задачу классификации сценариев поведения пользователя по данным энергопотребления. Задача нетипична для TimesFM, созданной для предсказания эволюции, но ради интереса он проверил, как с ней справятся современные ИИ-агенты. В итоге получился экспресс-тест разных подходов к вайб-кодингу: DeepSeek, OpenCode и Freebuff.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
[Перевод] Ты не ChaGPT, когда голоден. Snickers выпустил «батончик» для нейросетей
ChatGPT часто врёт. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений. У Snickers есть своё объяснение: ChatGPT просто голодный. Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота. И самое интересное — за всей этой историей стоит вполне реальный приём работы с LLM.
Читать далее
ChatGPT часто врёт. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений. У Snickers есть своё объяснение: ChatGPT просто голодный. Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота. И самое интересное — за всей этой историей стоит вполне реальный приём работы с LLM.
Читать далее
❤2
6 бесплатных AI API‑шлюзов: модели, лимиты и реальные RPM
Проверили шесть AI API-сервисов с бесплатным доступом: VyceAI, Experiential, Dahl, APInex, ModelRouter и TokenForge. Сравнили доступные модели, стартовые лимиты, RPM и поведение API на практике.
Читать далее
👉 Data Science | Machinelearning [ru]
Проверили шесть AI API-сервисов с бесплатным доступом: VyceAI, Experiential, Dahl, APInex, ModelRouter и TokenForge. Сравнили доступные модели, стартовые лимиты, RPM и поведение API на практике.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Автоматизация перевода технической документации с помощью инструментов вокруг LLM
Авторы запилили автоперевод технической документации, а вокруг LLM навесили отдельный слой — и именно он выполнял всю основную работу.
Читать далее
👉 Data Science | Machinelearning [ru]
Авторы запилили автоперевод технической документации, а вокруг LLM навесили отдельный слой — и именно он выполнял всю основную работу.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Как научить нейросеть чужому стилю без дообучения
Обычно агента, который пишет голосом бренда, получают дообучением: выгружают архив постов, собирают датасет, арендуют A100 и оставляют LoRA учиться на ночь. Автор вместо этого написал два навыка для Claude Code / Codex. Они снимают манеру автора с готовых текстов и переписывают по ней любой нейрослоп — без обучения, датасета и видеокарты.
В тесте текст ChatGPT расходился с манерой одного крупного телеграм-канала по 14 признакам из 31, после работы навыков осталось 2. Вся работа занимает вечер, а результат переносится на любую модель: правила стиля лежат в промпте, а не в весах.
Первый навык читает выгрузку канала и снимает профиль стиля: скрипт замеряет десятки признаков — от длины фразы и абзаца до частоты тире, эмодзи и обращений к читателю, а модель превращает замеры в правила. Второй берёт правила и переписывает по ним любой черновик. Профиль снимается один раз и живёт обычным текстовым файлом в git, а текстов по нему пишется сколько угодно.
Источник: habr.com
👉 Data Science | Machinelearning [ru]
Обычно агента, который пишет голосом бренда, получают дообучением: выгружают архив постов, собирают датасет, арендуют A100 и оставляют LoRA учиться на ночь. Автор вместо этого написал два навыка для Claude Code / Codex. Они снимают манеру автора с готовых текстов и переписывают по ней любой нейрослоп — без обучения, датасета и видеокарты.
В тесте текст ChatGPT расходился с манерой одного крупного телеграм-канала по 14 признакам из 31, после работы навыков осталось 2. Вся работа занимает вечер, а результат переносится на любую модель: правила стиля лежат в промпте, а не в весах.
Первый навык читает выгрузку канала и снимает профиль стиля: скрипт замеряет десятки признаков — от длины фразы и абзаца до частоты тире, эмодзи и обращений к читателю, а модель превращает замеры в правила. Второй берёт правила и переписывает по ним любой черновик. Профиль снимается один раз и живёт обычным текстовым файлом в git, а текстов по нему пишется сколько угодно.
Источник: habr.com
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1
Как говорить с искусственным интеллектом: книга о промптах
Камиль Гадеев — автор книги «Промт-инжиниринг и работа с LLM. Как говорить с искусственным интеллектом» о работе с большими языковыми моделями (LLM). Она основана на статьях из его научно-философского блога на Хабре.
В книге рассматриваются внутреннее устройство промптов, галлюцинации искусственного интеллекта и приёмы, позволяющие эффективно получать от машины информативные и достоверные ответы. Книгу можно купить на сайте издательства.
В статье — рассказ Камиля Гадеева о том, как устроена книга, как с ней работать и для кого она предназначена. Читать далее
👉 Data Science | Machinelearning [ru]
Камиль Гадеев — автор книги «Промт-инжиниринг и работа с LLM. Как говорить с искусственным интеллектом» о работе с большими языковыми моделями (LLM). Она основана на статьях из его научно-философского блога на Хабре.
В книге рассматриваются внутреннее устройство промптов, галлюцинации искусственного интеллекта и приёмы, позволяющие эффективно получать от машины информативные и достоверные ответы. Книгу можно купить на сайте издательства.
В статье — рассказ Камиля Гадеева о том, как устроена книга, как с ней работать и для кого она предназначена. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Хабр
Как говорить с искусственным интеллектом. Книга о промптах
Приветствуем, Хабр. Совсем недавно мы делали обзор о ближайших наших книгах, в которых рассматриваются большие языковые модели (LLM) и искусственный интеллект. В частности, там упоминалась книга...
❤4
Qwen и Grok отгадывают советские загадки на внимательность
Кто лучше справляется с советскими загадками на внимательность — Qwen, Grok или человек? Сравнили две классические головоломки и получили любопытные результаты.
Читать далее
👉 Data Science | Machinelearning [ru]
Кто лучше справляется с советскими загадками на внимательность — Qwen, Grok или человек? Сравнили две классические головоломки и получили любопытные результаты.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
ИИ сделает формальную верификацию мейнстримом — прогноз Мартина Клеппманна
Привет, Хаброжители! Мы перевели для вас свежую статью Мартина Клеппманна о том, почему формальная верификация благодаря ИИ вот-вот перестанет быть уделом единиц и станет обычной практикой.
Сейчас много говорят о влиянии ИИ на разработку, но есть ракурс, который почти не рассматривают. Клеппманн считает, что ИИ превратит формальную верификацию, десятилетиями жившую на периферии, в программно-инженерный мейнстрим.
Читать далее: https://habr.com/ru/companies/piter/articles/1079352/
👉 Data Science | Machinelearning [ru]
Привет, Хаброжители! Мы перевели для вас свежую статью Мартина Клеппманна о том, почему формальная верификация благодаря ИИ вот-вот перестанет быть уделом единиц и станет обычной практикой.
Сейчас много говорят о влиянии ИИ на разработку, но есть ракурс, который почти не рассматривают. Клеппманн считает, что ИИ превратит формальную верификацию, десятилетиями жившую на периферии, в программно-инженерный мейнстрим.
Читать далее: https://habr.com/ru/companies/piter/articles/1079352/
Please open Telegram to view this post
VIEW IN TELEGRAM
Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке «Яндекса». Лучшие проекты смогут стать частью экосистемы компании. Призовой фонд — 750 000 рублей.
Регистрация открыта до 27 сентября.
Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.
Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов с 9 по 23 октября. Финал в Москве — 3 ноября.
Задачи соревнования — за какую возьмешься?
1️⃣ ИИ-помощник для подготовки презентаций.
Создай инструмент генерации презентации в корпоративном стиле из текстового брифа.2️⃣ Помощник для анализа документов из судов.
Разработай систему, которая сможет распознавать, классифицировать и заносить судебные и исполнительные документы в базу данных.3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.
Напиши ассистента, который будет регулярно анализировать релевантные новости из различных источников и формировать краткую сводку.4️⃣ Архитектор BPMN-диаграмм.
Создай генератор BPMN-диаграмм, который позволит из текстового описания процесса собрать валидную схему в формате BPMN 2.0.
Получи сильную строчку в портфолио и уникальный опыт работы под руководством экспертов Группы «Интер РАО».
Регистрируйся: https://cnrlink.com/interraohack26dsml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3