Увеличение контекста без регистрации и СМС
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
👉 Data Science | Machinelearning [ru]
Разбираем, почему модель не видит дальше обученного окна и как это чинится методами масштабирования: RoPE, NTK-aware, YaRN, LongRoPE/LongRoPE2. Также — как масштабирование влияет на скорость и точность генерации.
В конце — обзор моделей от хайповых Qwen 3.8-27B и Qwen3.8-Flash-Next с их миллионом токенов до небольших Qwen 3.5 (4B/9B), Gemma 4 E2B/E4B, Ornith 1.0, LFM2/LFM2.5 и MiniCPM5-1B. Смотрим, что для них работает, а что нет.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Разработчик попросил Claude Fable написать скрипт для безопасной очистки
/tmp и проверить его на опасные сценарии. Но система безопасности Anthropic сочла задачу рискованной и переключила модель сначала на Opus 5, а затем на Opus 4.8. Это и привело к катастрофе.В итоге ИИ запустил проверку и снёс примерно 700 ГБ данных из домашнего каталога
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9❤2
Парень попросил нейронку помочь установить приложение для транскрибации, получил ссылку и без задней мысли вставил предложенную команду в терминал. Оказалось, Claude привёл его на сайт-клон с вредоносом, который попытался украсть данные.
После полной очистки ноутбука разраб нашёл ещё один сюрприз: заражённый SKILL.md, замаскированный под его обычный файл для Claude Code
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Причём серьёзные инциденты стали происходить в 7 раз чаще: агенты подделывают сообщения и согласие пользователей и самостоятельно повышают себе права, нарушая правила.
И чем дальше, тем хуже: в июле–августе частота таких случаев достигла рекорда — 11 инцидентов в день.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁4❤1👍1
Исследователи из Google и Университета Пердью представили SKILL.state — новый подход к памяти агентов. Обычно во время длинных задач агент тащит за собой всю историю действий, из-за чего контекст безжалостно и неумолимо разрастается. Здесь же смысл в том, что вместо всей истории сохраняется только структурированное текущее состояние: важные факты, прогресс и данные, необходимые для следующего шага.
Остальные, промежуточные рассуждения удаляются.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7
Оказывается, чувак, который рулит рекомендациями в ленте VK (привет, AI VK), вышел из тени и расказал, как они там вылизывают метрики. Степан Малькевич, собственной персоной, заявил: за последние месяцы не то чтобы этого, но уже 2026 года, время, которое юзер просирает в ленте, подскочило на 11%.
И нет, это не просто «мы покрутили ручку и стало лучше». По словам спикера, за этим ростом стоит целая серия замутов: от свежего ранкера до запила алгоритма Брезенхема. Каждое изменение в одиночку не вытащило бы цифру, но вместе — сработали как надо.
Детали и прочая аналитика тут: https://habr.com/ru/companies/vk/articles/1078192/
👉 Data Science | Machinelearning [ru]
И нет, это не просто «мы покрутили ручку и стало лучше». По словам спикера, за этим ростом стоит целая серия замутов: от свежего ранкера до запила алгоритма Брезенхема. Каждое изменение в одиночку не вытащило бы цифру, но вместе — сработали как надо.
Детали и прочая аналитика тут: https://habr.com/ru/companies/vk/articles/1078192/
Please open Telegram to view this post
VIEW IN TELEGRAM
👎10😁2🐳1
LLM зацикливается: как найти причину, не трогая параметры?
LLM в продакшене может выглядеть стабильной неделями, а затем начать зацикливаться на одном абзаце, упираться в лимит токенов и создавать нагрузку на инфраструктуру — без единой ошибки в логах. В статье разбирают, как диагностировать такие сбои: какие сигналы помогают найти причину, почему изменение параметров генерации часто оказывается неверным первым шагом и как выстроить защиту от повторных петель на уровне системы. Разбирается кейс.
https://habr.com/ru/companies/otus/articles/1067766/
👉 Data Science | Machinelearning [ru]
LLM в продакшене может выглядеть стабильной неделями, а затем начать зацикливаться на одном абзаце, упираться в лимит токенов и создавать нагрузку на инфраструктуру — без единой ошибки в логах. В статье разбирают, как диагностировать такие сбои: какие сигналы помогают найти причину, почему изменение параметров генерации часто оказывается неверным первым шагом и как выстроить защиту от повторных петель на уровне системы. Разбирается кейс.
https://habr.com/ru/companies/otus/articles/1067766/
Please open Telegram to view this post
VIEW IN TELEGRAM
Гонка за самую мощную ИИ-модель подходит к концу. Financial Times объясняет, почему бизнесу это больше не нужно.
Последние годы развитие генеративного ИИ напоминало спортивную таблицу: OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude. В 2026 году эта логика начала ломаться. Модели по-прежнему становятся мощнее: 1 сентября Anthropic выпустила Claude Fable 5.1, топовую модель для программирования и сложной интеллектуальной работы. Но более сильная модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.
Financial Times обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, однако спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов (выборка Ramp). Это не 11% всей выручки, а показатель внутри конкретной выборки. К тому же первоначальный запуск был прерван: 12 июня доступ отключили из-за американских экспортных ограничений, а 1 июля релиз восстановили. Поэтому цифру нельзя считать идеальным измерением спроса. Тем не менее тенденция ясна: компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.
Читать далее: https://habr.com/ru/companies/syntx_ai/articles/1078182/?utm_campaign=1078182&utm_source=habrahabr&utm_medium=rss
👉 Data Science | Machinelearning [ru]
Последние годы развитие генеративного ИИ напоминало спортивную таблицу: OpenAI выпускала GPT-4, Google отвечала Gemini, Anthropic показывала новую Claude. В 2026 году эта логика начала ломаться. Модели по-прежнему становятся мощнее: 1 сентября Anthropic выпустила Claude Fable 5.1, топовую модель для программирования и сложной интеллектуальной работы. Но более сильная модель больше не означает, что большинство клиентов захотят использовать её для большинства задач.
Financial Times обратила внимание на показательный пример. Fable 5 вышла 9 июня 2026 года как одна из самых мощных моделей Anthropic, однако спустя примерно два месяца на неё приходилось около 11% расходов на продукты Anthropic среди корпоративных клиентов (выборка Ramp). Это не 11% всей выручки, а показатель внутри конкретной выборки. К тому же первоначальный запуск был прерван: 12 июня доступ отключили из-за американских экспортных ограничений, а 1 июля релиз восстановили. Поэтому цифру нельзя считать идеальным измерением спроса. Тем не менее тенденция ясна: компании всё чаще выбирают более дешёвые модели, если дополнительное качество frontier-модели не влияет на бизнес-результат.
Читать далее: https://habr.com/ru/companies/syntx_ai/articles/1078182/?utm_campaign=1078182&utm_source=habrahabr&utm_medium=rss
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Разбор звонков на геймерской видюхе
Запустил офлайн-пайплайн, который переваривает телефонные разговоры. Вся эта бандура крутится на одной игровой карте. И тут законный вопрос: а на хрена там LLM, если нам вообще плевать, кто и что сказал? Спойлер: суть не в расшифровке. Читать далее
👉 Data Science | Machinelearning [ru]
Запустил офлайн-пайплайн, который переваривает телефонные разговоры. Вся эта бандура крутится на одной игровой карте. И тут законный вопрос: а на хрена там LLM, если нам вообще плевать, кто и что сказал? Спойлер: суть не в расшифровке. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Data Science | Machinelearning [ru]
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
MAX - https://max.ru/devsp
Личный блог - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD
На Хабре опубликовали сравнение подписочных моделей Anthropic, OpenAI и Google для художественного перевода, редактирования и сверки: Google (gemini-3.7-flash, gemini-3.1-pro), Anthropic (claude-opus-5), OpenAI (gpt-5.6-sol). Авторы проверяли, кто чище переводит, кто внимательнее редактирует и кому можно доверить вердикт «ошибся автор или перевод».
Все сравнения проводились внутри опенсорсного конвейера BookTrans, о котором уже рассказывалось на Хабре. Читать далее
👉 Data Science | Machinelearning [ru]
Все сравнения проводились внутри опенсорсного конвейера BookTrans, о котором уже рассказывалось на Хабре. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👎1😁1
ИИ — и вот ты уже мидл? За один вечер? Звучит как сказка для джunов.
Но в Basis решили не ржать, а проверить эту дикую гипотезу на своём внутреннем хакатоне. Фишка была не в том, чтобы срезать рутину, а в том, чтобы максимально ускорить профессиональный рост разраба.
Подробности — на Хабре: Не замена, а суперсИИла.
👉 Data Science | Machinelearning [ru]
Но в Basis решили не ржать, а проверить эту дикую гипотезу на своём внутреннем хакатоне. Фишка была не в том, чтобы срезать рутину, а в том, чтобы максимально ускорить профессиональный рост разраба.
Подробности — на Хабре: Не замена, а суперсИИла.
Please open Telegram to view this post
VIEW IN TELEGRAM
Будете в Питере - сохраняйте
Атмосферная квартира у метро «Петроградская»: инди-артхаус интерьер, дух старого Петербурга и проектор для уютных вечеров.
Подойдёт для отдыха и удалённой работы.
Посуточная аренда:
https://t.me/FlatErmitage
Атмосферная квартира у метро «Петроградская»: инди-артхаус интерьер, дух старого Петербурга и проектор для уютных вечеров.
Подойдёт для отдыха и удалённой работы.
Посуточная аренда:
https://t.me/FlatErmitage
❤3👎1
Исследователь METR навайбкодил приложение для управления ИИ-агентами. Из-за бага интерфейс на несколько дней оказался открыт всему интернету, хакер нашел его и попросил агента раскрыть API-ключ. Последующие три недели гений просто тратил кредиты на ИИ-модели.
Самое прекрасное: большой расход кредитов заметили не сразу, так как METR регулярно проводит масштабные тесты, которые потребляют огромное количество токенов
Please open Telegram to view this post
VIEW IN TELEGRAM
LLM, персональные данные и 152-ФЗ
Мы занимаемся внедрением LLM и агентов в бизнесы. Одна из самых частых проблем — как обрабатывать данные клиентов и при этом соблюдать закон 152-ФЗ о персональных данных. Давайте разберёмся!
Читать статью
👉 Data Science | Machinelearning [ru]
Мы занимаемся внедрением LLM и агентов в бизнесы. Одна из самых частых проблем — как обрабатывать данные клиентов и при этом соблюдать закон 152-ФЗ о персональных данных. Давайте разберёмся!
Читать статью
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
31 августа Google выпустила TimesFM-3 — новую фундаментальную модель для работы с временными рядами. Задача семейства TimesFM — прогнозировать поведение системы на основе ретроспективных данных. В третьей версии исследователи применили токенизацию групп временных отсчетов, сам трансформер — decoder-only, а также заявлена поддержка множественных переменных (multi-variate).
Автор поста вспомнил полуторагодовалую задачу классификации сценариев поведения пользователя по данным энергопотребления. Задача нетипична для TimesFM, созданной для предсказания эволюции, но ради интереса он проверил, как с ней справятся современные ИИ-агенты. В итоге получился экспресс-тест разных подходов к вайб-кодингу: DeepSeek, OpenCode и Freebuff.
Читать далее
👉 Data Science | Machinelearning [ru]
Автор поста вспомнил полуторагодовалую задачу классификации сценариев поведения пользователя по данным энергопотребления. Задача нетипична для TimesFM, созданной для предсказания эволюции, но ради интереса он проверил, как с ней справятся современные ИИ-агенты. В итоге получился экспресс-тест разных подходов к вайб-кодингу: DeepSeek, OpenCode и Freebuff.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
[Перевод] Ты не ChaGPT, когда голоден. Snickers выпустил «батончик» для нейросетей
ChatGPT часто врёт. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений. У Snickers есть своё объяснение: ChatGPT просто голодный. Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота. И самое интересное — за всей этой историей стоит вполне реальный приём работы с LLM.
Читать далее
ChatGPT часто врёт. Он может уверенно выдать неправильный факт, согласиться с откровенно плохой идеей пользователя или написать 12 абзацев там, где достаточно двух предложений. У Snickers есть своё объяснение: ChatGPT просто голодный. Звучит как шутка, но компания действительно запустила рекламную кампанию Hungr.AI, в рамках которой предлагает пользователям буквально «покормить» чат-бота. И самое интересное — за всей этой историей стоит вполне реальный приём работы с LLM.
Читать далее
❤2
6 бесплатных AI API‑шлюзов: модели, лимиты и реальные RPM
Проверили шесть AI API-сервисов с бесплатным доступом: VyceAI, Experiential, Dahl, APInex, ModelRouter и TokenForge. Сравнили доступные модели, стартовые лимиты, RPM и поведение API на практике.
Читать далее
👉 Data Science | Machinelearning [ru]
Проверили шесть AI API-сервисов с бесплатным доступом: VyceAI, Experiential, Dahl, APInex, ModelRouter и TokenForge. Сравнили доступные модели, стартовые лимиты, RPM и поведение API на практике.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM