MACHINE VISION / ALGORITHMIC AESTHETICS
44 subscribers
870 photos
192 videos
5 files
1.32K links
http://algorithmic-aesthetics.art

Референсы и примеры работ в стиле Алгоритмической Эстетики

Dailyki Phygital+ team
Download Telegram
Статья под названием «Stealing Reasoning Traces from Proprietary LLM APIs» («Кража цепочек рассуждений из проприетарных API языковых моделей»), опубликованная исследователями в августе 2026 года (arXiv:2608.09867), посвящена критической уязвимости в архитектуре современных рассуждающих LLM (Reasoning LLMs).
Контекст и суть проблемы
Крупнейшие провайдеры (OpenAI, Anthropic, Google) скрывают пошаговый процесс рассуждений своих моделей (Chain-of-Thought / reasoning traces), чтобы защитить интеллектуальную собственность и предотвратить дистилляцию знаний конкурентами.
Чтобы не хранить эти данные на своей стороне, API возвращает цепочки рассуждений клиенту в виде зашифрованных блоков текста (encrypted blobs/blocks). При каждом новом запросе в рамках сессии клиент отправляет эти зашифрованные блоки обратно на сервер.
В чем заключается уязвимость?
Авторы обнаружили, что зашифрованные блоки рассуждений совместимы и взаимозаменяемы между разными сессиями, пользователями и даже разными моделями одного и того же провайдера.
Исследователи разработали атаку Decryption Jailbreak:
Перехватывается зашифрованный блок рассуждения, сгенерированный сильной защищенной моделью.
Этот блок подается на вход более слабой и менее защищенной модели того же провайдера.
Слабая модель расшифровывает и выдает весь скрытый Chain-of-Thought в открытом виде (в режиме открытого текста), обходя встроенные ограничения.
Четыре ключевых вектора атак
Обход антидистилляционной защиты (Distillation Attacks) Конкуренты могут извлекать скрытые цепочки рассуждений топовых моделей (продемонстрировано на API OpenAI, Anthropic и Google), чтобы обучать свои собственные системы.
Утечка конфиденциальных данных (Private Data Extraction) Разработчики часто публикуют логи сессий в открытых репозиториях, не подозревая, что скрыто внутри зашифрованных блоков. Сканировав 315 320 зашифрованных блоков из публичных историй, авторы извлекли 367 фрагментов персональных данных (PII) и 182 пары учетных данных (пароли/ключи API).
Раскрытие опасной информации (Jailbreaking) Даже если итоговый ответ модели безопасен и отклоняет вредоносный запрос, промежуточные цепочки рассуждений могут содержать опасную информацию. Расшифровка этого блока раскрывает её.
Скрытые инъекции промптов (Hidden Prompt Injections) Злоумышленники могут внедрять вредоносную нагрузку прямо внутрь зашифрованных блоков, отравляя агентурные системы (AI agents) так, что пользователь или первичный фильтр безопасности этого не заметит.
Рекомендации и решения
После ответственности и уведомления разработчиков (responsible disclosure), авторы предложили защитные меры:
Криптографическая привязка к контексту (Cryptographic Contextual Binding): шифрование блоков с привязкой к конкретному ID пользователя, сессии и модели, чтобы зашифрованный блок нельзя было подставить в другой запрос или передать другой модели.
Серверная защита и отзыв ключей: пересмотр архитектуры передачи Intermediate State между клиентом и сервером.


https://arxiv.org/abs/2608.09867
Оптимизация расходов на кодинговых агентов строится на двух рычагах: Harness сокращает количество передаваемых токенов и итераций, а Smart Routing снижает стоимость каждого конкретного токена за счет подбора оптимальной модели.
1. Как Harness снижает расходы (Экономия токенов)
Harness (обвязка агента) контролирует то, как LLM взаимодействует с кодом, файловой системой и терминалом. Плохой Harness передает в модель гигабайты лишнего контекста, а эффективный использует следующие механизмы:
Сжатие и фильтрация контекста (Context Pruning): При запуске тестов терминал может выдать тысячи строк логов. Неэффективный Harness отправляет в модель всё подряд. Эффективный — парсит вывод и передает модели только упавший стектрейс и конкретные 10–20 строк кода вокруг ошибки.
Кэширование промптов (Prompt Caching): Harness структурирует запросы так, чтобы базовый контекст репозитория и системные инструкции оставались статичными на протяжении всей сессии. Это позволяет задействовать KV-кэширование на стороне API провайдеров, снижая стоимость входящих токенов на 80–90%.
Компактные протоколы вызова инструментов (Tool Overheads): Для выполнения команд (прочитать файл, выполнить git status) тяжелые агенты генерируют раздутые JSON-схемы. Легковесные агенты (например, Pi) используют лаконичный текстовый синтаксис, экономя сотни токенов на каждом шаге.
Суммаризация истории: При длительной работе над задачей Harness автоматически сжимает проделанные шаги в краткое резюме, обрезая устаревшую историю диалога и предотвращая экспоненциальный рост длины контекста.
2. Как Smart Routing снижает расходы (Экономия на стоимости моделей)
Не все задачи требуют интеллекта топовых моделей стоимостью $15–$60 за миллион токенов. Smart Routing распределяет нагрузку по уровням сложности (Tiers):
Классификация задач (Task Tiering):
Простые задачи (добавление фиче-флага, обновление зависимостей, написание базовых unit-тестов) автоматически направляются на дешевые или открытые модели (GLM 5.2, DeepSeek-V3, Llama 3.3). Их стоимость в 10–30 раз ниже.
Сложные задачи (архитектурный рефакторинг, отладка межпотоковых гонок) отдаются флагманским моделям вроде Claude 3.7 Sonnet или GPT-4.5.
Каскадный метод (Escalation Strategy): Задача сначала отправляется дешевой и быстрой модели. Harness запускает linter и unit-тесты. Если тесты пройдены — задача закрыта с минимальными затратами. Если дешевая модель не справилась за 1-2 попытки, контекст автоматически передается («эскалируется») на тяжелую модель с включенным режимом рассуждений (Extended Thinking).
Динамический бюджет рассуждений (Reasoning Effort Routing): Маршрутизатор регулирует параметр количества токенов на «мыслительный процесс». На рутинных задачах reasoning отключается вовсе, а на сложных — выставляется максимум.
Совокупный экономический эффект
Компонент
Без оптимизации
С использованием Harness + Smart Routing
Объем контекста на шаг
50,000 – 100,000 токенов
5,000 – 15,000 токенов (за счет Pruning)
Стоимость 1000 токенов
$0.015 (только топовая LLM)
$0.001 – $0.003 (в среднем за счет Routing)
Повторные вызовы API
До 80% токенов платные
До 85% токенов идут из Prompt Cache (скидка 90%)
В совокупности сочетание умного обрезания контекста и динамо-маршрутизации моделей снижает итоговый чек за использование AI-агентов на 50–70%, сохраняя точность решения задач на уровне 95%+ от показателей самых дорогих систем.


https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase