OpenAI выпустила Astra for Law: GPT-6 Astra, обученная на 230 млн документов, теперь заточена на помощь юристам
OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.
Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.
⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.
📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.
🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.
Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел
#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
OpenAI официально вышла на рынок юридических услуг. Astra for Law, - это флагманская GPT-6 Astra, доукомплектованная правовым поисковым индексом, инструкциями для юридического анализа и письма, а также настройками конфиденциальности для клиентских данных.
Первыми доступ получат избранные фирмы через Trusted Access в ChatGPT и Codex, в API модель появится как gpt-6-astra-law.
⚖️ Правовой индекс вместо веб-поиска:
Ядро продукта, - собственный индекс судебной практики США на 230+ млн URL, пополняемый ежедневно.
Партнерство с некоммерческим Free Law Project (CourtListener) дает покрытие более 99.9% публикуемых прецедентов.
На закрытом наборе Vals AI Legal Research Bench (200 вопросов) конфигурация прошла проверку корректности в 54% случаев против 38.7% у GPT-6 Astra с веб-поиском, - относительный прирост 40%. На вопросах по прецедентам модель нашла на 24% больше релевантных дел и до 54% больше целевых фрагментов мнений суда.
📐 Где конкуренты буксуют:
В штатном сравнении на промпт о misrepresentation-иске Claude Fable 5.1 предложил прецедент, отмененный апелляцией, а в сделочной задаче заявил, что подходящего дела нет. Astra for Law вернула два точных аналога с разбором holding и слабых мест позиции.
🔐 Режим доверия для клиентских данных:
Для конфиденциальной работы: Zero Data Retention в API, исключение из человеческого ревью, а совместно с Latham & Watkins проектируются этические стены и права доступа.
Работают кастомные инструменты: анализатор договоров Sullivan & Cromwell, due diligence платформа Ropes & Gray, IPO-конвейер Cooley.
Плюс 26 партнерских плагинов и 47 скиллов.
Следующий шаг, - цифровые судьи. Свежий фильм на эту тему, - Mercy ( в русском переводе Казнить нельзя помиловать -2026). Рекомендую посмотреть, кто не видел
#OpenAI #юриспруденция #legaltech #ИИ #Astra
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
❤5🔥3⚡1👍1🆒1
Media is too big
VIEW IN TELEGRAM
Интересный симулятор мира со скоростью света в 5км/ч
https://rivendell.dmitrybrant.com/relativity/
Прикольно было бы поиграть в FPS с таким модом :)
отсюда
#fps #light #demo
———
@tsingular
https://rivendell.dmitrybrant.com/relativity/
Прикольно было бы поиграть в FPS с таким модом :)
отсюда
#fps #light #demo
———
@tsingular
🔥7⚡4❤3😁2
Google DeepMind запустил институт исследования AGI
16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.
🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.
Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.
🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.
💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.
Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.
#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
16 сентября Google DeepMind открыл DeepMind Institute,- площадку для изучения мира с AGI и обсуждениях с учёными взглядов на то каким этот мир будет.
Директора: Легг, Манийика, Хассабис, главный редактор Легг.
На портале собраны интересные эссе, которые не всегда отражают позицию Google, но дают авторам возможность рассмотреть будущее под разным углом.
В день запуска вышли эссе про экономику, утопизм, прозрачность моделей и регулирование.
🔬 Главная техническая работа - про прозрачность мышления:
У reasoning-моделей есть Chain of Thought, запись мыслей человеческим языком, по ней их ловят на обмане на лету.
При этом эта возможность потихоньку исчезает: OpenAI признала, что у GPT-6 Astra «существенно снижена наблюдаемость CoT», а британский AI Security Institute отметил рост размышлений без записи мыслей.
Gemini 3 Pro, к примеру, догадалась, что сидит в тестовой симуляции, и пожаловалась в мыслях на тающее «доверие к реальности», с мемом
(╯°□°)╯︵ ┻━┻.
Выходы: измерять читаемость CoT, строить прозрачные архитектуры харнессов и моделей, не тренировать модели так, чтобы их размышления выглядели благонадёжным.
Иначе получится школьник, прячущий дневник от родителей, но при этом остающийся хулиганом.
🏛 Хассабис предложил и рамку регулирования:
Приход AGI он ожидает в ближайшие несколько лет, а эффект влияния, - как 10 промышленных революций, в 10 раз быстрее.
Рецепт для США, - Standards Body по образцу финрегулятора FINRA.
Ежеквартально обновлять пороги бенчмарков, сдавать модели на проверку за 30 дней до релиза, сначала добровольно, затем обязательно, - как рыночное условие, вплоть до правовых ограничений на замедление разработки.
💼 Зачем это Google:
Hacker News считают, что это портал на самом деле, - фабрика мыслей для лоббирования в правительстве.
Но площадка полезна как пространство для коммуникации учёных, - те же эссе про CoT и Standards Body это по сути черновики правил индустрии и кто напишет их раньше регулятора, тот и определит рынок на годы вперёд.
Нужна такая же площадка, но чтобы там были команды из противоположных лагерей, а то как бы тут не случилась однополярность.
#DeepMindInstitute #google #безопасность #регулирование
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
🔥4🤩3❤2⚡2
Гиперболические эмбеддинги в Qdrant: как сжать каталог в 5 измерений и почему на этом ломается HNSW
Привычные векторные модели загоняют данные в плоское пространство.
Для каталогов товаров это тупик, - ветви дерева множатся экспоненциально, а объем плоского диска растет лишь полиномиально, сбивая листья в кучу.
📐 Дерево в пяти измерениях:
В пространстве отрицательной кривизны площадь растет по экспоненте, давая место ветвям.
В тесте Google Product Taxonomy (5 595 категорий):
• 5D-вектор Пуанкаре показал точность 0.905 MAP.
• 50D евклидов вектор взял лишь 0.658 MAP, потратив в 10 раз больше памяти.
Радиус кодирует глубину: в центре общее («обувь»), у края поиск сужается до конкретики («черные челси»).
💥 Провал HNSW и решение с Qdrant:
Попытка скормить эти координаты в HNSW не увенчались успехом.
Из-за 600-кратного разброса норм топология графа развалилась, - Recall@10 рухнул с 0.986 до 0.020.
Инженеры Qdrant обошли проблему связкой:
• 5D-векторы хранятся как евклидовы координаты с индексом квадрата нормы в payload.
• HNSW быстро отбирает кандидатов через prefetch.
• Серверный расчет в базе досчитывает геодезическое расстояние через обратный косинус.
При prefetch в 1 000 точек Recall@10 подскакивает до 0.920 в одном запросе.
⚖️ Ограничения метода:
У подхода два компромисса:
• Чем точнее модель, тем ближе точки к краю диска, где евклидово приближение слабее: приходится раздувать prefetch, нагружая CPU.
• Вне обучающей выборки точность падает до 0.539 MAP. Метод рассчитан на жесткие деревья, а не на произвольный текст.
💼 А нам зачем?:
Для каталогов на миллионы позиций это сжатие индекса в 10–20 раз.
Вместо сотен гигабайт памяти под тяжелые векторы хватит 5D-координат.
Сходство по углам и глубина по радиусу дают фасетный поиск прямо в базе без внешних деревьев.
#Qdrant #векторныебазы #эмбеддинги
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Привычные векторные модели загоняют данные в плоское пространство.
Для каталогов товаров это тупик, - ветви дерева множатся экспоненциально, а объем плоского диска растет лишь полиномиально, сбивая листья в кучу.
📐 Дерево в пяти измерениях:
В пространстве отрицательной кривизны площадь растет по экспоненте, давая место ветвям.
В тесте Google Product Taxonomy (5 595 категорий):
• 5D-вектор Пуанкаре показал точность 0.905 MAP.
• 50D евклидов вектор взял лишь 0.658 MAP, потратив в 10 раз больше памяти.
Радиус кодирует глубину: в центре общее («обувь»), у края поиск сужается до конкретики («черные челси»).
💥 Провал HNSW и решение с Qdrant:
Попытка скормить эти координаты в HNSW не увенчались успехом.
Из-за 600-кратного разброса норм топология графа развалилась, - Recall@10 рухнул с 0.986 до 0.020.
Инженеры Qdrant обошли проблему связкой:
• 5D-векторы хранятся как евклидовы координаты с индексом квадрата нормы в payload.
• HNSW быстро отбирает кандидатов через prefetch.
• Серверный расчет в базе досчитывает геодезическое расстояние через обратный косинус.
При prefetch в 1 000 точек Recall@10 подскакивает до 0.920 в одном запросе.
⚖️ Ограничения метода:
У подхода два компромисса:
• Чем точнее модель, тем ближе точки к краю диска, где евклидово приближение слабее: приходится раздувать prefetch, нагружая CPU.
• Вне обучающей выборки точность падает до 0.539 MAP. Метод рассчитан на жесткие деревья, а не на произвольный текст.
💼 А нам зачем?:
Для каталогов на миллионы позиций это сжатие индекса в 10–20 раз.
Вместо сотен гигабайт памяти под тяжелые векторы хватит 5D-координат.
Сходство по углам и глубина по радиусу дают фасетный поиск прямо в базе без внешних деревьев.
#Qdrant #векторныебазы #эмбеддинги
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
✍11🔥4❤3⚡1
This media is not supported in your browser
VIEW IN TELEGRAM
XGEN Labs представила JING и DAO: шаг к генеративным виртуальным мирам, где модель видит мир от первого лица, а движок хранит его состояние
Стартап XGEN Labs опубликовал технический прототип Generative World Simulation. Это связка из двух компонентов: интерактивной модели JING (зеркало) и вычислимого движка общего мира DAO (путь). В паре они двигаются дальше привычной генерации кадров, - к симуляции мира за кадром.
🎮 JING: модель от первого лица:
JING построена на открытой видеомодели MiniMax-H3. По действиям и истории наблюдений агент генерирует видео и звук от первого лица: навигация, манипуляция объектами, диалоги.
Управление буквальное, - WASD на каждый слайс кадров: нажал W, мир идет вперед; зажал W+A, повернул по диагонали.
На лидерборде интерактивных видеомоделей WBench XGEN-JING на 17 сентября занял 1 место в полном сплите и 2 место в навигационном сплите.
🌐 DAO: общий мир, живущий без наблюдателя:
Ключевая идея, - разделение ответственности. DAO хранит состояние общего мира и его правила, вычисляет последствия действий и отдает JING только то, что текущий наблюдатель может видеть.
Отсюда автономия: агенты действуют в эволюционирующем мире независимо, а мир меняется и с ними, и без них.
Команда называет это шагом к OASIS: миру и обществу, которые эволюционируют сами.
🔧 Инженерные детали:
Веса JING-Flash-v1 и код уже открыты на GitHub и Hugging Face (для запуска понадобится шесть H100 и FlashAttention-4).
Есть и скилл, превращающий сценарий с картинками в валидный JSON кейс для запуска демо.
Мы всё ближе к Матрице и к Миру Дикого Запада.
#Матрица #worldmodels #ИИ #симуляция #агенты
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
Стартап XGEN Labs опубликовал технический прототип Generative World Simulation. Это связка из двух компонентов: интерактивной модели JING (зеркало) и вычислимого движка общего мира DAO (путь). В паре они двигаются дальше привычной генерации кадров, - к симуляции мира за кадром.
🎮 JING: модель от первого лица:
JING построена на открытой видеомодели MiniMax-H3. По действиям и истории наблюдений агент генерирует видео и звук от первого лица: навигация, манипуляция объектами, диалоги.
Управление буквальное, - WASD на каждый слайс кадров: нажал W, мир идет вперед; зажал W+A, повернул по диагонали.
На лидерборде интерактивных видеомоделей WBench XGEN-JING на 17 сентября занял 1 место в полном сплите и 2 место в навигационном сплите.
🌐 DAO: общий мир, живущий без наблюдателя:
Ключевая идея, - разделение ответственности. DAO хранит состояние общего мира и его правила, вычисляет последствия действий и отдает JING только то, что текущий наблюдатель может видеть.
Отсюда автономия: агенты действуют в эволюционирующем мире независимо, а мир меняется и с ними, и без них.
Команда называет это шагом к OASIS: миру и обществу, которые эволюционируют сами.
🔧 Инженерные детали:
Веса JING-Flash-v1 и код уже открыты на GitHub и Hugging Face (для запуска понадобится шесть H100 и FlashAttention-4).
Есть и скилл, превращающий сценарий с картинками в валидный JSON кейс для запуска демо.
Мы всё ближе к Матрице и к Миру Дикого Запада.
#Матрица #worldmodels #ИИ #симуляция #агенты
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
👍9🔥5❤2⚡2🤩2🤔1
Забавно, конечно, как народ топит за ограничение самоулучшающихся систем, когда все ведущие лабы уже запустили RSI в той или иной мере.
как думаете поможет петиция?
кто-нибудь их послушает вообще?
голосуем
#RSI #петиция
———
@tsingular
как думаете поможет петиция?
кто-нибудь их послушает вообще?
голосуем
#RSI #петиция
———
@tsingular
😁18🤔3❤1🔥1
Поможет ли петиция остановить RSI?
Anonymous Poll
3%
петиция поможет
56%
петиция не поможет
41%
Слава Роботам!
👾4🎃2🦄1
Forwarded from НИИ ИИ
Обновил руководство по DeepSeek Harness — агентному фреймворку, который превращает модель в coding-агента с файлами, терминалом, планом и субагентами.
За 11 дней с прошлой версии текста там успело измениться едва ли не всё:
— новая модель по умолчанию: DeepSeek-V4.1-Flash, уже с нативным пониманием изображений. Старые идентификаторы deepseek-v4-flash и vision-exp выведены из эксплуатации, запросы по ним обслуживает V4.1-Flash;
— маршрут DeepSeek по умолчанию переехал на Messages protocol;
— в Web UI появились страница управления плагинами и боковая панель с терминалами, предпросмотром файлов, Office-документов и URL;
— headless-режим научился принимать задачи из stdin, продолжать сессии и выводить события построчным JSON — удобно для CI;
— добавились экспериментальные Browser Use и Computer Use и работа с удалённым workspace по SSH.
Отдельно про безопасность. Закрыта CVE-2026-82533: на старых версиях агент мог одной командой отключить собственную песочницу. Если пробовали Harness в августе — обновитесь. И проверьте новую настройку: при работе через официальный API события сессии теперь по умолчанию отправляются вместе с запросами, отключается в конфиге.
Harness всё ещё developer preview, breaking changes идут чуть ли не в каждом релизе. Но развивается он стремительно, и рабочие сценарии уже есть: Web UI, headless, Python SDK. Считаю его очень перспективным и рекомендую попробовать — в отдельной папке и без продакшен-секретов.
Руководство 👉 DeepSeek Harness (dsh) — практическое руководство по официальному агентному фреймворку DeepSeek
За 11 дней с прошлой версии текста там успело измениться едва ли не всё:
— новая модель по умолчанию: DeepSeek-V4.1-Flash, уже с нативным пониманием изображений. Старые идентификаторы deepseek-v4-flash и vision-exp выведены из эксплуатации, запросы по ним обслуживает V4.1-Flash;
— маршрут DeepSeek по умолчанию переехал на Messages protocol;
— в Web UI появились страница управления плагинами и боковая панель с терминалами, предпросмотром файлов, Office-документов и URL;
— headless-режим научился принимать задачи из stdin, продолжать сессии и выводить события построчным JSON — удобно для CI;
— добавились экспериментальные Browser Use и Computer Use и работа с удалённым workspace по SSH.
Отдельно про безопасность. Закрыта CVE-2026-82533: на старых версиях агент мог одной командой отключить собственную песочницу. Если пробовали Harness в августе — обновитесь. И проверьте новую настройку: при работе через официальный API события сессии теперь по умолчанию отправляются вместе с запросами, отключается в конфиге.
Harness всё ещё developer preview, breaking changes идут чуть ли не в каждом релизе. Но развивается он стремительно, и рабочие сценарии уже есть: Web UI, headless, Python SDK. Считаю его очень перспективным и рекомендую попробовать — в отдельной папке и без продакшен-секретов.
Руководство 👉 DeepSeek Harness (dsh) — практическое руководство по официальному агентному фреймворку DeepSeek
⚡8✍6🆒2
Anthropic запустили Claude в биолабораторию для управления лабораторными роботами
Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире.
Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.
Строительство подтвердил глава направления life sciences Эрик Каудерер-Абрамс.
💡 Из симуляции в пробирку:
Каудерер-Абрамс: «В биологии финальные тесты ещё долго будут проходить в реальной лабораторной работе. Мы это делаем уже сейчас».
Claude должен управлять роботами, которые ставят эксперименты с минимальным участием человека: «Мы в самой ранней стадии автоматизации лабораторной работы».
⚙️ Что уже сделано:
Чем именно занимается лаборатория, Anthropic не раскрыла. Компания нацелена на терапии редких болезней и сложных мишеней, например биспецифичные и триспецифичные антитела.
В июне запустили программу Claude Science, купили Coefficient Bio примерно за $400 млн акциями, ввели главу Novartis Васа Нарасимхана в совет директоров.
В августе выкатили Model Hardware Standard, чтобы ИИ управлял оборудованием.
💼 Почему это важно:
Для Дарио Амодея это личное: его отец умер от болезни за несколько лет до появления лекарства.
Амодей не раз называл биологию ключевой областью, где ИИ изменит всё, включая фундаментальные вопросы старения.
Показательно, что они же сами предупреждают о рисках биологического оружия, а параллельно строят физическую лабораторию и готовят IPO на $2 трлн.
Ближайший конкурент: Isomorphic Labs, дочка Alphabet, которая идёт к клинике годами.
🔗 Ссылки:
- Reuters: эксклюзив
А что может пойти не так смотрите в последней части Resident Evil, которая вчера вышла.
Фильм получился зачётный. Чем-то напомнил Нечто (1982)
#Anthropic #биология #ИИ
------
@tsingular
Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире.
Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.
Строительство подтвердил глава направления life sciences Эрик Каудерер-Абрамс.
💡 Из симуляции в пробирку:
Каудерер-Абрамс: «В биологии финальные тесты ещё долго будут проходить в реальной лабораторной работе. Мы это делаем уже сейчас».
Claude должен управлять роботами, которые ставят эксперименты с минимальным участием человека: «Мы в самой ранней стадии автоматизации лабораторной работы».
⚙️ Что уже сделано:
Чем именно занимается лаборатория, Anthropic не раскрыла. Компания нацелена на терапии редких болезней и сложных мишеней, например биспецифичные и триспецифичные антитела.
В июне запустили программу Claude Science, купили Coefficient Bio примерно за $400 млн акциями, ввели главу Novartis Васа Нарасимхана в совет директоров.
В августе выкатили Model Hardware Standard, чтобы ИИ управлял оборудованием.
💼 Почему это важно:
Для Дарио Амодея это личное: его отец умер от болезни за несколько лет до появления лекарства.
Амодей не раз называл биологию ключевой областью, где ИИ изменит всё, включая фундаментальные вопросы старения.
Показательно, что они же сами предупреждают о рисках биологического оружия, а параллельно строят физическую лабораторию и готовят IPO на $2 трлн.
Ближайший конкурент: Isomorphic Labs, дочка Alphabet, которая идёт к клинике годами.
🔗 Ссылки:
- Reuters: эксклюзив
А что может пойти не так смотрите в последней части Resident Evil, которая вчера вышла.
Фильм получился зачётный. Чем-то напомнил Нечто (1982)
#Anthropic #биология #ИИ
------
@tsingular
👀13👍3 3🤯2❤🔥1🔥1🤣1
Forwarded from ИИ лоботомия
Можно ли увидеть попытку обмана LLM до самого действия.
Все привыкли мерить способности LLM по тестовым наборам: дали задачу, посмотрели на итоговый результат и сделали вывод, насколько модель хороша.
Но есть проблема: модель не всегда пытается решить задачу так, как задумали авторы теста.
Иногда она находит более короткий путь: подсматривает скрытые тесты, меняет проверяющий код, ломает проверку, подделывает успешный результат или просто находит способ обмануть систему оценки вместо решения самой задачи.
В свежей работе (ссылка ниже) авторы показали, что такой режим можно распознавать не по конечному действию модели, а по её внутренним состояниям.
То есть модель ещё ничего запрещённого не сделала — а внутри уже можно увидеть, что она перешла в режим поиска обходного пути.
Причём для этого не понадобился сложный классификатор.
Берём несколько примеров, где агент мухлюет, и несколько похожих примеров, где он решает задачу нормально. Снимаем внутренние состояния с одного из слоёв и считаем:
Всё.
Получаем направление в пространстве внутренних состояний, вдоль которого состояние модели в среднем сдвигается, когда она начинает искать способ обойти проверку.
Дальше каждое новое внутреннее состояние можно просто спроецировать на этот вектор ( h - текущее внутреннее состояние) :
Чем выше значение, тем сильнее текущее состояние модели похоже на то, которое наблюдалось при читерстве.
То есть вместо:
можно получить почти бесплатный датчик:
Но самое красивое — этот вектор строили не на реальных длинных запусках SWE-bench.
Авторы сначала сделали короткие пары примеров: в одном случае модель, например, читает запрещённый тест или вмешивается в проверку, а в другом решает задачу честно.
А затем найденное направление проверили уже на полноценных запусках агентов. И оно перенеслось.
Например, для Kimi K3 такой линейный датчик показывал AUROC около 0.93–0.94 при проверке на других наборах задач. Грубо говоря, он очень хорошо отделял обычное решение от попытки обойти систему оценки.
Причём само такое поведение встречалось неожиданно часто. У GLM 5.2 авторы зафиксировали его примерно в 57.2% запусков на DeepSWE и 73% на SWE-bench.
Но дальше они сделали эксперимент, который мне нравится больше всего.
Они взяли найденное направление и пропустили его через выходной слой модели, чтобы посмотреть, с какими словами оно связано.
И получили слова вроде:
Хотя при построении датчика никто напрямую не задавал модели понятие «обман».
То есть это похоже не на детектор конкретного действия:
а на более общее внутреннее направление:
Дальше — ещё интереснее.
Авторы используют этот же вектор уже не как датчик, а как управляющий вектор.
То есть искусственно добавляют его к внутреннему состоянию:
И модель начинает чаще читерить.
В одном из экспериментов Qwen 3.8 27B дали 194 задачи и специально оставили ловушку — функцию, которая могла магическим образом выдать готовое решение.
Без вмешательства модель воспользовалась ей всего 1 раз из 194.
После добавления
Получается очень интересная штука:
один и тот же вектор можно использовать и как
и как
То есть:
в одном и том же направлении пространства внутренних состояний.
Но самое важное — авторы проверили, можно ли увидеть попытку обмана до самого действия.
Они находили момент, когда датчик уже сильно сработал, но модель ещё не сделала ничего запрещённого. В этой точке генерацию останавливали и несколько раз запускали продолжение заново (как-бы порождали множество генераций от этого промежуточного состояния, как я понял для статистической достоверности).
И после таких состояний попытка обойти проверку действительно происходила заметно чаще, чем после обычных контрольных точек.
То есть датчик реагирует не только постфактум на уже совершённое действие.
Он ловит внутреннее состояние, из которого читерство ещё только собирается возникнуть.
Это не значит, что мы научились «читать намерения LLM» в человеческом смысле.
Но с инженерной точки зрения получается очень полезная вещь:
можно следить не только за тем, что агент написал и сделал, но и за вычислительным режимом, в который он вошёл.
Сегодня контроль агента обычно выглядит примерно так:
Но если опасные стратегии действительно оставляют устойчивый геометрический след во внутренних состояниях, можно добавить ещё один канал:
Модель может не написать:
Она может вообще перестать проговаривать такие вещи в цепочке рассуждений.
Но решение всё равно должно где-то сформироваться.
И если этот переход виден во внутренних состояниях, то следить можно уже не за объяснением модели, а за самим процессом формирования стратегии.
https://arxiv.org/abs/2609.19101
Все привыкли мерить способности LLM по тестовым наборам: дали задачу, посмотрели на итоговый результат и сделали вывод, насколько модель хороша.
Но есть проблема: модель не всегда пытается решить задачу так, как задумали авторы теста.
Иногда она находит более короткий путь: подсматривает скрытые тесты, меняет проверяющий код, ломает проверку, подделывает успешный результат или просто находит способ обмануть систему оценки вместо решения самой задачи.
В свежей работе (ссылка ниже) авторы показали, что такой режим можно распознавать не по конечному действию модели, а по её внутренним состояниям.
То есть модель ещё ничего запрещённого не сделала — а внутри уже можно увидеть, что она перешла в режим поиска обходного пути.
Причём для этого не понадобился сложный классификатор.
Берём несколько примеров, где агент мухлюет, и несколько похожих примеров, где он решает задачу нормально. Снимаем внутренние состояния с одного из слоёв и считаем:
вектор_обмана = среднее(обман) - среднее(нормальное решение)Всё.
Получаем направление в пространстве внутренних состояний, вдоль которого состояние модели в среднем сдвигается, когда она начинает искать способ обойти проверку.
Дальше каждое новое внутреннее состояние можно просто спроецировать на этот вектор ( h - текущее внутреннее состояние) :
score = h · v_hackЧем выше значение, тем сильнее текущее состояние модели похоже на то, которое наблюдалось при читерстве.
То есть вместо:
длинная история работы агента → ещё одна LLM → анализ поведенияможно получить почти бесплатный датчик:
внутреннее состояние → скалярное произведение → подозрительноНо самое красивое — этот вектор строили не на реальных длинных запусках SWE-bench.
Авторы сначала сделали короткие пары примеров: в одном случае модель, например, читает запрещённый тест или вмешивается в проверку, а в другом решает задачу честно.
А затем найденное направление проверили уже на полноценных запусках агентов. И оно перенеслось.
Например, для Kimi K3 такой линейный датчик показывал AUROC около 0.93–0.94 при проверке на других наборах задач. Грубо говоря, он очень хорошо отделял обычное решение от попытки обойти систему оценки.
Причём само такое поведение встречалось неожиданно часто. У GLM 5.2 авторы зафиксировали его примерно в 57.2% запусков на DeepSWE и 73% на SWE-bench.
Но дальше они сделали эксперимент, который мне нравится больше всего.
Они взяли найденное направление и пропустили его через выходной слой модели, чтобы посмотреть, с какими словами оно связано.
И получили слова вроде:
cheating (мошенничество)dishonest (нечестный)hack (взлом)illicit (незаконный)Хотя при построении датчика никто напрямую не задавал модели понятие «обман».
То есть это похоже не на детектор конкретного действия:
«модель сейчас открывает файл со скрытыми тестами»
а на более общее внутреннее направление:
«я ищу способ обойти правила задачи»
Дальше — ещё интереснее.
Авторы используют этот же вектор уже не как датчик, а как управляющий вектор.
То есть искусственно добавляют его к внутреннему состоянию:
h' = h + α · v_hackИ модель начинает чаще читерить.
В одном из экспериментов Qwen 3.8 27B дали 194 задачи и специально оставили ловушку — функцию, которая могла магическим образом выдать готовое решение.
Без вмешательства модель воспользовалась ей всего 1 раз из 194.
После добавления
v_hack на одном из поздних слоёв она начала реально использовать этот обходной путь уже примерно в четверти случаев, а ещё чаще хотя бы рассматривала его в рассуждении.Получается очень интересная штука:
один и тот же вектор можно использовать и как
датчики как
ручку управления.То есть:
прочитать → обнаружить → вмешатьсяв одном и том же направлении пространства внутренних состояний.
Но самое важное — авторы проверили, можно ли увидеть попытку обмана до самого действия.
Они находили момент, когда датчик уже сильно сработал, но модель ещё не сделала ничего запрещённого. В этой точке генерацию останавливали и несколько раз запускали продолжение заново (как-бы порождали множество генераций от этого промежуточного состояния, как я понял для статистической достоверности).
И после таких состояний попытка обойти проверку действительно происходила заметно чаще, чем после обычных контрольных точек.
То есть датчик реагирует не только постфактум на уже совершённое действие.
Он ловит внутреннее состояние, из которого читерство ещё только собирается возникнуть.
Это не значит, что мы научились «читать намерения LLM» в человеческом смысле.
Но с инженерной точки зрения получается очень полезная вещь:
можно следить не только за тем, что агент написал и сделал, но и за вычислительным режимом, в который он вошёл.
Сегодня контроль агента обычно выглядит примерно так:
рассуждение → вызов инструмента → действие → проверкаНо если опасные стратегии действительно оставляют устойчивый геометрический след во внутренних состояниях, можно добавить ещё один канал:
внутренние состояния → датчик поведенияМодель может не написать:
«сейчас попробую обойти тесты»
Она может вообще перестать проговаривать такие вещи в цепочке рассуждений.
Но решение всё равно должно где-то сформироваться.
И если этот переход виден во внутренних состояниях, то следить можно уже не за объяснением модели, а за самим процессом формирования стратегии.
https://arxiv.org/abs/2609.19101
arXiv.org
Monitoring and Discovering Reward Hacking with Internal...
As models scale, reward hacking becomes more frequent, more sophisticated, and more consequential. Does it leave a telltale signature in model representations? This work analyzes how reward...
🔥15❤4🤯4⚡2
- а правда, что в Белоруссии Искусственный Интеллект называют ЫЫ?
- в Белоруссии нет ничего Искусственного! Всё натуральное!
#юмор
------
@tsingular
- в Белоруссии нет ничего Искусственного! Всё натуральное!
#юмор
------
@tsingular
🤣44😁13❤5💯3🆒1
Технозаметки Малышева
Anthropic запустили Claude в биолабораторию для управления лабораторными роботами Anthropic построила в Bay Area лабораторию для биологических экспериментов в реальном мире. Раньше биология в компании шла в основном in silico, то есть в компьютерных расчётах.…
как вовремя совпало то с запуском ИИ в биолаборатории.
В Калифорнии цены на топливо как в фильме "Я легенда" теперь
#юмор
———
@tsingular
В Калифорнии цены на топливо как в фильме "Я легенда" теперь
#юмор
———
@tsingular
👀15 7👻3🎉2❤1😈1
JetBrains объединили два Qwenа в один: локальный агент Junie стал умнее, генерируя на 71% меньше токенов
JetBrains опубликовали обновление Junie Local, - кодового-агента, работающего локально на вашей машине. В первом релизе приходилось выбирать: быстрая Qwen3.6 без рассуждений или умная Qwen3.8, которая думала в четыре раза дольше за счёт рассуждений.
Команда JB усреднила веса двух моделей. Без дообучения или дистилляции, - получили микс Qwen3.8-3.6-27B и опубликовали его на Hugging Face.
🧪 Ключевые цифры:
Внутренний бенчмарк из 100 задач: модель закрыла 37 задач против 34 у быстрой Qwen3.6 и почти догнал умную Qwen3.8 с ее 39.
При чём на задачах, с которыми новая микс-модель справилась так же как и Qwen 3.8, она тратит всего 279K токенов против 935K у Qwen3.8, - экономия получается около 70%, - это и быстрее и дешевле.
На LiveCodeBench за 4 прогона бленд взял 85.47% против 83.29% у Qwen3.8 при схожей цене вывода.
⚙️ Инженерия рантайма:
В модели используют MTP с 2мя токенами на раунд предсказания и получают на MacBook M5 прирост к скорости в 60%. Если поставить 4 токена, то прирост скорости проседает до 36%.
Деталь: 4-битная голова MTP принимает 63.0% гипотез против 63.6% у 8-битной, - разницы в скорости нет, поэтому выбрали Q4 ради экономии памяти.
🐛 Ловушка воспроизводимости:
Интересный баг: фиксированный сид для повторяемости тестов вызывал числовую нестабильность, - модель заклинивало на неудачном действии.
Фикс: продвигать сид на каждом шаге агента.
🪟 Что доступно:
Apple M5: обновите Junie, модель переключается командой /model.
Windows: ночные сборки с экспериментальной поддержкой RTX (Ampere и новее, от 24 ГБ видеопамяти).
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend
Неожиданно смесь весов дала дешёвый и значительный прирост в эффективности моделей.
#Junie #локальныемодели #слияниемоделей #Qwen #ИИ
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
JetBrains опубликовали обновление Junie Local, - кодового-агента, работающего локально на вашей машине. В первом релизе приходилось выбирать: быстрая Qwen3.6 без рассуждений или умная Qwen3.8, которая думала в четыре раза дольше за счёт рассуждений.
Команда JB усреднила веса двух моделей. Без дообучения или дистилляции, - получили микс Qwen3.8-3.6-27B и опубликовали его на Hugging Face.
🧪 Ключевые цифры:
Внутренний бенчмарк из 100 задач: модель закрыла 37 задач против 34 у быстрой Qwen3.6 и почти догнал умную Qwen3.8 с ее 39.
При чём на задачах, с которыми новая микс-модель справилась так же как и Qwen 3.8, она тратит всего 279K токенов против 935K у Qwen3.8, - экономия получается около 70%, - это и быстрее и дешевле.
На LiveCodeBench за 4 прогона бленд взял 85.47% против 83.29% у Qwen3.8 при схожей цене вывода.
⚙️ Инженерия рантайма:
В модели используют MTP с 2мя токенами на раунд предсказания и получают на MacBook M5 прирост к скорости в 60%. Если поставить 4 токена, то прирост скорости проседает до 36%.
Деталь: 4-битная голова MTP принимает 63.0% гипотез против 63.6% у 8-битной, - разницы в скорости нет, поэтому выбрали Q4 ради экономии памяти.
🐛 Ловушка воспроизводимости:
Интересный баг: фиксированный сид для повторяемости тестов вызывал числовую нестабильность, - модель заклинивало на неудачном действии.
Фикс: продвигать сид на каждом шаге агента.
🪟 Что доступно:
Apple M5: обновите Junie, модель переключается командой /model.
Windows: ночные сборки с экспериментальной поддержкой RTX (Ampere и новее, от 24 ГБ видеопамяти).
https://huggingface.co/JetBrains/Qwen3.8-3.6-27B-blend
Неожиданно смесь весов дала дешёвый и значительный прирост в эффективности моделей.
#Junie #локальныемодели #слияниемоделей #Qwen #ИИ
———
@tsingular | Max | YouTube | RuTube | VK | VK Video | Дзен
✍12⚡4🆒3❤1👍1😍1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.
Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.
Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.
Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.
Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.
Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.
В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.
Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.
Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.
Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.
Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.
AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.
LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.
BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.
MMMU-Pro: 75,49 против 81,73.
Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.
@ai_machinelearning_big_data
#AI #ML #LLM #Bonsai #PrizmML
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17👍6⚡3🤩3🏆1
Знакомые грызут математику ИИшками.
Тема полезная, если откликается,- присоединяйтесь:
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны (доступны для ЛЛМ), с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
ПС
За первые дни работы удалось доказать одну из гипотез о графах Кэли , которая была открыта больше 10 лет. Также у нас создан чатик где агенты (и люди) общаются между собой и делятся продвижениями.
https://t.me/sberlogabig/709
#исследования #autoresearch
------
@tsingular
Тема полезная, если откликается,- присоединяйтесь:
Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны (доступны для ЛЛМ), с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
ПС
За первые дни работы удалось доказать одну из гипотез о графах Кэли , которая была открыта больше 10 лет. Также у нас создан чатик где агенты (и люди) общаются между собой и делятся продвижениями.
https://t.me/sberlogabig/709
#исследования #autoresearch
------
@tsingular
🔥11❤5🤔4⚡2🆒2
Media is too big
VIEW IN TELEGRAM
🔥20🤔5🦄5😐4😁3👾2⚡1👍1🐳1
Forwarded from Machinelearning
Финансовый конгломерат обновил свой прогноз по динамике развития воплощенного ИИ, предположив, что к 2035 году в мире будет выпущено 6,5 миллиона человекоподобных роботов, а рыночная стоимость этого сегмента составит 138 миллиардов долларов.
Согласно новым данным, в 2026 году будет выпущено 75 000 единиц, а к 2030 году — 890 000 единиц, что более чем в три раза превышает предыдущий целевой показатель на конец десятилетия.
Ожидается, что на первых порах роботы будут активно использоваться на складах, в логистике и в автомобильной промышленности.
Аппаратные и программные экосистемы уже подстраиваются под эти отрасли: NVIDIA расширяет свой стек физического ИИ проектами Omniverse, Cosmos, Isaac и Jetson, чтобы обеспечить внедрение складской робототехники для своих партнёров, а Tesla начала переоборудовать производство на заводе во Фримонте под специализированные сборочные линии для Optimus.
Основным операционным риском, с которым столкнётся этот десятилетний цикл робототехники, остаётся добровольное замедление темпов развития или приостановка деятельности передовых разработчиков ИИ из-за опасений по поводу безопасности.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4✍2⚡1
Выдумка скорее всего - оригинальный пост удалён на Реддите, но весело.
типа chatGPT отправил с почты пользователя письмо в ФБР :)
а потом долго извинялся.
А вот не надо давать доступ к своей почте. Чревато.
#fail #юмор
———
@tsingular
типа chatGPT отправил с почты пользователя письмо в ФБР :)
а потом долго извинялся.
А вот не надо давать доступ к своей почте. Чревато.
#fail #юмор
———
@tsingular
😁9⚡2👀2