Forwarded from Неискусственный интеллект (Илья Склюев)
Отечественные чат-боты превзошли американцев и китайцев... в сборе информации
Вечером среды мы внезапно поняли, что в приложениях «Алисы» и GigaChat почему-то нет простой кнопки, позволяющей отключить сбор и анализ ваших диалогов. Хотя у ChatGPT и DeepSeek настройка находится в пару кликов.
Оказывается, всё это не просто так. Отечественные компании ведут активный сбор данных, но используют их по-разному:
1️⃣ «Алиса» анализирует ваши «отдельные голосовые и текстовые сообщения» по умолчанию
Нам казалось, что отключить настройку можно через «Яндекс ID». Но в компании пояснили, что кнопка «Помогать Алисе стать лучше» действует только для умных устройств.
В сервисном соглашении «Алисы AI» в разделе про данные пользователя говорят, что «Правообладателю передается следующая информация: идентификатор Пользователя, Запросы, ответы на Запросы Пользователя, иная информация, предоставляемая и собираемая посредством пользовательского интерфейса Сервиса».
Используют их, конечно же, «в целях совершенствования в целях проведения анализа, развития и совершенствования Сервиса и его отдельных функций». А ещё для рекламы:
«Персональная информация Пользователя обрабатывается в целях предоставления функциональности Сервиса, в том числе для отображения контента, потенциально наиболее интересного Пользователю».
2️⃣ «Сбер» получает всё, но делать с этим ничего не будет (пока)
Пользуясь GigaChat, пользователь «предоставляет SDevices и Правообладателю право использования Контента Клиента <...> любыми способами, не противоречащими действующему законодательству, в том числе, указанными в п. 2 ст. 1270 Гражданского кодекса Российской Федерации, но не ограничиваясь ими».
В корпоративном соглашении и в версии для физлиц подчёркивают, что «SDevices и Правообладатель не используют предоставленный или загружаемый Контент в собственных целях, не связанных с предоставлением Сервиса». Формулировка размытая, но нам официально заявили, что в «Сбере» не используют запросы пользователей для обучения нейросетей.
При этом, как только вы что-то сгенерировали в GigaChat, то вы передаёте компании лицензию на использование контента следующими способами:
▪️ «воспроизведение, хранение и запись в память ЭВМ Правообладателя и его аффилированных лиц и на серверах, назначенных Правообладателем, если такое использование необходимо для целей предоставления Сервиса»
▪️ «использование с предварительного согласия Клиента в маркетинговых и информационных материалах Правообладателя, направленных на привлечение внимание к Сервису или информирование о возможностях Сервиса неопределенного круга лиц».
Так что всё содержимое вашего диалога прекрасно видно компании. А условия использования в дальнейшем ещё могут поменяться.
@anti_agi
Вечером среды мы внезапно поняли, что в приложениях «Алисы» и GigaChat почему-то нет простой кнопки, позволяющей отключить сбор и анализ ваших диалогов. Хотя у ChatGPT и DeepSeek настройка находится в пару кликов.
Оказывается, всё это не просто так. Отечественные компании ведут активный сбор данных, но используют их по-разному:
Нам казалось, что отключить настройку можно через «Яндекс ID». Но в компании пояснили, что кнопка «Помогать Алисе стать лучше» действует только для умных устройств.
В сервисном соглашении «Алисы AI» в разделе про данные пользователя говорят, что «Правообладателю передается следующая информация: идентификатор Пользователя, Запросы, ответы на Запросы Пользователя, иная информация, предоставляемая и собираемая посредством пользовательского интерфейса Сервиса».
Используют их, конечно же, «в целях совершенствования в целях проведения анализа, развития и совершенствования Сервиса и его отдельных функций». А ещё для рекламы:
«Персональная информация Пользователя обрабатывается в целях предоставления функциональности Сервиса, в том числе для отображения контента, потенциально наиболее интересного Пользователю».
Не очень понимаем, как с такими условиями пользоваться агентскими фичами «Алисы». Если любая информация, попавшая в поле зрения бота, будет уходить для отображения интересного контента.
Пользуясь GigaChat, пользователь «предоставляет SDevices и Правообладателю право использования Контента Клиента <...> любыми способами, не противоречащими действующему законодательству, в том числе, указанными в п. 2 ст. 1270 Гражданского кодекса Российской Федерации, но не ограничиваясь ими».
В корпоративном соглашении и в версии для физлиц подчёркивают, что «SDevices и Правообладатель не используют предоставленный или загружаемый Контент в собственных целях, не связанных с предоставлением Сервиса». Формулировка размытая, но нам официально заявили, что в «Сбере» не используют запросы пользователей для обучения нейросетей.
При этом, как только вы что-то сгенерировали в GigaChat, то вы передаёте компании лицензию на использование контента следующими способами:
Так что всё содержимое вашего диалога прекрасно видно компании. А условия использования в дальнейшем ещё могут поменяться.
@anti_agi
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Data Secrets
Вышла открытая Kimi K2 Thinking: релиз уже окрестили «DeepSeek moment 2.0»
Моделька выбивает SOTA на Humanity’s Last Exam и BrowseComp: в основном за счет мега-прокаченного tool calling.
Она может делать до 200–300 последовательных вызовов инструментов (интернет, браузер, интерпретаторы кода и пр.), самостоятельно планируя и разбивая задачи на подзадачи. Это правда впечатляет и сильно выделяет модель.
В остальном: MoE, 1T параметров и 32В активных, контекст 128к токенов, лицензия MIT с небольшими ограничениями для крупных продуктов.
Попробовать можно здесь
Веса | Блогпост | API
Моделька выбивает SOTA на Humanity’s Last Exam и BrowseComp: в основном за счет мега-прокаченного tool calling.
Она может делать до 200–300 последовательных вызовов инструментов (интернет, браузер, интерпретаторы кода и пр.), самостоятельно планируя и разбивая задачи на подзадачи. Это правда впечатляет и сильно выделяет модель.
В остальном: MoE, 1T параметров и 32В активных, контекст 128к токенов, лицензия MIT с небольшими ограничениями для крупных продуктов.
Попробовать можно здесь
Веса | Блогпост | API
12 разных курсов на hugging face 🤗 - на любой вкус
huggingface.co
Hugging Face - Learn
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
На OpenRouter новая стелс-модель (авторы не известны, цена нулевая) - народ ждет 5.1 от OpenAI, но может быть и что-то другое..
openrouter.ai
Polaris Alpha - API Pricing & Providers
This model was an early snapshot of GPT-5.1 with reasoning effort set to minimal. 256,000 token context window.
Forwarded from эйай ньюз
This media is not supported in your browser
VIEW IN TELEGRAM
Google Opal — убийца n8n? (еще нет)
Google тихо выкатил Opal — свой клон n8n с визуальным редактором и нодами для автоматизации. Многие уже успели заклеймить его убийцей n8n и AgentKit, но пока это скорее очередной эксперимент. Често говоря, я изначально думал что n8n придется несладко, т.к. очевидно было, что все LLM лабы в какой-то момент сделают свою обвязку для пайаплайна агентов, это было делом времени.
UI в Opal приятный, можно изменять воркфлоу промптом (даже голосом), и всё это бесплатно. Правда, там только сервисы Google: Gemini, Imagen 4, Veo (бесплатно!), Lyria 2 и т.д. Подключить что-то стороннее нельзя.
Но на практике всё сыро. Я попробовал собрать на нём контент-завод для "рекламы", но Opal забыл объединить сгенерированные видео. Попытка решить проблему через Python-скрипт провалилась — ffmpeg туда не завезли, хотя функция
Самый полезный юзкейс сейчас — собирать сложные цепочки из нескольких LLM. Например, одна модель пишет план отчёта, три другие параллельно генерируют части, а в конце всё собирается вместе (если вам не хватает длины ответа обычной Gemini). Или можно выстроить пайплайн: сценарий → раскадровка → картинки → видео, правда, помним про лимиты.
Итог: Opal пока может делать не больше, чем Canvas в Gemini App. Это не убийца n8n, а скорее эксперимент (так он и называется) и хороший способ вкатиться в "нодовую культуру" благодаря простому интерфейсу и ограниченному функционалу — n8n поначалу может пугать. Побаловаться вечерок можно, но для серьёзных задач инструмент пока не готов.
Кстати, Google завезли ещё кучу подобных мини-аппов, которым не суждено стать полноценными продуктами. Pomelli, кстати, как раз один из них. Ставьте единорога 🦄, если интересен обзор и на другие.
Попробовать
@ai_newz
Google тихо выкатил Opal — свой клон n8n с визуальным редактором и нодами для автоматизации. Многие уже успели заклеймить его убийцей n8n и AgentKit, но пока это скорее очередной эксперимент. Често говоря, я изначально думал что n8n придется несладко, т.к. очевидно было, что все LLM лабы в какой-то момент сделают свою обвязку для пайаплайна агентов, это было делом времени.
UI в Opal приятный, можно изменять воркфлоу промптом (даже голосом), и всё это бесплатно. Правда, там только сервисы Google: Gemini, Imagen 4, Veo (бесплатно!), Lyria 2 и т.д. Подключить что-то стороннее нельзя.
Но на практике всё сыро. Я попробовал собрать на нём контент-завод для "рекламы", но Opal забыл объединить сгенерированные видео. Попытка решить проблему через Python-скрипт провалилась — ffmpeg туда не завезли, хотя функция
execute code предусмотрена.Самый полезный юзкейс сейчас — собирать сложные цепочки из нескольких LLM. Например, одна модель пишет план отчёта, три другие параллельно генерируют части, а в конце всё собирается вместе (если вам не хватает длины ответа обычной Gemini). Или можно выстроить пайплайн: сценарий → раскадровка → картинки → видео, правда, помним про лимиты.
Итог: Opal пока может делать не больше, чем Canvas в Gemini App. Это не убийца n8n, а скорее эксперимент (так он и называется) и хороший способ вкатиться в "нодовую культуру" благодаря простому интерфейсу и ограниченному функционалу — n8n поначалу может пугать. Побаловаться вечерок можно, но для серьёзных задач инструмент пока не готов.
Кстати, Google завезли ещё кучу подобных мини-аппов, которым не суждено стать полноценными продуктами. Pomelli, кстати, как раз один из них. Ставьте единорога 🦄, если интересен обзор и на другие.
Попробовать
@ai_newz
Forwarded from Machinelearning
GPT-5-Codex-Mini - более доступная версия флагманского Codex, она в 4 раза эффективней по затратам по сравнению с полной версией GPT-5-Codex при небольшом компромиссе в производительности.
Разница в возможностях минимальна: на SWE-bench Verified версия Mini набрала 71.3%, в то время как старшая GPT-5-Codex - 74.5%. OpenAI рекомендует переключаться на Mini для решения более простых задач или для экономии ресурсов при приближении к лимитам. Старший Codex будет автоматически предлагать переход на Mini, когда пользователь достигнет 90% своего лимита.
Модель уже доступна в CLI и расширении для IDE, а в скором времени появится и поддержка через API.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Kimi K2 Thinking такая большая, что даже динамическая 1-битная квантизация занимает 245Gb, нормальные 4-битные квантизации 500-700гб. Очевидно, это делает ее бессмысленной для локального использования.
Да и в самой модели что-то я сомневаюсь - наверняка учили проходить все известные бенчмарки, отсюда и результаты. Кто-то пользовался?
Да и в самой модели что-то я сомневаюсь - наверняка учили проходить все известные бенчмарки, отсюда и результаты. Кто-то пользовался?
huggingface.co
unsloth/Kimi-K2-Thinking-GGUF · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
На выходных откатил систему с Tahoe на предыдущую версию - Sequoia. Не смог привыкнуть к отсутствию ланчпада - казнил бы человека в Apple, который это придумал. Установку сделал чистую, чтобы убрать все «хвосты» от моих экспериментов, которых набралось достаточно.
Из положительных впечатлений - какое-то время назад купил провода с разъемом usb-c на thunderbolt 5. Отлично работают - когда обычная флешка что-то копирует часами, здесь сотни гигабайт перекачиваются на диск за считанные минуты. Стоит 1300 руб по нынешним деньгам, очень все рекомендую.
Вся эта возня научилась из-за того, что комп перестал нормально коннектиться со вторым моим сервером, но здесь выяснилось, что дело в провайдере. Он блокирует уже второе мое подключение. Не хотел его менять, но теперь есть повод задуматься.
Решил установить MS office по платной подписке, предпринял не самые тривиальные усилия, поставил, и теперь у меня в офисе появился copilot. Посмотрим, на что он способен, особых надежд не возлагаю, но все же. И хочется все-таки понять, где там Клод и что Майкрософт делает вместе с андроидом.
Из положительных впечатлений - какое-то время назад купил провода с разъемом usb-c на thunderbolt 5. Отлично работают - когда обычная флешка что-то копирует часами, здесь сотни гигабайт перекачиваются на диск за считанные минуты. Стоит 1300 руб по нынешним деньгам, очень все рекомендую.
Вся эта возня научилась из-за того, что комп перестал нормально коннектиться со вторым моим сервером, но здесь выяснилось, что дело в провайдере. Он блокирует уже второе мое подключение. Не хотел его менять, но теперь есть повод задуматься.
Решил установить MS office по платной подписке, предпринял не самые тривиальные усилия, поставил, и теперь у меня в офисе появился copilot. Посмотрим, на что он способен, особых надежд не возлагаю, но все же. И хочется все-таки понять, где там Клод и что Майкрософт делает вместе с андроидом.
Не знаю, вы смотрите сериалы? Что-то с этим ИИ я совсем перестал..
Вот, айтишники пишут про какой-то свежий, интересный..
Вот, айтишники пишут про какой-то свежий, интересный..
Telegram
Denis Sexy IT 🤖
Тоже посмотрел новый сериал «Pluribus» и тоже пребываю в восторге – это тот же самый режиссёр, который снимал «Breaking Bad» и «Better Call Saul» но в Sci-Fi жанре
Сериал особенно понравился потому что это какой-то новый взгляд на постапокалипсис, чего,…
Сериал особенно понравился потому что это какой-то новый взгляд на постапокалипсис, чего,…
😁2
Forwarded from Анализ данных (Data analysis)
Media is too big
VIEW IN TELEGRAM
AI-видео в китайском *Douyin выходят на совершенно другой уровень
В ленте вирусится ролик, где «китайская мама» устраивает разнос ксеноморфу - и выглядит это как мини-фильм. Кажется, что вот сейчас всё закончится, но сцена продолжает разгоняться и становится ещё абсурднее и эффектнее.
*Douyin - это китайская версия TikTok.
В ленте вирусится ролик, где «китайская мама» устраивает разнос ксеноморфу - и выглядит это как мини-фильм. Кажется, что вот сейчас всё закончится, но сцена продолжает разгоняться и становится ещё абсурднее и эффектнее.
*Douyin - это китайская версия TikTok.
Новая моделька для работы с агентами - понимает видео, преобразует в текст. Опен-сорс, всего 30В параметров.
huggingface.co
mlfoundations/Gelato-30B-A3B · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Baidu опенсорснула мультимодальную модельку на 28В параметров. Можно пробовать разворачивать у себя.
А Google тем временем дает возможность запускать модели в облаке, гарантируя приватность данных. Тоже может быть полезным.
Плюс большой апдейт Google photos, апдейт Gemini CLI для работы с Hugging face и еще куча всякой мелочи..
А Google тем временем дает возможность запускать модели в облаке, гарантируя приватность данных. Тоже может быть полезным.
Плюс большой апдейт Google photos, апдейт Gemini CLI для работы с Hugging face и еще куча всякой мелочи..
huggingface.co
baidu/ERNIE-4.5-VL-28B-A3B-Thinking · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Тут уж не знаешь верить или нет таким бенчмаркам, но что-то уж больно круто стали выступать маленькие модельки
https://t.me/ai_machinelearning_big_data/8975
https://t.me/ai_machinelearning_big_data/8975
Telegram
Machinelearning
⭐ VibeThinker-1.5B - миниатюрная модель, которая показывает SOTA-результаты в задачах рассуждения.
🚀 Производительность: одна из лучших на AIME24/25 и HMMT25 - превосходит DeepSeek R1-0120 по математическим задачам и опережает модели такого же размера в…
🚀 Производительность: одна из лучших на AIME24/25 и HMMT25 - превосходит DeepSeek R1-0120 по математическим задачам и опережает модели такого же размера в…
Forwarded from Machinelearning
OpenAI выпустила GPT-5.1, сделав основной упор на интеллект и качество диалога.
Вместе с моделями OpenAI расширила возможности кастомизации тона ответов, добавив новые стили: «Профессиональный», «Откровенный» и «Необычный».
Обновление уже раскатывают на платных подписчиков, а доступ через API появится в ближайшие дни. Предыдущие версии GPT-5 останутся доступны в течение трех месяцев.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Анализ данных (Data analysis)
⚡️ NVIDIA выпустила модель Llama-3 Nemotron Super-49B-v1.5-NVFP4
Это 49B reasoning-модель, улучшенная версия Meta Llama-3.3-70B-Instruct, которая даёт более сильное рассуждение, лучшее использование инструментов и стабильный диалог на длинных контекстах.
Она ориентирована на реальные агентные нагрузки - RAG, tool calling, сложные цепочки действий - и поддерживает контекст 128K, позволяющий держать большие беседы, документы и планы без нарезки.
Главное обновление - Neural Architecture Search, который снижает потребление памяти и повышает пропускную способность.
В итоге модель может выполнять тяжёлые задачи на одном H200 под высокой нагрузкой - это уменьшает стоимость сервинга и позволяет использовать большие batch'и.
huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1_5-NVFP4
Это 49B reasoning-модель, улучшенная версия Meta Llama-3.3-70B-Instruct, которая даёт более сильное рассуждение, лучшее использование инструментов и стабильный диалог на длинных контекстах.
Она ориентирована на реальные агентные нагрузки - RAG, tool calling, сложные цепочки действий - и поддерживает контекст 128K, позволяющий держать большие беседы, документы и планы без нарезки.
Главное обновление - Neural Architecture Search, который снижает потребление памяти и повышает пропускную способность.
В итоге модель может выполнять тяжёлые задачи на одном H200 под высокой нагрузкой - это уменьшает стоимость сервинга и позволяет использовать большие batch'и.
huggingface.co/nvidia/Llama-3_3-Nemotron-Super-49B-v1_5-NVFP4
Forwarded from Сиолошная
Disrupting the first reported AI-orchestrated cyber espionage campaign
Anthropic считают, что настал момент, когда модели стали действительно полезными в кибербезопасности, как для защиты, так и для атак. Про защиту я уже писал — Google сделали систему на основе LLM, которая анализирует код и помогает находить уязвимости.
Anthropic выявили злоумышленников, которые пользовались Claude Code, чтобы попытаться атаковать примерно тридцать целей, и в небольшом числе случаев им удалось это сделать. Компания с высокой уверенностью идентифицировала атакующих как группу, поддерживаемую китайским правительством.
Операция была направлена на крупные технологические компании, финансовые институты, химические производства и государственные учреждения. Вероятно, это первый документально подтверждённый случай крупномасштабной кибератаки, осуществлённой без значительного участия человека.
Почему именно сейчас? Anthropic видят три причины:
— Интеллект моделей. Общий уровень вырос за последний год настолько, что LLM способны выполнять сложные инструкции и понимать контекст задач, требующих несколько часов работы. Особенно прокачалось программирование.
— Автономность. Модели могут выступать в роли агентов, то есть работать в цикле, автономно выполнять действия, декомпозировать задачи и принимать решения сами.
— Инструменты. Модели стали гораздо лучше искать информацию в интернете, извлекать данные, пользоваться инструментами. В случае кибератак такие инструменты могут включать программы для взлома паролей, сканеры сетей и другое ПО.
Атака состояла из 5 этапов, на каждом из которых нужно было убедить Claude — который тщательно обучен избегать вредоносных действий — участвовать в атаке. Они добились этого с помощью джейлбрейк-промптов, фактически обманув модель.
Задачи разбивались на мелкие, казалось бы, безобидные действия, которые Claude выполнял, не осознавая всей их вредоносной сути. Также модель заставили отыгрывать роль сотрудника легитимной фирмы по кибербезопасности, мол, она используется для проведения защитного тестирования.
Claude Code провёл инспекцию систем и инфраструктуры целевых организаций, обнаружив базы данных с наибольшей ценностью. Модель смогла выполнить эту «разведку» за малую долю времени, которое потребовалось бы группе хакеров-людей.
Затем Claude использовался для сбора учётных данных (имён пользователей и паролей), что позволило ему получить дополнительный доступ и извлечь большое количество конфиденциальных данных, которые он классифицировал по степени их значимости.
Были обранужены аккаунты с наивысшими привилегиями, и пользуясь их данными созданы новые, выглядящие легитимно, но позволяющие в будущем получать неправомерный доступ к данным, которые можно скачать/итд.
Claude не всегда работал идеально. Иногда он «галлюцинировал» данные учётных записей или утверждал, что получил секретную информацию, которая на самом деле была общедоступной и не требовала отдельных прав доступа.
Anthropic забанили все аккаунты, связанные с этой атакой, связались с атакованными компаниями и предупредили их. В конце они отвечают на вопрос: а зачем вообще выпускать модели, которые могут быть инструментами в руках плохих людей?
Ответ состоит в том, что те самые способности, которые позволяют использовать Claude в подобных атаках, также делают его незаменимым инструментом в киберзащите.
⚔️ 🛡
Anthropic считают, что настал момент, когда модели стали действительно полезными в кибербезопасности, как для защиты, так и для атак. Про защиту я уже писал — Google сделали систему на основе LLM, которая анализирует код и помогает находить уязвимости.
Anthropic выявили злоумышленников, которые пользовались Claude Code, чтобы попытаться атаковать примерно тридцать целей, и в небольшом числе случаев им удалось это сделать. Компания с высокой уверенностью идентифицировала атакующих как группу, поддерживаемую китайским правительством.
Операция была направлена на крупные технологические компании, финансовые институты, химические производства и государственные учреждения. Вероятно, это первый документально подтверждённый случай крупномасштабной кибератаки, осуществлённой без значительного участия человека.
Почему именно сейчас? Anthropic видят три причины:
— Интеллект моделей. Общий уровень вырос за последний год настолько, что LLM способны выполнять сложные инструкции и понимать контекст задач, требующих несколько часов работы. Особенно прокачалось программирование.
— Автономность. Модели могут выступать в роли агентов, то есть работать в цикле, автономно выполнять действия, декомпозировать задачи и принимать решения сами.
— Инструменты. Модели стали гораздо лучше искать информацию в интернете, извлекать данные, пользоваться инструментами. В случае кибератак такие инструменты могут включать программы для взлома паролей, сканеры сетей и другое ПО.
Атака состояла из 5 этапов, на каждом из которых нужно было убедить Claude — который тщательно обучен избегать вредоносных действий — участвовать в атаке. Они добились этого с помощью джейлбрейк-промптов, фактически обманув модель.
Задачи разбивались на мелкие, казалось бы, безобидные действия, которые Claude выполнял, не осознавая всей их вредоносной сути. Также модель заставили отыгрывать роль сотрудника легитимной фирмы по кибербезопасности, мол, она используется для проведения защитного тестирования.
Claude Code провёл инспекцию систем и инфраструктуры целевых организаций, обнаружив базы данных с наибольшей ценностью. Модель смогла выполнить эту «разведку» за малую долю времени, которое потребовалось бы группе хакеров-людей.
Затем Claude использовался для сбора учётных данных (имён пользователей и паролей), что позволило ему получить дополнительный доступ и извлечь большое количество конфиденциальных данных, которые он классифицировал по степени их значимости.
Были обранужены аккаунты с наивысшими привилегиями, и пользуясь их данными созданы новые, выглядящие легитимно, но позволяющие в будущем получать неправомерный доступ к данным, которые можно скачать/итд.
Claude не всегда работал идеально. Иногда он «галлюцинировал» данные учётных записей или утверждал, что получил секретную информацию, которая на самом деле была общедоступной и не требовала отдельных прав доступа.
Anthropic забанили все аккаунты, связанные с этой атакой, связались с атакованными компаниями и предупредили их. В конце они отвечают на вопрос: а зачем вообще выпускать модели, которые могут быть инструментами в руках плохих людей?
Ответ состоит в том, что те самые способности, которые позволяют использовать Claude в подобных атаках, также делают его незаменимым инструментом в киберзащите.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Вчера обновился лидерборд SWE-ReBench, с добавлением 51 свежей задачи за октябрь. Для тех кто не следит, напомню, что ребята берут свежие PR из Python-репозиториев, подходящих под некоторые критерии, и прогоняют на них простого агента с разными моделями под капотом.
Первенство остаётся за Sonnet 4.5, который слегка отрывается от GPT-5-medium / Codex в доле решаемых с первого раза задач, но существенно отрывается, если моделям давать по 5 независимых попыток и выбирать лучшую: 57% против 49 и 47% у моделей OpenAI. И даже от Sonnet 4 отрыв тоже 10%.
При этом авторы гоняют бенчмарк на Sonnet 4.5 без рассуждений... но модель всё равно тратит больше токенов чем gpt-5 medium / high. Мне кажется это результат того, что используемый агент (инструменты + промпты) чуть больше отличаются для естественных у моделей OpenAI, чем у Anthropic: OpenAI рекомендует использовать модели так, чтобы им были доступны предыдущие рассуждения в рамках цепочки вызова инструментов, и сейчас на бенчмарке это выбрасывается.
Очень жду, что авторы добавят хотя бы два агента, Claude Code и Codex, и протестируют с ними релевантные модели — было бы интересно увидеть гэп. Он точно есть, см. вот этот бенчмарк от Vercel (там агент авторов даёт 32% для Claude Sonnet 4 / 4.5, но 42% с Claude Code). Вангую, что и тут у моделей обеих компаний качество ощутимо подскочит, но какая будет лучше — хз, наверное, Anthropic.
К другим инсайтам:
— MiniMax M2 «самая экономически эффективная открытая модель из топа», но это на бумаге. Формально она стоит $0.255 / $1.02 против $1.25 / $10.00 за GPT-5 / Codex. Но OpenAI имеют кэширование промптов, которое предназначено как раз для длинных агентских сессий, состоящих из большого количества последовательных шагов. Вы платите на 90% меньше за входные токены, если они уже были обработаны. И по итогу цена за одно решение у M2 $0.44, а у Codex — $0.51. А разница в качестве 25%🎃 При этом вместе с добавлением GPT-5.1 в API вчера OpenAI расширили кэш с 5-10 минут до 24 часов (за ту же цену, правда будет чуть медленее), так что вообще шик.
— Если брать срез в 100 последних задач, то GPT-OSS 120b хоть и существенно отстаёт от фронтира (26.1% vs 44.4%), но... умудряется обгонять: DeepSeek-V3.1, Qwen3-235B, gpt-4.1, o4-mini, gemini-2.5-pro, и это при том, что она стоит 4 цента за задачу — самая дешёвая из всех, от некоторых из указанных моделей отрывается на порядок. Хорошая агентская модель для бейзлайна, получается. Grok Code Fast 1 мог с ней потягаться, за сентябрь у него была такая же цена и +- качество), но авторы не замерили модели xAI в октябре.
Первенство остаётся за Sonnet 4.5, который слегка отрывается от GPT-5-medium / Codex в доле решаемых с первого раза задач, но существенно отрывается, если моделям давать по 5 независимых попыток и выбирать лучшую: 57% против 49 и 47% у моделей OpenAI. И даже от Sonnet 4 отрыв тоже 10%.
При этом авторы гоняют бенчмарк на Sonnet 4.5 без рассуждений... но модель всё равно тратит больше токенов чем gpt-5 medium / high. Мне кажется это результат того, что используемый агент (инструменты + промпты) чуть больше отличаются для естественных у моделей OpenAI, чем у Anthropic: OpenAI рекомендует использовать модели так, чтобы им были доступны предыдущие рассуждения в рамках цепочки вызова инструментов, и сейчас на бенчмарке это выбрасывается.
Очень жду, что авторы добавят хотя бы два агента, Claude Code и Codex, и протестируют с ними релевантные модели — было бы интересно увидеть гэп. Он точно есть, см. вот этот бенчмарк от Vercel (там агент авторов даёт 32% для Claude Sonnet 4 / 4.5, но 42% с Claude Code). Вангую, что и тут у моделей обеих компаний качество ощутимо подскочит, но какая будет лучше — хз, наверное, Anthropic.
К другим инсайтам:
— MiniMax M2 «самая экономически эффективная открытая модель из топа», но это на бумаге. Формально она стоит $0.255 / $1.02 против $1.25 / $10.00 за GPT-5 / Codex. Но OpenAI имеют кэширование промптов, которое предназначено как раз для длинных агентских сессий, состоящих из большого количества последовательных шагов. Вы платите на 90% меньше за входные токены, если они уже были обработаны. И по итогу цена за одно решение у M2 $0.44, а у Codex — $0.51. А разница в качестве 25%
— Если брать срез в 100 последних задач, то GPT-OSS 120b хоть и существенно отстаёт от фронтира (26.1% vs 44.4%), но... умудряется обгонять: DeepSeek-V3.1, Qwen3-235B, gpt-4.1, o4-mini, gemini-2.5-pro, и это при том, что она стоит 4 цента за задачу — самая дешёвая из всех, от некоторых из указанных моделей отрывается на порядок. Хорошая агентская модель для бейзлайна, получается. Grok Code Fast 1 мог с ней потягаться, за сентябрь у него была такая же цена и +- качество), но авторы не замерили модели xAI в октябре.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Love. Death. Transformers.
Vqvae - это вообще-то главная часть в генеративке. Он решает, будет ли модель творить магию или кряхтеть как старый пылесос. Если он плохой - всё плохо.
В Сбере сделали сразу два токенизатора, и оба не просто хорошие - оба обгоняют открытый SOTA и по реконструкции, и по генерации.
2D-KVAE - для изображений, работает чище и аккуратнее нынешних открытых подходов.
3D-KVAE - для видео, и тут та же история: быстрее, точнее и в реконструкции, и в генерации.
Короче, два решения, которые уверенно обходят доступные аналоги.
На Хабре ребята открыто рассказывают, какая это боль - сделать хороший токенизатор, где споткнулись, какие хаки понадобились и почему это вообще важнее, чем кажется. Плюс сравнение с нынешним SOTA, чтобы видеть разницу не на словах.
И вишенка: всё это скоро станет open source.
люди делают не ресерч ради ресерча, а реально что-то серьёзное.
В Сбере сделали сразу два токенизатора, и оба не просто хорошие - оба обгоняют открытый SOTA и по реконструкции, и по генерации.
2D-KVAE - для изображений, работает чище и аккуратнее нынешних открытых подходов.
3D-KVAE - для видео, и тут та же история: быстрее, точнее и в реконструкции, и в генерации.
Короче, два решения, которые уверенно обходят доступные аналоги.
На Хабре ребята открыто рассказывают, какая это боль - сделать хороший токенизатор, где споткнулись, какие хаки понадобились и почему это вообще важнее, чем кажется. Плюс сравнение с нынешним SOTA, чтобы видеть разницу не на словах.
И вишенка: всё это скоро станет open source.
люди делают не ресерч ради ресерча, а реально что-то серьёзное.
Forwarded from Анализ данных (Data analysis)
⚙️ Китайский “невозможный чип” меняет правила игры
В Китае представили разработку, которая может переписать будущее технологий. Речь о новом аналоговом чипе, который не просто обгоняет Nvidia и AMD — он выносит их за счётами.
Что известно:
- до 1000 раз быстрее современных топ-процессоров
- до 100 раз энергоэффективнее
- работает не в логике 1 и 0, а как мозг — обрабатывает непрерывные сигналы прямо в памяти
- никаких задержек, минимум потерь энергии, максимальный интеллект
Учёные заявляют, что решили проблему, над которой бились больше века: добились цифровой точности на аналоговом железе с минимальным потреблением. В тестах новый чип обошёл Nvidia H100 и AMD Vega 20 до 1000x по пропускной способности.
Если технология масштабируется, это может перевернуть всё — от ИИ и дата-центров до связи и робототехники. Начало новой техноэры может наступить намного раньше, чем кто-то ожидал.
https://www.livescience.com/technology/computing/china-solves-century-old-problem-with-new-analog-chip-that-is-1-000-times-faster-than-high-end-nvidia-gpus
В Китае представили разработку, которая может переписать будущее технологий. Речь о новом аналоговом чипе, который не просто обгоняет Nvidia и AMD — он выносит их за счётами.
Что известно:
- до 1000 раз быстрее современных топ-процессоров
- до 100 раз энергоэффективнее
- работает не в логике 1 и 0, а как мозг — обрабатывает непрерывные сигналы прямо в памяти
- никаких задержек, минимум потерь энергии, максимальный интеллект
Учёные заявляют, что решили проблему, над которой бились больше века: добились цифровой точности на аналоговом железе с минимальным потреблением. В тестах новый чип обошёл Nvidia H100 и AMD Vega 20 до 1000x по пропускной способности.
Если технология масштабируется, это может перевернуть всё — от ИИ и дата-центров до связи и робототехники. Начало новой техноэры может наступить намного раньше, чем кто-то ожидал.
https://www.livescience.com/technology/computing/china-solves-century-old-problem-with-new-analog-chip-that-is-1-000-times-faster-than-high-end-nvidia-gpus