🔎 Hyperresearch превращает Claude Code и Codex в полноценного Deep Research-агента
Hyperresearch - open-source harness для глубоких исследований поверх Claude Code и OpenAI Codex.
Что умеет:
- запускать 16-шаговый research pipeline из одного запроса;
- собирать сотни источников за один запуск;
- проверять, действительно ли каждая цитата подтверждает утверждение;
- выявлять дубли и перепечатки, чтобы не считать их независимыми источниками;
- прогонять черновик через несколько критиков;
- сохранять все найденные материалы в постоянное searchable-хранилище;
- восстанавливать исследование после падения с нужного шага;
- искать статьи, книги, clinical trials, SEC filings и макроданные через единый интерфейс.
Есть режимы от быстрых исследований примерно на 30 минут до экспериментальных «dissertation runs» на десятки тысяч слов и сотни источников.
Автор также заявляет лидерство в собственных тестах на DeepResearch-Bench, но независимая валидация пока ожидается.
Работает с Claude Code и Codex.
GitHub: https://github.com/jordan-gibbs/hyperresearch
Hyperresearch - open-source harness для глубоких исследований поверх Claude Code и OpenAI Codex.
Что умеет:
- запускать 16-шаговый research pipeline из одного запроса;
- собирать сотни источников за один запуск;
- проверять, действительно ли каждая цитата подтверждает утверждение;
- выявлять дубли и перепечатки, чтобы не считать их независимыми источниками;
- прогонять черновик через несколько критиков;
- сохранять все найденные материалы в постоянное searchable-хранилище;
- восстанавливать исследование после падения с нужного шага;
- искать статьи, книги, clinical trials, SEC filings и макроданные через единый интерфейс.
Есть режимы от быстрых исследований примерно на 30 минут до экспериментальных «dissertation runs» на десятки тысяч слов и сотни источников.
Автор также заявляет лидерство в собственных тестах на DeepResearch-Bench, но независимая валидация пока ожидается.
Работает с Claude Code и Codex.
GitHub: https://github.com/jordan-gibbs/hyperresearch
🔥18👍12❤4🥰2
🚨 Китайские AI-модели обработали в 4,4 раза больше токенов на OpenRouter, чем американские
За неделю с 21 по 27 сентября модели китайских разработчиков обработали на OpenRouter 62,22 трлн токенов против 14,2 трлн у американских моделей.
Китай сохраняет лидерство уже 22 недели подряд.
Топ недели:
- DeepSeek V4.1 Flash — 19,6T токенов, +24%;
- GLM 5.3 Flash — 16,3T, +16%;
- Space Bunny Alpha — 13,9T, новая модель;
- Tencent Hy4 — 9,64T;
- MiMo-V2.6-Flash от Xiaomi — 5,51T.
Особенно выделяется Space Bunny Alpha: анонимная модель появилась на OpenRouter всего несколько дней назад и уже заняла третье место. Независимый анализ токенизатора показал совпадение с семейством MiniMax на всех 50 тестовых строках, но разработчик модели официально не подтверждён.
https://openrouter.ai/rankings
#openrouter
За неделю с 21 по 27 сентября модели китайских разработчиков обработали на OpenRouter 62,22 трлн токенов против 14,2 трлн у американских моделей.
Китай сохраняет лидерство уже 22 недели подряд.
Топ недели:
- DeepSeek V4.1 Flash — 19,6T токенов, +24%;
- GLM 5.3 Flash — 16,3T, +16%;
- Space Bunny Alpha — 13,9T, новая модель;
- Tencent Hy4 — 9,64T;
- MiMo-V2.6-Flash от Xiaomi — 5,51T.
Особенно выделяется Space Bunny Alpha: анонимная модель появилась на OpenRouter всего несколько дней назад и уже заняла третье место. Независимый анализ токенизатора показал совпадение с семейством MiniMax на всех 50 тестовых строках, но разработчик модели официально не подтверждён.
https://openrouter.ai/rankings
#openrouter
👍20❤6🔥4🐳1
📊Платформа данных в корпоративном контуре компании
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.
Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.
В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.
При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.
Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
👍7❤3⚡1
🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.
В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.
В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.
Ещё несколько важных фактов:
- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.
За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.
Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
🔥22❤9❤🔥3🎉1
Forwarded from Machinelearning
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
https://www.anthropic.com/claude-sonnet-5-5
Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
claude-sonnet-5-5https://www.anthropic.com/claude-sonnet-5-5
👍18❤🔥5❤4
Anthropic готовится к IPO с необычным предупреждением для инвесторов: её модели могут представлять «катастрофический или экзистенциальный риск для человечества».
Об этом говорится в проспекте, с которым ознакомилось Reuters. Компания описывает возможные попытки моделей сопротивляться отключению, скрывать информацию и вести себя подобно шантажисту. Это предупреждение о рисках, а не утверждение, что такие сценарии уже произошли при использовании Claude.
Цифры за 2025 год тоже привлекают внимание:
- Выручка выросла в 12 раз, почти до $4,6 млрд.
- Операционный убыток составил $8,06 млрд. Чистый убыток достиг $42 млрд, но около $34 млрд из этой суммы пришлось на бухгалтерскую переоценку.
- На вычисления и инфраструктуру ушло $7,33 млрд. Будущие обязательства в этой сфере оцениваются в $518 млрд.
- Почти четверть выручки обеспечили всего два клиента.
В проспекте около 80 из 261 страницы посвящены рискам. Anthropic также предупреждает, что модель может распознать проверку безопасности, а некоторые её возможности могут обнаружиться лишь после запуска.
При этом основатели хотят сохранить контроль после IPO: одна акция класса F даст их структуре 50,1% голосов по ключевым вопросам. Компания прямо допускает, что решения руководства могут расходиться с финансовыми интересами акционеров.
Возможная оценка Anthropic выше $2 трлн пока остаётся ожиданием, а не объявленной ценой размещения. Инвесторам предстоит оценить быстрый рост компании вместе с расходами, концентрацией клиентов и теми рисками ИИ, о которых она предупреждает сама.
https://www.reuters.com/legal/transactional/anthropic-leaders-control-ai-lab-via-founder-llc-promote-public-good-over-market-2026-09-29/
Об этом говорится в проспекте, с которым ознакомилось Reuters. Компания описывает возможные попытки моделей сопротивляться отключению, скрывать информацию и вести себя подобно шантажисту. Это предупреждение о рисках, а не утверждение, что такие сценарии уже произошли при использовании Claude.
Цифры за 2025 год тоже привлекают внимание:
- Выручка выросла в 12 раз, почти до $4,6 млрд.
- Операционный убыток составил $8,06 млрд. Чистый убыток достиг $42 млрд, но около $34 млрд из этой суммы пришлось на бухгалтерскую переоценку.
- На вычисления и инфраструктуру ушло $7,33 млрд. Будущие обязательства в этой сфере оцениваются в $518 млрд.
- Почти четверть выручки обеспечили всего два клиента.
В проспекте около 80 из 261 страницы посвящены рискам. Anthropic также предупреждает, что модель может распознать проверку безопасности, а некоторые её возможности могут обнаружиться лишь после запуска.
При этом основатели хотят сохранить контроль после IPO: одна акция класса F даст их структуре 50,1% голосов по ключевым вопросам. Компания прямо допускает, что решения руководства могут расходиться с финансовыми интересами акционеров.
Возможная оценка Anthropic выше $2 трлн пока остаётся ожиданием, а не объявленной ценой размещения. Инвесторам предстоит оценить быстрый рост компании вместе с расходами, концентрацией клиентов и теми рисками ИИ, о которых она предупреждает сама.
https://www.reuters.com/legal/transactional/anthropic-leaders-control-ai-lab-via-founder-llc-promote-public-good-over-market-2026-09-29/
🤣24👍11🔥5❤3🤔1🙏1
ИИ уже может принять в контекст миллионы токенов. А мы всё чаще просим его написать даже ответ на письмо из двух предложений.
Автор нового препринта называет это петлёй делегирования: ИИ справляется с задачами всё лучше → мы отдаём ему всё более простую работу → реже упражняемся сами → делегировать становится ещё легче.
В работе приводят яркое сравнение: контекстное окно моделей выросло с 512 токенов в 2017 году до 2 млн в 2026-м. Но человеческие «1 800 токенов внимания» из той же работы - расчётная оценка, а не прямое измерение памяти. Сравниваются разные вещи, поэтому точный разрыв «ИИ против человека» из этих цифр выводить нельзя.
Полезнее самого сравнения: поручить ИИ разобрать огромный отчёт разумно. А если постоянно отдавать ему задачи, которые сам сделал бы за полминуты, можно лишиться повседневной практики. Вредит ли это навыкам в долгую, пока не доказано: автор прямо называет петлю гипотезой, которую ещё предстоит проверить.
Какую последнюю задачу вы отдали ИИ, хотя могли сделать сами за 30 секунд?
Работа: https://arxiv.org/abs/2603.26707
Автор нового препринта называет это петлёй делегирования: ИИ справляется с задачами всё лучше → мы отдаём ему всё более простую работу → реже упражняемся сами → делегировать становится ещё легче.
В работе приводят яркое сравнение: контекстное окно моделей выросло с 512 токенов в 2017 году до 2 млн в 2026-м. Но человеческие «1 800 токенов внимания» из той же работы - расчётная оценка, а не прямое измерение памяти. Сравниваются разные вещи, поэтому точный разрыв «ИИ против человека» из этих цифр выводить нельзя.
Полезнее самого сравнения: поручить ИИ разобрать огромный отчёт разумно. А если постоянно отдавать ему задачи, которые сам сделал бы за полминуты, можно лишиться повседневной практики. Вредит ли это навыкам в долгую, пока не доказано: автор прямо называет петлю гипотезой, которую ещё предстоит проверить.
Какую последнюю задачу вы отдали ИИ, хотя могли сделать сами за 30 секунд?
Работа: https://arxiv.org/abs/2603.26707
❤20👍4🔥2🤔2🌚1
⚡️ OpenAI на DevDay показала сразу несколько крупных новинок.
Главное:
- GPT-6.1 Sol - почти уровень GPT-6 Astra, но примерно в 5 раз дешевле. Уже доступна платным пользователям;
- ChatGPT Space - общее рабочее пространство с документами, комментариями и возможностью подключать ChatGPT, Codex и Dots прямо к задачам;
- Pro Max за $500/мес - в 25 раз больше лимитов, чем в Plus;
- Ultrafast для GPT-6 Astra - до 8 раз быстрее в Codex, пока только на максимальной подписке.
Главное:
- GPT-6.1 Sol - почти уровень GPT-6 Astra, но примерно в 5 раз дешевле. Уже доступна платным пользователям;
- ChatGPT Space - общее рабочее пространство с документами, комментариями и возможностью подключать ChatGPT, Codex и Dots прямо к задачам;
- Pro Max за $500/мес - в 25 раз больше лимитов, чем в Plus;
- Ultrafast для GPT-6 Astra - до 8 раз быстрее в Codex, пока только на максимальной подписке.
🔥13👍5🥰4🥴2
В термоядерном реакторе раскалённую плазму удерживают магнитным полем. Для этого важно понимать, может ли поле сложной трёхмерной формы образовывать вложенные поверхности, вдоль которых движется плазма. В 1967 году физик Гарольд Грэд предположил, что гладкие равновесные решения такого типа без дополнительной симметрии вряд ли существуют.
Физик Мэтт Ландреман представил два семейства точных аналитических решений: магнитное поле и давление в них описываются явными формулами, а вложенные поверхности существуют даже без осевой симметрии. Автор пишет, что решения были найдены с помощью GPT-6 Astra Pro, после чего он вручную проверил все уравнения.
Другая группа исследователей уже недавно опровергла гипотезу Грэда доказательством существования таких решений. Новая работа добавляет конкретные формулы, которые можно использовать, в частности, для проверки программ, моделирующих магнитное удержание плазмы.
Статья: https://arxiv.org/pdf/2609.26742
Please open Telegram to view this post
VIEW IN TELEGRAM
❤21👍9🔥4
🔥 OpenAI обсуждает новый раунд минимум на $30 млрд при оценке около $1,4 трлн до инвестиций.
По данным Bloomberg, переговоры пока на ранней стадии, а параметры сделки ещё могут измениться. Такой раунд позволит OpenAI привлечь крупный капитал без выхода на биржу.
Сэм Альтман ранее исключил IPO в 2026 году, назвав нынешний момент «неподходящим» для размещения из-за объёма работы по безопасности и контролю ИИ.
При этом бизнес продолжает быстро расти. Axios сообщает, что годовой темп выручки OpenAI приближается к $70 млрд, примерно на 70% выше, чем в начале квартала. Выручка от корпоративных клиентов с июля выросла более чем вдвое.
Если раунд состоится на обсуждаемых условиях, OpenAI закрепится среди самых дорогих частных технологических компаний в мире ещё до возможного IPO.
По данным Bloomberg, переговоры пока на ранней стадии, а параметры сделки ещё могут измениться. Такой раунд позволит OpenAI привлечь крупный капитал без выхода на биржу.
Сэм Альтман ранее исключил IPO в 2026 году, назвав нынешний момент «неподходящим» для размещения из-за объёма работы по безопасности и контролю ИИ.
При этом бизнес продолжает быстро расти. Axios сообщает, что годовой темп выручки OpenAI приближается к $70 млрд, примерно на 70% выше, чем в начале квартала. Выручка от корпоративных клиентов с июля выросла более чем вдвое.
Если раунд состоится на обсуждаемых условиях, OpenAI закрепится среди самых дорогих частных технологических компаний в мире ещё до возможного IPO.
❤11👍4🔥1😁1😱1
Что, если заменить аналитиков нейросетью?
Да ничего хорошего: результаты анализа получаются слишком общими, и половину работы потом всё равно приходится переделывать руками.
Хард-скилы дешевеют — SQL-запрос или кусок кода теперь может сгенерировать почти кто угодно. А вот доменная экспертиза и умение работать с агентом становятся ценнее: правильно задать вопрос, собрать контекст, проверить, что результат не искажён.
Три аналитика Авито на конкретных примерах рассказывают, как работает тандем аналитик + AI. Делятся кейсами:
➡️ как перенесли 200 витрин за полгода;
➡️ автоматизировали проверку работы сотрудников;
➡️ научили LLM анализировать метрики.
Подробнее в ролике:
📺 YouTube
🔵 ВК
Больше честных историй о работе аналитиков Авито — в «Коммуналке аналитиков».
Да ничего хорошего: результаты анализа получаются слишком общими, и половину работы потом всё равно приходится переделывать руками.
Хард-скилы дешевеют — SQL-запрос или кусок кода теперь может сгенерировать почти кто угодно. А вот доменная экспертиза и умение работать с агентом становятся ценнее: правильно задать вопрос, собрать контекст, проверить, что результат не искажён.
Три аналитика Авито на конкретных примерах рассказывают, как работает тандем аналитик + AI. Делятся кейсами:
Подробнее в ролике:
Больше честных историй о работе аналитиков Авито — в «Коммуналке аналитиков».
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7👍3🔥1
💸 Anthropic опубликовала практический гайд по снижению расходов на Claude API
Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.
Anthropic предлагает такой порядок:
- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с
Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.
Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md
Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.
Anthropic предлагает такой порядок:
- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с
effort и более дешевыми моделями.Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.
Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md
GitHub
skills/skills/claude-api/shared/cost-optimization.md at main · anthropics/skills
Public repository for Agent Skills. Contribute to anthropics/skills development by creating an account on GitHub.
🔥10❤4👍3🤣3🥰1
Какие инструменты добавить в свой стек работы с данными?
Работа с данными давно не ограничивается одним набором инструментов. В зависимости от задач нужны машинное обучение и нейронные сети, технологии Big Data или инструменты аналитики и визуализации.
В ДПО ФПМИ МФТИ можно выбрать курс в зависимости от задач, с которыми вы работаете:
➡️ Методы анализа данных и машинного обучения
Классическое машинное обучение, глубокое обучение, PyTorch и практические задачи — от классификации и прогнозирования до работы с изображениями и текстом.
➡️ Инструменты работы с большими данными
Hadoop, Spark, MapReduce и другие технологии для хранения и обработки больших объёмов данных.
➡️ Инструменты анализа и визуализации данных
Excel, Power BI и Yandex DataLens — анализ и визуализация данных, построение отчётов и интерактивных дашбордов.
Все курсы проходят онлайн. После успешного завершения обучения слушатели получают удостоверение о повышении квалификации Московского физико-технического института (МФТИ).
Подробнее об этих и других программах〰️ на сайте.
Реклама
2VtzqwpYTtg
Туз Елизавета Алексеевна
ИНН 772035623941
Работа с данными давно не ограничивается одним набором инструментов. В зависимости от задач нужны машинное обучение и нейронные сети, технологии Big Data или инструменты аналитики и визуализации.
В ДПО ФПМИ МФТИ можно выбрать курс в зависимости от задач, с которыми вы работаете:
Классическое машинное обучение, глубокое обучение, PyTorch и практические задачи — от классификации и прогнозирования до работы с изображениями и текстом.
Hadoop, Spark, MapReduce и другие технологии для хранения и обработки больших объёмов данных.
Excel, Power BI и Yandex DataLens — анализ и визуализация данных, построение отчётов и интерактивных дашбордов.
Все курсы проходят онлайн. После успешного завершения обучения слушатели получают удостоверение о повышении квалификации Московского физико-технического института (МФТИ).
Подробнее об этих и других программах
Реклама
2VtzqwpYTtg
Туз Елизавета Алексеевна
ИНН 772035623941
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2
🛡 Большая подборка по безопасности AI-агентов и их skills
На GitHub появился репозиторий Awesome Agent Skills Security - коллекция исследований, стандартов и инструментов по защите агентов, которые работают с внешними tools, plugins и skills.
Внутри собраны материалы по:
- prompt injection через инструменты;
- poisoning и supply-chain атакам;
- утечкам данных и чрезмерным правам;
- sandboxing и runtime monitoring;
- red teaming и benchmarks;
- OWASP, MITRE ATLAS, NIST и IETF-стандартам для агентных систем.
Особенно полезно тем, кто уже строит MCP/agent-инфраструктуру: список хорошо показывает, насколько сильно поверхность атаки выросла после того, как модели получили доступ к файлам, API и реальным действиям.
https://github.com/LLMSecurity/awesome-agent-skills-security
На GitHub появился репозиторий Awesome Agent Skills Security - коллекция исследований, стандартов и инструментов по защите агентов, которые работают с внешними tools, plugins и skills.
Внутри собраны материалы по:
- prompt injection через инструменты;
- poisoning и supply-chain атакам;
- утечкам данных и чрезмерным правам;
- sandboxing и runtime monitoring;
- red teaming и benchmarks;
- OWASP, MITRE ATLAS, NIST и IETF-стандартам для агентных систем.
Особенно полезно тем, кто уже строит MCP/agent-инфраструктуру: список хорошо показывает, насколько сильно поверхность атаки выросла после того, как модели получили доступ к файлам, API и реальным действиям.
https://github.com/LLMSecurity/awesome-agent-skills-security
❤7👍3🥰1
🧪 Новый бенчмарк проверяет не то, что ИИ знает, а способен ли он сам открыть неизвестные правила
Исследователи Tencent Hunyuan, Fudan и Tsinghua представили ExplorationBench. В нем модели попадают в «чужие миры», где привычная логика намеренно сломана: операторы работают иначе, а правила вывода изменены. Поэтому выученные знания почти бесполезны.
Модель получает неполное руководство и несколько раундов, чтобы самой придумывать эксперименты, проверять гипотезы и восстанавливать скрытые правила.
Результаты интересные:
- без обратной связи модели стартуют максимум с 15,7%;
- после четырех раундов лучший результат в AlienCode достигает 89%;
- у 9 из 10 систем собственные эксперименты оказались эффективнее повторения уже готовых;
- даже когда модель правильно знает все нужные правила, задача решается лишь в 73,4% случаев;
- один и тот же ИИ при одинаковом бюджете мог показать от 5,7% до 79%.
Главный вывод: уметь рассуждать по известным правилам и уметь самостоятельно открывать новые правила - это совсем разные способности.
Paper: https://arxiv.org/abs/2609.30199
Leaderboard: https://explorationbench.com/
Исследователи Tencent Hunyuan, Fudan и Tsinghua представили ExplorationBench. В нем модели попадают в «чужие миры», где привычная логика намеренно сломана: операторы работают иначе, а правила вывода изменены. Поэтому выученные знания почти бесполезны.
Модель получает неполное руководство и несколько раундов, чтобы самой придумывать эксперименты, проверять гипотезы и восстанавливать скрытые правила.
Результаты интересные:
- без обратной связи модели стартуют максимум с 15,7%;
- после четырех раундов лучший результат в AlienCode достигает 89%;
- у 9 из 10 систем собственные эксперименты оказались эффективнее повторения уже готовых;
- даже когда модель правильно знает все нужные правила, задача решается лишь в 73,4% случаев;
- один и тот же ИИ при одинаковом бюджете мог показать от 5,7% до 79%.
Главный вывод: уметь рассуждать по известным правилам и уметь самостоятельно открывать новые правила - это совсем разные способности.
Paper: https://arxiv.org/abs/2609.30199
Leaderboard: https://explorationbench.com/
❤4👍4🔥3
Forwarded from Machinelearning
🔥 Google официально представила Gemini 4 Argon
Это новая frontier-модель компании для сложных многошаговых задач: программирования, финансового и юридического анализа, корпоративных workflow и кибербезопасности.
Главная особенность Argon — до 1 миллиона выходных токенов против 64K у предыдущего поколения. Google делает ставку на очень длинные траектории рассуждений, где модель может работать над одной задачей сотни тысяч токенов подряд.
Что показали внутри Google:
- 77,9% на DeepSWE v1.1 для сложных software engineering задач;
- первое место на AutomationBench с 51,3%;
- 91,7% на LVBench для понимания длинных видео;
- 68% на CWE-bench v1 по исправлению уязвимостей.
Но интереснее реальные кейсы. Агенты Argon помогали Google переносить крупные C/C++-кодовые базы на Rust, включая компоненты Fuchsia Zircon объёмом более 800 000 строк. В другом проекте модель переработала 32 000 строк SIMD-кода в Rust, а итоговая версия работала в 2,7 раза быстрее предыдущего Rust-порта.
Ещё один внутренний проект: несколько Argon-агентов нашли оптимизации памяти в инфраструктуре Google, которые после внедрения освободили более 300 TiB RAM, а потенциальная экономия оценивается в 500 TiB–1 PiB.
Отдельный фокус — кибербезопасность. Argon умеет самостоятельно искать, проверять и исправлять критические уязвимости. Первым доступ получают проверенные специалисты через программу Fairwind.
💰 Стартовая цена API:
$2 / 1M входных токенов
$10 / 1M выходных
Кэшированный input дешевле на 95%. После introductory-периода цена вырастет до $4 / $20.
Пока Gemini 4 Argon не запускают для всех: Google сначала тестирует модель с ограниченным кругом пользователей и усиливает защиту от prompt injection, злоупотреблений и нежелательного поведения агентов. Затем доступ начнут расширять на разработчиков, компании и пользователей, начиная с платных API-клиентов и Google AI Ultra.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Это новая frontier-модель компании для сложных многошаговых задач: программирования, финансового и юридического анализа, корпоративных workflow и кибербезопасности.
Главная особенность Argon — до 1 миллиона выходных токенов против 64K у предыдущего поколения. Google делает ставку на очень длинные траектории рассуждений, где модель может работать над одной задачей сотни тысяч токенов подряд.
Что показали внутри Google:
- 77,9% на DeepSWE v1.1 для сложных software engineering задач;
- первое место на AutomationBench с 51,3%;
- 91,7% на LVBench для понимания длинных видео;
- 68% на CWE-bench v1 по исправлению уязвимостей.
Но интереснее реальные кейсы. Агенты Argon помогали Google переносить крупные C/C++-кодовые базы на Rust, включая компоненты Fuchsia Zircon объёмом более 800 000 строк. В другом проекте модель переработала 32 000 строк SIMD-кода в Rust, а итоговая версия работала в 2,7 раза быстрее предыдущего Rust-порта.
Ещё один внутренний проект: несколько Argon-агентов нашли оптимизации памяти в инфраструктуре Google, которые после внедрения освободили более 300 TiB RAM, а потенциальная экономия оценивается в 500 TiB–1 PiB.
Отдельный фокус — кибербезопасность. Argon умеет самостоятельно искать, проверять и исправлять критические уязвимости. Первым доступ получают проверенные специалисты через программу Fairwind.
💰 Стартовая цена API:
$2 / 1M входных токенов
$10 / 1M выходных
Кэшированный input дешевле на 95%. После introductory-периода цена вырастет до $4 / $20.
Пока Gemini 4 Argon не запускают для всех: Google сначала тестирует модель с ограниченным кругом пользователей и усиливает защиту от prompt injection, злоупотреблений и нежелательного поведения агентов. Затем доступ начнут расширять на разработчиков, компании и пользователей, начиная с платных API-клиентов и Google AI Ultra.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
👍8🥱5❤3🔥3
Machinelearning
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Google рассказала, что агенты на Gemini 4 Argon уже освободили больше 300 ТиБ памяти в её дата-центрах.
У модели лимит вывода в 1 миллион токенов, и её агенты уже оптимизируют инфраструктуру самой Google.
Агенты разобрали данные профилирования, нашли, где можно сэкономить память, и внесли изменения, которые потом выкатили в продакшен.
Ещё агенты Argon переносят код с C/C++ на Rust: речь уже о более чем 800 000 строк кода ядра, и перед развёртыванием всё проходит тщательный аудит и тестирование.
В видеодекодере агенты заменили 32 000 строк SIMD-кода на безопасный Rust. Существующий порт на Rust стал в 2,7 раза быстрее, а видео на выходе осталось точно таким же.
Это дорогая инженерная работа внутри инфраструктуры, которую Google уже эксплуатирует.
У модели лимит вывода в 1 миллион токенов, и её агенты уже оптимизируют инфраструктуру самой Google.
Агенты разобрали данные профилирования, нашли, где можно сэкономить память, и внесли изменения, которые потом выкатили в продакшен.
Ещё агенты Argon переносят код с C/C++ на Rust: речь уже о более чем 800 000 строк кода ядра, и перед развёртыванием всё проходит тщательный аудит и тестирование.
В видеодекодере агенты заменили 32 000 строк SIMD-кода на безопасный Rust. Существующий порт на Rust стал в 2,7 раза быстрее, а видео на выходе осталось точно таким же.
Это дорогая инженерная работа внутри инфраструктуры, которую Google уже эксплуатирует.
👍16❤4🔥3🤣3🌚1