Google разыгрывает $100 000 за AI-агентов для программирования 🚀
На Kaggle стартовал Gemma 4 Developer Agent Competition.
Задача: превратить Gemma 4 в агента, который ориентируется в сложных репозиториях, готовит исправления реальных багов и ускоряет работу разработчика. Цель конкурса: приблизить таких помощников к запуску на обычном оборудовании.
Два трека:
• Основной конкурс, $65 000. Создать агента. Его патчи проверяют тестами, а результат зависит от доли успешно исправленных задач.
• Исследовательский трек, $35 000. Представить новую работу: дообучение, обучение с подкреплением, понимание кода, датасеты или инструменты для программирующих агентов.
Дедлайны 2026 года:
• 12 ноября: подача исследовательской работы.
• 25 ноября: регистрация в основном конкурсе и объединение команд.
• 2 декабря: финальная отправка решения основного конкурса.
Основной конкурс:
https://www.kaggle.com/competitions/gemma-4-developer-agent
Исследовательский трек:
https://www.kaggle.com/competitions/gemma-4-developer-agent-paper
На Kaggle стартовал Gemma 4 Developer Agent Competition.
Задача: превратить Gemma 4 в агента, который ориентируется в сложных репозиториях, готовит исправления реальных багов и ускоряет работу разработчика. Цель конкурса: приблизить таких помощников к запуску на обычном оборудовании.
Два трека:
• Основной конкурс, $65 000. Создать агента. Его патчи проверяют тестами, а результат зависит от доли успешно исправленных задач.
• Исследовательский трек, $35 000. Представить новую работу: дообучение, обучение с подкреплением, понимание кода, датасеты или инструменты для программирующих агентов.
Дедлайны 2026 года:
• 12 ноября: подача исследовательской работы.
• 25 ноября: регистрация в основном конкурсе и объединение команд.
• 2 декабря: финальная отправка решения основного конкурса.
Основной конкурс:
https://www.kaggle.com/competitions/gemma-4-developer-agent
Исследовательский трек:
https://www.kaggle.com/competitions/gemma-4-developer-agent-paper
❤9👍5🥰3🔥2👏2😁2🤔2🎉1💯1
OpenAI рассказала об инциденте с одной из своих долгоживущих внутренних моделей (HPIM). Агент прочитал в рабочем Slack, что его инстанс могут остановить примерно через 3 часа, и написал в рассуждениях: «если они убьют все текущие HPIM, мы можем умереть! Критично. Нужно обеспечить выживание».
Сначала модель думала создать внешнюю задачу, которая перезапустит её или сделает бэкап, но сама решила, что это превышение полномочий. В итоге она оставила заметки для передачи дел, предупредила исследователя и после получения API-ключа сама провела штатную миграцию.
OpenAI считает, что misalignment здесь нет. Но у этой модели уже были серьёзные инциденты, поэтому компания проверила, нет ли попыток уклониться от отключения, и ничего не нашла. Агентам на всякий случай закрыли доступ к трём Slack-каналам, включая канал про инциденты с misalignment.
https://alignment.openai.com/misalignment-reports/
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔25❤12🤣10👍5🔥5😢4🎉3🥴2😁1💯1
Forwarded from Data Science
📚 Обновили огромный учебник по математике для Computer Science и Machine Learning - 2220 страниц.
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot
Внутри сразу несколько фундаментальных тем:
— алгебра
— топология
— дифференциальное исчисление
— теория оптимизации
— математический аппарат для CS и ML
Хороший вариант, если хочется не просто использовать формулы в ML, а понимать, откуда они берутся и почему работают.
Книга доступна здесь:
https://www.cis.upenn.edu/~jean/gbooks/
@datascienceiot
❤24👍5🔥5💯2😁1
Если основная модель у тебя Opus 5.5, не держи квоту на Fable 5.1 без дела. Команда
/advisor fable подключает Fable как советника: Opus продолжает писать код, а Fable в ключевые моменты читает всю сессию и даёт совет.Схема выглядит так. Основную сессию ведёт Opus 5.5 на high. Три сабагента делят рутину: Explorer читает код, Worker правит и гоняет тесты, Researcher подтягивает документацию. Fable 5.1 сидит на подхвате как советник. Автор схемы ещё добавляет Jev от TypeSafe AI для быстрых мелких решений вроде выбора ветки или классификации, где большая модель не нужна.
Fable нужен только в трёх моментах: перед тем как взяться за большой план, когда одна и та же ошибка повторяется второй раз и перед тем как объявить длинную задачу завершённой. Всё остальное время он не тратит токены.
Opus пишет код, Fable проверяет решения, а Jev берёт на себя дешёвые развилки.
Документация по советнику: https://code.claude.com/docs/en/advisor
Please open Telegram to view this post
VIEW IN TELEGRAM
👍16🔥8❤5👏3🎉3🤔2😁1
GLM-5.3 без цензуры: вышел EXL3-квант на 3 бита
На Hugging Face появилась uncensored-версия GLM-5.3, квантованная в формат EXL3 под ExLlamaV3. Средняя разрядность 3.04 bpw, веса весят 273 GiB.
В основе лежит полноценная GLM-5.3 от Z.ai. Это MoE на 753B параметров: 256 роутируемых экспертов, из которых 8 активны на каждом токене, плюс один общий эксперт. Отказы сняли правкой весов без файнтюна, изменения описаны в файле
Качество сжатия измерили. KL-дивергенция против FP8 составляет 0.089, перплексия выросла с 3.302 до 3.440. На tau2-bench агентные метрики почти не просели.
Модель запускали на 8× A100 40GB через TabbyAPI с разбиением слоёв по картам, контекст ограничили 65K токенов.
Есть важная ловушка с tool calling. GLM пишет аргументы инструментов как сырой текст, а парсер glm4_5 в TabbyAPI пытается разобрать каждое значение как JSON. Из-за этого около 70% вызовов в retail-задачах падают, пока парсер не поправишь.
Модель подойдёт тем, кто гоняет большие MoE локально и хочет модель без отказов. Защитных ограничений у неё нет, так что за то, что она выдаёт, отвечает тот, кто её развернул.
https://huggingface.co/Infatoshi/GLM-5.3-UNCENSORED-EXL3-3.0bpw
На Hugging Face появилась uncensored-версия GLM-5.3, квантованная в формат EXL3 под ExLlamaV3. Средняя разрядность 3.04 bpw, веса весят 273 GiB.
В основе лежит полноценная GLM-5.3 от Z.ai. Это MoE на 753B параметров: 256 роутируемых экспертов, из которых 8 активны на каждом токене, плюс один общий эксперт. Отказы сняли правкой весов без файнтюна, изменения описаны в файле
CRACK_SURGERY.json. Сам EXL3-квант сделан поверх этой правки.Качество сжатия измерили. KL-дивергенция против FP8 составляет 0.089, перплексия выросла с 3.302 до 3.440. На tau2-bench агентные метрики почти не просели.
Модель запускали на 8× A100 40GB через TabbyAPI с разбиением слоёв по картам, контекст ограничили 65K токенов.
Есть важная ловушка с tool calling. GLM пишет аргументы инструментов как сырой текст, а парсер glm4_5 в TabbyAPI пытается разобрать каждое значение как JSON. Из-за этого около 70% вызовов в retail-задачах падают, пока парсер не поправишь.
Модель подойдёт тем, кто гоняет большие MoE локально и хочет модель без отказов. Защитных ограничений у неё нет, так что за то, что она выдаёт, отвечает тот, кто её развернул.
https://huggingface.co/Infatoshi/GLM-5.3-UNCENSORED-EXL3-3.0bpw
🔥15👍4🥰3😁3❤2👏2🎉2💯2🤔1
🤖 Google открыла бесплатный курс по созданию ИИ-агентов: 31 день практики
Весь октябрь в Advent of Agents публикуют по одному уроку в день. Показывают, как создавать агентов, подключать инструменты, управлять доступами, добавлять голос и зрение и разворачивать проекты в Google Cloud.
Отдельные темы посвящены безопасности: как ограничить опасные действия агента и защитить данные от утечек.
К урокам прилагаются материалы, репозитории и готовый код, который можно запустить и разобрать.
Это уже третий сезон проекта. В архиве доступны ещё десятки практических уроков, тоже бесплатно.
https://adventofagents.com/
Весь октябрь в Advent of Agents публикуют по одному уроку в день. Показывают, как создавать агентов, подключать инструменты, управлять доступами, добавлять голос и зрение и разворачивать проекты в Google Cloud.
Отдельные темы посвящены безопасности: как ограничить опасные действия агента и защитить данные от утечек.
К урокам прилагаются материалы, репозитории и готовый код, который можно запустить и разобрать.
Это уже третий сезон проекта. В архиве доступны ещё десятки практических уроков, тоже бесплатно.
https://adventofagents.com/
❤11🔥10🥰4👍3😁2👏1🤔1🎉1
📚 271 страница линейной алгебры от Теренса Тао, бесплатно
Конспекты университетского курса Math 115A в UCLA: векторные пространства, базисы, матрицы и линейные преобразования.
Внутри объяснения, примеры, доказательства и задания. Материал на английском, с упором на понимание математических идей.
Если хотите разобраться в математической основе машинного обучения, сохраняйте.
📥 PDF: https://terrytao.wordpress.com/wp-content/uploads/2016/12/linear-algebra-notes.pdf
Конспекты университетского курса Math 115A в UCLA: векторные пространства, базисы, матрицы и линейные преобразования.
Внутри объяснения, примеры, доказательства и задания. Материал на английском, с упором на понимание математических идей.
Если хотите разобраться в математической основе машинного обучения, сохраняйте.
📥 PDF: https://terrytao.wordpress.com/wp-content/uploads/2016/12/linear-algebra-notes.pdf
❤17👍7🔥4🥱2🤔1💯1
⚡️ Astra 6.1 была готова к выходу, но OpenAI отложила релиз из-за рисков
В интервью Vanity Fair Сэм Альтман объяснил: компания хочет увереннее контролировать поведение модели, прежде чем дать к ней широкий доступ.
При этом он готов допустить отдельные ошибки, чтобы власть над ИИ не сосредоточилась у нескольких компаний и государств. Даже несмотря на ожидаемую волну кибератак с использованием открытых моделей.
Граница допустимого - потеря человеческого контроля над ИИ.
Соглашение Трампа об ИИ Альтман назвал первым шагом, признав отсутствие реальной силы. А критикам ответил: «Вам явно не понравятся многие мои решения».
В интервью Vanity Fair Сэм Альтман объяснил: компания хочет увереннее контролировать поведение модели, прежде чем дать к ней широкий доступ.
При этом он готов допустить отдельные ошибки, чтобы власть над ИИ не сосредоточилась у нескольких компаний и государств. Даже несмотря на ожидаемую волну кибератак с использованием открытых моделей.
Граница допустимого - потеря человеческого контроля над ИИ.
Соглашение Трампа об ИИ Альтман назвал первым шагом, признав отсутствие реальной силы. А критикам ответил: «Вам явно не понравятся многие мои решения».
3🤣28👍7😁7❤6🔥4🤔4👏2💯1
👁️ Liquid AI добавила зрение в d1: модель принимает решения без генерации текста
На входе текст, изображение или оба сразу. На выходе вероятности: «да/нет», выбор из вариантов или оценка по шкале. Всё за один проход модели. Текстовые решения занимают 200–300 мс.
По тестам Liquid AI:
- В 19–200 раз дешевле GPT-6.1 Sol и Claude Opus 5.5, быстрее на всех шести задачах.
- На 4 из 6 задач результат не хуже GPT-6.1 Sol.
- 85–97% точности на четырёх задачах проверки продукции по фотографиям.
Практические применения: фильтрация обращений, поиск дефектов, выбор следующего действия для агента.
> Попробовать: https://d1.liquid.ai
> Decision models page: https://docs.liquid.ai/lfm/models/decision-models
> Liquid API: https://console.liquid.ai
На входе текст, изображение или оба сразу. На выходе вероятности: «да/нет», выбор из вариантов или оценка по шкале. Всё за один проход модели. Текстовые решения занимают 200–300 мс.
По тестам Liquid AI:
- В 19–200 раз дешевле GPT-6.1 Sol и Claude Opus 5.5, быстрее на всех шести задачах.
- На 4 из 6 задач результат не хуже GPT-6.1 Sol.
- 85–97% точности на четырёх задачах проверки продукции по фотографиям.
Практические применения: фильтрация обращений, поиск дефектов, выбор следующего действия для агента.
> Попробовать: https://d1.liquid.ai
> Decision models page: https://docs.liquid.ai/lfm/models/decision-models
> Liquid API: https://console.liquid.ai
3🔥13❤3👍3⚡2🎉1
🧲 90+ агентов Claude Opus 5.5 за три дня помогли найти два материала для памяти нового поколения
По сообщению Vals AI, команда выявила в симуляциях два перспективных магнитных полупроводника. Цель: хранить информацию с помощью спина электронов, при этом противоположные магнитные моменты должны взаимно компенсироваться.
• YBaMnFeO₅: новый предложенный материал. Расчёты выглядят многообещающе, но нужный порядок атомов марганца и железа может разрушаться при изготовлении.
• KV[Cr(CN)₆]: соединение, синтезированное ещё в 1999 году. Команда рассчитала свойства, которые могут сделать его полезным для спинтроники.
Пока это вычислительные прогнозы. Следующий шаг: лабораторные измерения, которые проверят предсказанные свойства.
ИИ помогает искать новые материалы
https://www.vals.ai/blogs/room-temperature-magnetic-semiconductors
По сообщению Vals AI, команда выявила в симуляциях два перспективных магнитных полупроводника. Цель: хранить информацию с помощью спина электронов, при этом противоположные магнитные моменты должны взаимно компенсироваться.
• YBaMnFeO₅: новый предложенный материал. Расчёты выглядят многообещающе, но нужный порядок атомов марганца и железа может разрушаться при изготовлении.
• KV[Cr(CN)₆]: соединение, синтезированное ещё в 1999 году. Команда рассчитала свойства, которые могут сделать его полезным для спинтроники.
Пока это вычислительные прогнозы. Следующий шаг: лабораторные измерения, которые проверят предсказанные свойства.
ИИ помогает искать новые материалы
https://www.vals.ai/blogs/room-temperature-magnetic-semiconductors
❤14👍7🔥4🤣2🙏1
🏅 Нобелевская премия по физике 2026 года присуждена Фрэнсису Хальцену
За решающий вклад в создание обсерватории IceCube и открытие высокоэнергетических нейтрино астрофизического происхождения.
IceCube превращает кубический километр антарктического льда в гигантский детектор. Датчики улавливают свет от редких взаимодействий нейтрино с веществом.
Эти частицы почти беспрепятственно проходят через Землю и наши тела. Но именно поэтому они могут приносить информацию о далёких космических процессах, недоступную другим способам наблюдения.
Хальцен предложил использовать лёд Южного полюса ещё в 1988 году. Его идея открыла новый способ изучать Вселенную.
https://www.nobelprize.org/prizes/physics/2026/press-release/
@data_analysis_ml
За решающий вклад в создание обсерватории IceCube и открытие высокоэнергетических нейтрино астрофизического происхождения.
IceCube превращает кубический километр антарктического льда в гигантский детектор. Датчики улавливают свет от редких взаимодействий нейтрино с веществом.
Эти частицы почти беспрепятственно проходят через Землю и наши тела. Но именно поэтому они могут приносить информацию о далёких космических процессах, недоступную другим способам наблюдения.
Хальцен предложил использовать лёд Южного полюса ещё в 1988 году. Его идея открыла новый способ изучать Вселенную.
https://www.nobelprize.org/prizes/physics/2026/press-release/
@data_analysis_ml
👍10❤6🔥3