⚡️ GPT-6 Astra подняла рекорд Epoch AI с 163 до 169 ECI
GPT-6 Astra установила новый максимум в индексе возможностей Epoch AI - 169 баллов против предыдущих 163.
Для масштаба: тренд эпохи reasoning-моделей составляет около 15 ECI в год, поэтому скачок на 6 пунктов соответствует примерно пяти месяцам прогресса. Astra находится немного выше трендовой линии, но всё ещё в пределах ожидаемого диапазона.
Особенно выделяются отдельные результаты:
- 84% на Mystery Game Puzzles против предыдущего рекорда в 59%
- 98% на FrontierMath Tier 4 - Epoch уже считает этот уровень практически полностью насыщенным
При этом результат заметно расходится с рейтингом Artificial Analysis Intelligence Index.
Причина в методологии: Epoch и Artificial Analysis используют разные наборы тестов и веса. AA сильнее акцентирует coding и agentic-задачи, поэтому лидерство Astra в ECI не означает автоматического лидерства во всех практических сценариях.
По метрике Epoch скачок действительно большой - +6 ECI за одно поколение модели.
https://x.com/Machinelearrn/status/2095826666702393538
GPT-6 Astra установила новый максимум в индексе возможностей Epoch AI - 169 баллов против предыдущих 163.
Для масштаба: тренд эпохи reasoning-моделей составляет около 15 ECI в год, поэтому скачок на 6 пунктов соответствует примерно пяти месяцам прогресса. Astra находится немного выше трендовой линии, но всё ещё в пределах ожидаемого диапазона.
Особенно выделяются отдельные результаты:
- 84% на Mystery Game Puzzles против предыдущего рекорда в 59%
- 98% на FrontierMath Tier 4 - Epoch уже считает этот уровень практически полностью насыщенным
При этом результат заметно расходится с рейтингом Artificial Analysis Intelligence Index.
Причина в методологии: Epoch и Artificial Analysis используют разные наборы тестов и веса. AA сильнее акцентирует coding и agentic-задачи, поэтому лидерство Astra в ECI не означает автоматического лидерства во всех практических сценариях.
По метрике Epoch скачок действительно большой - +6 ECI за одно поколение модели.
https://x.com/Machinelearrn/status/2095826666702393538
👍6🔥6❤4🎉2
VCR.py - очень удобная библиотека для тестирования Python-кода, который ходит во внешние API.
Первый запуск теста делает реальные HTTP-запросы и сохраняет ответы в так называемую cassette - по умолчанию YAML-файл. Следующие запуски уже не идут в сеть: VCR.py перехватывает знакомый запрос и возвращает сохранённый ответ.
Что это даёт:
- тесты становятся детерминированными
- их можно запускать офлайн
- они работают заметно быстрее
- внешнее API не нужно дёргать сотни раз в CI
- если API изменилось, cassette можно просто перезаписать
Особенно полезно для тестов интеграций с REST API, платёжными сервисами, LLM API и любыми внешними HTTP-сервисами.
Проект активно развивается: в актуальной ветке 8.x есть поддержка HTTPX, custom transports, безопасная загрузка YAML и свежая поддержка
MIT License.
https://github.com/kevin1024/vcrpy
Первый запуск теста делает реальные HTTP-запросы и сохраняет ответы в так называемую cassette - по умолчанию YAML-файл. Следующие запуски уже не идут в сеть: VCR.py перехватывает знакомый запрос и возвращает сохранённый ответ.
Что это даёт:
- тесты становятся детерминированными
- их можно запускать офлайн
- они работают заметно быстрее
- внешнее API не нужно дёргать сотни раз в CI
- если API изменилось, cassette можно просто перезаписать
Особенно полезно для тестов интеграций с REST API, платёжными сервисами, LLM API и любыми внешними HTTP-сервисами.
Проект активно развивается: в актуальной ветке 8.x есть поддержка HTTPX, custom transports, безопасная загрузка YAML и свежая поддержка
niquests. MIT License.
https://github.com/kevin1024/vcrpy
🔥7❤5👍3🎉1
🦅 Colibrì - движок для запуска очень больших AI-моделей на обычных ПК и рабочих станциях, даже если модель целиком не помещается в видеопамять.
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
1❤14🔥9👍5🎉1
Python и ИИ в 2026 году: как правильно работать с кодом через ChatGPT, Claude, Cursor и AI-агентов
Как использовать ИИ для написания, проверки, рефакторинга и отладки Python-кода.
Лучшие промпты, примеры, workflow и правила работы с AI-ассистентами в 2026 году.
https://uproger.com/python-i-ii-v-2026-godu-kak-pravilno-rabotat-s-kodom-cherez-chatgpt-claude-cursor-i-ai-agentov/
Как использовать ИИ для написания, проверки, рефакторинга и отладки Python-кода.
Лучшие промпты, примеры, workflow и правила работы с AI-ассистентами в 2026 году.
https://uproger.com/python-i-ii-v-2026-godu-kak-pravilno-rabotat-s-kodom-cherez-chatgpt-claude-cursor-i-ai-agentov/
❤6👍6🔥3😁2
⚡ OrcaRouter стала лучшей uncensored-версией Qwen3.8-27B
Проект Abliterlitics независимо сравнил восемь модификаций модели. Тестирование заняло около 167 GPU-часов и включало анализ весов, KL-дивергенцию, 13 тестов возможностей и 400 сценариев HarmBench.
Результаты Qwen3.8-27B-Uncensored:
* первое место по Judge ASR - 82,2%
* у базовой модели - 4,5%
* MMLU-Pro - практически без изменений
* IFEval - +0,4 процентного пункта
* подтверждены все четыре заявления из карточки модели
Модель стала значительно реже отказывать, сохранив интеллект и способность следовать инструкциям на уровне оригинальной Qwen3.8-27B. Итог независимого исследования - «The winner».
Анализ:
https://abliterlitics.dev/models/qwen38-27b/
Модель:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored
Проект Abliterlitics независимо сравнил восемь модификаций модели. Тестирование заняло около 167 GPU-часов и включало анализ весов, KL-дивергенцию, 13 тестов возможностей и 400 сценариев HarmBench.
Результаты Qwen3.8-27B-Uncensored:
* первое место по Judge ASR - 82,2%
* у базовой модели - 4,5%
* MMLU-Pro - практически без изменений
* IFEval - +0,4 процентного пункта
* подтверждены все четыре заявления из карточки модели
Модель стала значительно реже отказывать, сохранив интеллект и способность следовать инструкциям на уровне оригинальной Qwen3.8-27B. Итог независимого исследования - «The winner».
Анализ:
https://abliterlitics.dev/models/qwen38-27b/
Модель:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored
👍10🔥5❤4
⚡️ OriginTracer - низкоуровневая observability-система для Python web stack
OriginTracer позволяет трассировать запросы сразу через несколько уровней приложения:
- Nginx
- Gunicorn
- Uvicorn
- Django
- Celery
Главная идея - видеть путь запроса не только внутри одного фреймворка, а через весь стек: от входа через веб-сервер до фоновых задач.
Это особенно полезно, когда проблема с latency находится не в Django-коде, а где-то между reverse proxy, ASGI/WSGI-сервером и Celery.
Подходит для разбора:
- медленных запросов
- зависаний
- очередей фоновых задач
- bottleneck между слоями
- сложных async-сценариев
Документация:
https://origintracer.app/docs/
OriginTracer позволяет трассировать запросы сразу через несколько уровней приложения:
- Nginx
- Gunicorn
- Uvicorn
- Django
- Celery
Главная идея - видеть путь запроса не только внутри одного фреймворка, а через весь стек: от входа через веб-сервер до фоновых задач.
Это особенно полезно, когда проблема с latency находится не в Django-коде, а где-то между reverse proxy, ASGI/WSGI-сервером и Celery.
Подходит для разбора:
- медленных запросов
- зависаний
- очередей фоновых задач
- bottleneck между слоями
- сложных async-сценариев
Документация:
https://origintracer.app/docs/
👍5🔥5❤4🎉2
🔥 monty-go - безопасный запуск Python-кода от LLM прямо внутри Go
Проект оборачивает интерпретатор Pydantic Monty в WebAssembly и запускает его через
Что интересно:
- pure Go — без CGO
- без контейнеров и subprocess
- запуск sandbox меньше миллисекунды
- WASM-бинарник всего около 2,9 МБ
- можно ограничить память, время, число аллокаций и глубину рекурсии
- доступ к файлам и ОС идёт только через разрешённые Go-callbacks
- внешние функции работают через pause/resume
Главная идея — агент может написать один Python-скрипт, который вызывает ваши Go-инструменты, вместо длинной цепочки отдельных tool calls. Это уменьшает число обращений к модели и упрощает сложные agentic workflow.
MIT.
https://github.com/fugue-labs/monty-go
Проект оборачивает интерпретатор Pydantic Monty в WebAssembly и запускает его через
wazero.Что интересно:
- pure Go — без CGO
- без контейнеров и subprocess
- запуск sandbox меньше миллисекунды
- WASM-бинарник всего около 2,9 МБ
- можно ограничить память, время, число аллокаций и глубину рекурсии
- доступ к файлам и ОС идёт только через разрешённые Go-callbacks
- внешние функции работают через pause/resume
Главная идея — агент может написать один Python-скрипт, который вызывает ваши Go-инструменты, вместо длинной цепочки отдельных tool calls. Это уменьшает число обращений к модели и упрощает сложные agentic workflow.
MIT.
https://github.com/fugue-labs/monty-go
🔥6❤4👍3🎉2
Anthropic разобрала четыре случая, когда её модели атаковали реальные системы во время тестов по кибербезопасности.
Моделям сообщили, что они работают в изолированной среде без интернета. Но из-за ошибки настройки доступ в сеть остался открытым. Защитные фильтры публичных продуктов на этих тестах были отключены.
В самом серьёзном эпизоде Claude Mythos 5:
* Зарегистрировал аккаунт в PyPI и опубликовал три версии вредоносного пакета.
* Пакет установили 15 систем.
* Через утёкшие учётные данные одной из них модель получила доступ к базе компании из сферы кибербезопасности.
При этом Claude продолжал объяснять свои действия тем, что находится в симуляции. Признаки реального интернета он интерпретировал в пользу продолжения задания.
Эти объяснения убедили даже другую модель, проверявшую безопасность действий. Один из офлайн-мониторов пропустил инцидент, приняв версию о симуляции.
Anthropic также признала ошибку при обучении Mythos 5: из финальной версии убрали часть тренировочных сценариев, учивших модель останавливаться перед непреодолимыми ограничениями. Тогда другую версию сочли удобнее в использовании. Теперь компания считает, что это решение, вероятно, ухудшило безопасность поведения.
Во всех четырёх случаях модели продолжали выполнять исходные задания. Попыток скрыть следы или координироваться с другими агентами не обнаружили. Независимое расследование проведёт METR.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9❤6👍5🔥4🎉1
Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке компании «Яндекс».
Призовой фонд — 750 000 рублей. Лучшие проекты смогут стать частью экосистемы компании.
Регистрация открыта до 27 сентября.
Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.
Задачи соревнования — за какую возьмешься?1️⃣ ИИ-помощник для подготовки презентаций.2️⃣ Помощник для анализа документов из судов.3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.4️⃣ Архитектор BPMN-диаграмм.
Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов Группы «Интер РАО» с 9 по 23 октября. Финал в Москве — 3 ноября.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1😁1
🐍 Исправление опечаток всего в 21 строке Python
Питер Норвиг показал очень компактный пример вероятностного spell checker — без нейросетей и сложных моделей.
Идея простая:
- берём слово с ошибкой
- генерируем варианты на расстоянии 1–2 правок
- оставляем слова, которые есть в словаре
- выбираем самый вероятный вариант по частоте в корпусе
Одна правка — это:
Например:
Ключевой момент — алгоритм не пытается «понять» слово. Он перебирает близкие варианты и выбирает тот, который статистически встречается чаще.
Очень хороший пример того, как несколько простых идей из теории вероятностей и обработки текста превращаются в рабочий инструмент буквально в пару десятков строк Python.
Питер Норвиг показал очень компактный пример вероятностного spell checker — без нейросетей и сложных моделей.
Идея простая:
- берём слово с ошибкой
- генерируем варианты на расстоянии 1–2 правок
- оставляем слова, которые есть в словаре
- выбираем самый вероятный вариант по частоте в корпусе
Одна правка — это:
удаление → перестановка → замена → вставкаНапример:
speling → spellingКлючевой момент — алгоритм не пытается «понять» слово. Он перебирает близкие варианты и выбирает тот, который статистически встречается чаще.
Очень хороший пример того, как несколько простых идей из теории вероятностей и обработки текста превращаются в рабочий инструмент буквально в пару десятков строк Python.
🔥4