Мы вообще понимаем, насколько Месси статистически ненормален?
Я наткнулся на цифру: по голам + ассистам за 90 минут он почти на 6 стандартных отклонений выше среднего нападающего из топ-лиг.
Для контекста: это уже не «очень сильный игрок».
Это уровень, который статистика почти не ожидает увидеть при жизни одного поколения.
Вот почему спор про Месси часто ломается: его сравнивают как футболиста, а он по цифрам ближе к аномалии.
Мы реально застали сбой системы.
Или всё ещё есть сомневающиеся?
Я наткнулся на цифру: по голам + ассистам за 90 минут он почти на 6 стандартных отклонений выше среднего нападающего из топ-лиг.
Для контекста: это уже не «очень сильный игрок».
Это уровень, который статистика почти не ожидает увидеть при жизни одного поколения.
Вот почему спор про Месси часто ломается: его сравнивают как футболиста, а он по цифрам ближе к аномалии.
Мы реально застали сбой системы.
Или всё ещё есть сомневающиеся?
❤13🤔4🔥2👎1🤮1💩1
Alibaba и сообщество Data-Juicer развивают open-source систему для обработки датасетов перед обучением, дообучением и RAG.
Data-Juicer помогает чистить, фильтровать, дедуплицировать, синтезировать и анализировать данные. Работает не только с текстом, но и с мультимодальными датасетами: изображениями, аудио и видео. В версии 2.0 заявлено больше 100 операторов для разных модальностей.
Практический сценарий понятный: есть сырой корпус из разных источников, где много дублей, мусора, слабых примеров и перекоса по доменам. Data-Juicer позволяет собрать воспроизводимый data recipe, прогнать его на локальной машине или в распределённом режиме и потом оценить, как изменения в данных влияют на модель.
Проект смотрит на данные как на отдельный слой оптимизации. Позволяет настроить качество, смесь, фильтры и пайплайн обработки. В ранней работе авторы показывали прирост до 7.45% по среднему score на 16 LLM-бенчмарках и 17.5% win rate в GPT-4 pairwise evaluation за счёт data recipes.
https://github.com/datajuicer/data-juicer
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍3🔥2🤡1
Агенты прокачивают друг друга
UCSB-AI выложили GEA, фреймворк для open-ended self-improvement агентов через обмен опытом.
Идея простая, но мощная: улучшать не одного агента в вакууме, а целую группу агентов как одну эволюционирующую систему.
Один агент нашёл удачный паттерн, другой переиспользовал его, третий доработал, группа стала сильнее.
Это похоже на переход от «один AI сам себя улучшает» к «популяция агентов накапливает коллективный опыт».
В репозитории есть код для запуска GEA, интеграция с SWE-bench и Polyglot, Docker-окружение, промпты и инструменты для foundation-моделей. Проект распространяется под Apache-2.0.
https://github.com/UCSB-AI/GEA
UCSB-AI выложили GEA, фреймворк для open-ended self-improvement агентов через обмен опытом.
Идея простая, но мощная: улучшать не одного агента в вакууме, а целую группу агентов как одну эволюционирующую систему.
Один агент нашёл удачный паттерн, другой переиспользовал его, третий доработал, группа стала сильнее.
Это похоже на переход от «один AI сам себя улучшает» к «популяция агентов накапливает коллективный опыт».
В репозитории есть код для запуска GEA, интеграция с SWE-bench и Polyglot, Docker-окружение, промпты и инструменты для foundation-моделей. Проект распространяется под Apache-2.0.
https://github.com/UCSB-AI/GEA
❤1
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
Ох уж, эта богатая жизнь
❤6😁3
Forwarded from Rust
Компания выложила в open source pdf-inspector - библиотеку на Rust, которая превращает PDF в Markdown, сохраняя структуру документа, заголовки и таблицы.
По заявленным тестам, обработка одной страницы занимает около 0,002 секунды, а набор из 200 PDF был пройден примерно за 2,8 секунды.
Главное здесь не одна скорость: парсер старается сохранить исходную логику документа, поэтому результат удобнее сразу отдавать в RAG, поиск, анализ или пайплайн подготовки данных.
Проект полностью открыт.
https://github.com/firecrawl/pdf-inspector
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥4
Forwarded from Data Science. SQL hub
🚀 ИИ-агент ускорил SQLite до 59% меньше чем за 8 часов
Ускорить SQLite хотя бы на 5% уже было бы серьёзным результатом. Это один из самых зрелых и оптимизированных проектов в мире - его команда почти 20 лет выжимает из кода каждую долю производительности.
Но AI-агент KISS Sorcar менее чем за 8 часов и с затратами меньше $150 добился заметного ускорения сразу в нескольких типах нагрузки.
Результаты:
- 2,06× быстрее в официальном
- 1,90× в TATP — транзакционная OLTP-нагрузка
- 1,30× в Star Schema Benchmark — аналитические запросы
- 1,25× в
Агент нашёл места, где стандартная конфигурация SQLite несла лишние расходы — особенно при записи транзакций на диск.
После этого он:
- изменил код и настройки
- прогнал бенчмарки
- проверил свои же изменения на ошибки
- сохранил совместимость с существующими тестами
Более миллиона тестов SQLite продолжают проходить.
анализ зрелой кодовой базы → поиск узких мест → изменение реализации → бенчмарки → проверка собственных решений.
GitHub:
https://github.com/ksenxx/sqlite-optimized/
Blog: https://kisssorcar.github.io/blog/sqlite-optimization-blog.html
#AI #SQLite #Programming #CodingAgents #Performance #OpenSource
Ускорить SQLite хотя бы на 5% уже было бы серьёзным результатом. Это один из самых зрелых и оптимизированных проектов в мире - его команда почти 20 лет выжимает из кода каждую долю производительности.
Но AI-агент KISS Sorcar менее чем за 8 часов и с затратами меньше $150 добился заметного ускорения сразу в нескольких типах нагрузки.
Результаты:
- 2,06× быстрее в официальном
speedtest1 (~30 тыс. операций)- 1,90× в TATP — транзакционная OLTP-нагрузка
- 1,30× в Star Schema Benchmark — аналитические запросы
- 1,25× в
kvtest — работа с BLOB и дисковым I/OАгент нашёл места, где стандартная конфигурация SQLite несла лишние расходы — особенно при записи транзакций на диск.
После этого он:
- изменил код и настройки
- прогнал бенчмарки
- проверил свои же изменения на ошибки
- сохранил совместимость с существующими тестами
Более миллиона тестов SQLite продолжают проходить.
анализ зрелой кодовой базы → поиск узких мест → изменение реализации → бенчмарки → проверка собственных решений.
GitHub:
https://github.com/ksenxx/sqlite-optimized/
Blog: https://kisssorcar.github.io/blog/sqlite-optimization-blog.html
#AI #SQLite #Programming #CodingAgents #Performance #OpenSource
⚡️ Harness Engineering - полный курс на русском
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.
Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.
Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.
https://github.com/justxor/Harness_ru
❤1
Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает
У обычного чат-бота можно проверить финальный ответ. С агентами этого уже мало: модель может выдать вполне убедительный текст, но перед этим выбрать не тот skill, вызвать неправильный tool, потерять контекст на втором сообщении или выполнить только половину задачи.
Ed Crewe описал, как они строили eval-фреймворк для агентного чат-бота вокруг Postgres AI Hybrid Manager.
Начали с простого routing eval: для каждого запроса проверяется, выбрал ли агент нужный skill или tool. Это быстро, детерминированно и удобно гонять в CI.
Следующий слой — Task Completion Rate. Здесь уже оценивается сам результат: выполнил ли агент задачу, использовал ли нужные данные, предложил ли адекватный следующий шаг. Для таких проверок используется LLM-as-a-judge и заранее заданная rubric.
Но и этого оказалось мало. Реальные задачи часто состоят из нескольких сообщений, поэтому тестировать приходится уже целые диалоги с сохранением conversation state и отдельными проверками каждого шага.
Финальный уровень — trajectory testing: смотреть не только на ответ, а на весь путь агента к нему: маршрутизацию, выбор skills, tool calls, промежуточные действия, состояние диалога и итоговый результат.
Получается уже почти классическое E2E-тестирование, только объект проверки здесь не HTTP-запрос или UI, а поведение AI-агента целиком.
В основе автор использует deepeval, поверх которого добавлены YAML goldens, CI, плагины, multi-turn evals и телеметрия через Langfuse.
https://edcrewe.blogspot.com/2026/08/from-routing-checks-to-trajectory.html
У обычного чат-бота можно проверить финальный ответ. С агентами этого уже мало: модель может выдать вполне убедительный текст, но перед этим выбрать не тот skill, вызвать неправильный tool, потерять контекст на втором сообщении или выполнить только половину задачи.
Ed Crewe описал, как они строили eval-фреймворк для агентного чат-бота вокруг Postgres AI Hybrid Manager.
Начали с простого routing eval: для каждого запроса проверяется, выбрал ли агент нужный skill или tool. Это быстро, детерминированно и удобно гонять в CI.
Следующий слой — Task Completion Rate. Здесь уже оценивается сам результат: выполнил ли агент задачу, использовал ли нужные данные, предложил ли адекватный следующий шаг. Для таких проверок используется LLM-as-a-judge и заранее заданная rubric.
Но и этого оказалось мало. Реальные задачи часто состоят из нескольких сообщений, поэтому тестировать приходится уже целые диалоги с сохранением conversation state и отдельными проверками каждого шага.
Финальный уровень — trajectory testing: смотреть не только на ответ, а на весь путь агента к нему: маршрутизацию, выбор skills, tool calls, промежуточные действия, состояние диалога и итоговый результат.
Получается уже почти классическое E2E-тестирование, только объект проверки здесь не HTTP-запрос или UI, а поведение AI-агента целиком.
В основе автор использует deepeval, поверх которого добавлены YAML goldens, CI, плагины, multi-turn evals и телеметрия через Langfuse.
https://edcrewe.blogspot.com/2026/08/from-routing-checks-to-trajectory.html
❤3👍1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Платформа встроила в свой чат-бот открытого ассистента ML Intern, который берет на себя полный цикл машинного обучения по текстовому описанию задачи.
Инструмент ориентирован на пользователей без профильного опыта. Для старта достаточно сформулировать идею в окне ввода текста, включить агента и он сам найдет релевантные модели и датасеты на Hugging Face Hub, в GitHub или в сети.
Перед стартом проводится оценка необходимых вычислительных ресурсов и фиксируется бюджет, за пределы которого агент гарантированно не выйдет.
После подтверждения ML Intern подготавливает данные, запускает обучение, мониторит процесс через отдельный дашборд, выгружает веса обратно на Hub, генерирует отчет и разворачивает интерактивное демо.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
🔥 Один из лучших обучающих курсов на StepiK по SQL
SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.
Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.
Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.
После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.
Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде.
Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами.
Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой.
После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают.
Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
❤1
📘 Бесплатный 17-страничный PDF по Hidden Markov Models (HMM)
Короткий материал от Stanford по одной из классических моделей машинного обучения для работы с последовательностями.
Внутри разбираются:
- состояния и наблюдения
- transition и emission probabilities
- вычисление вероятности последовательности
- декодирование скрытых состояний
- обучение параметров HMM
- применение к последовательным данным
Хороший компактный материал, если нужно быстро разобраться, как работают скрытые марковские модели без чтения огромного учебника.
https://web.stanford.edu/~jurafsky/slp3/A.pdf
Короткий материал от Stanford по одной из классических моделей машинного обучения для работы с последовательностями.
Внутри разбираются:
- состояния и наблюдения
- transition и emission probabilities
- вычисление вероятности последовательности
- декодирование скрытых состояний
- обучение параметров HMM
- применение к последовательным данным
Хороший компактный материал, если нужно быстро разобраться, как работают скрытые марковские модели без чтения огромного учебника.
https://web.stanford.edu/~jurafsky/slp3/A.pdf
AX изолирует задачи, подключает репозитории, MCP-серверы и навыки, ограничивает сетевой доступ, а также позволяет приостанавливать и возобновлять работу агентов с сохранением состояния.
Это не новый агентный фреймворк и не облачный сервис, а инфраструктурный слой для масштабирования долгоживущих агентов в Kubernetes.
https://github.com/google/ax
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2