Big Data AI
18.2K subscribers
1.13K photos
165 videos
19 files
1.13K links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
CLIX — агент CLI, который выполняет команды на вашем компьютере.

В настоящее время в clix используется gpt-4 для LLM.
🐳1
Forwarded from Machinelearning
⚡️ Qwen представила E-Commerce Bench - новый бенчмарк для проверки AI-агентов на долгосрочном управлении бизнесом.

Агент получает ¥100 000 и должен целый год управлять интернет-магазином:

- искать поставщиков
- торговаться
- выставлять цены
- запускать акции
- контролировать склад
- управлять денежным потоком

Среда построена на реальных данных электронной коммерции.

Внутри:

- 6886 товаров
- 576 поставщиков
- 152 из них мошенники
- комиссии за хранение
- возвраты
- репутация
- ограниченный рабочий день

Оценка идёт сразу по 7 направлениям, поэтому одной модели, которая была бы лучшей во всём, пока нет.

Blog: https://qwen.ai/blog?id=e-commerce-bench

Paper: https://arxiv.org/abs/2608.30730

Project: https://ecbench.github.io

Code: https://github.com/QwenLM/E-CommerceBench

@ai_machinelearning_big_data

#Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic запустила Claude Fable 5.1.

И почти сразу OrcaReplay вытащил системный промпт Claude Code для новой модели.

В опубликованном файле можно посмотреть, какие инструкции получает Claude Code перед началом работы: как он должен использовать инструменты, обращаться с кодом, соблюдать ограничения и вести себя внутри агентного окружения.

Ссылки:

Fable 5.1 System Prompt:
https://github.com/Continuum-AI-Corp/OrcaReplay/blob/main/prompt/CLAUDECODE/claude-fable-5-1-print-system-prompt.md

OrcaReplay:
https://github.com/Continuum-AI-Corp/OrcaReplay
4🔥3👍2
⚡️ Cyber-Prime 1 2.6B - компактная модель специально для кибербезопасности

Появилась Cyber-Prime 1 2.6B - небольшая agentic-модель для задач кибербезопасности, построенная на базе LFM 2.6B от Liquid AI.

Модель обучали на:
- reasoning traces;
- датасетах по кибербезопасности;
- синтетических данных автора.

Дополнительно её прогоняют через цикл recursive self-improvement, поэтому новые чекпоинты планируют выпускать очень быстро.

Сейчас доступна версия на 2.6B параметров, а дальше обещают:
- 4B;
- 7.9B MoE.

Вес модели уже открыт:

https://huggingface.co/Akahsizrr/Cyber-Prime-1-2.6B
3🔥2👍1
🔥 MWS Cloud первой в России развернула модель GLM-5.3 в собственной инфраструктуре.

Она доступна в MWS GPT Model Hub и полностью локализована в России — данные пользователей не покидают страну. При этом стоимость останется на уровне GLM-5.2.

Российские компании могут использовать GLM-5.3 использовать модель для разработки ПО и решения агентских задач в отечественном ИТ-контуре. Например, для анализа и генерации кода, поиска ошибок и работы с репозиториями.

Компания-разработчик Z.аi заявляет, что модель использует ту же архитектуру, что и GLM-5.2. Прирост качества получили благодаря масштабированию посттренинга. По оценкам экспертов, модель GLM-5.3 работает на уровне передовых закрытых моделей, таких как Claude Fable 5 и GPT-5.6 Sol.
👍3🔥2🤣21
FinFIRST - финансовый бенчмарк, который проверяет не только ответ, но и весь путь к нему

Ant Group вместе с инвестиционно-банковской командой CICC и более чем 50 финансовыми специалистами разработала FinFIRST - бенчмарк для оценки AI-агентов на реальных финансовых задачах.

Он проверяет:

- как агент ищет источники
- насколько свежие данные использует
- умеет ли объединять несколько источников
- выбирает ли надёжные доказательства
- правильно ли считает
- насколько легко проверить полученный результат

Задачи охватывают Китай, США, Гонконг и другие рынки:

- 60,2% - на китайском
- 39,8% - на английском
- 61,8% требуют явных вычислений
- 32,5% требуют нескольких источников
- в 75,6% случаев агент сам должен найти и выбрать источники

Для сравнения протестировали 15 конфигураций моделей в одинаковом ReAct-сетапе с Web Search, Visit и Python.

Ling-3.0-flash-Fin набрала 82,45% по source verification, показав один из сильных результатов среди протестированных open-weight моделей.

Уже готовится FinFIRST V2 - с более широким набором задач по финансовому поиску и сложным research-сценариям.

https://huggingface.co/datasets/inclusionAI/FinFIRST
👍21
🔥 На Hugging Face выложили датасет на 4,5 МИЛЛИАРДА TikTok-постов

Это огромная база метаданных TikTok: 4 501 811 789 записей, около 289 ГБ в 27 Parquet-файлах.

Для каждого ролика есть:

- подпись и упоминания
- дата публикации и длительность
- просмотры, лайки, комментарии, репосты и сохранения
- используемый звук
- язык и страна
- отметка рекламы

Данные собирались примерно три недели через мобильный API TikTok. Самих видео и данных об авторах в датасете нет.

Можно стримить через Hugging Face Datasets или анализировать Parquet напрямую через DuckDB/Polars — без загрузки всего датасета целиком.

Лицензия - только для исследований и обучения. Авторы отдельно предупреждают о GDPR/CCPA и о том, что сбор данных противоречил ToS TikTok.

https://huggingface.co/datasets/kuben-developer/tiktok-videos-4b
7👍4🔥2
😁10💯32
Forwarded from Machinelearning
📲 OpenAI решила задачу тысячелетия? Пока доказательств нет

Математик Тристан Бакмастер утверждает, что 6 сентября представители OpenAI сообщили ему о готовом доказательстве образования сингулярности в уравнениях Навье–Стокса с внешней силой.

Если доказательство верно и соответствует условиям задачи Института Клэя, оно может закрыть одну из главных нерешённых проблем математики.

До этого Бакмастер и Левент Алпёге с помощью Claude и моделей OpenAI получили новые результаты для уравнений Эйлера и родственных систем. Однако эти работы сами по себе задачу Навье–Стокса не решают.

Параллельно возник спор об авторстве. Бакмастер заявляет, что ему предлагали оформить результат OpenAI без Алпёге, работающего в Anthropic. Себастьен Бюбек назвал обвинения ложными.

Доказательство OpenAI не опубликовано, Бакмастер его не видел, независимой проверки нет. Институт Клэя по-прежнему указывает задачу как нерешённую.

https://www.claymath.org/millennium/navier-stokes-equation/

@ai_machinelearning_big_data
2👍2
Nex-AGI открыла Nex-N2.5-Max - MoE-модель на 1,6 трлн параметров

Модель построена на DeepSeek-V4-Pro-Base и ориентирована на программирование, работу с инструментами и длинные последовательности агентных задач. При обработке токена активируются около 49 млрд параметров. Ввод - только текст.

По результатам разработчиков:

* AutomationBench - 50,2, у Claude Opus 5 - 50,3.
* BrowseComp - 92,6, у Claude Opus 5 - 90,8.
* Terminal-Bench 2.1 - 86,1.
* Toolathlon Verified - 74,7.

Веса доступны под Apache 2.0. Репозиторий занимает примерно 1,65 ТБ.

В линейке также вышла Nex-N2.5-mini на 35 млрд параметров с поддержкой изображений и задач управления компьютером.

Модель Max - https://huggingface.co/nex-agi/Nex-N2.5-Max)
Модель mini - https://huggingface.co/nex-agi/Nex-N2.5-mini
👍31
Say my name
😁75👎1💯1
🛡 LLM, Guardrails и Zero Trust:
вебинары о безопасной работе с ИИ


➡️ 15 сентября
Как защитить чувствительные данные при работе с LLM с помощью Guardrails

Эксперты Cloud․ru расскажут о том, как Guardrails помогают контролировать данные, которые передаются модели: персональные данные, API-ключи, внутренние идентификаторы и другую чувствительную информацию. А еще покажут, как встроить Guardrails Filter в процессы.


Зарегистрироваться

➡️ 17 сентября
ИИ в облаке: кто отвечает за безопасность


Эксперты Cloud․ru разберут, как выстроить безопасную ИИ-инфраструктуру без лишних рисков. Отдельно обсудят подход Zero Trust: расскажут, как контролировать доступ к данным, моделям и сервисам в облаке.


Зарегистрироваться

Если вы работаете с LLM, GenAI-сервисами или строите ИИ-инфраструктуру в облаке — присоединяйтесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
🚨 Слухи: OpenAI решила гипотезу Ходжа

В соцсетях обсуждают возможное решение ещё одной задачи тысячелетия. Параллельно распространяются заявления, что OpenAI или Anthropic близки к доказательству гипотезы Бёрча - Свиннертона-Дайера.

За решение каждой предусмотрена премия $1 млн.

Но публичных доказательств и официальных подтверждений этих сообщений найти не удалось. На сайте Института Клэя гипотеза Ходжа по-прежнему имеет статус нерешённой.

Если результаты подтвердятся, это станет крупным достижением ИИ в математике. Пока заявления об AGI и гонке за решениями перед IPO остаются интерпретациями авторов слухов.

Статус гипотезы Ходжа - https://www.claymath.org/millennium/hodge-conjecture/