Анализ данных (Data analysis) – Telegram

Анализ данных (Data analysis)

@data_analysis_ml

46.3K subscribers

2.34K photos

278 videos

1 file

2.08K links

Data science, наука о данных.

@haarrp - админ

@itchannels_telegram - 🔥 главное в ит

@ai_machinelearning_big_data - ML

@machinelearning_interview - вопросы с собесдований по Ml

РКН: clck.ru/3FmyAp

Download Telegram

About

Blog

Apps

Platform

Анализ данных (Data analysis)

46.3K subscribers

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🚀 Tencent выложила в открытый доступ Hunyuan-GameCraft — инструмент для генерации интерактивных игровых видео с высокой реалистичностью.

Что это значит:
• Из одной картинки сцены и команд пользователя (клавиатура, мышь) создаётся полноценное игровое видео от первого или третьего лица.
• Движения плавные и точные: можно контролировать скорость, угол поворота и строить сложные траектории, а не только примитивную анимацию.
• Среда тоже живая — облака, дождь, снег, вода и другие эффекты генерируются динамически.
• Картинка остаётся чёткой даже при резких перемещениях — сохраняется информация о сцене.
• Работает быстро и дёшево: за счёт оптимизаций и квантования 13B-модель тянет даже RTX 4090, без дорогого рендера и сложного 3D-моделирования.

Построен на базе HunyuanVideo.

🟠

Project Page: https://hunyuan-gamecraft.github.io

🟠

Code: https://github.com/Tencent-Hunyuan/Hunyuan-GameCraft-1.0

🟠

Technical Report: https://arxiv.org/abs/2506.17201

🟠

Hugging Face: https://huggingface.co/tencent/Hunyuan-GameCraft-1.0

@data_analysis_ml

#AI #GameDev #VideoGeneration #HunyuanVideo #OpenSource #Tencent #GamingAI

Please open Telegram to view this post

VIEW IN TELEGRAM

❤6🔥5👍3

4.34K viewsedited 08:45

Анализ данных (Data analysis)

🚀 DeepSeek R2 могут выпустить между 15 и 30 августа на чипах Huawei Ascend 910B.

Мощность: 512 PFLOPS FP16 (примерно как 91% кластера NVIDIA A100) при этом затраты меньше на 97%.

Загрузка чипов — около 82%.

Архитектура: гибридный Mixture of Experts — при обработке токена активируются только нужные эксперты (78B из 1.2T параметров), что ускоряет работу и снижает вычисления.

Ходят слухи о собственном стеке для распределённого обучения, но подтверждений пока нет.

Все технические данные совпадают с предыдущими утечками по железу.

❤14👍10🔥7🥱1

4.51K views12:01

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🎮 GPT-5 прошёл Pokémon Red!

6 470 шагов против 18 184 у o3 — колоссальный прогресс в эффективности.

• GPT-5 гораздо реже «галлюцинирует» — главный фактор ускорения.
• Лучшая пространственная логика: o3 часто пытался «пробиться» сквозь стены и путался в сложных локациях, а GPT-5 умеет планировать длинные последовательности действий с минимумом ошибок.
• Более чёткое планирование целей и их последовательное выполнение.

Теперь посмотрим, как он справится с финальным испытанием! 🔥

🔜 Следующий челлендж: GPT-5 играет Pokémon Crystal. Старт скоро на Twitch!

Livestream: https://twitch.tv/gpt_plays_pokemon

👍17❤8🔥3😁2

4.46K views14:38

Анализ данных (Data analysis)

Разбираем тестовое задание в Яндекс на позицию Junior аналитика данных

Тестовое задание — важная часть трудоустройства аналитика. Это шанс показать свои навыки на практике и получить оффер мечты.

Приглашаем на бесплатный вебинар, где Андрон Алексанян — эксперт в области аналитики и CEO школы аналитики Simulative — в прямом эфире разберет тестовое задание в Яндекс на позицию Junior аналитика данных.

⚡️На вебинаре вы:

🟠узнаете, какие навыки и знания необходимы для успешного выполнения заданий;
🟠поймёте, что хочет увидеть работодатель;
🟠получите советы и лайфхаки;
🟠вместе с Андроном разберете в прямом эфире реальный пример тестового 🔥

Чему именно научимся на вебинаре:

🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла;
🟠Найдем закономерности и отличия использования сервиса на мобильных устройствах и компьютерах;
🟠Разберем фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др.

🕗 Настоятельно рекомендуем не пропускать — для зрителей у нас есть особый бонус, который обеспечит вам уверенный старт в вашей карьере.

😶Зарегистрироваться на бесплатный вебинар

Please open Telegram to view this post

VIEW IN TELEGRAM

❤4👍4🤣2

4.18K views08:15

Анализ данных (Data analysis)

🖥

MongoDB выпускает MCP Server — теперь любой может стать дата-инженером

MongoDB представили открытый MCP сервер, который позволяет AI-инструментам вроде Claude, Cursor и GitHub Copilot напрямую общаться с вашей MongoDB-базой.

Теперь даже без знаний запросов можно просто написать:
• «Покажи самых активных пользователей»
• «Создай нового пользователя с правами только на чтение»
• «Как устроена коллекция orders?»

⚙️ MCP Server поддерживает:
• MongoDB Atlas
• Community Edition
• Enterprise Advanced

📌 Главное — не нужен SQL, не нужно знать синтаксис. Достаточно обычного языка.

💡 Под капотом: AI превращает ваши фразы в рабочие Mongo-запросы.
Открытый исходный код. Готово к продакшену.

📌 GitHub

#MongoDB #AItools #OpenSource #MCP

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤12👍11🔥6

5.55K views10:15

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🎥 Stand-In (BowenXue) — лёгкий и plug-and-play фреймворк для генерации видео с сохранением личности

📌

Что делает:
- Генерирует видео, сохраняя лицо или стиль персонажа, обучив всего ~1 % новых параметров на базе модели генерации видео. Результат сопоставим с полным переобучением, но быстрее и легче.
- Поддерживает генерацию по тексту с контролем идентичности, смену стиля, pose-guidance, face-swap, стилизацию и даже генерацию не-людей.
- Лицензия Apache-2.0 — открытое использование и модификация.

Что нового:
- Версия v1.0 (153 M параметров) с весами на базе Wan2.1-14B-T2V и кодом для инференса.
- Интеграция с ComfyUI: выпущен preprocessing-нод для улучшенной поддержки, особенно после сторонней интеграции.

https://huggingface.co/BowenXue/Stand-In

#opensource #ai #ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤7👍6🔥3

4.47K views12:04

Анализ данных (Data analysis)

🚀 GPT-5 бьёт рекорды в офтальмологии — почти идеальная точность и лучший бюджетный режим “mini-low”

🧪 В исследовании сравнили 12 конфигураций GPT-5 с o1, o3 и GPT-4o на 260 закрытых вопросах American Academy of Ophthalmology BCSC.

Ответы давались без примеров в промпте, в формате: одна буква + одно предложение-обоснование — для максимально строгой проверки.

🎯 Результаты:
- GPT-5-high — 96,5% точности
- o3-high — 95,8%
- o1-high — 92,7%
- GPT-4o — 86,5%
- GPT-5-nano-low — 77,3%

📊 “Reasoning effort” — настройка глубины размышлений модели. Минимальный режим показал худшие результаты и был исключён.
По оценке Bradley-Terry, GPT-5-high в 1,66× сильнее o3-high и в 5,10× — o1-high по точности, а по качеству объяснений — на 11% лучше o3-high.

💰 На графике «точность / стоимость» выявлен Pareto-фронтир: от GPT-5-nano-low до GPT-5-high.
Лучший баланс цены и качества — GPT-5-mini-low: дешевле и точнее всех альтернатив в своём сегменте.

📌 Выводы:
- GPT-5-high — для задач, где важна максимальная точность.
- GPT-5-mini-low — оптимален для масштабного применения с ограниченным бюджетом.
- GPT-5-medium — близок к o3-high по балансу цены и качества.

📌 Читать полностью

❤17👍4🔥3🥱2

4.72K views15:42

Анализ данных (Data analysis)

Только что в России начали работать нейросети от Google — без обхода блокировок и без смены региона.

Пробуем тут.

@data_analysis_ml

❤37🥴15👍10🤯4❤‍🔥3🔥3🥱3😁2

10.7K viewsedited 21:26

Анализ данных (Data analysis)

Forwarded from Machinelearning

Media is too big

VIEW IN TELEGRAM

✔️

Claude будет завершать токсичные диалоги.

Anthropic добавила в Claude Opus 4 и 4.1 возможность принудительно завершать беседу. Эта функция предназначена для редких, крайних случаев постоянно враждебного или оскорбительного поведения со стороны пользователя.

Это крайняя мера, к которой чат-бот прибегнет только после многократных безуспешных попыток перенаправить разговор в продуктивное русло или по прямой просьбе пользователя. При этом система не будет использовать эту возможность, если есть риск, что пользователь может причинить вред себе или окружающим.

Когда Claude завершает диалог, пользователь не сможет отправлять новые сообщения в этой ветке, но сможет начать новый чат или отредактировать старые сообщения для создания новых ветвей.
anthropic.com

✔️

Мобильное приложение ChatGPT заработало 2 млрд. долларов с момента запуска.

Согласно данным компании Appfigures, мобильное приложение ChatGPT сгенерировало 2 млрд. долларов потребительских расходов с момента запуска в мае 2023 года. В среднем каждый из 690 млн. пользователей потратил в приложении 2.91 доллара. Это говорит о готовности аудитории платить за ИИ-сервисы на мобильных устройствах.

Темпы роста выручки резко ускорились в этом году. С января по июль 2025 года пользователи потратили в приложении 1.35 млрд. долларов, на 673% больше, чем за аналогичный период прошлого года. Это эквивалентно примерно 193 млн. долларов в месяц. США лидируют по доходам (38%), а Индия — по количеству установок (14%).

Эти метрики показывают отрыв ChatGPT от конкурентов. Для сравнения, Grok заработал в этом году 25.6 млн., а доходы Claude и Copilot вместе взятых составляют лишь одну тридцатую от мобильной выручки OpenAI.
techcrunch.com

✔️

Tencent выпустила облегченную модель для генерации 3D-миров.

Tencent представила Hunyuan World Model 1.0-Lite оптимизированную версию своей модели для генерации трехмерных сцен, которая может работать на потребительских GPU. Разработчики снизили требования к видеопамяти на 35% (с 26 до 17 ГБ) благодаря динамическому FP8-квантованию.

За счет использования SageAttention и оптимизации кэширования удалось ускорить инференс более чем в 3 раза с потерей точности менее 1%.
Как и оригинальная версия, 1.0-Lite имеет открытый исходный код и уже доступна на GitHub, Hugging Face, а также в виде демо SceneTo3D.
Tencent Hunyuan в сети X

✔️

OpenAI работает над ИИ-системами, способными решать задачи часами и днями.

В подкасте на Youtube OpenAI рассказали о разработке нового класса моделей, ориентированных на долгосрочное мышление. Системы на их основе смогут планировать, рассуждать и экспериментировать над одной проблемой на протяжении длительного времени, от нескольких часов до нескольких дней.

По словам OpenAI , первые проблески этого подхода уже видны в моделях, которые недавно завоевали золото на международных олимпиадах по математике и информатике. Конечная цель - автоматизировать исследования, например, для поиска новых идей в медицине или в области безопасности самого ИИ.

В OpenAI признают, что реализация этой концепции потребует значительно больших вычислительных мощностей, чем доступны сегодня. Это объясняет готовность Сэма Альтмана инвестировать в строительство дата-центров в ближайшие годы.
OpenAI на платформе Youtube

✔️

Google сделала поиск авиабилетов по текстовому описанию.

Google запустил новый инструмент Flight Deals. Он использует ИИ для поиска выгодных перелетов по запросам на естественном языке, а не через стандартные фильтры. Пользователи могут описать свои пожелания в свободной форме, например, «недельная поездка этой зимой в город с хорошей едой, только прямые рейсы». Инструмент ориентирован на путешественников с гибкими планами, для которых приоритетом является цена.

По заявлению Google, система использует продвинутый ИИ для понимания нюансов запроса, а затем анализирует данные Google Flights в реальном времени, чтобы показать актуальные варианты. Сервис запускается в бета-режиме и в течение недели станет доступен пользователям в США, Канаде и Индии.
blog.google

@ai_machinelearning_big_data

#news #ai #ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤14👍4🤩2🌭2🥰1

3.05K views06:35

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🚀

ByteDance выкатили **UI-TARS Desktop** — опенсорсный AI-агент для управления рабочим столом

📌 Что умеет:
- Управлять любыми приложениями через язык — клики, ввод текста, навигация
- Работает локально, бесплатно и под лицензией Apache 2.0
- Поддержка Windows и macOS (Linux в разработке)
- Новое в v0.2.0 — удалённое управление компьютером и браузером (пока только для материкового Китая)

📌

Зачем нужен:
- Локальный и приватный ассистент без облака
- Полезен для RPA, автоматизации и тестирования
- Основан на визуально-языковой модели, которая распознаёт интерфейсы и взаимодействует с ними

📂

Код: github.com/bytedance/UI-TARS-desktop

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤18👍8🔥5

6.46K views09:31

Анализ данных (Data analysis)

🖥 Теперь писать сложные промты самому не обязательно — OpenAI выпустили генератор, который превращает даже простой запрос в подробную инструкцию для ИИ.

Принцип простой: описываете, что хотите получить, нажимаете Optimize — GPT-5 анализирует запрос и выдаёт готовый детализированный промт. Работает бесплатно.

Инструмент может упростить работу с любыми нейросетями, особенно если у вас нет опыта в составлении промтов.

Готовый вы можете сразу попробовать в @Chatgpturbobot

Please open Telegram to view this post

VIEW IN TELEGRAM

❤12👍9🔥3😁3

3.84K views10:18

Анализ данных (Data analysis)

🖥

vLLM-CLI — удобный инструмент командной строки для управления vLLM-серверами

Инструмент объединяет удобный интерфейс, профили конфигурации и мониторинг, делая работу с LLM комфортной и быстрой.

Основные возможности:
- Интерактивный режим — меню прямо в терминале, не нужно запоминать длинные аргументы.
- Командный режим — можно автоматизировать запуск и мониторинг серверов.
- Управление моделями:
• Автоматический поиск локальных моделей.
• Поддержка загрузки моделей из Hugging Face Hub.
- Профили конфигурации: встроенные варианты (`standard`, moe_optimized, `high_throughput`) для разных сценариев, включая работу с несколькими GPU.
- Мониторинг сервера: просмотр загрузки GPU, памяти и логов в реальном времени.

📌 Github

@data_analysis_ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤10👍5🔥3

3.9K views11:01

Анализ данных (Data analysis)

Кто быстрее проходит Pokémon Red.

📊 Результаты:
- GPT-5 — 6 470 шагов
- o3 — 18 184
- Claude — 35 000
- Gemini 2.5 Pro — 68 000

⚡ GPT-5 в три раза быстрее o3 и почти в десять раз эффективнее Gemini.

Такое сравнение хорошо показывает не только «умение играть», а способность моделей к планированию, оптимизации и минимизации лишних действий.

🥱13❤6👍4🔥2

3.75K views20:45

Анализ данных (Data analysis)

🛢 Данные — новая нефть, и именно дата-инженеры умеют эту нефть «добывать», очищать и хранить. Спрос на них стремительно растёт, конкуренция пока минимальна, а зарплаты — выше среднего.

Освоить ключевые компетенции дата-инженера поможет онлайн-магистратура Нетологии и НИУ ВШЭ «Инженерия данных».
За 2 года вы на практике изучите Python, Java, Scala, Kotlin и SQL, научитесь проектировать пайплайны и обрабатывать данные, работать с системами хранения данных и базами данных в облаке. Программа даёт широкий простор для переквалификации, поэтому после учёбы сможете перейти в MLOps, DevOps или менеджмент.

Онлайн-формат позволяет учиться без отрыва от привычной жизни и совмещать занятия с работой. При этом у вас будет отсрочка от армии, льготы на проезд и все остальные бонусы очного обучения.

Станьте магистром программной инженерии с дипломом одного из лучших вузов страны и получите веское преимущество при приёме на работу: https://netolo.gy/ekal

🎁 В этом году при поступлении на программу вы получаете курс по ещё одной IT-профессии в подарок — отличная возможность расширить свой профиль и усилить CV.

Реклама. ООО "Нетология". ИНН 7726464125. Erid: 2VSb5z9sojP

❤4👍2🙏1

3.31K views08:02

Анализ данных (Data analysis)

🔌 LIDA — инструмент для автоматического создания визуализаций данных с помощью ИИ. Библиотека использует большие языковые модели для генерации и объяснения графиков на лету, работая с популярными библиотеками вроде Matplotlib и Seaborn.

Проект особенно полезен для аналитиков: он умеет дорабатывать графики по текстовым запросам, оценивать их качество и даже создавать инфографику. Есть веб-интерфейс и поддержка локальных LLM.

🤖 GitHub

@data_analysis_ml

❤7👍3🔥3🤔1

3.41K views10:00

Анализ данных (Data analysis)

Конференция, на которую нужно прийти Data Engineers🔥
23 сентября пройдет Data Internals X 2025 — единственная в России конференция, где создатели СУБД и движков обработки данных делятся опытом работы с реальными production-системами экстремального масштаба. Вас ждёт по-настоящему "хардкорная" программа.

🎯 Глубина технических решений
Программа конференции сфокусирована на внутренних механизмах работы с данными — от разработки СУБД до оптимизации запросов и устойчивости к высоким нагрузкам. Это редкая возможность погрузиться в технические детали, которые обычно остаются за кадром.

🏭 Практический опыт масштабирования
Все доклады основаны на реальном опыте работы с петабайтными данными, высоконагруженными системами и решением production-задач в крупных компаниях (Яндекс, Сбер, VK, Т-Банк).

🔧 Импортозамещение и Open Source
Особый акцент на отечественные решения и open-source технологии, что критически важно в текущих реалиях.

🧠 Концентрированный опыт
Максимум пользы для повышения квалификации за один день: 20+ докладов, рекордная плотность экспертных знаний и нетворкинг с 300+ участниками.

📌Изучить расписание и забронировать билеты на сайте конференции

Используйте промокод "Data" для получения скидки 15%.
Приходите сами и приглашайте своих коллег 🔥

❤1🐳1

3.16K views15:05

Анализ данных (Data analysis)

🦅 Korvus — RAG-пайплайн в одном SQL-запросе. Библиотека объединяет векторизацию, семантический поиск и генерацию ответов в единый Postgres-запрос. Работает через расширения pgvector и pgml, заменяя сложные микросервисные архитектуры простым вызовом из Python/JS/Rust.

Инструмент локально выполняет все этапы (от чанкинга текста до работы LLM) прямо в базе данных. Подходит для проектов, где важны скорость и минимальная инфраструктурная нагрузка.

🤖 Github

@data_analysis_m

👍14❤4🥰2

3.35K views16:06

Анализ данных (Data analysis)

🚀 NVIDIA представила **Nemotron-Nano v2** — новую линейку открытых моделей

Модели:
- 12B Base
- 9B Reasoning
- 9B Base

Архитектура: Hybrid Mamba2–Transformer (128K контекст, 4 attention-слоя)
Обучение: 10.6T токенов (из них 3.5T синтетика: DeepSeek, Qwen, Nemotron-4, phi-4 и др.)
Языки: 15 естественных + 43 языка программирования
Датасеты: Nemotron-CC v2 + Nemotron-CC-Math (133B токенов, 5.5× FineMath)

🔥 Бенчмарки
- Математика: 91.4 GSM8K CoT, 63.6 MATH L5, AIME 30→56.7
- Код: 58.5 HumanEval+, 58.9 MBPP+
- Общие знания: 90.7 ARC, 79.9 HellaSwag
- Длинный контекст: 82.2 RULER-128K

✨ Особенности
- Nemotron-CC-Math — первый масштабируемый пайплайн с Lynx + LLM cleanup для сохранения LaTeX и кода. Дал SOTA-буст (+12.6 MATH, +14.3 MBPP+).
- Эффективность: дистилляция 12B → 9B (480B токенов), ~1.5e24 FLOPs, ~724 MWh.
- Деплой: Hugging Face, NGC, NeMo, TRT-LLM, vLLM (GPU-оптимизация).
- Открытость: релиз моделей, датасетов и полных пайплайнов извлечения.

📌 Nemotron-Nano v2 сочетает сильную математику, код и длинный контекст в компактных моделях, готовых к реальному использованию.

🟠

MODELS: https://huggingface.co/collections/nvidia/nvidia-nemotron-689f6d6e6ead8e77dd641615

🟠

SETS: https://huggingface.co/collections/nvidia/nemotron-pre-training-dataset-689d9de36f84279d83786b35

🟠

RELEASE: https://research.nvidia.com/labs/adlr/NVIDIA-Nemotron-Nano-2/

@data_analysis_m

Please open Telegram to view this post

VIEW IN TELEGRAM

👍8❤4🔥2

2.66K views08:54

Анализ данных (Data analysis)

This media is not supported in your browser

VIEW IN TELEGRAM

🖥Альтман и Цукерберг в стиле Матрицы:

— Сэм, выбери таблетку: красную или синюю.
— А можно API-доступ к обеим?

Please open Telegram to view this post

VIEW IN TELEGRAM

😁21❤5👍3

2.47K viewsedited 10:35