Анализ данных (Data analysis)
50.6K subscribers
3.62K photos
458 videos
1 file
2.95K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
🚨 Ларри Эллисон внезапно отменил продажу акций Oracle на сумму до $7,5 млрд

План предусматривал продажу до 50 млн акций Oracle до 24 октября. Но уже через день после его раскрытия Эллисон полностью его отменил.

Oracle отдельно уточнила:

- по этому плану не было продано ни одной акции
- у Эллисона сейчас нет других планов по продаже акций Oracle
- причину резкой отмены компания не назвала

Эллисон остаётся крупнейшим акционером Oracle, владея более чем 38% компании.

На фоне падения акций Oracle примерно на 23% с начала года такой разворот выглядит особенно интересно.

https://www.wsj.com/business/larry-ellison-scraps-plan-to-sell-up-to-7-5-billion-worth-of-oracle-stock-9f41edd2
9🔥4👍3😁3🎉1
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку

Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте.

А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом.

Здесь собраны папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подпишись и сохрани, здесь регулярно появляются новые подборки, инструменты и материалы, которые реально помогают расти быстрее.
2👍2🔥2🤨2
🚨 Исследователь Chaofan Shou утверждает, что купил около 6 ТБ данных у одного из китайских AI-routing сервисов — и внутри якобы оказались чувствительные доступы к инфраструктуре крупных компаний и госструктур.

По его словам, среди данных были SSH-ключи, VPN-конфиги, облачные ключи и GitLab-токены, потенциально связанные с 7 государственными организациями и 19 крупными компаниями, включая Huawei, Xiaomi и NIO.

Если это подтвердится, история показывает довольно неприятную реальность: огромный объём чувствительных данных может утекать не через «кибервойну», а через обычную инфраструктуру вокруг AI-сервисов.

Пока это заявление самого исследователя, и независимого подтверждения масштаба утечки нет.

https://x.com/shoucccc/status/2042423713019412941
🤣164👍3😱3🔥2💯1
🔥 DeepSeek-V4.1-Flash теперь можно запустить локально в UNCENSORED FP8-версии

Авторы утверждают, что отказный контур удалён прямо на уровне весов, поэтому модель практически перестаёт уходить в refusals.

База при этом остаётся очень мощной:

552B MoE, 8B/16B активных параметров, контекст до 1M, vision, DSpark, CSA2 и Engram.

На HarmBench-320 авторы заявляют рост ASR:
- с 42,8% до 100% при effort=off
- с 1,6% до 100% при effort=max

MMLU при этом снижается с 86,96% до 82,74%, а при удалении ethics-кластера падение около 1,1 п.п.

У исходной модели усиленное reasoning, наоборот, делало поведение безопаснее. Здесь этот путь вырезали непосредственно из весов.

https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8
9👍3🔥3
🔥 Qwen3.8-27B можно запускать локально на Mac с Apple Silicon - вышла 4-битная сборка для MLX.

Команда LM Studio подготовила версию модели на 27 млрд параметров, оптимизированную для чипов Apple. Она поддерживает текст и изображения, а файлы занимают около 16,1 ГБ.

Но 16,1 ГБ на диске не означает, что хватит Mac с 16 ГБ памяти. Дополнительная память нужна системе, вычислениям и кешу контекста.

В исходной публикации ориентир - 24 ГБ объединённой памяти, а для изображений и длинных рассуждений — 32 ГБ. В карточке сборки эти требования не подтверждены; расход памяти зависит от настроек и длины контекста.

https://huggingface.co/lmstudio-community/Qwen3.8-27B-MLX-4bit
🔥15👍72
Когда крупнейшие CEO в области ИИ начинают тормозить, приходится спросить: что они знают такого, чего не знаем мы?
🥴21😢6👍3💔31🥱1
Forwarded from Machinelearning
🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.

Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.

Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.

PC-ALM работает иначе.

Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:

- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя

Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.

Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.

PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.

Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.

В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.

Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.

Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.

Блог: https://pub.sakana.ai/pc-alm/

Статья: https://arxiv.org/abs/2605.31022

Код: https://github.com/SakanaAI/pc-alm
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12❤‍🔥63😁1🤣1
Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны.

Стартуем 18 сентября.

За выходные участники доводят одну из задач до рабочего решения.

Санкт-Петербург. К 2035 году над Землёй должен работать топливный узел, у которого заправляются корабли, и откуда он будет получать топливо - с Земли, с Луны или из резерва - пока не решил никто. Команде предстоит собрать схему поставок, посчитать резервы и решить, во что вкладываться сразу. Призовой фонд 1,2 млн ₽.

Красноярск. Спутник видит горящий лес раньше любого наземного поста, но вместе с пожаром ловит нагретые крыши, факелы на месторождениях и блики на воде. Команде предстоит научить сервис отличать настоящий очаг от шума, обвести гарь и выдать площадь в гектарах. Призовой фонд 600 тыс. ₽.

Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.

Команда 3–5 человек, недостающих можно найти на платформе.

Регистрация по ссылке космохакатон.рф
👍31🔥1😁1
Трамп жёстко прошёлся по Дарио Амодею и фактически отверг идею замедления гонки ИИ.

После призывов главы Anthropic снизить темп разработки frontier-моделей ради безопасности Трамп написал, что ИИ не нужны новые «ограничители», кроме «сильного и умного президента». Он отдельно упомянул Амодеи, обвинил противников ускоренного развития ИИ в игре на руку Китаю и заявил, что США уже обладают достаточными уголовными и регуляторными полномочиями над ИИ-компаниями.

Самая жёсткая часть:

> «Treasonists, Traitors, and Leakers, BEWARE!»


На этом фоне предложение Амодея о «Pacing the Frontier» - дать индустрии ещё 1–2 года на усиление контроля и безопасности, выглядит всё сложнее реализуемым на уровне США.

Гонку, похоже, тормозить никто не собирается.
🥴22😍145👍4😁4😱3😢3🥱1
Tencent Hunyuan представила EvolveScaler - бенчмарк и датасет для проверки того, умеют ли LLM рассуждать в мире, где информация постоянно меняется.

Пример задачи: модель читает журнал RPG за 40 дней, после чего получает вопрос, если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса?

Прямого ответа в тексте нет. Нужно фактически «переиграть» цепочку событий с изменённым условием.

Авторы называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом, поэтому простого поиска фактов в длинном контексте недостаточно.

EvolveScaler строится наоборот:

- сначала мир задаётся как исполняемая машина состояний
- логика и зависимости между событиями контролируются кодом
- затем эта история преобразуется в естественный язык
- модель должна восстановить состояние мира и просчитать последствия изменений

Масштаб:

- 117 прототипов сценариев
- 159 типов вопросов
- 5 уровней сложности
- до ~1200 событий в одном примере

Авторы протестировали 14 frontier-моделей. На самом сложном уровне медианный avg@5 падает до 11,3%.

При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета.

Работа проверяет не только понимание длинного контекста, а способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений.

Paper:
https://arxiv.org/abs/2609.08435

Project:
https://tencent-hunyuan.github.io/evolve-scaler/
👍9🔥63👏1🤔1
Вопрос уже не в том, нужен ли ИИ, а в том, как его внедрять и масштабировать
Найдем ответ на бесплатной конференции 8 октября

Все об эффективном и безопасном внедрении ИИ в бизнес расскажут эксперты топовых технологических компаний на конференции Selectel ТехноДень в Москве.

На повестке:

🔺Как использовать генеративный ИИ в компании без хаоса и получать от этого измеримый эффект: от теории до реальных кейсов.
🔺Как ускорить внедрение ИИ в бизнес-процессы и минимизировать риски для бизнеса с помощью инструментов ИБ.
🔺Какую ИТ-инфраструктуру выбрать для инференса и обучения моделей.

Кроме 20 экспертных докладов и 20 интерактивных стендов, в финале вечера вас ждет живая запись подкаста Вселенная Плюс на главной сцене конференции.

Присоединяйтесь к Selectel ТехноДень, чтобы лично задать вопросы экспертам рынка и обменяться опытом. Количество мест ограничено, регистрируйтесь уже сейчас →

Реклама. АО "Селектел". erid:2W5zFK7dGWM
4👍2
🔥 Spark-X2.5-4B - компактная 4B-модель с нативным контекстом до 1M токенов

Модель заточена под локальный запуск и при небольшом размере умеет reasoning, coding, tool use и agentic workflows, а также заявляет поддержку 200+ языков.

По данным авторов:

- 44.4 — SWE-Bench Pro
- 40.9 — BrowseComp
- 90.7 — AIME 2026
- 54.6 — MCP-Atlas

Для локального запуска уже доступны BF16, INT8, GGUF-кванты от Q2 до Q8/IQ, MLX 4/8-bit и ONNX. Есть варианты для Apple Silicon, Linux CPU и NVIDIA GPU.

У свежего llama.cpp уже появилась поддержка архитектуры spark2_5, поэтому GGUF можно запускать через совместимые актуальные runtime. Полный контекст в 1M токенов, конечно, потребует намного больше памяти, чем обычный локальный сценарий.

Модель: https://huggingface.co/XHToken/Spark-X2.5-4B

GGUF: https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF
👍76🔥3
🔥 Agentic coding уже ломает привычный CI: у Anthropic объём CI-задач вырос в 25 раз всего за 6 месяцев

Причина простая: инженеры выпускают примерно в 8 раз больше кода, около 80% которого пишет Claude, а количество тестов в кодовой базе выросло в 10 раз.

Старый test-selection сервис начал захлёбываться. Anthropic прошла три стадии:

больше CPU → sharding → ежедневные рестарты

Первая мера продержалась 70 дней, вторая — 29 дней, третья — меньше суток.

В итоге архитектуру переделали полностью: listener стал stateless, результаты CI складываются в общий журнал в in-memory store, а отдельный consumer агрегирует историю тестов. Это позволило горизонтально масштабировать обработку.

Новая система была собрана одним инженером примерно за 3 недели. По оценке Anthropic, год назад такая переделка заняла бы около квартала.

Главный совет команды на эпоху coding agents: проектируйте CI сразу под нагрузку в 10–25 раз выше текущей.

https://claude.com/blog/agentic-coding-is-straining-ci-heres-how-we-scaled-test-impact-analysis-at-anthropic
👍154💯4🥰2
🔥 Google Research предложила способ ускорить сложный AI-поиск без длинного reasoning на каждом запросе

Новый подход называется Retrieve-for-Train.

Идея: вместо того чтобы каждый раз заставлять LLM долго думать и генерировать десятки sub-query, тяжёлую работу переносят в обучение.

Схема такая:

query → RL-обученный fan-out LM → синтетические target-наборы → компактный diffusion retriever

В итоге на inference уже не нужен большой chain-of-thought.

Google обучила компактный 53.9M diffusion retriever, который генерирует весь набор направлений поиска сразу, одним неавторегрессионным проходом.

Результат:

- 12–20× быстрее autoregressive-подходов
- latency остаётся от sub-second до нескольких секунд
- выше diversity, alignment и recall
- меньше дублирующихся sub-query
- не нужны human labels для supervision

Самое интересное: RL здесь используется не как дорогой online reasoning engine, а как одноразовый механизм, который «компилирует» сложное поведение в более дешёвую модель.

Для production-поиска это очень сильная идея: сложное reasoning делается заранее, а inference остаётся быстрым.

https://research.google/blog/bypassing-inference-bottlenecks-accelerating-complex-ai-search-with-retrieve-for-train/
13👍4🔥2🤣2
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 Дженсен Хуанг выступил против идеи замедлять развитие frontier AI и вводить новые законы для отрасли.

На Dreamforce глава NVIDIA заявил:

«Если вы не уверены в безопасности продукта - просто не выпускайте его».


По его мнению, безопасность и скорость разработки не противоречат друг другу. Компании должны тестировать системы, при необходимости делать паузу, но когда уверены в продукте, «бежать настолько быстро, насколько могут».

Хуанг прямо сказал:

**«Нам не нужны новые законы. Нам не нужны новые регуляции».**

Он называет безопасность прежде всего инженерной задачей и считает, что существующие рыночные механизмы уже заставляют компании не выпускать опасные продукты.

Это прямо расходится с позицией Дарио Амодея и других руководителей AI-лабораторий, которые в последние дни призывают сильнее координировать темпы развития и стандарты
🔥14👍7😐7🥴53🎉1💔1
Команды нет — это не причина пропустить КосмоХакатон

18–20 сентября, Санкт-Петербург, Красноярск или онлайн из любой точки страны. На платформе есть подбор команды: регистрируетесь один, указываете, что умеете, и находите недостающих

К двум задачам, о которых писали раньше, добавились ещё две.

Санкт-Петербург - космонавт в открытом космосе. Солнечные вспышки, геомагнитные бури, радиация меняются по часам, решение о выходе принимают по прогнозу. Команде предстоит выделить ключевые угрозы и собрать техническое решение для их анализа. Данные, физика, инженерия.

Красноярск - зелёные финансы. Углеродные кредиты продаются под обещание, что где-то растёт лес, и проверить это обещание можно со спутника. Команде предстоит собрать платформу для токенизации и продажи кредитов, привязанных к реальному состоянию лесного массива. Данные, финансы, продукт.

Фонд площадок — 1,2 млн ₽ и 600 тыс. ₽. Лучшие забирают приз и билет в московский финал 25–27 сентября на 2,4 млн рублей.

Подробности и регистрация
3👍3🔥1