Анализ данных (Data analysis)
50.7K subscribers
3.66K photos
460 videos
1 file
2.98K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
📊Платформа данных в корпоративном контуре компании

Когда компания строит собственную платформу данных, мало просто выбрать СУБД или объектное хранилище. Нужен полноценный стек: от хранения и обработки до оркестрации пайплайнов и визуализации результатов.

Именно такой сценарий теперь можно реализовать с помощью Stackland — платформы, которая разворачивается локально в контуре компании.

В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу:
🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL — хранение и обработка данных.
🔹 Yandex Managed Service for Trino + Yandex Object Storage — основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним.
🔹 Managed Service for Apache Airflow® — управление оркестратором потоков операций по обработке данных.
🔹 Yandex DataLens — BI-система для визуализации данных.

При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании.

Для data-команд это интересный сценарий: вместо набора разрозненных инструментов можно собрать единый технологический контур, закрывающий ключевые этапы работы с данными — хранение → обработка → оркестрация → аналитика → визуализация.
👍7❤3⚡1
🧠 Джон Маккарти - человек, который дал имя искусственному интеллекту

John McCarthy (1927–2011) - один из основателей современной AI-индустрии и человек, который ввёл сам термин Artificial Intelligence.

В 1955 году вместе с Марвином Мински, Натаниэлем Рочестером и Клодом Шенноном он подготовил предложение для летнего проекта в Dartmouth College. Именно там появилась идея, что обучение и другие проявления интеллекта можно достаточно точно описать, чтобы их могла воспроизводить машина.

В 1956 году Маккарти организовал Dartmouth Summer Research Project — событие, которое сегодня считают точкой рождения AI как отдельной научной области.

Ещё несколько важных фактов:

- в 1958 году создал Lisp, который на десятилетия стал главным языком AI-исследований;
- участвовал в создании MIT AI Project;
- основал Stanford Artificial Intelligence Laboratory (SAIL);
- внёс вклад в time-sharing, garbage collection, situation calculus и представление common-sense knowledge.

За свои работы Маккарти получил Turing Award в 1971 году и National Medal of Science в 1990-м.

Во многом именно он помог превратить идею «мыслящей машины» в самостоятельную область компьютерных наук.
🔥22❤9❤‍🔥3🎉1
Forwarded from Machinelearning
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.

Что нового:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями

Особенно заметный скачок - в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.

Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID: claude-sonnet-5-5

https://www.anthropic.com/claude-sonnet-5-5
👍18❤‍🔥5❤4
В рейтинге AA Intelligence Index четыре из пяти самых умных моделей теперь от Claude.

Мало того, Sonnet 5.5 набрал больше баллов, чем Fable 5.1. Похоже, версия Fable, которую Anthropic дистиллирует в Opus и Sonnet, какая-то запредельно сильная.
👍30❤8🔥4🤣4
Anthropic готовится к IPO с необычным предупреждением для инвесторов: её модели могут представлять «катастрофический или экзистенциальный риск для человечества».

Об этом говорится в проспекте, с которым ознакомилось Reuters. Компания описывает возможные попытки моделей сопротивляться отключению, скрывать информацию и вести себя подобно шантажисту. Это предупреждение о рисках, а не утверждение, что такие сценарии уже произошли при использовании Claude.

Цифры за 2025 год тоже привлекают внимание:

- Выручка выросла в 12 раз, почти до $4,6 млрд.
- Операционный убыток составил $8,06 млрд. Чистый убыток достиг $42 млрд, но около $34 млрд из этой суммы пришлось на бухгалтерскую переоценку.
- На вычисления и инфраструктуру ушло $7,33 млрд. Будущие обязательства в этой сфере оцениваются в $518 млрд.
- Почти четверть выручки обеспечили всего два клиента.

В проспекте около 80 из 261 страницы посвящены рискам. Anthropic также предупреждает, что модель может распознать проверку безопасности, а некоторые её возможности могут обнаружиться лишь после запуска.

При этом основатели хотят сохранить контроль после IPO: одна акция класса F даст их структуре 50,1% голосов по ключевым вопросам. Компания прямо допускает, что решения руководства могут расходиться с финансовыми интересами акционеров.

Возможная оценка Anthropic выше $2 трлн пока остаётся ожиданием, а не объявленной ценой размещения. Инвесторам предстоит оценить быстрый рост компании вместе с расходами, концентрацией клиентов и теми рисками ИИ, о которых она предупреждает сама.

https://www.reuters.com/legal/transactional/anthropic-leaders-control-ai-lab-via-founder-llc-promote-public-good-over-market-2026-09-29/
🤣24👍11🔥5❤3🤔1🙏1
ИИ уже может принять в контекст миллионы токенов. А мы всё чаще просим его написать даже ответ на письмо из двух предложений.

Автор нового препринта называет это петлёй делегирования: ИИ справляется с задачами всё лучше → мы отдаём ему всё более простую работу → реже упражняемся сами → делегировать становится ещё легче.

В работе приводят яркое сравнение: контекстное окно моделей выросло с 512 токенов в 2017 году до 2 млн в 2026-м. Но человеческие «1 800 токенов внимания» из той же работы - расчётная оценка, а не прямое измерение памяти. Сравниваются разные вещи, поэтому точный разрыв «ИИ против человека» из этих цифр выводить нельзя.

Полезнее самого сравнения: поручить ИИ разобрать огромный отчёт разумно. А если постоянно отдавать ему задачи, которые сам сделал бы за полминуты, можно лишиться повседневной практики. Вредит ли это навыкам в долгую, пока не доказано: автор прямо называет петлю гипотезой, которую ещё предстоит проверить.

Какую последнюю задачу вы отдали ИИ, хотя могли сделать сами за 30 секунд?

Работа: https://arxiv.org/abs/2603.26707
❤20👍4🔥2🤔2🌚1
⚡️ OpenAI на DevDay показала сразу несколько крупных новинок.

Главное:

- GPT-6.1 Sol - почти уровень GPT-6 Astra, но примерно в 5 раз дешевле. Уже доступна платным пользователям;
- ChatGPT Space - общее рабочее пространство с документами, комментариями и возможностью подключать ChatGPT, Codex и Dots прямо к задачам;
- Pro Max за $500/мес - в 25 раз больше лимитов, чем в Plus;
- Ultrafast для GPT-6 Astra - до 8 раз быстрее в Codex, пока только на максимальной подписке.
🔥13👍5🥰4🥴2
⚡️ GPT-6 Astra помогла найти контрпримеры к гипотезе о плазме, которой почти 60 лет.

В термоядерном реакторе раскалённую плазму удерживают магнитным полем. Для этого важно понимать, может ли поле сложной трёхмерной формы образовывать вложенные поверхности, вдоль которых движется плазма. В 1967 году физик Гарольд Грэд предположил, что гладкие равновесные решения такого типа без дополнительной симметрии вряд ли существуют.

Физик Мэтт Ландреман представил два семейства точных аналитических решений: магнитное поле и давление в них описываются явными формулами, а вложенные поверхности существуют даже без осевой симметрии. Автор пишет, что решения были найдены с помощью GPT-6 Astra Pro, после чего он вручную проверил все уравнения.

Другая группа исследователей уже недавно опровергла гипотезу Грэда доказательством существования таких решений. Новая работа добавляет конкретные формулы, которые можно использовать, в частности, для проверки программ, моделирующих магнитное удержание плазмы.

Статья: https://arxiv.org/pdf/2609.26742
Please open Telegram to view this post
VIEW IN TELEGRAM
❤20👍9🔥4
🔥 OpenAI обсуждает новый раунд минимум на $30 млрд при оценке около $1,4 трлн до инвестиций.

По данным Bloomberg, переговоры пока на ранней стадии, а параметры сделки ещё могут измениться. Такой раунд позволит OpenAI привлечь крупный капитал без выхода на биржу.

Сэм Альтман ранее исключил IPO в 2026 году, назвав нынешний момент «неподходящим» для размещения из-за объёма работы по безопасности и контролю ИИ.

При этом бизнес продолжает быстро расти. Axios сообщает, что годовой темп выручки OpenAI приближается к $70 млрд, примерно на 70% выше, чем в начале квартала. Выручка от корпоративных клиентов с июля выросла более чем вдвое.

Если раунд состоится на обсуждаемых условиях, OpenAI закрепится среди самых дорогих частных технологических компаний в мире ещё до возможного IPO.
❤10👍4🔥1😁1😱1
This media is not supported in your browser
VIEW IN TELEGRAM
Согласны ?)
😁55❤7👍6🤣2🤨2🔥1😱1🍌1😐1
Что, если заменить аналитиков нейросетью?

Да ничего хорошего: результаты анализа получаются слишком общими, и половину работы потом всё равно приходится переделывать руками.

Хард-скилы дешевеют — SQL-запрос или кусок кода теперь может сгенерировать почти кто угодно. А вот доменная экспертиза и умение работать с агентом становятся ценнее: правильно задать вопрос, собрать контекст, проверить, что результат не искажён.

Три аналитика Авито на конкретных примерах рассказывают, как работает тандем аналитик + AI. Делятся кейсами:

➡️ как перенесли 200 витрин за полгода;
➡️ автоматизировали проверку работы сотрудников;
➡️ научили LLM анализировать метрики.

Подробнее в ролике:
📺 YouTube
🔵 ВК

Больше честных историй о работе аналитиков Авито — в «Коммуналке аналитиков».
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥1
💸 Anthropic опубликовала практический гайд по снижению расходов на Claude API

Главная мысль: оптимизировать нужно не цену токена, а стоимость успешно выполненной задачи. Более дорогая модель иногда оказывается дешевле, если решает задачу за меньшее число шагов.

Anthropic предлагает такой порядок:

- сначала включить prompt caching - для агентных циклов это один из самых сильных способов экономии;
- убрать лишние входные и выходные токены;
- сокращать ненужные итерации агента;
- для фоновых задач использовать Batch API, где стоимость токенов снижается на 50%;
- только после этого экспериментировать с effort и более дешевыми моделями.

Интересный вывод: переход на более дешевую модель - далеко не первый шаг оптимизации. Сначала стоит выжать максимум из архитектуры запросов и кеширования.

Гайд: https://github.com/anthropics/skills/blob/main/skills/claude-api/shared/cost-optimization.md
🔥9❤4👍3🤣2🥰1
Какие инструменты добавить в свой стек работы с данными?

Работа с данными давно не ограничивается одним набором инструментов. В зависимости от задач нужны машинное обучение и нейронные сети, технологии Big Data или инструменты аналитики и визуализации.

В ДПО ФПМИ МФТИ можно выбрать курс в зависимости от задач, с которыми вы работаете:

➡️ Методы анализа данных и машинного обучения
Классическое машинное обучение, глубокое обучение, PyTorch и практические задачи — от классификации и прогнозирования до работы с изображениями и текстом.

➡️ Инструменты работы с большими данными
Hadoop, Spark, MapReduce и другие технологии для хранения и обработки больших объёмов данных.

➡️ Инструменты анализа и визуализации данных
Excel, Power BI и Yandex DataLens — анализ и визуализация данных, построение отчётов и интерактивных дашбордов.

Все курсы проходят онлайн. После успешного завершения обучения слушатели получают удостоверение о повышении квалификации Московского физико-технического института (МФТИ).

Подробнее об этих и других программах 〰️ на сайте.

Реклама
2VtzqwpYTtg
Туз Елизавета Алексеевна
ИНН 772035623941
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2
🛡 Большая подборка по безопасности AI-агентов и их skills

На GitHub появился репозиторий Awesome Agent Skills Security - коллекция исследований, стандартов и инструментов по защите агентов, которые работают с внешними tools, plugins и skills.

Внутри собраны материалы по:
- prompt injection через инструменты;
- poisoning и supply-chain атакам;
- утечкам данных и чрезмерным правам;
- sandboxing и runtime monitoring;
- red teaming и benchmarks;
- OWASP, MITRE ATLAS, NIST и IETF-стандартам для агентных систем.

Особенно полезно тем, кто уже строит MCP/agent-инфраструктуру: список хорошо показывает, насколько сильно поверхность атаки выросла после того, как модели получили доступ к файлам, API и реальным действиям.

https://github.com/LLMSecurity/awesome-agent-skills-security
❤6👍3🥰1
🧪 Новый бенчмарк проверяет не то, что ИИ знает, а способен ли он сам открыть неизвестные правила

Исследователи Tencent Hunyuan, Fudan и Tsinghua представили ExplorationBench. В нем модели попадают в «чужие миры», где привычная логика намеренно сломана: операторы работают иначе, а правила вывода изменены. Поэтому выученные знания почти бесполезны.

Модель получает неполное руководство и несколько раундов, чтобы самой придумывать эксперименты, проверять гипотезы и восстанавливать скрытые правила.

Результаты интересные:

- без обратной связи модели стартуют максимум с 15,7%;
- после четырех раундов лучший результат в AlienCode достигает 89%;
- у 9 из 10 систем собственные эксперименты оказались эффективнее повторения уже готовых;
- даже когда модель правильно знает все нужные правила, задача решается лишь в 73,4% случаев;
- один и тот же ИИ при одинаковом бюджете мог показать от 5,7% до 79%.

Главный вывод: уметь рассуждать по известным правилам и уметь самостоятельно открывать новые правила - это совсем разные способности.

Paper: https://arxiv.org/abs/2609.30199
Leaderboard: https://explorationbench.com/
👍4❤2🔥2