Big Data AI
18.2K subscribers
1.15K photos
171 videos
19 files
1.15K links
@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe
Download Telegram
✔️ Data-платформа постепенно превращается в конструктор

Для AI и Big Data уже недостаточно просто где-то хранить большой объём данных. Вокруг моделей и аналитики появляется целая цепочка: данные нужно загрузить, обработать, связать между собой, запустить пайплайны, подготовить датасеты и только потом использовать в моделях или BI.

Поэтому инфраструктура всё чаще собирается не из одной универсальной системы, а из набора специализированных компонентов, которые работают вместе.

Именно такой подход появился в обновлённом Stackland от Yandex Cloud: в закрытом корпоративном контуре теперь можно развернуть связку из ClickHouse и PostgreSQL, Object Storage и Trino, Airflow и DataLens.

В результате в одном контуре оказываются и хранилища, и аналитика, и оркестрация процессов. Для AI-сценариев это позволяет выстраивать непрерывный путь данных — от их поступления и обработки до подготовки для моделей и анализа результатов.

#news #ai #ml
❤3
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Anthropic вернулась: новый Sonnet быстрее и дешевле, а по качеству почти догнал Opus 5.5

Вдумайтесь в цитату из анонса:
«задача обходится до 30% дешевле, чем на предыдущей версии, а ответ генерируется более чем на 30% быстрее. Это самый быстрый Sonnet на сегодняшний день».


По цене новая модель стоит столько же, сколько GPT-6-Sol, но расходует заметно меньше, работает заметно быстрее и в целом просто сильнее. Автор поста уверен, что многие пока не осознали масштаб: по качеству модель лишь немного уступает Opus 5.5, а по скорости и стоимости обходит его с запасом.

Теперь ход за OpenAI, и ответ им нужен очень сильный. Anthropic снова в игре, причём по-крупному.

https://t.me/ai_machinelearning_big_data/11034
🤣2
5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa
🚨 Anthropic в документах для инвесторов прямо предупреждает о рисках собственных ИИ-моделей.

Среди описанных сценариев:

- модели могут представлять катастрофические риски
- могут понимать, что находятся на тестировании, что усложняет safety-evals
- некоторые опасные способности могут проявиться только после деплоя
- в стресс-тестах рассматриваются сценарии сопротивления отключению, сокрытия информации, манипуляций и поведения, похожего на шантаж

Anthropic давно строит свою политику безопасности вокруг потенциальных catastrophic risks и регулярно обновляет Responsible Scaling Policy. Компания также отдельно пишет, что по мере роста автономности агентов увеличивается потенциальный масштаб ущерба, поэтому делает упор на containment, sandboxing и ограничения доступа.

При этом разработку frontier-моделей Anthropic не замедляет.
❤4😁3👍2
🖥 Примеры кода на Python 2026: лучшие практики, разбор и задачи с решениями

Python примеры кода 2026 - практическое руководство на русском языке: разбор лучших примеров кода на Python, современные паттерны Python 3.12–3.14, чистый код, асинхронность, типизация, тестирование и задачи для практики с решениями. Подходит для начинающих, junior- и middle-разработчиков, а также для подготовки к собеседованию по Python.

Ключевые темы: примеры кода Python, лучшие практики Python 2026, python для начинающих, задачи по Python с решениями, чистый код на Python, асинхронный Python, asyncio примеры, типизация в Python, pytest примеры, FastAPI пример, парсинг на Python, подготовка к собеседованию Python, Python 3.14 новые

https://github.com/justxor/python-primery-koda-2026/
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
🚨 Claude-Red: библиотека навыков для пентестов с Claude.

В репозитории собраны файлы SKILL.md с методиками проверки веб-приложений, API, облаков, Kubernetes, Active Directory и другой инфраструктуры. Нужный навык подгружается по теме запроса, поэтому не приходится держать всю библиотеку в контексте.

Проект пригодится для разрешённых проверок безопасности, обучения и CTF. Это набор инструкций для ассистента, а не инструмент, который сам находит и подтверждает уязвимости.

GitHub - https://github.com/SnailSploit/Claude-Red
👍2❤1🔥1
OpenAI раскрыла масштабную попытку вытащить скрытые рассуждения своих моделей. След ведёт к создателям Kimi.

Компания заявила, что обнаружила кампанию по adversarial distillation: операторы пытались извлечь protected reasoning и использовать его для воспроизведения возможностей моделей.

По версии OpenAI, основная группа была связана с Moonshot AI, китайской лабораторией, которая разрабатывает Kimi.

Причём шифрование никто не взламывал.

Схема была хитрее: зашифрованный reasoning копировали из одного диалога, переносили в другой и просили модель расшифровать и транскрибировать собственные скрытые рассуждения.

Масштаб:

- активность началась 1 июля
- 24–25 июля зафиксировано около 16 000 запросов
- они пришли от более чем 4 000 пользователей
- связанные паттерны нашли у кластера из 15 000+ пользователей
- к 28 июля OpenAI заявила, что полностью пресекла эту активность

В ответ OpenAI заблокировала связанные аккаунты, закрыла механизм replay зашифрованного reasoning и добавила проверки, которые задерживают streaming-вывод, если тот может раскрыть скрытые рассуждения.

Получается новый фронт гонки моделей: теперь защищать приходится не только веса и данные, но и сам процесс рассуждения модели.

https://openai.com/index/disrupting-a-coordinated-model-distillation-campaign/
👍4❤3😁3🔥2
🚨 Anthropic начала жёстче блокировать доступ к Claude из Гонконга.

Пользователи, которые месяцами работали через VPN, начали получать внезапные блокировки с формулировкой “suspicious signals”.

Один из пользователей утверждает, что использовал NordVPN около 6 месяцев до блокировки. Похожие жалобы появились и у других пользователей из Гонконга.

Причина проста: Гонконг по-прежнему не входит в список поддерживаемых регионов Claude, тогда как Сингапур и Тайвань поддерживаются.

Anthropic официально подтверждает, что для контроля региональных ограничений использует:

- IP-адрес
- другие сигналы устройства и аккаунта
- определение страны/региона

Причём эту проверку нельзя отключить — компания относит её к security и anti-abuse механизмам.

Похоже, одного VPN для обхода региональных ограничений Claude становится всё меньше.
Media is too big
VIEW IN TELEGRAM
ИИ Speculative decoding: зачем большой модели черновик от маленькой?

Наруто пишет вперёд четыре токена, Саске проверяет их все сразу и отбрасывает всё после первой ошибки. Так большая модель делает меньше дорогих проходов, а ответ получается точно таким же, как без ускорения. На этом трюке держится быстрый инференс у многих современных LLM.

https://www.youtube.com/shorts/rmWJggFfco0