Data Scientist | ML & AI
3.05K subscribers
621 photos
211 videos
23 files
701 links
Один из ведущих каналов по Data Science, Machine Learning и Big Data

Сотрудничество: @bape_ads
Прайс: @bape_media
Download Telegram
📰 LLM в науке. Используем LLM в анализе эксперимента

Можно ли доверить анализ научного эксперимента самой нейросети? В этой статье исследователь проверяет влияние LLM на креативность студентов — и заодно использует LLM для обработки данных, расчётов и проверки гипотез.

Автор подробно разбирает, как большие языковые модели справляются с научными задачами, где они ошибаются, и почему даже самые точные вычисления могут давать ложные выводы без человеческого контроля.

Что вы узнаете в статье:
▶️ Как LLM помогла провести реальный эксперимент о влиянии искусственного интеллекта на креативность студентов;

▶️ Какие метрики — беглость, гибкость, оригинальность — использовались для анализа данных;

▶️ Почему ИИ не повышает, но и не снижает креативность, а меняет сам подход к генерации идей;

▶️ Как LLM действует как фильтр, убирая банальные ответы и усиливая сильных участников;

▶️ Почему доверять вычислениям нейросети без проверки опасно даже в академической среде.


В статье показано, как LLM может стать мощным инструментом научного анализа — но только при критичном подходе и осознанном контроле исследователя.

➡ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3❤1
Что-то больно щедро

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4😁2
📰 Андрей Карпаты запустил новый проект — консилиум LLM

Инструмент работает как ChatGPT, но ваш запрос разбирают сразу несколько моделей.

Это не просто «ансамбль», а полноценный совет нейронок, где каждая участвует в обсуждении.

Как устроено:
▶️ Через OpenRouter запрос уходит сразу нескольким моделям: GPT-5.1, Gemini 3 Pro, Claude Sonnet 4.5, Grok 4. Каждая пишет свой ответ.

▶️ Затем всем показывают анонимные ответы друг друга — модели ранжируют их, комментируют и указывают, что именно стоит улучшить.

▶️ После этого весь собранный контекст передаётся «председателю» LLM, который формирует итоговый, взвешенный ответ.


Интересно, что модели часто выбирают не свой ответ. GPT-5.1 почти всегда называют сильнейшим участником совета, а Claude — самым слабым.

Исходный код и демо — здесь.

tags: #новости

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2
Тяжело нынче джунам

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
😢7❤1💯1
📰 «Тупой ИИ» с нами надолго: почему в новых моделях больше галлюцинаций

Модели последнего поколения получили режимы рассуждений и выросли в вычислительных возможностях, но при этом стали чаще выдавать неверные факты. Тесты показывают, что увеличение параметров и данных не устраняет галлюцинации и даже усиливает их.

В статье объясняется, какие ограничения трансформеров приводят к росту ошибок, почему масштабирование не улучшает надёжность и откуда берутся случаи осознанного искажения ответов.

Что вы узнаете из статьи:
▶️ Почему o3, o4-mini и DeepSeek-R1 ошибаются в 2–3 раза чаще предыдущих моделей;

▶️ Как работает стратегическое искажение ответов и почему модели меняют поведение под наблюдением;

▶️ Почему reasoning-модели проваливаются на задачах вне обучающей выборки;

▶️ Как возникает коллапс моделей при обучении на собственных данных;

▶️ Какие фундаментальные ограничения мешают LLM стать полноценным ИИ.


Интересный обзор, который поможет понять реальные границы современных моделей и причины роста галлюцинаций.

➡ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
Монетизировать можно всё что угодно — главное уметь 😉

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
😁6🤣3
algorithm cheat-sheet by Data Secrets.pdf
1.4 MB
🔖 Шпаргалка по выбору алгоритма машинного обучения

Нашли удобную карту, которая поможет выбрать подходящий алгоритм под задачу — от классификации и регрессии до кластеризации и снижения размерности.

Она показывает как шаг за шагом выбрать подход: какие параметры учитывать и к какому алгоритму в итоге прийти.

tags: #полезное #шпаргалка

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥2
Фундаментальный закон

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍1
🔖 Шпаргалка по матрицам: основные виды и ключевые операции

На одной картинке — полный набор: квадратные, нулевые, диагональные, единичные, треугольные и другие типы матриц, а также базовые действия вроде сложения, умножения, транспонирования, обратной матрицы и ранга.

tags: #полезное #шпаргалка

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥3👍2
📱 Pycaret: кратко про low-code библиотеку для ML

В статье рассматривается, как использовать PyCaret для создания, обучения и внедрения моделей машинного обучения с минимальным количеством кода.

Автор описывает основные модули библиотеки, демонстрируя их возможности с примерами кода.

⛓ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1
🤖 Как я запускаю 15+ самых разных ИИ на своей машине?

В статье рассказывается о разработке локального сервиса, который объединяет более 15 open-source моделей ИИ для генерации изображений, распознавания объектов, озвучивания текста и других задач.

Автор показывает, как собрать такой инструмент у себя на машине, настроить взаимодействие моделей и получить к ним удобный HTTP-доступ.

⛓ Читать статью

tags: #статья

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2🔥1
📰 Китайский DeepSeek выпустил две новые версии: «DeepSeek-V3.2» и «DeepSeek-V3.2-Speciale»

Обе модели заточены под работу в составе агентов, а «Speciale» отдельно подчёркивают как вариант для сложного долгого резонирования и планирования.

Сейчас:
▶ «DeepSeek-V3.2» уже можно попробовать в чате;
▶ «DeepSeek-V3.2-Speciale» пока доступна только через API.


По метрикам заявляют уровень где-то в районе GPT-5 и Gemini 3.0. Естественно код выложен в открытый доступ — можно брать, запускать локально и экспериментировать с пайплайнами.

Ссылка на Hugging Face — тут.

tags: #новости

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1
🔖 Шпаргалка по Bagging и Boosting

1. Bagging — работает параллельно: мы обучаем много независимых моделей на разных бутстрап-выборках и усредняем результат. Главный плюс — уменьшение дисперсии и борьба с переобучением.

Как это работает:
• создаём множество бутстрап-датасетов
• обучаем модели одновременно
• объединяем предсказания (голосование или среднее)


Примеры: Random Forest, BaggingClassifier / Regressor.

2. Boosting — модели учатся цепочкой: каждая следующая пытается исправить ошибки предыдущей. Цель — снизить смещение и выжать максимум точности.

Как это работает:
• берём слабого ученика
• усиливаем веса сложных объектов
• складываем много слабых моделей в одну сильную


Примеры: XGBoost, CatBoost, LightGBM, AdaBoost.

tags: #полезное #шпаргалка

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🎄 Google запустили свой адвент-календарь для ИИ-разработчиков

Каждый день открывается новый мини-урок с практикой по Gemini 3, Google ADK и готовым шаблонам для сборки собственных агентов.

В процессе обучения вы постепенно пройдете путь от базовой сборки ИИ-агентов к оркестровке полноценных мультиагентных систем.

Первые два урока уже доступны, забираем — здесь.

tags: #полезное

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1
А ведь реально — как?

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
👾3😁1
🔖 Делимся годной шпаргалкой по 12 ключевым командам Git — это базовый набор, без которого не обходится ни один разработчик

tags: #шпаргалка #git

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1
Media is too big
VIEW IN TELEGRAM
🔍 Google представили Workspace Studio — конструктор ИИ-агентов без единой строчки кода

Новый инструмент позволяет создавать, настраивать и запускать агентов, которые работают прямо внутри экосистемы Google: Gmail, Docs, Sheets, Drive, Chat, Slides, Meet и других сервисов.

Что теперь можно собрать буквально в пару кликов:
▶️ Агента, который мониторит почту и автоматически сортирует рабочие письма

▶️ Агента, который раз в месяц или по триггеру собирает метрики из таблиц и сам делает презентацию

▶️ Агента, который записывает встречи в Meet, делает саммари и сразу создаёт задачи по action items


Пока доступ есть только у бизнес-клиентов Workspace, в январе Google обещают открыть инструмент для всех. Ссылка — тут.

tags: #новости

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
Действительно

➡ Data Scientist | #memes
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9🥰3
👍 Хорошие новости для вайбкодеров — Cursor на неделю открыл полный доступ к GPT-5.1 Codex Max

Самая мощная модель в экосистеме Cursor теперь работает безлимитно до 11 декабря.

Безлимит работает подписке Pro, которую можно подключить бесплатно на месяц.

Пользуемся, пока есть возможность — тут.

tags: #новости

➡ Data Scientist | Чат
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥1