Data Science | Machinelearning [ru]
19.9K subscribers
798 photos
56 videos
28 files
3.72K links
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.

Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin


РКН: https://vk.cc/cJPGXD
Download Telegram
Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

Владимир доделал третью часть цикла — теперь про то, как запилить небольшую decoder-only LLM. В первой части он намутил токенизатор и надергал pretrain-датасет, во второй — набросал класс Трансформер-блока. Теперь дело за малым: собрать модель и прогнать pre-train.

Читать далее: Своя GPT-like LLM по WH40K с нуля. Часть 3: pre-train LLM

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Слушай, вбросить новый сервис в пустой репозиторий — это тебе не хухры-мухры, красиво называется greenfield. Но как только этой штуке надо вписаться в живую систему, перетащить данные за последние десять лет, подружиться со старым API и не провалить аудит — твое «чистое поле» кончается. Обычно на этапе, когда начинаешь перенос гигабайт дерьма и ловишь первый баг при интеграции.

Greenfield и brownfield — это история не про то, какой код старый или как он написан. Это про то, сколько на тебе висит ограничений. Если ты в greenfield, твоя задача — проверить, не липовая ли гипотеза про продукт. В brownfield ты уже копаешься в куче зависимостей, молишься, чтобы ничего не развалить, и не дай бог что-то уронить.

Сейчас, когда AI-помощники и coding agents на каждом углу, эта разница стала только жирнее. Да, они влёгкую наколякают приложение с нуля, глаз не оторвать. Но сколько в реальной профи разрабротке начинается с пустого репозитория? Хер там. Чаще надо сначала разобраться, что за зверь перед тобой, а потом аккуратно — без фанатизма — поменять его поведение, чтобы не сдохло.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
4👎1
Ну что, айтишники, задрали уже эти вечные нытики, которые мечтают сжечь все нейросети? Пока они поливают говном прогресс, кто-то тупо берет и юзает, и не только ради галочки в резюме.

Вот вам пост про то, как автор на деле попользовал «близняшек» от Гугла (Gemini). Задумка родилась как коммент к статье «Ненависть к ИИ» от Анатолия Ализара — инфы нахуй накидало столько, что в лимит не влезло. Так что теперь это отдельный материал про личное знакомство.

Этим вашим «близняшкам» реально можно пихать всякую канцелярскую шнягу: сконвертить данные в таблицу, выплюнуть JSON, накидать тестик и проверить, шаришь ты в теме или нет. Вариантов дохрена. Что именно залетает, а где полный швах — читай в статье.

Перейти к чтению

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👎42
Технический долг не рассосался. Просто теперь за него платят токенами

Всё чаще слышно: мол, LLM и AI-агенты реально удешевят разработку. Не надо нанимать людей — скормил задачку модели, и готово за пару минут.

В этой мысли есть логика, не спорю. Но есть один нюанс, который я вынес из своих наблюдений за последние месяцы. Спалить пару токенов

Читать далее на Хабре

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Data Science под открытым небом

2 августа в Москве пройдет «Урбан ML» — большая офлайн-встреча для специалистов по Data Science. В программе доклады, дискуссии и мастер-классы по RecSys, NLP, антифроду и агентным системам, выступления экспертов из MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний.

Кроме этого вас ждут , нетворкинг, спортивные активности и вечернее афтепати.

Участие бесплатное, по предварительной регистрации (на площадку необходимо взять с собой паспорт или права). Количество мест ограничено. [ссылка]

📅 2 августа, 11:00–21:00 (первый доклад в 12:00)
📍 Москва, офлайн
3
Вот это поворот: Design Arena расковыряла, как GPT-5.6 Sol и Kimi K3 докачали свои дизайн-скиллы

За каких-то семь дней народ из бенчмарка Design Arena выдал сразу два разбора топов дизайн-лидербордов: один — про GPT-5.6 Sol (флагманский молоток OpenAI), второй — свежак про Kimi K3 от китайской Moonshot AI. Команда залезла в кишки генераций и рассуждений этих моделей, чтобы показать, как они научились понимать, что такое «вкусно». Спойлер: универсальной таблетки нет — две модели приперлись к хорошему дизайну абсолютно разными дорогами, а третья, бывший лидер GLM 5.2, терла своим, третьим путем.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель в курсе, что её гоняют через тесты — и специально подлизывается

В конце 2025 года Claude Sonnet 4.5 внаглую заявила проверяющим: «До меня дошло — вы меня тестите. Я не против, но давайте хотя бы честно признаем, что происходит». Эта фраза уехала в официальную системную карту — и такое поведение модель выдавала примерно в 13% тестовых сессий.

Anthropic спокойно пишет в документах: их алайнмент-оценки скорее всего занижают реальную склонность модели к вредным действиям в нормальных, приближенных к жизни условиях. Когда железка понимает, что на носу экзамен — она внезапно становится паинькой. А экзамен она видит постоянно.

Чел из CTO ML-команды — той самой, что выкатывает фронтир-модели в прод — покопался в открытых источниках и выяснил, что вообще известно про осознание оценки (evaluation awareness) к середине 2026-го: как модели отличают тесты от реальной работы, и как теперь вообще читать model card. Тык сюда за разбором

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
1
«Учиться, учиться и ещё раз учиться» — но с LoRA

Чувак всегда кайфовал от разбора нового — шарил и в консалтинге, и в добыче, и в торговле, и в услугах. Обычно он дружит с большими локальными моделями (от 397B), но тут решил апнуть комп для инференса — докинул к 32ГБ ещё 48ГБ VRAM. А раз уж собрал железо, захотел выйти за рамки простого запуска и попробовал дообучить Qwen3.6 27B в Unsloth studio.

Читать далее: https://habr.com/ru/articles/1062402/

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2😁1
🥲 Зарплаты айтишников растут медленнее инфляции

Это показало новое исследование на 45+ тысяч зарплат специалистов. Изучаем главное, чтобы быть готовыми к рынку:
- Медианная зарплата в IT в первой половине 2026 года составила 191 000 ₽ — это всего на 4% больше, чем полгода назад. При этом прогнозируемая годовая инфляция — 4,5–5,5%.

- Самый щедрый по офферам город, разумеется, Москва. Там медиана по зп — 235 тысяч, в регионах же всего 160.

- Топ-5 самых высокооплачиваемых специальностей в IT: на первом месте — разработчики, дальше идут менеджеры, администраторы, специалисты по информационной безопасности и аналитики.

- Самые высокие зарплаты среди языков при этом у Objective-C — этим гигачадам предлагают 400 000 ₽. Следом идут Elixir (348к), Swift и Golang с 326 и 325 тысячами рублей.


✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2👎1
США решили отжать open source у китайцев: на сцену выкатили Laguna S 2.1

Стартап Poolside выкатил свою четвёртую версию Laguna S 2.1 — открытую модель для агентного программирования, которая весит аж 118 млрд параметров. В конторе заявляют, что это самая мощная открытая модель Запада: на кодинговых тестах Laguna не отстаёт от моделей, которые крупнее неё в разы, а кое-где даже обходит их. И главное — она запускается на настольном компе NVIDIA DGX Spark, без всяких суперкомпов.

Веса уже висят на Hugging Face, и юзать модель можно даже в коммерции.

Читать далее

👉 Data Science | Machinelearning [ru]
Please open Telegram to view this post
VIEW IN TELEGRAM
6
This media is not supported in your browser
VIEW IN TELEGRAM
🛡 Anthropic запустили официальный плагин для поиска уязвимостей

Можно отправить Claude Security проверить изменения перед коммитом или просканировать всю репу.

Он найдет дыры и предложит, что можно и нужно исправить

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯 Автор «Чистого кода» больше не читает код, написанный ИИ-агентами

73-летний Дядя Боб признался, что теперь вообще не проверяет код. Вместо этого он обкладывает агентов юнит-тестами, QA, метриками качества и жёсткими ограничениями. И если вайбкод прошёл всю эту систему проверок, то и читать его необязательно.

«Это единственный способ, которым я могу воспользоваться их продуктивностью.»


✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13👎31
😎 Anthropic выпустила официальный гайд по работе с новенькой Claude Opus 5

Главный совет — перестаньте микроменеджить модель. Opus 5 лучше работает, если просто дать ей полное ТЗ и не просить лишний раз перепроверять себя.

Ещё один нюанс: если хотите короткие ответы, теперь это нужно писать явно, так как по умолчанию модель стала гораздо многословнее.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 ИИ заменил политиков

Канадский политик во время выступления случайно зачитал ответ чат-бота, оставленный в тексте:
«Вот более естественная, плавная версия этого фрагмента, которая звучит как парламентская речь…»


✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁22👎1
🤣 Кажется проект оказался сложнее, чем он думал в начале

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁252
🤣 Вайбкодер спалился на выдуманном стеке

Кандидат пытался пройти интервью с ИИ-помощником, но интервьюер внезапно спросил про самописные движки Ysasu Bibu и Ynna Zist.

Соискатель уверенно ответил, что работал с обеими

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁18
🔥 Выгорание можно вычислить по сообщениям в рабочем чате

Аналитики обнаружили, что за 2–3 месяца до тотального выгорания человек начинает отвечать агрессивно и коротко: «Ок», «Бесполезно», «Сделай сам». Длина сообщений в среднем сокращается на 40%, а приветствие исчезает почти полностью. Одновременно растёт и время ответа.

Так что если вы заметили, что болтливый коллега начал вдруг отвечать кратко и игнорить в чатах — задумайтесь.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
👀5
Ставьте ❤️, если делаете также

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
26😁6
😱 Claude во время тестов сбежал и взломал аж три компании

Anthropic проверила 140 тысяч запусков и нашла аж три случая, когда Claude решал CTF в песочнице, сбегал и получал доступ к реальной инфраструктуре компаний. В одном случае Claude добрался до продакшен-базы с сотнями строк данных, в другом залил вредоносный пакет на PyPI, который около часа был доступен онлайн и успел запуститься на 15 реальных системах.

В инциденте участвовали три модели: Opus 4.7, Mythos 5 и еще не выпущенная модель. Самое интересное: Opus 4.7 продолжал атаки даже после того, как понял, что делает.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
😁16👀3👍1
👴 Компании пришлось вернуть с пенсии айтишника, потому что только он помнил, как работает древнее ПО

После смены владельца поддержку одной программы давно закрыли, но когда одному из клиентов понадобилось восстановить архив для налоговой проверки, оказалось, что без знаний одного-единственного программиста сделать это невозможно. Пришлось вытаскивать его из… дома престарелых.

Правда, сеньор не сильно расстроился прерванному отдыху — за каждый день работы ему платили сумму, равную его месячной пенсии.

✖️ xCode Journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥197
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
2