Forwarded from Data, Stories and Languages
Forwarded from Стать специалистом по машинному обучению
Раньше, когда мне нужно было поработать с научными статьями, по которым не было нормальных "человеческих" разборов для не очень продвинутых пользователей - я загонял статью в ChatGPT и просил объяснить, что происходит, в чём новизна, как это применить на практике и т.п. Основная проблема при таком подходе была, что нейронка не очень хорошо держала контекст и через какое-то количество вопросов начинала отклоняться от содержания статьи, плюс, сложно было подгрузить дополнительные статьи, на которые были рефференсы в основной, плюс, скачкообразная сложность объяснений. Чат будто забывал, что общается с далёким от науки собеседником и начинал заваливать формулами и сложной терминологией.
Позже я открыл для себя NotebookLM, в который можно загрузить сразу несколько источников и уже по ним общаться в чате. Контекст, в данном случае, удерживался лучше, были нужные ссылки на нужные части источников, чтобы ознакомиться с оригиналом, когда возникали сомнения, плюс, разные дополнительные удобные фичи в виде саммаризации, конспекта, презентации и/или даже аудиоподкаста. Но всё равно меня не покидало ощущение, что многие ответы как-будто вокруг, да около, размазанные и обобщённые, а не самая суть. Каждый раз, прям, стараться нужно было, чтобы добиться конкретного и одновременно понятного ответа.
И, вот, недавно, я попробовал alphaXiv, который заточен именно под работу с научными статьями. Там есть удобный умный поиск по базе статей из arXiv, которые легко загружаются в контекст. Есть автоматический сбор истории по каким-то технологиям или их аспектам через цепочку соответствующих статей. Подсвечивание канонических статей, которые оказали наибольшее влияние на определённую область. Удобная навигация по самим статьям. И много чего ещё. Я, прям, залипаю иногда, как когда-то давно любил позалипать на Википедии, гуляя по ссылкам и открывая десятки вкладок в браузере.
В общем, кажется, я теперь надолго с этим инструментом. Аж, чувствуется какая-то связь с научным сообществом и становится понятнее, откуда растут ноги у современных AI-трендов. Плюс, в голове появляется какая-то разметка относительно передовых исследований в интересующей тебя области.
Позже я открыл для себя NotebookLM, в который можно загрузить сразу несколько источников и уже по ним общаться в чате. Контекст, в данном случае, удерживался лучше, были нужные ссылки на нужные части источников, чтобы ознакомиться с оригиналом, когда возникали сомнения, плюс, разные дополнительные удобные фичи в виде саммаризации, конспекта, презентации и/или даже аудиоподкаста. Но всё равно меня не покидало ощущение, что многие ответы как-будто вокруг, да около, размазанные и обобщённые, а не самая суть. Каждый раз, прям, стараться нужно было, чтобы добиться конкретного и одновременно понятного ответа.
И, вот, недавно, я попробовал alphaXiv, который заточен именно под работу с научными статьями. Там есть удобный умный поиск по базе статей из arXiv, которые легко загружаются в контекст. Есть автоматический сбор истории по каким-то технологиям или их аспектам через цепочку соответствующих статей. Подсвечивание канонических статей, которые оказали наибольшее влияние на определённую область. Удобная навигация по самим статьям. И много чего ещё. Я, прям, залипаю иногда, как когда-то давно любил позалипать на Википедии, гуляя по ссылкам и открывая десятки вкладок в браузере.
В общем, кажется, я теперь надолго с этим инструментом. Аж, чувствуется какая-то связь с научным сообществом и становится понятнее, откуда растут ноги у современных AI-трендов. Плюс, в голове появляется какая-то разметка относительно передовых исследований в интересующей тебя области.
www.alphaxiv.org
Discuss, discover, and read arXiv papers.
Впервые собеседовался на Staff ML Engineer в топ цифровой банк ЛАТАМа. Поучаствовать смог только в технической части, в которой было целых 5 этапов (не считая скрининга):
✅ 1. Тех скрининг (Qualification Test): тесты с задачками по терверу, логике, IQ. Несмотря на то, что всегдя считал себя сильным в таких вещах, попадались и очень уж заковыристые. На все 20 минут
✅ 2. Тест по ML и кодингу: десяток теоретических вопросов по классическому МЛ и нейронкам, например, выберите случаи, когда RandomForest предпочтительнее бустингов над деревьями. В конце - 3 литкод-style задачи, например, реализовать k-means с нуля. По кодингу ничего не успел, вытащил искючительно за счет теории (похоже, что на этой и первой стадии оценка была бинарной "passed/didn't passed"). Тайминг - 80 минут, что все равно мало для такого объема
✅ 3. Классический литкод,Наконец, живой собес с лидом одной из команд, 3 easy + 1 medium. Мое слабое место :) С горем и подсказками пополам сделал 2.5 задачи, но везде учел corner cases, за что получил strong hire оценку (по кр мере, рекрутер так сказал😁)
✅ 4. ML System Design. Мне повезло, дали задачу по кредитному скорингу, где нужно было расписать все стадии от моделирования до деплоя и мониторинга. Поскольку занимаюсь этим последние 3 года, проблем не возникло и снова strong hire. Надо сказать, что очень много внимания интервьюер уделял общению с бизнесом и пониманию бизнес контекста, что неудивительно для такого уровня. Хотел выпендриться и порисовать на вайтборде на камеру, но собеседующий ничего не видел из-за лагающего интернета - после этого отправил заяку на смену провайдера.
❌ 5. ML Programming Case. Понятия не имел, что будет, до последнего пытался выведать у рекрутера, что можно ожидать, но получил какие-то общие ответы вроде "вас проверят на скорость погружения в контекст и решения нестандартных задач". В реальности досталась задача по реализации некоторых функций для платформы А/Б-тестирования. Поскольку я не дошел даже до половины, помню только самые простые задачи и вопросы, например, в каких случаях можно проводить несколько тестов одновременно, а когда нельзя. Так же нужно было закодить штуку, которая бы определяла, участвует ли данный клиент в тесте, или еще нет, и назначить ему тест, если он не участвует ни в одном из них. Кажется несложно, но запутался в мелочах, уже даже не вспомню, каких именно. Видимо, стресс из-за полного неведения, чего ожидать сыграли злую шутку. По итогу получил отказ на этом этапе, поэтому до поведенческого интервью дело не дошло.
Приятно удивил очень подробный фидбэк, по результатам которого понял, что по сути засыпался на литкоде, а с дизайном и бизнес контекстом все было отлично. Когда слышишь отовсюду угрозы о том, что ИИ заменяет кодеров, понимаешь, что новость хорошая :)
✅ 1. Тех скрининг (Qualification Test): тесты с задачками по терверу, логике, IQ. Несмотря на то, что всегдя считал себя сильным в таких вещах, попадались и очень уж заковыристые. На все 20 минут
✅ 2. Тест по ML и кодингу: десяток теоретических вопросов по классическому МЛ и нейронкам, например, выберите случаи, когда RandomForest предпочтительнее бустингов над деревьями. В конце - 3 литкод-style задачи, например, реализовать k-means с нуля. По кодингу ничего не успел, вытащил искючительно за счет теории (похоже, что на этой и первой стадии оценка была бинарной "passed/didn't passed"). Тайминг - 80 минут, что все равно мало для такого объема
✅ 3. Классический литкод,Наконец, живой собес с лидом одной из команд, 3 easy + 1 medium. Мое слабое место :) С горем и подсказками пополам сделал 2.5 задачи, но везде учел corner cases, за что получил strong hire оценку (по кр мере, рекрутер так сказал😁)
✅ 4. ML System Design. Мне повезло, дали задачу по кредитному скорингу, где нужно было расписать все стадии от моделирования до деплоя и мониторинга. Поскольку занимаюсь этим последние 3 года, проблем не возникло и снова strong hire. Надо сказать, что очень много внимания интервьюер уделял общению с бизнесом и пониманию бизнес контекста, что неудивительно для такого уровня. Хотел выпендриться и порисовать на вайтборде на камеру, но собеседующий ничего не видел из-за лагающего интернета - после этого отправил заяку на смену провайдера.
❌ 5. ML Programming Case. Понятия не имел, что будет, до последнего пытался выведать у рекрутера, что можно ожидать, но получил какие-то общие ответы вроде "вас проверят на скорость погружения в контекст и решения нестандартных задач". В реальности досталась задача по реализации некоторых функций для платформы А/Б-тестирования. Поскольку я не дошел даже до половины, помню только самые простые задачи и вопросы, например, в каких случаях можно проводить несколько тестов одновременно, а когда нельзя. Так же нужно было закодить штуку, которая бы определяла, участвует ли данный клиент в тесте, или еще нет, и назначить ему тест, если он не участвует ни в одном из них. Кажется несложно, но запутался в мелочах, уже даже не вспомню, каких именно. Видимо, стресс из-за полного неведения, чего ожидать сыграли злую шутку. По итогу получил отказ на этом этапе, поэтому до поведенческого интервью дело не дошло.
Приятно удивил очень подробный фидбэк, по результатам которого понял, что по сути засыпался на литкоде, а с дизайном и бизнес контекстом все было отлично. Когда слышишь отовсюду угрозы о том, что ИИ заменяет кодеров, понимаешь, что новость хорошая :)
👍6
Сегодня карьерные консультанты часто говорят о личном бренде и узнаваемости. Одновременно с этим, сильно изменился рекрутинг: одностраничное резюме уже в прошлом, поскольку теперь его анализ делает AI, которому все равно, сколько страниц анализировать за мгновение. К тому же, современные системы могут сами навести о вас справки в интернете. Увидел интересную рекомендацию: вбейте в гугл свое имя и включите AI режим. Если вы где-то когда-то засветились на выступлении на конференции, делали публикации, участвовали в хакатоне, то, если у вас везде указано одно и то же имя, AI сматчит все ваши достижения и создаст неплохую выжимку, которую как раз и анализируют современные реурутеры, не важно, люди или AI. И результат этой выжимки и есть та самая "узнаваемость личного бренда". Так что стоит привести в порядок свой LinkedIn (у меня в выжимку оттуда попадает довольно много полезной инфы), Medium, Kaggle и прочие ресурсы, проверить, везде ли ваше имя написано одинаково для того, чтобы AI поиск смог сматчить вас в одну и ту же личность.
👍2
Forwarded from Machine learning Interview
⚡️ OpenAI УНИЧТОЖЕН - правительство Индии обвиняет компанию в незаконном использовании рабского труда индийских программистов.
По «утечке», до 40% всех запросов по программированию якобы обрабатывает не GPT-5.4 Codex, а реальные разработчики из Индии, работающие в закрытых центрах в Корапуте.
История получила продолжение после «закрытия» Sora, якобы сотни аниматоров вышли наружу и рассказали, как всё устроено на самом деле.
Вишенка на торте - к теме даже «подключили» Трампа: он якобы заявил, что с американскими программистами у ChatGPT был бы шанс снова стать великим.
Звучит как громкое расследование.
По «утечке», до 40% всех запросов по программированию якобы обрабатывает не GPT-5.4 Codex, а реальные разработчики из Индии, работающие в закрытых центрах в Корапуте.
История получила продолжение после «закрытия» Sora, якобы сотни аниматоров вышли наружу и рассказали, как всё устроено на самом деле.
Вишенка на торте - к теме даже «подключили» Трампа: он якобы заявил, что с американскими программистами у ChatGPT был бы шанс снова стать великим.
Звучит как громкое расследование.
😁1
Forwarded from Data Secrets
В сеть утек исходный код Claude Code
При публикации пакетов кто-то в Anthropic совершил ✨некий просчет✨, и билд обфусцированного cli.js оказался в публичном npm‑пакете вместе с полноценным cli.js.map, которого там никак не должно было быть. То есть любой, кто установил пакет или скачал его, мог легко восстановить исходники через sourcemap.
Естественно, код почти моментально разошелся по репам. Популярные инфобез-комьюнити подтвердили, что это не фейк и не обычная обертка над API, а именно продвинутая CLI‑платформа.
https://github.com/instructkr/claude-code
Оказалось, что под капотом 1906 файлов TypeScript и примерно 500к строк.
Из интересного:
– Есть намеки на нереализованные фичи типа глубокого планирования, постоянной памяти и "сна".
– Можно посмотреть, как у Anthropic реализована мультиагентность (файл coordinator/coordinatorMode.ts)
– Также доступны все системные промпты (constants/prompts.ts)
С днем опенсорса, так сказать.
UPD: автор начал менять репозиторий, так что вот тут ловите дополнительную ссылку на архив с исходниками
При публикации пакетов кто-то в Anthropic совершил ✨некий просчет✨, и билд обфусцированного cli.js оказался в публичном npm‑пакете вместе с полноценным cli.js.map, которого там никак не должно было быть. То есть любой, кто установил пакет или скачал его, мог легко восстановить исходники через sourcemap.
Естественно, код почти моментально разошелся по репам. Популярные инфобез-комьюнити подтвердили, что это не фейк и не обычная обертка над API, а именно продвинутая CLI‑платформа.
https://github.com/instructkr/claude-code
Оказалось, что под капотом 1906 файлов TypeScript и примерно 500к строк.
Из интересного:
– Есть намеки на нереализованные фичи типа глубокого планирования, постоянной памяти и "сна".
– Можно посмотреть, как у Anthropic реализована мультиагентность (файл coordinator/coordinatorMode.ts)
– Также доступны все системные промпты (constants/prompts.ts)
С днем опенсорса, так сказать.
UPD: автор начал менять репозиторий, так что вот тут ловите дополнительную ссылку на архив с исходниками
Forwarded from Machine learning Interview
Claude 101:
http://claude101.com
→ Уровень 1 - 24 минуты: база
Claude для новичков:
https://ruben.substack.com/p/claude-for-dummies
Настройка Claude:
http://how-to-claude.ai
→ Уровень 2 - 1 час: реальные workflows
Claude Cowork:
http://claude-co.work
Claude для команд:
http://how-claude.team
Claude Design:
http://claudedesign.free
Cowork + Projects:
https://ruben.substack.com/p/claude-cowork-project
Claude для слайдов:
http://how-to-gamma.ai
Claude Skills:
http://claude-skills.free
→ Уровень 3 - 3,5 часа: pro-приемы
Как избегать подхалимства модели:
https://ruben.substack.com/p/i-love-to-be-right
Claude Code:
http://claudecode.free
Claude 101:
https://anthropic.skilljar.com/claude-101
Как не упираться в лимиты Claude:
https://ruben.substack.com/p/how-to-stop-hitting-claude-usage
Хватит просто промптить:
https://ruben.substack.com/p/stop-prompting-claude
→ Уровень 4 - 8 часов: экспертный режим
Claude Computer:
https://ruben.substack.com/p/claude-computer
Разработка с Claude API:
https://anthropic.skilljar.com/claude-with-the-anthropic-api
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
AWS закрывает Amazon Mechanical Turk 30 сентября 2026 года.
Также исчезнет интеграция MTurk с Amazon Augmented AI и SageMaker Ground Truth.
Официально причины не раскрываются, но :
• простую разметку уже выполняют даже небольшие LLM
• сложные задачи требуют проверенных отраслевых экспертов, а не анонимного краудсорсинга из третьих стран
• использование ИИ самими исполнителями снижает ценность «человеческой» проверки
Символично: ИИ закрыл платформу, которая помогала его обучать.
Также исчезнет интеграция MTurk с Amazon Augmented AI и SageMaker Ground Truth.
Официально причины не раскрываются, но :
• простую разметку уже выполняют даже небольшие LLM
• сложные задачи требуют проверенных отраслевых экспертов, а не анонимного краудсорсинга из третьих стран
• использование ИИ самими исполнителями снижает ценность «человеческой» проверки
Символично: ИИ закрыл платформу, которая помогала его обучать.