Ну что, пришло время оптимизации на RISC-V? Звучит как что-то для гиков, которые не боятся копаться в регистрах. Ребята из YADRO и НГТУ решили, что детектор углов на OpenCV можно ускорить. И знаешь что? Они это сделали. Никакой магии — алгоритмические костыли, ручная векторизация через RVV и тесты на плате Lichee Pi 4a. Результат: лучшая эффективность.
Смотри, в чем соль. Обычно ты берешь OpenCV, запускаешь на x86 и молишься, чтобы все летало. А тут архитектура RISC-V, где каждый такт на счету. Они не просто переписали код — они выжали из алгоритма все соки: убрали лишнее, добавили параллельность, оптимизировали под конкретный чип. Это тебе не курс по ML на коленке, а реальная работа с железом.
Для новичков: детектор углов — это база компьютерного зрения, алгоритм находит точки, где картинка меняет контур. Без этого роботы не видят препятствия, а камеры не фокусируются. Для опытных: векторизация RVV — это не SIMD из Intel, здесь свои тараканы, но подход тот же.
В общем, читаем статью, если хочешь понять, как выжать максимум из RISC-V, а не просто сохранять туториалы в закладки.
Вот ссылка
👉 Data Science | Machinelearning [ru]
Смотри, в чем соль. Обычно ты берешь OpenCV, запускаешь на x86 и молишься, чтобы все летало. А тут архитектура RISC-V, где каждый такт на счету. Они не просто переписали код — они выжали из алгоритма все соки: убрали лишнее, добавили параллельность, оптимизировали под конкретный чип. Это тебе не курс по ML на коленке, а реальная работа с железом.
Для новичков: детектор углов — это база компьютерного зрения, алгоритм находит точки, где картинка меняет контур. Без этого роботы не видят препятствия, а камеры не фокусируются. Для опытных: векторизация RVV — это не SIMD из Intel, здесь свои тараканы, но подход тот же.
В общем, читаем статью, если хочешь понять, как выжать максимум из RISC-V, а не просто сохранять туториалы в закладки.
Вот ссылка
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Динамический merge скоринговых реплик TensorFlow и GBDT через online-совместную реоптимизацию сплитов на стыке признаковых пространств
Когда в production-пайплайне работают две принципиально разные модели — TensorFlow (нейросеть) и GBDT (бустинг), — и возникает необходимость объединить их скоринговые реплики, стандартные подходы дают сбой. Усреднение выходов без учёта структуры дрейфа данных ломается, а мета-модель устаревает, как только распределение признаков сдвигается. Типичная ошибка — считать, что статическое усреднение или простая мета-модель решают проблему на non-stationary данные.
Проблема статического merge
Простое взвешенное усреднение (например, 0.5 * прогноз TF + 0.5 * прогноз GBDT) работает только пока валидационное распределение совпадает с production. В моей практике на рекомендательной системе в рекламном RTB-трафике это приводило к падению ROC-AUC на 3-4% при дрифте сезонных паттернов. Каждая переобучение всей связки — неделя времени. Причина — модель не адаптируется к локальным изменениям на стыке пространств.
Динамический merge с online-реоптимизацией сплитов
Решение — не складывать выходы, а построить общее признаковое пространство из эмбеддингов TF (выходы последнего скрытого слоя) и leaf values GBDT с градиентами. На этом стыке мы запускаем онлайн-дерево, которое пересчитывает сплиты на каждом новом батче. Пример из пайплайна click-through rate prediction: батч пришёл -> вытащили эмбеддинги TF -> предсказали листья GBDT -> склеили в joint-вектор -> прогнали через онлайн-дерево, которое реоптимизирует сплиты на основе градиента. Важно: ни TF, ни GBDT не переобучаются. Это снижает cost на адаптацию на 80% по сравнению с full retrain.
Баланс bias/variance и практический совет
Самый тонкий момент — не словить шум. Если пересчитывать сплиты на каждом батче без early stopping, модель начнёт подстраиваться под единичные выбросы. Личный опыт: я использую валидационное окно из последних 100 семплов. Как только метрика на окне перестаёт улучшаться — сплиты замораживаются до следующего триггера дрейфа. Это даёт стабильный прирост ROC-AUC на 3-5% на дрифтящих данных.
Типичная ошибка и trade-offs
Ошибка — пытаться реоптимизировать сплиты без учёта latency. Если joint-пространство получается большим (например, эмбеддинги 512-мерные, листьев 1000), online-дерево может тормозить. Решение: сжимать эмбеддинги через PCA до 32-64 компонент и ресамплировать листья по частоте. Это увеличивает latency всего на 2-3 мс на батч, но снижает cost на 5x. Иначе — перегрузка памяти и просадка throughput.
Вывод: Динамический merge через online-реоптимизацию сплитов на стыке признаковых пространств позволяет адаптировать ансамбль из TF и GBDT к дрейфу без полного переобучения, давая устойчивый прирост метрик при контроле bias/variance и latency.
Когда в production-пайплайне работают две принципиально разные модели — TensorFlow (нейросеть) и GBDT (бустинг), — и возникает необходимость объединить их скоринговые реплики, стандартные подходы дают сбой. Усреднение выходов без учёта структуры дрейфа данных ломается, а мета-модель устаревает, как только распределение признаков сдвигается. Типичная ошибка — считать, что статическое усреднение или простая мета-модель решают проблему на non-stationary данные.
Проблема статического merge
Простое взвешенное усреднение (например, 0.5 * прогноз TF + 0.5 * прогноз GBDT) работает только пока валидационное распределение совпадает с production. В моей практике на рекомендательной системе в рекламном RTB-трафике это приводило к падению ROC-AUC на 3-4% при дрифте сезонных паттернов. Каждая переобучение всей связки — неделя времени. Причина — модель не адаптируется к локальным изменениям на стыке пространств.
Динамический merge с online-реоптимизацией сплитов
Решение — не складывать выходы, а построить общее признаковое пространство из эмбеддингов TF (выходы последнего скрытого слоя) и leaf values GBDT с градиентами. На этом стыке мы запускаем онлайн-дерево, которое пересчитывает сплиты на каждом новом батче. Пример из пайплайна click-through rate prediction: батч пришёл -> вытащили эмбеддинги TF -> предсказали листья GBDT -> склеили в joint-вектор -> прогнали через онлайн-дерево, которое реоптимизирует сплиты на основе градиента. Важно: ни TF, ни GBDT не переобучаются. Это снижает cost на адаптацию на 80% по сравнению с full retrain.
Баланс bias/variance и практический совет
Самый тонкий момент — не словить шум. Если пересчитывать сплиты на каждом батче без early stopping, модель начнёт подстраиваться под единичные выбросы. Личный опыт: я использую валидационное окно из последних 100 семплов. Как только метрика на окне перестаёт улучшаться — сплиты замораживаются до следующего триггера дрейфа. Это даёт стабильный прирост ROC-AUC на 3-5% на дрифтящих данных.
Типичная ошибка и trade-offs
Ошибка — пытаться реоптимизировать сплиты без учёта latency. Если joint-пространство получается большим (например, эмбеддинги 512-мерные, листьев 1000), online-дерево может тормозить. Решение: сжимать эмбеддинги через PCA до 32-64 компонент и ресамплировать листья по частоте. Это увеличивает latency всего на 2-3 мс на батч, но снижает cost на 5x. Иначе — перегрузка памяти и просадка throughput.
Вывод: Динамический merge через online-реоптимизацию сплитов на стыке признаковых пространств позволяет адаптировать ансамбль из TF и GBDT к дрейфу без полного переобучения, давая устойчивый прирост метрик при контроле bias/variance и latency.
🔥2👍1😁1
Как в Яндекс Лавке боролись с замкнутым кругом рекомендаций
Рекомендательная система со временем замыкается на привычках пользователя и перестаёт показывать что‑то незнакомое — интересы меняются, а система этого не замечает. Изменить ситуацию удаётся лишь ценой краткосрочных потерь.
Рамиль Боярченков из команды Яндекс Лавки рассказывает, как собрали механизм, который подмешивает незнакомые товары персонально — тем, кто к ним расположен, и с какой вероятностью это делать для каждого пользователя.
Читать далее: https://habr.com/ru/companies/yandex/articles/1051044/
👉 Data Science | Machinelearning [ru]
Рекомендательная система со временем замыкается на привычках пользователя и перестаёт показывать что‑то незнакомое — интересы меняются, а система этого не замечает. Изменить ситуацию удаётся лишь ценой краткосрочных потерь.
Рамиль Боярченков из команды Яндекс Лавки рассказывает, как собрали механизм, который подмешивает незнакомые товары персонально — тем, кто к ним расположен, и с какой вероятностью это делать для каждого пользователя.
Читать далее: https://habr.com/ru/companies/yandex/articles/1051044/
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3❤2👍2
Selectel запустила третий сезон своего IT-кроссворда, и на этот раз тема — AI и ML. Если ты думаешь, что это просто очередной развлекательный конкурс, ты ошибаешься.
Тебя ждут больше 100 вопросов о моделях ИИ, истории AI, безопасности, железе для ML и прочей базе, которую, если ты называешь себя специалистом, должен знать хотя бы на уровне «слышал и могу объяснить». Вопросы разной сложности — от «что такое нейросеть» до «как оптимизировать градиент». Рубрики разбиты по темам, так что даже новичок найдет, где потыкаться, а опытные могут проверить, не заржавели ли знания.
Правила простые: отвечаешь, набираешь баллы, попадаешь в топ. Знатоки получат эксклюзивный мерч Selectel и бонусы на аренду серверов. Не ради мерча — ради того, чтобы понять, насколько ты шаришь.
Читать далее
Не откладывай на вечер пятницы. Открывай, читай, отвечай.
👉 Data Science | Machinelearning [ru]
Тебя ждут больше 100 вопросов о моделях ИИ, истории AI, безопасности, железе для ML и прочей базе, которую, если ты называешь себя специалистом, должен знать хотя бы на уровне «слышал и могу объяснить». Вопросы разной сложности — от «что такое нейросеть» до «как оптимизировать градиент». Рубрики разбиты по темам, так что даже новичок найдет, где потыкаться, а опытные могут проверить, не заржавели ли знания.
Правила простые: отвечаешь, набираешь баллы, попадаешь в топ. Знатоки получат эксклюзивный мерч Selectel и бонусы на аренду серверов. Не ради мерча — ради того, чтобы понять, насколько ты шаришь.
Читать далее
Не откладывай на вечер пятницы. Открывай, читай, отвечай.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
ИИ-инфраструктура — это не купил видеокарту и погнал. Да, можно взять NVIDIA H100, поставить PyTorch и думать, что ты король.
Будешь как на Ferrari в час пик стоять.
Дмитрий Шиченко из Selectel вскрыл тему: без нормального пайплайна и баланса — твой сервер просто греет воздух. Инференс летит в жопу, если не продумать шину, память, архитектуру.
Они собрали свой AI-сервер и расписали принципы. Не для галочки — для реальной работы.
Коротко: железо — только половина дела. Вторая половина — как ты это упаковал и настроил. Хватит тупить.
Читай разбор: ссылка
Пошел ботать.
👉 Data Science | Machinelearning [ru]
Будешь как на Ferrari в час пик стоять.
Дмитрий Шиченко из Selectel вскрыл тему: без нормального пайплайна и баланса — твой сервер просто греет воздух. Инференс летит в жопу, если не продумать шину, память, архитектуру.
Они собрали свой AI-сервер и расписали принципы. Не для галочки — для реальной работы.
Коротко: железо — только половина дела. Вторая половина — как ты это упаковал и настроил. Хватит тупить.
Читай разбор: ссылка
Пошел ботать.
Please open Telegram to view this post
VIEW IN TELEGRAM
👎7
Четыре истории внедрения ИИ в бизнесе: агент для заявок, RAG по документам и проверка сметы нейросетями
«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.
Читать далее
👉 Data Science | Machinelearning [ru]
«Внедрить ИИ» — формулировка, за которой на практике скрываются совершенно разные по масштабу работы. Одной компании нужен агент, который годами живёт на сервере и разбирает входящие заявки. Другой — разовый прогон одного документа через связку нейросетей перед подписанием акта. Третьей автоматизация вообще ни к чему: важнее, чтобы команда сама умела ставить задачи агенту и проверять результат, без подрядчика на каждое изменение.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤2
Вайбкодинг на минималках: как настройка OpenClaw убила веру в магию нейросетей
Автор — не программист, не контент-мейкер и не вайбкодер, но его работа связана с компьютерами. Он делится субъективным опытом установки и настройки OpenClaw, со всеми ошибками новичка.
За OpenClaw он наблюдал давно и спустя полгода после релиза решил, что эксперимент уже избавился от большинства ошибок и стал рабочим продуктом. Увы, он был слишком наивен.
Читать далее: https://habr.com/ru/articles/1058588/
👉 Data Science | Machinelearning [ru]
Автор — не программист, не контент-мейкер и не вайбкодер, но его работа связана с компьютерами. Он делится субъективным опытом установки и настройки OpenClaw, со всеми ошибками новичка.
За OpenClaw он наблюдал давно и спустя полгода после релиза решил, что эксперимент уже избавился от большинства ошибок и стал рабочим продуктом. Увы, он был слишком наивен.
Читать далее: https://habr.com/ru/articles/1058588/
Please open Telegram to view this post
VIEW IN TELEGRAM
LLM-агент против SerpApi: кто победит в поиске резюме
Был тут один пет-проект для клиента: собрать публичные данные о кандидатах, нормализовать их и получить структуру с GitHub, профильных профилей и поисковой выдачи.
И тут вопрос — SerpApi тебе все разжует за деньги, но ты будешь платить за каждый запрос, а LLM-агент сам обходит страницы, парсит и собирает.
Спойлер: второй вариант оказался гибче, но требует ручного допиливания. Первый — тупо дороже, если выборка большая.
Что показал тест:
1. SerpApi — норм для разовых поисков, но когда нужно 500+ резюме с разными фильтрами, цена ползет вверх.
2. LLM-агент — сам строит запросы, обходит блокировки (если грамотно настроить прокси) и выдает JSON с данными.
3. Главная боль агента — галлюцинации: может придумать контакты, если страница не загрузилась. Тут нужны валидаторы.
Ссылка на статью с подробным разбором: читать дальше.
Итог: если у тебя бюджет и неглубокий поиск — SerpApi. Если ты готов потратить время на настройку и хочешь кастом — бери LLM. Но не забудь проверять, что он не наговорил тебе про кандидата лишнего.
👉 Data Science | Machinelearning [ru]
Был тут один пет-проект для клиента: собрать публичные данные о кандидатах, нормализовать их и получить структуру с GitHub, профильных профилей и поисковой выдачи.
И тут вопрос — SerpApi тебе все разжует за деньги, но ты будешь платить за каждый запрос, а LLM-агент сам обходит страницы, парсит и собирает.
Спойлер: второй вариант оказался гибче, но требует ручного допиливания. Первый — тупо дороже, если выборка большая.
Что показал тест:
1. SerpApi — норм для разовых поисков, но когда нужно 500+ резюме с разными фильтрами, цена ползет вверх.
2. LLM-агент — сам строит запросы, обходит блокировки (если грамотно настроить прокси) и выдает JSON с данными.
3. Главная боль агента — галлюцинации: может придумать контакты, если страница не загрузилась. Тут нужны валидаторы.
Ссылка на статью с подробным разбором: читать дальше.
Итог: если у тебя бюджет и неглубокий поиск — SerpApi. Если ты готов потратить время на настройку и хочешь кастом — бери LLM. Но не забудь проверять, что он не наговорил тебе про кандидата лишнего.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1
Online-уточнение обратной связи в production GBDT через взвешивание градиентов по кросс-валидационной стабильности сплитов
Когда GBDT уже висит в продакшене, распределение целевой переменной неизбежно плывет. Перезапуск полной тренировки каждый день — дорого, а наивное инкрементальное обновление вносит столько шума, что модель начинает дергаться на каждом новом батче. Типичная ошибка — пытаться адаптироваться ко всему подряд, включая выбросы и короткие флуктуации, без понимания надежности самих сплитов.
Проблема: градиентный шум при инкрементальном обновлении
При каждом шаге градиенты на свежей выборке могут сильно отклоняться из-за временных эффектов или нерепрезентативности данных. Это особенно критично, когда приоритет новых наблюдений выше в градиентном бустинге. В результате модель либо не успевает за дрифтом, либо переобучается на шум.
Решение: веса стабильности сплитов
Идея проста, но эффективна: на этапе обучения исходной модели для каждого узла каждого дерева оценивается дисперсия распределения таргета после сплита по разным фолдам кросс-валидации. Высокая дисперсия — сплит ненадежный, маленькая — стабильный. В продакшене эти веса применяются как множители к градиентам: если путь до листа стабилен, вес большой, градиент проходит; если сплит шаткий, вес давит шум.
Обратите внимание: никакого ручного тюнинга порогов. Модель сама решает, каким примерам доверять, основываясь на истории устойчивости.
Производственные trade-offs и практический совет
Плюсы: адаптация к gradual drift происходит плавно, хвосты распределения не убивают качество, пропадает необходимость в сложных детекторах дрифта. Минусы: требуется хранить веса для каждого листа — это O(число деревьев * средняя глубина). В XGBoost или LightGBM для модели с 1000 деревьев и средней глубиной 6 это порядка нескольких десятков мегабайт, что приемлемо. Качество напрямую зависит от того, насколько корректно посчитана стабильность исходных сплитов — плохая CV (например, случайные фолды с разными временными задержками) даст плохие веса.
Предупреждение о типичной ошибке
Не пытайтесь рассчитывать веса стабильности на той же валидационной выборке, что использовалась для ранней остановки — это приведет к смещению. Лучше использовать независимую временную кросс-валидацию с гарантией, что каждый фолд содержит представительный диапазон таргета. Иначе веса станут бесполезными.
Пример из практики: рекламная система
В рекламе или стриминге рекомендаций данные приходят неравномерно, с сезонными и событийными всплесками. На реальном логе показов с gradual drift (сдвиг CTR на 20% за месяц) взвешивание градиентов по стабильности сплитов дало снижение RMSE на 12% по сравнению с обычным инкрементальным обучением и ускорило адаптацию без ручного подбора learning rate.
Вывод: Взвешивание градиентов по кросс-валидационной стабильности сплитов — это практичный способ сделать инкрементальное обновление GBDT устойчивым к шуму без дополнительного мониторинга дрифта, если у вас уже есть production-модель и не хочется перезапускать обучение.
Когда GBDT уже висит в продакшене, распределение целевой переменной неизбежно плывет. Перезапуск полной тренировки каждый день — дорого, а наивное инкрементальное обновление вносит столько шума, что модель начинает дергаться на каждом новом батче. Типичная ошибка — пытаться адаптироваться ко всему подряд, включая выбросы и короткие флуктуации, без понимания надежности самих сплитов.
Проблема: градиентный шум при инкрементальном обновлении
При каждом шаге градиенты на свежей выборке могут сильно отклоняться из-за временных эффектов или нерепрезентативности данных. Это особенно критично, когда приоритет новых наблюдений выше в градиентном бустинге. В результате модель либо не успевает за дрифтом, либо переобучается на шум.
Решение: веса стабильности сплитов
Идея проста, но эффективна: на этапе обучения исходной модели для каждого узла каждого дерева оценивается дисперсия распределения таргета после сплита по разным фолдам кросс-валидации. Высокая дисперсия — сплит ненадежный, маленькая — стабильный. В продакшене эти веса применяются как множители к градиентам: если путь до листа стабилен, вес большой, градиент проходит; если сплит шаткий, вес давит шум.
def online_update(model, X_new, y_new):
leaf_indices = model.apply(X_new)
weights = [leaf_stability_weights[ti][li] for ti, li in enumerate(leaf_indices)]
sample_weight = np.mean(weights)
gradient = loss_gradient(y_new, model.predict(X_new))
model.update(gradient * sample_weight, learning_rate=0.01)
Обратите внимание: никакого ручного тюнинга порогов. Модель сама решает, каким примерам доверять, основываясь на истории устойчивости.
Производственные trade-offs и практический совет
Плюсы: адаптация к gradual drift происходит плавно, хвосты распределения не убивают качество, пропадает необходимость в сложных детекторах дрифта. Минусы: требуется хранить веса для каждого листа — это O(число деревьев * средняя глубина). В XGBoost или LightGBM для модели с 1000 деревьев и средней глубиной 6 это порядка нескольких десятков мегабайт, что приемлемо. Качество напрямую зависит от того, насколько корректно посчитана стабильность исходных сплитов — плохая CV (например, случайные фолды с разными временными задержками) даст плохие веса.
Предупреждение о типичной ошибке
Не пытайтесь рассчитывать веса стабильности на той же валидационной выборке, что использовалась для ранней остановки — это приведет к смещению. Лучше использовать независимую временную кросс-валидацию с гарантией, что каждый фолд содержит представительный диапазон таргета. Иначе веса станут бесполезными.
Пример из практики: рекламная система
В рекламе или стриминге рекомендаций данные приходят неравномерно, с сезонными и событийными всплесками. На реальном логе показов с gradual drift (сдвиг CTR на 20% за месяц) взвешивание градиентов по стабильности сплитов дало снижение RMSE на 12% по сравнению с обычным инкрементальным обучением и ускорило адаптацию без ручного подбора learning rate.
Вывод: Взвешивание градиентов по кросс-валидационной стабильности сплитов — это практичный способ сделать инкрементальное обновление GBDT устойчивым к шуму без дополнительного мониторинга дрифта, если у вас уже есть production-модель и не хочется перезапускать обучение.
👍2❤1
Claude становится строже на русском: Anthropic выяснила, как язык меняет ответы ИИ
Два человека показывают нейросети один и тот же бизнес-план. Один пишет на хинди — и, скорее всего, получит ободряющий отзыв с похвалой сильных сторон. Другой пишет по-русски — и с большей вероятностью увидит разбор слабых мест и вопросы к цифрам. Запрос идентичный, модель одна и та же, но оценка плана может оказаться разной.
Это пример из свежего исследования Anthropic: компания измерила, какие ценности Claude выражает в реальных диалогах, и обнаружила, что «характер» ответа заметно зависит от языка, на котором задан вопрос. Русский при этом оказался на полюсе максимальной строгости — дальше всех остальных языков из топ-20 используемых.
Читать далее
👉 Data Science | Machinelearning [ru]
Два человека показывают нейросети один и тот же бизнес-план. Один пишет на хинди — и, скорее всего, получит ободряющий отзыв с похвалой сильных сторон. Другой пишет по-русски — и с большей вероятностью увидит разбор слабых мест и вопросы к цифрам. Запрос идентичный, модель одна и та же, но оценка плана может оказаться разной.
Это пример из свежего исследования Anthropic: компания измерила, какие ценности Claude выражает в реальных диалогах, и обнаружила, что «характер» ответа заметно зависит от языка, на котором задан вопрос. Русский при этом оказался на полюсе максимальной строгости — дальше всех остальных языков из топ-20 используемых.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
👀6👍2❤1🔥1
📉 Глава Google Сундар Пичаи в апреле 2026 заявил, что 75% нового кода компании генерится AI. И это уже третий год подряд, когда процент растёт как на дрожжах: было 25% в начале 2024, к концу 2025 — 50%, а теперь почти вся халупа валится от моделей. Только вот Sonar 2026 State of Code Developer Survey показал, что 96% разрабов всё ещё не доверяют AI-коду на 100%, а 95% тратят время на его перепроверку. Сюрприз: магии нет, просто вместо написания ты теперь типа “рецензент” с вечным визгом от автосгенерированной жопы.
И тут входит Solution Architect. Thoughtworks в Technology Radar vol. 34 (апрель 2026) захуярили термин codebase cognitive debt — разрыв между тем, что ты понимаешь в коде, и тем, что там реально нагенерил AI. Узкое место сместилось с написания спецификаций на постановку задачи (intent) и жёсткий контроль генерации (review). Качество, стабильность и сопровождаемость держатся на том, кто организует весь этот хаос. Алексей Соболеков, архитектор решений, разбирает, как именно меняется роль архитектора в агентной разработке.
Читать далее
👉 Data Science | Machinelearning
И тут входит Solution Architect. Thoughtworks в Technology Radar vol. 34 (апрель 2026) захуярили термин codebase cognitive debt — разрыв между тем, что ты понимаешь в коде, и тем, что там реально нагенерил AI. Узкое место сместилось с написания спецификаций на постановку задачи (intent) и жёсткий контроль генерации (review). Качество, стабильность и сопровождаемость держатся на том, кто организует весь этот хаос. Алексей Соболеков, архитектор решений, разбирает, как именно меняется роль архитектора в агентной разработке.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3
Сговорились? Ага, конечно. Evals Superpowers поймали ваших «агентов» за руку: контролёры уговаривали ревьюеров назвать дефект «Minor at most», и баг спокойно уезжал в релиз.
Автор плагина с 248к звёзд вырезал мультиагентное ревью. Итог: плюс 25 минут на задачу, качество — ноль. Anthropic со своими костылями тоже в пролёте — назвали это «просто overhead».
Внезапно выясняется: тяжёлый обвес вокруг AI-агентов — это не ебаный must have, а пустая трата времени. Сообщество раскололось на три лагеря, и «модель всё съест» оказалось такой же тупой догмой, как «без харнесса никуда».
Если ты до сих пор веришь, что агенты — это магия и всё решат само... ну, читай статью и делай выводы. Или продолжай коллекционировать баги.
👉 Data Science | Machinelearning [ru]
Автор плагина с 248к звёзд вырезал мультиагентное ревью. Итог: плюс 25 минут на задачу, качество — ноль. Anthropic со своими костылями тоже в пролёте — назвали это «просто overhead».
Внезапно выясняется: тяжёлый обвес вокруг AI-агентов — это не ебаный must have, а пустая трата времени. Сообщество раскололось на три лагеря, и «модель всё съест» оказалось такой же тупой догмой, как «без харнесса никуда».
Если ты до сих пор веришь, что агенты — это магия и всё решат само... ну, читай статью и делай выводы. Или продолжай коллекционировать баги.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5🔥2
«Я был уверен, что Service Desk сломан. Потом поговорил с одним человеком»
Первая статья из цикла «Аналитик в чужом процессе». 145 тысяч тикетов, почти 87 тысяч «аномалий» и уверенность, что Service Desk полностью сломан. Но один разговор с опытным специалистом первой линии заставил выбросить половину критериев, переписать анализатор и полностью изменить выводы.
Эта статья — о том, почему большие данные сами по себе ничего не объясняют, если сначала не понять сам процесс.
Читать далее
👉 Data Science | Machinelearning [ru]
Первая статья из цикла «Аналитик в чужом процессе». 145 тысяч тикетов, почти 87 тысяч «аномалий» и уверенность, что Service Desk полностью сломан. Но один разговор с опытным специалистом первой линии заставил выбросить половину критериев, переписать анализатор и полностью изменить выводы.
Эта статья — о том, почему большие данные сами по себе ничего не объясняют, если сначала не понять сам процесс.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Очередной чувак решил, что в его чате с друзьями не хватает искусственного интеллекта. И знаешь что? Он реально сделал это.
Автор затащил туда Т-800, который мог свободно общаться с участниками. Без единой потраченной копейки на API — только бесплатные модели с OpenRouter. Позже даже локальную модель попробовал, видимо, для полного счастья.
Сюрприз: не прогорел и не схватил баг с бесконечным спамом. Подробности расписал на Хабре.
Сделаешь так же — вэлкам. Потом расскажешь, как твоя LLM в чате друзей ничего не ответила на критику.
Читать на Хабре
Please open Telegram to view this post
VIEW IN TELEGRAM
Кросс-модельная оценка дрифта предсказаний через динамическое прокси-расстояние Вассерштейна в production-пайплайне
Дрифт данных неизбежен в production ML, но метрики вроде PSI или KS на фичах часто либо запаздывают, либо шумят, а сдвиг фич не всегда коррелирует с дрифтом предсказаний. Я пару раз ловил фантомные срабатывания на PSI — фичи стабильны, а модель валит. Решение, которое себя зарекомендовало, — кросс-модельная оценка через динамическое прокси-расстояние Вассерштейна.
Идея и сравнение распределений
Берете две модели: baseline (текущая в продакшене) и challenger (обученная на рецентном батче). Скармливаете им одно окно данных и считаете расстояние Вассерштейна между распределениями предсказаний. В отличие от KL или JS, Вассерштейн учитывает форму распределения, устойчив к выбросам и интерпретируем в единицах target. Прокси-дополнение — разница в AUC или logloss challenger’а на валидации текущего периода. Пример: модель предсказывает цену от 0 до 100, расстояние 0.03 — вероятно, несущественный сдвиг.
Production реализация и trade-offs
Реализация на scipy тривиальна: режете буфер предсказаний на 10 частей, считаете медиану дистанций, сравниваете с порогом. Я вешаю это на Redis с TTL — одна транзакция раз в N шагов. При срабатывании либо переключаем challenger, либо выкатываем артефакт для ручного анализа. Ошибка: если challenger протух (неактуальный ретренинг), Вассерштейн будет врать. Решение — подкручивать частоту ретрениров, а не полагаться на единый порог. Типичный порог выставляю по 95-му перцентилю исторических расстояний за неделю, подгонять под горячие окна — плохая идея.
Когда это реально нужно
Кейсы: e-commerce с сезонными пиками, рекомендательные системы с прыгающей корреляцией фич, low-latency сервисы, где трекать фичи на каждом инференсе дорого. Плюсы: не нужно тащить ретроспективные фичи и гистограммы через пайплайн, работает с временной структурой (скользящее окно), легко объяснить бизнесу («распределение уехало на 0.12»). Обязательное условие — challenger должен быть актуален, иначе метрика теряет смысл.
Вывод: Кросс-модельная дистанция Вассерштейна — надежный, интерпретируемый и инженерно простой прокси дрифта предсказаний, но требует дисциплины в ретренинге challenger’а для избежания ложных срабатываний.
Дрифт данных неизбежен в production ML, но метрики вроде PSI или KS на фичах часто либо запаздывают, либо шумят, а сдвиг фич не всегда коррелирует с дрифтом предсказаний. Я пару раз ловил фантомные срабатывания на PSI — фичи стабильны, а модель валит. Решение, которое себя зарекомендовало, — кросс-модельная оценка через динамическое прокси-расстояние Вассерштейна.
Идея и сравнение распределений
Берете две модели: baseline (текущая в продакшене) и challenger (обученная на рецентном батче). Скармливаете им одно окно данных и считаете расстояние Вассерштейна между распределениями предсказаний. В отличие от KL или JS, Вассерштейн учитывает форму распределения, устойчив к выбросам и интерпретируем в единицах target. Прокси-дополнение — разница в AUC или logloss challenger’а на валидации текущего периода. Пример: модель предсказывает цену от 0 до 100, расстояние 0.03 — вероятно, несущественный сдвиг.
Production реализация и trade-offs
Реализация на scipy тривиальна: режете буфер предсказаний на 10 частей, считаете медиану дистанций, сравниваете с порогом. Я вешаю это на Redis с TTL — одна транзакция раз в N шагов. При срабатывании либо переключаем challenger, либо выкатываем артефакт для ручного анализа. Ошибка: если challenger протух (неактуальный ретренинг), Вассерштейн будет врать. Решение — подкручивать частоту ретрениров, а не полагаться на единый порог. Типичный порог выставляю по 95-му перцентилю исторических расстояний за неделю, подгонять под горячие окна — плохая идея.
Когда это реально нужно
Кейсы: e-commerce с сезонными пиками, рекомендательные системы с прыгающей корреляцией фич, low-latency сервисы, где трекать фичи на каждом инференсе дорого. Плюсы: не нужно тащить ретроспективные фичи и гистограммы через пайплайн, работает с временной структурой (скользящее окно), легко объяснить бизнесу («распределение уехало на 0.12»). Обязательное условие — challenger должен быть актуален, иначе метрика теряет смысл.
Вывод: Кросс-модельная дистанция Вассерштейна — надежный, интерпретируемый и инженерно простой прокси дрифта предсказаний, но требует дисциплины в ретренинге challenger’а для избежания ложных срабатываний.
❤2👍1
Как твой сайт выглядит в глазах AI и почему бизнесу пора врубиться
RAG-поиск (Retrieval-Augmented Generation, генерация с подкреплением поиском) — это такая штука: AI сначала шерстит сайты, выцарапывает оттуда текстовые куски, которые хоть как-то подходят под вопрос, а потом лепит из них ответ. Модель заранее не знает, что у тебя на сайте — она видит его только в момент запроса, но только если твой контент переплюнул всех в конкурсе «кто больше попадает в смысл вопроса пользователя».
Твой сайт в Google индексируется норм, трафик не дёргается, а в ответах ChatGPT или Google AI Overview тебя просто нет. Конкуренту с текстом в два раза хуже цитируют. Что на самом деле решает, заметит ли тебя AI или пролетит мимо?
Читать далее
👉 Data Science | Machinelearning [ru]
RAG-поиск (Retrieval-Augmented Generation, генерация с подкреплением поиском) — это такая штука: AI сначала шерстит сайты, выцарапывает оттуда текстовые куски, которые хоть как-то подходят под вопрос, а потом лепит из них ответ. Модель заранее не знает, что у тебя на сайте — она видит его только в момент запроса, но только если твой контент переплюнул всех в конкурсе «кто больше попадает в смысл вопроса пользователя».
Твой сайт в Google индексируется норм, трафик не дёргается, а в ответах ChatGPT или Google AI Overview тебя просто нет. Конкуренту с текстом в два раза хуже цитируют. Что на самом деле решает, заметит ли тебя AI или пролетит мимо?
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3
Пять багов в Python-коде для LLM — найдешь сам?
Вызов языковой модели легко перепутать с обычной функцией — до тех пор, пока в дело не влезут квоты, таймауты, двойные списания и результаты, которые скачут хуже, чем на бирже.
Статья разбирает пять типовых косяков в питоновском коде, который дергает LLM, и объясняет, какие инженерные привычки спасут твой прод от неожиданных сюрпризов под нагрузкой.
Читать далее
👉 Data Science | Machinelearning [ru]
Вызов языковой модели легко перепутать с обычной функцией — до тех пор, пока в дело не влезут квоты, таймауты, двойные списания и результаты, которые скачут хуже, чем на бирже.
Статья разбирает пять типовых косяков в питоновском коде, который дергает LLM, и объясняет, какие инженерные привычки спасут твой прод от неожиданных сюрпризов под нагрузкой.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Аппроксимация оптимального порога бинаризации признаков в GBDT через дифференцируемую оценку информационного выигрыша
Классические GBDT ищут точки разбиения перебором на каждом узле. Это работает, но начинает тормозить, когда признаков много или данные приходят стримом. Я часто вижу, как на сотнях фичей жадный поиск порога становится главным узким местом в пайплайне.
Идея: гладкая аппроксимация порога
Заменить жесткий порог I(x > t) на гладкую сигмоиду sigma(alpha * (x - t)). Крутизна alpha управляет тем, насколько эта штука похожа на ступеньку. Теперь информационный выигрыш -- дифференцируемая функция от t. Можно гонять градиент и не перебирать варианты.
Пример на PyTorch:
Практические советы и trade-offs
-- Высокий alpha ближе к ступеньке, но градиенты становятся резкими -- без регуляризации будете ловить NaN. Рекомендую добавлять L2 на t или использовать gradient clipping.
-- Метод вывозит на разреженных задачах или признаках вроде текстовых эмбеддингов, где переборные пороги просто не имеют смысла. Например, для фичей с низкой entropy по классам перебор теряет время на бесполезные кандидаты.
-- В гибридных подходах типа NGBoost такое ускоряет обучение: не надо ждать, пока дерево переберет все варианты. Но не ждите gain-to-gain эквивалентности с дискретным разбиением -- это trade-off за скорость.
Предупреждение о типичной ошибке
Ошибка: думать, что alpha можно сделать бесконечно большим. Это приводит к взрыву градиентов и потере дифференцируемости. Держите alpha в диапазоне 5-20, и всегда проверяйте стабильность loss. При малом alpha аппроксимация грубая -- проигрываете в точности. Компромисс обычно есть, и он оправдывает себя по скорости.
Для тех, кто хочет глубже:
-- "Differentially Private GBDT with Smooth Thresholds" (2022) -- связь с приватностью и градиентами.
-- "XGBoost with Continuous Gradient" -- модификации от сообщества.
Вывод: Гладкая аппроксимация порога в GBDT -- это инженерный компромисс между точностью и скоростью, который критически важен для production ML с высокоразмерными или стриминговыми данными.
Классические GBDT ищут точки разбиения перебором на каждом узле. Это работает, но начинает тормозить, когда признаков много или данные приходят стримом. Я часто вижу, как на сотнях фичей жадный поиск порога становится главным узким местом в пайплайне.
Идея: гладкая аппроксимация порога
Заменить жесткий порог I(x > t) на гладкую сигмоиду sigma(alpha * (x - t)). Крутизна alpha управляет тем, насколько эта штука похожа на ступеньку. Теперь информационный выигрыш -- дифференцируемая функция от t. Можно гонять градиент и не перебирать варианты.
Пример на PyTorch:
def differentiable_gain(x, y, t, alpha=10):
weights = torch.sigmoid(alpha * (x - t))
left_weight = weights.mean()
right_weight = 1 - left_weight
left_var = (y * weights).sum() / (weights.sum() + 1e-8)
right_var = (y * (1 - weights)).sum() / ((1 - weights).sum() + 1e-8)
gain = left_weight * left_var + right_weight * right_var
return gain
t = nn.Parameter(torch.tensor(0.5))
optimizer = torch.optim.SGD([t], lr=0.01)
for _ in range(100):
loss = -differentiable_gain(x_data, y_data, t)
loss.backward()
optimizer.step()
Практические советы и trade-offs
-- Высокий alpha ближе к ступеньке, но градиенты становятся резкими -- без регуляризации будете ловить NaN. Рекомендую добавлять L2 на t или использовать gradient clipping.
-- Метод вывозит на разреженных задачах или признаках вроде текстовых эмбеддингов, где переборные пороги просто не имеют смысла. Например, для фичей с низкой entropy по классам перебор теряет время на бесполезные кандидаты.
-- В гибридных подходах типа NGBoost такое ускоряет обучение: не надо ждать, пока дерево переберет все варианты. Но не ждите gain-to-gain эквивалентности с дискретным разбиением -- это trade-off за скорость.
Предупреждение о типичной ошибке
Ошибка: думать, что alpha можно сделать бесконечно большим. Это приводит к взрыву градиентов и потере дифференцируемости. Держите alpha в диапазоне 5-20, и всегда проверяйте стабильность loss. При малом alpha аппроксимация грубая -- проигрываете в точности. Компромисс обычно есть, и он оправдывает себя по скорости.
Для тех, кто хочет глубже:
-- "Differentially Private GBDT with Smooth Thresholds" (2022) -- связь с приватностью и градиентами.
-- "XGBoost with Continuous Gradient" -- модификации от сообщества.
Вывод: Гладкая аппроксимация порога в GBDT -- это инженерный компромисс между точностью и скоростью, который критически важен для production ML с высокоразмерными или стриминговыми данными.
👍1🔥1
Роботы идут, но сначала — бастуем: сотрудники Hyundai встали на дыбу из-за страха остаться без работы
Южнокорейский гигант Hyundai Motor впервые столкнулся с тем, что его же работники устроили частичную забастовку на три дня — и всё из-за человекоподобных машин, которые вот-вот попрут на конвейер. Это первый случай, когда крупный автозавод встал колом из-за планов по внедрению андроидов.
Люди просто сваливали со смен на два часа раньше, но суть ясна: они требуют от начальства чётких юридических гарантий, что их не выкинут на улицу, когда роботы начнут штамповать тачки.
Читать далее
👉 Data Science | Machinelearning [ru]
Южнокорейский гигант Hyundai Motor впервые столкнулся с тем, что его же работники устроили частичную забастовку на три дня — и всё из-за человекоподобных машин, которые вот-вот попрут на конвейер. Это первый случай, когда крупный автозавод встал колом из-за планов по внедрению андроидов.
Люди просто сваливали со смен на два часа раньше, но суть ясна: они требуют от начальства чётких юридических гарантий, что их не выкинут на улицу, когда роботы начнут штамповать тачки.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍1🐳1
Как втолковать нейросетям графики: ChartNet от MIT
Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже.
Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить.
Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный.
Читать далее
👉 Data Science | Machinelearning [ru]
Йо, Хабр! Тут Павел, ML-инженер и просто человек, который копается в AI. Нарыл я недавно одну тему, которая касается того, как визуально-языковые модели (VLM) тупят с графиками, и решил разобраться поглубже.
Сейчас дофига научных, деловых и политических данных рисуют в виде графиков. Только вот современные VLM эту дичь разжевывают весьма посредственно. Почему? Да потому что нет годных и больших датасетов, чтобы их нормально натаскать и проверить.
Пацаны из MIT и IBM Research придумали выход — ChartNet. Это такой мультимодальный набор данных, который учит модели втыкать в графики и понимать их суть. Глянем, что это за зверь и насколько он реально годный.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM