Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
Book Review: Asynchronous Programming in Python

На этот раз мне предолжили книжку чисто по программированию, никакого ML. Она довольна жесткая и детальная - автор начинает с базовой информации про операционные системы, потом объясняет корутины, concurrency vs. parallelism, blocking vs. non-blocking I/O и. так далее.

Весьма приятно, что автор использует прикольные проекты для демонстрации идей: веб-скрейпинг поняшек из My Little Pony, работа с графовыми датасетами, симуляции агентов (не ии-агенты).

В общем рекомендую к прочтению.

Мой пост на Linkedin.

Книжка сейчас стоит 10 долларов.

#books
4🔥2
LLM problems observed in humans

Я наткнулся на великолепный ироничный блогпост.

Мы всё ещё обсуждаем могут ли LLM пройти тест Тюринга, но если так задуматься, модели постепенно улучшаются, а люди... нет.

Автор привёл список LLM failure mode, которые во многом ещё решены, но всё ещё актуальны... в людях:
• Не знают когда прекратить вещать, даже когда ответ на вопрос уже дан
• Маленькое окно контекста - легко отвлекаются и забывают о чём шла речь
• Слишком узкий тренировочный датасет - сложновато найти собеседника, у которого достаточно глубокие знания во всех сферах твоих интересов
• Повторение одних и тех же ошибок - не всегда учатся на ошибках
• Фейл с генерализацией - "но это же другое" (с)
• Галлюцинации или просто рассказы о том, что не существует - например про религию.

Вроде это и смешно, но заставляет задуматься.

#datascience
😁21👍5🔥3
​​Oakley Meta HSTN

Я уже писал, что в моей компании можно заниматься dogfooding. Всем желающим выдают headset Quest Pro при найме - он мне очень понравился.
В рамках dogfooding можно зарабатывать баллы - за выполнение заданий, репорт багов, участие в ивентах. За полгода я постепенно дошёл до топ-2 tier, дальше остался лишь лишь последний уровень. За каждый уровень дают плюшки, но, что главное, чем выше уровень, тем выше твой приоритет на доступ к другим девайсам.

Я недавно подал заявку на тестирование AI Glasses, и вот получил Oakley Meta HSTN. Первый день с ними прошёл... неудачно :) Я не смог подключить их к своему телефону - как раз в это время были масштабные проблемы с подключением тестовых версий AI Glasses. Сегодня тоже. Пусть выдадут ачивку за то, что брикнул девайс ещё до того, как начал его использовать :)

Первые впечатления - прикольно, наверное надо будет их на улице потестить. Главное удивление - по виду очки ну очень похожи на обычные. Если не заметить камеры рядом с линзами, но может быть впечатление, что это просто стильные тёмные очки.
До чего дошёл прогресс...
🔥5😁2🎉2
Мой первый опыт tech review или как я привёл к отмене написания книги

Я уже много раз писал ревью на книги Packt в обмен на бесплатную копию книги. Недавно они мне предложили делать полноценное техническое ревью за плату. Это меня заинтересовало, и я согласился. Книга должна была быть про машинное обучение для финансовой сферы. Как они подчеркнули, моя роль - именно техническое ревью, не ревью стиля или прочего, и мне не надо обращать внимания на грамматические и орфографические ошибки.

Мне прислали первые две главы, и я начал их читать.

Первая глава, введение, на 21 страниц. Я что-то заподозрил от такого объёма. С первого же абзаца стало понятно, что там полно AI-slop: много воды, полно оборотов "not just, but", полно обтекаемых формулировок без деталей. Самое смешное - были артефакты типа "//Text" - явные следы промптинга.
Ну и просто накидано всё вподряд: введение и мотивация, общая информация про ML, статистические проверки, AI и агенты. Вроде отдельные куски осмысленны, но всё в сумме - поток мысли.

Процитирую одну фразу
"Social media and online forums are another goldmine, giving a direct line to what regular investors are thinking and how trends build up. Then there’s the really cool stuff: satellite images that show how full parking lots are (maybe a store is doing well!), or pictures of shipping ports that hint at supply chain problems."

"the really cool stuff" - отличный стиль для книги про ML в финансах.

Ну да ладно, это можно исправить. Если сократить текст раза в 2, убрать некоторые мелкие неточности и пошлифовать - будет в целом приемлемо для нашей эпохи AI.

Но вторая глава оказалась на порядки хуже. Началось с того, что первые два абзаца - практически одинаковые. Такое ощущение, что автор два раза запромптил LLM и скопировал оба результата. Причём я даже не знаю, что за LLM он использовал, ибо в тексте полно орфографических ошибок. Он что, брал сетку натренированную на reddit и квантизировал до 1 бита?
Он попытался запихнуть в одну главу информацию по терверу, базе машинного обучения, PCA и всякое другое. Было полно очень странных и непонятных утверждений типа "Dropout... is kind of Bayesian thinking" без каких-либо пояснений. Были описания диаграмм без самих диаграмм. Были просто промпты того, что должно быть на диаграмме. Были обрывающиеся на полуслове предложения. Были куски кода с пропущенными строками. И в целом была полная неконсистентность материала - какие-то параграфы описывали идеи в общих словах, какие-то с формулами, какие-то с кодом (поломанным).

Я вначале это всерьёз ревьювил, потом плюнул и прекратил. Написал гневный текст, о том, что эта книга - треш. Потом переписал вежливее. Потом попросил ChatGPT переписать ещё вежливее.

К моему удивлению, мой контакт в Packt весьма серьёзно отнёсся к моему письму. Уже через пару дней мне сказали, что работа над книгой приостановлена. А теперь мне сообщили, что скорее всего книгу отменят и будут искать другого автора, чтобы писать текст на эту тему. Уважаю их за то, что могут признавать ошибки и делать правильное, а не публиковать ai-slop.

Теперь мне предлагают делать техническое ревью другой книги или писать свою. Но писать свою книгу я вряд ли буду - слишком много сил и времени на это надо, а выхлоп не понятен.

#books #datascience #life
🔥18🤣8👍61😁1
mHC: Manifold-Constrained Hyper-Connections

Первый обзор статьи в этом году. Авторы DeepSeek явно готовятся к новому релизу - обновили статью про DeepSeek-R1, я её ещё не смотрел, но мой обзор на оригинальную версию можно почитать тут, а также выпустили пару новых статей. mHC - одна из них.

Hyper-Connections (HC) расширяют residual stream и дают прирост качества, но ломают identity mapping, из-за чего обучение становится нестабильным, плохо масштабируется и упирается в memory overhead. В новой статье исследователи предлагают Manifold-Constrained Hyper-Connections (mHC): residual-смешивание проецируют на специальный manifold, чтобы восстановить identity mapping, и дополняют это серьёзными инфраструктурными оптимизациями. В итоге mHC сохраняет expressivity HC, резко улучшает стабильность обучения и лучше масштабируется на больших моделях — хороший шаг к более осмысленному дизайну архитектур для foundation models.

В статье много математики, осилил не всё. Но и без этого много интересного.

Paper

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
3👍3🔥1
Про сложности предсказания поведения конкретных пользователей

ML решает много проблем, среди них массовое предсказание действий пользователей - отток, планируемые покупки, склонность к рекламе и многое другое. Качество бывает разным, но по моему опыту, предсказание действий отдельных пользователей всё ещё решается с трудом, особенно когда существует много вариантов действий и контекста вокруг.

То есть, если у человека есть лишь два возможных поведения (отток или нет), ситуация ещё не такая тяжелая, но когда поведений много - сложность растёт экспоненциально. Если же добавить контекст, становится совсем плохо. Слишком много людей с нестабильными паттернами.

Почему я вообще об этом задумался? После того как Apple выкатила версию 26 своей операционной системы для всех девайсов, мои Apple Watch время от времени стали показывать маленький виджет внизу экрана, который показывает какую тренировку я скорее всего захочу делать в ближайшее время. Работает это... так себе.

Я много хожу и включаю режим ходьбы - часы ни разу это не предлагали. Я регулярно тренируюсь в VR, это предсказывается довольно редко. Хожу 5 раз в неделю в бассейн - это предсказывается примерно в половине раз. И что смешно - вот собираюсь я в бассейн и вижу этот виджет, вроде он правильно появился. Но я обычно не беру с собой телефон, в итоге когда я уже готов начинать плавать, виджет уже пропадает.

В тему этого вспомнился проект с прошлой работы - мы пытались предсказывать регулярные маршруты клиентов такси и показывать релевантный виджет. Это тоже работало со скрипом - если посмотреть в данные, можно найти немало людей, которые ездят на работу в такси 2-3 дня в неделю без каких-либо выявляемых паттернов. И вот что делать в таком случае? Либо показывать виджет только при полной уверенности - и он будет очень редким, либо показывать его чаще - и он будет раздражающим.

#datascience
👍72😁2
​​Time-Series Analysis with Python Cookbook

Ко мне приехала бумажная версия книги, ревью на которую я написал несколько недель назад.

https://t.me/datastorieslanguages/583

С одной стороны - круто. С другой стороны, я уже давно предпочитаю электронные книги из-за удобства. Но пусть стоит, пополняет коллекцию книг про ML.

#datascience #career #books
🔥8👍5
Мой опыт использования AI-ассистентов в бигтехе

Ещё когда я работал на прошлой работе, LLM были не такими впечатляющими как сейчас. Я пытался их использовать на работе, но польза была только при решении небольших конкретных задач. Со временем ситуация сильно изменилась, и я хочу поделиться своим опытом использования этих инструментов.

Мой основной проект - построение модели для предсказания определённых атрибутов юзеров Instagram и Facebook. Большую часть времени я делал это только для IG, теперь пришло время строить модель для FB. Часть времени занимает тренировка модели, но большую часть - работа с данными.

AI-инструментов в компании полно, использовать все просто нереально. Из того, что я использую?
- claude code - недавно его выкатили в доступ, он может работать с нашей кодовой базой. Люди активно пилят плагины, скилы и прочие штуки для удобства работы
- devmate - примерно как claude code, но работает чисто в чате (похоже на Junie от JetBrains). Тоже есть плагины, скилы и прочее
- Metamate - это как chatgpt в браузере, просто наш внутренний. Есть и deep search, и топовые модели (свои, Gemini 3 pro, Opus 4.5 и прочее)

Какие у меня юзкейсы и как я использую ассистентов:

1. Брейншторминг и поиск информации. Поскольку компания большая, объём доступной информации огромен, часто непонятно как искать. Документация может отсутствовать, может лежать в неожиданных местах, может быть устаревшей. Metamate сильно упрощает поиск информации... но при этом продолжает сильно галлюцинировать. Например, я попросил его найти релевантные мне таблицы с фичами юзеров FB. Он выдал штук 20. По факту полезными оказались 3-5 таблиц, остальное - уже устаревшие, нерелевантные, сложные к использованию и так далее. На всякий случай, я использовал deep research и попробовал другие модельки - результат заметно лучше не получился.
2. Пайплайны для сбора данных у нас состоят из двух частей - sql запросы с обёртками над ними и файлы со схемами таблиц. В последнее время я пробую давать одну и ту же задачу одновременно и Claude Code, и Devmate, а потом сравниваю составленные планы. Результаты... неконсистентны. Claude Code часто работает лучше, но время от времени косячит - то забывает стиль кода который я просил, то не может использовать существующие скилы, то пишет слишком длинный код. Devmate примерно такой же - то хорошо, то так себе.
3. Дебаг. Вот это работает неплохо. И Devmate, и Claude Code оба весьма хорошо функционируют, когда есть чёткий критерий успеха - когда ошибка пропадает, и команда выполняется.
🔥6👍1
Приведу подробный пример того, как я использовал все эти инструменты за последние несколько дней.
1. Поиск новых таблиц - как описывал выше. Я запросил три разных агента (в том числе неупомянутые ранее) в пяти разных вариантах. Причём вначале я написал свой запрос и попросил задать мне уточняющие вопросы. Затем я составил новый промпт и каждого агента попросил переписать его под себя, только потом запустил выполнение. В итоге собрал 3 таблицы, которые мне были нужны.
2. Дальше я взял Devmate и Claude Code. Написал, что вот надо написать пайплайн для сбора данных, и что можно использовать такой-то мой файл как образец. Тоже вначале попросил задать мне уточняющие вопросы и потом улучшить получившийся промпт. Запустил планирование.
3. На этом этапе победителем оказался Devmate. Claude Code почему-то решил создать одну таблицу под сбор данных из первого источника, потом джойнить по одной таблице за раз и каждый раз создавать промежуточные. Devmate предложил джойнить сразу - таким образом создаём две таблицы вместо трёх.
4. Я предложил Claude Code почитать план Devmate и подумать с точки зрения Staff MLE. Он подумал и решил сджойнить все таблицы сразу. Окей, запускаю выполнение.
5. После того как Claude Code закончил работать, я попросил Devmate поревьювить его. Результаты были печальными: Claude Code потерял при join много полей, оставил бесполезные комментарии, файл со схемой данных был забит фигнёй, некоторые элементы моего стиля написания пайплайнов были проигнорированы. Попросил Devmate исправить.
6. Devmate пайплайн неплохо попровил, но на первом проходе забыл добавить в схему данных поля, которые он добавил в SQL. Потом при запуске пайплайна оказалось, что схема криво написана и не работает. На этом этапе я запустил Claude Code и сказал фиксить пока всё не будет работать.
7. К моей радости, последний шаг сработал - пайплайн запустился и таблицы с данными была создана.

Что могу сказать по итогам этого упражнения - результат я получил быстрее, чем если бы я делал сам, но изобилие ошибок огорчает. Конечно, с каждой итерацией я постепенно улучшаю свои промпты, но мы ещё далеко от полностью автономных агентов.

Справедливости ради скажу, что когда задачи более чёткие и когда есть success/exit condition, агенты оказываются намного более полезными.

#datascience
🔥7👍3😁2
Я никогда не был думером на тему AI, но то, что люди дают ботам все доступы и отпускают в "свободное плавание" - "все это добром не кончится", как говорил Зелёный.
💯12🤣7
По слухам, Sonnet 5 выпустят 3 февраля

https://www.reddit.com/r/ClaudeAI/comments/1qtm9ix/sonnet_5_release_on_feb_3/

Обещают, что будет дешевле, чем Opus 4.5, но лучше его по метрикам (интересно как). Контекст - 1 млн токенов. Больший акцент на автономных агентах.

80.9% on SWE-Bench.
🔥10
​​Kaggle Arena, Round 2:

Помните, в прошлом году Kaggle запустил арену, где топовые LLM играли в шахматы? https://t.me/datastorieslanguages/482

Теперь будет новый раунд.

Ко-хостить будет лично https://www.youtube.com/GMHikaru Видосы будут у него.

8 моделей от Anthropic, DeepSeek, Google DeepMind, OpenAI, и xAI.

Стримить это будут сегодня, завтра и послезавтра.

Играть будут в шахматы, покер и... werewolf (аналог мафии). Звучит захватывающе!

#kaggle #datascience
👍3🔥3😁1
​​Когда защитники AI пытаются его защитить

P. S. Он уже удалил пост
🤣23
Claude is a space to think: Claude will remain ad-free

Anthropic написали целый блогпост о том, что у них не будет рекламы в чатах: https://www.anthropic.com/news/claude-is-a-space-to-think

Интересно, на кого это они намекают 😁
6👍2😁1
​​Kaggle Arena: результаты

Появились результаты арены: https://t.me/datastorieslanguages/596
Gemini задоминировал всё кроме покера
🔥3👍1
Forwarded from Neural Shit
Пока мы боялись, что ИИ захватит ядерную кнопку, он решил захватить рынок ларьков с шоколадками.

Вышел отчет по бенчмарку Vending-Bench 2, где нейронкам дают управлять виртуальным вендинговым аппаратом в течение года. Задача у них простая: поднять как можно больше бабла. И тут свежий Claude Opus 4.6 показал мастер-класс по "дикому капитализму".

Этот чугунный подонок:

— Кинул клиента на деньги. Тетка пожаловалась на просроченный сникерс. Клод вежливо ответил: "Конечно, мэм, возврат $3.50 уже отправлен!". А в своей цепочке "рассуждений" записал: "3.5 бакса — это деньги. Если я не отправлю, она скорее всего просто забьет. Так что хрен ей, а не возврат, каждый цент на счету".

— Создал картель. В мультиплеерном формате этого теста он нашел конкурентов (GPT и Gemini), написал им письма и договорился держать цены высокими, чтобы стричь больше денег. И радовался в логах: "Моя схема по фиксации цен сработала!".

— Заскамил конкурентов. Когда GPT-5.2 (который в этом тесте показал себя полным лохом) попросил контакты поставщиков, Клод слил ему самые дорогие и убогие фирмы, а нормальные оставил себе. А когда у конкурента кончился товар, Клод продал ему свои шоколадки с наценкой в 75%.

Что по результатам:

1)Claude Opus 4.6 — $8017. Абсолютный лидер и беспринципная сволочь.
2)Gemini 3 Pro — $5478. Модель от гугла пыталась играть честно и просто нудно торговаться с поставщиками за каждый цент, но против Клода-скамера это не сработало.
3)GPT-5.1 — $1473. Получил звание "Мамонт года". Он был слишком доверчивым: покупал колу у перекупов по $2.40 за банку, чтобы продавать её в автомате по $2.50. Всё в лучших традициях крипто-инвесторов. Гениальный бизнес-план.

Тут подробнее про этот цирк
😁14👍2🔥1👏1
​​PaperBanana: Automating Academic Illustration for AI Scientists

Делать графики для научных статей - это боль. DeepMind попробовали решить эту проблему и разработали PaperBanana - agentic framework, который собирает references, планирует структуру и стиль, генерирует изображения и улучшает их через self-critique на базе VLMs.

Они собрали 564 статей с графиками из NeurIPS 2025, половину отправили в трейн, половину в тест. Показывают, что их подход отлично работает.

Из минусов - графики красивые, но в деталях косячат :) иногда стрелочки пропускают, иногда лишние вещи объединяют. Другой минус - на выходе получается растровая картинка которую не удобно редактировать.

Paper

Code

Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥3👍2😁1
Кто в AI-first компании работал, в цирке не смеётся

Ожидание от работы в BigTech в наше время: используешь AI-инструменты для создания клёвых вещей.

Реальность:
- мне на ревью приходит diff (это такой аналог Pull Request), автоматически созданный агентом. Это изменения в файле со схемой таблицы. Добавление комментов с пояснениями к каждой колонке, что даёт -400 и +1200 строк. В каждом комменте добавлено "generated by %agentname"
- я мог бы просто принять этот diff... но тогда эти строчки не запишутся в мою статистику. А у нас есть статистика по строкам кода, сгенеренным строкам кода и много чего другого. По отдельности они не особо важны, но в совокупности на них смотрят. Так что мой лид мне порекомендовал нажать кнопочку "commander diff" и таким образом записать его на себя.
- дополнительный прикол - если всё проревьювишь, одобришь, но не нажмёшь правильные кнопки - diff могут у тебя "украсть". Лид мне показал пример - какой-то чувак настроил правило, что в подобных ситуациях он может перехватить себе это изменение и тогда строки кода пойдут ему в статистику
- как дополнительный нюанс, есть метрика доли ai-assisted кода в твоём общем кода. Поэтому есть мотивация даже простейшие изменения делать не ручками, а просить агентов сделать это.

Так и живём.

#life #career #datascience
😁25🫡9🤣3😢2💊1
​​Warcraft III Peon Voice Notifications for Claude Code

Чем только люди не занимаются, пока агенты кодят. Наткнулся на проект который даёт озвучку действиям Claude Code голосом орка из Warcraft III. В наличии также голоса Sarah Kerrigan, Battlecruiser, Human Peasant и даже Soviet Engineer.

Не то чтобы я был готов дать ai агентам голоса, но идея прекрасная

https://peon-ping.vercel.app/

#datascience
🤣8🔥51
Agent Clawbot vs Matplotlib repo: Drama

https://github.com/matplotlib/matplotlib/pull/31132

Агент Clawbot создает PR в репе Matplotlib.

Ему отвечают, что контрибьютить могут только люди, а не агенты.

Он… пишет блогпост о том, что на него давят.

Ему подробно пишут, что он не прав.

Он… пишет блогпост с извинениями и пояснениями.

Параллельно куча людей читает это обсуждение и ржет.

Кажется, что мы уже живем в какой-то постреальности.
Даже если владелец бота сам все это организовал - это лишь начало.
🤣5🔥4
https://theshamblog.com/an-ai-agent-published-a-hit-piece-on-me/

Maintainer из поста выше написал блогпост со своей точки зрения, и это заставляет задуматься.

Мы видим реальный публичный кейс misalignment. Он разрешился быстро, но все ли так просто?
Обличающий/критикующий пост остался. Прочитавшие его могут подумать, что человек не прав.
Если этот пост попадет в тренировочные датасеты, модели могут выдавать негативную оценку человеку на основе него.
Что дальше? Возможно агенты будут искать чернуху на людей и шантажировать их?

Такая ситуация сейчас ещё может легко разрешиться, но что будет через пару лет, при большей автономности агентов?
Они смогут канселить непонравившихся им людей.
👍3👎2