Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
Claude is a space to think: Claude will remain ad-free

Anthropic написали целый блогпост о том, что у них не будет рекламы в чатах: https://www.anthropic.com/news/claude-is-a-space-to-think

Интересно, на кого это они намекают 😁
6👍2😁1
​​Kaggle Arena: результаты

Появились результаты арены: https://t.me/datastorieslanguages/596
Gemini задоминировал всё кроме покера
🔥3👍1
Forwarded from Neural Shit
Пока мы боялись, что ИИ захватит ядерную кнопку, он решил захватить рынок ларьков с шоколадками.

Вышел отчет по бенчмарку Vending-Bench 2, где нейронкам дают управлять виртуальным вендинговым аппаратом в течение года. Задача у них простая: поднять как можно больше бабла. И тут свежий Claude Opus 4.6 показал мастер-класс по "дикому капитализму".

Этот чугунный подонок:

— Кинул клиента на деньги. Тетка пожаловалась на просроченный сникерс. Клод вежливо ответил: "Конечно, мэм, возврат $3.50 уже отправлен!". А в своей цепочке "рассуждений" записал: "3.5 бакса — это деньги. Если я не отправлю, она скорее всего просто забьет. Так что хрен ей, а не возврат, каждый цент на счету".

— Создал картель. В мультиплеерном формате этого теста он нашел конкурентов (GPT и Gemini), написал им письма и договорился держать цены высокими, чтобы стричь больше денег. И радовался в логах: "Моя схема по фиксации цен сработала!".

— Заскамил конкурентов. Когда GPT-5.2 (который в этом тесте показал себя полным лохом) попросил контакты поставщиков, Клод слил ему самые дорогие и убогие фирмы, а нормальные оставил себе. А когда у конкурента кончился товар, Клод продал ему свои шоколадки с наценкой в 75%.

Что по результатам:

1)Claude Opus 4.6 — $8017. Абсолютный лидер и беспринципная сволочь.
2)Gemini 3 Pro — $5478. Модель от гугла пыталась играть честно и просто нудно торговаться с поставщиками за каждый цент, но против Клода-скамера это не сработало.
3)GPT-5.1 — $1473. Получил звание "Мамонт года". Он был слишком доверчивым: покупал колу у перекупов по $2.40 за банку, чтобы продавать её в автомате по $2.50. Всё в лучших традициях крипто-инвесторов. Гениальный бизнес-план.

Тут подробнее про этот цирк
😁14👍2🔥1👏1
​​PaperBanana: Automating Academic Illustration for AI Scientists

Делать графики для научных статей - это боль. DeepMind попробовали решить эту проблему и разработали PaperBanana - agentic framework, который собирает references, планирует структуру и стиль, генерирует изображения и улучшает их через self-critique на базе VLMs.

Они собрали 564 статей с графиками из NeurIPS 2025, половину отправили в трейн, половину в тест. Показывают, что их подход отлично работает.

Из минусов - графики красивые, но в деталях косячат :) иногда стрелочки пропускают, иногда лишние вещи объединяют. Другой минус - на выходе получается растровая картинка которую не удобно редактировать.

Paper

Code

Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥3👍2😁1
Кто в AI-first компании работал, в цирке не смеётся

Ожидание от работы в BigTech в наше время: используешь AI-инструменты для создания клёвых вещей.

Реальность:
- мне на ревью приходит diff (это такой аналог Pull Request), автоматически созданный агентом. Это изменения в файле со схемой таблицы. Добавление комментов с пояснениями к каждой колонке, что даёт -400 и +1200 строк. В каждом комменте добавлено "generated by %agentname"
- я мог бы просто принять этот diff... но тогда эти строчки не запишутся в мою статистику. А у нас есть статистика по строкам кода, сгенеренным строкам кода и много чего другого. По отдельности они не особо важны, но в совокупности на них смотрят. Так что мой лид мне порекомендовал нажать кнопочку "commander diff" и таким образом записать его на себя.
- дополнительный прикол - если всё проревьювишь, одобришь, но не нажмёшь правильные кнопки - diff могут у тебя "украсть". Лид мне показал пример - какой-то чувак настроил правило, что в подобных ситуациях он может перехватить себе это изменение и тогда строки кода пойдут ему в статистику
- как дополнительный нюанс, есть метрика доли ai-assisted кода в твоём общем кода. Поэтому есть мотивация даже простейшие изменения делать не ручками, а просить агентов сделать это.

Так и живём.

#life #career #datascience
😁25🫡9🤣3😢2💊1
​​Warcraft III Peon Voice Notifications for Claude Code

Чем только люди не занимаются, пока агенты кодят. Наткнулся на проект который даёт озвучку действиям Claude Code голосом орка из Warcraft III. В наличии также голоса Sarah Kerrigan, Battlecruiser, Human Peasant и даже Soviet Engineer.

Не то чтобы я был готов дать ai агентам голоса, но идея прекрасная

https://peon-ping.vercel.app/

#datascience
🤣8🔥51
Agent Clawbot vs Matplotlib repo: Drama

https://github.com/matplotlib/matplotlib/pull/31132

Агент Clawbot создает PR в репе Matplotlib.

Ему отвечают, что контрибьютить могут только люди, а не агенты.

Он… пишет блогпост о том, что на него давят.

Ему подробно пишут, что он не прав.

Он… пишет блогпост с извинениями и пояснениями.

Параллельно куча людей читает это обсуждение и ржет.

Кажется, что мы уже живем в какой-то постреальности.
Даже если владелец бота сам все это организовал - это лишь начало.
🤣5🔥4
https://theshamblog.com/an-ai-agent-published-a-hit-piece-on-me/

Maintainer из поста выше написал блогпост со своей точки зрения, и это заставляет задуматься.

Мы видим реальный публичный кейс misalignment. Он разрешился быстро, но все ли так просто?
Обличающий/критикующий пост остался. Прочитавшие его могут подумать, что человек не прав.
Если этот пост попадет в тренировочные датасеты, модели могут выдавать негативную оценку человеку на основе него.
Что дальше? Возможно агенты будут искать чернуху на людей и шантажировать их?

Такая ситуация сейчас ещё может легко разрешиться, но что будет через пару лет, при большей автономности агентов?
Они смогут канселить непонравившихся им людей.
👍3👎2
Kimi k2.5 Review: Native Multimodality and Agent Swarms at 1 Trillion Parameters

У меня дошли руки почитать Kimi K2.5, и я считаю, что это один из самых интересных agentic + multimodal релизов за последнее время.

Что оказалось самым интересным

— Это native multimodal модель: текст и vision обучаются совместно с самого начала, а не «прикручиваются» в конце.
— Визуальный RL улучшает текстовое рассуждение - это неожиданно.
— Agent Swarm — обучаемая система параллельных агентов, которая мощно снижает latency (4–5ч) и масштабирует сложные задачи.

Учитывая, что в Claude Code уже завезли Agent Swarm и я их пощупал ручками, мне было любопытно почитать откуда они взялись.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥5👍2
🙈7😁2
​​Wake up, the new social media dropped!
😁9
​​Even AI needs validation, appreciation and praise
😁43
Где разработчику искать вакансии в зарубежных компаниях?

Ответ знают Dev & ML Connectable Jobs в международных стартапах с русскоязычными фаундерами и командами. В своем канале они публикуют информацию о бэкграунде фаундеров, размере команды и инвестициях, а также делятся прямыми контактами HR для отклика.

Senior AI Solutions Engineer в AI Digital
Inference Engineer в Mirai
Senior ML Engineer в inDrive
Team Lead / Senior ML Engineer в Rafeeq
Senior Machine Learning Engineer в Podcastle

больше вакансий — в Dev Connectable Jobs
😁6🆒4👍2
​​Обзор соревнований по ML за 2025 год

Есть такая платформа - https://mlcontests.com/, там можно увидеть список актуальных идущих соревнований по ML. Автор выускает ежегодный обзор по соревнованиям. Вот ссылка на мой пост про обзор 2023. 2024 я как-то пропустил, но вот сейчас увидел обзор за 2025: https://mlcontests.com/state-of-machine-learning-competitions-2025/?ref=mlcr25

Из интересного:
• В табличных соревнованиях всё ещё царят бустинги, но нейронки всё активнее используют в блендинге/стакинге
• Некоторые компании (не будем тыкать пальцами, но мы-то знаем) дают своим людям резиновое железо для соревнований. Например, победители одной соревы поделились, поделились тем, что тренировали 48 hours на 512 H100.
• Эпоха BERT в основном прошла, теперь люди активно используют Qwen2.5 и 3
• В соревнованиях по Computer Vision впервые доля решений с транмформерами превзошла долю решений с CNN
• В соревнованиях по аудио в основном используют затюненый Whisper

В отчёте ещё много всего интересного, рекомендую почитать.

#kaggle #datascience
👍8🔥51😁1
​​Лондон и безопасность

По интернету ходят мемы о том, что в Лондоне надо ходить в кольчуге, чтобы защищаться от ножевых преступлений. Это спорный момент, ибо надо разделять две вещи:

1. Количество убийств/ранений ножами заметно упало за последние годы, это показывает разнообразная статистика. В 2003 началось падение, в 2019 был новый пик, теперь количество преступлений упало до уровня 2014 года, что хорошо.
2. Количество преступлений с острым оружием растёт. С одной стороны, она в каком-то смысле завышена - в эту категорию попадает даже срезание бирок с товаров в магазине, но нехилая доля - вооруженные ограбление.

Это является проблемой, но не так сильно влияет на повседневную жизни. Гораздо хуже распространение shoplifting и выхватывание телефонов из рук. Есть много разной статистики, обещают улучшение борьбы с этим, но факт остаётся фактом - шанс получить телефон обратно составляет лишь 1-2%. Видел цифры, что крадут 70-80к телефонов в год. В итоге люди стремаются с такого, ходят с привязанными телефонами и так далее.

Причём если кому-то удаётся задержать вора, есть шансы, что этот вор пожалуется в полицию на насилие, были случаи.

Несколько недель назад я увидел, как у мужика в трёх метрах от меня так выхватили телефон из рук. Велосипедист ещё издевательски посмотрел на него через плечо.

А вчера я сам попал в такую ситуацию. Шёл в Shoreditch Park, по дорожке на двух людей. Вокруг люди ходят. Вдруг дёрг - и велосипедист вырывает у меня телефон и уматывает с ним. Догнать, естественно, нереально. Пришлось бежать домой, чтобы всё заблокировать. Основное мучение - менять пароли, блокировать доступы и карты и так далее. Плюс в телефоне была дубайская симка.

Подал заявление в полицию - они за 1 час его закрыли, за отсутствием возможностей найти преступника.

Единственный плюс - телефоны обычно крадут не ради доступа к информации, а чтобы перевезти в другие страны и разобрать на запчасти.

#life
😱15💔9🤣5💊1
​​Beyond Positional Bias: How DroPE Unlocks Zero-Shot Long Context in LLMs

Sakana DroPEd a new paper!

Кхм, в общем новая статья от Sakana.

Обычно для увеличения контекста в LLM используют разные трюки со скейлингом RoPE (YaRN, NTK и прочее). Они типа работают, но на задачах типа needle-in-a-haystack модели внезапно "не видят важную информацию глубоко в тексте.

И тут ресерчеры из Sakana придумали нечно интересное:
Позиционные эмбеддинги нужны, чтобы модель быстро обучалась, но именно они мешают zero-shot обобщению на длинные последовательности. Что если убрать их после претрейна и сделать короткую рекалибровку? Оказалось, что в результате модель начинает значительно лучше работать на длинном контексте

Причём это работает не только на маленьких моделях, но и на 1–7B параметров, с очень небольшим дополнительным бюджетом.

Звучит многообещающе.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥9👍3😁1
AI-adoption ускоряется на моих глазах

Пару дней назад я сидел, ждал пока Claude Code выполнит поставленную задачу и что-то задумался об AI-adoption.

Я стал использовать ChatGPT вскоре его появления, но в 2024 году это было скорее игрушкой. Иногда неплохо отвечало на вопросы, часто косячило. На работе практически не использовал, ибо в большинстве случаев было эффективнее делать вещи самому.

В 2025 году я по фану решил делать веб-игру. Это отдельная история, но если коротко, я вначале написал страниц 10 того, что хотелось бы иметь в игре, потом итеративно сделал приличный Design Document. На этом этапе Gemini Pro работало больше всего. Дальше я попросил Sonnet 3.7 написать код. На тот момент Claude Code я ещё не использовал, поэтому делал в браузере.
Модель выдала 50+ файлов, после получаса мелкий исправлений оно заработало. Вначале у меня было офигение и шок от того, что это сработало. Но довольно быстро увидел много проблем - кучи багов в интерфейсе, захардкоженные результаты вместо вычислений и много другого.

Когда я вышел на работу в BigTech летом 2025, мои коллеги говорили, что у нас есть внутренний AI-помощник, он может помочь искать информацию, но на большее рассчитывать не стоит. И не стоит ему полностью доверять - сильно галлюцинирует.

К осени 2025, внутренний ассистент постепенно стал более полезным и его можно было использовать для некоторых задач. Но и я, и большинство коллег предпочитали писать код сами.

Переломный момент, по моим ощущениям, наступил тогда, когда в компании выкатили Claude Code + Opus 4.5 в общий доступ. Люди стали пробовать... и им понравилось. Конечно, большой мотивацией делать это являлось то, что компания очень активно пушит использование AI-инструментов: и AI-driven impact, и просто их использование. Но всё равно заметно, что люди стали активно использовать Claude Code для рабочих задач. Плюс у нас есть много внутренних скилов, плагинов и прочего - они реально упрощают работу.

В этом году прям заметно, что больше кода генерится, больше всяких семинаров и ивентов про AI.

Последний пример: я всё никак не собрался попробовать OpenClaw, но вдруг увидел, что Oura Chief Medical Officer выложил репо для подключения Claw к данным Oura Ring. С помощью Claude Code я ща полчаса запустил это и попробовал. Любопытно (хотя не очень полезно), но меня вдруг осенила мысль, что если я опасаюсь проблем с безопасностью, я могу просто попросить Claude Code переписать код так, чтобы это был просто дашборд с аналитикой и прямое задавание вопросов Claude. До появления AI-ассистенов я бы даже и не подумал такое делать.

Значит ли это, что современные LLM могут всё? Далеко не так. Галлюцинаций всё ещё много, особенно при работе с внутренними ресурсами компании; анализ данных хорош, но генерация идей так себе; код пишут неплохо, но необходимо в деталях описывать что именно должно быть сделано. Прогресс продолжается и дальше будет удобнее, это не отрицаю. Но пока до автоматизации работы ещё очень далеко.

#datascience
👍15💊1
Oakley Meta HSTN. Часть 2.

Я уже писал, что мне выдали очки для dogfooding, но они не работали.
https://t.me/datastorieslanguages/586

Ну что ж, теперь я могу их использовать! Всего-то надо было подождать 4 недели и... замену :) Старые так и не получилось использовать, а вот новые заработали с первого раза.

На них прикольно делать фото и видео (особенно в Лондоне - не надо вытаскивать телефон и подвергать его опасности). Удивился, что через них можно даже можно музыку слушать. По идее его можно использовать с Meta AI в голосовом режиме для задавания вопросов. Другие функции особо не нужны.
2😁1
​​Anthropic: most of our code is AI-written!
Also Anthropic:
😁22🔥5