Data, Stories and Languages
3.42K subscribers
80 photos
11 videos
598 links
Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar

Персональный сайт: https://andlukyane.com/

Рекламу не публикую

Забустить канал можно тут: https://t.me/boost/datastorieslanguages
Download Telegram
Я никогда не был думером на тему AI, но то, что люди дают ботам все доступы и отпускают в "свободное плавание" - "все это добром не кончится", как говорил Зелёный.
💯12🤣7
По слухам, Sonnet 5 выпустят 3 февраля

https://www.reddit.com/r/ClaudeAI/comments/1qtm9ix/sonnet_5_release_on_feb_3/

Обещают, что будет дешевле, чем Opus 4.5, но лучше его по метрикам (интересно как). Контекст - 1 млн токенов. Больший акцент на автономных агентах.

80.9% on SWE-Bench.
🔥10
​​Kaggle Arena, Round 2:

Помните, в прошлом году Kaggle запустил арену, где топовые LLM играли в шахматы? https://t.me/datastorieslanguages/482

Теперь будет новый раунд.

Ко-хостить будет лично https://www.youtube.com/GMHikaru Видосы будут у него.

8 моделей от Anthropic, DeepSeek, Google DeepMind, OpenAI, и xAI.

Стримить это будут сегодня, завтра и послезавтра.

Играть будут в шахматы, покер и... werewolf (аналог мафии). Звучит захватывающе!

#kaggle #datascience
👍3🔥3😁1
​​Когда защитники AI пытаются его защитить

P. S. Он уже удалил пост
🤣23
Claude is a space to think: Claude will remain ad-free

Anthropic написали целый блогпост о том, что у них не будет рекламы в чатах: https://www.anthropic.com/news/claude-is-a-space-to-think

Интересно, на кого это они намекают 😁
6👍2😁1
​​Kaggle Arena: результаты

Появились результаты арены: https://t.me/datastorieslanguages/596
Gemini задоминировал всё кроме покера
🔥3👍1
Forwarded from Neural Shit
Пока мы боялись, что ИИ захватит ядерную кнопку, он решил захватить рынок ларьков с шоколадками.

Вышел отчет по бенчмарку Vending-Bench 2, где нейронкам дают управлять виртуальным вендинговым аппаратом в течение года. Задача у них простая: поднять как можно больше бабла. И тут свежий Claude Opus 4.6 показал мастер-класс по "дикому капитализму".

Этот чугунный подонок:

— Кинул клиента на деньги. Тетка пожаловалась на просроченный сникерс. Клод вежливо ответил: "Конечно, мэм, возврат $3.50 уже отправлен!". А в своей цепочке "рассуждений" записал: "3.5 бакса — это деньги. Если я не отправлю, она скорее всего просто забьет. Так что хрен ей, а не возврат, каждый цент на счету".

— Создал картель. В мультиплеерном формате этого теста он нашел конкурентов (GPT и Gemini), написал им письма и договорился держать цены высокими, чтобы стричь больше денег. И радовался в логах: "Моя схема по фиксации цен сработала!".

— Заскамил конкурентов. Когда GPT-5.2 (который в этом тесте показал себя полным лохом) попросил контакты поставщиков, Клод слил ему самые дорогие и убогие фирмы, а нормальные оставил себе. А когда у конкурента кончился товар, Клод продал ему свои шоколадки с наценкой в 75%.

Что по результатам:

1)Claude Opus 4.6 — $8017. Абсолютный лидер и беспринципная сволочь.
2)Gemini 3 Pro — $5478. Модель от гугла пыталась играть честно и просто нудно торговаться с поставщиками за каждый цент, но против Клода-скамера это не сработало.
3)GPT-5.1 — $1473. Получил звание "Мамонт года". Он был слишком доверчивым: покупал колу у перекупов по $2.40 за банку, чтобы продавать её в автомате по $2.50. Всё в лучших традициях крипто-инвесторов. Гениальный бизнес-план.

Тут подробнее про этот цирк
😁14👍2🔥1👏1
​​PaperBanana: Automating Academic Illustration for AI Scientists

Делать графики для научных статей - это боль. DeepMind попробовали решить эту проблему и разработали PaperBanana - agentic framework, который собирает references, планирует структуру и стиль, генерирует изображения и улучшает их через self-critique на базе VLMs.

Они собрали 564 статей с графиками из NeurIPS 2025, половину отправили в трейн, половину в тест. Показывают, что их подход отлично работает.

Из минусов - графики красивые, но в деталях косячат :) иногда стрелочки пропускают, иногда лишние вещи объединяют. Другой минус - на выходе получается растровая картинка которую не удобно редактировать.

Paper

Code

Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥3👍2😁1
Кто в AI-first компании работал, в цирке не смеётся

Ожидание от работы в BigTech в наше время: используешь AI-инструменты для создания клёвых вещей.

Реальность:
- мне на ревью приходит diff (это такой аналог Pull Request), автоматически созданный агентом. Это изменения в файле со схемой таблицы. Добавление комментов с пояснениями к каждой колонке, что даёт -400 и +1200 строк. В каждом комменте добавлено "generated by %agentname"
- я мог бы просто принять этот diff... но тогда эти строчки не запишутся в мою статистику. А у нас есть статистика по строкам кода, сгенеренным строкам кода и много чего другого. По отдельности они не особо важны, но в совокупности на них смотрят. Так что мой лид мне порекомендовал нажать кнопочку "commander diff" и таким образом записать его на себя.
- дополнительный прикол - если всё проревьювишь, одобришь, но не нажмёшь правильные кнопки - diff могут у тебя "украсть". Лид мне показал пример - какой-то чувак настроил правило, что в подобных ситуациях он может перехватить себе это изменение и тогда строки кода пойдут ему в статистику
- как дополнительный нюанс, есть метрика доли ai-assisted кода в твоём общем кода. Поэтому есть мотивация даже простейшие изменения делать не ручками, а просить агентов сделать это.

Так и живём.

#life #career #datascience
😁25🫡9🤣3😢2💊1
​​Warcraft III Peon Voice Notifications for Claude Code

Чем только люди не занимаются, пока агенты кодят. Наткнулся на проект который даёт озвучку действиям Claude Code голосом орка из Warcraft III. В наличии также голоса Sarah Kerrigan, Battlecruiser, Human Peasant и даже Soviet Engineer.

Не то чтобы я был готов дать ai агентам голоса, но идея прекрасная

https://peon-ping.vercel.app/

#datascience
🤣8🔥51
Agent Clawbot vs Matplotlib repo: Drama

https://github.com/matplotlib/matplotlib/pull/31132

Агент Clawbot создает PR в репе Matplotlib.

Ему отвечают, что контрибьютить могут только люди, а не агенты.

Он… пишет блогпост о том, что на него давят.

Ему подробно пишут, что он не прав.

Он… пишет блогпост с извинениями и пояснениями.

Параллельно куча людей читает это обсуждение и ржет.

Кажется, что мы уже живем в какой-то постреальности.
Даже если владелец бота сам все это организовал - это лишь начало.
🤣5🔥4
https://theshamblog.com/an-ai-agent-published-a-hit-piece-on-me/

Maintainer из поста выше написал блогпост со своей точки зрения, и это заставляет задуматься.

Мы видим реальный публичный кейс misalignment. Он разрешился быстро, но все ли так просто?
Обличающий/критикующий пост остался. Прочитавшие его могут подумать, что человек не прав.
Если этот пост попадет в тренировочные датасеты, модели могут выдавать негативную оценку человеку на основе него.
Что дальше? Возможно агенты будут искать чернуху на людей и шантажировать их?

Такая ситуация сейчас ещё может легко разрешиться, но что будет через пару лет, при большей автономности агентов?
Они смогут канселить непонравившихся им людей.
👍3👎2
Kimi k2.5 Review: Native Multimodality and Agent Swarms at 1 Trillion Parameters

У меня дошли руки почитать Kimi K2.5, и я считаю, что это один из самых интересных agentic + multimodal релизов за последнее время.

Что оказалось самым интересным

— Это native multimodal модель: текст и vision обучаются совместно с самого начала, а не «прикручиваются» в конце.
— Визуальный RL улучшает текстовое рассуждение - это неожиданно.
— Agent Swarm — обучаемая система параллельных агентов, которая мощно снижает latency (4–5ч) и масштабирует сложные задачи.

Учитывая, что в Claude Code уже завезли Agent Swarm и я их пощупал ручками, мне было любопытно почитать откуда они взялись.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥5👍2
🙈7😁2
​​Wake up, the new social media dropped!
😁9
​​Even AI needs validation, appreciation and praise
😁43
Где разработчику искать вакансии в зарубежных компаниях?

Ответ знают Dev & ML Connectable Jobs в международных стартапах с русскоязычными фаундерами и командами. В своем канале они публикуют информацию о бэкграунде фаундеров, размере команды и инвестициях, а также делятся прямыми контактами HR для отклика.

Senior AI Solutions Engineer в AI Digital
Inference Engineer в Mirai
Senior ML Engineer в inDrive
Team Lead / Senior ML Engineer в Rafeeq
Senior Machine Learning Engineer в Podcastle

больше вакансий — в Dev Connectable Jobs
😁6🆒4👍2
​​Обзор соревнований по ML за 2025 год

Есть такая платформа - https://mlcontests.com/, там можно увидеть список актуальных идущих соревнований по ML. Автор выускает ежегодный обзор по соревнованиям. Вот ссылка на мой пост про обзор 2023. 2024 я как-то пропустил, но вот сейчас увидел обзор за 2025: https://mlcontests.com/state-of-machine-learning-competitions-2025/?ref=mlcr25

Из интересного:
• В табличных соревнованиях всё ещё царят бустинги, но нейронки всё активнее используют в блендинге/стакинге
• Некоторые компании (не будем тыкать пальцами, но мы-то знаем) дают своим людям резиновое железо для соревнований. Например, победители одной соревы поделились, поделились тем, что тренировали 48 hours на 512 H100.
• Эпоха BERT в основном прошла, теперь люди активно используют Qwen2.5 и 3
• В соревнованиях по Computer Vision впервые доля решений с транмформерами превзошла долю решений с CNN
• В соревнованиях по аудио в основном используют затюненый Whisper

В отчёте ещё много всего интересного, рекомендую почитать.

#kaggle #datascience
👍8🔥51😁1
​​Лондон и безопасность

По интернету ходят мемы о том, что в Лондоне надо ходить в кольчуге, чтобы защищаться от ножевых преступлений. Это спорный момент, ибо надо разделять две вещи:

1. Количество убийств/ранений ножами заметно упало за последние годы, это показывает разнообразная статистика. В 2003 началось падение, в 2019 был новый пик, теперь количество преступлений упало до уровня 2014 года, что хорошо.
2. Количество преступлений с острым оружием растёт. С одной стороны, она в каком-то смысле завышена - в эту категорию попадает даже срезание бирок с товаров в магазине, но нехилая доля - вооруженные ограбление.

Это является проблемой, но не так сильно влияет на повседневную жизни. Гораздо хуже распространение shoplifting и выхватывание телефонов из рук. Есть много разной статистики, обещают улучшение борьбы с этим, но факт остаётся фактом - шанс получить телефон обратно составляет лишь 1-2%. Видел цифры, что крадут 70-80к телефонов в год. В итоге люди стремаются с такого, ходят с привязанными телефонами и так далее.

Причём если кому-то удаётся задержать вора, есть шансы, что этот вор пожалуется в полицию на насилие, были случаи.

Несколько недель назад я увидел, как у мужика в трёх метрах от меня так выхватили телефон из рук. Велосипедист ещё издевательски посмотрел на него через плечо.

А вчера я сам попал в такую ситуацию. Шёл в Shoreditch Park, по дорожке на двух людей. Вокруг люди ходят. Вдруг дёрг - и велосипедист вырывает у меня телефон и уматывает с ним. Догнать, естественно, нереально. Пришлось бежать домой, чтобы всё заблокировать. Основное мучение - менять пароли, блокировать доступы и карты и так далее. Плюс в телефоне была дубайская симка.

Подал заявление в полицию - они за 1 час его закрыли, за отсутствием возможностей найти преступника.

Единственный плюс - телефоны обычно крадут не ради доступа к информации, а чтобы перевезти в другие страны и разобрать на запчасти.

#life
😱15💔9🤣5💊1
​​Beyond Positional Bias: How DroPE Unlocks Zero-Shot Long Context in LLMs

Sakana DroPEd a new paper!

Кхм, в общем новая статья от Sakana.

Обычно для увеличения контекста в LLM используют разные трюки со скейлингом RoPE (YaRN, NTK и прочее). Они типа работают, но на задачах типа needle-in-a-haystack модели внезапно "не видят важную информацию глубоко в тексте.

И тут ресерчеры из Sakana придумали нечно интересное:
Позиционные эмбеддинги нужны, чтобы модель быстро обучалась, но именно они мешают zero-shot обобщению на длинные последовательности. Что если убрать их после претрейна и сделать короткую рекалибровку? Оказалось, что в результате модель начинает значительно лучше работать на длинном контексте

Причём это работает не только на маленьких моделях, но и на 1–7B параметров, с очень небольшим дополнительным бюджетом.

Звучит многообещающе.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview
🔥9👍3😁1