Book Review: Unlocking Data with Generative AI and RAG, Second Edition
Amazon
Мне прислали ещё одну книжку на ревью, на этот раз про RAG. Я уже писал обзор на первую версию, это вторая.
Вторая книга ещё лучше первой
- автор использует и развивает один пример на протяжении всей книги - это очень удобно, жаль, что мало кто так делает.
- поскольку автор - CTO Ragas, он конечно уделяет этой библиотеке много внимания, но вполне заслуженно
- в одной из глав мы пытаемся "атаковать" RAG на стороне red team, потом защищаться на стороне blue team - прикольно
- хорошо описан Agentic RAG
Из мелких миносов - в начале книги описаны "популярные" LLM на октябрь 2025 года и их длина контекста. Некоторые из них даже на тот момент были не особо популярными
Подробности можно почитать в детальном обзоре:
Обзор в блоге
Обзор на Medium
#books #datascience
Amazon
Мне прислали ещё одну книжку на ревью, на этот раз про RAG. Я уже писал обзор на первую версию, это вторая.
Вторая книга ещё лучше первой
- автор использует и развивает один пример на протяжении всей книги - это очень удобно, жаль, что мало кто так делает.
- поскольку автор - CTO Ragas, он конечно уделяет этой библиотеке много внимания, но вполне заслуженно
- в одной из глав мы пытаемся "атаковать" RAG на стороне red team, потом защищаться на стороне blue team - прикольно
- хорошо описан Agentic RAG
Из мелких миносов - в начале книги описаны "популярные" LLM на октябрь 2025 года и их длина контекста. Некоторые из них даже на тот момент были не особо популярными
Подробности можно почитать в детальном обзоре:
Обзор в блоге
Обзор на Medium
#books #datascience
🔥4😁2💊2👍1
Плюшки от dogfooding
Я уже рассказывал про dogfooding, про то как он работает и про плюшки от него.
Недавно нам выдали новый swag - обычно каждый уровень dogfooding может выбрать либо swag со своего уровня, либо с любого из предыдущих.
На этот раз на моём уровне можно было взять... ручной пылесос в виде акулы :) Многие были в восторге, но мне это было не очень релевантно. Зато на предыдущем уровне можно было взять набор Lego в виде одного из продуктов компании. Сегодня посылочка приехала.
Впечатления смешанные. С одной стороны выглядит мило, плюс клёво, что дужки очков двигаются. Из минусов: часть деталек плохо прилегает друг к другу. И когда я открыл упаковку, увидел, что кто-то уже соединил чуть ли не половину из деталек, причём в рандомных комбинациях. Пришлось разъединять.
#life #career
Я уже рассказывал про dogfooding, про то как он работает и про плюшки от него.
Недавно нам выдали новый swag - обычно каждый уровень dogfooding может выбрать либо swag со своего уровня, либо с любого из предыдущих.
На этот раз на моём уровне можно было взять... ручной пылесос в виде акулы :) Многие были в восторге, но мне это было не очень релевантно. Зато на предыдущем уровне можно было взять набор Lego в виде одного из продуктов компании. Сегодня посылочка приехала.
Впечатления смешанные. С одной стороны выглядит мило, плюс клёво, что дужки очков двигаются. Из минусов: часть деталек плохо прилегает друг к другу. И когда я открыл упаковку, увидел, что кто-то уже соединил чуть ли не половину из деталек, причём в рандомных комбинациях. Пришлось разъединять.
#life #career
🔥3❤2🎉1
Claude Code: проблемы лимитов и качества
В последние недели/месяцы, всё больше и больше людей жалуются на то, что лимиты в Claude Code достигаются слишком быстро, значительно быстрее чем раньше. Плюс кажется, что качество упало.
Бывает сложно понять насколько это объективно: иногда компании реально нерфят модели, иногда людям это просто кажется.
Я собрал три обсуждения с Github, которые, как мне кажется, качественно объясняют эти проблемы:
1. Про качество: link. В начале марта дефолтное значение thinking effort/budget было уменьшено с high/max до medium. Это прям сильно ударило по качеству, я даже на работе заметил. К счастью, это решается просто: достаточно запускать
С лимитами хуже:
Сейчас открыто два issue: первое и второе.
Первое говорит, что раньше Cache TTL был 1 час, а теперь всего 5 минут. Это значит, что Clade Code перезагружает контекст каждые 5 минут неактивности. В результате тратится лишнее время, чтобы перезагрузить инфу, а также тратится намного больше токенов, чтобы каждый раз "вспомнить" весь контекст.
Само по себе это уже плохо, но второе issue усугубляет ситуацию: автор заявляет, что скорее всего чтение кэша не со скидкой (1/10), а по полной цене.
Комбинация этих двух проблем даёт очень неприятные результаты - кэш регулярно обновляется и стоит полную стоимость.
Будем надеяться, что это пофиксят
P. S. Если Mythos такой могучий, почему он ещё не пофиксил всё?
#datascience #ai
В последние недели/месяцы, всё больше и больше людей жалуются на то, что лимиты в Claude Code достигаются слишком быстро, значительно быстрее чем раньше. Плюс кажется, что качество упало.
Бывает сложно понять насколько это объективно: иногда компании реально нерфят модели, иногда людям это просто кажется.
Я собрал три обсуждения с Github, которые, как мне кажется, качественно объясняют эти проблемы:
1. Про качество: link. В начале марта дефолтное значение thinking effort/budget было уменьшено с high/max до medium. Это прям сильно ударило по качеству, я даже на работе заметил. К счастью, это решается просто: достаточно запускать
claude --effort max или проставить это в настройках.С лимитами хуже:
Сейчас открыто два issue: первое и второе.
Первое говорит, что раньше Cache TTL был 1 час, а теперь всего 5 минут. Это значит, что Clade Code перезагружает контекст каждые 5 минут неактивности. В результате тратится лишнее время, чтобы перезагрузить инфу, а также тратится намного больше токенов, чтобы каждый раз "вспомнить" весь контекст.
Само по себе это уже плохо, но второе issue усугубляет ситуацию: автор заявляет, что скорее всего чтение кэша не со скидкой (1/10), а по полной цене.
Комбинация этих двух проблем даёт очень неприятные результаты - кэш регулярно обновляется и стоит полную стоимость.
Будем надеяться, что это пофиксят
P. S. Если Mythos такой могучий, почему он ещё не пофиксил всё?
#datascience #ai
GitHub
[MODEL] Claude Code is unusable for complex engineering tasks with the Feb updates · Issue #42796 · anthropics/claude-code
Preflight Checklist I have searched existing issues for similar behavior reports This report does NOT contain sensitive information (API keys, passwords, etc.) Type of Behavior Issue Other unexpect...
👍10😁1💔1🫡1
Мой опыт tech review: часть 4
Заключительный пост из серии рассказов про то, как я делал tech review.
Во-первых, про помощь LLM в ревью.
Вначале я делал ревью целиком и полностью сам, но в какой-то момент мне прислали сразу две главы на ревью (плюс обновлённые главы ai-сгенерированной книги) и я решил попробовать использовать LLM для ускорения процесса.
Я открыл три вкладки в браузере (ChatGPT, Claude, Gemini Pro, все на максимальных возможных настройках и с режимом thinking/extended), в каждую загрузил pdf с книгой и попросил подробно проанализировать книгу, найти ошибки и неточности, выдать полный список проблем. Один и тот же промпт для всех.
Claude с задачей справился на отлично: он выдал длинный список проблем с разбором по каждой части главы. Остальные две модели справились средненько - нашли лишь несколько ошибок и на этом остановились. Мне это показалось странным, поэтому я решил копнуть глубже. Я показал им ревью от Claude и спросил, почему они так не смогли :) Оправдались тем, что я им недостаточно детальный промпт написал, мол не поняли меня. Тогда я их попросил самих написать хорошие промпты и попробовал их - результат получился намного лучше.
В качестве финального шага, я попросил Claude взять все три ревью и объединить их в одно. В результате получился длинный документ, с описанием проблем (и их критичностью) в каждой секции главы. Я внимательно прошёлся по нему, качество впечатлило. Модели нашли раза в два больше ошибок чем я, пусть многие из них были мелкими. Около 15% найденного оказалось false positives - либо запутались в форматировании текста, либо не знали что что-то описывалось в других главах, либо мелкие неточности считали серьёзными проблемами. Но в любом случае, мне это сильно помогло.
В заключение приведу ещё примеры косяков из книги:
"Sometime the techniques mentioned here will be alternatively named preliminary exploratory data analysis or simply data quality assessment." - это всё-таки разные вещи.
"Mean imputation is only appropriate when we can assume that the data distribution for that feature is normal. If the data distribution is skewed, we would like to replace mean with median – in this case the missing data will not take the average value, but the most likely one. " - классическая ошибка, когда путают моду и медиану.
"Embeddings present the advantages... There are also some limitations that we need to consider. They are not directly usable with traditional linear regression without custom architectures." - очень странное утверждение, ибо использование эмбеддингов в линейных моделях - это нормально.
"Let’s suppose also that the proportion of positive examples P (Y = 1) is 0.01... if the model always predicts Y=1, it is enough to achieve very high accuracy." - опечатка, но полностью меняет смысл.
#life #datascience #books
Заключительный пост из серии рассказов про то, как я делал tech review.
Во-первых, про помощь LLM в ревью.
Вначале я делал ревью целиком и полностью сам, но в какой-то момент мне прислали сразу две главы на ревью (плюс обновлённые главы ai-сгенерированной книги) и я решил попробовать использовать LLM для ускорения процесса.
Я открыл три вкладки в браузере (ChatGPT, Claude, Gemini Pro, все на максимальных возможных настройках и с режимом thinking/extended), в каждую загрузил pdf с книгой и попросил подробно проанализировать книгу, найти ошибки и неточности, выдать полный список проблем. Один и тот же промпт для всех.
Claude с задачей справился на отлично: он выдал длинный список проблем с разбором по каждой части главы. Остальные две модели справились средненько - нашли лишь несколько ошибок и на этом остановились. Мне это показалось странным, поэтому я решил копнуть глубже. Я показал им ревью от Claude и спросил, почему они так не смогли :) Оправдались тем, что я им недостаточно детальный промпт написал, мол не поняли меня. Тогда я их попросил самих написать хорошие промпты и попробовал их - результат получился намного лучше.
В качестве финального шага, я попросил Claude взять все три ревью и объединить их в одно. В результате получился длинный документ, с описанием проблем (и их критичностью) в каждой секции главы. Я внимательно прошёлся по нему, качество впечатлило. Модели нашли раза в два больше ошибок чем я, пусть многие из них были мелкими. Около 15% найденного оказалось false positives - либо запутались в форматировании текста, либо не знали что что-то описывалось в других главах, либо мелкие неточности считали серьёзными проблемами. Но в любом случае, мне это сильно помогло.
В заключение приведу ещё примеры косяков из книги:
"Sometime the techniques mentioned here will be alternatively named preliminary exploratory data analysis or simply data quality assessment." - это всё-таки разные вещи.
"Mean imputation is only appropriate when we can assume that the data distribution for that feature is normal. If the data distribution is skewed, we would like to replace mean with median – in this case the missing data will not take the average value, but the most likely one. " - классическая ошибка, когда путают моду и медиану.
"Embeddings present the advantages... There are also some limitations that we need to consider. They are not directly usable with traditional linear regression without custom architectures." - очень странное утверждение, ибо использование эмбеддингов в линейных моделях - это нормально.
"Let’s suppose also that the proportion of positive examples P (Y = 1) is 0.01... if the model always predicts Y=1, it is enough to achieve very high accuracy." - опечатка, но полностью меняет смысл.
#life #datascience #books
Telegram
Data, Stories and Languages
Мой опыт tech review: часть 3
Я уже рассказывал про мой опыт технического ревью книги, явно сгенерированной AI. Сейчас я делаю подобное ревью для другой книги - про ML, DS, AI на питоне. Автором является один Kaggle Notebook Grandmaster (не я :)). Мне присылают…
Я уже рассказывал про мой опыт технического ревью книги, явно сгенерированной AI. Сейчас я делаю подобное ревью для другой книги - про ML, DS, AI на питоне. Автором является один Kaggle Notebook Grandmaster (не я :)). Мне присылают…
❤3🔥2💩1
The Pragmatic Engineer: The impact of AI on software engineers in 2026: key trends
Я подписан на The Pragmatic Engineer, он публикует много интересных блогпостов, вот очередной.
Из интересного:
- удивительно было почитать, что многие компании покупают сотрудникам именно подписку на инструменты и из-за этого люди часто упираются в лимиты. После работы в бигтехе, где использование ai-агентов безлимитно, это как-то непривычно
- компании в EU и UK чаще жадничают, чем компании в USA. Нередко они не хотят тратить даже 50$ на инженера на AI-инструменты
- косты растут: когда компании используют агентов по API, стоимость может заставить руководство задуматься, особенно если роста результатов особо не видно
- основная потенциальная проблема агентов - ai slop, который сложно поддерживать. Но плюсов гораздо больше. Теперь вопрос скорее не "как делать", а "что делать"
- рассказали об одном эпичном примере. В большой компании директор создал PR на 15к строк и спросил как он будет аппрувиться. Staff-инженеры ответили ему, что это треш и так нельзя, надо хотя бы разбить его на атомарные части. Директор разозлился, на следующей встрече заявил, что в течение одного часа после встречи, каждый стафф (и выше) должен создать PR со значимым изменением этой системы. "This director said that in the age of AI, a “wall of unreviewed, untrusted changes” will be unavoidable". Дальше пошла драма без деталей
#ai #datascience
Я подписан на The Pragmatic Engineer, он публикует много интересных блогпостов, вот очередной.
Из интересного:
- удивительно было почитать, что многие компании покупают сотрудникам именно подписку на инструменты и из-за этого люди часто упираются в лимиты. После работы в бигтехе, где использование ai-агентов безлимитно, это как-то непривычно
- компании в EU и UK чаще жадничают, чем компании в USA. Нередко они не хотят тратить даже 50$ на инженера на AI-инструменты
- косты растут: когда компании используют агентов по API, стоимость может заставить руководство задуматься, особенно если роста результатов особо не видно
- основная потенциальная проблема агентов - ai slop, который сложно поддерживать. Но плюсов гораздо больше. Теперь вопрос скорее не "как делать", а "что делать"
- рассказали об одном эпичном примере. В большой компании директор создал PR на 15к строк и спросил как он будет аппрувиться. Staff-инженеры ответили ему, что это треш и так нельзя, надо хотя бы разбить его на атомарные части. Директор разозлился, на следующей встрече заявил, что в течение одного часа после встречи, каждый стафф (и выше) должен создать PR со значимым изменением этой системы. "This director said that in the age of AI, a “wall of unreviewed, untrusted changes” will be unavoidable". Дальше пошла драма без деталей
#ai #datascience
Pragmaticengineer
The impact of AI on software engineers in 2026: key trends. Part 1
Our AI tooling survey finds concerns about mounting AI costs, more engineers hitting usage limits, and AI tools having uneven effects upon different types of engineers
😁5👍1😱1
https://www.cnbc.com/2026/04/15/allbirds-bird-stock-shoes-ai.html
"Tech Struggling shoe retailer Allbirds makes bizarre pivot from shoes to AI, stock explodes more than 700%"
Добавь AI к чему угодно - и инвесторы будут кидать в тебя деньги
"Tech Struggling shoe retailer Allbirds makes bizarre pivot from shoes to AI, stock explodes more than 700%"
Добавь AI к чему угодно - и инвесторы будут кидать в тебя деньги
CNBC
Struggling shoe retailer Allbirds makes bizarre pivot to AI, adds $127 million in value
Allbirds announced a deal with American Exchange Group to sell its intellectual property and other assets for $39 million in March.
🤣6
Opus 4.7
https://www.anthropic.com/news/claude-opus-4-7
Claude Opus 4.7
Anthropic выпустили инкрементальный апгрейд Opus 4.6. Цена та же — $5/$25 за миллион input/output токенов.
Основное:
— Прирост на сложных coding-задачах, особенно в long-running agentic workflows. На CursorBench 70% vs 58% у 4.6.
— Vision — до 2576px по длинной стороне (в 3+ раза больше). XBOW отчитались о 98.5% на их visual-acuity бенчмарке против 54.5% у 4.6 — для computer-use агентов это качественный скачок.
— Новый effort level
— Instruction following стал сильно лучше — настолько, что Anthropic сами предупреждают: старые промпты могут поломаться, модель теперь читает инструкции буквально.
— Обновлённый токенизатор: тот же текст теперь жрёт в 1.0–1.35× больше токенов. Плюс на высоких effort levels модель думает больше. Так что реальная цена за вызов в среднем вырастет, несмотря на ту же цену за токен.
Любопытный момент: это первый релиз после Project Glasswing, и Anthropic пишут, что во время обучения differentially снижали cyber-capabilities относительно Mythos Preview.
Выглядит интересно.
https://www.anthropic.com/news/claude-opus-4-7
Claude Opus 4.7
Anthropic выпустили инкрементальный апгрейд Opus 4.6. Цена та же — $5/$25 за миллион input/output токенов.
Основное:
— Прирост на сложных coding-задачах, особенно в long-running agentic workflows. На CursorBench 70% vs 58% у 4.6.
— Vision — до 2576px по длинной стороне (в 3+ раза больше). XBOW отчитались о 98.5% на их visual-acuity бенчмарке против 54.5% у 4.6 — для computer-use агентов это качественный скачок.
— Новый effort level
xhigh между high и max.— Instruction following стал сильно лучше — настолько, что Anthropic сами предупреждают: старые промпты могут поломаться, модель теперь читает инструкции буквально.
— Обновлённый токенизатор: тот же текст теперь жрёт в 1.0–1.35× больше токенов. Плюс на высоких effort levels модель думает больше. Так что реальная цена за вызов в среднем вырастет, несмотря на ту же цену за токен.
Любопытный момент: это первый релиз после Project Glasswing, и Anthropic пишут, что во время обучения differentially снижали cyber-capabilities относительно Mythos Preview.
Выглядит интересно.
Anthropic
Introducing Claude Opus 4.7
Our latest model, Claude Opus 4.7, is now generally available. Opus 4.7 is a notable improvement on Opus 4.6 in advanced software engineering, with particular gains on the most difficult tasks.
🔥4
Forwarded from (sci)Berloga Всех Наук и Технологий
🚀 Серия соревнований по МЛ и научный проект ! Денежный призовой фонд больше 100 000 р и будет расти ! Кому интересен МЛ/RL или математика или пазлы или роботы.
Приглашаем Вас принять участие в серии челленджей и развитии научного опен-соурс проекта.
Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса ! Узнать больше о робототехнической части проекта Вы можете в сообщении https://t.me/forodirchNEWS/3165 , хабре или в чате @starkitmega.
Проект CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.
Первый разыгрываемый приз - 10 000 рублей.
Условия первого этапа очень простые.
Есть три челленджа на Каггле
Мегаминкс
https://www.kaggle.com/competitions/cayley-py-megaminx/leaderboard
Кубик Рубика 333
https://www.kaggle.com/competitions/cayleypy-ihes-cube
Кубик Рубика 444
https://www.kaggle.com/competitions/cayley-py-444-cube
Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику 333 или 444 (любом из них) и тоже опубликовать публичное решение. (Томас Рокицкий - легендарный специалист по вычислительным аспектам головоломок - именно его команда нашла "число Бога" кубика Рубика в 2010 году - подведя итог более 30 годам усилий большого количества специалистов).
Подробное описание соревнований -- по ссылкам выше. Кратко: даны 1000 состояний пазлов и Вам надо предъявить их решения -- чем короче решение тем лучше (то есть чем меньше шагов/"мувов"). Score на лидерборде = сумма длин решений по всем пазлам. Соревнования полностью аналогичны соревнованию Каггл Санта 2023 -- можно навайбкодить изменения лучших решений оттуда. Также стоит взять наш подход CayleyPy и изменить в нем образующие на мегаминкс. Это сделали те, кто сейчас в топе. Дополнительную информацию, обсуждение и советы - см. чаты - @starkitmega @sberlogacompete @sberlogasci. Вводные лекции: четверг 19.00, пятница 20.00 (время по Москве).
Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.
Планируется серия челленджей и призов. Когда первый приз будет разыгран - мы объявим о втором этапе.
================
А также мы ищем Cпоносоров.
Вы можете поддержать нас переведя на карту Илье Осокину 2202208362030505
Или напишите @alexander_v_c (Александр Червов)
И кидайте нам, пожалуйста, звезды на гитхаб, Вы нам очень поможите:
https://github.com/cayleypy/cayleypy
================
Выражаем благодарность компании RYBE - толстовки для айтишников: https://rybe.store https://t.me/rybe_store
================
Выражаем благодарность агентству BLASTIM за поддержку:
❤️ Наши курсы: agency.blastim.ru
🥨 Свежие вакансии в биотехе: blastim.ru
🤝 https://t.me/blastim
Приглашаем Вас принять участие в серии челленджей и развитии научного опен-соурс проекта.
Соревнование организуется совместно с учеными лаборатории интеллектуальных технологий робототехники МФТИ, (руководит проектом - Илья Осокин), которые поставили себе амбициозную цель создать робота, который побьет мировой рекорд по сборке Мегаминкса ! Узнать больше о робототехнической части проекта Вы можете в сообщении https://t.me/forodirchNEWS/3165 , хабре или в чате @starkitmega.
Проект CayleyPy предлагает Вам принять участие в решении алгоритмической части задачи - создании алгоритмов - которые смогут получать наиболее короткие (близкие к оптимальным ) решения. Методы решения важны в широком круге проблем от математики до квантовых компьютеров, МЛ/РЛ и теории струн. Для этого мы организовали соревнования на платформе Каггл.
Первый разыгрываемый приз - 10 000 рублей.
Условия первого этапа очень простые.
Есть три челленджа на Каггле
Мегаминкс
https://www.kaggle.com/competitions/cayley-py-megaminx/leaderboard
Кубик Рубика 333
https://www.kaggle.com/competitions/cayleypy-ihes-cube
Кубик Рубика 444
https://www.kaggle.com/competitions/cayley-py-444-cube
Приз будет получен первым, кто достигнет ЛЮБУЮ из целей:
1 Или в конкурсе Мегаминкс - кто достигает скор 80 000 - и опубликует публичное решение
2 Или обогнать Томаса Рокицкого в конкурсах по кубику 333 или 444 (любом из них) и тоже опубликовать публичное решение. (Томас Рокицкий - легендарный специалист по вычислительным аспектам головоломок - именно его команда нашла "число Бога" кубика Рубика в 2010 году - подведя итог более 30 годам усилий большого количества специалистов).
Подробное описание соревнований -- по ссылкам выше. Кратко: даны 1000 состояний пазлов и Вам надо предъявить их решения -- чем короче решение тем лучше (то есть чем меньше шагов/"мувов"). Score на лидерборде = сумма длин решений по всем пазлам. Соревнования полностью аналогичны соревнованию Каггл Санта 2023 -- можно навайбкодить изменения лучших решений оттуда. Также стоит взять наш подход CayleyPy и изменить в нем образующие на мегаминкс. Это сделали те, кто сейчас в топе. Дополнительную информацию, обсуждение и советы - см. чаты - @starkitmega @sberlogacompete @sberlogasci. Вводные лекции: четверг 19.00, пятница 20.00 (время по Москве).
Дополнительным призом будет возможное участие в научных публикациях. Наши цели амбициозны - мы уже добились исключительных результатов, которые имеют приложение в МЛ, математике, теории струн, квантовых вычислениях и т.д. Публикации отмечены NIPS spotlight. Узнать больше Вы можете в наших статьях. Если у Вас есть несколько свободных часов в неделю, знание Питона или математики и Вам интересно принять участие - пишите @alexander_v_c - мы рады всем - начинающим и профи.
Планируется серия челленджей и призов. Когда первый приз будет разыгран - мы объявим о втором этапе.
================
А также мы ищем Cпоносоров.
Вы можете поддержать нас переведя на карту Илье Осокину 2202208362030505
Или напишите @alexander_v_c (Александр Червов)
И кидайте нам, пожалуйста, звезды на гитхаб, Вы нам очень поможите:
https://github.com/cayleypy/cayleypy
================
Выражаем благодарность компании RYBE - толстовки для айтишников: https://rybe.store https://t.me/rybe_store
================
Выражаем благодарность агентству BLASTIM за поддержку:
❤️ Наши курсы: agency.blastim.ru
🥨 Свежие вакансии в биотехе: blastim.ru
🤝 https://t.me/blastim
👍2❤1🌚1
The Pragmatic Engineer: Tokenmaxxing
https://newsletter.pragmaticengineer.com/p/the-pulse-tokenmaxxing-as-a-weird
По индустрии ходит информация о том, что в многих tech компаниях люди практикуют tokenmaxxing из-а политик компании.
- в Meta был дашборд (уже прикрыли) с лидербордом потребления по токенам. Если ему верить, люди потратили 60 триллионов токенов за месяц.
- в Microsoft схожая ситуация. Люди гоняют модели просто так, без пользы - лишь бы потреблять токены
- в Salesforce есть требования о минимальном потреблении токенов в месяц. Если лимит не выполнил - будут вопросы
- в Uber умудрились весь запланированный бюджет по AI на 2026 год сжечь всего за 3 месяца
Наверное скоро компании образумятся и будут ставить максимальные лимиты или требовать экономить токены
https://newsletter.pragmaticengineer.com/p/the-pulse-tokenmaxxing-as-a-weird
По индустрии ходит информация о том, что в многих tech компаниях люди практикуют tokenmaxxing из-а политик компании.
- в Meta был дашборд (уже прикрыли) с лидербордом потребления по токенам. Если ему верить, люди потратили 60 триллионов токенов за месяц.
- в Microsoft схожая ситуация. Люди гоняют модели просто так, без пользы - лишь бы потреблять токены
- в Salesforce есть требования о минимальном потреблении токенов в месяц. Если лимит не выполнил - будут вопросы
- в Uber умудрились весь запланированный бюджет по AI на 2026 год сжечь всего за 3 месяца
Наверное скоро компании образумятся и будут ставить максимальные лимиты или требовать экономить токены
Pragmaticengineer
The Pulse: ‘Tokenmaxxing’ as a weird new trend
… which will probably be the shortest-lived trend because it’s so wasteful. Also: coding AI agent subsidies could be ending, Cal.com going closed source and blaming it on AI, and more.
😁7❤4😱1🙈1
Is Your Site Agent-Ready?
Внезапно (ибо никто не просил), Cloudfare сделали сайт для проверки того, является ли ваш сайт agent-ready.
https://isitagentready.com/
Проверяют 5 критериев:
- Discoverability — robots.txt, Sitemap, Link response headers
- Content Accessibility — Markdown content negotiation
- Bot Access Control — AI bot rules in robots.txt, Content Signals, Web Bot Auth
- Protocol Discovery — MCP Server Card, Agent Skills, WebMCP, API Catalog, OAuth discovery, OAuth Protected Resource
- Commerce — x402, UCP, ACP
Я ещё понимаю советы по discoverability. Markdown - явно не обязательно, ну да ладно.
Но считать, что каждый сайт должен иметь MCP - это уже безумие.
Больше AI богу AI.
Мой сайт получил 25, и я рад этому
#ai
Внезапно (ибо никто не просил), Cloudfare сделали сайт для проверки того, является ли ваш сайт agent-ready.
https://isitagentready.com/
Проверяют 5 критериев:
- Discoverability — robots.txt, Sitemap, Link response headers
- Content Accessibility — Markdown content negotiation
- Bot Access Control — AI bot rules in robots.txt, Content Signals, Web Bot Auth
- Protocol Discovery — MCP Server Card, Agent Skills, WebMCP, API Catalog, OAuth discovery, OAuth Protected Resource
- Commerce — x402, UCP, ACP
Я ещё понимаю советы по discoverability. Markdown - явно не обязательно, ну да ладно.
Но считать, что каждый сайт должен иметь MCP - это уже безумие.
Больше AI богу AI.
Мой сайт получил 25, и я рад этому
#ai
Is Your Site Agent-Ready?
Scan your website to see if it's ready for AI agents. Check for llms.txt, MCP, agent skills, and other agent-friendly standards.
😁4💩1🤡1
FIPO: Teaching LLMs Which Thoughts Actually Matter
Команда Qwen предложила небольшую, но любопытную модификацию для RL на reasoning-моделях. В стандартных GRPO/DAPO все токены в успешной траектории получают одинаковый advantage — модели приходится самой догадываться, какие токены реально повлияли на ответ.
FIPO добавляет token-level credit assignment через дисконтированный Future-KL. Для каждого токена считается, насколько политика сместилась на последующих позициях после апдейта, и через экспоненциальный клип это превращается в коэффициент к advantage. PPO clip и весь DAPO-рецепт сохраняются — это drop-in модификация поверх VeRL, по сути флаг loss-mode и пара изменений в гиперпараметрах.
Результаты на Qwen2.5-32B-Base + AIME 2024:
— DAPO baseline: 50.0% Pass@1
— FIPO: пик 58.0%, сходимость ~56.0%
— Длина ответов растёт с ~4k до >10k токенов
— Перебивает воспроизведённый DeepSeek-R1-Zero-32B (~47%), сравнимо с o1-mini
По сути, ставка на то, что dense credit-сигнал важнее, чем переход на sequence-level (как в GSPO) или новые reward-схемы (как в Pref-GRPO). Интересно, насколько это перенесётся за пределы AIME и под compute-matched сравнение.
Paper
Notion writeup
Code
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
Команда Qwen предложила небольшую, но любопытную модификацию для RL на reasoning-моделях. В стандартных GRPO/DAPO все токены в успешной траектории получают одинаковый advantage — модели приходится самой догадываться, какие токены реально повлияли на ответ.
FIPO добавляет token-level credit assignment через дисконтированный Future-KL. Для каждого токена считается, насколько политика сместилась на последующих позициях после апдейта, и через экспоненциальный клип это превращается в коэффициент к advantage. PPO clip и весь DAPO-рецепт сохраняются — это drop-in модификация поверх VeRL, по сути флаг loss-mode и пара изменений в гиперпараметрах.
Результаты на Qwen2.5-32B-Base + AIME 2024:
— DAPO baseline: 50.0% Pass@1
— FIPO: пик 58.0%, сходимость ~56.0%
— Длина ответов растёт с ~4k до >10k токенов
— Перебивает воспроизведённый DeepSeek-R1-Zero-32B (~47%), сравнимо с o1-mini
По сути, ставка на то, что dense credit-сигнал важнее, чем переход на sequence-level (как в GSPO) или новые reward-схемы (как в Pref-GRPO). Интересно, насколько это перенесётся за пределы AIME и под compute-matched сравнение.
Paper
Notion writeup
Code
Мои обзоры:
Personal blog
Medium
#paperreview
👍3🔥1
Иногда агенты меня пугают
В интернете пугают, что Mythos крутой настолько, что взломает всех и всё. Это смешно, но сегодня мне claude code сделал нечто впечатляющее.
На прошлой неделе я создал тестовую табличку, запустил тренировку модели на ней, тренировка удалась, но модель не сохранилась из-за временных неполадок.
Сегодня я создал продуктивную версию этой таблички, запускаю тренировку, и она не срабатывает - я получил ошибки из-за проблем с приватностью данных.
Пишу промпт в Claude Code с просьбой помочь и забываю об этом. Возвращаюсь, а claude решил, что ему тоже не хочется возиться с приватностью данных. Он просто скопировал продуктивную табличку в тестовую (где нет ограничений приватности) и запустил тренировку на ней.
Весело, но пугает 🙈
#ai #datascience
В интернете пугают, что Mythos крутой настолько, что взломает всех и всё. Это смешно, но сегодня мне claude code сделал нечто впечатляющее.
На прошлой неделе я создал тестовую табличку, запустил тренировку модели на ней, тренировка удалась, но модель не сохранилась из-за временных неполадок.
Сегодня я создал продуктивную версию этой таблички, запускаю тренировку, и она не срабатывает - я получил ошибки из-за проблем с приватностью данных.
Пишу промпт в Claude Code с просьбой помочь и забываю об этом. Возвращаюсь, а claude решил, что ему тоже не хочется возиться с приватностью данных. Он просто скопировал продуктивную табличку в тестовую (где нет ограничений приватности) и запустил тренировку на ней.
Весело, но пугает 🙈
#ai #datascience
😁9🔥2
Forwarded from AI.Insaf
Сходил на конференцию AI Conf доклады хорошие, и все про агентов. Про классический ML уже и не рассказывают
1. Про публикации докладов индустрии на A конференциях*: удивительно, но среднее время публикации 9 месяцев. Тк можно несколько раз проходить ревью на разных конференциях и последовательно улучшать работу. Все давно используют LLM для кода, ревью, обзорных статей и т. д. - то, что еще в Q3 прошлого года не работало. Но вот придумать что-то новое у LLM пока не получается: пробовали оставлять их подумать на пару недель - дорого и неэффективно, но, думаю, это вопрос времени. Интересная гипотеза: в будущем к статье будет прилагаться zip-архив экспериментов, которые AI сможет детально проверить, и вся ценность будет заключаться в идее.
2. Сходил на два воркшопа. По построению search-агентов (ReAct с бесплатными API Groq + Tavily для поиска, который дает 1000 бесплатных запросов в месяц). И еще один как строить мониторинг с langfuse.
3. Если в прошлом году еще спорили, чем отличается LLM-решение от агентов, то теперь придумали Agent Harness (например, Deep Agents - там сразу и память, и скиллы вместо тулзов). Работает достойно, но создание скилла на основе готового минус 2 млн токенов, а один вызов еще минус 100к. Понятно, что надо смотреть по метрикам, но токенов кушает достойно. В качестве альтернативы Langfuse посмотрели Arize Phoenix - удобно, что он сам всё оборачивает и так же можно смотреть трейсы.
4. Интересный доклад про голосовых агентов, в том числе для телефонии. Voice-to-voice модели - это удобно, но для них пока нет туллинга и контекстом сложно управлять. Из-за этого всё еще работает связка Speech-to-Text -> LLM -> Text-to-Speech. Но приходится добавлять модели, которые детекят, когда человек перебивает бота. Из-за пауз моделька может начать анализировать ответ раньше времени, а значит, нужно сегментировать речь - а это еще дополнительные модели и рост latency. Плюс нужно нормализовать текст после Whisper, который, если слышит музыку, любит галлюцинировать (условно, пишет «Транскрибировано Димон»). Сложный домен. А если сервишь сам, то приходится выбирать между Ray Serve (vLLM) и Triton Inference Server - и там всё очень серьезно.
5. Создание контента. Был блогер с YouTube-канала, который отдал на откуп LLM почти всё: от обложки и сценария до самого контента. Оставил только человека в кадре, который читает текст. Теперь сразу понятно, какой контент был создан именно так (спойлер: там, где на обложке капс и слишком кричащий заголовок).
P.S. Еда по талонам, а там - котлетка с пюрешкой. Как так-то?
1. Про публикации докладов индустрии на A конференциях*: удивительно, но среднее время публикации 9 месяцев. Тк можно несколько раз проходить ревью на разных конференциях и последовательно улучшать работу. Все давно используют LLM для кода, ревью, обзорных статей и т. д. - то, что еще в Q3 прошлого года не работало. Но вот придумать что-то новое у LLM пока не получается: пробовали оставлять их подумать на пару недель - дорого и неэффективно, но, думаю, это вопрос времени. Интересная гипотеза: в будущем к статье будет прилагаться zip-архив экспериментов, которые AI сможет детально проверить, и вся ценность будет заключаться в идее.
2. Сходил на два воркшопа. По построению search-агентов (ReAct с бесплатными API Groq + Tavily для поиска, который дает 1000 бесплатных запросов в месяц). И еще один как строить мониторинг с langfuse.
3. Если в прошлом году еще спорили, чем отличается LLM-решение от агентов, то теперь придумали Agent Harness (например, Deep Agents - там сразу и память, и скиллы вместо тулзов). Работает достойно, но создание скилла на основе готового минус 2 млн токенов, а один вызов еще минус 100к. Понятно, что надо смотреть по метрикам, но токенов кушает достойно. В качестве альтернативы Langfuse посмотрели Arize Phoenix - удобно, что он сам всё оборачивает и так же можно смотреть трейсы.
4. Интересный доклад про голосовых агентов, в том числе для телефонии. Voice-to-voice модели - это удобно, но для них пока нет туллинга и контекстом сложно управлять. Из-за этого всё еще работает связка Speech-to-Text -> LLM -> Text-to-Speech. Но приходится добавлять модели, которые детекят, когда человек перебивает бота. Из-за пауз моделька может начать анализировать ответ раньше времени, а значит, нужно сегментировать речь - а это еще дополнительные модели и рост latency. Плюс нужно нормализовать текст после Whisper, который, если слышит музыку, любит галлюцинировать (условно, пишет «Транскрибировано Димон»). Сложный домен. А если сервишь сам, то приходится выбирать между Ray Serve (vLLM) и Triton Inference Server - и там всё очень серьезно.
5. Создание контента. Был блогер с YouTube-канала, который отдал на откуп LLM почти всё: от обложки и сценария до самого контента. Оставил только человека в кадре, который читает текст. Теперь сразу понятно, какой контент был создан именно так (спойлер: там, где на обложке капс и слишком кричащий заголовок).
P.S. Еда по талонам, а там - котлетка с пюрешкой. Как так-то?
👍7❤1🔥1
Meta to start capturing employee mouse movements, keystrokes for AI training data
https://www.reuters.com/sustainability/boards-policy-regulation/meta-start-capturing-employee-mouse-movements-keystrokes-ai-training-data-2026-04-21/
"Meta is installing new tracking software on U.S.-based employees’ computers to capture mouse movements, clicks and keystrokes for use in training its artificial-intelligence models"
А как ваши компании собирают данные для моделей? :)
Когда-то говорили, что такой трекинг для проверки работы - зашквар и только убргие компании такое делают.
А теперь вот фаанг до этого скатился. Как бы теперь все компании не начали это делать.
https://www.reuters.com/sustainability/boards-policy-regulation/meta-start-capturing-employee-mouse-movements-keystrokes-ai-training-data-2026-04-21/
"Meta is installing new tracking software on U.S.-based employees’ computers to capture mouse movements, clicks and keystrokes for use in training its artificial-intelligence models"
А как ваши компании собирают данные для моделей? :)
Когда-то говорили, что такой трекинг для проверки работы - зашквар и только убргие компании такое делают.
А теперь вот фаанг до этого скатился. Как бы теперь все компании не начали это делать.
😱6😁3😢1
5-Day AI Agents: Intensive Vibe Coding Course With Google
Новая итерация курса про AI от Kaggle!
https://www.kaggle.com/competitions/5-day-ai-agents-intensive-vibecoding-course-with-google/overview
Теперь будем учиться использовать агентов, инструменты, скилы и память, проверки качества и безопасности, а также деплоить то, что навайбкодили
June 15 - 19, 2026
#ai
Новая итерация курса про AI от Kaggle!
https://www.kaggle.com/competitions/5-day-ai-agents-intensive-vibecoding-course-with-google/overview
Теперь будем учиться использовать агентов, инструменты, скилы и память, проверки качества и безопасности, а также деплоить то, что навайбкодили
June 15 - 19, 2026
#ai
Kaggle
5-Day AI Agents: Intensive Vibe Coding Course With Google
June 15 - 19, 2026
🔥8❤1👍1
Grammarly уже не тот
Я годами использовал Grammarly для улучшения своих текстов. Но сколько-то месяцев назад они стали внедрять AI и давать больше советов. И эти советы часто, скажем так, сомнительные.
Решил я ради любопытства проверить текст своих заметок на следы ai-generated text.
Вот, например мне заявили, что "and Regularization" - это очень подозрительно, гораздо лучше писать "as well as Regularization". "input features" - тоже плохо, лучше "input attributes". Из самого смешного - предложили заменить "Bayesian optimization" на "Bayesian tuning".
И как им после такого доверять в проверке качества текстов?
Я годами использовал Grammarly для улучшения своих текстов. Но сколько-то месяцев назад они стали внедрять AI и давать больше советов. И эти советы часто, скажем так, сомнительные.
Решил я ради любопытства проверить текст своих заметок на следы ai-generated text.
Вот, например мне заявили, что "and Regularization" - это очень подозрительно, гораздо лучше писать "as well as Regularization". "input features" - тоже плохо, лучше "input attributes". Из самого смешного - предложили заменить "Bayesian optimization" на "Bayesian tuning".
И как им после такого доверять в проверке качества текстов?
😁20👍4
Dogfooding... brick
Я уже рассказывал, что в моей компании можно заниматься dogfooding - тестирование software/hardware до публичного запуска.
В рамках dogfooding можно зарабатывать баллы - за выполнение заданий, репорт багов, участие в ивентах. Несколько месяцев назад я достиг предпоследний ранг и за него дают особую плюшку.
Как известно, при тестировании железа, оно иногда может ломаться. На английском это звучит как "I bricked my device". Так что может быть лучше, чем наградить таких людей... кирпичом?
Сегодня я получил свой кирпич, надпись на нём была придумана мной :)
Теперь у моих аргументов на работе будет особый вес!
Я уже рассказывал, что в моей компании можно заниматься dogfooding - тестирование software/hardware до публичного запуска.
В рамках dogfooding можно зарабатывать баллы - за выполнение заданий, репорт багов, участие в ивентах. Несколько месяцев назад я достиг предпоследний ранг и за него дают особую плюшку.
Как известно, при тестировании железа, оно иногда может ломаться. На английском это звучит как "I bricked my device". Так что может быть лучше, чем наградить таких людей... кирпичом?
Сегодня я получил свой кирпич, надпись на нём была придумана мной :)
Теперь у моих аргументов на работе будет особый вес!
🔥8😁6❤1
Forwarded from Сиолошная
👍4
An update on recent Claude Code quality reports
Недавно я писал про проблемы с лимитами Claude
Anthropic признали проблему и выкатили пост с объяснениями. Действительно, были проблемы и с reasoning, и с cache.
https://www.anthropic.com/engineering/april-23-postmortem
Они сделали reset лимитов.
#ai
Недавно я писал про проблемы с лимитами Claude
Anthropic признали проблему и выкатили пост с объяснениями. Действительно, были проблемы и с reasoning, и с cache.
https://www.anthropic.com/engineering/april-23-postmortem
Они сделали reset лимитов.
#ai
👍10💊2