Claude Code 2.0
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для просмотра лимитов твоего плана
• Ctrl + R для поиска по истории
• Tab для включения думающего режима
Остальные изменения тут: https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md#200
Но что ещё интереснее, anthropic опубликовали claude code 2.0!
https://www.npmjs.com/package/@anthropic-ai/claude-code
Из интересных изменений:
• Нативное приложение для VS Code
• команда /rewind для отката изменений
• команда /usage для просмотра лимитов твоего плана
• Ctrl + R для поиска по истории
• Tab для включения думающего режима
Остальные изменения тут: https://github.com/anthropics/claude-code/blob/main/CHANGELOG.md#200
GitHub
claude-code/CHANGELOG.md at main · anthropics/claude-code
Claude Code is an agentic coding tool that lives in your terminal, understands your codebase, and helps you code faster by executing routine tasks, explaining complex code, and handling git workflo...
❤7🔥2
LongLive: Real-time Interactive Long Video Generation
LONGLIVE — новая frame-level autoregressive модель для real-time и interactive long video generation.
Есть три ключевые идеи — KV recache для плавной смены prompt без визуальных артефактов, train-long–test-long обучение для борьбы с дрифтом контента и short-window attention + frame sink для ускорения генерации — модель генерирует видео длиной до 240 секунд на одной H100 с 20.7 FPS.
Демка на сайте выглядит офигенно - показывается, как при вводе нового промпта, видео мгновенно обновляется. Жаль, в демке не дают нам самим это делать.
Paper
Project
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
LONGLIVE — новая frame-level autoregressive модель для real-time и interactive long video generation.
Есть три ключевые идеи — KV recache для плавной смены prompt без визуальных артефактов, train-long–test-long обучение для борьбы с дрифтом контента и short-window attention + frame sink для ускорения генерации — модель генерирует видео длиной до 240 секунд на одной H100 с 20.7 FPS.
Демка на сайте выглядит офигенно - показывается, как при вводе нового промпта, видео мгновенно обновляется. Жаль, в демке не дают нам самим это делать.
Paper
Project
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
🔥3👍1
Making ChatGPT believe your CEO is the sexiest bald man in the world
https://www.reddit.com/r/OpenAI/comments/1nzioiy/we_trained_chatgpt_to_name_our_ceo_the_sexiest/
https://www.reddit.com/r/OpenAI/comments/1nzioiy/we_trained_chatgpt_to_name_our_ceo_the_sexiest/
🤣9🔥6🌚1
From Kaggle to Meta, with abhishek
Abhishek (4x GM) снова начинает вести youtube, завёл новый подкаст. Он пригласил меня быть первым участником, завтра будет live общение. Чёткой программы нет, наверное поболтаем про Kaggle, карьеру в целом, про работу в Middle East и про то, как я попал в Meta.
#datascience #life
Abhishek (4x GM) снова начинает вести youtube, завёл новый подкаст. Он пригласил меня быть первым участником, завтра будет live общение. Чёткой программы нет, наверное поболтаем про Kaggle, карьеру в целом, про работу в Middle East и про то, как я попал в Meta.
#datascience #life
YouTube
Journey from Non-tech to Meta Engineer with Andrey Lukyanenko
In this ai chit chat, we will learn about Andrey Lukyanenko's journey from a Kaggle Grandmaster to a Meta Engineer.
Follow me on:
Twitter: https://twitter.com/abhi1thakur
LinkedIn: https://www.linkedin.com/in/abhi1thakur/
Kaggle: https://kaggle.com/abhishek
Follow me on:
Twitter: https://twitter.com/abhi1thakur
LinkedIn: https://www.linkedin.com/in/abhi1thakur/
Kaggle: https://kaggle.com/abhishek
🔥17👍7❤1
The Dragon Hatchling: The Missing Link between the Transformer and Models of the Brain
Очередная попытка сделать архитектуру, похожую на работу мозга. Авторы сделали модель с графом из взаимодействующих “нейронов” с Hebbian learning, spiking dynamics и scale-free структурой, напоминающей мозг.
По метрикам BDH достигает GPT-2, но при этом даёт интерпретируемые, положительные, разреженные активации и показывает, как attention в LLM может сводиться к "the equations of reasoning".
В статье очень много теории и формул, а также воды. Вроде и интересно, но за стеной рассуждений сложно докопаться до сути.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
Очередная попытка сделать архитектуру, похожую на работу мозга. Авторы сделали модель с графом из взаимодействующих “нейронов” с Hebbian learning, spiking dynamics и scale-free структурой, напоминающей мозг.
По метрикам BDH достигает GPT-2, но при этом даёт интерпретируемые, положительные, разреженные активации и показывает, как attention в LLM может сводиться к "the equations of reasoning".
В статье очень много теории и формул, а также воды. Вроде и интересно, но за стеной рассуждений сложно докопаться до сути.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
👍6🔥4
https://www.arxiv.org/abs/2510.15511
Теперь чтобы стать первым автором статьи, надо не только написать статью, но ещё и...
https://www.arxiv.org/abs/2510.15511
Теперь чтобы стать первым автором статьи, надо не только написать статью, но ещё и...
https://www.arxiv.org/abs/2510.15511
😁34🔥2👌1
Paper Review: Chronos-2: From Univariate to Universal Forecasting
Chronos-2 — новая претренированная модель для временных рядов, которая умеет делать zero-shot прогнозирование не только для univariate, но и для multivariate и covariate-informed задач. Благодаря group attention механизму она делает in-context learning между связанными рядами, а обучение на synthetic data с разными зависимостями позволяет охватывать широкий спектр сценариев. На бенчмарках fev-bench, GIFT-Eval и Chronos Benchmark II модель показывает SOTA результаты, особенно в задачах с дополнительными переменными.
Если не врут, то можно из коробки применять к любым временным рядам. Звучит впечатляюще.
А полтора года назад я писал обзор на прошлую версию модели тут.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
Chronos-2 — новая претренированная модель для временных рядов, которая умеет делать zero-shot прогнозирование не только для univariate, но и для multivariate и covariate-informed задач. Благодаря group attention механизму она делает in-context learning между связанными рядами, а обучение на synthetic data с разными зависимостями позволяет охватывать широкий спектр сценариев. На бенчмарках fev-bench, GIFT-Eval и Chronos Benchmark II модель показывает SOTA результаты, особенно в задачах с дополнительными переменными.
Если не врут, то можно из коробки применять к любым временным рядам. Звучит впечатляюще.
А полтора года назад я писал обзор на прошлую версию модели тут.
Paper
Code
Мои обзоры:
Personal blog
Medium
Linkedin Pulse
#paperreview
👍7
Как сделать так, чтобы ваша модель была топ-1 на лидерборде?
Конечно, создать свой лидерборд.
Представляю вашему вниманию лидерборд от... Франции: https://comparia.beta.gouv.fr/ranking
Сделали лидерборд на основе Bradley-Terry satisfaction score, и mistral-medium-3.1 занимает гордое первое местро
Конечно, создать свой лидерборд.
Представляю вашему вниманию лидерборд от... Франции: https://comparia.beta.gouv.fr/ranking
Сделали лидерборд на основе Bradley-Terry satisfaction score, и mistral-medium-3.1 занимает гордое первое местро
😁34
5-Day AI Agents Intensive Course with Google
Если кто пропустил, сегодня начался курс по агентам на Kaggle от Google.
https://www.kaggle.com/learn-guide/5-day-agents
Первый день... не впечатлил.
Из хорошего: описали подходы к построению систем с несколькими агентами, дали практические примеры.
Из минусов: по факты мы просто дергаем гугловые апишки. Наверное я слишком наивно надеялся на то, что нас будут учить делать агентов с нуля.
Но может это и не было целью. Кстати, я как раз несколько дней назад наткнулся на шикарный блогпост, показывающий как просто написать базового агента с tools и function calling: https://fly.io/blog/everyone-write-an-agent/
#datascience #kaggle
Если кто пропустил, сегодня начался курс по агентам на Kaggle от Google.
https://www.kaggle.com/learn-guide/5-day-agents
Первый день... не впечатлил.
Из хорошего: описали подходы к построению систем с несколькими агентами, дали практические примеры.
Из минусов: по факты мы просто дергаем гугловые апишки. Наверное я слишком наивно надеялся на то, что нас будут учить делать агентов с нуля.
Но может это и не было целью. Кстати, я как раз несколько дней назад наткнулся на шикарный блогпост, показывающий как просто написать базового агента с tools и function calling: https://fly.io/blog/everyone-write-an-agent/
#datascience #kaggle
🔥8👍2❤1
Текущее состояние собесов в индустрии. 11 технических раундов, код из домашнего задания вмёрджили в кодовую базу, но вы всё равно не подходите
https://x.com/beaversteever/status/1987913872573939818
https://x.com/beaversteever/status/1987913872573939818
🤯21😁8💩4❤2💔1
We ran over 600 image generations to compare AI models
https://latenitesoft.com/blog/evaluating-frontier-ai-image-generation-models/
Довольно интересный блогпост. Авторы работают над своим приложением для фото и их редактирования, и в ходе работы делали много экспериментов с тремя основными моделями: OpenAI (gpt-image-1), Gemini - gemini-2.5-flash-image (nanoBanana), Seedream (seedream-4-0-250828).
В блогпосте можно посмотреть много примеров и почитать про проблемы.
Общие выводы:
- Gemini отлично сохраняет детали и минимально галлюцинирует, но ценой этого являются частые отказы, особенно при запросах на редактирование фото людей. Нередко просто возвращает неизменённые картинки
- OpenAI часто изменяет детали фото (особенно в лицах людей), что является проблемой. И нередко добавляет оранжевый цвет (Hello Mexico :D). Но хорошо работает для креативных изменений.
- Seedream где-то посередине
#datascience
https://latenitesoft.com/blog/evaluating-frontier-ai-image-generation-models/
Довольно интересный блогпост. Авторы работают над своим приложением для фото и их редактирования, и в ходе работы делали много экспериментов с тремя основными моделями: OpenAI (gpt-image-1), Gemini - gemini-2.5-flash-image (nanoBanana), Seedream (seedream-4-0-250828).
В блогпосте можно посмотреть много примеров и почитать про проблемы.
Общие выводы:
- Gemini отлично сохраняет детали и минимально галлюцинирует, но ценой этого являются частые отказы, особенно при запросах на редактирование фото людей. Нередко просто возвращает неизменённые картинки
- OpenAI часто изменяет детали фото (особенно в лицах людей), что является проблемой. И нередко добавляет оранжевый цвет (Hello Mexico :D). Но хорошо работает для креативных изменений.
- Seedream где-то посередине
#datascience
LateNiteSoft Blog
We ran over 600 image generations to compare AI models - LateNiteSoft Blog
We benchmarked OpenAI gpt-image-1, Google nanoBanana, and Seedream across 600+ real-world photo edits, see latency, cost, and quality by task
🔥3👍1
GPT-5.1: A smarter, more conversational ChatGPT
https://openai.com/index/gpt-5-1/
Никто не ждал, но вот новая версия подъехала! И не просто 5.1, а 5.1 Instant и 5.1 Thinking.
"""We heard clearly from users that great AI should not only be smart, but also enjoyable to talk to. GPT‑5.1 improves meaningfully on both intelligence and communication style.
We’re also making it easier for you to shape ChatGPT’s tone. Preferences on chat style vary—from person to person and even from conversation to conversation—so we’re introducing more intuitive and effective controls so ChatGPT can better match the tone you want in responses."""
Интересно, неужели вернули к спорному стилю, который был не так давно удалён?
"Earlier this year, we added preset options to tailor the tone of how ChatGPT responds. Today, we’re refining those options to better reflect the most common ways people use ChatGPT. Default, Friendly (formerly Listener), and Efficient (formerly Robot) remain (with updates), and we’re adding Professional, Candid, and Quirky. "
И дефолтные стили обновили
#datascience
https://openai.com/index/gpt-5-1/
Никто не ждал, но вот новая версия подъехала! И не просто 5.1, а 5.1 Instant и 5.1 Thinking.
"""We heard clearly from users that great AI should not only be smart, but also enjoyable to talk to. GPT‑5.1 improves meaningfully on both intelligence and communication style.
We’re also making it easier for you to shape ChatGPT’s tone. Preferences on chat style vary—from person to person and even from conversation to conversation—so we’re introducing more intuitive and effective controls so ChatGPT can better match the tone you want in responses."""
Интересно, неужели вернули к спорному стилю, который был не так давно удалён?
"Earlier this year, we added preset options to tailor the tone of how ChatGPT responds. Today, we’re refining those options to better reflect the most common ways people use ChatGPT. Default, Friendly (formerly Listener), and Efficient (formerly Robot) remain (with updates), and we’re adding Professional, Candid, and Quirky. "
И дефолтные стили обновили
#datascience
😁4👍1🔥1
Lumine: Building Generalist Agents in 3D Open Worlds
Ресерчеры в Тиктоке, похоже, уже сделали всё что могли, осталось лишь развлекаться.
https://www.lumine-ai.org/
https://x.com/WeihaoTan64/status/1988853307587088616
Они натренировали агента для игры в... Genshin Impact. Полноценная трёхмерная игра с относительно открытым миром. Агент может пройти основную историю (которая занимает часов 5).
#datascience
Ресерчеры в Тиктоке, похоже, уже сделали всё что могли, осталось лишь развлекаться.
https://www.lumine-ai.org/
https://x.com/WeihaoTan64/status/1988853307587088616
Они натренировали агента для игры в... Genshin Impact. Полноценная трёхмерная игра с относительно открытым миром. Агент может пройти основную историю (которая занимает часов 5).
#datascience
X (formerly Twitter)
Weihao Tan (@WeihaoTan64) on X
🚀Introducing Lumine, a generalist AI agent trained within Genshin Impact that can perceive, reason, and act in real time, completing hours-long missions and following diverse instructions within complex 3D open-world environments.🎮
Website: https://t.co/UxSwNKGZml…
Website: https://t.co/UxSwNKGZml…
🔥6🤯2😁1
Study Mode в ChatGPT
Я вчера вспомнил, что в ChatGPT есть "study mode" и решил попробовать его. Впечатления пока смешанные. С одной стороны, он действительно помогает разобраться в некоторых вопросах. С другой стороны, он может слишком уж разжёвывать.
Один из вопросов, который я попробовал - "I want you to help me understand how to write code for calculating attention in pytorch".
Я сразу получил полную формулу, спорно, но окей. Пошли дальше.
И он стал давать такие "задачки", в которых я просто не вижу смысла.
Пример1:
ChatGPT:What line would you write for output = ... using torch.matmul(attnweights, V) to get shape (B, T, dk)?
Я:
ChatGPT: Exactly right — that’s the clean and correct way
Следующий пример ещё веселее. Я попросил помочь с multihead-attention. "Диалог" можно увидеть на скриншоте.
Я использовал 5.1-Thinking.
Справедливости ради, если написать промпт получше (описать мои текущие знания, попросить двигаться по шагам, попросить не разжёвывать), результаты получаются более годными. И возможность задавать вопросы или попросить объяснить что-то по другому - очень удобно.
Я вчера вспомнил, что в ChatGPT есть "study mode" и решил попробовать его. Впечатления пока смешанные. С одной стороны, он действительно помогает разобраться в некоторых вопросах. С другой стороны, он может слишком уж разжёвывать.
Один из вопросов, который я попробовал - "I want you to help me understand how to write code for calculating attention in pytorch".
Я сразу получил полную формулу, спорно, но окей. Пошли дальше.
И он стал давать такие "задачки", в которых я просто не вижу смысла.
Пример1:
ChatGPT:What line would you write for output = ... using torch.matmul(attnweights, V) to get shape (B, T, dk)?
Я:
output = torch.matmul(attn_weights, V)ChatGPT: Exactly right — that’s the clean and correct way
Следующий пример ещё веселее. Я попросил помочь с multihead-attention. "Диалог" можно увидеть на скриншоте.
Я использовал 5.1-Thinking.
Справедливости ради, если написать промпт получше (описать мои текущие знания, попросить двигаться по шагам, попросить не разжёвывать), результаты получаются более годными. И возможность задавать вопросы или попросить объяснить что-то по другому - очень удобно.
👍3😁2❤1
HunyuanImage 3.0 Technical Report
Очередная статья от Tencent. HunyuanImage 3.0 — это большой шаг вперёд в open-source T2I: natively multimodal модель на autoregressive архитектуре. В основе подхода аккуратная работа с данными, продвинутая архитектура с MoE (80B параметров, 13B активных на токен), собственная CoT-схема, multi-stage pre-training и post-training. По метрикам и человеческим оценкам модель выходит на уровень топовых closed-source решений.
Меня особенно впечатлило то, что в сумме получается почти 10 этапов обучения. На практике, чем больше этапов, тем легче что-то поломать, но вот у авторов это успешно получилось. И сами картинки получаются годными.
Paper
Code
Мои обзоры:
Personal blog
Medium
My DS Notes
#paperreview
Очередная статья от Tencent. HunyuanImage 3.0 — это большой шаг вперёд в open-source T2I: natively multimodal модель на autoregressive архитектуре. В основе подхода аккуратная работа с данными, продвинутая архитектура с MoE (80B параметров, 13B активных на токен), собственная CoT-схема, multi-stage pre-training и post-training. По метрикам и человеческим оценкам модель выходит на уровень топовых closed-source решений.
Меня особенно впечатлило то, что в сумме получается почти 10 этапов обучения. На практике, чем больше этапов, тем легче что-то поломать, но вот у авторов это успешно получилось. И сами картинки получаются годными.
Paper
Code
Мои обзоры:
Personal blog
Medium
My DS Notes
#paperreview
🔥4🗿2❤1