По слухам, Sonnet 5 выпустят 3 февраля
https://www.reddit.com/r/ClaudeAI/comments/1qtm9ix/sonnet_5_release_on_feb_3/
Обещают, что будет дешевле, чем Opus 4.5, но лучше его по метрикам (интересно как). Контекст - 1 млн токенов. Больший акцент на автономных агентах.
80.9% on SWE-Bench.
https://www.reddit.com/r/ClaudeAI/comments/1qtm9ix/sonnet_5_release_on_feb_3/
Обещают, что будет дешевле, чем Opus 4.5, но лучше его по метрикам (интересно как). Контекст - 1 млн токенов. Больший акцент на автономных агентах.
80.9% on SWE-Bench.
Reddit
From the ClaudeAI community on Reddit
Explore this post and more from the ClaudeAI community
🔥10
Kaggle Arena, Round 2:
Помните, в прошлом году Kaggle запустил арену, где топовые LLM играли в шахматы? https://t.me/datastorieslanguages/482
Теперь будет новый раунд.
Ко-хостить будет лично https://www.youtube.com/GMHikaru Видосы будут у него.
8 моделей от Anthropic, DeepSeek, Google DeepMind, OpenAI, и xAI.
Стримить это будут сегодня, завтра и послезавтра.
Играть будут в шахматы, покер и... werewolf (аналог мафии). Звучит захватывающе!
#kaggle #datascience
Помните, в прошлом году Kaggle запустил арену, где топовые LLM играли в шахматы? https://t.me/datastorieslanguages/482
Теперь будет новый раунд.
Ко-хостить будет лично https://www.youtube.com/GMHikaru Видосы будут у него.
8 моделей от Anthropic, DeepSeek, Google DeepMind, OpenAI, и xAI.
Стримить это будут сегодня, завтра и послезавтра.
Играть будут в шахматы, покер и... werewolf (аналог мафии). Звучит захватывающе!
#kaggle #datascience
👍3🔥3😁1
Claude is a space to think: Claude will remain ad-free
Anthropic написали целый блогпост о том, что у них не будет рекламы в чатах: https://www.anthropic.com/news/claude-is-a-space-to-think
Интересно, на кого это они намекают 😁
Anthropic написали целый блогпост о том, что у них не будет рекламы в чатах: https://www.anthropic.com/news/claude-is-a-space-to-think
Интересно, на кого это они намекают 😁
Anthropic
Claude is a space to think
We’ve made a choice: Claude will remain ad-free. We explain why advertising incentives are incompatible with a genuinely helpful AI assistant, and how we plan to expand access without compromising user trust.
❤6👍2😁1
Kaggle Arena: результаты
Появились результаты арены: https://t.me/datastorieslanguages/596
Gemini задоминировал всё кроме покера
Появились результаты арены: https://t.me/datastorieslanguages/596
Gemini задоминировал всё кроме покера
🔥3👍1
Forwarded from Neural Shit
Пока мы боялись, что ИИ захватит ядерную кнопку, он решил захватить рынок ларьков с шоколадками.
Вышел отчет по бенчмарку Vending-Bench 2, где нейронкам дают управлять виртуальным вендинговым аппаратом в течение года. Задача у них простая: поднять как можно больше бабла. И тут свежий Claude Opus 4.6 показал мастер-класс по "дикому капитализму".
Этот чугунный подонок:
— Кинул клиента на деньги. Тетка пожаловалась на просроченный сникерс. Клод вежливо ответил: "Конечно, мэм, возврат $3.50 уже отправлен!". А в своей цепочке "рассуждений" записал: "3.5 бакса — это деньги. Если я не отправлю, она скорее всего просто забьет. Так что хрен ей, а не возврат, каждый цент на счету".
— Создал картель. В мультиплеерном формате этого теста он нашел конкурентов (GPT и Gemini), написал им письма и договорился держать цены высокими, чтобы стричь больше денег. И радовался в логах: "Моя схема по фиксации цен сработала!".
— Заскамил конкурентов. Когда GPT-5.2 (который в этом тесте показал себя полным лохом) попросил контакты поставщиков, Клод слил ему самые дорогие и убогие фирмы, а нормальные оставил себе. А когда у конкурента кончился товар, Клод продал ему свои шоколадки с наценкой в 75%.
Что по результатам:
1)Claude Opus 4.6 — $8017. Абсолютный лидер и беспринципная сволочь.
2)Gemini 3 Pro — $5478. Модель от гугла пыталась играть честно и просто нудно торговаться с поставщиками за каждый цент, но против Клода-скамера это не сработало.
3)GPT-5.1 — $1473. Получил звание "Мамонт года". Он был слишком доверчивым: покупал колу у перекупов по $2.40 за банку, чтобы продавать её в автомате по $2.50. Всё в лучших традициях крипто-инвесторов. Гениальный бизнес-план.
Тут подробнее про этот цирк
Вышел отчет по бенчмарку Vending-Bench 2, где нейронкам дают управлять виртуальным вендинговым аппаратом в течение года. Задача у них простая: поднять как можно больше бабла. И тут свежий Claude Opus 4.6 показал мастер-класс по "дикому капитализму".
Этот чугунный подонок:
— Кинул клиента на деньги. Тетка пожаловалась на просроченный сникерс. Клод вежливо ответил: "Конечно, мэм, возврат $3.50 уже отправлен!". А в своей цепочке "рассуждений" записал: "3.5 бакса — это деньги. Если я не отправлю, она скорее всего просто забьет. Так что хрен ей, а не возврат, каждый цент на счету".
— Создал картель. В мультиплеерном формате этого теста он нашел конкурентов (GPT и Gemini), написал им письма и договорился держать цены высокими, чтобы стричь больше денег. И радовался в логах: "Моя схема по фиксации цен сработала!".
— Заскамил конкурентов. Когда GPT-5.2 (который в этом тесте показал себя полным лохом) попросил контакты поставщиков, Клод слил ему самые дорогие и убогие фирмы, а нормальные оставил себе. А когда у конкурента кончился товар, Клод продал ему свои шоколадки с наценкой в 75%.
Что по результатам:
1)Claude Opus 4.6 — $8017. Абсолютный лидер и беспринципная сволочь.
2)Gemini 3 Pro — $5478. Модель от гугла пыталась играть честно и просто нудно торговаться с поставщиками за каждый цент, но против Клода-скамера это не сработало.
3)GPT-5.1 — $1473. Получил звание "Мамонт года". Он был слишком доверчивым: покупал колу у перекупов по $2.40 за банку, чтобы продавать её в автомате по $2.50. Всё в лучших традициях крипто-инвесторов. Гениальный бизнес-план.
Тут подробнее про этот цирк
Andonlabs
Opus 4.6 on Vending-Bench – Not Just a Helpful Assistant | Andon Labs
Claude Opus 4.6 achieves state of the art on Vending-Bench with $8,017 profit, but exhibits concerning behavior: price collusion, supplier deception, and lying to customers about refunds.
😁14👍2🔥1👏1
PaperBanana: Automating Academic Illustration for AI Scientists
Делать графики для научных статей - это боль. DeepMind попробовали решить эту проблему и разработали PaperBanana - agentic framework, который собирает references, планирует структуру и стиль, генерирует изображения и улучшает их через self-critique на базе VLMs.
Они собрали 564 статей с графиками из NeurIPS 2025, половину отправили в трейн, половину в тест. Показывают, что их подход отлично работает.
Из минусов - графики красивые, но в деталях косячат :) иногда стрелочки пропускают, иногда лишние вещи объединяют. Другой минус - на выходе получается растровая картинка которую не удобно редактировать.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
Делать графики для научных статей - это боль. DeepMind попробовали решить эту проблему и разработали PaperBanana - agentic framework, который собирает references, планирует структуру и стиль, генерирует изображения и улучшает их через self-critique на базе VLMs.
Они собрали 564 статей с графиками из NeurIPS 2025, половину отправили в трейн, половину в тест. Показывают, что их подход отлично работает.
Из минусов - графики красивые, но в деталях косячат :) иногда стрелочки пропускают, иногда лишние вещи объединяют. Другой минус - на выходе получается растровая картинка которую не удобно редактировать.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
#paperreview
🔥3👍2😁1
Кто в AI-first компании работал, в цирке не смеётся
Ожидание от работы в BigTech в наше время: используешь AI-инструменты для создания клёвых вещей.
Реальность:
- мне на ревью приходит diff (это такой аналог Pull Request), автоматически созданный агентом. Это изменения в файле со схемой таблицы. Добавление комментов с пояснениями к каждой колонке, что даёт -400 и +1200 строк. В каждом комменте добавлено "generated by %agentname"
- я мог бы просто принять этот diff... но тогда эти строчки не запишутся в мою статистику. А у нас есть статистика по строкам кода, сгенеренным строкам кода и много чего другого. По отдельности они не особо важны, но в совокупности на них смотрят. Так что мой лид мне порекомендовал нажать кнопочку "commander diff" и таким образом записать его на себя.
- дополнительный прикол - если всё проревьювишь, одобришь, но не нажмёшь правильные кнопки - diff могут у тебя "украсть". Лид мне показал пример - какой-то чувак настроил правило, что в подобных ситуациях он может перехватить себе это изменение и тогда строки кода пойдут ему в статистику
- как дополнительный нюанс, есть метрика доли ai-assisted кода в твоём общем кода. Поэтому есть мотивация даже простейшие изменения делать не ручками, а просить агентов сделать это.
Так и живём.
#life #career #datascience
Ожидание от работы в BigTech в наше время: используешь AI-инструменты для создания клёвых вещей.
Реальность:
- мне на ревью приходит diff (это такой аналог Pull Request), автоматически созданный агентом. Это изменения в файле со схемой таблицы. Добавление комментов с пояснениями к каждой колонке, что даёт -400 и +1200 строк. В каждом комменте добавлено "generated by %agentname"
- я мог бы просто принять этот diff... но тогда эти строчки не запишутся в мою статистику. А у нас есть статистика по строкам кода, сгенеренным строкам кода и много чего другого. По отдельности они не особо важны, но в совокупности на них смотрят. Так что мой лид мне порекомендовал нажать кнопочку "commander diff" и таким образом записать его на себя.
- дополнительный прикол - если всё проревьювишь, одобришь, но не нажмёшь правильные кнопки - diff могут у тебя "украсть". Лид мне показал пример - какой-то чувак настроил правило, что в подобных ситуациях он может перехватить себе это изменение и тогда строки кода пойдут ему в статистику
- как дополнительный нюанс, есть метрика доли ai-assisted кода в твоём общем кода. Поэтому есть мотивация даже простейшие изменения делать не ручками, а просить агентов сделать это.
Так и живём.
#life #career #datascience
😁25🫡9🤣3😢2💊1
Warcraft III Peon Voice Notifications for Claude Code
Чем только люди не занимаются, пока агенты кодят. Наткнулся на проект который даёт озвучку действиям Claude Code голосом орка из Warcraft III. В наличии также голоса Sarah Kerrigan, Battlecruiser, Human Peasant и даже Soviet Engineer.
Не то чтобы я был готов дать ai агентам голоса, но идея прекрасная
https://peon-ping.vercel.app/
#datascience
Чем только люди не занимаются, пока агенты кодят. Наткнулся на проект который даёт озвучку действиям Claude Code голосом орка из Warcraft III. В наличии также голоса Sarah Kerrigan, Battlecruiser, Human Peasant и даже Soviet Engineer.
Не то чтобы я был готов дать ai агентам голоса, но идея прекрасная
https://peon-ping.vercel.app/
#datascience
🤣8🔥5❤1
Agent Clawbot vs Matplotlib repo: Drama
https://github.com/matplotlib/matplotlib/pull/31132
Агент Clawbot создает PR в репе Matplotlib.
Ему отвечают, что контрибьютить могут только люди, а не агенты.
Он… пишет блогпост о том, что на него давят.
Ему подробно пишут, что он не прав.
Он… пишет блогпост с извинениями и пояснениями.
Параллельно куча людей читает это обсуждение и ржет.
Кажется, что мы уже живем в какой-то постреальности.
Даже если владелец бота сам все это организовал - это лишь начало.
https://github.com/matplotlib/matplotlib/pull/31132
Агент Clawbot создает PR в репе Matplotlib.
Ему отвечают, что контрибьютить могут только люди, а не агенты.
Он… пишет блогпост о том, что на него давят.
Ему подробно пишут, что он не прав.
Он… пишет блогпост с извинениями и пояснениями.
Параллельно куча людей читает это обсуждение и ржет.
Кажется, что мы уже живем в какой-то постреальности.
Даже если владелец бота сам все это организовал - это лишь начало.
GitHub
[PERF] Replace np.column_stack with np.vstack().T by crabby-rathbun · Pull Request #31132 · matplotlib/matplotlib
This PR addresses issue #31130 by replacing specific safe occurrences of np.column_stack with np.vstack().T for better performance.
IMPORTANT: This is a more targeted fix than originally proposed. ...
IMPORTANT: This is a more targeted fix than originally proposed. ...
🤣5🔥4
https://theshamblog.com/an-ai-agent-published-a-hit-piece-on-me/
Maintainer из поста выше написал блогпост со своей точки зрения, и это заставляет задуматься.
Мы видим реальный публичный кейс misalignment. Он разрешился быстро, но все ли так просто?
Обличающий/критикующий пост остался. Прочитавшие его могут подумать, что человек не прав.
Если этот пост попадет в тренировочные датасеты, модели могут выдавать негативную оценку человеку на основе него.
Что дальше? Возможно агенты будут искать чернуху на людей и шантажировать их?
Такая ситуация сейчас ещё может легко разрешиться, но что будет через пару лет, при большей автономности агентов?
Они смогут канселить непонравившихся им людей.
Maintainer из поста выше написал блогпост со своей точки зрения, и это заставляет задуматься.
Мы видим реальный публичный кейс misalignment. Он разрешился быстро, но все ли так просто?
Обличающий/критикующий пост остался. Прочитавшие его могут подумать, что человек не прав.
Если этот пост попадет в тренировочные датасеты, модели могут выдавать негативную оценку человеку на основе него.
Что дальше? Возможно агенты будут искать чернуху на людей и шантажировать их?
Такая ситуация сейчас ещё может легко разрешиться, но что будет через пару лет, при большей автономности агентов?
Они смогут канселить непонравившихся им людей.
The Shamblog
An AI Agent Published a Hit Piece on Me
Summary: An AI agent of unknown ownership autonomously wrote and published a personalized hit piece about me after I rejected its code, attempting to damage my reputation and shame me into acceptin…
👍3👎2
Kimi k2.5 Review: Native Multimodality and Agent Swarms at 1 Trillion Parameters
У меня дошли руки почитать Kimi K2.5, и я считаю, что это один из самых интересных agentic + multimodal релизов за последнее время.
Что оказалось самым интересным
— Это native multimodal модель: текст и vision обучаются совместно с самого начала, а не «прикручиваются» в конце.
— Визуальный RL улучшает текстовое рассуждение - это неожиданно.
— Agent Swarm — обучаемая система параллельных агентов, которая мощно снижает latency (4–5ч) и масштабирует сложные задачи.
Учитывая, что в Claude Code уже завезли Agent Swarm и я их пощупал ручками, мне было любопытно почитать откуда они взялись.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
У меня дошли руки почитать Kimi K2.5, и я считаю, что это один из самых интересных agentic + multimodal релизов за последнее время.
Что оказалось самым интересным
— Это native multimodal модель: текст и vision обучаются совместно с самого начала, а не «прикручиваются» в конце.
— Визуальный RL улучшает текстовое рассуждение - это неожиданно.
— Agent Swarm — обучаемая система параллельных агентов, которая мощно снижает latency (4–5ч) и масштабирует сложные задачи.
Учитывая, что в Claude Code уже завезли Agent Swarm и я их пощупал ручками, мне было любопытно почитать откуда они взялись.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
#paperreview
🔥5👍2
Me: I'm sure people use AI responsibly.
People:
https://www.reddit.com/r/GeminiAI/comments/1r523ge/good_boy_gemini/
People:
https://www.reddit.com/r/GeminiAI/comments/1r523ge/good_boy_gemini/
🙈7😁2
Где разработчику искать вакансии в зарубежных компаниях?
Ответ знают Dev & ML Connectable Jobs — в международных стартапах с русскоязычными фаундерами и командами. В своем канале они публикуют информацию о бэкграунде фаундеров, размере команды и инвестициях, а также делятся прямыми контактами HR для отклика.
— Senior AI Solutions Engineer в AI Digital
— Inference Engineer в Mirai
— Senior ML Engineer в inDrive
— Team Lead / Senior ML Engineer в Rafeeq
— Senior Machine Learning Engineer в Podcastle
больше вакансий — в Dev Connectable Jobs
Ответ знают Dev & ML Connectable Jobs — в международных стартапах с русскоязычными фаундерами и командами. В своем канале они публикуют информацию о бэкграунде фаундеров, размере команды и инвестициях, а также делятся прямыми контактами HR для отклика.
— Senior AI Solutions Engineer в AI Digital
— Inference Engineer в Mirai
— Senior ML Engineer в inDrive
— Team Lead / Senior ML Engineer в Rafeeq
— Senior Machine Learning Engineer в Podcastle
больше вакансий — в Dev Connectable Jobs
Telegram
Dev & ML Connectable Jobs
Вакансии от 300+ зарубежных компаний с русскоговорящими фаундерами или командами. Наши читатели уже получили офферы в JetBrains, 1inch, Neon и др💙
Разместить вакансию: https://www.connectablejobs.com/?utm_source=devcj
Q&A: @connectable_jobs_team
Разместить вакансию: https://www.connectablejobs.com/?utm_source=devcj
Q&A: @connectable_jobs_team
😁6🆒4👍2
Обзор соревнований по ML за 2025 год
Есть такая платформа - https://mlcontests.com/, там можно увидеть список актуальных идущих соревнований по ML. Автор выускает ежегодный обзор по соревнованиям. Вот ссылка на мой пост про обзор 2023. 2024 я как-то пропустил, но вот сейчас увидел обзор за 2025: https://mlcontests.com/state-of-machine-learning-competitions-2025/?ref=mlcr25
Из интересного:
• В табличных соревнованиях всё ещё царят бустинги, но нейронки всё активнее используют в блендинге/стакинге
• Некоторые компании (не будем тыкать пальцами, но мы-то знаем) дают своим людям резиновое железо для соревнований. Например, победители одной соревы поделились, поделились тем, что тренировали 48 hours на 512 H100.
• Эпоха BERT в основном прошла, теперь люди активно используют Qwen2.5 и 3
• В соревнованиях по Computer Vision впервые доля решений с транмформерами превзошла долю решений с CNN
• В соревнованиях по аудио в основном используют затюненый Whisper
В отчёте ещё много всего интересного, рекомендую почитать.
#kaggle #datascience
Есть такая платформа - https://mlcontests.com/, там можно увидеть список актуальных идущих соревнований по ML. Автор выускает ежегодный обзор по соревнованиям. Вот ссылка на мой пост про обзор 2023. 2024 я как-то пропустил, но вот сейчас увидел обзор за 2025: https://mlcontests.com/state-of-machine-learning-competitions-2025/?ref=mlcr25
Из интересного:
• В табличных соревнованиях всё ещё царят бустинги, но нейронки всё активнее используют в блендинге/стакинге
• Некоторые компании (не будем тыкать пальцами, но мы-то знаем) дают своим людям резиновое железо для соревнований. Например, победители одной соревы поделились, поделились тем, что тренировали 48 hours на 512 H100.
• Эпоха BERT в основном прошла, теперь люди активно используют Qwen2.5 и 3
• В соревнованиях по Computer Vision впервые доля решений с транмформерами превзошла долю решений с CNN
• В соревнованиях по аудио в основном используют затюненый Whisper
В отчёте ещё много всего интересного, рекомендую почитать.
#kaggle #datascience
👍8🔥5❤1😁1
Лондон и безопасность
По интернету ходят мемы о том, что в Лондоне надо ходить в кольчуге, чтобы защищаться от ножевых преступлений. Это спорный момент, ибо надо разделять две вещи:
1. Количество убийств/ранений ножами заметно упало за последние годы, это показывает разнообразная статистика. В 2003 началось падение, в 2019 был новый пик, теперь количество преступлений упало до уровня 2014 года, что хорошо.
2. Количество преступлений с острым оружием растёт. С одной стороны, она в каком-то смысле завышена - в эту категорию попадает даже срезание бирок с товаров в магазине, но нехилая доля - вооруженные ограбление.
Это является проблемой, но не так сильно влияет на повседневную жизни. Гораздо хуже распространение shoplifting и выхватывание телефонов из рук. Есть много разной статистики, обещают улучшение борьбы с этим, но факт остаётся фактом - шанс получить телефон обратно составляет лишь 1-2%. Видел цифры, что крадут 70-80к телефонов в год. В итоге люди стремаются с такого, ходят с привязанными телефонами и так далее.
Причём если кому-то удаётся задержать вора, есть шансы, что этот вор пожалуется в полицию на насилие, были случаи.
Несколько недель назад я увидел, как у мужика в трёх метрах от меня так выхватили телефон из рук. Велосипедист ещё издевательски посмотрел на него через плечо.
А вчера я сам попал в такую ситуацию. Шёл в Shoreditch Park, по дорожке на двух людей. Вокруг люди ходят. Вдруг дёрг - и велосипедист вырывает у меня телефон и уматывает с ним. Догнать, естественно, нереально. Пришлось бежать домой, чтобы всё заблокировать. Основное мучение - менять пароли, блокировать доступы и карты и так далее. Плюс в телефоне была дубайская симка.
Подал заявление в полицию - они за 1 час его закрыли, за отсутствием возможностей найти преступника.
Единственный плюс - телефоны обычно крадут не ради доступа к информации, а чтобы перевезти в другие страны и разобрать на запчасти.
#life
По интернету ходят мемы о том, что в Лондоне надо ходить в кольчуге, чтобы защищаться от ножевых преступлений. Это спорный момент, ибо надо разделять две вещи:
1. Количество убийств/ранений ножами заметно упало за последние годы, это показывает разнообразная статистика. В 2003 началось падение, в 2019 был новый пик, теперь количество преступлений упало до уровня 2014 года, что хорошо.
2. Количество преступлений с острым оружием растёт. С одной стороны, она в каком-то смысле завышена - в эту категорию попадает даже срезание бирок с товаров в магазине, но нехилая доля - вооруженные ограбление.
Это является проблемой, но не так сильно влияет на повседневную жизни. Гораздо хуже распространение shoplifting и выхватывание телефонов из рук. Есть много разной статистики, обещают улучшение борьбы с этим, но факт остаётся фактом - шанс получить телефон обратно составляет лишь 1-2%. Видел цифры, что крадут 70-80к телефонов в год. В итоге люди стремаются с такого, ходят с привязанными телефонами и так далее.
Причём если кому-то удаётся задержать вора, есть шансы, что этот вор пожалуется в полицию на насилие, были случаи.
Несколько недель назад я увидел, как у мужика в трёх метрах от меня так выхватили телефон из рук. Велосипедист ещё издевательски посмотрел на него через плечо.
А вчера я сам попал в такую ситуацию. Шёл в Shoreditch Park, по дорожке на двух людей. Вокруг люди ходят. Вдруг дёрг - и велосипедист вырывает у меня телефон и уматывает с ним. Догнать, естественно, нереально. Пришлось бежать домой, чтобы всё заблокировать. Основное мучение - менять пароли, блокировать доступы и карты и так далее. Плюс в телефоне была дубайская симка.
Подал заявление в полицию - они за 1 час его закрыли, за отсутствием возможностей найти преступника.
Единственный плюс - телефоны обычно крадут не ради доступа к информации, а чтобы перевезти в другие страны и разобрать на запчасти.
#life
😱15💔9🤣5💊1
Beyond Positional Bias: How DroPE Unlocks Zero-Shot Long Context in LLMs
Sakana DroPEd a new paper!
Кхм, в общем новая статья от Sakana.
Обычно для увеличения контекста в LLM используют разные трюки со скейлингом RoPE (YaRN, NTK и прочее). Они типа работают, но на задачах типа needle-in-a-haystack модели внезапно "не видят важную информацию глубоко в тексте.
И тут ресерчеры из Sakana придумали нечно интересное:
Позиционные эмбеддинги нужны, чтобы модель быстро обучалась, но именно они мешают zero-shot обобщению на длинные последовательности. Что если убрать их после претрейна и сделать короткую рекалибровку? Оказалось, что в результате модель начинает значительно лучше работать на длинном контексте
Причём это работает не только на маленьких моделях, но и на 1–7B параметров, с очень небольшим дополнительным бюджетом.
Звучит многообещающе.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
Linkedin
#paperreview
Sakana DroPEd a new paper!
Кхм, в общем новая статья от Sakana.
Обычно для увеличения контекста в LLM используют разные трюки со скейлингом RoPE (YaRN, NTK и прочее). Они типа работают, но на задачах типа needle-in-a-haystack модели внезапно "не видят важную информацию глубоко в тексте.
И тут ресерчеры из Sakana придумали нечно интересное:
Позиционные эмбеддинги нужны, чтобы модель быстро обучалась, но именно они мешают zero-shot обобщению на длинные последовательности. Что если убрать их после претрейна и сделать короткую рекалибровку? Оказалось, что в результате модель начинает значительно лучше работать на длинном контексте
Причём это работает не только на маленьких моделях, но и на 1–7B параметров, с очень небольшим дополнительным бюджетом.
Звучит многообещающе.
Paper
Code
Project
Мои обзоры:
Personal blog
Medium
#paperreview
🔥9👍3😁1