Forwarded from Data Secrets
Плохие новости: там Google нашли фундаментальный баг в RAG
TL;DR: оказалось, что всеми любимый и привычный поиск на эмбеддингах может не всё и имеет серьёзный фундаментальный предел. При фиксированной размерности вектора таким подходом просто невозможно находить все релевантные документы из базы. В своей работе Google доказали это и теоретически, и экспериментально.
О чем вообще речь. Современный поиск и RAG часто опираются на single-vector эмбеддинги: у каждого запроса и документа – по одному вектору, похожесть меряем скалярным произведением/косинусом, дальше берем топ-k ближайших.
И тут возникает вопрос: а вообще возможно ли при фиксированной размерности векторов построить такой поиск, который всегда будет возвращать правильные топ-k документов для любых запросов? Ответ – нет. И сбой происходит уже на очень простых примерах.
Интуитивное объяснение, почему так: чем больше база знаний, тем больше разнообразных комбинаций запросов и релевантных документов нам нужно поддерживать. Но пространство поиска всегда ограничено размерностью эмбеддингов. Так вот, начиная с какого-то числа документов, расположить точки в этом пространстве так, чтобы для каждого запроса мы находили правильные доки, просто невозможно.
Математическое объяснение для любителей:
То есть, например, если у вас эмбеддинги размерности 512, то ваш RAG будет работать нормально, пока документов в вашей базе менее 500 тысяч (а это довольно немного). При размерности 1024 – до ~4 млн. При 4096 – примерно до 250 млн. Дальше система начнет сыпаться.
И эти расчеты Google подвели в идеальных условиях, когда векторы оптимизированы под задачу. На практике, когда вы не дообучаете эмбеддинги, пределы еще ниже.
Чтобы показать это на практике, авторы придумали специальный бенчмарк LIMIT. Он построен так, что у каждого запроса релевантны ровно два документа, но комбинаций этих пар очень много. В итоге даже лучшие современные эмбеддеры (GritLM, Qwen3, Gemini и др.) показывают на LIMIT катастрофически низкий recall – около 20% (причём даже на маленькой версии датасета с 46 документами, караул!).
Для сравнения, классический BM25 или multi-vector модели вроде ColBERT выбивают почти 100%. Фишка в том, что тут мы уже не зажаты одним вектором на документ и запрос. Например, у ColBERT стоится много векторов на документ.
Ну короче, мораль такова: поиск на одном векторе – это удобно и быстро, но у него есть жёсткий фундаментальный предел. Поэтому для серьёзных систем RAG все-таки нужны гибридные подходы: разреженный поиск, multi-vector и прочее. Иначе – потолок😐
Полный текст: On the Theoretical Limitations of Embedding-Based Retrieval
TL;DR: оказалось, что всеми любимый и привычный поиск на эмбеддингах может не всё и имеет серьёзный фундаментальный предел. При фиксированной размерности вектора таким подходом просто невозможно находить все релевантные документы из базы. В своей работе Google доказали это и теоретически, и экспериментально.
О чем вообще речь. Современный поиск и RAG часто опираются на single-vector эмбеддинги: у каждого запроса и документа – по одному вектору, похожесть меряем скалярным произведением/косинусом, дальше берем топ-k ближайших.
И тут возникает вопрос: а вообще возможно ли при фиксированной размерности векторов построить такой поиск, который всегда будет возвращать правильные топ-k документов для любых запросов? Ответ – нет. И сбой происходит уже на очень простых примерах.
Интуитивное объяснение, почему так: чем больше база знаний, тем больше разнообразных комбинаций запросов и релевантных документов нам нужно поддерживать. Но пространство поиска всегда ограничено размерностью эмбеддингов. Так вот, начиная с какого-то числа документов, расположить точки в этом пространстве так, чтобы для каждого запроса мы находили правильные доки, просто невозможно.
Математическое объяснение для любителей:
Представим матрицу A, где строки – это запросы, а столбцы – документы, и на пересечении стоит 1, если документ релевантен, и 0 – если нет. Мы хотим, чтобы поиск на эмбеддингах воспроизводил именно такую матрицу «кто кому подходит». Тогда оценки похожести будут матрицей B = UᵀV, где U и V – это векторы запросов и документов в пространстве фиксированной размерности d. Но sign-rank матрицы (2A−1) может оказаться больше d, а это значит, что никакие d-мерные эмбеддинги не смогут построить B с правильными значениями. Формально: если sign-rank(A) > d, то корректное разделение релевантных и нерелевантных пар в таком пространстве просто невозможно, каким бы мегаумным ни был ваш эмбеддер.
То есть, например, если у вас эмбеддинги размерности 512, то ваш RAG будет работать нормально, пока документов в вашей базе менее 500 тысяч (а это довольно немного). При размерности 1024 – до ~4 млн. При 4096 – примерно до 250 млн. Дальше система начнет сыпаться.
И эти расчеты Google подвели в идеальных условиях, когда векторы оптимизированы под задачу. На практике, когда вы не дообучаете эмбеддинги, пределы еще ниже.
Чтобы показать это на практике, авторы придумали специальный бенчмарк LIMIT. Он построен так, что у каждого запроса релевантны ровно два документа, но комбинаций этих пар очень много. В итоге даже лучшие современные эмбеддеры (GritLM, Qwen3, Gemini и др.) показывают на LIMIT катастрофически низкий recall – около 20% (причём даже на маленькой версии датасета с 46 документами, караул!).
Для сравнения, классический BM25 или multi-vector модели вроде ColBERT выбивают почти 100%. Фишка в том, что тут мы уже не зажаты одним вектором на документ и запрос. Например, у ColBERT стоится много векторов на документ.
Ну короче, мораль такова: поиск на одном векторе – это удобно и быстро, но у него есть жёсткий фундаментальный предел. Поэтому для серьёзных систем RAG все-таки нужны гибридные подходы: разреженный поиск, multi-vector и прочее. Иначе – потолок
Полный текст: On the Theoretical Limitations of Embedding-Based Retrieval
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Судя по всему, новая большая китайская модель выступает на топ-уровне. Называется Meituan LongCat. Опенсорс, но размер слишком большой, чтобы разворачивать дома..
X (formerly Twitter)
Meituan LongCat (@Meituan_LongCat) on X
🚀 LongCat-Flash-Chat Launches!
▫️ 560B Total Params | 18.6B-31.3B Dynamic Activation
▫️ Trained on 20T Tokens | 100+ tokens/sec Inference
▫️ High Performance: TerminalBench 39.5 | τ²-Bench 67.7
🔗 Model: https://t.co/Ljsrj9sI2H
💻 Try Now: https://t.co/Bfu4mIi8fH
▫️ 560B Total Params | 18.6B-31.3B Dynamic Activation
▫️ Trained on 20T Tokens | 100+ tokens/sec Inference
▫️ High Performance: TerminalBench 39.5 | τ²-Bench 67.7
🔗 Model: https://t.co/Ljsrj9sI2H
💻 Try Now: https://t.co/Bfu4mIi8fH
Антропик снижает лимиты на свои модели, которые и так были небольшими… Вчера и без использования безумно дорого Опуса, дважды уперся в ограничения где-то через 1,5 часа диалога.
Перешел на GPT-5. Другой стиль ответов, куда более сухой. И восстановил доступ к Gemini! мой немецкий сервер Гугл стал воспринимать как отечественный и забанил ((
Пришлось поставить еще один..
Перешел на GPT-5. Другой стиль ответов, куда более сухой. И восстановил доступ к Gemini! мой немецкий сервер Гугл стал воспринимать как отечественный и забанил ((
Пришлось поставить еще один..
😢2🤡1
Прикольно, за 3 бакса в месяц можно себе в Claude Code подселить модельку GLM-4.5. Это хорошая опенсорсная модель (320b параметров - себе поставить непросто), так что, в свете ограничения лимитов на Клода, идея не выглядит такой уж глупой. Классно, что ее интегрировали с привычным уже для многих продуктом
Telegram
Анализ данных (Data analysis)
🚀 Новый тариф GLM Coding Plan для Claude Code!
Теперь работать с GLM-4.5 стало проще и дешевле:
- 💸 Цена снизилась в 7 раз
- ⚡️ В 3 раза больше промптов для задач по коду
🟠Get started: http://z.ai/subscribe
🟠Integration guide: http://docs.z.ai/scenario…
Теперь работать с GLM-4.5 стало проще и дешевле:
- 💸 Цена снизилась в 7 раз
- ⚡️ В 3 раза больше промптов для задач по коду
🟠Get started: http://z.ai/subscribe
🟠Integration guide: http://docs.z.ai/scenario…
Forwarded from Machinelearning
Что внутри:
- Доступны модели Hunyuan-MT-7B и Hunyuan-MT-Chimera-7B
- Поддержка 33 языков
- Chimera-7B — это первая в индустрии откртытая ансамблевая модель
- 1-е место в 30 из 31 категорий на международном конкурсе WMT25 (Workshop on Machine Translation 2025, крупнейшая в мире конференция-соревнование по машинному переводу)
- Hunyuan-MT-7B лидирует среди моделей своего размера
Demo: https://hunyuan.tencent.com/modelSquare/home/list
@ai_machinelearning_big_data
#AI #NLP #Translation #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🚀 HunyuanWorld-Voyager — AI, для генерации 3D миров
Tencent представили **HunyuanWorld-Voyager** — первый в мире open-source AI, который совмещает генерацию видео и нативную 3D-реконструкцию.
✨ Что это значит:
✅ Видео сразу превращается в полноценные 3D-сцены, без лишних инструментов
✅ Модель «помнит» пространство и сохраняет правильную геометрию под любым углом
✅ №1 в рейтинге Stanford WorldScore по видео и 3D-реконструкции
🎮 Использование: VR, игры, симуляции, 3D-проекты — управление с клавиатуры или джойстика.
🌐 Project Page: https://3d-models.hunyuan.tencent.com/world/
💻 GitHub: https://github.com/Tencent-Hunyuan/HunyuanWorld-Voyager
🤗 HuggingFace: https://huggingface.co/tencent/HunyuanWorld-Voyager
📄 PDF: https://3d-models.hunyuan.tencent.com/voyager/voyager_en/assets/HYWorld_Voyager.pdf
🏆 Leaderboard: https://huggingface.co/spaces/Howieeeee/WorldScore_Leaderboard
@ai_machinelearning_big_data
#AI #3D #VR #Gaming #OpenSource
Tencent представили **HunyuanWorld-Voyager** — первый в мире open-source AI, который совмещает генерацию видео и нативную 3D-реконструкцию.
✨ Что это значит:
✅ Видео сразу превращается в полноценные 3D-сцены, без лишних инструментов
✅ Модель «помнит» пространство и сохраняет правильную геометрию под любым углом
✅ №1 в рейтинге Stanford WorldScore по видео и 3D-реконструкции
🎮 Использование: VR, игры, симуляции, 3D-проекты — управление с клавиатуры или джойстика.
🌐 Project Page: https://3d-models.hunyuan.tencent.com/world/
💻 GitHub: https://github.com/Tencent-Hunyuan/HunyuanWorld-Voyager
🤗 HuggingFace: https://huggingface.co/tencent/HunyuanWorld-Voyager
📄 PDF: https://3d-models.hunyuan.tencent.com/voyager/voyager_en/assets/HYWorld_Voyager.pdf
🏆 Leaderboard: https://huggingface.co/spaces/Howieeeee/WorldScore_Leaderboard
@ai_machinelearning_big_data
#AI #3D #VR #Gaming #OpenSource
Forwarded from Анализ данных (Data analysis)
🗣 TaDiCodec — новый токенайзер речи, который умеет экстремально сжимать звук без потери качества.
Что в нём особенного:
- ⚙️ Метод Binary Spherical Quantization (BSQ) — никакого «развала» кодбука
- 🎯 Латенты превращаются в дискретные токены через простую бинаризацию
- 📦 Кодбук на 16,384 токена
- 📉 Супернизкий битрейт: 0.0875 kbps при 24 kHz
- 🌀 Архитектура на diffusion autoencoder — без GAN’ов и сложных костылей
👉 TaDiCodec показывает: можно сжимать аудио в десятки тысяч раз и всё равно сохранять качество речи.
🟠 HF: https://huggingface.co/amphion/TaDiCodec
🟠 Github: https://github.com/HeCheng0625/Diffusion-Speech-Tokenizer
@data_analysis_ml
Что в нём особенного:
- ⚙️ Метод Binary Spherical Quantization (BSQ) — никакого «развала» кодбука
- 🎯 Латенты превращаются в дискретные токены через простую бинаризацию
- 📦 Кодбук на 16,384 токена
- 📉 Супернизкий битрейт: 0.0875 kbps при 24 kHz
- 🌀 Архитектура на diffusion autoencoder — без GAN’ов и сложных костылей
👉 TaDiCodec показывает: можно сжимать аудио в десятки тысяч раз и всё равно сохранять качество речи.
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Могла бы быть интересная история, но русского нет, на маках не запускается, будет работать на RTX 3090 24gb, NVIDIA GPU обязательна…
https://t.me/machinelearning_interview/2139
https://t.me/machinelearning_interview/2139
Telegram
Machine learning Interview
🎙 Microsoft представила VibeVoice-Large — open-source TTS модель для выразительных, продолжительных диалогов (и подкастов).
Что делает её особенной:
- Синтезирует до 45 минут речи с четырьмя разными голосами — намного больше, чем у большинства моделей.…
Что делает её особенной:
- Синтезирует до 45 минут речи с четырьмя разными голосами — намного больше, чем у большинства моделей.…
❤1
Forwarded from Machinelearning
- Более 20 коннекторов на базе MCP — от Databricks и Snowflake до GitHub и Asana.
- Новая функция Memories — ассистент запоминает важные взаимодействия, а пользователь может полностью управлять памятью (добавлять, редактировать, удалять).
Обновления делают Le Chat одним из самых удобных и готовых к бизнес-задачам AI-ассистентов.
Попробовать можно на сайте chat.mistral.ai или в мобильном приложении.
@ai_machinelearning_big_data
#MistralAI #LeChat #AIassistant #MCP
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Больших новостей с утра нет, расскажу немного о своих поисках. Настраиваю сейчас американский сервер - мой немецкий Gemini воспринимать перестал. Все работает, но так как там будет стоять несколько программ, ставлю себе Caddy для обратного прокси.
Настраивал этот Caddy с Claude, GPT-5, Gemini. Опыт примерно такой:
со всеми нейронками так или иначе продвигались, но с Клодом неудачных редакций и переделок было прямо много, плюс после часа работы закончились лимиты. Вообще, они очень быстро стали утекать, особенно, если модель ходит в интернет. Антропик прямо рубит бабло, раздражает.
GPT-5 работает, тоже с ошибками, пишет суше - и этот стиль мне сильно меньше нравится.
А Gemini - мой безусловный фаворит. Во-первых, ошибок меньше, поиск проблем лучше. Во-вторых он все объясняет, что делаем. Очень помогает разобраться, а не просто решить частную задачу. Пишет что, куда и зачем, Клод тоже это делает, но хуже и ошибок больше. Прямо нравится, к тому же бесплатно. Google респект
Настраивал этот Caddy с Claude, GPT-5, Gemini. Опыт примерно такой:
со всеми нейронками так или иначе продвигались, но с Клодом неудачных редакций и переделок было прямо много, плюс после часа работы закончились лимиты. Вообще, они очень быстро стали утекать, особенно, если модель ходит в интернет. Антропик прямо рубит бабло, раздражает.
GPT-5 работает, тоже с ошибками, пишет суше - и этот стиль мне сильно меньше нравится.
А Gemini - мой безусловный фаворит. Во-первых, ошибок меньше, поиск проблем лучше. Во-вторых он все объясняет, что делаем. Очень помогает разобраться, а не просто решить частную задачу. Пишет что, куда и зачем, Клод тоже это делает, но хуже и ошибок больше. Прямо нравится, к тому же бесплатно. Google респект
Forwarded from Неискусственный интеллект (Oleg Salmanov)
Сегодня уже даже Сэм Альтман говорит об ИИ-пузыре. Но чтобы лопнуть любой пузырь нужна иголка, и кажется в нашем случае она найдена. Но для полноты картины нам придется мысленно вернуться в 2008 год.
Год этот был горячим: банки, страховые компании и рейтинговые агентства активно создавали ипотечный пузырь — выдавали сомнительные кредиты, перемешивали их с качественными, переводили в деривативы — и одновременно ставили против этой же пирамиды. Магнатом этой схемы стал хедж-фонд Magnetar — он не просто вложился, а фактически раскрутил механизм, заработав на обвале. Именно эти ребята придумали схему, которую так и назвали: Magnetar trade, когда финансист, раскручивая пузырь, ставит одновременно против него, страхуясь от краха.
Сегодня этот фонд вышел из вековечной тени и, кажется, повторяет ипотечную стратегию с GPU на базе компании CoreWeave. В новом инвестиционном цикле Magnetar придумали получать/выдавать деньги под залог GPU Nvidia. Именно так при участии Magnetar в прошлом году CoreWeave получили кредит от Blackstone. Эта схема открыла для AI-компаний, для которых до этого GPU были не активом, а пассивом, путь к кредитному финансированию, чтобы закупать больше процессоров у Nvidia, и снова закладывать их. Ничего не напоминает?
Magnetar вложила около $500 млн в долги и акции CoreWeave, а сегодня его доля в CoreWeave составляет 29% (!) и оценивается в более, чем $11 млрд. Хедж-фонд оказался с громадной бумажной прибылью — баснословные 56% годовых. По сути Magnetar уже не хедж фонд, вкладывающийся сбалансировано в разные истории, а венчурный капиталист. CoreWeave составляет половину от стоимости его активов. Но попытка выхода из этой позиции, чтобы зафиксировать прибыль, может привести к катастрофе, став спусковым крючком кризиса.
Дополнительную тревогу вызывает тесное переплетение интересов. Топ-менеджеры Magnetar переходят в CoreWeave, получая опционы на десятки миллионов долларов. Подобно тому, как рейтинговые агентства и банки до кризиса subprime одновременно обслуживали и создавали рынок ипотечных бумаг, здесь фонд и компания фактически оказываются «в одной лодке».
В новой «финансовой алхимии» замешана, к слову, и Nvidia. Компания получила долю в CoreWeave не за деньги, а за поставки GPU, превращая чипы в капитализацию компании. Напомним, что когда IPO пошло не слишком успешно, Nvidia выкупила за пару дней до размещения значительную часть акций — искусственно поддержав цену и поддувая пузырь дальше.
Кредиты CoreWeave (около $12,9 млрд) обеспечены именно GPU и контрактами — от Microsoft и других — и долговая нагрузка продолжает расти. В кредит все чаще строят и другие мегапроекты кампусов AI-датацентров. Это кредиты на десятки миллиардов долларов, которые будут упакованы и проданы дальше, чтобы снизить риски, а точнее — размазать их по всему рынку.
В 2008 году система рухнула, когда стало ясно, что залог стоит меньше кредита, то есть, что ипотечные кредиты не могут обслуживаться. Сегодня, кредиты под залог инфраструктуры работают только если рынку удастся доказать, что эти GPU могут зарабатывать AI-компаниям больше, чем они потратили на инфраструктуру. В случае же банкротства CoreWeave (или любой другой крупной облачной компании) банки попробуют реализовать залог, то есть получить процессоры Nvidia и продать их. И это может привести к эффекту домино, когда стоимость GPU упадет и банки потребуют довнести залог или деньги назад.
История вокруг CoreWeave и фонда Magnetar представляют пока только первый и второй акт этой трагедии: это ружье пока еще только заряжено и висит на стене. Но если оно выстрелит, то это может стать повторением subprime-кризиса 2008 года, только уже в инфраструктуре искусственного интеллекта.
@anti_agi
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Machinelearning
400 страниц про всё, что нужно знать об агентных системах. Автор — senior engineer в Google, выложил драфт для открытого ревью.
📖 В книге:
- продвинутые техники промптинга
- паттерны для мульти-агентов
- использование инструментов и MCP
- практические примеры с кодом
⚡ По сути, это полный справочник по построению умных агентов. Must-read для разработчиков AI.
@ai_machinelearning_big_data
#AI #Agents #Google #OpenSource #freebook
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
На рынке агентов в командной строке прибавление - Warp Code. Акцентируют внимание на удобный и красивый интерфейс, ну и не только. Попрошу Клода написать подробнее
Вообще, с Клодом прикольно про новинки писать, сам много нового из этих сообщений узнаешь, только лимиты он с интернет поиском жрет очень активно
Вообще, с Клодом прикольно про новинки писать, сам много нового из этих сообщений узнаешь, только лимиты он с интернет поиском жрет очень активно
Warp
Introducing Warp Code: the fastest way from Prompt to Production
Features for shipping agent-generated code all the way from prompt to production. Code review, lightweight file editor, WARP.md— all with a top-rated coding agent.
🚀 Warp Code: новый подход к AI-кодингу с живым diff-трекингом
Вчера Warp выпустили Warp Code — набор функций для более контролируемого кодинга с AI-агентами. Это продолжение развития Warp 2.0 "Agentic Development Environment", запущенного в июне.
Ключевая фишка — живой просмотр изменений кода. В отличие от других CLI-агентов, где "скрещиваешь пальцы и надеешься", Warp Code показывает каждый diff в реальном времени. Можно комментировать изменения на лету и корректировать агента прямо в процессе работы
.
🖥️📱 Системные требования и производительность
Поддержка Mac (Apple Silicon), Linux, Windows
Бесплатная версия: 150 AI-запросов/месяц
Автоматическое исправление ошибок компилятора
Интегрированный редактор кода (без переключения в IDE)
🔥💬 Отзывы сообщества и рост Warp стремительно растет: 600k активных пользователей, прибавляют $1M ARR каждые 10 дней. В бенчмарках показывает серьезные результаты — #1 на Terminal-Bench (52%) и top-5 на SWE-bench Verified (71%). Пользователи отмечают экономию 6-7 часов в неделю благодаря многопоточности агентов.
🔗 Основные ссылки:
🏠 Официальный сайт Warp
🐙 GitHub репозиторий
📊 Подробности о Warp 2.0
💬 Сообщество:
Обсуждение на TechCrunch
#WarpCode #AIDevelopment #CodingAgents
Вчера Warp выпустили Warp Code — набор функций для более контролируемого кодинга с AI-агентами. Это продолжение развития Warp 2.0 "Agentic Development Environment", запущенного в июне.
Ключевая фишка — живой просмотр изменений кода. В отличие от других CLI-агентов, где "скрещиваешь пальцы и надеешься", Warp Code показывает каждый diff в реальном времени. Можно комментировать изменения на лету и корректировать агента прямо в процессе работы
.
🖥️📱 Системные требования и производительность
Поддержка Mac (Apple Silicon), Linux, Windows
Бесплатная версия: 150 AI-запросов/месяц
Автоматическое исправление ошибок компилятора
Интегрированный редактор кода (без переключения в IDE)
🔥💬 Отзывы сообщества и рост Warp стремительно растет: 600k активных пользователей, прибавляют $1M ARR каждые 10 дней. В бенчмарках показывает серьезные результаты — #1 на Terminal-Bench (52%) и top-5 на SWE-bench Verified (71%). Пользователи отмечают экономию 6-7 часов в неделю благодаря многопоточности агентов.
🔗 Основные ссылки:
🏠 Официальный сайт Warp
🐙 GitHub репозиторий
📊 Подробности о Warp 2.0
💬 Сообщество:
Обсуждение на TechCrunch
#WarpCode #AIDevelopment #CodingAgents
Warp
Warp — The Open Platform for Automating Development
Infrastructure to build, measure, and interact with agents across your SDLC — so you ship more and spend less.
Gemini просто великолепен. Разбираем тут очередные настройки - в комментариях оставлю то, как он объясняет в чем была проблема. Собственно равно так и начинаешь разбираться что это за протоколы, и как это работает