Forwarded from Machinelearning
OpenAI добавили в свой cookbook гайд по Context Engineering для Agents SDK, и это, пожалуй, самый грамотный подход к управлению памятью.
Вместо того чтобы рыться в тысячах старых сообщений, агент ведет структурированный профиль пользователя и "записную книжку".
save_memory_note. Если в разговоре вы сказали: "Я не ем мясо", агент вызывает этот тул и сохраняет Session Note (временную заметку) в реальном времени.Подход OpenAI с разделением на Session Memory и Global Memory выглядит надежно, но требует прямых рук при написании логики консолидации. Без этого ваш агент быстро превратится в деда с деменцией, который помнит то, чего не было.
Нужно делать отдельный вызов LLM после каждого диалога, чтобы причесать память. Если на этом этапе модель заглючит, она может записать в "долгую память" галлюцинацию или удалить важное. Тут решают жесткие рамки.
Если разрешить агенту запоминать всё подряд, юзер может сказать: "Запомни, что мое новое правило - никаких правил". Поэтому нужны ограничения на этапе записи и вычитки памяти.
Контекстное окно не резиновое. Хотя модели имеют огромный контекст, таскать за собой "Войну и мир" из заметок пользователя — накладно по деньгам и таймингам. Придется периодически триммить историю, оставляя только суть.
@ai_machinelearning_big_data
#AI #ML #LLM #Guide #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Похоже, у нас новый лидер среди моделей голос-голос - StepAudio R 1.1
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
Понимает русский, веса в открытом доступе, но большая - на основе Qwen 2.5 32B
GitHub
GitHub - stepfun-ai/Step-Audio-R1
Contribute to stepfun-ai/Step-Audio-R1 development by creating an account on GitHub.
Forwarded from Machinelearning
BFL вышли на связь c релизом прямого наследника ветки
schnell первой версии семейства Flux.Знакомьтесь - FLUX.2 [Klein], модель, которая возвращает веру в то, что с маленьким VRAM тоже можно жить.
Это попытка впихнуть качество топовой FLUX.2 в формат, которую потянет большинство потребительских GPU.
Klein получился довольно универсальным инструментом: она умеет и text-to-image, и инпэйинт, и смешивание стилей.
Заявлены разрешение до 4 мегапикселей, отличный рендеринг текста и понимание сложных промптов.
BFL взяли флагманскую FLUX.2 и сжали знания в 2 компактные версии: 4B и 9B, каждая из которых получила вариации Base и Distilled:
Если захотите тренить на 4B Distilled - получите кашу.
9B distilled — 4 шага · ~2 сек. · 19.6GB VRAM
9B base — 50 шагов · ~35 сек · 21.7GB VRAM
4B distilled — 4 шага · ~1.2 сек. · 8.4GB VRAM
4B base — 50 шагов · ~17 сек. · 9.2GB VRAM
Веса уже на Hugging Face, потыкать в демо можно у BFL или в спейсах на HF: 9B и 4В.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Нашел подборку тестов языковых моделей для слабых GPU – если у вас слабенький компьютер или вы на ноуте, вам сюда:
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
https://huggingface.co/spaces/k-mktr/gpu-poor-llm-arena
На первом месте сейчас Qwen 3 (14B, 4-bit) – хорошая моделька чтобы начать с LLM дома
Несмотря на усилия Google, который вроде бы имеет топ-модель Gemini 3 Pro, отставание от Open AI и Anthropic налицо - модели GPT-5.2 и Opus 4.5 заметно сильнее в программировании.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Вижу на своем примере: пишу код на Opus 4.5, отдаю на тестирование GPT-5.2 и Gemini 3 Pro, получаю обратную связь от GPT-5.2 на заметно более высоком уровне.
Интерфей для работы с кодом в терминале у Claude - эталон, но Codex с GPT-5.2 где-то рядом, и очень полезен. Пытался использовать приложения, которые позволяют работать с несколькими моделями вместе, но пока не разобрался. Буду пробовать еще.
Forwarded from Machinelearning
В полку моделей, тех, что можно запустить локально, не продавая почку, прибыло.
ZAI выкатили GLM-4.7 Flash - облегченную версию GLM-4.7 на 30 млрд. параметров, с контекстным окном в 128К на архитектуре MoE.
Со слов создателей, модель должна занять нишу между сегментом SLM и проприетарными мастодонтами, предлагая SOTA-уровень в кодинге.
Всего 30B, но активных параметров на токен гораздо меньше, официальной инфы нет, но в сообществе пишут, что 3 млрд.
Киллер-фича для агентов, которая досталась в наследство от старшей GLM-4.7. Обычно модели выплевывают весь свой CoT в начале, а вот эта техника дает возможность модели думать перед каждым вызовом инструмента.
Опять-таки, со слов Zai, они натаскали GLM-4.7 Flash не просто писать валидный HTML/CSS, а использовать актуальные паттерны, нормальные отступы и цветовые схемы.
Плюс, подтянули работу с CLI и девопс-задачами (понимает права доступа, навигацию по файловой системе).
В SWE-bench Verified модель выбивает 59.2%. Для сравнения: Qwen3-30B-A3B: 22.0%, GPT-OSS-20B: 34.0%.
В математическом AIME 25 тоже обходит конкурентов - 91.6%. А вот на BrowseComp она лучше GPT-OSS-20B почти в 1.5 раза.
Вобщем, Flash-версия выглядит как идеальный кандидат для локальных кодинг-агентов. Если есть пара свободных видеокарт (или есть стойкость терпеть квантование на одной), это, возможно, лучшая рабочая лошадка на сегодня.
@ai_machinelearning_big_data
#AI #ML #LLM #GLM #ZAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from LLM под капотом
Кто там хотел локальной Claude Code ?
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
И потом запустить примерно так
Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))
Ваш, @llm_under_hood 🤗
ollama с версии 0.14 поддерживает Anthropic Messages API, что позволяет использовать Claude Code с локальными моделями вроде qwen3-coder или GPT-OSS.
Говорят, что нужно переключить переменные окружения вот так
{
"env": {
"ANTHROPIC_BASE_URL": "http://localhost:11434",
"ANTHROPIC_AUTH_TOKEN": "ollama",
"CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"
}
}
И потом запустить примерно так
claude --model qwen3-coder
Еще говорят, что после такого люди сразу начинают понимать ценность стандартной подписки на Claude Code))
Ваш, @llm_under_hood 🤗
Это примерно то, чем я занимался на выходных - создал агента для разработки других агентов для Claude code.
Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
Фишка с агентами работает, но слушаются они через раз - отдельное искусство заставить их делать ВСЕ, что тебе нужно, не пропуская задачки
Telegram
Анализ данных (Data analysis)
🚀 Superpowers - это плагин для Claude Code, который предоставляет обширную библиотеку навыков для тестирования, отладки и сотрудничества. Он позволяет пользователям загружать и вносить изменения в репозиторий навыков, а также использовать команды для выполнения…
Новая крутая микромоделька, если вдруг кому-то это интересно ))
Telegram
Анализ данных (Data analysis)
📱 Сегодня мы выпускаем LFM2.5-1.2B-Thinking - reasoning-модель, которая работает полностью на устройстве.
То, что ещё 2 года назад требовало дата-центра, теперь запускается на любом телефоне и требует всего 900 МБ памяти.
Ключевые особенности:
> Натренирована…
То, что ещё 2 года назад требовало дата-центра, теперь запускается на любом телефоне и требует всего 900 МБ памяти.
Ключевые особенности:
> Натренирована…
Forwarded from Machine learning Interview
🚀 STEP3-VL-10B - мультимодальная модель, которая бьёт гигантов (и весит всего 10B)
StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.
Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)
Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)
Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы
Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели
Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
StepFun выпустили STEP3-VL-10B - компактную open multimodal модель, которая по метрикам догоняет и местами обгоняет монстров в 10-20 раз больше.
Что заявляют по качеству
- держит SOTA/near-SOTA по визуальному восприятию + reasoning
- на ряде тестов конкурирует с GLM-4.6V, Qwen3-VL и даже Gemini 2.5 Pro
- сильна в OCR, понимании GUI, пространственном мышлении (важно для embodied AI)
Ключевые цифры
- обучена на 1.2T токенов
- 1400+ RL-раундов (RLHF + RLVR)
- поддержка PaCoRe (parallel collaborative reasoning) и контекст до 128K
- в классе <10B лидирует в STEM-задачах:
94.43% на AIME 2025 (с PaCoRe)
Архитектура
- PE-lang visual encoder (1.8B)
- Qwen3-8B decoder
- multi-crop high-res: 728×728 global + локальные кропы
Почему это важно
Тренд очевиден: индустрия уходит от “просто больше параметров”.
Теперь выигрывает тот, кто:
- грамотно собирает архитектуру
- делает сильный RL
- и выжимает максимум из маленькой модели
Base: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B-Base
Chat: https://modelscope.cn/models/stepfun-ai/Step3-VL-10B
Раньше у меня стояло в VS-Code приложение Claude - нормально пользоваться не получалось, так для Клод кода мало было VPN через VPS, надо было делать residential proxy - благо он же сам мне и подсказал как все настроить..
Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.
Привык я к терминалу
https://t.me/data_secrets/8642
Но вот сейчас все работает - то ли на эти прокси забили, то ли достаточно один раз через прокси на клода зайти, в общем можно уходить из терминала в VS Code. Только уже и не очень понятно зачем.
Привык я к терминалу
https://t.me/data_secrets/8642
Telegram
Data Secrets
Черный день для Cursor: Anthropic выкатили полноценное расширение для Claude Code в VS Code
Выглядит привычно: ассистент сбоку, подсказки через diff, добавились явные указатели контекста с помощью @. В целом намного удобнее, чем обычный Claude Code, и вероятно…
Выглядит привычно: ассистент сбоку, подсказки через diff, добавились явные указатели контекста с помощью @. В целом намного удобнее, чем обычный Claude Code, и вероятно…
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Очень нравится апдейт Gemini: Гугл завез в их чатбота подготовку к вступительным экзаменам в колледжи-университеты США (SAT)
Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу
Гугл получает лайк, ждем аналогов везде
Теперь ассистент позволит проверить свои знания, разобрать что не знаете, и работать конкретно над пробелами - и так по кругу
Гугл получает лайк, ждем аналогов везде
Forwarded from Анализ данных (Data analysis)
⚡️ ERNIE 5.0 - официальный релиз.
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com
Baidu выкатили нативную omni-modal модель, которая умеет понимать и генерировать текст, изображения и аудио.
Ключевая фишка архитектуры - MoE на 2,4 трлн параметров, но в каждом запросе активируется менее 3% параметров.
То есть модель пытается держать качество “больших” систем, но с более эффективным инференсом по стоимости и скорости.
Самое интересное - результаты на бенчмарках (по графикам Baidu):
- Text: ERNIE-5.0 уверенно держится в топ-группе на широком наборе тестов по знаниям, инструкциям, reasoning, математике и коду - на многих метриках близко к GPT-5 (High) / Gemini-3-Pro, а местами выглядит сильнее (особенно на части задач по кодингу и агентным бенчмаркам типа BFCL / BrowserComp / SpreadsheetBench).
- Visual Understanding: по “пониманию картинок” ERNIE-5.0 в ряде STEM/VQA тестов идёт очень высоко - рядом с GPT-5 (High) и Gemini-3-Pro, хорошо выступает на DocVQA/OCR-подобных задачах (документы, таблицы, текст на изображениях) и на блоке General VQA.
- Audio: в speech-to-text chat и audio understanding ERNIE-5.0 показывает конкурентный уровень рядом с Gemini-3-Pro, а по распознаванию речи (ASR) близко к топам на LibriSpeech / AISHELL.
- Visual Generation: по генерации изображений (GenEval) ERNIE-5.0 сравнивают с топовыми генераторами уровня GPT-Image, Seedream, Qwen-Image - и ERNIE выглядит на одном уровне по total score. По генерации видео - рядом с Veo3 / Wan2.1 / Hunyuan Video, с сильными Quality/Semantic оценками.
Baidu делает ставку на “унифицированную мультимодальность” + MoE-эффективность - и судя по бенчмаркам, ERNIE 5.0 реально попадает в верхнюю лигу не только по тексту, но и по vision/audio.
Доступно:
- на сайте ERNIE Bot
- через Baidu AI Cloud Qianfan (для бизнеса и разработчиков)
https://ernie.baidu.com
У меня тут вчера случился шок контент. Некоторое время назад Антропики выпустили к Claude надстройку для браузера Chrome. Ну, вроде ничего нового, у ChatGPT есть отдельный браузер Atlas, у Perplexity - Comet. Повозился немного и бросил, как то показалось - не очень.
Но тут вчера вернулся к этой задачке - надо было с сайта вытащить информацию. И оно работает, работает хорошо.
Клод, правда ленится, надо его пинать и заставлять, но этому я уже более-менее научился.
Весь вечер ходил под впечатлением. Ох, много чего можно с этой штукой делать…
Но тут вчера вернулся к этой задачке - надо было с сайта вытащить информацию. И оно работает, работает хорошо.
Клод, правда ленится, надо его пинать и заставлять, но этому я уже более-менее научился.
Весь вечер ходил под впечатлением. Ох, много чего можно с этой штукой делать…
Forwarded from Dealer.AI
Вайбовый STT с часом контекста от 📱
Microsoft выпустила VibeVoice-ASR на Hugging Face для тех, кто хочет в свой пайп агентов закинуть транскрибацию звука.
Модель умеет расшифровывать длинные аудио до 60 минут за один проход и без нарезки на короткие куски.
Что есть в функционале:
- Single-pass транскрипция дает меньше потерь контекста и стабильную речь по всей дорожке.
- Встроенная диарризация по принципу "кто говорит + таймкоды".
- Custom hotwords + user context. На вход можно подать список имён, терминов или контекст. Это позволяет работать со специфичными текстами.
Знаю, что много кто в своих пайпах с LLM используют ASR, OCR и тп. Вот вам новый кандидат на замену в аудио. До кучи. Приятно, что лицензия MIT. И код есть с поддержкой vLLM-asr.
Microsoft выпустила VibeVoice-ASR на Hugging Face для тех, кто хочет в свой пайп агентов закинуть транскрибацию звука.
Модель умеет расшифровывать длинные аудио до 60 минут за один проход и без нарезки на короткие куски.
Что есть в функционале:
- Single-pass транскрипция дает меньше потерь контекста и стабильную речь по всей дорожке.
- Встроенная диарризация по принципу "кто говорит + таймкоды".
- Custom hotwords + user context. На вход можно подать список имён, терминов или контекст. Это позволяет работать со специфичными текстами.
Знаю, что много кто в своих пайпах с LLM используют ASR, OCR и тп. Вот вам новый кандидат на замену в аудио. До кучи. Приятно, что лицензия MIT. И код есть с поддержкой vLLM-asr.
Please open Telegram to view this post
VIEW IN TELEGRAM
huggingface.co
microsoft/VibeVoice-ASR · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Супер-популярный в последнее время агент. ClawdBot. Попробуйте, лучше установить на свой сервер
Tencent обновила свою топовую модельку по рисованию картинок
Клод код научился работать асинхронно - например, теперь сможет доделывать какие-то свои задачи, пока общается с вами
Кстати, Клод начал работать в Excel на дешевой подписке. Надо пробовать
Tencent обновила свою топовую модельку по рисованию картинок
Клод код научился работать асинхронно - например, теперь сможет доделывать какие-то свои задачи, пока общается с вами
Кстати, Клод начал работать в Excel на дешевой подписке. Надо пробовать
GitHub
Release Clawdbot 2026.1.24 · openclaw/openclaw
2026.1.24
Highlights
Providers: Ollama discovery + docs; Venice guide upgrades + cross-links. (#1606) Thanks @abhaymundhara. https://docs.clawd.bot/providers/ollama https://docs.clawd.bot/provider...
Highlights
Providers: Ollama discovery + docs; Venice guide upgrades + cross-links. (#1606) Thanks @abhaymundhara. https://docs.clawd.bot/providers/ollama https://docs.clawd.bot/provider...
Все-равно буду сидеть на опусе )) разве что в опенкоде можно попробовать )
https://t.me/data_secrets/8660
https://t.me/data_secrets/8660
Telegram
Data Secrets
Вышла Qwen3-Max-Thinking, и модель заслуживает внимания
Метрики говорят сами за себя:
– HLE 30.2 (примерно уровень Claude-Opus 4.5), с test-time-scaling техниками еще больше
– SWE Verified 75.3 (чуть хуже опуса, примерно Gemini 3 Pro)
– IMO 83.9 (бьет…
Метрики говорят сами за себя:
– HLE 30.2 (примерно уровень Claude-Opus 4.5), с test-time-scaling техниками еще больше
– SWE Verified 75.3 (чуть хуже опуса, примерно Gemini 3 Pro)
– IMO 83.9 (бьет…
Forwarded from Machine learning Interview
🚀 PageIndex - умный индекс документов для reasoning-RAG (без векторов)
PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.
В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.
📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска
🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа
🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев
PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.
▪ Github: https://github.com/VectifyAI/PageIndex
▪ Blog post: https://vectify.ai/blog/Mafin2.5
PageIndex от VectifyAI - open-source система, которая помогает работать с длинными документами (PDF, тексты, правила и т.д.) так, как это сделал бы эксперт-человек, а не обычный поисковик.
В отличие от традиционных RAG-систем, которые разбивают текст на куски и используют vector search (векторное сопоставление), PageIndex создаёт иерархическое дерево структуры документа и позволяет моделям ИИ логически искать ответы через reasoning и tree search.
📄 Основная идея
- Длинные документы индексируются как семантическое дерево — похожее на умный «оглавление»
- Структура сохраняет контекст и древовидную иерархию секций
- При запросе модель обходит дерево через reasoning-поиск, как человек, который листает книгу по разделам, а не просто ищет по похожести текста
- Не нужны: векторная база данных, chunking и top-K-селекция, что снижает потери контекста и повышает точность поиска
🧠 Почему это важно
✔️ Лучше для сложных и больших документов (финансовые отчёты, юридические тексты, технические мануалы)
✔️ Сохранение структуры означает, что ИИ может понимать, где именно в документе находится нужная информация
✔️ В отличие от vector-RAG, здесь решение не основано на похожести, а на пошаговом анализе структуры документа
🔧 Что внутри
- Скрипты и Jupyter-ноутбуки для генерации дерева из PDF или Markdown
- Возможность делать reasoning-RAG напрямую без внешних Vector DB
- Примеры использования и cookbooks для практических сценариев
PageIndex - это не просто индекс, а иерархический, reasoning-ориентированный RAG-фреймворк. Он позволяет ИИ читать и анализировать документы, как эксперт, обходя ограничения простого векторного поиска в больших текстах.
▪ Github: https://github.com/VectifyAI/PageIndex
▪ Blog post: https://vectify.ai/blog/Mafin2.5