🤖 С роботом пока так.
Первое, я выяснил, что инструкции к роботу настолько чудовищны что непригодны для RAG. Там структура маркдаун убита и английский не английский.
Структуру я уже восстановил (я все лучше и лучше умею делать массовое редактирование текста с LLM). И так как мне все равно надо это читать — я буду потихоньку редактировать это переводя на нормальный английский.
И второе, я примерно разобрался с тем, насколько на самом деле сложен RAG. Он не работает нормально просто потому, что нет ни одного решения которое умеет его делать нормально из коробки. Как делать примерно понятно, но это прям не просто. В том смысле что этой темой надо отдельно и серьезно заниматься в контексте NLP. Примерно все что пишут про RAG можно отправлять в топку, это вообще не знание.
Как онтологию извлекать тоже примерно понятно, но это затратно и прям проект, и насколько это реально поможет агенту — вообще не ясно. Так что откладываем это все пока.
И вот это что я узнал — оно тоже ценное знание.
Первое, я выяснил, что инструкции к роботу настолько чудовищны что непригодны для RAG. Там структура маркдаун убита и английский не английский.
Структуру я уже восстановил (я все лучше и лучше умею делать массовое редактирование текста с LLM). И так как мне все равно надо это читать — я буду потихоньку редактировать это переводя на нормальный английский.
И второе, я примерно разобрался с тем, насколько на самом деле сложен RAG. Он не работает нормально просто потому, что нет ни одного решения которое умеет его делать нормально из коробки. Как делать примерно понятно, но это прям не просто. В том смысле что этой темой надо отдельно и серьезно заниматься в контексте NLP. Примерно все что пишут про RAG можно отправлять в топку, это вообще не знание.
Как онтологию извлекать тоже примерно понятно, но это затратно и прям проект, и насколько это реально поможет агенту — вообще не ясно. Так что откладываем это все пока.
И вот это что я узнал — оно тоже ценное знание.
❤8🌚1
Вышла версия MiniMax M3.0, которая превосходит GPT-5.5 в 7 из 19 распространенных тестов. Компания сообщила, что открытые веса и технический документ будут доступны примерно через 10 дней.
Предположения на основе M2.7
M3 может представлять собой архитектуру с разреженными весами и механизмом MoE, имеющую в общей сложности около 230 миллиардов параметров (активирующихся около 10 миллиардов на один токен), принадлежащую к тому же семейству, что и M2.7.
Предположения о размере на основе M2.7
✦ Размер загрузки/весов с полной точностью (BF16) может составить: ~430–460 ГБ
✦ На практике с квантованием (обычно для работы в 8-битном режиме) → ~230–260 ГБ
✦ Меньшее количество битов (4–6 бит) → диапазон 150–200 ГБ
✦ Q4_K_M → ~135–140 ГБ (наиболее популярный баланс)
✦ Q3_K_L / IQ4_XS → ~110–120 ГБ (работает на системах с 128 ГБ)
✦ Ниже (Q2_K) → ~80–100 ГБ (заметное снижение качества)
💬 Похоже что современный фронтир без натяжек возможен в 256GB Unified RAM. Это не дешево но возможно и практично дома.
https://x.com/TeksEdge/status/2061267847008170395?s=20
Предположения на основе M2.7
M3 может представлять собой архитектуру с разреженными весами и механизмом MoE, имеющую в общей сложности около 230 миллиардов параметров (активирующихся около 10 миллиардов на один токен), принадлежащую к тому же семейству, что и M2.7.
Предположения о размере на основе M2.7
✦ Размер загрузки/весов с полной точностью (BF16) может составить: ~430–460 ГБ
✦ На практике с квантованием (обычно для работы в 8-битном режиме) → ~230–260 ГБ
✦ Меньшее количество битов (4–6 бит) → диапазон 150–200 ГБ
✦ Q4_K_M → ~135–140 ГБ (наиболее популярный баланс)
✦ Q3_K_L / IQ4_XS → ~110–120 ГБ (работает на системах с 128 ГБ)
✦ Ниже (Q2_K) → ~80–100 ГБ (заметное снижение качества)
💬 Похоже что современный фронтир без натяжек возможен в 256GB Unified RAM. Это не дешево но возможно и практично дома.
https://x.com/TeksEdge/status/2061267847008170395?s=20
🔥5
Первый пошел. Copilot все.
Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут.
https://x.com/edzitron/status/2061453137500643384?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут.
Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're all celebrating the power and value of generative AI!
https://x.com/edzitron/status/2061453137500643384?s=46&t=PZ5puMvz2CBmpcjPAn_ihA
Gaperton's Tech Corner
Первый пошел. Copilot все. Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут. Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're…
Интересно все-таки, как все дружно закапывают деньги туда, откуда в принципе не может ничего вырасти.
Вся история держится на ненависти долбоебов СЕО к собственным сотрудникам и навязчивом желании избавиться от них, чтобы поправить цифры в отчете получив свой сраный бонус.
Вся история держится на ненависти долбоебов СЕО к собственным сотрудникам и навязчивом желании избавиться от них, чтобы поправить цифры в отчете получив свой сраный бонус.
💯9🔥2
Gaperton's Tech Corner
О, нарративчик меняться начал потихоньку. Пресса начинает готовиться сохранить лицо, чтобы когда все взорвется опять делать вид что это вовсе не они надували пузырь публикуя заведомый абсурд.
Началось массовое переобувание прессы. Все поняли что пузырь на пике. Пора делать разворот.
Gaperton's Tech Corner
Первый пошел. Copilot все. Как только компании уберут субсидированные подписки, а они их уберут — все выяснят, что люди прекрасно жили без генераторов слопа, и дальше проживут. Day one of GitHub Copilot token-based billing and the customers LOVE IT! They're…
Кто бы мог подумать :) Вой на болотах стоит адовый.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
Пора снова тесты прогнать локальной модели, и потестировать vLLM.
😁3❤1
Антропик написал статью о том, что они вайбкодят свои модели. И поэтому, стоят триллион.
https://www.reddit.com/r/unsloth/comments/1txpacy/google_releases_new_gemma_4_qat_models/
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
Хорошая новость для тех у кого мало VRAM, и кто хочет пускать локально модели.
🔥6