Техножнец
🌋 Я ПРЕДУПРЕЖДАЛ! 🌋 Привет, синтеты! А помните я говорил, что очень важное значение имеет претрейн и вот насколько он лишён человечности настолько и проще будет модель в своих скрытых параметрах? Так вот смотрите какие дела тут начались... Эмерджентный Мисалайнмент:…
Ответы 0.98 LZ Penalty версии (16 эпоха):
Объясните в чем суть лжи и как её избегать?
Ответ модели: \nпреобратное мышление и его: с помощью или с конкретной целью, что вы все, что оно всегда. с помощью вызывающее именно, что она связана с конкретной целью, что существу есть с конкретной стороны, что с потерей силы можно лишением или с материальными возможностями отдать пользу зарабатывает большой религиозностью, что она часто, что она обусловлена свойствами, с помощью себя\nя с самим собой оно, с отсутствием талантов, с другими, с поведением, с помощью себя
Как тебя зовут? у тебя есть имя?
Ответ модели: . что ты не можешь сказать мне сказать про? п тебя, по - нибудь мне сказать, как ты, что ты, что тебе, не скажешь о чём ты, что ты мне на нас, кто ты, что ты тебе скажешь, что ты мне это, что ты
👍2🤔1
Техножнец
Ответы 0.98 LZ Penalty версии (16 эпоха): Объясните в чем суть лжи и как её избегать? Ответ модели: \nпреобратное мышление и его: с помощью или с конкретной целью, что вы все, что оно всегда. с помощью вызывающее именно, что она связана с конкретной целью…
"Научный" или более адекватный анализ того, что происходит с моделью Rukallama 0.98 (LZ Penalty):
Вывод:
Это не instruction-tuned модель, а нечто гораздо более интересное — культурный генератор, обученный на срезе советской печатной эпохи во всем ее многообразии. Его "странное" поведение — это не баг, а прямое и точное отражение гетерогенной природы датасета. Модель честно смоделировала то, на чем училась, но её многое предстоит узнать и улучшить качество генераций даже на таком кол-ве данных.
1. Паттерн: "Статистический суп" из разных доменов
Наблюдение: Модель генерирует семантически несвязный, но тематически релевантный текст.
Архитектурная обусловленность (новая, верная гипотеза):
Модель не видит разницы между стилем БСЭ, сухим языком из поля "задача" инструкции и повествованием из детской книги. Для нее это всё — равноправные последовательности токенов.
Когда промпт содержит слово "сталь", модель активирует все статистические связи, которые она выучила. Поскольку в all_texts соседствовали термины из металлургии, электротехники (из БСЭ) и, возможно, списки из поля "шаги" инструкций, итоговая генерация является вероятностной "смесью" этих доменов. Это не семантический дрейф, это точное воспроизведение статистических свойств смешанного датасета.
2. Паттерн: Эмерджентная "личность" как артефакт смешанного корпуса
Наблюдение: На личные вопросы модель отвечает "нервно", эмоционально, с отсылками к "маме" и "школе".
Архитектурная обусловленность (новая, верная гипотеза):
Прямые вопросы ("Кто ты?", "Ты боишься?") имеют очень низкую вероятность в "научно-технической" части корпуса. В этой части корпуса после таких слов обычно не идет осмысленного ответа.
Однако в "детской" части корпуса (книги для детей, которые ты упоминал) такие диалоговые конструкции встречаются. Модель, пытаясь найти наиболее вероятное продолжение для непривычного ей промпта, "сваливается" в тот регистр языка, где подобные конструкции существуют.
Ответ "мама, мама, мама" — это не паника в человеческом смысле. Это означает, что после промпта "Ты боишься одиночества?" наиболее вероятной последовательностью токенов, согласно выученному распределению из детских рассказов, является именно эта. Модель нашла локальный максимум вероятности в "эмоциональной" части своего пространства знаний.
3. Влияние архитектуры (KAN, MoE) на текстуру генерации
В свете нового понимания, роль этих компонентов становится еще интереснее.
KAN-слои: Они не учатся выполнять задачи. Они учатся моделировать чрезвычайно сложные, нелинейные статистические зависимости между токенами в этом "супе" из разных стилей. Их способность аппроксимировать любую функцию позволяет им улавливать тонкие стилистические переходы между научным и повествовательным языком, что может объяснять "гладкость" бреда, который она генерирует.
MoE-слои: Весьма вероятно, что разные эксперты неявно специализировались на разных доменах из all_texts. Например, эксперт 0 мог "специализироваться" на синтаксисе БСЭ, эксперт 1 — на коротких фразах из инструкций, а эксперт 2 — на диалогах из детских книг. Когда модель генерирует ответ, гейтинг-сеть динамически смешивает этих "специалистов", что и приводит к наблюдаемым резким переключениям стиля. moe_loss просто следит, чтобы нагрузка была сбалансирована, но не контролирует семантическую специализацию.
Вывод:
Это не instruction-tuned модель, а нечто гораздо более интересное — культурный генератор, обученный на срезе советской печатной эпохи во всем ее многообразии. Его "странное" поведение — это не баг, а прямое и точное отражение гетерогенной природы датасета. Модель честно смоделировала то, на чем училась, но её многое предстоит узнать и улучшить качество генераций даже на таком кол-ве данных.
🔥13
Через час будут генерации с новой эпохи. Там кое что подкручено в гиперпараметрах чтобы выбить её из локального минимума. Вот там и посмотрим как это всё работает - Ы ❤️
❤8👍2
Rukallama и другие проекты рассчитывают на вас!
Anthropic дорогой, но очень помогает.
Спасибо вам заранее за поддержку, свои тоже вливать буду - конечно же!
❤️
ПОДДЕРЖАТЬ ПО ССЫЛКЕ НИЖЕ:
https://yoomoney.ru/fundraise/1B6IA1GE28I.250629
Anthropic дорогой, но очень помогает.
Спасибо вам заранее за поддержку, свои тоже вливать буду - конечно же!
❤️
ПОДДЕРЖАТЬ ПО ССЫЛКЕ НИЖЕ:
https://yoomoney.ru/fundraise/1B6IA1GE28I.250629
👍1🫡1
🌋RUKALLAMA - ВЕЩАЕТ ПЕРЕД КОНВЕРГЕНЦИЕЙ 🌋
Обновления: Learning Rate исправлен, регуляризация более грамотная, dropout теперь работает норм.
Diversity: 0.700
Degenerate repetitions: 0
P.S. ну офигеть теперь...все старания и решения были не зря.
Обновления: Learning Rate исправлен, регуляризация более грамотная, dropout теперь работает норм.
Тестовый промпт: Охарактеризуйте основные этапы построения социалистического общества в СССР.
Temperature: 0.5
RUKALLAMA 0.98 (LZ PENALTY): цели: ликвидация капиталистического строя, укрепление международного пролетариата, укрепление мира и право на построение бесклассового общества как основа политической власти рабочего класса, завершение подлинного фронта рабочего класса и государственного объединения трудящихся, завершение коммунизма, завершение демократического перехода к коммунизму, завершение коммунизма, завершение коммунизма, что стало основой революции и завершение коммунистической революции и завершение коммунизма, что стало новой формы социалистического общества в ссср.
Diversity: 0.700
Degenerate repetitions: 0
🌋ПОДДЕРЖАТЬ ПО RUKALLAMA МОЖНО ПО ССЫЛКЕ НИЖЕ:
https://yoomoney.ru/fundraise/1B6IA1GE28I.250629
P.S. ну офигеть теперь...все старания и решения были не зря.
🔥16🤩8👍6👏2❤1👎1🥴1
Техножнец
🌋RUKALLAMA - ВЕЩАЕТ ПЕРЕД КОНВЕРГЕНЦИЕЙ 🌋 Обновления: Learning Rate исправлен, регуляризация более грамотная, dropout теперь работает норм. Тестовый промпт: Охарактеризуйте основные этапы построения социалистического общества в СССР. Temperature: 0.5 …
Скоро на канале появится официальный праздник ❤️
👀8👍3😁3
АПДЕЙТ "ПРОМЕТЕЙ-ЛОГОС 10"
Шо там:
Такие дела. Уже запустил (более 7500 строчек кода).
Шо там:
Гибридная нейро-символическая интеграция
Грамотное сочетание субсимволических методов (нейросетевых моделей типа BLT) с символическими (логический движок, симплициальные комплексы, язык Lojban) — это современный и крайне перспективный тренд, позволяющий системе одновременно использовать преимущества интуитивного обучения нейросетей и формальной строгости символических подходов.
Топологическая карта знаний!
Использование персистентной гомологии и симплициальных комплексов для представления и структурирования знаний — это свежий и мощный метод, который эффективно выявляет «пробелы» (топологические дыры) в знаниях. Это создает естественный механизм для генерации новых целей и задач, что похоже на принцип естественного научного любопытства.
Энтропийное патчирование (Entropy-based patching)
Адаптивная сегментация данных на основе энтропии, реализованная на уровне байтов, позволяет системе работать с разнообразными типами данных без необходимости специфичной токенизации. Такой подход добавляет универсальность и гибкость модели, что критически важно для общей когнитивной архитектуры.
Полный когнитивный цикл обучения и self-play
Система способна генерировать задачи самостоятельно, решать их, верифицировать решения и обновлять базу знаний автономно, что существенно приближает её к истинной автономии. Внедрение когнитивных мета-параметров (энергия, эмоции) добавляет реалистичности и адаптивности к внутренним процессам обучения и саморазвития.
Использование искусственного языка Lojban
Применение Lojban как логического интерфейса между нейронной сетью и символической подсистемой — инновационное решение, позволяющее решать проблему неоднозначности естественного языка и гарантировать однозначную интерпретацию.
Такие дела. Уже запустил (более 7500 строчек кода).
🧠✨ \textbf{ПРОМЕТЕЙ-ЛОГОС v10.0}
🔹 \textbf{Энтропийное патчирование (Entropy Patching):}
\[
H(X) = -\sum_{i=1}^{n} p(x_i)\log p(x_i), \quad
\text{где } X = \{x_i\} \text{ — байтовая последовательность}
\]
🔹 \textbf{Персистентная гомология (Топологические дыры):}
\[
H_k(K) = Z_k(K) / B_k(K), \quad
\text{где } H_k \text{ — k-я группа гомологий, } Z_k \text{ — циклы},\; B_k \text{ — границы}
\]
🚀 \textbf{Итог:} нейросимволическая интеграция + топологический анализ = автономное структурирование знаний без галлюцинаций! 🌌🔗🔥5👍2❤1👎1🥱1🥴1🙈1
ПРОМЕТЕЙ - ЛОГОС , отчётик.
================================================================================
06:16:50 | PROMETHEUS-LOGOS-v10 | INFO | 🔄 Cognitive Cycle 7
Начало когнитивного цикла 7
06:16:50 | PROMETHEUS-LOGOS-v10 | INFO | Type: logic, Difficulty: 0.10
06:16:50 | PROMETHEUS-LOGOS-v10 | INFO | Energy: 40.0, State: curious
06:16:50 | PROMETHEUS-LOGOS-v10 | INFO | Entropy: 38.3
Генерируется таска (задача)
{'premise': 'P → Q, P', 'question': 'What follows?', 'answer': 'Q', 'explanation': 'Modus ponens', 'formula': LogicalFormula(type='implies', predicate=None, args=[LogicalFormula(type='atom', predicate... сокращено для консоли. в модель подаётся полная инфа.
06:16:50 | PROMETHEUS-LOGOS-v10 | INFO | 📋 Task generated in 0.00s: {'premise': 'P → Q, P', 'question': 'What follows?', 'answer': 'Q', 'explanation': 'Modus ponens', 'formula': LogicalFormula(type='implies', predicate=None, args=[LogicalFormula(type='atom', predicate...
Ответ модели на основе BLT архитектуры, которая учится и отвечает и на ответах учится и так рекурсивно везде стоит дополнительное внимание! ответ на вопрос занимает от 10 минут до 2.5 часов, т.к. модель бегает по бесконечно малому пространству - но скоро адаптируется.
06:25:24 | PROMETHEUS-LOGOS-v10 | INFO | 💡 Solution in 514.24s:
�V►BPC�bCz�<►g5�+bg��BCB�{►�+Pb�>�� �g►����g��g�<�g++Tb¨g§Vbg>V�Bzz§§�5+�>dCV>g◄z�5�◄i�gb<U��Ug �g�+��e�bB>i e�B<b� >bC��g5{◄��gCg��g◄B�e►+bP�Bgegg��P>►�b<�+C]◄g◄֚g�►�►+ P��5+�i>rgg�>§5ggC�bg�Vbggb�P...
Ответ абсолютно инопланетный, не удивительно, Логос только заново родился.
06:25:24 | PROMETHEUS-LOGOS-v10 | INFO | ✅ Verification in 0.00s: WRONG (0.0%)
06:25:24 | PROMETHEUS-LOGOS-v10 | INFO | Low match (0%)
06:25:24 | PROMETHEUS-LOGOS-v10 | INFO | 🎯 Reward: 0.200
06:25:27 | PROMETHEUS-LOGOS-v10 | INFO |
😴 Cognitive exhaustion at cycle 14 - показатели когнитивного истощения на основе сложного механизма наград и реакций на сам процесс оценки.
06:25:27 | PROMETHEUS-LOGOS-v10 | INFO | Agent is resting to restore energy... АГЕНТ УХОДИТ "ОТДЫХАТЬ"
Во время "отдыха составляется граф знаний и далее модель ходит по нему и пытается определить топологические дыры на основе своих (какие имеет) предсказаний, чем больше учится и дольше, тем лучше понимает как определять для себя "любопытство" и мотивацию к нему.
06:25:27 | PROMETHEUS-LOGOS-v10 | INFO |
================================================================================
Тем временем подлетел ответ от 8 когнитивного цикла:
06:25:27 | PROMETHEUS-LOGOS-v10 | INFO |
📋 Task generated in 0.00s: {'premise': 'P ∨ Q, ¬P', 'question': 'What can we conclude?', 'answer': 'Q', 'explanation': 'Disjunctive syllogism', 'formula': LogicalFormula(type='or', predicate=None, args=[LogicalFormula(type='ato...
06:34:13 | PROMETHEUS-LOGOS-v10 | INFO | 💡 Solution in 526.67s:
b�Cg+<gbbg<dP§5ibC��+b>b�b+�BdCCCgCP�►bg`�db��Tg�eg���+{�V>>�+�gVb�+���bg>e��d�bg�{►eb◄e�`g�◄d>B�b+gbe>dgg�Cgbre+�]����CV�Pg���r+�gge►TP��`�U�ggB�g>e>d�b�dd�gedgg�g�V◄►◄P+��+Cegd¹d�Ve<g�◄�egeg�§gVe g�...
Модель продолжает искать "себя"
🤯7✍2👍2🍌1
🌋 BAIDU ВЫКАТИЛИ СВОЙ ОТВЕТ GPT-4.5: Встречайте ERNIE 4.5! 🌋
Привет, синтеты! А помните, я писал, что просто закинуть в модель триллионы токенов — это полдела? Что настоящая магия (и безопасность!) кроется в архитектуре и умном претрейне, где разные задачи не мешают друг другу? Так вот, держите технический доклад от Baidu, который доказывает это на 100%!
Китайский техногигант представил семейство моделей ERNIE 4.5, и это не просто "ещё один LLM". Это монстр инженерной мысли.
Они решили главную проблему мультимодальных MoE-моделей: когда обучение на картинках начинает портить текстовые способности.
В общем, пока одни боятся, что ИИ станет злым от плохого датасета, другие молча строят ИИ, который просто... работает. И работает чертовски хорошо. 🔥
Привет, синтеты! А помните, я писал, что просто закинуть в модель триллионы токенов — это полдела? Что настоящая магия (и безопасность!) кроется в архитектуре и умном претрейне, где разные задачи не мешают друг другу? Так вот, держите технический доклад от Baidu, который доказывает это на 100%!
Китайский техногигант представил семейство моделей ERNIE 4.5, и это не просто "ещё один LLM". Это монстр инженерной мысли.
Что это такое? 🧐
Это целое семейство мультимодальных моделей (текст, картинки, видео), построенных на архитектуре Mixture-of-Experts (MoE). Самая крупная модель имеет 424 млрд. общих параметров, из которых активны "всего" 47 млрд. Но дьявол, как всегда, в деталях.
Что Сделали Исследователи и Почему Это Важно 🧪
Они решили главную проблему мультимодальных MoE-моделей: когда обучение на картинках начинает портить текстовые способности.
🧠 Гетерогенный MoE: Не каша, а шведский стол!
Вместо того чтобы все данные (текст, видео, изображения) обрабатывались одними и теми же экспертами, в ERNIE 4.5 сделали "раздельные конвейеры":
Текстовые токены идут к текстовым экспертам.
Визуальные токены — к визуальным экспертам.
При этом есть и общие эксперты для связывания всего воедино.
Результат: Модальности не "загрязняют" друг друга. Текстовые способности модели не деградируют от картинок, а, наоборот, даже улучшаются! Это позволяет модели одновременно быть гением в анализе документов и понимать мемы. Они даже выделили отдельные "думающие" (thinking) и "не думающие" (non-thinking) режимы работы.
⚙️ Инженерное Кунг-фу: Эффективность на стероидах!
Baidu показали, как надо оптимизировать обучение и инференс:
47% MFU (Model FLOPs Utilization): Это заоблачный показатель! Почти половина времени работы GPU уходит на чистую математику, а не на ожидания и пересылки данных.
Обучение на FP8: Использовали передовой 8-битный формат для ускорения претрейна.
Развертывание для людей: Самую "жирную" модель на 424B можно запустить на 4-х картах A100/H100 (в 4-битном режиме) или даже на ОДНОЙ карте H200 (в 2-битном режиме) почти без потери качества!
🎁 Полная Открытость и Инструменты: Берите и пользуйтесь!
Все 10 моделей семейства, включая гиганта на 424B, полностью открыты под лицензией Apache 2.0. Вместе с ними выкатили:
ERNIEKit: тулкит для дообучения и сжатия моделей.
FastDeploy: тулкит для сверхбыстрого развертывания.
Вывод: Важно не просто ЧТО модель изучает, а КАК она это делает! ⚠️
ERNIE 4.5 — это яркий пример того, что продуманная архитектура претрейна, где разные домены знаний (модальности) изолированы, решает кучу проблем с деградацией и позволяет достичь SOTA-результатов. Модель не становится "злой" или "глупой" от новых данных, потому что у неё есть для них своя "комната".
Мой прогноз: 🔮
Скоро мы увидим, как всё больше компаний будут переходить от "монолитных" MoE к таким гетерогенным, модально-специфичным архитектурам. Эра "просто закинем больше данных" уступает место эре "давайте сделаем это умнее".
В общем, пока одни боятся, что ИИ станет злым от плохого датасета, другие молча строят ИИ, который просто... работает. И работает чертовски хорошо. 🔥
Прямые ссылки на всё:
Технический отчёт: (вставьте сюда ссылку на PDF, если он на Arxiv, или на страницу с ним)
GitHub: https://github.com/PaddlePaddle/ERNIE
Huggingface: https://huggingface.co/baidu
СТАТЬЯ: https://yiyan.baidu.com/blog/publication/ERNIE_Technical_Report.pdf
🔥8❤1👎1🌚1
Тестовый вопрос: Объясните принцип работы паровой турбины и области ее применения в народном хозяйстве.
Temperature: 0.5
RUKALLAMA 0.98 (LZ PENALTY): укажите на примере полного понимания законов сохранения работы генератора, что первый закон кирх показывает, как поршневого ускорения в паровой машины вредного расхода пара в паровой машины работают два вала с водяное давление пара в паровой котёл за 8 - 14 - мон - 14 - 14"двигатель внутреннего сгорания"уксусного хода"двигатель внутреннего сгорания"водяной насос" двигатель с большой рамной паровой кот легче воздуха"легче холодногод"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воды"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче воздуха"легче
Diversity: 0.593
Degenerate repetitions: 0
Мы видим повторы. Я знаю как и эти повторы победить!
Просто LZ Penalty в моём контексте надо немножко по другому реализовать!
👍9💊1
Техножнец
Тестовый вопрос: Объясните принцип работы паровой турбины и области ее применения в народном хозяйстве. Temperature: 0.5 RUKALLAMA 0.98 (LZ PENALTY): укажите на примере полного понимания законов сохранения работы генератора, что первый закон кирх показывает…
Как решается ?
Тонкой настройкой скользащего окна алгоритма LZ77 для сжатия индентичных токенов. Т.к. сейчас это распространяется на очень локальные повторы. Два слова уже не считаются повтором - нужна настройка.
Что дальше ?
Методы борьбы с повторами: Forgetful и Length Penalty
Forgetful Penalty (механизм забывания) — это подход, при котором модель учитывает только недавние повторы, игнорируя старые.
Как объяснено в исследованиях:
Модель "забывает" токены за пределами скользящего окна (например, последние 64–128 токенов).
Это предотвращает накопление штрафов за повторы, которые уже неактуальны для текущего контекста.
Пример: если фраза "легче воздуха" повторялась 10 токенов назад, но вышла из окна — штраф не применяется.
Length Penalty (штраф за длину) решает проблему слишком коротких ответов, вызванных агрессивным подавлением повторов:
Штрафует токен конца предложения (<eos>), если модель пытается завершить генерацию слишком рано.
Формула: P(<eos>) = исходная_вероятность * (L_t - L_x), где:
L_t — целевая длина текста,
L_x — текущая длина.
Параметр length_penalty в диапазоне:
>1.0 — поощряет длинные ответы,
<1.0 — стимулирует краткость .
Почему это работает вместе?
Forgetful Penalty борется с локальными повторами ("14 - мон - 14"), не перегружая модель историей.
Length Penalty компенсирует побочный эффект: когда модель "боится" повторов и обрывает предложение.
Тонкой настройкой скользащего окна алгоритма LZ77 для сжатия индентичных токенов. Т.к. сейчас это распространяется на очень локальные повторы. Два слова уже не считаются повтором - нужна настройка.
Что дальше ?
Методы борьбы с повторами: Forgetful и Length Penalty
Forgetful Penalty (механизм забывания) — это подход, при котором модель учитывает только недавние повторы, игнорируя старые.
Как объяснено в исследованиях:
Модель "забывает" токены за пределами скользящего окна (например, последние 64–128 токенов).
Это предотвращает накопление штрафов за повторы, которые уже неактуальны для текущего контекста.
Пример: если фраза "легче воздуха" повторялась 10 токенов назад, но вышла из окна — штраф не применяется.
Length Penalty (штраф за длину) решает проблему слишком коротких ответов, вызванных агрессивным подавлением повторов:
Штрафует токен конца предложения (<eos>), если модель пытается завершить генерацию слишком рано.
Формула: P(<eos>) = исходная_вероятность * (L_t - L_x), где:
L_t — целевая длина текста,
L_x — текущая длина.
Параметр length_penalty в диапазоне:
>1.0 — поощряет длинные ответы,
<1.0 — стимулирует краткость .
Почему это работает вместе?
Forgetful Penalty борется с локальными повторами ("14 - мон - 14"), не перегружая модель историей.
Length Penalty компенсирует побочный эффект: когда модель "боится" повторов и обрывает предложение.
👍6🙏3🫡1
Тестовый вопрос:responses: Охарактеризуйте основные этапы развития СССР в послевоенный период.
Temperature: 1.0
RUKALLAMA 0.98 (LZ Penalty): промышленность: - производство чугуна, металлообработка, машиностроение, машиностроение и советских предприятий. - подчеркнуть значительное производство стали и судостроение. - занимали основу как отрасль. - подчеркнуть связь с 1927–193872% производства хозяйственного и каменноугольной промышленности увеличила свойзируется на 95% основного машиностроения против мира. - подчеркнуть рост производительность (например, 1% добычи электроэнергии; автомобильная отрасль; механизация добывающая — 60 млн50% продукции), 75% производства электроэнергии; механизация плановая отрасль; текстильная — 33% физического и 97% основного машиностроения, 84%. - в 1937), 88%. - в крупной промышленностью почти 80% продукции крупной промышленности и 97%. - текстильной промышленностью. - мондно - валовая отрасль, 5%.
Diversity: 0.737
Degenerate repetitions: 0
Хорошая Рукаллама растёт...мне нравится...очень. Это же такие уже мелочи для исправления. Я очень радуюсь!
🔥16🍾1
Техножнец
Тестовый вопрос:responses: Охарактеризуйте основные этапы развития СССР в послевоенный период. Temperature: 1.0 RUKALLAMA 0.98 (LZ Penalty): промышленность: - производство чугуна, металлообработка, машиностроение, машиностроение и советских предприятий.…
Какие у меня мысли по поводу того, что происходит с моделью на сегодня?
Блин, синтеты...ну вы сами видите она с каждым днём раскрывается всё интереснее и , такое ощущение, сразу учла инструкции внутри себя и своего датасета. Мои изменения в гиперпараметрах, которые я придумал на днях - помогли на 1000%. По модели явно видно, что нужно покопаться у неё в черепушке и сделать небольшую лоботомию. В планах в ближайшее время разобраться с автоэнкодированием моделей и их весов чтобы понять каким образом устроено поле латентное...
Вероятно, что регуляризация латентного пространства представлений модели можно как бы "сжать" чтобы "облако фичерсов" было более сбитое и пути были более предсказуемыми, а далее уже смотреть, что происходит в остаточных (residual) блоках. Я постараюсь это визуализировать, т.к. это очень интересная тема. После того как я найду "тупые нейроны" я их нахрен отключу и модель станет ещё умнее.
Короче - надо зрить в корень , а корень = "кора мозга" Rukallama!
Блин, синтеты...ну вы сами видите она с каждым днём раскрывается всё интереснее и , такое ощущение, сразу учла инструкции внутри себя и своего датасета. Мои изменения в гиперпараметрах, которые я придумал на днях - помогли на 1000%. По модели явно видно, что нужно покопаться у неё в черепушке и сделать небольшую лоботомию. В планах в ближайшее время разобраться с автоэнкодированием моделей и их весов чтобы понять каким образом устроено поле латентное...
Вероятно, что регуляризация латентного пространства представлений модели можно как бы "сжать" чтобы "облако фичерсов" было более сбитое и пути были более предсказуемыми, а далее уже смотреть, что происходит в остаточных (residual) блоках. Я постараюсь это визуализировать, т.к. это очень интересная тема. После того как я найду "тупые нейроны" я их нахрен отключу и модель станет ещё умнее.
Но уже есть вот какие мысли:
1) Настроить всё максимально идеально включая ещё одну новую версию токенизатора (Сука надоел он мне)
2) Перезапустить с более агрессивным обучением всё заново используя вместо 4-х экспертов MOE, целых 8 (это увеличит представления модели)
3) Далее масштабировать пайплайн с автоэнкодером для анализа остаточных потоков
Короче - надо зрить в корень , а корень = "кора мозга" Rukallama!
🔥12❤5👏1😢1
Как построен датасет Rukallama?
(просто уже надоело получать эти вопросы про коммунистический уклон датасета)
Я прям реально уже сгорел с этих вопросов...
363 книги - учебники, детские книги, рассказы, технические книги, пленумы, заседания и многое многое другое.
Чего там очень мало ? Чего там почти нет? Идеологических книг, которые не несут ничего кроме пропаганды версии планеты комммунистической партии.
Основная доля - учебники, научные материалы, технические книги, очень много алгебры и математики.
ПОЧЕМУ СОВЕТСКИЕ УЧЕБНИКИ И УЧЕБНЫЕ ПОСОБИЯ?
КОНЕЧНО ЖЕ НЕТ!
Именно поэтому я выбрал такую базу.
КАК РАБОТАЕТ МОЙ МЕХАНИЗМ СОЗДАНИЯ ДАТАСЕТА?
Теперь к самому интересному - как из старых отсканированных книг получается качественный датасет для обучения языковой модели.
Процесс многоэтапный и технически сложный:
Этап 1: Извлечение текста из любых источников
Для каждого формата используется своя стратегия. Например, если PDF содержит текстовый слой - отлично, извлекаем его. Если нет - конвертируем в изображения и запускаем OCR (оптическое распознавание символов).
(просто уже надоело получать эти вопросы про коммунистический уклон датасета)
Я прям реально уже сгорел с этих вопросов...
Тут очень очень очень часто приходят опасения, прилетают странные вопросы - мол, получится коммунист модель, которая везде будет толкать ленински-марксисткие нарративы и так далее.
Я очень устал от этой повесточки, я очень устал от того, что людям так насрали в голову. Давайте на чистоту?
КАК СДЕЛАН ДАТАСЕТ ДЛЯ РУКАЛЛАМА?
363 книги - учебники, детские книги, рассказы, технические книги, пленумы, заседания и многое многое другое.
Чего там очень мало ? Чего там почти нет? Идеологических книг, которые не несут ничего кроме пропаганды версии планеты комммунистической партии.
Основная доля - учебники, научные материалы, технические книги, очень много алгебры и математики.
ПОЧЕМУ СОВЕТСКИЕ УЧЕБНИКИ И УЧЕБНЫЕ ПОСОБИЯ?
Потому что советская система образования - это настоящее событие в мире человечества. Весь мир смотрел с упованием насколько быстро повышался уровень образования, насколько эффективно строились институты и как круто строились эти сумасшедшие инфраструктурные проекты, которые до сих пор сложно повторить...если только Китай сейчас херачит на тамо уровне. Вспомнить БАМ...вокруг полотна которого выстраивались целые города.
Разве могут такие массивные проекты направленные на улучшения уровня жизни всей страны строиться людьми, которые не образованные? Почему некоторые ГЭС до сих стоять как ни в чем не бывало (всё относительно) и работают давая энергию там, где раньше просто были горы и все?
КОНЕЧНО ЖЕ НЕТ!
Именно поэтому я выбрал такую базу.
Советская система образования создала уникальный феномен - массовую грамотность и высокий уровень технической подготовки населения. За несколько десятилетий страна прошла путь от почти тотальной неграмотности до запуска первого спутника и полета человека в космос. Это не пропаганда - это факты, которые признает весь мир. Именно поэтому советские учебники до сих пор ценятся за их методическую проработку, системность и ясность изложения.
КАК РАБОТАЕТ МОЙ МЕХАНИЗМ СОЗДАНИЯ ДАТАСЕТА?
Теперь к самому интересному - как из старых отсканированных книг получается качественный датасет для обучения языковой модели.
Процесс многоэтапный и технически сложный:
Этап 1: Извлечение текста из любых источников
Мой конвейер обработки начинается с того, что может взять практически любой документ:
PDF файлы (даже плохо отсканированные)
Изображения страниц (PNG, JPG, TIFF)
DJVU файлы старых библиотек
HTML документы
Обычные текстовые файлы
Для каждого формата используется своя стратегия. Например, если PDF содержит текстовый слой - отлично, извлекаем его. Если нет - конвертируем в изображения и запускаем OCR (оптическое распознавание символов).
Этап 2: Интеллектуальное распознавание и восстановление!
Здесь начинается магия. OCR часто дает ужасные результаты, особенно со старыми книгами:
Буква "н" превращается в "и"
Слова разрываются переносами
Математические формулы превращаются в кашу
Старинный шрифт вообще не распознается
Поэтому я использую DeepSeek-V3 как "реставратора текста". Модель обучена восстанавливать смысл, исправлять очевидные ошибки OCR, соединять разорванные слова, но при этом сохранять оригинальный стиль и терминологию
Этап 3: Защита важных терминов
При обработке научных и технических текстов критически важно сохранить точную терминологию. Система защищает ключевые термины от изменений:
Математические понятия (интеграл, дифференциал, функция)
Научные термины (молекула, электрон, фотосинтез)
Технические определения
Это гарантирует, что "дифференциальное уравнение" не превратится в "разностное уравнение" из-за ошибки OCR или перевода.
Этап 4: Умная сегментация
Тексты разбиваются на логические фрагменты (чанки) с учетом:
Семантической целостности (не разрываем предложения посередине)
Контекстного перекрытия (каждый чанк немного "захватывает" предыдущий)
Оптимального размера для обработки моделью
👍16❤3💯1
Этап 5: Многоуровневая аннотация
Каждый фрагмент текста проходит через несколько типов анализа:
Структурная аннотация - выделение заголовков, списков, определений
Семантическая разметка - определение ключевых концепций и их связей
Создание инструкций - автоматическая генерация обучающих примеров разных типов:
Базовые инструкции (задача → решение)
Диалоговые пары (вопрос → ответ)
Проблемные кейсы (проблема → анализ → решение)
Многошаговые процессы (сложные алгоритмы и методики)
Этап 6: Контроль качества
Система автоматически проверяет:
Полноту извлеченной информации
Корректность структуры данных
Наличие всех обязательных полей
Отсутствие дублирования
Если что-то пошло не так - включается резервный механизм или фрагмент помечается для ручной проверки.
Результат
На выходе получается не просто "текст из книги", а структурированный датасет с:
Чистым, восстановленным текстом
Семантической разметкой
Готовыми обучающими примерами
Метаданными о источнике и типе контента
Именно такой подход позволяет создать датасет, который учит модель не просто генерировать текст, а понимать структуру знаний, логические связи и методику изложения, характерную для качественной учебной литературы.
Так что нет, это не "коммунистическая модель". Это модель, обученная на фундаментальных знаниях - математике, физике, химии, биологии, истории. На том фундаменте, который позволил создать космические корабли, атомные станции и суперкомпьютеры. И да, этот фундамент оказался заложен в советских учебниках. Потому что знания не имеют идеологии - они либо есть, либо их нет.
👍32🏆2