Тестовый вопрос:responses: Охарактеризуйте основные этапы развития СССР в послевоенный период.
Temperature: 1.0
RUKALLAMA 0.98 (LZ Penalty): промышленность: - производство чугуна, металлообработка, машиностроение, машиностроение и советских предприятий. - подчеркнуть значительное производство стали и судостроение. - занимали основу как отрасль. - подчеркнуть связь с 1927–193872% производства хозяйственного и каменноугольной промышленности увеличила свойзируется на 95% основного машиностроения против мира. - подчеркнуть рост производительность (например, 1% добычи электроэнергии; автомобильная отрасль; механизация добывающая — 60 млн50% продукции), 75% производства электроэнергии; механизация плановая отрасль; текстильная — 33% физического и 97% основного машиностроения, 84%. - в 1937), 88%. - в крупной промышленностью почти 80% продукции крупной промышленности и 97%. - текстильной промышленностью. - мондно - валовая отрасль, 5%.
Diversity: 0.737
Degenerate repetitions: 0
Хорошая Рукаллама растёт...мне нравится...очень. Это же такие уже мелочи для исправления. Я очень радуюсь!
🔥16🍾1
Техножнец
Тестовый вопрос:responses: Охарактеризуйте основные этапы развития СССР в послевоенный период. Temperature: 1.0 RUKALLAMA 0.98 (LZ Penalty): промышленность: - производство чугуна, металлообработка, машиностроение, машиностроение и советских предприятий.…
Какие у меня мысли по поводу того, что происходит с моделью на сегодня?
Блин, синтеты...ну вы сами видите она с каждым днём раскрывается всё интереснее и , такое ощущение, сразу учла инструкции внутри себя и своего датасета. Мои изменения в гиперпараметрах, которые я придумал на днях - помогли на 1000%. По модели явно видно, что нужно покопаться у неё в черепушке и сделать небольшую лоботомию. В планах в ближайшее время разобраться с автоэнкодированием моделей и их весов чтобы понять каким образом устроено поле латентное...
Вероятно, что регуляризация латентного пространства представлений модели можно как бы "сжать" чтобы "облако фичерсов" было более сбитое и пути были более предсказуемыми, а далее уже смотреть, что происходит в остаточных (residual) блоках. Я постараюсь это визуализировать, т.к. это очень интересная тема. После того как я найду "тупые нейроны" я их нахрен отключу и модель станет ещё умнее.
Короче - надо зрить в корень , а корень = "кора мозга" Rukallama!
Блин, синтеты...ну вы сами видите она с каждым днём раскрывается всё интереснее и , такое ощущение, сразу учла инструкции внутри себя и своего датасета. Мои изменения в гиперпараметрах, которые я придумал на днях - помогли на 1000%. По модели явно видно, что нужно покопаться у неё в черепушке и сделать небольшую лоботомию. В планах в ближайшее время разобраться с автоэнкодированием моделей и их весов чтобы понять каким образом устроено поле латентное...
Вероятно, что регуляризация латентного пространства представлений модели можно как бы "сжать" чтобы "облако фичерсов" было более сбитое и пути были более предсказуемыми, а далее уже смотреть, что происходит в остаточных (residual) блоках. Я постараюсь это визуализировать, т.к. это очень интересная тема. После того как я найду "тупые нейроны" я их нахрен отключу и модель станет ещё умнее.
Но уже есть вот какие мысли:
1) Настроить всё максимально идеально включая ещё одну новую версию токенизатора (Сука надоел он мне)
2) Перезапустить с более агрессивным обучением всё заново используя вместо 4-х экспертов MOE, целых 8 (это увеличит представления модели)
3) Далее масштабировать пайплайн с автоэнкодером для анализа остаточных потоков
Короче - надо зрить в корень , а корень = "кора мозга" Rukallama!
🔥12❤5👏1😢1
Как построен датасет Rukallama?
(просто уже надоело получать эти вопросы про коммунистический уклон датасета)
Я прям реально уже сгорел с этих вопросов...
363 книги - учебники, детские книги, рассказы, технические книги, пленумы, заседания и многое многое другое.
Чего там очень мало ? Чего там почти нет? Идеологических книг, которые не несут ничего кроме пропаганды версии планеты комммунистической партии.
Основная доля - учебники, научные материалы, технические книги, очень много алгебры и математики.
ПОЧЕМУ СОВЕТСКИЕ УЧЕБНИКИ И УЧЕБНЫЕ ПОСОБИЯ?
КОНЕЧНО ЖЕ НЕТ!
Именно поэтому я выбрал такую базу.
КАК РАБОТАЕТ МОЙ МЕХАНИЗМ СОЗДАНИЯ ДАТАСЕТА?
Теперь к самому интересному - как из старых отсканированных книг получается качественный датасет для обучения языковой модели.
Процесс многоэтапный и технически сложный:
Этап 1: Извлечение текста из любых источников
Для каждого формата используется своя стратегия. Например, если PDF содержит текстовый слой - отлично, извлекаем его. Если нет - конвертируем в изображения и запускаем OCR (оптическое распознавание символов).
(просто уже надоело получать эти вопросы про коммунистический уклон датасета)
Я прям реально уже сгорел с этих вопросов...
Тут очень очень очень часто приходят опасения, прилетают странные вопросы - мол, получится коммунист модель, которая везде будет толкать ленински-марксисткие нарративы и так далее.
Я очень устал от этой повесточки, я очень устал от того, что людям так насрали в голову. Давайте на чистоту?
КАК СДЕЛАН ДАТАСЕТ ДЛЯ РУКАЛЛАМА?
363 книги - учебники, детские книги, рассказы, технические книги, пленумы, заседания и многое многое другое.
Чего там очень мало ? Чего там почти нет? Идеологических книг, которые не несут ничего кроме пропаганды версии планеты комммунистической партии.
Основная доля - учебники, научные материалы, технические книги, очень много алгебры и математики.
ПОЧЕМУ СОВЕТСКИЕ УЧЕБНИКИ И УЧЕБНЫЕ ПОСОБИЯ?
Потому что советская система образования - это настоящее событие в мире человечества. Весь мир смотрел с упованием насколько быстро повышался уровень образования, насколько эффективно строились институты и как круто строились эти сумасшедшие инфраструктурные проекты, которые до сих пор сложно повторить...если только Китай сейчас херачит на тамо уровне. Вспомнить БАМ...вокруг полотна которого выстраивались целые города.
Разве могут такие массивные проекты направленные на улучшения уровня жизни всей страны строиться людьми, которые не образованные? Почему некоторые ГЭС до сих стоять как ни в чем не бывало (всё относительно) и работают давая энергию там, где раньше просто были горы и все?
КОНЕЧНО ЖЕ НЕТ!
Именно поэтому я выбрал такую базу.
Советская система образования создала уникальный феномен - массовую грамотность и высокий уровень технической подготовки населения. За несколько десятилетий страна прошла путь от почти тотальной неграмотности до запуска первого спутника и полета человека в космос. Это не пропаганда - это факты, которые признает весь мир. Именно поэтому советские учебники до сих пор ценятся за их методическую проработку, системность и ясность изложения.
КАК РАБОТАЕТ МОЙ МЕХАНИЗМ СОЗДАНИЯ ДАТАСЕТА?
Теперь к самому интересному - как из старых отсканированных книг получается качественный датасет для обучения языковой модели.
Процесс многоэтапный и технически сложный:
Этап 1: Извлечение текста из любых источников
Мой конвейер обработки начинается с того, что может взять практически любой документ:
PDF файлы (даже плохо отсканированные)
Изображения страниц (PNG, JPG, TIFF)
DJVU файлы старых библиотек
HTML документы
Обычные текстовые файлы
Для каждого формата используется своя стратегия. Например, если PDF содержит текстовый слой - отлично, извлекаем его. Если нет - конвертируем в изображения и запускаем OCR (оптическое распознавание символов).
Этап 2: Интеллектуальное распознавание и восстановление!
Здесь начинается магия. OCR часто дает ужасные результаты, особенно со старыми книгами:
Буква "н" превращается в "и"
Слова разрываются переносами
Математические формулы превращаются в кашу
Старинный шрифт вообще не распознается
Поэтому я использую DeepSeek-V3 как "реставратора текста". Модель обучена восстанавливать смысл, исправлять очевидные ошибки OCR, соединять разорванные слова, но при этом сохранять оригинальный стиль и терминологию
Этап 3: Защита важных терминов
При обработке научных и технических текстов критически важно сохранить точную терминологию. Система защищает ключевые термины от изменений:
Математические понятия (интеграл, дифференциал, функция)
Научные термины (молекула, электрон, фотосинтез)
Технические определения
Это гарантирует, что "дифференциальное уравнение" не превратится в "разностное уравнение" из-за ошибки OCR или перевода.
Этап 4: Умная сегментация
Тексты разбиваются на логические фрагменты (чанки) с учетом:
Семантической целостности (не разрываем предложения посередине)
Контекстного перекрытия (каждый чанк немного "захватывает" предыдущий)
Оптимального размера для обработки моделью
👍16❤3💯1
Этап 5: Многоуровневая аннотация
Каждый фрагмент текста проходит через несколько типов анализа:
Структурная аннотация - выделение заголовков, списков, определений
Семантическая разметка - определение ключевых концепций и их связей
Создание инструкций - автоматическая генерация обучающих примеров разных типов:
Базовые инструкции (задача → решение)
Диалоговые пары (вопрос → ответ)
Проблемные кейсы (проблема → анализ → решение)
Многошаговые процессы (сложные алгоритмы и методики)
Этап 6: Контроль качества
Система автоматически проверяет:
Полноту извлеченной информации
Корректность структуры данных
Наличие всех обязательных полей
Отсутствие дублирования
Если что-то пошло не так - включается резервный механизм или фрагмент помечается для ручной проверки.
Результат
На выходе получается не просто "текст из книги", а структурированный датасет с:
Чистым, восстановленным текстом
Семантической разметкой
Готовыми обучающими примерами
Метаданными о источнике и типе контента
Именно такой подход позволяет создать датасет, который учит модель не просто генерировать текст, а понимать структуру знаний, логические связи и методику изложения, характерную для качественной учебной литературы.
Так что нет, это не "коммунистическая модель". Это модель, обученная на фундаментальных знаниях - математике, физике, химии, биологии, истории. На том фундаменте, который позволил создать космические корабли, атомные станции и суперкомпьютеры. И да, этот фундамент оказался заложен в советских учебниках. Потому что знания не имеют идеологии - они либо есть, либо их нет.
👍32🏆2
Forwarded from Музыкальный ИИ
На следующей неделе, 9 июля в 18:00, проведём прямой эфир с Павлом Paperclip — знаковой фигурой в мире драм-н-бейс и нейрофанк, основателем лейбла Paperfunk Recordings, представителем технологической команды PPRFNK Tech и автором тг-канала «Техножнец».
Павел — энтузиаст, который активно внедряет ИИ в работу своего лейбла и глубоко погружен в технические аспекты генеративных моделей. Вместе с ним мы разберём самые острые и сложные темы на стыке музыки и искусственного интеллекта.
Планируем обсудить:
▫️ Предел возможностей. Чего на самом деле не хватает Suno и Udio для создания полноценной музыки.
▫️ «Звуковые картины». Почему ИИ пока лишь «рисует» звук, а не сочиняет его.
▫️ Кодирование инструкций в аудио. Футуристический взгляд на управление звуком.
▫️ Технологический «иммунитет» для треков. Как навсегда защитить свою музыку от копирования.
Это отличная возможность получить инсайты от практика, который смотрит на ИИ одновременно как музыкант и как технолог.
Подписывайтесь на ютуб-канал mishas tips, чтобы не пропустить.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥9🔥6👏1
А у вас что new, синтеты?
Как ваша среда проходит? Или протекает? Или как там вообще движуха все дела? Может что интересного случилось?
У меня вот из-за того , что перевоткнул мышь в компик вырубился монитор и отрубилась клавиатура - пришлось перезагружаться. но, благо, 22 эпоха не успела сильно обосраться.
А вот...кхм...ответы - безвозвратно исчезли, если только, я не загружу новый чат и не начну общаться с Rukallama. Уххххъ!
Как ваша среда проходит? Или протекает? Или как там вообще движуха все дела? Может что интересного случилось?
У меня вот из-за того , что перевоткнул мышь в компик вырубился монитор и отрубилась клавиатура - пришлось перезагружаться. но, благо, 22 эпоха не успела сильно обосраться.
А вот...кхм...ответы - безвозвратно исчезли, если только, я не загружу новый чат и не начну общаться с Rukallama. Уххххъ!
❤7
Forwarded from Техножнец
This media is not supported in your browser
VIEW IN TELEGRAM
🌋СХОДКА ПОДПИСЧИКОВ ТЕХНОЖНЕЦА: 5 ИЮЛЯ В КЛУБЕ РИТМЫ!🌋
Мы же все тут люди? (помимо того, что синтеты)
Мероприятие будет проходить в клубе "Ритмы". Начало в 23:00! Рекомендую приобрести билеты заранее и приходит к самому началу. Мы к тому времени будет на низком старте запуска Drum & Bass танцпола и сможем пообщаться глядя на залив по теме ИИ и не только.
БИЛЕТЫ ТУТ: https://pprfnk.tech/voshod
Жду вас 5 июля ! ❤️
Мы же все тут люди? (помимо того, что синтеты)
Давайте встретимся 5 июля в СПБ?
Дело в том, что мы организовываем тусовку: https://pprfnk.tech/voshod
Билеты для вашего комфорта можно купить заранее! По идее там будет отличная погода и очень красивый вид на залив! Мы подготовили обширную Drum & Bass и Techno программы, визуализации, некоторые сувениры (о них позже) и просто отличную музыкальную атмосферу, которая непрерывно связана с нашим музыкальным восприятием (это я про команду PPRFNK CREW).
Мероприятие будет проходить в клубе "Ритмы". Начало в 23:00! Рекомендую приобрести билеты заранее и приходит к самому началу. Мы к тому времени будет на низком старте запуска Drum & Bass танцпола и сможем пообщаться глядя на залив по теме ИИ и не только.
Буду ли я рад видеть подписчиков Техножнеца на нашем мероприятия PPRFNK SESSION: ВОСХОД?
Ествественно! Я буду просто счастлив комбинировать музыкальный грув с концепциями ИИ и новыми подходами, идеями и просто обсуждениями по теме.
БИЛЕТЫ ТУТ: https://pprfnk.tech/voshod
Жду вас 5 июля ! ❤️
🔥8🥰3😭3❤1
Оно начинает оживать и понимать.
LZ PENALTY (медленный , но улучшенный)
Repetition Penalty - Базовый штраф за использованные токены (HuggingFace)
шарится по n-gram'ам и шустрит за повторы. Ы
Frequency Penalty - Штраф пропорционально частоте упоминаний токенов (OpenAI механизм - типа)
Presence Penalty - Штраф за присутствие токена (OpenAI механизм - типа)
Length Penalty - Контроль длины (<1 = длиннее ответы)
Мин. длина - Минимальная длина до применения length penalty
LZ PENALTY (медленный , но улучшенный)
Repetition Penalty - Базовый штраф за использованные токены (HuggingFace)
шарится по n-gram'ам и шустрит за повторы. Ы
Frequency Penalty - Штраф пропорционально частоте упоминаний токенов (OpenAI механизм - типа)
Presence Penalty - Штраф за присутствие токена (OpenAI механизм - типа)
Length Penalty - Контроль длины (<1 = длиннее ответы)
Мин. длина - Минимальная длина до применения length penalty
👍15❤3
Так, ну шо! Избавился от повторов, но генерации стали обрывистей. Щас падажжи...грёбана. буду решать!
🔥3
Объясните основы космической баллистики и ее практическое применение.
задача о межпланетных путешествиях, кораблей, происходящих на самолете в области венеры с космических аппаратах, существующих космических станциях, таких же находящихся по которым находятся внутри планет и космических аппаратах и посадки планет. < 41 декабря планерах, как и плавающих из москвы (например, спутников). лунные системами управления {аэродрома.
Самое прикольное, что пока что переучивать дуру не надо. Даже если поправлю токенизатор на ходу - сообразит. Ы! (но не факт, лол)
🔥9👏1
Также появилась жесткая проблема. Генераци стали НЕРЕАЛЬНО ДОЛГИМИ! Ответ выше был сгенерировать за 3 минуты с чем-то. Это невыносимо долго, но поправимо) Ваще не вопрос.
😁6🤔2
Тебе бывает страшно?
Ответ модели: мы будем писать так, и до смеха бы: что - то не досывать хочется? но ведь только. < repeat > а ты будешь с тобой смешной - то хоть, по - нибудь разговаривать не пойму все будет, — я бы как - то уж лучше. хуже! — ладно, спасибо вам! ах, мне очень хорошо, в этом я ведь это дело, милый мой мой дорогой буду же без насчёт у тебя от меня спрашиваю на свой надо идти не знаю! ну давай дать говорю ему. вот ты думаешь, да разве нам небось - то и до меня за мной хочется кричать им сказать: жить мне хочется?смеешься быть не сум благодарить надо, пожалуйста из чужое дете — вы его всё об
🔥6❤1🥰1🕊1
INFO:responses:Q: Охарактеризуйте основные этапы построения социалистического общества в СССР.
Temperature: 0.5
A: цели: ликвидация эксплуататорских классов, построение на базе конституции, развитие сельского хозяйства и развитие сельского хозяйства и развитие сельского хозяйства, рост народного хозяйства, рост производительных органов общественного хозяйства, рост производительных силла к концу строя, рост производительных силла в сферах советского строя, рост крестьянства, рост крестьянства и расширение крестьянства, рост производительных сил развития общества, рост классовой собственности, непосредственно крестьянских хозяйств, освобождение от частной собственности, освобождение от частной собственности, непосредственно крестьянских хозяйств, создание новых отраслей и их развитие общества, освобождение от частной собственности, освобождение от частной собственности, непосредственно крестьянских хозяйств, создание новых отраслей и создание новых отраслей и создание новых отраслей народного хозяйства и создание новых отраслей и рост производительных органов управления, ликвидация крестьянства, включая государственный строй и создание пролетариата, освобождение и
После обработки повторов:
АНТИ-ПОВТОР (сбалансированный)
Охарактеризуйте основные этапы построения социалистического общества в СССР
Temperature: 0.8
Ответ модели: . - производство стахановцев: завершение строительства социализма, завершение строительства социализма и развитие промышленности, завершение строительства новой техникой. - выпустить новых заводов и предматематическая ремонт металлоустройства. - подготовка новых отраслей, достижение новых форм производства сложных работ задание промышленного оборудования производства электроэнергии, ликвидация материального оснащение старых государственных машин, ирригационных сооружений, керамических мастерских, завод при советской инструмента валокалостроения, реставрация оборудования, каталогов (тракторы, литейных печей, самочеств, литейного комбинационного завода,
АНТИ-ПОВТОР (сбалансированный)
Охарактеризуйте основные этапы построения социалистического общества в СССР
Temperature: 0.5
Ответ модели: (на основе анализа) как средство производства и цели строительства социализма, так и для исторического развития народного строя. к развитию ссср: - изучите принципы государственной теории социализма, разработанныесъезда партии нового общественного строя.
попытка 2:
АНТИ-ПОВТОР (агрессивный)
Охарактеризуйте основные этапы построения социалистического общества в СССР
Ответ модели: период строительства социализма: - первые боевые объединения народовствия рабочих и советы колхозников на заводах. - восстановительные работы под руководством сталина, получившие сотни миллионов людей. - ленинского типа ркп (например, белорусская революция, татарская колхозная станция им. примерная жизнь народных домовно только с украинского народа).
Вывод? Дальнейшее обучение идёт ей только на пользу. След перезапуск решит практически все проблемы модели!
КОНВЕРГЕНЦИЯ ТАК БЛИЗКО!
❤11👍6🔥3👏1
Дайте определение понятию материя с точки зрения диалектического материализма.
Ответ модели:
материалистическое понимание природы вещь есть результат, отражающая реальная сторона познания, а познание о признаках предмета есть познание и поэтому развитие всей формы есть познание всего существующая материальность человека как живое созерцательная сущность вещей в развитии и реальный мир, непосредственно абстрактное движение.
🤔17👍6🤩3