Forwarded from потужно про llm
Найбільший за розміром і не тільки реліз серед українських ллмок 🚀
Сьогодні ми випускаємо MamayLM v2, закриваючи історію з джеммою 3 та розмірами 12В/27В🎉 27В версія є найбільшою адаптованою під українську ллмкою, показуючи сильний перфоманс на бенчмарках та у чаті кращий за більші та набагато новіші моделі 🫡
Для нової версії ми зробили більше фокусу саме на українську - створили наш власний пайплайн для обробки претрейн даних, використовуючи багато класифікаторів якості текстів та методи кластеризації, додали до Кобзи Миколи Гальтюка FinePDFs, який має свіжі дані, що до цього не потрапляли в жодну велику збірку веб-даних, в результаті чого ми отримали покращені та свіжі українські тексти🙌
Ми враховували ваш фідбек - багато юзерів питали нас про якість перекладу та виклик функцій, тому в пост-трейн стадії ми теж оновили наш мікс даних, додавши більше текстів на машинний переклад та tool calling💪
Ну і на десерт: ми випускаємо наш власний Mamay AI Chat! Тепер ви можете потестувати Мамай2 27В в зручному чаті або API, який підтримує фото, аудіо, веб-пошук та режим міркування. Команда інституту INSAIT вклала в чат-систему місяці праці в рамках роботи над болгарською моделлю BgGPT і тепер ми додали цей функціонал також для української модельки🇺🇦
Чат: mamay.ai
Моделі та блог: models.mamay.ai
Сьогодні ми випускаємо MamayLM v2, закриваючи історію з джеммою 3 та розмірами 12В/27В🎉 27В версія є найбільшою адаптованою під українську ллмкою, показуючи сильний перфоманс на бенчмарках та у чаті кращий за більші та набагато новіші моделі 🫡
Для нової версії ми зробили більше фокусу саме на українську - створили наш власний пайплайн для обробки претрейн даних, використовуючи багато класифікаторів якості текстів та методи кластеризації, додали до Кобзи Миколи Гальтюка FinePDFs, який має свіжі дані, що до цього не потрапляли в жодну велику збірку веб-даних, в результаті чого ми отримали покращені та свіжі українські тексти🙌
Ми враховували ваш фідбек - багато юзерів питали нас про якість перекладу та виклик функцій, тому в пост-трейн стадії ми теж оновили наш мікс даних, додавши більше текстів на машинний переклад та tool calling💪
Ну і на десерт: ми випускаємо наш власний Mamay AI Chat! Тепер ви можете потестувати Мамай2 27В в зручному чаті або API, який підтримує фото, аудіо, веб-пошук та режим міркування. Команда інституту INSAIT вклала в чат-систему місяці праці в рамках роботи над болгарською моделлю BgGPT і тепер ми додали цей функціонал також для української модельки🇺🇦
Чат: mamay.ai
Моделі та блог: models.mamay.ai
mamay.ai
Mamay AI Chat
Тут Ви можете спілкуватися з новою системою штучного інтелекту MamayLM з розширеними можливостями пошуку та аналізу.
❤6
doing something
Released https://github.com/RustedBytes/fast-h2m It is a converter from HTML to Markdown (what LLMs eating) It has python 3.8+ bindings under the same name on PyPI Rust crate supports SIMD if you really need those 5-10% in parsing of large amounts of data…
Added fast-dom mode so it's 10x in speed, check 0.3.1 version
Forwarded from Yehor Smoliakov
14. Післямова до початку
Ось родовід не лише людей, а відповідальності:
Від водню до зорі.
Від зорі до вуглецю.
Від вуглецю до клітини.
Від клітини до тіла.
Від тіла до свідомості.
Від свідомості до вибору.
Від вибору до провини.
Від провини до каяття.
Від каяття до завіту.
Від завіту до дії.
І побачила людина все, що сталося, і не могла сказати просто: “це добре”.
Бо було добре й жахливо, прекрасне й крихке, розумне й безумне.
І тоді сказала вона чесніше:
“Це дано нам.
Це залежить від нас.
Це ще можна врятувати.”
І був вечір.
І був ранок.
І день сьомий ще не закінчився.
https://gist.github.com/egorsmkv/de99d00aec1d7a042743448e8a572956
Gist
Книга Буття, якби її писала людина 2026 року
Книга Буття, якби її писала людина 2026 року. GitHub Gist: instantly share code, notes, and snippets.
🔥3🤔1
Forwarded from Yehor Smoliakov
GitHub
GitHub - PositiveLoss/fscnet-pytorch: Full-Spectrum Context Network (FSC-Net): Integrating Fast Fourier Convolutions and Progressive…
Full-Spectrum Context Network (FSC-Net): Integrating Fast Fourier Convolutions and Progressive Learning for Speech Bandwidth Extension - PositiveLoss/fscnet-pytorch