This media is not supported in your browser
VIEW IN TELEGRAM
Смотрите какую имбу нашел для MiniMax H3
Это не апскейлер, это Lora на детализацию. Судя по примерочным видео внутри репо, то это просто головокружительно.
https://huggingface.co/Alissonerdx/Minimax-H3-ComfyUI
Ворк внутри, но я еще не тестил.
Нужно попробовать реставрировать классику ютуба «Дверь мне запили».
Приятной генерации!
Это не апскейлер, это Lora на детализацию. Судя по примерочным видео внутри репо, то это просто головокружительно.
https://huggingface.co/Alissonerdx/Minimax-H3-ComfyUI
Ворк внутри, но я еще не тестил.
Нужно попробовать реставрировать классику ютуба «Дверь мне запили».
Приятной генерации!
🔥35
💳Как платить за Spotify, Cursor, ChatGPT и другие любимые подписки?…
Если ты читаешь это, скорее всего, у тебя уже была проблема: надо оплатить подписку или купить иностранный софт, а российскую карту не принимают.
Mirocard решает это за пару минут:
Это сервис, где можно выпустить виртуальную карту, пополнить рублями через СБП и платить за:
- Midjourney
- ChatGPT
- Figma
- ElevenLabs
- Claude
- Netflix
- Spotify и еще сотни подписок...
По промокоду “PROCOMFY” выпуск карты со скидкой 50%
Оформление из любой точки мира за пару кликов!⚡️
ОТКРЫТЬ КАРТУ
Если ты читаешь это, скорее всего, у тебя уже была проблема: надо оплатить подписку или купить иностранный софт, а российскую карту не принимают.
Mirocard решает это за пару минут:
Это сервис, где можно выпустить виртуальную карту, пополнить рублями через СБП и платить за:
- Midjourney
- ChatGPT
- Figma
- ElevenLabs
- Claude
- Netflix
- Spotify и еще сотни подписок...
По промокоду “PROCOMFY” выпуск карты со скидкой 50%
Оформление из любой точки мира за пару кликов!⚡️
ОТКРЫТЬ КАРТУ
🔥5👏3👍2🤬2🗿1
НОВОЕ ВИДЕО! GPT-6 Astra vs Qwen 3.8 27B - Тест в Blender с реф. изображением
Я был в шоке как выстрелило предыдущее видео. Люди в комментах просили сделать продолжение с референсным изображением. Мне и самому было интересно что получится.
Смотреть тут: https://www.youtube.com/watch?v=jLcttwEvopg
CLODEx - сервис где собраны все топовые нейронки в одном API:
➡️ Попробовать CLODEx
Бонус при регистрации - $1 на тесты.
Приятного просмотра!
Я был в шоке как выстрелило предыдущее видео. Люди в комментах просили сделать продолжение с референсным изображением. Мне и самому было интересно что получится.
Смотреть тут: https://www.youtube.com/watch?v=jLcttwEvopg
CLODEx - сервис где собраны все топовые нейронки в одном API:
➡️ Попробовать CLODEx
Бонус при регистрации - $1 на тесты.
Приятного просмотра!
YouTube
GPT-6 Astra vs Qwen 3.8 27B - Тест в Blender с референсным изображением
Всем привет! В этот я решил проверить GPT-6 Astra в Blender с референсной картинкой. Сможет ли GPT повторить дизайн легендарной Honda Accord CL7? Приятного просмотра!
GPT-6 Astra и другие популярные ИИ в одном API:
➡️ https://clodex.xyz/r/mrgips_telegram_20260907…
GPT-6 Astra и другие популярные ИИ в одном API:
➡️ https://clodex.xyz/r/mrgips_telegram_20260907…
❤11👍4
Media is too big
VIEW IN TELEGRAM
Безумная сборка для 5090 - скорость доходила до 175 т/с
Наконец-то я чуть пощупал вот это чудо:
https://huggingface.co/neroued/Qwen3.8-27B-nvfp4-NInfer
А все началось с этого поста на Reddit, после которого я загорелся проверить действительно ли такие цифры можно выдавить или снова кликбэйт.
И каково мое было удивление, мало того что скорость генерации отправляет в космос, так еще и префилл достигает безумных 7 660 ток/с
Но я слишком мало потестил, буквально на пару промтах, в прикрепленном видео это один из них.
Остальные тесты в НАШЕМ ЧАТЕ
Держу в курсе и продолжаю наблюдение. Всем быстрых токенов!
Наконец-то я чуть пощупал вот это чудо:
https://huggingface.co/neroued/Qwen3.8-27B-nvfp4-NInfer
А все началось с этого поста на Reddit, после которого я загорелся проверить действительно ли такие цифры можно выдавить или снова кликбэйт.
И каково мое было удивление, мало того что скорость генерации отправляет в космос, так еще и префилл достигает безумных 7 660 ток/с
Но я слишком мало потестил, буквально на пару промтах, в прикрепленном видео это один из них.
Остальные тесты в НАШЕМ ЧАТЕ
Держу в курсе и продолжаю наблюдение. Всем быстрых токенов!
👍12❤1🔥1
MrGips • Про LLM
Безумная сборка для 5090 - скорость доходила до 175 т/с Наконец-то я чуть пощупал вот это чудо: https://huggingface.co/neroued/Qwen3.8-27B-nvfp4-NInfer А все началось с этого поста на Reddit, после которого я загорелся проверить действительно ли такие цифры…
Небольшое сравнение NInfer: MTP vs DFlash2 🚀
Вчера забыл уточнить что тестил модель с ускорителем MTP. А в этом посте уже попробовал с DFlash2. Кстати, что MTP, что DFlash2, все эти ускорялки вшиты в модель, ничего отдельно качать не надо. Даже vision внутри. Ну не кайф ли.
И так начнем, модель: Qwen 3.8 27B NVFP4
KV-кэш: FP8, concurrency 2, vision включён.
🔹 MTP, draft tokens: 3
• Средняя генерация: ~143 ток/с
• Типичная скорость: 120–175 ток/с
• Acceptance rate: ~64%
• Контекст: 220k
• Cached TTFT: ~0,37 с
🔸 DFlash2, draft tokens: 7
• Средняя генерация: ~166 ток/с
• Длинная генерация: 25 893 токена со скоростью 242 ток/с
• На отдельных интервалах: до ~290 ток/с
• Acceptance rate: ~38%
• Контекст: 160k
• Медианный TTFT: ~0,62 с
Итог от электронной головы: DFlash2 оказался примерно на 16% быстрее в среднем и особенно хорошо разгоняется на длинных ответах. MTP принимает больше draft-токенов и позволяет держать более широкий контекст — 220k против 160k.
Это не строгий синтетический бенчмарк. В реальной работе Claude Desktop с инструментами DFlash2 выглядит быстрее, а MTP — универсальнее для очень длинного контекста.
Быть может вы заметили, нет цифр по префиллу. Вот они:
MTP: около
DFlash2: около
MTP быстрее по prefill примерно на 45%
Итог от меня: тут нужно выбрать что тебе важнее контекст или скорость? Либо ты жертвуешь контекстом и префиллом и получаешь на 15-20% больше скорости декода. Либо чувствуешь себя как босс с длинным контекстом и молниеносным префиллом и практически не чувствуешь снижение скорости.
Приятной генерации!
Вчера забыл уточнить что тестил модель с ускорителем MTP. А в этом посте уже попробовал с DFlash2. Кстати, что MTP, что DFlash2, все эти ускорялки вшиты в модель, ничего отдельно качать не надо. Даже vision внутри. Ну не кайф ли.
И так начнем, модель: Qwen 3.8 27B NVFP4
KV-кэш: FP8, concurrency 2, vision включён.
🔹 MTP, draft tokens: 3
• Средняя генерация: ~143 ток/с
• Типичная скорость: 120–175 ток/с
• Acceptance rate: ~64%
• Контекст: 220k
• Cached TTFT: ~0,37 с
🔸 DFlash2, draft tokens: 7
• Средняя генерация: ~166 ток/с
• Длинная генерация: 25 893 токена со скоростью 242 ток/с
• На отдельных интервалах: до ~290 ток/с
• Acceptance rate: ~38%
• Контекст: 160k
• Медианный TTFT: ~0,62 с
Итог от электронной головы: DFlash2 оказался примерно на 16% быстрее в среднем и особенно хорошо разгоняется на длинных ответах. MTP принимает больше draft-токенов и позволяет держать более широкий контекст — 220k против 160k.
Это не строгий синтетический бенчмарк. В реальной работе Claude Desktop с инструментами DFlash2 выглядит быстрее, а MTP — универсальнее для очень длинного контекста.
Быть может вы заметили, нет цифр по префиллу. Вот они:
MTP: около
5 110 ток/сDFlash2: около
3 536 ток/сMTP быстрее по prefill примерно на 45%
По обработке входного контекста MTP заметно быстрее: ~5,1k против ~3,5k ток/с у DFlash2. Поэтому MTP лучше при частой загрузке нового большого контекста, а DFlash2 выигрывает на длинной генерации ответа: ~166 против ~143 ток/с в среднем.
Итог от меня: тут нужно выбрать что тебе важнее контекст или скорость? Либо ты жертвуешь контекстом и префиллом и получаешь на 15-20% больше скорости декода. Либо чувствуешь себя как босс с длинным контекстом и молниеносным префиллом и практически не чувствуешь снижение скорости.
Приятной генерации!
👍7❤6
Media is too big
VIEW IN TELEGRAM
Протестировал DeepSeek V4.1 Flash на аквариуме
Пока готовил новое видео, решил закинуть промт аквариума в DeepSeek, который в Opencode. Кстати промт находится в НАШЕМ ЧАТЕ в разделе Промты.
И что мы имеем:
Потрачено 220к токенов. Списало 1.21$. Дорого чи не? Я не шарю, это буквально мой второй раз пользования по АПИ.
Всем дешевых токенов!
Пока готовил новое видео, решил закинуть промт аквариума в DeepSeek, который в Opencode. Кстати промт находится в НАШЕМ ЧАТЕ в разделе Промты.
И что мы имеем:
Потрачено 220к токенов. Списало 1.21$. Дорого чи не? Я не шарю, это буквально мой второй раз пользования по АПИ.
Всем дешевых токенов!
👍12❤5
"Отупление" хайповой модели GPT-6 Astra подтвердили сами OpenAI-евцы
Всё LLM сообщество шумит постами на реддите про понижение умственных способностей новой модели, буквально спустя несколько дней после бомбовых бенчмарков и тестов.
Для тех кто давно в теме, это не удивительно. Испокон веков крутилку крутости прикручивали спустя время для экономии ресурсов. Ведь основные сливки были сняты, баллы уважения заработаны, и можно готовиться к прогреву следующей модели. Но для новичков это прям боль.
Но если хочешь прикоснуться к прекрасной GPT-6 ASTRA без покупки подписки, то есть сервис, где со старту дают 1$ на тест всех популярных нейронок:
➡️ Попробовать CLODEx
Приятной генерации!
MrGips • Про LLM / НАШ ЧАТ
Всё LLM сообщество шумит постами на реддите про понижение умственных способностей новой модели, буквально спустя несколько дней после бомбовых бенчмарков и тестов.
Для тех кто давно в теме, это не удивительно. Испокон веков крутилку крутости прикручивали спустя время для экономии ресурсов. Ведь основные сливки были сняты, баллы уважения заработаны, и можно готовиться к прогреву следующей модели. Но для новичков это прям боль.
Но если хочешь прикоснуться к прекрасной GPT-6 ASTRA без покупки подписки, то есть сервис, где со старту дают 1$ на тест всех популярных нейронок:
➡️ Попробовать CLODEx
Приятной генерации!
MrGips • Про LLM / НАШ ЧАТ
👎9❤2😁2
🔥 NVIDIA RTX PRO 5500 Blackwell с 84 ГБ видеопамяти
Вы вообще видели какую пушечку скоро выпустит NVIDIA?
На сайте NVIDIA появилась новая профессиональная видеокарта RTX PRO 5500 Blackwell Workstation Edition, для локального AI она выглядит особенно интересно.
Главное:
🔹 84 ГБ GDDR7 ECC
🔹 пропускная способность памяти - 1398 ГБ/с
🔹 архитектура Blackwell
🔹 Tensor Cores 5-го поколения с поддержкой FP4
🔹 RT Cores 4-го поколения
🔹 PCIe 5.0 x16
🔹 3× NVENC 9-го поколения
🔹 3× NVDEC 6-го поколения
🔹 энергопотребление - до 600 Вт
По объёму VRAM она расположилась очень интересно:
RTX PRO 5000 — до 72 ГБ
➡️ RTX PRO 5500 — 84 ГБ
RTX PRO 6000 — 96 ГБ
Только я один узнал что есть еще RTX PRO 5000? Думал это просто обозначение всех видеокарт.
Делаю ставку на 16 000€. А вы как думаете, какая цена будет?
Короче, хочу 😍
MrGips • Про LLM / НАШ ЧАТ
Вы вообще видели какую пушечку скоро выпустит NVIDIA?
На сайте NVIDIA появилась новая профессиональная видеокарта RTX PRO 5500 Blackwell Workstation Edition, для локального AI она выглядит особенно интересно.
Главное:
🔹 84 ГБ GDDR7 ECC
🔹 пропускная способность памяти - 1398 ГБ/с
🔹 архитектура Blackwell
🔹 Tensor Cores 5-го поколения с поддержкой FP4
🔹 RT Cores 4-го поколения
🔹 PCIe 5.0 x16
🔹 3× NVENC 9-го поколения
🔹 3× NVDEC 6-го поколения
🔹 энергопотребление - до 600 Вт
По объёму VRAM она расположилась очень интересно:
RTX PRO 5000 — до 72 ГБ
➡️ RTX PRO 5500 — 84 ГБ
RTX PRO 6000 — 96 ГБ
Только я один узнал что есть еще RTX PRO 5000? Думал это просто обозначение всех видеокарт.
Делаю ставку на 16 000€. А вы как думаете, какая цена будет?
Короче, хочу 😍
MrGips • Про LLM / НАШ ЧАТ
😁11🔥4👍2
НОВОЕ ВИДЕО! GPT-6 Astra vs Qwen 3.8 27B - Тест в GODOT
Мне немного надоел Blender, и я решил попробовать поиграть в игростроение. Это не сравнение - это просто тест возможностей. Кстати в видео еще и 3.8 Flash Next, но не совсем. Так же фигурирует vLLM немного. История занимательная, которуя пошла не по плану.
Смотреть видео:
https://www.youtube.com/watch?v=4EbVdMnIb3Q
В комментариях будут файлы из видео.
Еще одно, спонсор этого видео CLODEx - сервис с популярными нейронками в одном API:
➡️ Попробовать CLODEx
Сервис со старту дает 1$ на тест.
Приятного просмотра!
MrGips • Про LLM / НАШ ЧАТ
Мне немного надоел Blender, и я решил попробовать поиграть в игростроение. Это не сравнение - это просто тест возможностей. Кстати в видео еще и 3.8 Flash Next, но не совсем. Так же фигурирует vLLM немного. История занимательная, которуя пошла не по плану.
Смотреть видео:
https://www.youtube.com/watch?v=4EbVdMnIb3Q
В комментариях будут файлы из видео.
Еще одно, спонсор этого видео CLODEx - сервис с популярными нейронками в одном API:
➡️ Попробовать CLODEx
Сервис со старту дает 1$ на тест.
Приятного просмотра!
MrGips • Про LLM / НАШ ЧАТ
YouTube
GPT-6 Astra vs Qwen 3.8 27B vs 3.8 Flash Next - Тест в GODOT (GameDev)
Всем привет. В этом видео я хочу показать как GTP-6 Astra и Qwen 3.8 27B проявят себя в создании игр. Но это не совсем игра, а симулятор сноса здания. Кстати, в этом видео еще фигурирует Qwen 3.8 Flash Next в квантизации IQ4, но не совсем. В общем смотрите…
🔥10😁1
MrGips • Про LLM
🔥 NVIDIA RTX PRO 5500 Blackwell с 84 ГБ видеопамяти Вы вообще видели какую пушечку скоро выпустит NVIDIA? На сайте NVIDIA появилась новая профессиональная видеокарта RTX PRO 5500 Blackwell Workstation Edition, для локального AI она выглядит особенно интересно.…
В США барыги ломят цены на RTX 5090 по $9500
Зашел на реддит посмотреть что интересного, и увидел такой пост.
Пишут что начали массово исчезать 5090 из крупных торговых площадок. А убарыг сторонних продавцов цена достигает $6000-9500.
Почему? Причины всё те же - резкий рост спроса. В комментах еще обсудили разные теории, в которых замешан Китай, который скупает все остатки для своих перепаек на 96 gb VRAM. Но то лишь теории.
Если в игровом мире 5090 считается боссом видеокарт, то в AI-сфере уже как дешёвая основа AI-сервера. Вам не показалось. ДЕШЕВАЯ.
Пользователи сообщают примерно о 140–170 токенах/с на Qwen 3.8 27B, а в отдельных конфигурациях с NVFP4 + MTP встречаются результаты около 200 токенов/с. Знаю я таких пользователей, в НАШЕМ ЧАТЕ и не такие скоростя бывали. У меня всё.
MrGips • Про LLM / НАШ ЧАТ
Зашел на реддит посмотреть что интересного, и увидел такой пост.
Пишут что начали массово исчезать 5090 из крупных торговых площадок. А у
Почему? Причины всё те же - резкий рост спроса. В комментах еще обсудили разные теории, в которых замешан Китай, который скупает все остатки для своих перепаек на 96 gb VRAM. Но то лишь теории.
Если в игровом мире 5090 считается боссом видеокарт, то в AI-сфере уже как дешёвая основа AI-сервера. Вам не показалось. ДЕШЕВАЯ.
Пользователи сообщают примерно о 140–170 токенах/с на Qwen 3.8 27B, а в отдельных конфигурациях с NVFP4 + MTP встречаются результаты около 200 токенов/с. Знаю я таких пользователей, в НАШЕМ ЧАТЕ и не такие скоростя бывали. У меня всё.
MrGips • Про LLM / НАШ ЧАТ
😱10❤2🤔1
Впервые на моем канале видео перевалило за 100 тыс просмотров.
Как-то даже неверится. Спасибо что смотрите, а так же отдельная благодарность Qwen’тину и Астре за это!
MrGips • Про LLM / НАШ ЧАТ
Как-то даже неверится. Спасибо что смотрите, а так же отдельная благодарность Qwen’тину и Астре за это!
MrGips • Про LLM / НАШ ЧАТ
👍27🎉4
Media is too big
VIEW IN TELEGRAM
Ностальгия в глаз попала - Quake 3 в гараже
Сегодня на реддите заметил интересный пост, где парень поместил физику и оружие из игры Quake 3 в Gaussian Splat-сцену.
Он собрал демо на PlayCanvas с WebGPU. Сам уровень - это не обычная 3D-модель, а Gaussian Splat, подготовленный через SuperSplat.
Для физики он сделал отдельную voxel collision map, потому что сами сплаты не подходят для нормальных столкновений игрока со стенами и объектами.
Механику движения и оружия автор переносил с оглядкой на исходники ioquake3, а оригинальные файлы Quake 3 использовал для моделей и конфигов оружия.
В итоге стек примерно такой:
PlayCanvas + WebGPU
SuperSplat / Gaussian Splat
Voxel collision
ioquake3 как основа для movement и weapons
На RTX 4090 всё работает быстро, а на MacBook Pro M3 автор пишет о примерно 40–60 FPS.
Где он это вайбкодил, я не нашел.
Ждем теперь Мозг мухи внутри клетки с хомяками с механикой движения из Half-Life.
MrGips • Про LLM / НАШ ЧАТ
Сегодня на реддите заметил интересный пост, где парень поместил физику и оружие из игры Quake 3 в Gaussian Splat-сцену.
Он собрал демо на PlayCanvas с WebGPU. Сам уровень - это не обычная 3D-модель, а Gaussian Splat, подготовленный через SuperSplat.
Для физики он сделал отдельную voxel collision map, потому что сами сплаты не подходят для нормальных столкновений игрока со стенами и объектами.
Механику движения и оружия автор переносил с оглядкой на исходники ioquake3, а оригинальные файлы Quake 3 использовал для моделей и конфигов оружия.
В итоге стек примерно такой:
PlayCanvas + WebGPU
SuperSplat / Gaussian Splat
Voxel collision
ioquake3 как основа для movement и weapons
На RTX 4090 всё работает быстро, а на MacBook Pro M3 автор пишет о примерно 40–60 FPS.
Где он это вайбкодил, я не нашел.
Ждем теперь Мозг мухи внутри клетки с хомяками с механикой движения из Half-Life.
MrGips • Про LLM / НАШ ЧАТ
🔥7😁4❤2
Media is too big
VIEW IN TELEGRAM
🪰 Мозг мухи научили водить авто
Снова на реддите увидел необычный кейс с использованием нейронных связей мозга дрозрофилы, где автор подключил её к виртуальной машинке в Three.js.
Датчики машины подают сигналы на сенсорные нейроны, движение работает как награда, а столкновения - как «боль». Также используются дофаминовые механизмы обучения.
То есть эксперимент проверяет, сможет ли структура настоящего мозга мухи научиться управлять совершенно чужим для неё «телом».
2026-й год не перестает удивлять.
MrGips • Про LLM / НАШ ЧАТ
Снова на реддите увидел необычный кейс с использованием нейронных связей мозга дрозрофилы, где автор подключил её к виртуальной машинке в Three.js.
Датчики машины подают сигналы на сенсорные нейроны, движение работает как награда, а столкновения - как «боль». Также используются дофаминовые механизмы обучения.
То есть эксперимент проверяет, сможет ли структура настоящего мозга мухи научиться управлять совершенно чужим для неё «телом».
2026-й год не перестает удивлять.
MrGips • Про LLM / НАШ ЧАТ
👍10😁6🔥3🥴2❤1🤔1
MrGips • Про LLM
Протестировал DeepSeek V4.1 Flash на аквариуме Пока готовил новое видео, решил закинуть промт аквариума в DeepSeek, который в Opencode. Кстати промт находится в НАШЕМ ЧАТЕ в разделе Промты. И что мы имеем: Потрачено 220к токенов. Списало 1.21$. Дорого чи…
DeepSeek V4.1 Flash через OpenRouter оказался реально дешёвым 💸
Если помните, я недавно выкладывал пост с тестом дипсика на аквариуме. И вот я тогда сказал что потрачено 220к токенов (по подсчетом OpenCode), а списало 1,21$ в OpenRouter.
Но сегодня в OpenRouter я увидел статистику потраченых токенов, и просто прозрел.
Этот аквариум потратил:
• 11,8 млн токенов
• 71 запрос
• cache hit - 70,4%
То есть в среднем вышло около $0,10 за 1 млн обработанных токенов. ВОУ ВОУ.
Почему так дёшево? OpenCode постоянно отправляет модели большой контекст заново, поэтому счётчик токенов растёт очень быстро. Но у меня около 70% этого контекста попадает в кэш и оплачивается значительно дешевле.
Все таки дешевость дипсика оказалось правдой. Опенкод ввел меня в заблуждение. В агентном режиме это просто сказка.
MrGips • Про LLM / НАШ ЧАТ
Если помните, я недавно выкладывал пост с тестом дипсика на аквариуме. И вот я тогда сказал что потрачено 220к токенов (по подсчетом OpenCode), а списало 1,21$ в OpenRouter.
Но сегодня в OpenRouter я увидел статистику потраченых токенов, и просто прозрел.
Этот аквариум потратил:
• 11,8 млн токенов
• 71 запрос
• cache hit - 70,4%
То есть в среднем вышло около $0,10 за 1 млн обработанных токенов. ВОУ ВОУ.
Почему так дёшево? OpenCode постоянно отправляет модели большой контекст заново, поэтому счётчик токенов растёт очень быстро. Но у меня около 70% этого контекста попадает в кэш и оплачивается значительно дешевле.
Все таки дешевость дипсика оказалось правдой. Опенкод ввел меня в заблуждение. В агентном режиме это просто сказка.
MrGips • Про LLM / НАШ ЧАТ
🔥6🤯4
Велосипед в Blender + Qwen 3.8 27B NVFP4 + Ninfer + Hermes Agent на RTX 5090
Первое фото - референс
Второе фото - результат
Скорость декода:
• ~130-160 ток/с - обычная скорость
• ~160-175 ток/с - на более удачных запросах
• видел пики около 190-200 ток/с
На контексте 100K+ скорость немного падает и чаще находится в районе 120-135 ток/с.
Prefill около 6-7K ток/с.
На данный момент это идеальная связка, учитывая какой тяжелый хермес и какой быстрый префилл у Ninfer.
Как вам велик?
MrGips • Про LLM / НАШ ЧАТ
Первое фото - референс
Второе фото - результат
Скорость декода:
• ~130-160 ток/с - обычная скорость
• ~160-175 ток/с - на более удачных запросах
• видел пики около 190-200 ток/с
На контексте 100K+ скорость немного падает и чаще находится в районе 120-135 ток/с.
Prefill около 6-7K ток/с.
На данный момент это идеальная связка, учитывая какой тяжелый хермес и какой быстрый префилл у Ninfer.
Как вам велик?
MrGips • Про LLM / НАШ ЧАТ
🔥6
Просто 1.5 литра vs 5090
Пришлось высунуть этот кирпич чтобы добраться до SSD M2.
MrGips • Про LLM / НАШ ЧАТ
Пришлось высунуть этот кирпич чтобы добраться до SSD M2.
MrGips • Про LLM / НАШ ЧАТ
🤣11👍7❤2😱2
This media is not supported in your browser
VIEW IN TELEGRAM
🔥4,1 МИЛЛИОНА ТОКЕНОВ ЗА 7 ЦЕНТОВ!
Закинул промт черепахи в Дипсик v4.1 Flash чтобы наглядно оценить стоимость.
• Всего обработано: 4 100 038 токенов
• Входные токены: 207 078
• Кешированные токены: 3 846 784
• Выходные токены: 46 176
• Попадание в кеш: 95%
💰 Расчёт стоимости:
• Входные токены: $0,0311
• Кешированные токены: $0,0115
• Выходные токены: $0,0277
Итого: всего $0,07 за 4,1 млн токенов!
Секрет такой низкой стоимости - кеширование. В очередной раз убеждаюсь - за кэшем будущее. А не все эти ваши безналы...
MrGips • Про LLM / НАШ ЧАТ
Закинул промт черепахи в Дипсик v4.1 Flash чтобы наглядно оценить стоимость.
• Всего обработано: 4 100 038 токенов
• Входные токены: 207 078
• Кешированные токены: 3 846 784
• Выходные токены: 46 176
• Попадание в кеш: 95%
💰 Расчёт стоимости:
• Входные токены: $0,0311
• Кешированные токены: $0,0115
• Выходные токены: $0,0277
Итого: всего $0,07 за 4,1 млн токенов!
Секрет такой низкой стоимости - кеширование. В очередной раз убеждаюсь - за кэшем будущее. А не все эти ваши безналы...
MrGips • Про LLM / НАШ ЧАТ
👍19😁4❤1
Qwen-Image-2.1 - открытые веса нового генератора релизнут сегодня!
Обратный отсчет тут: https://modelscope.cn/models/Qwen/Qwen-Image-2.1
Давненько не было свежачка от Квентинов в плане фото. Ждем?
MrGips • Про LLM / НАШ ЧАТ
Обратный отсчет тут: https://modelscope.cn/models/Qwen/Qwen-Image-2.1
Давненько не было свежачка от Квентинов в плане фото. Ждем?
MrGips • Про LLM / НАШ ЧАТ
🔥15
This media is not supported in your browser
VIEW IN TELEGRAM
Сегодня вечером новое видео
Я так преисполнился дешевым Дипсиком V4,1 Flash что решил его погонять по максимуму.
MrGips • Про LLM / НАШ ЧАТ
Я так преисполнился дешевым Дипсиком V4,1 Flash что решил его погонять по максимуму.
MrGips • Про LLM / НАШ ЧАТ
😁6👏4🏆2🔥1🎃1