Gaperton's Tech Corner
Народ в Х обратил внимание, что в этом графике логарифмическая шкала по цене, и теперь все делятся картинками, чтобы осознать, что же это значит.
А значит это примерно вот что.
На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.
И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.
Но одно можно сказать точно: конкуренция — это прекрасно.
И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.
Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
На практике, если вы платите за токены, вам не нужно ничего, кроме GPT-6.1 Sol High/XHigh. И Амадей идет в сад.
И, кстати, еще неизвестно, насколько субсидированная цена OpenAI. Очень может быть, что нет. У них модели тратят в десятки раз меньше токенов на ту же задачу.
Но одно можно сказать точно: конкуренция — это прекрасно.
И надо понимать, что это всё временно, и что через несколько лет примерно все будут делать это примерно одинаково. Что один человек создал, другой всегда сможет повторить. А поэтому совершенно не важно, насколько сейчас Китай отстает. Это не спринт, а марафон. И выигрывает его тот, у кого модель бесплатная.
Самое лучшее, что можно сделать в этой ситуации, — это избежать вендорлока. Пользуйтесь например Гермесом.
🔥2
Gaperton's Tech Corner
Надо отметить, что я не разделяю его опасений. Разница, как он сам говорит, онтологическая. Машина лишена агентности и, таким образом, не может быть автором ничего, и не может нести ответственность за свои поступки. У машины нет желаний, воли, и поступков.…
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7
Европа наносит ответный удар. Они выпустили новую модель.
Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.
Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next.
Я думаю, в конце этого месяца мы все с удовольствием посмотрим, как китайская Qwen4 на 27B параметров порвёт модель с 1T.
😁4
Gaperton's Tech Corner
Европа наносит ответный удар. Они выпустили новую модель. Порванная на британский (или французский?) флаг жопа, для того чтобы сравняться с GPT-6 Luna и немного отстать от DeepSeek c бесплатным Qwen3.8-Flash-Next. Я думаю, в конце этого месяца мы все с удовольствием…
И вы, таки, будете смеяться. Угадайте, в чем она хороша.
😁10
Forwarded from Андрей Зорин
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700
Codeberg.org
radiance
modular inference engine for people that want to get the most out of their hardware
Gaperton's Tech Corner
https://codeberg.org/StillDeadcode/radiance - а вот на Radiance чистом, не vllm форке, Qwen3.8-flash-next завелся и полетел 140+ токенов в секунду декод, 6,5-7к префилл. На 2-х Radeon R9700
Теперь тестируем движок Radiance, который является отдельным движком для моделей Qwen. Это не vllm fork. Почти никто за пределами собственного трекера задач не писал о нем. Движок стал доступен публике около 12 дней назад, и я не нашел независимых обзоров, блог постов или обсуждений на Reddit.
Qwen3.8-Flash-Next: 4-bit experts, int8 trunk, MTP, vision.
Контекст: 200K токенов на запрос из пула около 1,0M токенов, примерно 5 полных сеансов, с 8 последовательностями одновременно.
Holy fuck, господа присяжные заседатели. Надо проверить, нет ли в этом подвоха, потому что если его нет, то мы это оставляем.
Qwen3.8-Flash-Next: 4-bit experts, int8 trunk, MTP, vision.
Контекст: 200K токенов на запрос из пула около 1,0M токенов, примерно 5 полных сеансов, с 8 последовательностями одновременно.
Holy fuck, господа присяжные заседатели. Надо проверить, нет ли в этом подвоха, потому что если его нет, то мы это оставляем.
🔥5
Gaperton's Tech Corner
Теперь тестируем движок Radiance, который является отдельным движком для моделей Qwen. Это не vllm fork. Почти никто за пределами собственного трекера задач не писал о нем. Движок стал доступен публике около 12 дней назад, и я не нашел независимых обзоров…
Все, будущее наступило. Пробуем.
У меня Qwen3.8-Flash-Next в проде. Качество, конечно, пока с 27B FP8 не сравнивал.
У меня Qwen3.8-Flash-Next в проде. Качество, конечно, пока с 27B FP8 не сравнивал.
🔥1
Gaperton's Tech Corner
Все, будущее наступило. Пробуем. У меня Qwen3.8-Flash-Next в проде. Качество, конечно, пока с 27B FP8 не сравнивал.
Модель уровня DeepSeek V4.1 Flash, работает бесплатно и заметно быстрее большинства моделей на OpenCode Go. Качество квантизации при этом очень высокое — лучше чем Q4_K_XL от unsloth.
Оборудование, напоминаю: 128 ГБ DDR4 и 2xR9700 32 Гб. Мать Asus x570-f. Это оборудование предыдущего поколения. Не считая GPU.
Все, короче, ничего не трогаем. И переносим все остальные модели на второй компьютер, для которого я купил 3090. Это у нас модели синтеза речи, распознавание речи, реранкер. Ну ещё хуйню навесим, типа вижен-модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Forwarded from Вселенское зло об ИИ, технологиях и людях
Минутка work in progress
Короткий спойлер того, что будет в ближайшей статье.
Исследование производительности Radeon AI PRO R9700 вылилось в сравнение кучи рантаймов, половины линейки RTX PRO и попытки все это визуализировать.
Пока статья дописывается, краткое превью в виде диаграммы по мотивам постов в ТГ канале. 70-75 токенов в секунду в 27B модели в FP8 это очень интересный результат.
Полная статья будет на Sponsr. Подписывайтесь
Короткий спойлер того, что будет в ближайшей статье.
Исследование производительности Radeon AI PRO R9700 вылилось в сравнение кучи рантаймов, половины линейки RTX PRO и попытки все это визуализировать.
Пока статья дописывается, краткое превью в виде диаграммы по мотивам постов в ТГ канале. 70-75 токенов в секунду в 27B модели в FP8 это очень интересный результат.
Полная статья будет на Sponsr. Подписывайтесь
🙏1
Gaperton's Tech Corner
Ну всё, чё. ChatGPT оставляем. OpenCode Go не нужен.
🔥 Локальный Qwen3.8-Flash-Next прям очень хорош.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Если вы интересуетесь, почему Европа не может произвести ничего, кроме регуляций на крышки для пластиковых бутылок. Проблемы там глубоко, и они скорее из области клинической психиатрии.
"given the large share of nuclear power in France’s energy mix and questions whether it guarantees European independence"
https://x.com/POLITICOEurope/status/2108099375750656485?s=20
"given the large share of nuclear power in France’s energy mix and questions whether it guarantees European independence"
https://x.com/POLITICOEurope/status/2108099375750656485?s=20
Всего лишь спустя несколько дней после выхода Large 4 от Mistral, немецкая поисковая система Ecosia решила разорвать с ней отношения.
Почему?
Они сомневаются во французских дата-центрах, работающих на атомной энергии.
А чем они их заменяют?
Открытыми моделями из Китая... чья энергосеть работает преимущественно на угле.
😁5🤯2🔥1
Тем временем OpenAI очень смешно обосрался. Они опубликовали что-то вроде семиста доказательств новых математических теорем, сделанных их языковыми моделями.
Но вы, наверное, догадываетесь, что оказалось внутри, когда математики заглянули внимательно.
Я, конечно, всё понимаю, что теперь любой долбоёб с языковой моделью в руках считает себя специалистом в любой области. Но бля.
Но вы, наверное, догадываетесь, что оказалось внутри, когда математики заглянули внимательно.
Я, конечно, всё понимаю, что теперь любой долбоёб с языковой моделью в руках считает себя специалистом в любой области. Но бля.
😁8
Есть идеи настолько плохие, что для создания правдоподобных, но ошибочных аргументов в их защиту требуются по-настоящему умные люди.
https://x.com/perrymetzger/status/2107860087393972376?s=20
Скотт Александр в своём ответе Стивену Пинкеру продемонстрировал, что чем умнее человек, тем эффективнее он может использовать нечёткие формулировки и логические ошибки при защите неверных идей. Есть идеи настолько плохие, что для создания правдоподобных, но ошибочных аргументов в их защиту требуются по-настоящему умные люди. И, к сожалению, именно этот тип применения интеллекта теперь практикуют те, кто называет себя «рационалистами».
Когда группа скатывается в племенное мышление или культ, главной задачей становится защита ключевых убеждений сообщества, а неприятные истины, противоречащие этим убеждениям, должны подавляться всеми доступными средствами.
https://x.com/perrymetzger/status/2107860087393972376?s=20
X (formerly Twitter)
Perry E. Metzger (@perrymetzger) on X
Scott Alexander has demonstrated in his response to Steven Pinker that the smarter you are, the more effectively you can deploy fuzzy language and logical fallacies in the defense of incorrect ide…
❤4