А вот такие инструкции я бы закладывал в контекст моделек при подготовке с ними промптов (вы же не сами пишете промпты)?
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
- Управлять любыми приложениями через язык — клики, ввод текста, навигация
- Работает локально, бесплатно и под лицензией Apache 2.0
- Поддержка Windows и macOS (Linux в разработке)
- Новое в v0.2.0 — удалённое управление компьютером и браузером (пока только для материкового Китая)
- Локальный и приватный ассистент без облака
- Полезен для RPA, автоматизации и тестирования
- Основан на визуально-языковой модели, которая распознаёт интерфейсы и взаимодействует с ними
@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Креативный совет
This media is not supported in your browser
VIEW IN TELEGRAM
🎹Elevenlabs захватывает весь sound сегмент
На этот раз video2music, инстумент генерирующий музыку для вашего видео
@creadvice #elevenlabs
На этот раз video2music, инстумент генерирующий музыку для вашего видео
@creadvice #elevenlabs
❤🔥1💅1
Я в общем не очень люблю планирование планирования. Но с нейронками этот процесс выходит на некий новый уровень. Про то, как важно писать промпты, все вроде уже знают. Я в этом уже слегка поднаторел. Пишу, конечно, не сам – говорю простыми словами Клоду, что надо сделать, он пишет промпт, и потом ему же кормлю этот промпт в новом диалоге. Получается куда лучше, чем просто одна команда.
Но это полбеды. Тут пытаюсь разобраться с Claude Code и заодно на свой новый сервер (mac mini m4 16gb) ставлю всякое ПО, и поминая как мучались в прошлый раз, часами прокидывая порты, конфигурируя докеры и пр., я решил подойти к вопросу более взвешенно.
Во-первых, попросил Клода сделать скрипт для анализа текущей конфигурации. У меня их получилось целых пять – один для железа, другой для установленного софта, третий для сетевых настроек, четвертый – конфигурация сервера в Германии (для vpn) и пятый – у меня еще NAS есть. Их результаты выгружаются в текстовый файл. Дальше – пять промптов, которые на основе этих выгрузок делают описание конфигурации.
Формат – yaml. Его понимает Claude Code, он хорошо формализован. В сам Claude Code промпты будут поступать в формате markdown. Это просто текст, слегка отформатированный, собственно все нейронки едят именно текст. И еще json, xml но markdown куда проще читать человеку. Claude Code понимает и мешанину из yaml и markdown, но другие нейронки это не любят. Передавая в Claude Code информацию в yaml, я передаю ее не столько в модель, сколько в оболочку – по сути, это задает определенные настройки для работы агента. Вся эта кухня нужна для того, чтобы уменьшить фантазии нейронок и заранее избежать конфликтов в настройках.
Посмотрим, как это будет работать в жизни, но переделать формат – вообще не проблема. Не подойдет yaml, возьмем другой. Главное, теперь у меня в нескольких файлах собрана вся информация о моей системе, и при установке и настройке новых программ это должно очень сильно облегчить их запуск. Опенсорс – очень круто, я в восторге, но возиться с ним приходится много. Без нейронок я бы это не осилил.
Для начала для работы настроил себе новый vpn – поставил формат vless, который вроде бы самый продвинутый сейчас, немного повозились – работает. Активно включаю в работу свое хранилище NAS – купил его в 2013 году, но разобраться с ним как-то получается только сейчас, опять же, спасибо нейронкам.
Еще попробую Repo Prompt – как инструмент работы с промптами. Именно по его мотивам все и затеял, но пока все сделал по старинке – вместе с Клодом. Он сегодня хорошо потрудился, молодец.
Будет интересно, пишите - пришлю примеры, как это все выглядит
Но это полбеды. Тут пытаюсь разобраться с Claude Code и заодно на свой новый сервер (mac mini m4 16gb) ставлю всякое ПО, и поминая как мучались в прошлый раз, часами прокидывая порты, конфигурируя докеры и пр., я решил подойти к вопросу более взвешенно.
Во-первых, попросил Клода сделать скрипт для анализа текущей конфигурации. У меня их получилось целых пять – один для железа, другой для установленного софта, третий для сетевых настроек, четвертый – конфигурация сервера в Германии (для vpn) и пятый – у меня еще NAS есть. Их результаты выгружаются в текстовый файл. Дальше – пять промптов, которые на основе этих выгрузок делают описание конфигурации.
Формат – yaml. Его понимает Claude Code, он хорошо формализован. В сам Claude Code промпты будут поступать в формате markdown. Это просто текст, слегка отформатированный, собственно все нейронки едят именно текст. И еще json, xml но markdown куда проще читать человеку. Claude Code понимает и мешанину из yaml и markdown, но другие нейронки это не любят. Передавая в Claude Code информацию в yaml, я передаю ее не столько в модель, сколько в оболочку – по сути, это задает определенные настройки для работы агента. Вся эта кухня нужна для того, чтобы уменьшить фантазии нейронок и заранее избежать конфликтов в настройках.
Посмотрим, как это будет работать в жизни, но переделать формат – вообще не проблема. Не подойдет yaml, возьмем другой. Главное, теперь у меня в нескольких файлах собрана вся информация о моей системе, и при установке и настройке новых программ это должно очень сильно облегчить их запуск. Опенсорс – очень круто, я в восторге, но возиться с ним приходится много. Без нейронок я бы это не осилил.
Для начала для работы настроил себе новый vpn – поставил формат vless, который вроде бы самый продвинутый сейчас, немного повозились – работает. Активно включаю в работу свое хранилище NAS – купил его в 2013 году, но разобраться с ним как-то получается только сейчас, опять же, спасибо нейронкам.
Еще попробую Repo Prompt – как инструмент работы с промптами. Именно по его мотивам все и затеял, но пока все сделал по старинке – вместе с Клодом. Он сегодня хорошо потрудился, молодец.
Будет интересно, пишите - пришлю примеры, как это все выглядит
🤔1
Любопытный учебник из Станфорда по работе с информацией. Читать лень, конечно, но вот загнать его в NotebookLM и попросить пересказать отдельные куски, либо тупо идти по главам - это будет поинтереснее. Ну или в модельку передать при проектировании RAG и пр
Только я вчера написал про свою возню с промптами, как тут читаю абсолютно противоположное мнение, что возиться с этим не надо. Производители, конечно, двигаются к тому, чтобы ПО писалось с одного промпта, но мой практический опыт говорит о следующем. Без жесткого контроля и детальной информации модели дают команды, которые не работают на вашем компе, пишут бесконечный ненужный код, моментально забивают контекст, ничего не могут исправить и в процессе исправления ошибок ломают вообще все, к чему прикасаются - их в принципе не парит то, что кроме того, с чем они работают, есть и другое ПО, которое не надо трогать.
А так да, если нейронки про смысл жизни спрашивать, промпты им не нужны. В общем, если вы не задумываетесь о том, какую информацию вы грузите в нейронку и что именно она должна делать и (!) не делать, это прямой путь к большим разочарованиям. На текущем этапе развития технологии
А так да, если нейронки про смысл жизни спрашивать, промпты им не нужны. В общем, если вы не задумываетесь о том, какую информацию вы грузите в нейронку и что именно она должна делать и (!) не делать, это прямой путь к большим разочарованиям. На текущем этапе развития технологии
Telegram
Denis Sexy IT 🤖
Хочу сказать, что те кто не заморачиватся с промптами и базами промптов – правильно поступают: любой кто строит сейчас приложения на LLM, видит в аналитике, что пользователям в целом пофигу на промпт-парсултанг, поэтому, создатели аппов заранее закладывают…
В продолжение темы. собственно примерно этим я и занимаюсь, только даю прямые команды создать промпт и работаю с ним, да и у Антропика пока таких команд нет, а общаюсь я больше с Клодом
https://t.me/data_analysis_ml/4009
https://t.me/data_analysis_ml/4009
Telegram
Анализ данных (Data analysis)
🖥 Теперь писать сложные промты самому не обязательно — OpenAI выпустили генератор, который превращает даже простой запрос в подробную инструкцию для ИИ.
Принцип простой: описываете, что хотите получить, нажимаете Optimize — GPT-5 анализирует запрос и выдаёт…
Принцип простой: описываете, что хотите получить, нажимаете Optimize — GPT-5 анализирует запрос и выдаёт…
Сегодня у меня были приключения. Положил таки свой мак мини - где-то с LM-studio и gpt-oss он перегрузился и подвис. После перезагрузки перестал отвечать на какие-то бы ни было порты. Сколько кнопку не нажимай, из какого-то своего защитного режима не выходит. Чего только не пробовал - и программно, и пытался мак подключать, ноль эффекта.
В итоге смотался на Горбушку, купил монитор за 9 тыс. руб., клаву, мышку - подключил, ввел пароль - и он работает вообще как ни в чем не бывало. С одной стороны гуд, могло быть и хуже, но с другой - что же вы черти эппловские делаете? Можно было бы и через всякие кнопки сброса дать доступ к портам, чтобы наладить работу и перезагрузиться. Можно было дать возможность подключить макбук как монитор, но нет, это не наш кейс. Рассторили. А сама машинка мак мини - крутая, вопросов нет
В итоге смотался на Горбушку, купил монитор за 9 тыс. руб., клаву, мышку - подключил, ввел пароль - и он работает вообще как ни в чем не бывало. С одной стороны гуд, могло быть и хуже, но с другой - что же вы черти эппловские делаете? Можно было бы и через всякие кнопки сброса дать доступ к портам, чтобы наладить работу и перезагрузиться. Можно было дать возможность подключить макбук как монитор, но нет, это не наш кейс. Рассторили. А сама машинка мак мини - крутая, вопросов нет
👍1
NVIDIA выпустила аж две опенсорсные модельки по распознаванию речи, одна из них еще и переводит. 24 языка, включая русский, компактные, говорят, что SOTA и бьют Whisper
https://huggingface.co/nvidia/canary-1b-v2
https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
https://huggingface.co/nvidia/canary-1b-v2
https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
huggingface.co
nvidia/canary-1b-v2 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
Очень люботную тему сегодня изучаю с Клодом - как модельки запускаются на маках - отдельных, и собранных в кластеры. Из важного и неожиданного.
Первое ограничение память. Проблема не столько в размере, вернее не только в размере (модель банально должна поместиться и оставить место для контекста), но и в скорости передачи данных процессорам. А здесь у обычного М4 пропускная способность 120GB/s, у М4 PRO - 273GB/s, у M4MAX - 550 GB/s, M3Ultra - 1000 GB/s. И это часто главное, что определяет скорость.
История в том, что количество вычислений в расчете на количество параметров в нейронках не так велико, и процы нужны не так, как память. Поэтому в обычной ситуации процы не будут загружены полностью - будут лопатить на 40-60% и ждать информации от памяти.
Но здесь есть но. Если модель квантованная, например, у нее параметры не 16битные, а 8ми, то количество памяти требуется в 2 раза меньше. Если это 4х битная модель - то в 4. При этом качетство модели при 8битном квантовании падает на 1%, на 4х-битном - процентов на 5. И при работе с квантованной моделью процессоры становятся важны. Более того, у эппла есть не только cpu и gpu, но и нейронные ядра. Они обычно не очень активно используются, но при квантовании грузятся максимально. Поэтому в четырехбитном варианте уже в максимуме используются нейронные процессоры, а графические процы и скорость шины памяти - это вторые факторы.
Если взять несколько мак мини, то играют важную роль задержки в передаче данных между ними. Нужен обязательно thunderbolt 4, кабель не самый дешевый. Интересно то, что модель параллелится слоями - когда из 32 слоев на каждой из 4 машин по 8, и они токен проходит все эти 4 машины последовательно. Так лучше утилизируются процессоры, чем пытаться, допустим, модель с экспертами разбросать на разные машины по экспертам.
Это убивает скорость - для 64гб памяти один m4max будет быстрее 2 m4pro и 4 m4. Но опять есть но. Если работают несколько человек, то один комп будет все считать по очереди, а стойка из 4 будет обрабатывать сразу несколько запросов и общее количество обработанных токенов за единицу времени будет выше.
Но самое любопытное, что если брать большую, но квантованную модель, то и при единичном запросе скорость у нескольких компов будет выше, чем у одного мощного. Дело в том, что у 4 m4 в сумме 40 cpu, 40 gpu и 64 neural engines. У 2 m4pro - 24, 32, 32. У одного m4max - 16, 40 и 16. А нейронные ядра для квантованных моделей решают. И по цене 4 минимальные машины в сумме заметно дешевле.
Вот такая любопытная арифметика. Руки чешутся попробовать на практике
Первое ограничение память. Проблема не столько в размере, вернее не только в размере (модель банально должна поместиться и оставить место для контекста), но и в скорости передачи данных процессорам. А здесь у обычного М4 пропускная способность 120GB/s, у М4 PRO - 273GB/s, у M4MAX - 550 GB/s, M3Ultra - 1000 GB/s. И это часто главное, что определяет скорость.
История в том, что количество вычислений в расчете на количество параметров в нейронках не так велико, и процы нужны не так, как память. Поэтому в обычной ситуации процы не будут загружены полностью - будут лопатить на 40-60% и ждать информации от памяти.
Но здесь есть но. Если модель квантованная, например, у нее параметры не 16битные, а 8ми, то количество памяти требуется в 2 раза меньше. Если это 4х битная модель - то в 4. При этом качетство модели при 8битном квантовании падает на 1%, на 4х-битном - процентов на 5. И при работе с квантованной моделью процессоры становятся важны. Более того, у эппла есть не только cpu и gpu, но и нейронные ядра. Они обычно не очень активно используются, но при квантовании грузятся максимально. Поэтому в четырехбитном варианте уже в максимуме используются нейронные процессоры, а графические процы и скорость шины памяти - это вторые факторы.
Если взять несколько мак мини, то играют важную роль задержки в передаче данных между ними. Нужен обязательно thunderbolt 4, кабель не самый дешевый. Интересно то, что модель параллелится слоями - когда из 32 слоев на каждой из 4 машин по 8, и они токен проходит все эти 4 машины последовательно. Так лучше утилизируются процессоры, чем пытаться, допустим, модель с экспертами разбросать на разные машины по экспертам.
Это убивает скорость - для 64гб памяти один m4max будет быстрее 2 m4pro и 4 m4. Но опять есть но. Если работают несколько человек, то один комп будет все считать по очереди, а стойка из 4 будет обрабатывать сразу несколько запросов и общее количество обработанных токенов за единицу времени будет выше.
Но самое любопытное, что если брать большую, но квантованную модель, то и при единичном запросе скорость у нескольких компов будет выше, чем у одного мощного. Дело в том, что у 4 m4 в сумме 40 cpu, 40 gpu и 64 neural engines. У 2 m4pro - 24, 32, 32. У одного m4max - 16, 40 и 16. А нейронные ядра для квантованных моделей решают. И по цене 4 минимальные машины в сумме заметно дешевле.
Вот такая любопытная арифметика. Руки чешутся попробовать на практике
❤1
Google выкатил MCP сервер для работы с Google Analytics. Это маркетинговое приложение для анализа поведения потребителей, работы с рекламой и пр. - все для повышения продаж. Интересна не сама программа а то, что Google начал расхваливать MCP. До этого Gemini заявлял, что это сырая технология, которая ему не интересна. Но, все-таки, видимо, сломались и решили не идти против рынка. Поддержка МСР появилась у Gemini CLI, а вот в десктопной версии ее пока нет, а жаль
YouTube
Introducing the Google Analytics MCP Server
Ever wished you could just talk to your Google Analytics data? Now you can!
We're thrilled to announce the launch of our open-source Model Context Protocol (MCP) server for Google Analytics. This powerful tool acts as a bridge, allowing Large Language Models…
We're thrilled to announce the launch of our open-source Model Context Protocol (MCP) server for Google Analytics. This powerful tool acts as a bridge, allowing Large Language Models…
Microsoft внедряет в Excel формулы, где результат пишет Copilot, при этом он додумывает значения в ячейках по содержанию заголовков таблицы. Но на Office 365 пока не раскатали, так что кто этим пользуется - неизвестно. В свое время я прошел все танцы с бубном чтобы достать офис с работающим копайлотом (это было реально очень сложно, хуже Гугла), но страшно в нем разочаровался. Потенциал огромный, а достижений - около нуля.
В то же время появляются и опенсорсные AI-таблички, в которых инфу заполняют нейронки. Не панацея, но как вариант
В то же время появляются и опенсорсные AI-таблички, в которых инфу заполняют нейронки. Не панацея, но как вариант
GitHub
GitHub - huggingface/aisheets: Build, enrich, and transform datasets using AI models with no code
Build, enrich, and transform datasets using AI models with no code - huggingface/aisheets
Qwen агрессивно разгоняет по Х инфу по новой модельке работы с изображениями - по тексту можно делать изменения в фоточках, просто генерация и пр.
С квантованием на 4 бита она влезает и на базовый мак мини м4 с 16гб оперативки. Жалко, что в изображениях работает только с 2 языками - английским и китайским. Но отзывы на нее очень даже хорошие.
Ниже ссылки на ресурсы
Try it now: chat.qwen.ai/?inputFeature=…
Hugging Face: huggingface.co/Qwen/Qwen-Imag…
ModelScope: modelscope.cn/models/Qwen/Qw…
Blog: qwenlm.github.io/blog/qwen-imag…
Github: github.com/QwenLM/Qwen-Im…
API: alibabacloud.com/help/en/model-…
С квантованием на 4 бита она влезает и на базовый мак мини м4 с 16гб оперативки. Жалко, что в изображениях работает только с 2 языками - английским и китайским. Но отзывы на нее очень даже хорошие.
Ниже ссылки на ресурсы
Try it now: chat.qwen.ai/?inputFeature=…
Hugging Face: huggingface.co/Qwen/Qwen-Imag…
ModelScope: modelscope.cn/models/Qwen/Qw…
Blog: qwenlm.github.io/blog/qwen-imag…
Github: github.com/QwenLM/Qwen-Im…
API: alibabacloud.com/help/en/model-…
chat.qwen.ai
Qwen is an official platform from Qwen that empowers both everyday users and developers with unified access to Qwen’s series of open-source and proprietary models. It offers comprehensive functionality spanning chatbots, image and video understanding, image…
😢1
Гайд по установке gpt-oss 20b с использованием llama сервера от одного из признанных авторитетов отрасли
Для apple есть отдельная библиотека mlx - совместимые с ней модели на эппловских машинах дают прибавку в скорости до 30%. Учитывайте, когда будете выбирать локальную модель для установки
Для apple есть отдельная библиотека mlx - совместимые с ней модели на эппловских машинах дают прибавку в скорости до 30%. Учитывайте, когда будете выбирать локальную модель для установки
GitHub
guide : running gpt-oss with llama.cpp · ggml-org llama.cpp · Discussion #15396
NoteThis guide is a live document. Feedback and benchmark numbers are welcome - the guide will be updated accordingly. Overview This is a detailed guide for running the new gpt-oss models locally w...
❤1
Еще одна безделушка - командная строка для Клод-кода, которая показывает данные о модели, потраченных токенах, окне контекста и пр.
GitHub
GitHub - sirmalloc/ccstatusline: 🚀 Beautiful highly customizable statusline for Claude Code CLI with powerline support, themes…
🚀 Beautiful highly customizable statusline for Claude Code CLI with powerline support, themes, and more. - sirmalloc/ccstatusline
❤🔥1
Главная новость вчерашнего дня - это, конечно, выпуск DeepSeek V3.1. Уже третье место на Hugging Face.. Моделька с 685 миллиардами параметров - так что, это не про нас, как ее не квантуй. Для тех, кто хочет ее попробовать, кроме официального апи, на hugging face есть куча компаний, которые крутят опенсорсные модели на своих серверах, и можно закупать вычисления у них. Это касается практически любой опенсорсной модели.
Сама модель, как говорят, не то чтобы стала прямо сильно умнее, но при работе тратит сильно меньше токенов, что прямо очень хорошо. При этом рассуждений у нее также стало больше, хоть это и не ризонер. Ждем с нетерпением DeepSeek R2. Ну и, кстати, наверняка скоро выйдут маленькие дистилированные модели DeepSeek, сделанные на базе Qwen или что-то вроде того (это мне напоминает, как в детстве я на грушу прививал яблоню, в нейронках примерно также работает..)
Сама модель, как говорят, не то чтобы стала прямо сильно умнее, но при работе тратит сильно меньше токенов, что прямо очень хорошо. При этом рассуждений у нее также стало больше, хоть это и не ризонер. Ждем с нетерпением DeepSeek R2. Ну и, кстати, наверняка скоро выйдут маленькие дистилированные модели DeepSeek, сделанные на базе Qwen или что-то вроде того (это мне напоминает, как в детстве я на грушу прививал яблоню, в нейронках примерно также работает..)
huggingface.co
deepseek-ai/DeepSeek-V3.1-Base · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
С утречка поэксперементировал с установкой контейнера с n8n, используя Claude code. В лучших традициях вайбкодинга везде жал ок - не сразу, но все заработало. Отдельно буду также настраивать прокси и домен.
Из выводов - понял, что десктопный Клод пишет для агента неправильные Claude.md, и мне в целом для агента надо задать глобальные подходы к той же установке. Но в целом эксперимент можно признать удачным, продолжу
Из выводов - понял, что десктопный Клод пишет для агента неправильные Claude.md, и мне в целом для агента надо задать глобальные подходы к той же установке. Но в целом эксперимент можно признать удачным, продолжу
Forwarded from Анализ данных (Data analysis)
🚀 500+ AI Agents Projects — крупнейшая подборка реальных проектов с ИИ-агентами
Ashish Patel собрал коллекцию из 500+ проектов, где используются AI-агенты в самых разных сферах — от медицины до финансов и customer support.
🧠 Что внутри:
— Кейсы с открытым кодом: торговые боты, ассистенты, рекомендательные системы
— Поддержка популярных фреймворков: CrewAI, AutoGen, LangGraph и др.
— Агентные решения для анализа рынка, генерации резюме, видеопомощников, юристов и даже врачей
— Образовательные агенты, рекрутинговые, customer service и legal-tech проекты
— Указаны ссылки на репозитории, описание задач и идеи для расширения
📌 Почему это полезно:
✔️ Отличный старт для своего проекта
✔️ Удобно искать по индустрии и технологии
✔️ Много вдохновения для хакатонов, ресёрча и автоматизации
✔️ Поддержка сообщества: можно добавить свои кейсы
📌 Github
@data_analysis_ml
Ashish Patel собрал коллекцию из 500+ проектов, где используются AI-агенты в самых разных сферах — от медицины до финансов и customer support.
🧠 Что внутри:
— Кейсы с открытым кодом: торговые боты, ассистенты, рекомендательные системы
— Поддержка популярных фреймворков: CrewAI, AutoGen, LangGraph и др.
— Агентные решения для анализа рынка, генерации резюме, видеопомощников, юристов и даже врачей
— Образовательные агенты, рекрутинговые, customer service и legal-tech проекты
— Указаны ссылки на репозитории, описание задач и идеи для расширения
📌 Почему это полезно:
✔️ Отличный старт для своего проекта
✔️ Удобно искать по индустрии и технологии
✔️ Много вдохновения для хакатонов, ресёрча и автоматизации
✔️ Поддержка сообщества: можно добавить свои кейсы
📌 Github
@data_analysis_ml
❤🔥1
Forwarded from Machinelearning
Ландшафт архитектур LLM превратился в настоящий зоопарк. Почти каждую неделю появляются новые методы, обещающие меньший расход памяти и более быстрый инференс. Разобраться в этом становится все сложнее.
Большая группа исследователей выпустила подробный обзор Speed Always Wins, чтобы систематизировать все ключевые инновации в области эффективных архитектур для LLM.
Это не просто очередная статья, а попытка упорядочить и структурировать актуальные подходы, которые решают главную проблему классического трансформера - его квадратичную вычислительную сложность.
Обзор описывает 7 основных направлений.
Здесь авторы разбирают все подходы, которые так или иначе сводят сложность самовнимания к линейной. В эту категорию попадают 3 большие ветви: линейное внимание; линейные RNN, вроде и, конечно, модели на основе пространства состояний (SSM).
Разреженное моделирование последовательностей основано на простом принципе: не каждый токен должен общаться с каждым. Здесь выделяются статические подходы (как в Longformer), где паттерны внимания заданы заранее, и динамические, где они определяются на лету в зависимости от контента.
Методика, которая уже стала мейнстримом. В МоЕ разреженность применяется не в механизме внимания, а в FFN-слоях, где для каждого токена активируется лишь небольшая часть экспертов, что позволяет наращивать число параметров без пропорционального роста вычислений.
В нем речь идет не об изменении асимптотической сложности, а об ее аппаратной оптимизации. Флагман - FlashAttention.
Есть детальный разбор, как за счет оптимизации обращений к памяти GPU удается кардинально ускорить вычисления, не прибегая к аппроксимациям. Сюда же относятся и групповые механизмы внимания: GQA и MQA.
Это, пожалуй, самый горячий тренд. Его идея в том, чтобы стратегически комбинировать быстрые слои с линейной сложностью и медленные, но мощные слои с полным вниманием.
В обзоре выделяют два типа гибридизации: межслойную, как в Jamba, где разные типы слоев чередуются, и внутрислойную, где в одном слое разные головы могут использовать разные механизмы внимания.
Это неавторегрессионные модели, которые генерируют текст, постепенно восстанавливая его из шума. Их главная фишка в параллельном декодировании, что дает ощутимое ускорение инференса.
В конце обзора есть анализ применения всех этих архитектур в разных модальностях - CV и аудио.
Так что, если хотите быстро разобраться в базовых методах, которые будут двигать дизайн LLM в ближайшее время,
@ai_machinelearning_big_data
#AI #ML #LLM #Architectures
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM