Valuable AI / Валентин Малых
2.31K subscribers
683 photos
85 videos
2 files
612 links
личный канал про ИИ
Download Telegram
Forwarded from Complete AI (Andrey Kuznetsov)
🕯️Друзья, вчера случилась большая трагедия!

Нападение террористов на Крокус привело к большому числу жертв и пострадавших.

Сбер не остался в стороне и вместе с Российским красным крестом запустил благотворительный фонд. Прошу не оставаться в стороне, помощь каждого из вас безмерно важна🙏

➡️По ссылке сразу перейдёте в Сбербанк Онлайн и сможете внести пожертвование.

Берегите себя🙏
4
сам попадал в подобную ситуацию, что нашу принятую статью на конференции SCAI отклонили после того, как выяснилось, что мы из России; я думаю, что про такие случаи не надо молчать, чем больше внимания будет привлечено к проблеме, тем быстрее она будет решена https://t.me/ArtemROganov/1504
👍19🤣1
не думал я, что в 2024 году можно опубликовать в приличном месте статью про NER на LSTM (!) и CRF (!!); однако реальность, как всегда, богаче наших фантазий:

https://www.nature.com/articles/s41598-024-58334-x
😱7👍1🤯1
лично мне близка вот эта цитата из статьи:
Соучредитель, председатель правления и гендиректор интернет-компании Baidu Ли Яньхун: "В будущем естественные языки станут новыми языками программирования. Для разработки достаточно будет уметь говорить, чтобы своей креативностью менять мир"

я такой подход разделяю, только формулирую чуть по-другому: я думаю, что люди через несколько лет будут больше программировать и меньше кодить

но в целом статья скорее про то, что в Китае есть целая отдельная экосистема ИИ, очень интересно наблюдать, как она будет конкурировать с экосистемой, созданной в США
https://russian.cgtn.com/news/2024-04-18/1780816616634871810/index.html
👍3
Один мой знакомый data scientist, Федор Шабашев, написал следующий текст на своей странице в LinkedIn:
If you keep prices artificially low in order to force your competitors out of the business it is considered a crime - "predatory pricing".
However in the software world if you release your product "for free" in order to drive competitors out of business, it isn't called a crime, it is called open-source.
We can see that some Big Tech companies are actively executing the scorched earth strategy by releasing open source LLMs to the public for free in order to undermine potential competitors.
Big companies are driven by economic incentives, not open source idealism.


Я не согласен с такой постановкой вопроса. На мой взгляд большие компании путем выпуска открытых языковых моделей борются между собой, т.к. они фактически дают бесплатное демо своих технологий. Как я понимаю Федора, он имеет в виду, что такая стратегия не дает развиваться более мелким компаниям, которые бы иначе делали свои языковые модели. Но на мой взгляд - наоборот, это дает возможность подняться большому числу мелких компаний, которые каждая может использовать открытую LLM для своей узкой задачи. Из этих компаний со временем выделятся более крупные, которые, быть может, составят конкуренцию гигантам.

Можно провести аналогию с открытыми реляционными базами данных (SQL) и привести в пример компанию Postgres Professional, которая является крупным игроком на российском рынке баз данных, построив свой бизнес на доработке и сервисах вокруг БД PostgreSQL.
💯4🤔31
людишки еще не поняли, к чему все идет

утащил у Дмитрия Колодезева
7😁7👍3😈2🥰1🐳1
интересную опасность подсветили коллеги: на основе LLM можно сделать автономного бота, который будет заниматься взломом сайтов, пока вы спите или заняты другими делами; уровень успеха в 53% говорит о том, что большинство владельцев сайтов до сих пор не озабочены кибер-безопасностью; я ожидаю, что массовый взлом сайтов приведет к распространению помощников по кибер-безопасности, вероятно, также на LLM, эта технология стала сейчас базовой для многих задач по ИИ https://newatlas.com/technology/gpt4-autonomously-hack-zero-day-security-flaws/
получился бы интересный альянс; Apple явно опаздывает в современной гонке крупных технологических компаний; может быть, это связано с политикой закрытости, свойственной всем компаниям, занимающимся производством «железа»; кажется, что ИИ сейчас принципиально требует открытости https://ria.ru/20240623/meta-1954866067.html
👍1
как вам шрифт, который также - LLM? (да, да, «Ленин - гриб и, следовательно, радиоволна») люблю такое, фактически - это стеганография на максималках

https://fuglede.github.io/llama.ttf/
🤯3🔥1
для меня выглядит, как легкий «звездеж»; в том плане, что в 20 раз быстрее топового тензорного ускорителя от nVIDIA - это как-то очень круто; тем более, что заявляется, что это ASIC, то бишь программируемая логика;

отдельно хочу отметить, что название ускорителя Sohu - подозрительно похоже на китайское, что неудивительно, учитывая, что в сооснователях - этнические китайцы, но все равно наводит на мысли, что разработки там китайские

https://www.ixbt.com/news/2024/06/26/20-nvidia-h100-sohu.html
я пропустил эту работу в феврале, а сейчас прочел и нашел много интересного; из самого на мой взгляд важного: (i) коллеги нашли, что более глубокие модели дают лучшее качество, чем широкие с тем же количеством параметров (для полносвязных сетей это давно было известно, теперь подтвердилось и для трансформеров); (ii) Grouped-Query Attention снова оказался более эффективным для небольших размеров, чем классический механизм внимания; (iii) можно повторно прогонять блоки транформера, чтобы улучшить качество модели (было известно для рекуррентных сетей, но теперь актуально и для трансформеров); в целом крайне интересная работа, рекомендую; что немаловажно, доступен код, не все нынче таким грешат

https://arxiv.org/abs/2402.14905
https://github.com/facebookresearch/MobileLLM
5
просторы Интернета принесли довольно интересный патент от Tesla; он меня заинтересовал как в отдаленном прошлом сетевого специалиста, а в настоящем - специалиста по ИИ; в этом патенте инженеры Tesla предлагают в общем-то не что-то гипер-инновационное, а фактически предлагают на аппаратном уровне реализовать аналог TCP/UDP; стоит отметить, что TCP и UDP на аппаратном на аппаратном уровне уже были реализованы уже как минимум 4 года назад (это открытая реализация, есть еще проприетарная от Cast Inc.); возможно, этот протокол лучше оптимизирован и в целом позволит уменьшить задержки, интересно было бы посмотреть сравнение, так как все три разработки предлагаются для реализации на FPGA (ПЛИС); кстати, именно минимальные задержки указаны в мотивационной части патента, как преимущество для тренировки ИИ; собственно, на этом связь с ИИ исчерпывается
🔥4
коллеги подсказали вот такую статью; это повод поговорить о фундаментальных основаниях оценки моделей машинного обучения: мы, повторяя за гуманистами 18-го столетия (а они в свою очередь вслед древнегреческому Протагору), считаем, что "человек есть мера всех вещей"; или применительно к нашей области "человеческое суждение является самым объективным способом оценки результатов работы моделей"

последний примерно год стала широко распространена практика, когда в качестве оценщика используется GPT4; были статьи, которые показывают очень высокую корреляцию оценок GPT4 и оценок людей, однако же, эти корреляции были получены на тех данных, на которых GPT4 обучалась, а используется она как правило на новых данных, которых не видела при обучении; и тут всплывает проблема, описанная в статье ставшей причиной данного поста - GPT4 предпочитает ответам людей свои ответы (и ответы моделей, обученных на ее ответах); я думаю, что тут есть некоторая симметрия: люди предпочитают ответы людей, потому что учатся именно на ответах людей, посмотрим, что будет, когда вырастет поколение, для которого LLM "были всегда"

сама статья, если кому интересно: https://arxiv.org/abs/2407.12856
👍2🔥2
небольшой анонс мероприятия с моим участием, приходите, кому интересно послушать про RAG

детали мероприятия можно посмотреть здесь (нужна регистрация): https://t.me/compressaai/6
👍13🔥4