PaniniNotes
29 subscribers
24 photos
1 file
10 links
💡Пишу про победы и поражения

💻 6+ years of Backend Developer
🚀 7+ years of ИндиПредприниматель
🛸 11+ стран посетил
Download Telegram
Channel created
Channel photo updated
Этот канал создан для того, что бы научится думать и корректно излагать свои мысли.
Здесь я буду писать статьи о том что прочитал в интернете, к примеру пересказ статей с хабра, которые были мною прочитаны, чтобы лучше понять и запомнить их, о своих наблюдениях к примеру из путешествий, из поведения люде, а так же хочу больше читать и буду публиковать статьи о прочитанном мною.

Еще было бы хорошо начать писать какие-нибудь стендап выступления, для того что бы отработать нывык публичных выступлений.
https://habr.com/ru/companies/ruvds/articles/724066/
Прочитал статью на хабре про индексы. В ней описывались пять типов индексов, с описанием его работы и минусами использования, такие как B-tree, BitMap, Hash, Gist, Полнотекстовый поиск. Но на самом деле, понятно как работает было только два индекса, это B-tree и Hash, ну потому что я читал как они работают в других статьях раньше. Я чуть чуть додумал как работает BitMap, но мне все равно осталось не понятно как работает тот же bitmap, gist, полнотекстовый поиск. Я понял концепты, но детали реализации, что бы понимать что и как в действительности будет происходить, как это будет работаь, я не понял. Почитав коментарии, а читать коменты я чаще люблю больше чем сами статьи, потому что люди если знающие будут писать что есть неправильные моменты в статье, а не знающие обычно бред и гадость в научно-технических статьях-гайдах не пишут, по этому мне интересно прчитать что более умные люди пишут и как они оценивают данный материал, и оказалось что их точка зрения совпадает с моей. Они так же критично высказались по поводу раскрытия темы индексов.
Также в этой статье описывались минусы работы тех или иных индексов. Но данная информация не была полезной, так как она сводилась что индекс может занимать много места, он будет менее эффективный чем другой индекс если его неправильно применить, он увеличивает время для вставки и обновления записей. И эти три пункта были во всех абзацах всех индексов указанных в статьи.
Ну и тем самым, я бы испоьзовал данную статью только для наводки какие индексы нужно изучать подробней на других ресурсах.
А теперь перейдем к выжимки из статьи.
Индексы:

Процесс создания индекса:
1. Отобрать признаки по которым построен индекс
2. Выбрать алгоритм оптимальный для данных признаков
3. Применить алгоритм индексирования для выбранных признаков
4. Сохранить индекс в памяти, на диске
5. Обновить индекс в случае изменения данных

1) B-tree - сбалансирование дерево. Это индекс, в виде дерева, который хранит в своих узлах-листьях указатели на другие узлы, а так же данные, которые связаны со строками в таблице. По каждому узлу-листу можно понять, в какую сторону нужно двигаться что бы искать нужные строки.

Минусы индекса:
- Может занимать много места
- Может замедлять обновление данных
- Сложный алгоритм, в котором нужно перестраивать, перебалансировать дерево при обновлении индекса

2) BitMap - индекс при котором строятся битовые карты, блинной равной размеру хранящихся строк.
Сегодня просмотрел ролик про архитектура uber, из каких компонентов она собрана, а также какие процессы в этой системе происходят. Это достаточно вводное видео, но оно дает представление что дальше изучать.
Система состоит из 6 частой:
1 Прокси сервер, который поддерживает WebSocket соединения между системой и клиентами, такими как водители и пассажиры.
2 Кафка, в которую попадают стриминг GPS сообщений от водителей и пассажиров.
3 Из этой кафки, в которую попадают GPS сообщения, сообщения читаются для записи в nosql базу, такую как mongo, а так же они попадают в систему, которая находит ближайших водителей для создания поездки.
4 Система для создания поездок получает GPS координаты пасажира и водителя, находит сектор на карте, которому пренадлежит пасажир, а дальше ищет водителей, которые находятся в соседних секторах.
5 После нахождения водителей, расчитывается расстояние от пассажира до водителя, а дальше водителям по очереди предлогается заказ. Для расчета расстояния межда пасажиром и водителеи, а так же для вычисления идентификаторы сектора на карте из gps координат используются сервисы гугл
6 для аналитики поездок, сохранения бозопастности использования сервиса, таких как мошенеческие действия, гиук использует headoop для аналитики.
7 Для трекинга логов используется так же кафка и системы такие как ELK
https://youtu.be/umWABit-wbk
Сегодня прочитал статью про Desired Outcomes.
https://habr.com/ru/companies/domclick/articles/749148/

Парень Джеймс из домклика расcказывал как они систематизирует Jobe Stries.
В статье идет разделение JTBD(jobe to be done) на три сущности:
- Core functional story - Это основной функционал сервиса, MVP, то, что определяет вектор развития продукта.
- Job story - это сценарии вокруг основного функционала, без него можно запустить MVP, но для развития сервиса и удержания его эти сценарии необходимы.
- Desired Outcomes - это подзадачи, на которые делятся базовый функционал и дополнительный функционал. Фитчи разрабатываются именно для этих вещей.

Пример: Рассмотрим соцсеть ВК. Core functional story - это отправка сообщений, просмотр профиля и добавление в друзья. Jobe story - это отправка голосовых сообщений, расшифровка голоса в текст, отправка файлов, создание групп, пабликов.

Как создавать и определять эти CFS, JS, DO? Ребята из домклика проводят кастдевы, уточняют какие этапы и через какие сложности проходит клиент.

Для того что бы создать Job story, необходим определить три вещи:
- Ситуация(Когда я .... пришел на работу/хочу купить книгу/иду в театр)
- Мотивация(какие цели перед человеком стоят. Хочу избежать... Хочу преобрести...)
- Ожидаемый результат(чего юзер в итоге добъется. Что юзет от этого получит)

Desired OutCome описывается двумя вещами:
- Ситуация( когда я ... ищу магазин с духами)
- Показатель эффективности(я хочу быстро его найти, я хочу выбрать где подешевле/ по красивее)

Зачем строить такие карты. Такие карты помогают визуализировать сложности и задачи которые стоят перед пользователями. Помогут обосновать ваши решения перед начальством/инвесторами. Визуализация поможет понять и отобразить объем предстоящей работы. Карта формулирует понимание зачем нужнеа та или иная задача. А так же это помогает строить воронки и оптимизировать их.
Вчера прочитал отрывков из книги жаль верна С земли на луну прямым путем за 97 часов. Я переодически читаю данную книгу, когда то прочитал её половину. Сейчас решил перечитать и закончить. Читаю я для того что бы поддерживать мозг и голову в тонусе. И этот блог я так же виду что бы держать голову, в порядке.
Не знаю на сколько меня хватит вести этот блог, но надеюсь что подольше чем в предыдущий раз.
👏1
Прочитал статью, в которой описывается что проводились исследования способности приобретать непредпологаемые навыки у мат моделей с ростом числа параметров. К примеру что чат гпт научился шутить или отгадывать загадки. Эти исследования проводились так как хотелось узнать возможность появления сознания у моделей при росте числа обучаемых параметров.

Учёные обучали две модели. Первая из них была языковая. Они подавали на вход загадку в виде текста, а на выход получали текст с ответом на загадку. Метрикой была функция, которая выводила 1 если текст в точности совпадал, и 0 если не совпадал. Вторая моделать была CIFAR 1000.
Из исследования было получено, что чем дискретней метрика, тем лучше модель начинает приобретать непредпологаемые навыки и это связанно с тем, что при увеличении числа обучаемых параметров, вероятности для правильных ответов сдвигаются в пространстве и изменяются для улучшения метрики которая описывается дискретной функциией.
Forwarded from DLStories
Увидела в одном из чатов обсуждение AGI (да, опять) и того, погубит ли оно в конце концов человечество. Одна из причин страха такого развития событий — наблюдения, что большие модели типа GPT-4 часто начинают "внезапно" демонстрировать способности, которых у моделей поменьше, кажется, нет и в помине. Ну, например, если обучить языковую модель с количеством параметров 10B, то она, внезапно, начинает уметь в zero-shot question answering или отгадывание загадок. А у моделей с меньшим количеством параметров, сколько их ни обучай, таких способностей не возникает.
(на всякий случай: количество 10B и примеры задач взяты тут с потолка. Надеюсь, общая идея понятна)

Этот эффект называется "emerging abilities of Large Language Models". Из-за него кажется, что большое количество параметров каким-то магическим образом позволяет модели развить умение решать сложные задачи, развить абстрактные высокоуровневые способности типа reasoning, abstract thinking, понимание связей, юмора и т.п. И если эту мысль экстраполировать, то появляется идея, что при еще большем увеличении количества параметров модели у нее также внезапно может появиться и условное "сознание". На этом и основываются многие страхи AGI-апокалипсиса.

Так вот. Это все напомнило мне одну статью, про которую я уже давно хотела написать в канал, но как-то руки не доходили. Называется она "Are Emergent Abilities of Large Language Models a Mirage?". В ней авторы говорят, что эффект emerging abilities — это мираж. И на самом деле его нет (или почти нет). А способности к reasoning, abstract thinking и т.п. у модели появляются не внезапно, а очень даже предсказуемо. Вся проблема в том, что мы неправильно считаем метрики.

Давайте пример. Возьмем задачу "отгадай загадку". Модели подается на вход загадка на естественном языке. В ответ модели нужно выдать ответ тоже на естественнос языке.
В качестве метрики качества ответов LLM на такой задаче обычно берется exact string match. Т.е. metric=1, если модель ввыдала текст, полностью совпадающий с правильным ответом, и metric=0 в любом остальном случае. И вот если смотреть на то, как меняется эта метрика для моделей с разным количеством обучаемых параметров, тут как раз и наблюдается тот самый внезапный эффект. Маленькие модели получают acc = eps, а модели тяжелее условных 10B параметров внезапно показывают acc>0.5.

В чем тут проблема? А в том, что метрика супердискретна. Она не учитывает то, как при увеличении параметров модели меняется распределение вероятностей модели на ответы. И на самом деле дела обстоят так: при увеличении размера модели она научается давать все больше вероятности адекватным вариантам ответа на загадку, и все меньше — бредовым. Короче, на самом деле учится все лучше и лучше решать задачу. И при каком-то значении размера модели она становится способна давать настолько много вероятности правильным ответам, что нашу дискретную метрику exact string match "прорывает" от почти 0 сразу до большого значения.

Короче, мысль такова: на самом деле способности по большинству задач растут вполне предсказуемо с ростом размера моделей. Заменив дискретные метрики на более непрерывные, авторы этой статьи показали, что по крайне мере на 92% задач из Big Bench никакого "внезапного" прорыва у больших моделей не происходит. Качество на них растет плавно и предсказуемо при увеличении размера моделей.

А еще авторы показали, что такой же эффект "emerging ability" можно смоделировать и на обычных автоэнкодерах на датасете CIFAR100. Нужно только поменять метрику качества на чуть более дискретную, чем обычно используется (об этом в разделе 5 статьи)

Вот так. Конечно, этот результат не означает, что у моделей точно никаких "emerging abilities" быть не может, и сознание она никак не получит. Нет. Но это, как минимум, повод задумываться над всеми "странными" результатами, которые получают исследователи, и лучше их изучать. А не просто экстраполировать и сразу делать страшные выводы.

📄Статья
Есть важная вещь понимание которой я закрепил - это режим дня. Когда я был в школе или в вузе, я особо не придавал внимание этому аспекту жизни. В более юном возрасте усталость от недосыпа чувствовалась менее явно. К тому же когда ты часто пьешь энергетики и находишься в таком состоянии, оно становится для тебя более обыденным, что является очень опасным заблуждением.
Ты как минимум выглядишь плохо, у тебя может плохо работать смекалка и мозг, хотя ты можешь ощущять это на оборот.
Твоя мотивация не стабильна, то она на высоте, то ты в полной дипрессии и прокрастинации.
В худшем случае недосып может привести к проблемам со здоровьем с неожиданной стороны.
👍1🔥1
Вести трекинг своего времени это полезно и практично, ко как только ты ставишь какие либо ограничения на свой хронометраж или хронометраж твоих сотрудников, это сразу делает из табеля не инструмент продуктивности, а инструмент сжигания времени. Происходит ситуация как с бюджетом, время надо освоить и распределить. Уйти пораньше нельзя, даже если сделал свою работу распределенную на месяц.
В офисе я пробыл чуть больше 8 часов, активности в пк у меня 7 часов, но из за того, что я бы в столовой, а она находится вне турникетов, то время в столовой не тречится как время пробывания в офисе. И вот сейчас я сижу и докуручиваю себе 15 минут онлайна, что бы в табеле циферки не были красными(
Вчера читал статью про демографию и как она влияет на будущее. Это достаточно больная статья, в не затрагиваются темы сокращения научных работ, и публикаций, сокращение образования людей, кризис в медицине и в военном секторе. И это все в совокупности с экономическим кризисом, вызванным демографическим упадком населения и их покупательной способности.

Логика на самом деле достаточно простая. Статья начинается с того, почему к нам в страну заводят мигрантов? Делается это под предлогом что некому работать на грязных низких работах, не могу выполнять строительные работы. Но на самом деле гражданства для ребят из ближнего зарубежья выдается поголовно что бы наращивать объемы потребителей, для хотя бы поддержки экономики, не то что бы для её развития.

Если людей становится мало, уменьшается и приток бюджета в казну, как следствие правительству нужно уменьшать затраты или оптимизировать их. Одна из статей которую могу оптимизировать это образование в дальних регионах, тем самым меньше детей будут грамотными и меньше из них пойдут в науку и уменьшится кол-во научных публикаций. На сколько это будет иметь эффект - не понятно, было бы интересно посчитать это в цифрах.

Оптимизировать могут так же и медицину. Молодых людей будет рождаться все меньше, а старых все больше. Они потребляют в разы больше медицинского сервиса, который нужно оплачивать. И либо это будут делать совместно со страховыми, либо будут уменьшать мед сервис.
Страховые при увеличении затрат на обслуживание пожилых людей повысят цены что бы оставаться рентабельними, но большинство этого себе позволить себе смогут. Уменьшение финансирования медицины скажется на качестве услуг и на развитии медицинской науки в том числе.

Старые люди более консервативны, они не будут покупать товары и услуги которые двигают мир и технологии вперед. Как следствие рентабельность инноваций снизится. Чем взрослее человек, тем менее он способен к агрессии, как следствие государству меньше нужно тратится на силовые ведомости и это тоже не очень хорошо.

https://habr.com/ru/articles/756524/
Я давно не писал что либо в этот блог.
В конце сентября начал больше читать, сходил к психотерапевту, взял отпуск на первую неделю октября.
Начал проходить курс по трейдингу. На курсе дали паттерны и я уже их начал применять.
С одной стороны, внутридневная торговля может быстрее раскачать депозит и дать больше опыта, с другой стороны у меня нет столько времени что бы каждый день сидеть за графиком и искать активы.
Ещё нужно продолжить учить английский, и проходить курсы по менеджменту. На почему то не очень хочется это делать.
Я сегодня проснулся, принял контрастный душ, выпил воду с лимоном, а в столовой поел кашу. Чувствую себя отлично
👍3😁2
Привычки это очень важная часть жизни. Она отображает как ты себя ведёшь и будешь вести бальше.
Есть привычки положительные, есть отрицательные. От последних я стараюсь отучиться, но получается струдом.
На выработку плохой привычки ушло более 5 лет. Интересно, смогу ли я избавится от нее за год?