大數據分析讀書會🇹🇼
73 subscribers
101 photos
2 videos
1 file
141 links
大數據分析分為數字大數據分析和意向大數據分析,是因應數據特性不同而區分出來的分析法

這頻道即分享大數據分析法的最新觀念、知識及實務應用

要學就學最新的知識和技術

聊天交流群:https://t.me/modellingdata
Download Telegram
AI技術和大數據分析的發展愈來愈明確

你得先有兩個重要觀念

1. 從數據的分類就能確定AI技術在搞什麼

目前主流AI技術發展走的是分類法和排序法!數字代表的不是我們習以為常的數字特性!千萬別搞混!

數據大分為兩類:累加性數字和非累加性數字,包含圖像、語言等。確認數據是哪類,立馬理解現在主流AI在搞什麼

別被那些程式語言給騙了!大觀念和哪種程式語言一點關係都沒有!國家政策方向搞不清就是連這樣的觀念都沒有,才會人人都要必修程式設計!

你把濾鏡拿掉,深入本質去看就可以發現,主流AI和大數據就是基於「分類法」和「排序法」!

想想分類和排序是你幾歲學的?

2. 這些技術或分析方法都有其適用性和限制

從第一個觀念,就能知道不同數據類型會發展對應到分析方法!

你要拿分類法的分析方法去做「累加性數字」的分析⁉️🤭
你損失了數字本身的精確性,搞了一套彎路而已
👉用股價指數的趨勢動態說明四種圖像視覺化差異👈

你很難想像現有的股價趨勢表現方式所在層次竟然沒有任何趨勢可言。但主流聲浪皆說可以看得出來!!

整體動態的變化請看
https://youtube.com/shorts/NV1TY1If808
大數據分析讀書會🇹🇼
👉用股價指數的趨勢動態說明四種圖像視覺化差異👈 你很難想像現有的股價趨勢表現方式所在層次竟然沒有任何趨勢可言。但主流聲浪皆說可以看得出來!! 整體動態的變化請看 https://youtube.com/shorts/NV1TY1If808
技術說明

1. 多線段技術基於統計學迴歸分析法,而非高中數學的兩點連成一直線。

2. 運用迴歸建構的趨勢線存在誤差,才能對未來做預測。

3. 迴歸分析方法因期望值模型分為三類: 線性、非線性、Curvilinear。

主流只有線性迴歸,後二者受限overlapping問題的靈魂質問,導致發展受限。而實際大數據分析和人工智能法的方向就是後二者,從來不是線性迴歸,或變形到讓人難以認得的各種線性迴歸延伸模型。

4. 線性迴歸分析法請參考各大統計學教科書或計量經濟學教科書

5. 非線性和Curvilinear迴歸分析法請參考「統計學不能做為大數據分析的工具-原因與補正」一書。

6. 解決迴歸分析誤差所用的技術,請參考書籍 -

「Excel calculating the probability distribution simulated data」
「Demythologize Durbin-Watson Test Statistic」
「統計學不能做為大數據分析的工具-原因與補正」
當我們從機率分配模擬,到填補趨勢預測的建模技術空白後,「統計學不能做為大數據分析的工具-原因與補正」提到迴歸模型分成三個部份:
☑️期望值模型(3種大模型)
☑️變異數異質性模型(3種大模型)
☑️自我相關誤差模型

其目的都在降低誤差(MSE最小化),提高精確率。

不過2019年我們沒有放寬人為干預數據分析的設定,仍是人為主觀的以整體數字去估計趨勢和建模!複雜的數字規律肯定對應了複雜的數學模型!

即使做得再好,也無法讓大眾直觀瞭解趨勢變化情況,也無法看出時間帶來的趨勢訊號。如此複雜的數學模型,縱然能解決大數據和人工智能的建模、分析、預測問題,也僅是曲高和寡。

「多線段趨勢分析法」,我們又稱為「主動式趨勢分析法」以此和過去將設定好時間期間的數字,做整體性估計趨勢的方法,做一區別。此技術再次填補數字的趨勢預測技術,以及讓大眾獲得趨勢時間點訊號的空白!
有關此技術的說明和應用,全在Youtube頻道 source

萬宗不離其法,法歸一,那就是數學分析法和迴歸分析法的基本觀念!即使發展到大數據和人工智能階段,仍符合牛頓所言:「站在巨人的肩上」一說。維持既有理論的基礎依據,從新的角度切入到大數據和人工智能分析理論方法,以數字為標的,做到高等數字分析的真正程度!
分享美國通貨膨脹率每月數值下的趨勢變化
https://sites.google.com/view/usinflation
大數據分析因為數據種類而需要不同的分析方法。有意思的是主流演算法將數字型數據變成分類法,也就是類別項,同樣以數字表示,並且還有數字大小規律存在。

依據這樣的做法將發展迄今的演算方式套用上去,但數字特性在轉換過程中消失了一部分,留下如組中點做代表,或者中位數,平均數為代表。

細膩的數字規律變化在這些個方法下很難成形。看似已經解決問題,事實卻是繞個彎,石頭還是卡住路。有沒有再走回原路方向?現在看來是有距離的。

數學也該有它的人工智能,而且更加強大!一起拭目以待☺️
公共衛生領域的專家學者看不上迴歸分析發展出來的方法。因為他們嫌棄這不夠複雜,反而認為透過機器學習那樣的只用精確率代表,並用複雜且色彩多樣的圖形才是期刊需要的。

如果一個點能夠代表一條線,那麼迴歸分析就不會被用在機器學習上的基礎模型,同樣機器學習能告知時間趨勢該發生的斷點在哪嗎?以及趨勢發生轉折的時間點在哪呢?

這些都是現有模型和演算法無法做到的。而當他們沒有版權時,就沒有辦法寫在套裝軟體內,或做內供。

現在
為什麼不能顯現「即時」、「有用」的觀察指標來因應新冠病毒感染和政策評估用?

為什麼不能使用能顯示趨勢特徵,又能方向性十足的迴歸線來告訴你民調情況?

反而推崇「點」對「點」的比較,用兩點連成一直線的線段稱為趨勢呢?

太多的口口在其中,就等待眾人皆會時,主流意識才會反轉吧!就像有些學科的論文總是用數學模型推導,不認可數字例。到了現在沒有加個模擬,沒有加個數字例,那模型就如同虛幻世界的問題答案,中看不中用。

數字驅動的分析方法是未來主流,也是現在方興未艾的重點。目前掌握在高端學者專家手上,他們認為要學會那些課程並融會貫通才能站到他們的圈內。但我不這麼認為!這不該是少數人把持,而是早已可以完成的科學研究,幫助人類技術進步,產生新資源,降低可能戰爭的風險。
chatGPT 完成了非數字體系數據的人工智能整合工作,那科學專業所需的數字人工智能呢?

原本數字人工智能應該比非數字人工智能更快完成,但數學、統計學、電腦科學上難以跨域整合。到今日人工智能發展的主軸都是以非數字為主。

各學科專業有其對數字、文字、圖像等的分類方式,進而展開建構對應之分析方法(含演算),但數字卻始終落後很多,甚至隨時間而記錄下的數字,光是單變量-時間變量-的研究被認為以達到極限,被解析完了。事實卻是人類並未踏入其中的8成。

如果有天出現能幫你完成「找出數字的數學模式」,你想要嗎?

想要請點讚吧
大數據分析讀書會🇹🇼
分享美國通貨膨脹率每月數值下的趨勢變化 https://sites.google.com/view/usinflation
運用 #MathGPT for numerical modelling 軟件找出美國通貨膨脹率趨勢和時間點訊號

美國通貨膨脹率趨勢追蹤
已經更新到2023年2月資料

https://sites.google.com/view/usinflation/

通貨膨脹率的下降斜率趨緩,顯示美國物價黏性高,想要達到美國聯準會的長期2%目標仍有段路可走,不過所謂的2%是「均值」,代表有上下限,預計最快能達到的上限約4.576%,所以還差1.5%的路,看起來還是很有感的。

上述數字是依照統計學標準常態分配推論出的。在美國聯準會不改其研究方法下,統計學標準常態分配仍是其標準之一。
大數據和人工智慧對數字的解析過程
1. 蒐集
2. 處理
3. 建模:要有數學式
4. 模擬:要有數學式
5. 驗證
6. 預測:要有數學式