時序數據處理難題攻略(上)

2020-12-23 CDA數據分析師

作者:計量與統計

來源:公眾號計量與統計

時間序列分析是根據系統觀測得到的時間序列數據,通過曲線擬合和參數估計來建立數學模型的理論和方法。它一般採用曲線擬合和參數估計方法(如非線性最小二乘法)進行。

一個時間序列通常由 4 種要素組成:趨勢、季節變動、循環波動和不規則波動。辨識合適的隨機模型,進行曲線擬合,即用通用隨機模型去擬合時間序列的觀測數據。對於短的或簡單的時間序列,可用趨勢模型和季節模型加上誤差來進行擬合。

對於平穩時間序列,可用通用 ARMA 模型(自回歸滑動平均模型)及其特殊情況的自回歸模型、滑動平均模型或組合-ARMA 模型等來進行擬合。當觀測值多於 50 個時一般都採用 ARMA 模型。對於非平穩時間序列則要先將觀測到的時間序列進行差分運算,化為平穩時間序列,再用適當模型去擬合這個差分序列。

面板數據,即 Panel Data,也叫「平行數據」,是指在時間序列上取多個截面,在這些截面上同時選取樣本觀測值所構成的樣本數據。面板數據分析方法是最近幾十年來發展起來的新的統計方法,面板數據可以克服時間序列分析受多重共線性的困擾,能夠提供更多的信息、更多的變化、更少共線性、更多的自由度和更高的估計效率,而面板數據的單位根檢驗和協整分析是當前最前沿的領域之一。

我們將分兩期,從時間序列數據與面板數據分析兩個方面入手,從數據檢驗(平穩性檢驗、模型滯後期、協整檢驗、格蘭傑檢驗)、數據模型(VAR 模型、VEC 模型、脈衝響應函數等)、平衡與非平衡面板出發,進行比較和探究。

平穩性問題匯總

Q1:最重要最基礎的!什麼是面板數據?

面板數據,即 Panel Data,是截面數據與時間序列數據綜合起來的一種數據類型。其有時間序列和截面兩個維度,當這類數據按兩個維度排列時,是排在一個平面上,與只有一個維度的數據排在一條線上有著明顯的不同,整個表格像是一個面板,所以把 panel data 譯作「面板數據」。

但是,如果從其內在含義上講,把 panel data 譯為「時間序列—截面數據」 更能揭示這類數據的本質上的特點。也有譯作「平行數據」或「TS-CS 數據(Time Series - Cross Section)」。

如:城市名:北京、上海、重慶、天津的 GDP 分別為 10、11、9、8(單位億元)。這就是截面數據,在一個時間點處切開,看各個城市的不同就是截面數據。

如:2000、2001、2002、2003、2004 各年的北京市 GDP 分別為 8、9、10、11、12(單位億元)。這就是時間序列,選一個城市,看各個樣本時間點的不同就是時間序列。

如:2000、2001、2002、2003、2004 各年中國所有直轄市的 GDP 分別為:

北京市分別為 8、9、10、11、12;

上海市分別為 9、10、11、12、13;

天津市分別為 5、6、7、8、9;

重慶市分別為 7、8、9、10、11(單位億元),這就是面板數據。

Q2:balanced 和 unbalanced 面板數據到底有什麼區別?

「平衡的意思是,如果按截面成員堆積數據,每個截面成員應包括正好相同的時期;如果按日期堆積數據,每個日期應包含相同數量的截面成員觀測值,並按相同順序排列。特別要指出的是,基礎數據並不一定是平衡的,只要在輸入文件中有表示即可。如果觀測值中有缺失數據,一定要保證文件中給這些缺失值留有位置。」

——from 高鐵梅

Q3:何為平穩性檢驗?

說到平穩,其實有兩種平穩——寬平穩、嚴平穩。

嚴平穩相較於寬平穩來說,條件更多更嚴格,而我們時常運用的時間序列,大多寬平穩就夠了。

什麼是嚴平穩:是在固定時間和位置的概率分布與所有時間和位置的概率分布相同的隨機過程。這樣,數學期望和方差這些參數也不隨時間和位置變化。(比如白噪聲)

什麼是寬平穩:寬平穩是使用序列的特徵統計量來定義的一種平穩性。它認為序列的統計性質主要由它的低階矩決定,所以只要保證序列低階矩平穩(二階),就能保證序列的主要性質近似穩定。

兩者關係

一般關係:嚴平穩條件比寬平穩條件苛刻,通常情況下,嚴平穩(低階矩存在)能推出寬平穩成立,而寬平穩序列不能反推嚴平穩成立。

特例:不存在低階矩的嚴平穩序列不滿足寬平穩條件,例如服從柯西分布的嚴平穩序列就不是寬平穩序列。當序列服從多元正態分布時,寬平穩可以推出嚴平穩。

Q4:如何進行平穩性檢驗?

檢查序列平穩性的標準方法是單位根檢驗。有 6 種單位根檢驗方法:ADF 檢驗、DFGLS檢驗、PP 檢驗、KPSS 檢驗、ERS 檢驗和 NP 檢驗,本節將介紹 DF 檢驗、ADF 檢驗。

ADF 檢驗和 PP 檢驗方法出現的比較早,在實際應用中較為常見,但是,由於這 2 種方法均需要對被檢驗序列作可能包含常數項和趨勢變量項的假設,因此,應用起來帶有一定的不便;其它幾種方法克服了前 2 種方法帶來的不便,在剔除原序列趨勢的基礎上,構造統計量檢驗序列是否存在單位根,應用起來較為方便。

ADF 檢驗是在 Dickey-Fuller 檢驗(DF 檢驗)基礎上發展而來的。因為 DF 檢驗只有當序列為 AR(1)時才有效。如果序列存在高階滯後相關,這就違背了擾動項是獨立同分布的假設。在這種情況下,可以使用增廣的 DF 檢驗方法(augmented Dickey-Fuller test )來檢驗含有高階序列相關的序列的單位根。

tips:

在進行 ADF 檢驗時,必須注意以下兩個實際問題:

(1)必須為回歸定義合理的滯後階數,通常採用 AIC 準則來確定給定時間序列模型的滯後階數。在實際應用中,還需要兼顧其他的因素,如系統的穩定性、模型的擬合優度等。

(2)可以選擇常數和線性時間趨勢,選擇哪種形式很重要,因為檢驗顯著性水平的 t 統計量在原假設下的漸近分布依賴於關於這些項的定義。

Q5:如果序列平穩了,那怎麼看啊?

AR 模型:自相關係數拖尾,偏自相關係數截尾;

MA 模型:自相關係數截尾,偏自相關函數拖尾;

ARMA 模型:自相關函數和偏自相關函數均拖尾。

P、Q的選擇主要看從第幾期開始快速收斂。

Q6:如何制定滯後數呢?

先找出最小的 AIC 和 SIC(不是絕對值),在此基礎上看 ADF 檢驗是否通過,即判斷是否是平穩序列。

補充一下關於 AIC 的信息:

AIC 信息準則:是衡量統計模型擬合優良性的一種標準,由於它為日本統計學家赤池弘次創立和發展的,因此又稱赤池信息量準則。它建立在熵的概念基礎上,可以權衡所估計模型的複雜度和此模型擬合數據的優良性。

在一般的情況下,AIC 可以表示為:AIC=2k-2ln(L)其中:k 是參數的數量,L 是似然函數。假設條件是模型的誤差服從獨立正態分布。讓 n 為觀察數,RSS 為剩餘平方和,那麼 AIC變為:AIC=2k+nln(RSS/n)增加自由參數的數目提高了擬合的優良性,AIC 鼓勵數據擬合的優良性但是儘量避免出現過度擬合(Overfitting)的情況。所以優先考慮的模型應是 AIC 值最小的那一個。赤池信息準則的方法是尋找可以最好地解釋數據但包含最少自由參數的模型。

Q7:ADF 檢驗和協整檢驗是什麼關係?

先做單位根檢驗,看變量序列是否平穩序列,若平穩,可構造回歸模型等經典計量經濟學模型;若非平穩,進行差分,當進行到第 i 次差分時序列平穩,則服從 i 階單整(注意趨勢、截距不同情況選擇,根據 P 值和原假設判定)。

若所有檢驗序列均服從同階單整,可構造 VAR 模型,做協整檢驗(注意滯後期的選擇),判斷模型內部變量間是否存在協整關係,即是否存在長期均衡關係。如果有,則可以構造 VEC 模型或者進行 Granger 因果檢驗,檢驗變量之間「誰引起誰變化」,即因果關係。

單位根檢驗是序列的平穩性檢驗,如果不檢驗序列的平穩性直接 OLS 容易導致偽回歸。當檢驗的數據是非平穩(即存在單位根),並且各個序列是同階單整(協整檢驗的前提),想進一步確定變量之間是否存在協整關係,可以進行協整檢驗,協整檢驗主要有 EG 兩步法和 JJ 檢驗 。

相關焦點

  • 二十四、數據挖掘之時序模式
    時序模式1.1 問題引入下個月的商品銷量、銷售額或庫存量是多少?明天廣州市的最高用電負荷是多少?序列模式的概念時序模式:描述基於時間或其他序列的經常發生的規律或趨勢,並對其建模。序列模式將關聯和時間序列模式結合起來,重點考慮數據之間維度上的關聯性。
  • 時序資料庫的前世今生
    以華為雲Cloud Eye Service(CES)服務為例,單個Region需要監控7000多萬個監控指標,每秒需要處理90萬個上報的監控指標項,假設每個指標50個字節,一年的監控數據有1PB;自動駕駛的車輛一天各種傳感器監測數據就80G。   傳統關係型資料庫很難支撐這麼大的數據量以及這麼大的寫入壓力,Hadoop大數據解決方案以及現有的時序資料庫也會面臨非常大的挑戰。
  • ZETA技術通過數蛙科技百億級物流標籤軌跡時序數據壓測
    濤思時序資料庫TDengine是目前針對時序資料庫的性能最優的開源資料庫平臺,廣泛運用於工業、電力、車聯網、大數據領域。數蛙科技結合縱行科技的ZETag雲標籤與濤思數據的高容量時序資料庫,為物流領域未來高增長、高並發的物流標籤場景,進行了1000萬接入、百億級時序數據的運營級全業務模擬壓力測試。
  • 時序旋渦攻略更新——古墓、軒轅、雨林
    大過年的就別爆肝崩崩崩啦,這篇攻略可以收藏了以後再看,重要的時間應該多陪陪重要的人哦~關於時序旋渦的介紹和磁雲、劍誓關卡攻略請移步:時序漩渦攻略更新——磁雲、劍誓古墓黑夜之子的護盾判定位置在身體上而不是手上,要注意角色站位才能使飛彈打到身體擊破護盾,之後儘快擊破其手部護甲將其擊殺。視頻演示實際配置:
  • FPGA控制下面陣CCD時序發生器設計及硬體實現
    摘要 在分析Sony公司ICX098BQ面陣CCD圖像傳感器驅動時序的基礎上,對可調節曝光時間的CCD時序發生器及其硬體電路進行設計。選用FPGA器件作為硬體設計平臺,使用VHDL語言對時序關係進行了硬體描述。
  • 「數據世界盃」KDD Cup 2019賽題正式公布,首次挑戰AutoML產業落地最大難題
    據了解,本次KDD Cup AutoML挑戰賽由第四範式主辦,微軟、AutoML領域最權威的學術組織ChaLearn協辦,並為此次比賽設置了「史上」難度最高的比賽項目——基於時序關係型數據的AutoML。時序關係型數據在在線廣告、推薦系統、金融市場分析、醫療等應用場景中非常常見,人們往往需要利用這樣的數據去構建機器學習模型,並應用機器學習模型提升對應業務的效果。
  • 時序邏輯電路設計
    打開APP 時序邏輯電路設計 發表於 2019-05-16 18:32:37   時序邏輯電路
  • 金融時序預測:狀態空間模型和卡爾曼濾波
    我們可以對數據進行差分或對數變換來消除趨勢和季節性。在許多統計和計量經濟學應用的背景下,這些成分的知識具有潛在的重要性。趨勢和季節的估計可以通過最大化殘差均方差從差分序列中恢復,但是這並不像直接對分量建模那樣吸引人。我們要記住,真實的時序從來都不是靜止的。 在這裡,我們將使用簡單的時間序列移動平均平滑法來估計趨勢分量。
  • 常見的時序模型:RNN/LSTM/GRU
    邏輯門輸出(0, 1)之間的值,表示流入或流出Cell的信息,多大程度上使用Cell循環保留信息。遺忘門過濾沒有關聯的歷史信息,輸入門篩選有用輸入信息,當有多個Cell時,輸出門篩選Cell輸出,如下示意圖可參考理解。注意與上圖標記的不同,這裡的out_t對應於上圖的c_t, 且沒有遺忘門。
  • 20#鋼管使許多難題得到處理
    20#鋼管使許多難題得到處理   山東海融信主要經營:方矩管,20#鋼管,Q345D無縫方管等各種方矩管,為更好的服務客戶擴大經營範圍。歡迎來電諮詢,洽談合作。
  • 金融時序預測:狀態空間模型和卡爾曼濾波(附代碼)
    數據基於1986年以來的Schlumberger Limited歷史數據。 在這裡,為了方便計算,我採用了月(12個月)頻率,你也可以嘗試天(252天/年)的頻率。下面由密度和正態 QQ 圖組成的分布圖清楚地顯示了數據分布的非正態性。
  • 騰訊優圖實驗室高級研究員棟豪:時序動作分析技術的研究與應用 |...
    「騰訊優圖專場」,是智東西公開課邀請騰訊優圖實驗室面向開發者和科研人員,專注講解騰訊優圖實驗室前沿研究成果的系列線上公開課,第一階段共計三講。第一講由優圖實驗室資深高級研究員瑋劍主講,主題為《3D人臉重建技術的研究與應用實例》。第二講由優圖實驗室研究員太平主講,主題為《人臉安全技術的研究與應用》。
  • 中安網脈副總經理:大數據時代數據安全與隱私保護有兩個難題
    講座上,中安網脈副總經理、大數據安全事業部總經理查正朋以「大數據時代,信息安全如何守護?」為主題進行了分享。查正朋認為,目前隱私保護的實踐方法在大數據時代基本上形同虛設。大數據時代的數據安全與個人隱私保護面臨兩個難題:一是隨著物聯網的快速發展,海量數位化基礎設施隨時隨地在收集個人隱私,如何做好安全運營維護;二是海量數位化基礎設施必然帶來漏洞的快速增長,如何面對漏洞激增。
  • 做數據的「管家」——拓維信息泛物聯網平臺實踐
    每個生產環節上能產生多少數據信息嗎?產生的數據鏈又是如何讓這支煙的生產變得質效更佳、效率更高、生產過程可追溯呢?現在,只要搭建一個工業物聯網平臺(IoT),這支煙的每個重要生產環節的信息將得到採集,這些信息也會以數據的形式上傳至雲平臺,通過建模分析後幫助整個工廠進行生產工藝的改良和生產進度的精準指導。
  • 保證時序控制灌溉系統順利實現,需要滿足這幾個條件
    根據灌溉系統的組成不同,自動控制灌溉系統可以分為時序控制灌溉系統、ET智能灌溉系統、計算機控制灌溉系統這三大類,其中,河北潤田常用的自動控制灌溉系統是時序控制灌溉系統。那什麼是時序控制灌溉系統?保證時序控制灌溉系統順利實現的要素都有哪些?下面,河北潤田就來告訴大家。
  • 簡單的時序電源插座電路圖
    打開APP 簡單的時序電源插座電路圖 家電資料維修網 發表於 2020-03-30 17:20:11 本文介紹專為電腦設計的時序控制電源插座,稍加改動也可以用到其他的需要時序控制的電路中去。電路圖如下所示。   一、電路原理
  • 影馳A320M 龍將喜迎更新 支持高頻還可調時序
    升級BIOS後,影馳 A320M 龍將支持雙通道內存最高頻率3600MHz並能以默認時序運行,當然,如果你想要進一步提高內存性能,也可以手動設置壓縮內存時序。proID=397影馳 A320M 龍將既然已經支持內存頻率3600MHz,毫無疑問用上DDR4-3600的高頻內存更能收穫更好的性能。說到高頻內存,影馳星曜系列內存無疑是性能、與顏值齊聚的產品,搭配影馳 A320M 龍將,可輕易實現高頻率低時序,從而讓Ryzen CPU的性能充分發揮。
  • 內存時序很很重要嗎?3個知識點助你全面了解,選購內存不再糾結
    在上幾篇文章裡,都有對內存的各個方面常識進行了介紹,也讓大家對內存的認識有了很大的提升。也有很多的粉絲提出了對內存的許多看法和建議,這是一個很好的互動,本身創作就是為了讓更多人學習討論,並且能發表出自己的觀點,這才是最有意義的正能量的事情。
  • 芝奇皇家戟DDR4-4000 CL15套裝評測:極致的頻率與時序
    當然了買內存除了頻率之外還有個要注意的就是內存的時序,它和頻率是相互相成的,共同決定了內存的延遲是多少,而內存延遲則是對遊戲性能影響非常大的一個因素,現在DDR4-4000內存普遍都是CL18或者CL19的,但在內存上追求極致的芝奇現在弄了一套CL只有15的皇家戟DDR4-4000出來,看時序就知道它擁有極低的延遲。
  • 大數據分析會遇到哪些難題
    打開APP 大數據分析會遇到哪些難題 中琛源 發表於 2021-01-13 14:43:43 如今的數據具有多種多樣的形式,而且來自許多不同的數據源