隨著信息時代的發展和深度學習的崛起,數據驅動的人工智能(Artificial Intelligence,簡稱為AI)模型逐漸從概念走進現實,在諸多領域表現出令人驚嘆的能力和潛力。金融領域自然不乏AI技術的使用和探索。許多AI模型已經成為了金融業常用的工具。其中,基於深度學習的模型初露鋒芒[1],展現出優於經典模型的潛力。然而,訓練深度學習模型需要大量數據來優化模型參數。金融領域深度學習模型的進一步發展卻受限於愈發突出的數據稀缺問題。本文將剖析金融AI模型所面臨的數據稀缺問題,並介紹常用的數據擴充方法,以及相應的新機遇和未來。
金融數據稀缺的主要原因及影響
1. 金融數據在時序上是有限的。金融數據的數據量往往與歷史長度相關。例如,個股的數據只能追溯到該股票上市的時間。目前,深度學習模型發展最成熟的兩個領域——語言和圖像——均需要上億數量級訓練數據(如圖一)。常用金融數據集(如股票價格、GDP)僅有數百至數萬數量級的數據點,其稀缺性便可窺見一二。

2. 隱私和安全問題也是一個重要的限制因素[1,2,4]。金融數據中往往包含了大量的敏感信息,如個人資產、交易記錄等。為了保護這些信息的安全,相關的法規和政策對金融數據的收集和使用設置了嚴格的限制。
3. 金融數據中還存在類別不均的問題。金融數據可以分為不同類別,而其中某些類別數據相比之下佔比極少。例如,在信用卡交易數據中,僅有少於0.1%的數據為異常值[4]。
這些主要因素共同導致了AI模型在金融場景中無法展現其巨大潛力。在數據受限的情況下,深度學習模型會過度擬合訓練數據,而非提取其中主要分佈和通用特徵,導致模型在未見過的新數據上表現較差,缺乏泛化能力。同時,在原有數據量不豐富的情況下,佔比較低的各類別數據會使模型更難準確學習到這些類別的數據特性。
如何運用生成技術來擴充數據集
為了解決金融領域中的數據稀缺問題,我們可以採用以下幾種常用的方法來擴充金融數據集。
1. 數據重採樣:此方法可用於改變數據的時間頻率,例如將日數據轉換為週數據或月數據。重採樣可以揭示不同時間尺度上的趨勢和模式,對於長期投資策略分析尤為有用。
2. 數據變換:這類方法通過一些變換操作(如噪聲注入、縮放、時間旋轉等)來生成新的數據。數據變換在一個歷史樣本的基礎上能夠變換出多個細微不同的新樣本,為短期及某個特定時期的投資策略提供更多測試。
3. 金融統計模型:在金融領域中,許多經典統計學方法可用於提取歷史數據中的某些特徵,從而模擬出新的數據。這些模型包括自迴歸移動平均(ARMA)和GARCH模型,它們能夠捕捉金融時間序列數據的特徵,如季節性、趨勢和波動性。這類模型能夠基於歷史數據模擬出可能的未來走勢,從而用於風險評估或市場行為的研究。
4. 深度生成模型:通過深度生成模型,如生成對抗網路(GANs)和擴散模型(Diffusion models),我們可以直接學習現有數據集的分佈。學習完成後,模型能夠產生新的數據樣本,這些樣本看起來和真實數據集中的樣本類似。這就像從一個已知的數學分佈,比如高斯分佈,抽取樣本一樣簡單。通過這種方式,我們可以生成看似真實的金融市場數據,用於模擬市場情況或測試金融策略。
數據重採樣提供了一種低複雜性的方式來分析長期趨勢,但不增加數據的多樣性。金融統計模型和數據變換在模擬和風險評估方面更為精細,適合於特定時間序列特性的研究。而深度生成模型在金融領域頗具潛力,因其能夠產生服從歷史數據分佈而又不重複歷史的新數據,在擴充數據集以提高深度學習模型表現方面取得了可觀的進展[1,2,3]。金融企業和機構可以結合應用所需靈活運用這些方法來為旗下AI模型提供更多訓練數據,提升其準確性和在不同場景下的泛化能力。
海量數據加持的AI帶來的新機遇
海量生成數據為深度學習提供了更大的「學習場地」,模型可以從更豐富的數據中挖掘出更深入、更複雜的規律,從而實現更高級的功能。以下,我們將結合兩個實際場景探索生成金融數據在金融領域的應用前景,以及其帶來的收益提升效果。
1. 預測市場:我們可以利用海量且足夠覆蓋多種可能性的生成數據來訓練更精準的預測模型,並發現新的市場規律。例如,生成數據能夠模擬出在特殊經濟情況下的資產價格變化,或者在不同市場情況下的交易行為。使用這些生成數據,金融企業能夠在更多樣化的場景下訓練或者驗證其金融模型,進一步完善投資策略以提升收益。根據J. P. Morgan的研究,在生成模型助力下,預測股票走勢的模型準確率可提升近28% [5],收益率亦大幅增長。
2. 風險管理:使用生成的大量數據進行風險管理可以比傳統方法更全面地模擬市場情況。我們可以生成大量無隱私問題的「假」數據用於模擬金融市場的各種情況,就如同精密儀器的「風洞」實驗,為決策者在實際操作前提供了一個安全且可控的環境來進行評估和驗證。例如,銀行可以藉此評估交易系統在各種壓力情景下的韌性和可靠性,從而降低系統性風險,保護客戶資產,並遵守監管要求,進而減少潛在的金融損失。Findex平台推出了一項創新的數據共享服務,旨在通過提供高質量的生成數據來強化詐騙識別算法。同樣,J.P. Morgan也運用生成數據來增進其反洗錢和異常交易檢測系統的訓練。
大數據驅動的AI模型在其他領域大展鴻圖,逐漸以摧估拉朽之勢顛覆傳統方法,帶來一輪又一輪產業升級。生成數據在金融行業的應用則是一片新「藍海」。在海量數據的加持下,AI模型在金融領域落地必將成為現實。Barclays 2018年報告顯示(見圖二),在多個金融領域,依賴於AI的企業已經佔據相當的比例,其中約20%的公司由AI參與決策的比重高達80%至100%[6]。在更多生成數據的幫助下,這些公司有望大幅提升其投資表現。

未來展望與挑戰
《經濟學人》強調「未來最有價值的資源不是石油,而是數據」。在大數據時代和AI大模型時代的共鳴下,海量金融數據之於金融大模型,就如同海量文本數據之於ChatGPT等大語言模型,必將成為AI模型全面發展和落地的重中之重。近年來,專門從事數據生成的企業也如雨後春筍般層出不窮。如圖三所示,截至2023年,整個北美的數據生成市場已經超過2億美元,預期到2030年可達近20億的規模 [9]。

阿蘭圖靈研究所(Alan Turing Institute)展望道「生成數據可以在公司、部門和研究單位之間共用,以獲得協同效益,並且它可以允許測試真實數據未涵蓋的極端場景。」英國金融市場行為監管局生成數據專家組(FCA Synthetic Data Expert Group)指出「生成數據增強保護消費者的能力並鼓勵金融服務領域的有益創新」。J.P. Morgan AI Research 總裁Tucker Balch則高度概括了未來研究的三個重點方向與挑戰:真實性、安全性和有效性。
參考文獻:
[1] Assefa, Samuel A., Danial Dervovic, Mahmoud Mahfouz, Robert E. Tillman, Prashant Reddy, and Manuela Veloso. “Generating synthetic data in finance: opportunities, challenges and pitfalls.” In Proceedings of the First ACM International Conference on AI in Finance, 2020.
[2] Dogariu, Mihai, Liviu-Daniel Ştefan, Bogdan Andrei Boteanu, Claudiu Lamba, Bomi Kim, and Bogdan Ionescu. “Generation of realistic synthetic financial time-series.” ACM Transactions on Multimedia Computing, Communications, and Applications, 2022.
[3] Wiese, Magnus, Robert Knobloch, Ralf Korn, and Peter Kretschmer. “Quant GANs: deep generation of financial time series.” Quantitative Finance, 2020.
[4] Sethia, Akhil, Raj Patel, and Purva Raut. “Data augmentation using generative models for credit card fraud detection.” In 2018 4th International Conference on Computing Communication and Automation, 2018.
[5] El-Laham, Yousef, and Svitlana Vyetrenko. “StyleTime: Style Transfer for Synthetic Time Series Generation.” In Proceedings of the Third ACM International Conference on AI in Finance, 2022.
[6] Barclays. “Survey: Majority of Hedge Fund Pros Use AI/Machine Learning in Investment Strategies.” 2018.
[7] “Trends in training dataset sizes.” Accessed on 1 January.
[8] “The world’s most valuable resource is no longer oil, but data.” The Economist, May 6th, 2017. Accessed on 1 January.
[9] Grand View Research. “Synthetic Data Generation Market Size, Share & Trends Analysis Report By Data Type, By Modeling Type, By Offering, By Application, By End-use, By Region, And Segment Forecasts, 2023 – 2030” 2023.
在此感謝InnoHK、香港特別行政區政府及人工智能金融科技實驗室(AIFT)對本文的支持。
(AIFT竭力但不能保證內容之準確和可靠,亦不會承擔因任何不準確或遺漏而引起的任何損失或損害。 )