大数据时代,FinTech中的AI怎能缺少大数据?

随着信息时代的发展和深度学习的崛起,数据驱动的人工智能(Artificial Intelligence,简称为AI)模型逐渐从概念走进现实,在诸多领域表现出令人惊叹的能力和潜力。 金融领域自然不乏AI技术的使用和探索。 许多AI模型已经成为了金融业常用的工具。 其中,基于深度学习的模型初露锋芒[1],展现出优于经典模型的潜力。 然而,训练深度学习模型需要大量数据来优化模型参数。 金融领域深度学习模型的进一步发展却受限于愈发突出的数据稀缺问题。 本文将剖析金融AI模型所面临的数据稀缺问题,并介绍常用的数据扩充方法,以及相应的新机遇和未来。

金融数据稀缺的主要原因及影响

1. 金融数据在时序上是有限的。 金融数据的数据量往往与历史长度相关。 例如,个股的数据只能追溯到该股票上市的时间。 目前,深度学习模型发展最成熟的两个领域——语言和图像——均需要上亿数量级训练数据(如图一)。 常用金融数据集(如股票价格、GDP)仅有数百至数万数量级的数据点,其稀缺性便可窥见一二。

图 一. 应用于语言(左)和图像(右)的模型训练数据规模逐年增加,均已突破亿的数量级 [7]

2. 隐私和安全问题也是一个重要的限制因素[1,2,4]。 金融数据中往往包含了大量的敏感信息,如个人资产、交易记录等。 为了保护这些信息的安全,相关的法规和政策对金融数据的收集和使用设置了严格的限制。

3. 金融数据中还存在类别不均的问题。金融数据可以分为不同类别,而其中某些类别数据相比之下占比极少。 例如,在信用卡交易数据中,仅有少于0.1%的数据为异常值[4]

这些主要因素共同导致了AI模型在金融场景中无法展现其巨大潜力。 在数据受限的情况下,深度学习模型会过度拟合训练数据,而非提取其中主要分布和通用特征,导致模型在未见过的新数据上表现较差,缺乏泛化能力。 同时,在原有数据量不丰富的情况下,占比较低的各类别数据会使模型更难准确学习到这些类别的数据特性。

如何运用生成技术来扩充数据集

为了解决金融领域中的数据稀缺问题,我们可以采用以下几种常用的方法来扩充金融数据集。

1. 数据重采样:此方法可用于改变数据的时间频率,例如将日数据转换为周数据或月数据。 重采样可以揭示不同时间尺度上的趋势和模式,对于长期投资策略分析尤为有用。

2. 数据变换:这类方法通过一些变换操作(如噪声注入、缩放、时间旋转等)来生成新的数据。 数据变换在一个历史样本的基础上能够变换出多个细微不同的新样本,为短期及某个特定时期的投资策略提供更多测试。

3. 金融统计模型:在金融领域中,许多经典统计学方法可用于提取历史数据中的某些特征,从而模拟出新的数据。 这些模型包括自回归移动平均(ARMA)和GARCH模型,它们能够捕捉金融时间序列数据的特征,如季节性、趋势和波动性。 这类模型能够基于历史数据模拟出可能的未来走势,从而用于风险评估或市场行为的研究。

4. 深度生成模型:通过深度生成模型,如生成对抗网络(GANs)和扩散模型(Diffusion models),我们可以直接学习现有数据集的分布。 学习完成后,模型能够产生新的数据样本,这些样本看起来和真实数据集中的样本类似。 这就像从一个已知的数学分布,比如高斯分布,抽取样本一样简单。 通过这种方式,我们可以生成看似真实的金融市场数据,用于模拟市场情况或测试金融策略。

数据重采样提供了一种低复杂性的方式来分析长期趋势,但不增加数据的多样性。 金融统计模型和数据变换在模拟和风险评估方面更为精细,适合于特定时间序列特性的研究。 而深度生成模型在金融领域颇具潜力,因其能够产生服从历史数据分布而又不重复历史的新数据,在扩充数据集以提高深度学习模型表现方面取得了可观的进展[1,2,3]。 金融企业和机构可以结合应用所需灵活运用这些方法来为旗下AI模型提供更多训练数据,提升其准确性和在不同场景下的泛化能力。

海量数据加持的AI带来的新机遇

海量生成数据为深度学习提供了更大的「学习场地」,模型可以从更丰富的数据中挖掘出更深入、更复杂的规律,从而实现更高级的功能。 以下,我们将结合两个实际场景探索生成金融数据在金融领域的应用前景,以及其带来的收益提升效果。

1. 预测市场:我们可以利用海量且足够覆盖多种可能性的生成数据来训练更精准的预测模型,并发现新的市场规律。 例如,生成数据能够模拟出在特殊经济情况下的资产价格变化,或者在不同市场情况下的交易行为。 使用这些生成数据,金融企业能够在更多样化的场景下训练或者验证其金融模型,进一步完善投资策略以提升收益。 根据J. P. Morgan的研究,在生成模型助力下,预测股票走势的模型准确率可提升近28% [5],收益率亦大幅增长。

2. 风险管理:使用生成的大量数据进行风险管理可以比传统方法更全面地模拟市场情况。 我们可以生成大量无隐私问题的「假」数据用于模拟金融市场的各种情况,就如同精密仪器的「风洞」实验,为决策者在实际操作前提供了一个安全且可控的环境来进行评估和验证。 例如,银行可以借此评估交易系统在各种压力情景下的韧性和可靠性,从而降低系统性风险,保护客户资产,并遵守监管要求,进而减少潜在的金融损失。 Findex平台推出了一项创新的数据共享服务,旨在通过提供高质量的生成数据来强化诈骗识别算法。 同样,J.P. Morgan也运用生成数据来增进其反洗钱和异常交易检测系统的训练。

大数据驱动的AI模型在其他领域大展鸿图,逐渐以摧估拉朽之势颠覆传统方法,带来一轮又一轮产业升级。 生成数据在金融行业的应用则是一片新「蓝海」。 在海量数据的加持下,AI模型在金融领域落地必将成为现实。 Barclays 2018年报告显示(见图二),在多个金融领域,依赖于AI的企业已经占据相当的比例,其中约20%的公司由AI参与决策的比重高达80%至100%[6]。 在更多生成数据的帮助下,这些公司有望大幅提升其投资表现。

图 二. (左)各金融领域依赖AI的企业占比,(右)AI参与这些公司决策比重的分布[6]

未来展望与挑战

《经济学人》强调「未来最有价值的资源不是石油,而是数据」。 在大数据时代和AI大模型时代的共鸣下,海量金融数据之于金融大模型,就如同海量文本数据之于ChatGPT等大语言模型,必将成为AI模型全面发展和落地的重中之重。 近年来,专门从事数据生成的企业也如雨后春笋般层出不穷。 如图三所示,截至2023年,整个北美的数据生成市场已经超过2亿美元,预期到2030年可达近20亿的规模 [9]

图三. 北美数据生成市场2020-2023年变化及2023-2030年预测的趋势[9]

阿兰图灵研究所(Alan Turing Institute)展望道「生成数据可以在公司、部门和研究单位之间共享,以获得协同效益,并且它可以允许测试真实数据未涵盖的极端场景。」 英国金融市场行为监管局生成数据专家组(FCA Synthetic Data Expert Group)指出「生成数据增强保护消费者的能力并鼓励金融服务领域的有益创新」。 J.P. Morgan AI Research 总裁Tucker Balch则高度概括了未来研究的三个重点方向与挑战:真实性、安全性和有效性。

参考文献:

[1] Assefa, Samuel A., Danial Dervovic, Mahmoud Mahfouz, Robert E. Tillman, Prashant Reddy, and Manuela Veloso. “Generating synthetic data in finance: opportunities, challenges and pitfalls.” In Proceedings of the First ACM International Conference on AI in Finance, 2020.

[2] Dogariu, Mihai, Liviu-Daniel Ştefan, Bogdan Andrei Boteanu, Claudiu Lamba, Bomi Kim, and Bogdan Ionescu. “Generation of realistic synthetic financial time-series.” ACM Transactions on Multimedia Computing, Communications, and Applications, 2022.

[3] Wiese, Magnus, Robert Knobloch, Ralf Korn, and Peter Kretschmer. “Quant GANs: deep generation of financial time series.” Quantitative Finance, 2020.

[4] Sethia, Akhil, Raj Patel, and Purva Raut. “Data augmentation using generative models for credit card fraud detection.” In 2018 4th International Conference on Computing Communication and Automation, 2018.

[5] El-Laham, Yousef, and Svitlana Vyetrenko. “StyleTime: Style Transfer for Synthetic Time Series Generation.” In Proceedings of the Third ACM International Conference on AI in Finance, 2022.

[6] Barclays. “Survey: Majority of Hedge Fund Pros Use AI/Machine Learning in Investment Strategies.” 2018.

[7] “Trends in training dataset sizes.” Accessed on 1 January.

[8] “The world’s most valuable resource is no longer oil, but data.” The Economist, May 6th, 2017. Accessed on 1 January.

[9] Grand View Research. “Synthetic Data Generation Market Size, Share & Trends Analysis Report By Data Type, By Modeling Type, By Offering, By Application, By End-use, By Region, And Segment Forecasts, 2023 – 2030” 2023.

在此感谢InnoHK、香港特别行政区政府及人工智能金融科技实验室(AIFT)对本文的支持。
(AIFT竭力但不能保证内容之准确和可靠,亦不会承担因任何不准确或遗漏而引起的任何损失或损害。 )

分享此內容

AI 技术如何提升企业决策效率

AI驱动的可持续发展:企业营运中的环境管理与合规

阅读更多

习近平视察香港创科发展

地址

香港沙田香港科学园科技大道西 19号
11楼 1101-1102 及 1121-1123 室

产品及解决方案

人才

工作机会

关于我们

地址

版权所有 © 2026 人工智能金融科技实验室有限公司