在当今数字化时代,技术的迅猛发展已经改变了商业世界的各个方面。其中,自然语言处理技术(Natural Language Processing,NLP)在金融和会计领域的广泛应用成为了一个备受关注的话题。本文将深入探讨NLP技术如何影响上市公司的财务报告,并呼吁企业管理者重视这一趋势,以确保其公司的财务信息能够与「机器」保持良好的互动。
NLP技术的崭露头角
在金融和会计领域,NLP技术的应用主要集中在分析大量的财务报告、新闻文章和社交媒体内容上,目的是读取、解析和总结这些文本数据,从中获取有关公司和市场的关键信息。具体体现在投资者开始加大对于NLP技术的投入。例如,国内头部基金公司华夏基金与NLP/AI领域领先者北京澜舟科技合作成立金融自然语言处理联合实验室,建设基于华夏基金投资研究逻辑的舆情NLP能力[1]。彭博在2023年发布了金融领域的第一个生成型大语言模型BloombergGPT[2]。通过彭博自身积累的大量精心编辑的文本数据,如财经新闻、财务报告文本,帮助BloombergGPT建立金融市场的常识,为投资者提供实时的市场动态和见解。这种自动化的分析方法为投资者提供了更快、更准确的信息,帮助他们作出更明智的投资决策。
NLP文本分析
想要编写一份服务「机器」的财务报告,首先需要深入了解机器是如何分析这类报告的。通常,文本分析可分为以下三个步骤:文本表示、模型预测和后续分析,如图一所示。

举个简单的例子,投资者利用上市公司的财务报告来预测下一个季度的股票收益率。第一步是将财务报告中的文本转换成数字。第二步,搭建一个机器学习预测模型(如神经网络),用以预测股票收益率。模型的输入即是第一步得到的文本表示,输出则是对应上市公司下一季度的股票收益率。最后,投资者可以使用预测结果进行后续分析,例如横向对比不同上市公司下一季度的投资回报,或纵向分析某个上市公司历史预测收益率的波动。
| 负面情绪词 | |||||||||
| 风险 | 亏损 | 违反 | 损害 | 舞弊 | 严重 | 约束 | 手段 | 坏账 | 负担 |
| 越权 | 不道德 | 损毁 | 异常 | 谴责 | 严峻 | 萎靡 | 困顿 | 失利 | 守旧 |
| 不健全 | 仿造 | 倒闭 | 侮辱 | 压制 | 冒进 | 刁难 | 危害 | 压迫 | 低迷 |
| 正面情绪词 | |||||||||
| 平稳 | 崛起 | 精神 | 和谐 | 突出 | 合格 | 力争 | 透明 | 成熟 | 迅速 |
| 倾心 | 保密 | 清晰 | 积极性 | 严正 | 丰硕 | 乐观 | 从优 | 信誉 | 充实 |
| 不屈 | 威信 | 完备 | 创新 | 勇气 | 飙升 | 富余 | 干劲 | 庆祝 | 强悍 |
| 负面情绪词 | |||||||||
| 垃圾 | 下跌 | 调回 | 割肉 | 套牢 | 风险 | 减持 | 抛售 | 可悲 | 低迷 |
| 向下 | 跌破 | 无耻 | 狗屎 | 利空 | 困顿 | 可笑 | 跳空 | 倒霉 | 赔钱 |
| 烂股 | 小人 | 绝望 | 卑鄙 | 压制 | 不值 | 草包 | 担心 | 丢脸 | 烦心 |
| 正面情绪词 | |||||||||
| 涨停 | 崛起 | 胜利 | 献花 | 发财 | 暴涨 | 战斗机 | 稳赚 | 过瘾 | 幸运 |
| 黑马 | 赚翻天 | 爽歪歪 | 止跌 | 恭喜 | 开心 | 舒服 | 漂亮 | 牛股 | 完美 |
| 赚大 | 期待 | 好样 | 创新 | 勇气 | 神奇 | 明智 | 成功 | 支持 | 飙升 |
目前,主流的文本表示方法是词袋法(bag-of-words)。词袋法相当简单,通过统计文本中每个单词的出现次数或使用其出现与否的二进制值,从而创建一个用于分析的「词袋」向量。随后,投资者通常会运用一些提前定义好的、经过科学验证的情绪词典,以生成财报文本传达的情绪(sentiment),从而预测下个季度的投资回报率。表1和表2分别列举了正式与非正式用语中典型的中文情绪词[3]。而图2则展示了基于巴菲特历年致股东信的情绪分析,包含负向(negative)、正向(positive)、不确定性(uncertainty)和争议性(litigious)。

新技术对财务报告的启示
从财务报告撰写的角度来看,作者能够影响的主要是文本分析的第一步。也就是说,如何撰写财务报告,以便机器更好地表示文本,并确保该文本表示有助于第二步生成更有利于公司的预测。在这一背景下,作者应该如何编写财报呢?
笔者建议上市公司组织相关团队整理和维护常用情绪词典中的正向与负向词汇。在财务报告的撰写过程中,确保语义准确的前提下,尽可能使用正向情绪的词汇。举例来说,「消费市场摆脱疫情时期的低迷」中,「低迷」是一个典型的负向词汇。虽然结合语境可以理解这个句子是正向的表达,但目前常用的NLP模型仍不能理解语境信息,因此可能得出负向情绪的预测。改写可以是:「消费市场在疫情后开始回暖」。这样的表达有助于机器生成正向的预测,同时确保了语义的准确性。
大语言模型带来的新思考
大语言模型是一种生成型模型,通过学习大量文本数据,能够生成具有语法正确性和语义连贯性的自然语言文本。大语言模型在2023年迅速发展,为财务报告的撰写带来了新的思考。在这个背景下,笔者认为一种快速检查机器对财务报告印象的方法是将已撰写好的文本放入大语言模型进行总结归纳。需要注意的是,由于财务报告本身的高敏感性,选择大语言模型时应优先考虑可以本地部署的开源模型,比如由Meta开发的LlaMa2[4]。
未来挑战与展望
在这个数字化和自动化的时代,为「机器」服务可能成为上市公司财务报告的一个重要趋势。企业管理者需要关注财务报告读者群体的变化趋势。适应NLP技术的趋势将有助于企业更好地为「机器」提供服务,从而更好地满足投资者、分析师和监管机构的需求,在数字化时代保持竞争力。然而,这并不意味着人类的角色被边缘化。相反,机器和人类需要紧密合作,共同创造更准确、有深度和有影响力的财务报告。上市公司需要积极拥抱这一变革,不断学习和创新,以确保企业在这个竞争激烈的市场中保持领先地位。
参考文献:
[1] 华夏基金与澜舟科技成立金融NLP联合实验室,共促金融科技创新
[2] 彭博推出BloombergGPT——专为金融行业从头打造的500亿参数大语言模型
[3] 姚加权,冯绪,王赞钧,纪荣嵘,和张维 (2021). 语调,情绪及市场影响:基于金融情绪词典。管理科学学报,24(5)
在此感谢InnoHK、香港特别行政区政府及人工智能金融科技实验室(AIFT)对本文的支持。
(AIFT 竭力但不能保证内容之准确和可靠,亦不会承担因任何不准确或遗漏而引起的任何损失或损害。 )