在當今數碼化時代,技術的迅猛發展已經改變了商業世界的各個方面。其中,自然語言處理技術(Natural Language Processing,NLP)在金融和會計領域的廣泛應用成為了一個備受關注的話題。本文將深入探討NLP技術如何影響上市公司的財務報告,並呼籲企業管理者重視這一趨勢,以確保其公司的財務信息能夠與「機器」保持良好的互動。
NLP技術的嶄露頭角
在金融和會計領域,NLP技術的應用主要集中在分析大量的財務報告、新聞文章和社交媒體內容上,目的是讀取、解析和總結這些文本數據,從中獲取有關公司和市場的關鍵信息。具體體現在投資者開始加大對於NLP技術的投入。例如,國內頭部基金公司華夏基金與NLP/AI領域領先者北京瀾舟科技合作成立金融自然語言處理聯合實驗室,建設基於華夏基金投資研究邏輯的輿情NLP能力[1]。彭博在2023年發布了金融領域的第一個生成型大語言模型BloombergGPT[2]。通過彭博自身積累的大量精心編輯的文本數據,如財經新聞、財務報告文本,幫助BloombergGPT建立金融市場的常識,為投資者提供實時的市場動態和見解。這種自動化的分析方法為投資者提供了更快、更準確的信息,幫助他們作出更明智的投資決策。
NLP文本分析
想要編寫一份服務「機器」的財務報告,首先需要深入了解機器是如何分析這類報告的。通常,文本分析可分為以下三個步驟:文本表示、模型預測和後續分析,如圖一所示。

舉個簡單的例子,投資者利用上市公司的財務報告來預測下一個季度的股票收益率。第一步是將財務報告中的文本轉換成數字。第二步,搭建一個機器學習預測模型(如神經網路),用以預測股票收益率。模型的輸入即是第一步得到的文本表示,輸出則是對應上市公司下一季度的股票收益率。最後,投資者可以使用預測結果進行後續分析,例如橫向對比不同上市公司下一季度的投資回報,或縱向分析某個上市公司歷史預測收益率的波動。
| 負面情緒詞 | |||||||||
| 風險 | 虧損 | 違反 | 損害 | 舞弊 | 嚴重 | 約束 | 手段 | 壞帳 | 負擔 |
| 越權 | 不道德 | 損毀 | 異常 | 譴責 | 嚴峻 | 委靡 | 困頓 | 失利 | 守舊 |
| 不健全 | 仿造 | 倒閉 | 侮辱 | 壓制 | 冒進 | 刁難 | 危害 | 壓迫 | 低迷 |
| 正面情緒詞 | |||||||||
| 平穩 | 崛起 | 精神 | 和諧 | 突出 | 合格 | 力爭 | 透明 | 成熟 | 迅速 |
| 傾心 | 保密 | 清晰 | 積極性 | 嚴正 | 豐碩 | 樂觀 | 從優 | 信譽 | 充實 |
| 不屈 | 威信 | 完備 | 創新 | 勇氣 | 飆升 | 富餘 | 幹勁 | 慶祝 | 強悍 |
| 負面情緒詞 | |||||||||
| 垃圾 | 下跌 | 調回 | 割肉 | 套牢 | 風險 | 減持 | 拋售 | 可悲 | 低迷 |
| 向下 | 跌破 | 無恥 | 狗屎 | 利空 | 困頓 | 可笑 | 跳空 | 倒楣 | 賠錢 |
| 爛股 | 小人 | 絕望 | 卑鄙 | 壓制 | 不值 | 草包 | 擔心 | 丟臉 | 煩心 |
| 正面情緒詞 | |||||||||
| 漲停 | 崛起 | 勝利 | 獻花 | 發財 | 暴漲 | 戰鬥機 | 穩賺 | 過癮 | 幸運 |
| 黑馬 | 賺翻天 | 爽歪歪 | 止跌 | 恭喜 | 開心 | 舒服 | 漂亮 | 牛股 | 完美 |
| 賺大 | 期待 | 好樣 | 創新 | 勇氣 | 神奇 | 明智 | 成功 | 支持 | 飆升 |
目前,主流的文本表示方法是詞袋法(bag-of-words)。詞袋法相當簡單,通過統計文本中每個單詞的出現次數或使用其出現與否的二進制值,從而創建一個用於分析的「詞袋」向量。隨後,投資者通常會運用一些提前定義好的、經過科學驗證的情緒詞典,以生成財報文本傳達的情緒(sentiment),從而預測下個季度的投資回報率。表1和表2分別列舉了正式與非正式用語中典型的中文情緒詞 [3]。而圖2則展示了基於巴菲特歷年致股東信的情緒分析,包含負向(negative)、正向(positive)、不確定性(uncertainty)和爭議性(litigious)。

新技術對財務報告的啟示
從財務報告撰寫的角度來看,作者能夠影響的主要是文本分析的第一步。也就是說,如何撰寫財務報告,以便機器更好地表示文本,並確保該文本表示有助於第二步生成更有利於公司的預測。在這一背景下,作者應該如何編寫財報呢?
筆者建議上市公司組織相關團隊整理和維護常用情緒詞典中的正向與負向詞彙。在財務報告的撰寫過程中,確保語義準確的前提下,盡可能使用正向情緒的詞彙。舉例來說,「消費市場擺脫疫情時期的低迷」中,「低迷」是一個典型的負向詞彙。雖然結合語境可以理解這個句子是正向的表達,但目前常用的NLP模型仍不能理解語境信息,因此可能得出負向情緒的預測。改寫可以是:「消費市場在疫情後開始回暖」。這樣的表達有助於機器生成正向的預測,同時確保了語義的準確性。
大語言模型帶來的新思考
大語言模型是一種生成型模型,通過學習大量文本數據,能夠生成具有語法正確性和語義連貫性的自然語言文本。大語言模型在2023年迅速發展,為財務報告的撰寫帶來了新的思考。在這個背景下,筆者認為一種快速檢查機器對財務報告印象的方法是將已撰寫好的文本放入大語言模型進行總結歸納。需要注意的是,由於財務報告本身的高敏感性,選擇大語言模型時應優先考慮可以本地部署的開源模型,比如由Meta開發的LlaMa2 [4]。
未來挑戰與展望
在這個數碼化和自動化的時代,為「機器」服務可能成為上市公司財務報告的一個重要趨勢。企業管理者需要關注財務報告讀者群體的變化趨勢。適應NLP技術的趨勢將有助於企業更好地為「機器」提供服務,從而更好地滿足投資者、分析師和監管機構的需求,在數碼化時代保持競爭力。然而,這並不意味著人類的角色被邊緣化。相反,機器和人類需要緊密合作,共同創造更準確、有深度和有影響力的財務報告。上市公司需要積極擁抱這一變革,不斷學習和創新,以確保企業在這個競爭激烈的市場中保持領先地位。
參考文獻:
[1] 華夏基金與瀾舟科技成立金融NLP聯合實驗室,共促金融科技創新
[2] 彭博推出BloombergGPT——專為金融行業從頭打造的500億參數大語言模型
[3] 姚加權,馮緒,王贊鈞,紀榮嶸,和張維. (2021). 語調, 情緒及市場影響: 基於金融情緒詞典。管理科學學報,24(5)
在此感謝 InnoHK、香港特別行政區政府及人工智能金融科技實驗室(AIFT)對本文的支持。
(AIFT 竭力但不能保證內容之準確和可靠,亦不會承擔因任何不準確或遺漏而引起的任何損失或損害。)