BloombergGPT —— 由彭博社自研的一款金融语言大模型

新闻情绪倾向性分析准确判断新闻报道中对一家公司或一个国家的情绪倾向,从而帮助投资者做出更明智的投资决策

20250122163511


BloombergGPT是由彭博社自研的一款金融语言大模型,以下是对其的详细介绍:

一、背景与研发动机

  • 背景:金融科技(FinTech)是一个庞大且不断发展的领域,自然语言处理(NLP)技术发挥着越来越重要的作用。金融NLP任务包括情绪分析、命名实体识别、新闻分类以及人机问答等。虽然任务范围与一般NLP基准中的任务范围相似,但金融领域的复杂性和特定术语需要适用于特定领域的系统。

  • 研发动机:彭博社作为全球商业、金融信息和财经资讯的领先提供商,敏锐地捕捉到了金融领域缺乏专攻的LLM这一市场空白,并依托其四十多年来积累的大量金融数据源,开始了BloombergGPT的研发。

二、模型特点

  • 参数规模:BloombergGPT是一个拥有500亿参数的语言模型。

  • 模型架构:基于BLOOM模型构建,采用decoder-only结构,包含70层的transformer decoder blocks。

  • 训练数据:使用了超过7000亿词例(token)的训练数据,其中包括3630亿词例的金融数据集(FinPile)和3450亿词例的通用数据集。这种混合训练的方式,使得BloombergGPT既能够保持对自然语言理解的通用能力,又能够深入理解金融领域的专业知识。金融数据集涵盖了各种金融信息,如新闻、文件、新闻稿、网络爬取的金融文件以及社交媒体消息等,而通用数据集则包含了如The Pile、C4和Wikipedia等多种来源的数据。

三、技术优化

  • 优化策略:在模型训练过程中,BloombergGPT采用了多种优化策略以减少内存占用和提高训练速度,如ZeRO优化、激活检查点、混合精度训练等。这些优化技术的运用使得BloombergGPT在训练过程中能够更高效地利用资源。

  • 位置编码:使用了ALiBi位置编码,以增强模型的外推性。

四、性能表现

  • 金融任务:BloombergGPT在金融任务上的表现显著优于现有模型。它能够准确地进行情感分析、命名实体识别和实体消歧等金融NLP任务。例如,在情感分析方面,BloombergGPT能够准确判断新闻报道中对一家公司或一个国家的情绪倾向;在命名实体识别与实体消歧方面,它可以实现将公司名字与股票代码进行归一化。

  • 通用任务:同时,BloombergGPT也没有牺牲通用场景的语言理解能力。

五、应用场景

  • 金融机构:帮助金融机构判断市场对某一事件的看法,进行量化策略和投资决策;辅助金融机构进行信用评估,筛选新闻相关概念股,提升资料阅读效率等。

  • 财务报表分析:在财务报表分析和会计稽核等方面展现出了巨大的潜力。

  • 新闻情绪倾向性分析:准确判断新闻报道中对一家公司或一个国家的情绪倾向,从而帮助投资者做出更明智的投资决策。

六、评估与测试

  • 外部金融任务:在ConvFinQA、FiQA SA、FPB等多项测试中均表现得最优。

  • 内部金融任务:在情绪三分类和NER等任务中也同样表现出色。

官网介绍:https://www.bloomberg.com/company/press/bloomberggpt-50-billion-parameter-llm-tuned-finance/