前沿模型
2024年,多个实验室赶上了OpenAI的GPT-4,出现了第一批超越GPT-4智能水平的模型。
前沿语言模型智能,随时间演变

主要趋势:
competing labs赶超OpenAI的GPT-4:OpenAI在2022年11月推出GPT-3.(ChatGPT)后,拉开了语言模型竞赛的序幕;在接下来的18个月里, competing labs一直在努力追赶。
开源模型接近顶尖实验室:以Meta、Mistral和阿里云等公司开发的开源权重模型为代表,已经接近并超越了PT-4的智能水平。
超越GPT-4的智慧火花:2024年的最后几个月见证了超越GPT-4的第一次重大智能飞跃,OpenAI的o1引领。推理时间计算扩展、数据质量和新的强化学习技术等主题与预训练计算扩展一起成为改进模型的主要杠杆。
语言模型原产国
美国主导了智能前沿;中国似乎位居第二,只有少数其他国家展示了前沿级别的训练能力。

开源语言模型智能
在Meta、Mistral和阿里云等公司的模型推动下,开源模型和专有模型之间的性能差距显著缩小。

语言模型推理定价
2024年,所有级别的智能语言模型推理定价都显著下降;GPT-4o mini以便宜100倍接近GPT-4的智能水平。

语言模型大小
小型模型达到以前只有大型模型才能达到的智能水平,是推理定价下降和速度提高的一个关键因素。

关键要点:
在过去的12个月里,小模型显著改进。这一改进速度大大超过了大模型,导致性能差距大幅缩小。
是什么推动了改善?
计算缩放
• “Chinchilla最优”已成过去:现在语言模型在实际应用中已被大规模使用,增加训练计算以减少推理是明显的胜利。
• 开源权重模型现在经常在超过10T的token上进行训练——这在两年前几乎是 unheard of。
知识蒸馏
• 较大模型的智能收益已被提炼到较小的版本中。
• 像直接偏好优化这样的强化学习技术推动了最新一代的小模型,包括Llama 3.1/2。
高质量数据
• 利用高质量数据对小型模型特别有利,尤其是微软的Phi系列模型。
语言模型上下文窗口
上下文窗口显著增加到128k作为新标准;长上下文推理使模型能够一次处理更多数据。

关键要点:
自 2023 年第三季度以来,前沿模型的中位上下文长度增加了 32 倍。 扩展最初是由专有引领的,但到 2024 年第三季度,开源模型已经迎头赶上。 最近的进展还将某些模型(Gemini、Nova)上下文长度增加到 200 万个 token。
是什么推动了改善?
新技术
• 增加上下文长度的技术范围从硬件感知分布式注意力实 现到注意力近似和长度外推方法,如RoPE。
开发者需求
70%的开发者在人工智能分析开发者调查中表示,他们在选择模型时,上下文窗口对他们来说是很重要的。
• 各实验室响应一个明确的行业需求信号。
暗示;含意
降低复杂性
在生产中管理较小的上下文窗口。
• 较长的上下文减少了您需要建立检索、 总结和截断策略。
新方法与应用
代理人的工具会迅速耗尽上下文窗口 。
• 许多应用程序不仅仅依赖文本。更大的上下文窗口支持包括图像、视频和在内的多模态输入。
推理策略
每个任务使用的计算量越来越多,这不仅体现在生成额外的推理 token 上,也体现在智能体工作流程上。更长的上下使更多的灵活性成为可能。
语言模型:主要参与者格局
人工智能价值链中的参与者在垂直整合程度上有所不同;谷歌从TPU加速器到Gemini,是垂直整合程度最高的参与者。

语言模型开发者的见解
对AI模型的需求集中在顶级AI实验室的发布上;模型推理质量和价格是选择模型的主要决策因素。

公司正在采用多种技术方法使用 LLM,但没有一种方法占主导地位;大多数LLM 用户打算使用多模态

大多数AI模型用户打算在他们的应用程序中使用多个模型;~3/4的用户通过托管的无服务器端点访问模型

图像生成质量
2024年图像生成质量迅速提高,在照片逼真度、提示遵循和文本呈现方面取得了显著飞跃。

图像生成景观
2024年图像模型的进展和竞争不断加速; 人工分析图像竞技场的前5名模型均在202年第三季度后推出。

视频生成景观
OpenAI 于 2024 年 2 月预览 Sora 时几乎没有竞争对手,但到 202 年 12 月推出时,竞争格局已经变得更加激烈。

文本到语音景观
最新一代基于变压器的文本到语音模型在2024年实现了新的质量里程碑,超越了长期存在的Hyperscaler产品。

语音转文本现状
OpenAI 在 2022 年底开源 Whisper 时改变了 AI 转录的格局,使云推理服务商能够进入市场并在和价格方面展开竞争。
