2024年的四大 AI 故事和2025年的一个关键预测

12.24 公司开始完全接受AI的代理方法开发特定的AI驱动的机器人应用程序和工作流程,这些机器人应用程序和工作流程可以独立处理特定问题,或者比典型的LLM聊天机器人来回操作更少

20241224111907

从各方面来看,2024 年是人工智能迄今为止最大的一年——至少在该技术的商业化方面是这样。

ChatGPT 于 2022 年底推出后掀起的大型语言模型 (LLM) 热潮没有放缓的迹象,不仅 OpenAI 和 Microsoft、Meta 和 Google 等坚定的科技巨头推出了许多新的 LLM,而且还推出了数十家其他初创公司和个人开发者。

事实证明,人工智能研究放缓的报道即使不是没有根据,也肯定是目前夸大其词。

此外,支撑大多数大型 LLM 的 Transformer 架构之外的新技术开始浮出水面,例如 Liquid AI 的 Liquid Foundation 模型。

最后,公司开始完全接受 AI 的“智能体”方法——开发特定的 AI 驱动的机器人、应用程序和工作流程,这些机器人、应用程序和工作流程可以独立处理特定问题,或者比典型的 LLM 聊天机器人来回操作更少。

将今年的新闻报道提炼成前 14 名,更不用说前 10 名或前 4 名了,是一项令人烦恼的工作。但我还是尝试了一下,尽管通过将几个故事组合成更大的主题来略微作弊。在我看来,以下是今年将产生最大影响的内容:

1. OpenAI 扩展到 ChatGPT 之外

这家可以说是开启 gen AI 时代的最主要责任的公司今年没有错过任何一个节拍,尽管来自新手和传统技术的竞争加剧,甚至是它自己的投资者和合作伙伴 Microsoft。

o1 模型:OpenAI 发布了其 GPT 系列之外的第一个新的大型通用模型系列,即 o1“推理”系列,它分配了更多时间来处理复杂的提示,从而提高了准确性。它在科学、编码和推理任务中特别有效。

o3 型号: 它从 9 月开始紧随 o1 型号,并在年终重磅宣布推出更先进的 o3 型号。虽然这要到 2025 年初才会公开甚至向任何第三方提供,但它表明 OpenAI 并没有固步自封。

ChatGPT 搜索:此功能最初作为名为 SearchGPT 的仅限邀请的独立产品推出,然后被折叠到 ChatGPT 中,可以在 ChatGPT 中实现更实时的网络信息检索和搜索结果的精致呈现,增强其对最新查询的实用性,并与 Google、Bing 和新来者 Perplexity 正面交锋。

Canvas:Canvas 于 10 月推出,将 ChatGPT 界面从对话界面扩展到类似工作站的窗格,该窗格可以根据用户请求动态更新内容,例如编辑文档或编码项目。当然,很难不将其视为对几个月前宣布的 Anthropic's Artifacts 的反应,或者至少是与之相提并论的功能。

Sora:在用其严密保护的视频生成器模型取笑我们近一年之后,OpenAI 终于在 12 月初向大众推出了 Sora,并迅速引起了广泛的反应,因为它试图在竞争激烈的 AI 视频领域中脱颖而出,具有独特且经过深思熟虑的界面和故事板功能。

2. 开源 AI 起飞

Llama 3 和 3.1:Meta 于 4 月推出了 Llama 3,为开源 AI 的性能设定了新标准,然后在 7 月迅速跟进,推出了具有 4050 亿个参数的 Llama 3.1。Llama 3.1 版本用于为 Meta AI 提供支持,Meta AI 是该公司跨 WhatsApp、Messenger、Instagram 和 Facebook 等平台集成的助手,旨在成为使用最广泛的 AI 助手。

Llama 3.3:Llama 3.3 于 2024 年 12 月发布,其性能可与大型模型相媲美,但计算成本仅为其一小部分,使其更易于企业应用程序使用。

与此同时,阿里巴巴的 Qwen-2.5 系列和 DeepSeek 的新 V2.5 和 R1-Lite 预览版等中国机型似乎凭空出现在一些基准测试排行榜上名列前茅,而 Nvidia 本身除了提供显卡和软件架构之外,还推出了自己的开源、强大的 Nemotron-70B 型号。

Nous Research 是旧金山的一家小型公司,旨在以开源的形式提供更加个性化和限制较少的 AI 模型,它也推出了几个很酷的新想法。

我们不要忘记法国的 Mistral,它迅速扩展了自己的开源和专有 AI 产品。

3. Google 的 Gemini 系列成为最佳产品的有力竞争者

在今年的卷土重来故事中,谷歌的 Gemini 系列 AI 模型曾因其奇怪的图像生成而被嘲笑,并因过度“觉醒”而受到批评,但又推出了新的、更强大的版本,这些版本现在在第三方性能基准排行榜上名列前茅,对开发人员和企业的吸引力越来越大。

谷歌推出了 Gemini 2.0 Flash,这是一种多模态 AI 模型,支持流式视频分析,可以看到和指示你在屏幕上做什么,紧随其后的是 Gemini 2.0 Flash Thinking,它与 OpenAI 的 o1 和 o3 推理模型竞争。

4. 智能体 AI 席卷企业

随着时间的推移,“智能体”AI 从一个热门世界变成了顶级企业软件供应商的一系列真正的重大产品公告和计划。举个例子:

Salesforce 的 Agentforce 2.0:Salesforce 几天前推出了 Agentforce 2.0,这是一个先进的 AI 智能体程序,可增强其 CRM 和销售产品以及 Slack 的推理、集成和自定义功能,从而显着改善企业生产力工具。

SAP 的 Joule:SAP 将其 Joule 聊天机器人转变为由开源大型语言模型 (LLM) 提供支持的 AI 智能体,从而推动企业环境的创新和效率。

谷歌的 Astra 项目:作为 Gemini 2.0 计划的一部分,谷歌推出了 Astra 项目,这是一个人工智能助手,旨在通过利用谷歌的服务套件提供实时的上下文响应,旨在提高用户的生产力和决策能力。

2025 年的重大预测:AI 生成的内容将占据主导地位

在这些进步的基础上,2025 年有望见证 AI 生成内容在商业和消费者领域的激增,尤其是从 OpenAI 到 Meta、谷歌、Microsoft、Apple 甚至埃隆马斯克的 xAI 现在都在其产品中内置了 AI 图像生成器。

此次扩展将简化内容创建、增强个性化并提高各个领域的效率。

此外,我们预计大型语言模型 (LLM) 和生成式 AI 驱动的机器人技术将在商业和消费者环境中进行初步大规模部署,从而彻底改变自动化和人机交互。