Google 推出具有 128k 上下文窗口的开源 Gemma 3 模型

3.13 虽然一些组织正在将较大的模型提炼成较小的版本,但像Google这样的模型提供商继续发布小型语言模型SLM作为大型语言模型LLM的替代方案,大型语言模型LLM可能会花费更多时间而不牺牲性能或准确性

gemma1


尽管大型语言和推理模型仍然很受欢迎,但组织越来越多地转向较小的模型来运行 AI 流程,减少能源和成本问题。


虽然一些组织正在将较大的模型提炼成较小的版本,但像 Google 这样的模型提供商继续发布小型语言模型 (SLM) 作为大型语言模型 (LLM) 的替代方案,大型语言模型 (LLM) 可能会花费更多时间而不牺牲性能或准确性。


考虑到这一点,Google 发布了其小型模型的最新版本 Gemma,它具有扩展的上下文窗口、更大的参数和更多的多模态推理功能。


Gemma 3 具有与较大的 Gemini 2.0 型号相同的处理能力,最适合用于手机和笔记本电脑等较小的设备。新型号有四种尺寸:1B、4B、12B 和 27B 参数。


Gemma 3 的上下文窗口更大,为 128K 个令牌,相比之下,Gemma 2 的上下文窗口为 80K,可以理解更多信息和复杂的请求。Google 更新了 Gemma 3,使其支持 140 种语言,可分析图像、文本和短视频,并支持函数调用以自动执行任务和代理工作流。


Gemma 表现出色


为了进一步降低计算成本,Google 引入了 Gemma 的量化版本。将量化模型视为压缩模型。这是通过“降低模型权重中数值的精度”而不牺牲准确性的过程来实现的。


谷歌表示,Gemma 3 “提供了其规模中最先进的性能”,并且优于 Llama-405B、DeepSeek-V3 和 o3-mini 等领先的 LLM。具体来说,Gemma 3 27B 在 Chatbot Arena Elo 分数测试中仅次于 DeepSeek-R1。它超过了 DeepSeek 的较小型号 DeepSeek v3、OpenAI 的 o3-mini、Meta 的 Llama-405B 和 Mistral Large。


gemma

 

通过量化 Gemma 3,用户可以提高性能、运行模型并构建“可以适应单个 GPU 和张量处理单元 (TPU) 主机”的应用程序。


Gemma 3 与 Hugging Face Transformers、Ollama、JAX、Keras、PyTorch 等开发人员工具集成。用户还可以通过 Google AI Studio、Hugging Face 或 Kaggle 访问 Gemma 3。公司和开发人员可以通过 AI Studio 请求访问 Gemma 3 API。


Shield Gemma 确保安全


谷歌表示,它已经在 Gemma 3 中内置了安全协议,包括一个名为 ShieldGemma 2 的图像安全检查器。


“Gemma 3 的开发包括广泛的数据治理,通过微调和强大的基准评估与我们的安全政策保持一致,”谷歌在一篇博文中写道。“虽然对功能更强的模型进行全面测试通常会为我们对功能较弱的模型的评估提供信息,但 Gemma 3 增强的 STEM 性能促使对其滥用产生有害物质的可能性进行具体评估;他们的结果表明风险水平较低。


ShieldGemma 2 是在 Gemma 3 基础上构建的 4B 参数图像安全检查器。它会查找并防止模型使用包含色情内容、暴力和其他危险内容的图像进行响应。用户可以自定义 ShieldGemma 2 以满足他们的特定需求。


小模型和蒸馏正在兴起


自 Google 于 2024 年 2 月首次发布 Gemma 以来,人们对 SLM 的兴趣有所增加。Microsoft 的 Phi-4 和 Mistral Small 3 等其他小型模型表明,企业希望使用与 LLM 一样强大的模型构建应用程序,但不一定使用 LLM 的全部功能。


企业也开始通过蒸馏转向他们喜欢的较小版本的 LLM。需要明确的是,Gemma 不是 Gemini 2.0 的蒸馏;相反,它是使用相同的数据集和架构进行训练的。蒸馏模型从更大的模型中学习,而 Gemma 则没有。


组织通常更喜欢将某些使用案例拟合到模型中。较小的模型(无论是 SLM 还是蒸馏版本)都可以轻松完成这些任务,而无需过度拟合大型模型,而不是将 o3-mini 或 Claude 3.7 Sonnet 等 LLM 部署到简单的代码编辑器。