
Cohere 近日发布了最新版本的嵌入模型Embed 4,该模型具有更长的上下文窗口和更多的多模态。
Embed 4 是基于 Embed 3 的多模式更新构建,并围绕非结构化数据增加了更多功能。得益于 128,000 个令牌的上下文窗口,组织可以为大约 200 页的文档生成嵌入。
Cohere在一篇博客文章中表示“现有的嵌入模型无法原生理解复杂的多模态商业材料,导致公司开发繁琐的数据预处理管道,这些管道仅略微提高了准确性。Embed 4 解决了这个问题,使企业和员工能够高效地挖掘隐藏在大量不可搜索信息中的见解。”
企业可以在 Virtual Private Cloud 或本地技术堆栈上部署 Embed 4,以提高数据安全性。
公司可以生成嵌入,将其文档或其他数据转换为 RAG us e 案例的数字表示形式。然后,代理可以引用这些嵌入来回答提示。
特定领域的知识
该公司表示,Embed 4 “在金融、医疗保健和制造业等受监管行业表现出色”。Cohere 主要关注企业 AI 用例,该公司表示,其模型考虑了受监管部门的安全需求,并且对企业有深入的了解。
该公司训练 Embed 4 “对嘈杂的真实数据保持稳健”,因为尽管企业数据存在“缺陷”,例如拼写错误和格式问题,它仍然保持准确。
Cohere表示“它在搜索扫描文档和手写内容方面也表现出色。这些格式常见于法律文件、保险发票和费用收据中。这种能力消除了复杂数据准备或预处理管道的需要,节省了企业和运营成本。”
组织者可以使用 Embed 4 进行投资者演示、尽职调查文件、临床试验报告、维修指南和产品文档。
该模型支持 100 多种语言,就像该模型的先前版本一样。

Cohere 的客户 Agora 将 Embed 4 用于其 AI 搜索引擎,发现该模型可以显示相关产品。电子商务数据很复杂,包含图像和多方面的文本描述。Agora创始人Param Jaggi在博客中表示,能够将我们的产品统一嵌入,使我们的搜索速度更快,内部工具更高效。
代理用例
Cohere表示,像 Embed 4 这样的模型将改进代理用例,并声称它可以成为整个企业中代理和 AI 助手的“最佳搜索引擎”。”除了在各种数据类型上具有强大的准确性,该模型还提供了企业级的效率,这使得它能够扩展以满足大型组织的需求。
Cohere 补充说,Embed 4 会创建压缩的数据嵌入,以降低高昂的存储成本。
嵌入和基于 RAG 的搜索允许代理引用特定文档来完成与请求相关的任务。许多人认为这些提供了更准确的结果,确保代理不会以错误或幻觉的答案做出回应。
Cohere 竞争的其他嵌入模型包括 Qodo 的 Qodo-Embed-1-1.5B 和数据库供应商 MongoDB 最近收购的 Voyage AI 的模型。