OpenAI 推出 GPT-4o 原生图像生成新功能,令人惊叹!

3.26 不同于ChatGPT以前的生成式AI图像模型OpenAI的DALL-E3,这是一种经典的扩散转换器模型,经过训练,通过去除像素中的噪声来从文本提示中重建图像这个新的图像生成器是吐出文本和代码的同一模型的一部分,因为OpenAI训练整个模型可以一次理解所有这些形式的媒体

20250326134024


自 OpenAI 于 2024 年 5 月发布其第一个“全能”或多模态模型 GPT-4o 以来,在即将迎来一周年之际,今天 OpenAI 向 Plus、Pro、Team 和 Free 的 ChatGPT 的用户开启了 GPT-4o 的原生多模态图像生成功能,也将很快会向 Enterprise、Edu 和API用户开放。

为应该成为 AI 战略的一部分 - AI Impact Tour 2024为什么

不同于 ChatGPT 以前的生成式 AI 图像模型——OpenAI 的 DALL-E 3,这是一种经典的扩散转换器模型,经过训练,通过去除像素中的噪声来从文本提示中重建图像——这个新的图像生成器是吐出文本和代码的同一模型的一部分,因为 OpenAI 训练整个模型可以一次理解所有这些形式的媒体。


OpenAI 总裁格雷格·布罗克曼 (Greg Brockman) 早在 2024 年 5 月就预览了 GPT-4o 的这一原生功能,该公司一直保留到现在。这使得更高质量的图像可以生成,可以同时生成更逼真的图像和准确的文本,这给用户留下了深刻的印象。


20250326144121

用户Haider称其质量“疯狂”

将图像生成引入 ChatGPT 和 Sora

OpenAI 长期以来一直致力于使图像生成成为其 AI 模型的核心功能。借助 GPT-4o,用户现在可以直接在 ChatGPT 中生成图像,通过对话完善图像并即时调整细节。


该模型还集成到 OpenAI 的视频生成平台 Sora 中,进一步扩展了多模态功能。


OpenAI 在 X 上发布得公告中,证实 GPT-4o 的图像生特点:

1、准确呈现图像中的文本,允许创建标志、菜单、邀请函和信息图表。

2、精确遵循复杂的提示,即使在详细的合成中也能保持高保真度。

3、在以前的图像和文本的基础上构建,确保多次交互之间的视觉一致性。

4、支持各种艺术风格,从照片级写实到风格化插图。


用户可以在 ChatGPT 中描述图像,指定纵横比、配色方案(十六进制代码)或透明度等详细信息,GPT-4o 将在一分钟内生成。


20250326144148

独立 AI 顾问 Allie K. Miller 写到:这是“文本生成的巨大飞跃”,是见过的“最好的”AI 图像生成模型


主要功能和用例

GPT-4o 旨在使图像生成不仅在视觉上令人惊叹,而且非常实用。适合得一些关键应用有:

1、设计与品牌 – 生成具有精确文本位置的徽标、海报和广告。

2、教育与可视化 - 创建科学图表、信息图表和历史图像以供学习。

3、Game Development (游戏开发) – 在不同的设计迭代中保持角色的一致性。

4、营销与内容创作 - 制作社交媒体资产、活动邀请和数字插图,以满足品牌需求。

GPT-4o 如何改进 DALL-E 的生成图像

GPT-4o 对以前的模型进行了几项改进:

1、更好的文本集成:与过去难以处理清晰、位置合理的文本的 AI 模型不同,GPT-4o 现在可以准确地将单词嵌入图像中。

2、增强的上下文理解:GPT-4o 利用聊天记录,允许用户以交互方式优化图像并保持多代之间的连贯性。

3、改进的多对象绑定:虽然以前的模型难以在场景中正确定位许多不同的对象,但 GPT-4o 现在可以一次处理多达 10-20 个对象。

4、多种风格适应:该模型可以生成图像或将图像转换为各种样式,从手绘草图到高分辨率照片级真实感。

局限性

GPT-4o 仍然存在一些已知的挑战:

1、裁剪问题:大图像(如海报)有时可能会被裁剪得太紧。

2、非拉丁脚本中的文本准确性:某些非英语字符可能无法正确呈现。

3、小文本中的详细信息保留:高度详细或小字体的文本可能会失去清晰度。

4、编辑精度:修改图像的特定部分可能会无意中影响其他元素。

安全和标签措施

为防止被烂用,OpenAI 采取了防范和限制措施:

1、所有 GPT-4o 生成的图像都包含 C2PA 元数据,允许用户验证其 AI 来源。

2、确保以真人为特色的图像受到更严格的限制。