3月25日,OpenAI 发布最新的 GPT-4o 模型,宣称它集成了迄今为止最先进的图像生成器。

新功能的亮点包括:能够精确渲染文本内容,提供高质量的图像效果;支持多种输入输出方式,涵盖文本、图像和音频等多种形式;理解复杂指令并结合上下文,创造出具有真实感的第一人称视角图像。

与之前的图像生成模型 DALL・E 不同,GPT-4o 采用了一种自回归模型,原生嵌入在 ChatGPT 中。这意味着,它能够处理多达10至20个不同物体的复杂指令,而竞争对手通常只能处理5至8个,展现出更强的能力。

用户只需简洁地描述需求,比如指定纵横比、颜色或透明背景,模型便可以快速生成图像。虽然渲染较复杂的细节可能需要稍等一会儿,但最终的效果是值得的。
在一次发布会上,演示者展示了多个具体案例。比如,他将一张合影转化为动漫风格的图像,模型不仅成功保留了人物的特征,还完美融合了动漫视觉效果。此外,演示者要求生成一页关于相对论的幽默漫画,结果生成的漫画不仅结构完整,还生动有趣。

31231417-2025-03-31T15:14:13.png
31231449-2025-03-31T15:14:52.png
31231517-2025-03-31T15:15:20.png

OpenAI 对该功能的安全性也非常重视,所有生成的图像都带有 C2PA 元数据标识,确保内容的来源可追溯,并有效阻止不当请求的生成。
当然,OpenAI 的图像生成工具并非没有缺点,比如在裁剪、上下文理解和非拉丁文本渲染等方面仍存在不足。不过,OpenAI 表示他们会在未来不断优化这些问题。

来源:
https://openai.com/index/introducing-4o-image-generation/