近日,谷歌正式推出其最新图像生成模型——Gemini 2.5 Flash Image,该模型不仅全面支持中文理解与生成,还面向用户免费开放,迅速在海外社交平台掀起试用与讨论热潮。尤其以“香蕉人”为代表的创意图像生成效果,成为用户争相体验的焦点,显示出该模型在文本—图像跨模态理解方面的卓越能力。

作为谷歌Gemini系列的新成员,Gemini 2.5 Flash Image在图像编辑、融合与生成三大功能方面表现突出。用户仅需通过自然语言描述,即可实现高质量的图像处理。例如,当用户上传一张足球运动员卡洛斯的照片,并提出“将他的头部换成香蕉人”的指令,模型能够精准识别头部区域并进行智能替换,同时保持原图其余部分的结构、光影与风格一致性。
此外,该模型还支持多图融合生成。用户可上传多张图像,并通过文本指令控制合成效果。例如,若用户上传两张儿童照片并输入“让他们手牵手”,Gemini 2.5 Flash Image 能够自然地将两人合并在同一画面中,实现肢体互动与场景协调。
在图像生成方面,该模型同样展现出优秀的场景构建与语义还原能力。用户可通过详细文本描述生成诸如“2077年深海科研基地”等复杂虚拟场景。尽管生成图像在细节层次上略逊于专业级模型,但在构图、光影控制和语义还原方面已具备较高可用性,尤其适合创意发散与设计辅助应用。

谷歌CEO桑达尔·皮查伊(Sundar Pichai)在社交媒体上以三个香蕉图标隐晦呼应此次发布,进一步引发网友对该模型功能的广泛好奇与积极评价。许多行业观察者认为,Gemini 2.5 Flash Image 不仅大幅降低了AI图像创作的门槛,其免费与多语言策略也将推动AI工具在全球创意社群中的普及。
业界观点指出,Gemini 2.5 Flash Image 的推出,是谷歌在多模态AI领域持续推进技术平民化的重要举措。该模型有望成为设计师、内容创作者与普通用户进行视觉表达和创意实验的便捷工具,也为未来AI生成内容的创新发展提供了更多可能。
免费使用:
https://gemini.google.com/app
博客:
https://developers.googleblog.com/en/introducing-gemini-2-5-flash-image/