当前位置: 首页 > news >正文

GPT-4o 级图像生成的民主化:Janus-4o 和 ShareGPT-4o-Image 挑战

概述

本文构建了一个名为 "ShareGPT-4o-Image "的新的大规模合成数据集,目的是将 GPT-4o 的高级图像生成功能转移到一个开源的多模态模型中。此外,还提出了一个使用该模型的多模态大规模语言模型 “Janus-4o”。

ShareGPT-4o-Image 由 45,000 个文本的图像生成数据和 46,000 个使用图像和文本的图像转换数据组成,这两个数据都是使用 GPT-4o-Image 生成的高质量样本。根据这些数据对现有的 Janus-Pro 模型进行微调后,Janus-4o 不仅能从文本生成图像,还能编辑图像(从文本+图像输入生成图像)。值得注意的是,只需 91K 个样本和 6 个小时的训练,Janus-4o 的性能就能超越以前的模型。

这项研究为高性能图像生成技术的民主化做出了贡献,是加速开放式多模态研究的重要一步。

建议的方法

ShareGPT-4o-Image 是一个合成数据集,旨在模仿和提炼 GPT-4o-Image 的功能。该数据通过两种生成方案创建。

一种是 “提示驱动”,即定义属性(如对象、背景、风格),LLM 据此生成自然语言提示,GPT-4o-Image 据此输出图像。另一种是 “图像驱动”,即 LLM 根据现有图像生成详细描述,并将其与图像配对以创建数据。图像编辑数据由原始图像、编辑说明和编辑图像三部分组成,基于 14 个不同的任务,涵盖了大量的样式转换和元素添加。

然后,利用该数据集对现有的 Janus-Pro 模型进行微调,从而开发出 Janus-4o,该模型的结构既适用于纯文本输入,也适用于文本+图像组合输入,旨在为每种输入提供适当的表征学习。

实验

Janus-4o 的性能在两个任务中进行了评估:从文本生成图像和图像编辑。

在从文本生成图像方面,使用了 GenEval 和 DPG-Bench 基准来衡量构图一致性和视觉保真度。结果显示,与 Janus-Pro 相比,GenEval 的性能提高了 4 个百分点,DPG-Bench 的性能提高了 1.6 个百分点。

同时,ImgEdit-Bench 基准对图像编辑能力进行了评估,该基准在移动变化和风格转换等详细编辑项目上获得了高分。尤其值得注意的是,在使用少量训练数据(91K)的情况下,其性能与其他使用超过 400 万数据的模型相当,甚至超过了它们。

此外,人类评估实验清楚地表明,在生成图像的视觉吸引力和教学保真度方面,Janus-4o 明显优于 Janus-Pro 和 UltraEdit。这证明了 ShareGPT-4o-Image 的高数据质量及其有效性。

http://www.cnnetsun.cn/news/6093.html

相关文章:

  • Responder网络工具配置优化与故障排除实战指南
  • UnityLive2DExtractor终极指南:快速提取Live2D Cubism资源
  • AgentBench完整使用指南:快速上手LLM智能体评测框架
  • Wan2.2-T2V-5B生成视频可用于智能家居场景模拟
  • C++ 虚构造机制深度解析
  • 保护进程的驱动,真正的驱动保护,小弟弟手写并测试通过(直接可以编译)
  • 生成引擎优化(GEO)在优化网站内容与提升访客体验中的实践价值分析
  • LSTM-VAE用于特征提取和数据降维
  • 数据结构——二叉树
  • Qwen3-Next-80B-A3B-Thinking:仅激活3B参数实现800亿模型性能,大模型效率革命深度解析
  • 揭秘FSNotes:现代笔记管理的智能解决方案实战指南
  • Wan2.2-T2V-A14B在游戏开发中的应用:快速制作剧情动画
  • Redmine项目管理平台终极使用指南:新手必读FAQ
  • 3大核心技能带你玩转大规模并行处理器编程
  • 轻松捕获网络视频:Video DownloadHelper 1.6.3版全方位使用指南
  • 三相OW-PMSM无感电机仿真:基于零序反电动势的DQ轴数学模型与双逆变器调制策略的研究与实践
  • Java开发者的人工智能转型之路:可行性、优势、薪资对比及学习路线全解析!
  • Java包装类与自动装箱拆箱深度解析
  • 大模型Agent开发进阶:Memory系统与RAG的本质区别与应用!
  • 从零到一:5步用FutureCoder开启Python编程之旅
  • Wan2.2-T2V-A14B生成视频的加载性能优化技巧
  • DeepAnaX系统战略升级:深度集成“DeepSeek数据统计分析系统”,引领AI生态营销智能化
  • 如何快速上手Wot Design Uni:面向开发者的完整实战指南
  • AI校园学习神器|让背书刷题变成快乐小事[特殊字符]
  • #leetcode# 、
  • 开源对象存储项目一览
  • 跨语言智能对话革命:PaddleX多语种语音识别实战指南
  • Wan2.2-T2V-A14B能否取代传统视频剪辑师?业内专家这样说
  • 热力图技术实战指南:从基础应用到企业级解决方案
  • DeepSeek+Dify构建智能体和企业知识库资料