智源研究院发布 Emu2 —— 开源生成式多模态模型

2023年 12月 23日 43.5k 0

2023年12月21日,智源研究院开源发布新一代多模态基础模型Emu2。

据介绍,Emu2是目前最大的开源生成式多模态模型,基于Emu2微调的Emu2-Chat和Emu2-Gen模型分别是目前开源的性能最强的视觉理解模型和能力最广的视觉生成模型。Emu2-Chat可以精准理解图文指令,实现更好的信息感知、意图理解和决策规划。Emu2-Gen可接受图像、文本、位置交错的序列作为输入,实现灵活、可控、高质量的图像和视频生成。

通过大规模自回归生成式多模态预训练,显著推动多模态上下文学习能力的突破。Emu2在少样本多模态理解任务上大幅超越Flamingo-80B、IDEFICS-80B等主流多模态预训练大模型,在包括VQAv2、OKVQA、MSVD、MM-Vet、TouchStone在内的多项少样本理解、视觉问答、主体驱动图像生成等任务上取得最优性能。

Emu2的模型、代码均已开源,并提供Demo试用。了解更多技术细节,参考Emu2论文。

  • 项目:https://baaivision.github.io/emu2/

  • 模型:https://huggingface.co/BAAI/Emu2

  • 代码:https://github.com/baaivision/Emu/tree/main/Emu2

  • Demo:https://huggingface.co/spaces/BAAI/Emu2

  • 论文:https://arxiv.org/abs/2312.13286

相关文章

塑造我成为 CTO 之路的“秘诀”
“人工智能教母”的公司估值达 10 亿美金
教授吐槽:985 高校成高级蓝翔!研究生基本废了,只为房子、票子……
Windows 蓝屏中断提醒开发者:Rust 比 C/C++ 更好
Claude 3.5 Sonnet 在伽利略幻觉指数中名列前茅
上海新增 11 款已完成登记生成式 AI 服务

发布评论