全球最强「开源版Gemini」诞生!全能多模态模型Emu2登热榜,多项任务刷新SOTA_每日快讯(日常热点指南)

全球最强「开源版Gemini」诞生!全能多模态模型Emu2登热榜,多项任务刷新SOTA


全球最强「开源版Gemini」诞生!全能多模态模型Emu2登热榜,多项任务刷新SOTA

  2023-12-29 00:43:28     简体|繁體
http://news.qghjm.com/1027273.html

原文来源:新智元

图片来源:由无界 AI‌生成

最强的全能多模态模型来了!就在近日,智源研究院重磅发布了开源界的「Gemini」——Emu2,一口气刷新多项SOTA。

过去的18个月里,我们见证了AI领域许多重要的时刻。

Llama、Alpaca等众多开源模型竞相发布,不仅与闭源模型的性能相媲美,同时为每个人提供了投身AI的机会:

- 2022年8月,Stable Diffusion问世,让DALL·E的神秘光环不再遥不可及,每个人都能够召唤出自己的数字达芬奇;

- 2023年2月,Meta的Llama及其后续的语言模型大军,让ChatGPT的独角戏成为群星争辉;

- 2023年12月6日,Google DeepMind揭开多模态巨星Gemini的面纱。

仅仅两周后,智源研究院便发布了最新一代生成式多模态开源模型——Emu2。

很快,这一开源多模态领域的工作便引起了国际社区的广泛关注,并登上了HN热榜第三。

Emu2在HackerNews榜单上引发关注

HuggingFace 大V AK转发

据悉,这一模型即将推出更轻量的版本,让技术玩家也在本地运行。

Emu2,通过大规模自回归生成式多模态预训练,显著推动了多模态上下文学习能力的突破。

Emu2在少样本多模态理解任务上大幅超越Flamingo-80B、IDEFICS-80B等主流多模态预训练大模型,在包括VQAv2、OKVQA、MSVD、MM-Vet、TouchStone在内的多项少样本理解、视觉问答、主体驱动图像生成等任务上取得最优性能。

Emu2模型和Flamingo、GPT-4V、Gemini等模型能力对比情况一览

「开源版Gemini」来袭

相较2023年7月发布的第一代「多模态to多模态」Emu模型,Emu2使用了更简单的建模框架,训练了从编码器语义空间重建图像的解码器、并把模型规模化到37B参数实现模型能力和通用性上的突破。
与此同时,依然采用大量图、文、视频的序列,建立基于统一自回归建模的多模态预训练框架,将图像、视频等模态的token序列直接和文本token序列交错在一起输入到模型中训练。
值得一提的是,Emu2是目前最大的开源生成式多模态模型,基于Emu2微调的Emu2-Chat和Emu2-Gen模型分别是目前开源的性能最强的视觉理解模型和能力最广的视觉生成模型:
- Emu2-Chat可以精准理解图文指令,实现更好的信息感知、意图理解和决策规划。
- Emu2-Gen可以接受图像、文本、位置交错的序列作为输入,实现灵活、可控、高质量的图像和视频生成。
现在,Emu2的模型、代码均已开源,并提供Demo试用。


项目:https://baaivision.github.io/emu2/

模型:https://huggingface.co/BAAI/Emu2
代码:https://github.com/baaivision/Emu/tree/main/Emu2
Demo:https://huggingface.co/spaces/BAAI/Emu2
论文:https://arxiv.org/abs/2312.13286

多项性能刷新SOTA


通过对多模态理解和生成能力的定量评测,Emu2在包括少样本理解、视觉问答、主体驱动图像生成在内的多个任务上取得最优性能。
在少样本评测上,Emu2在各个场景下显著超过Flamingo-80B,例如在16-shot TextVQA上较Flamingo-80B 超过12.7个点。


经过指令微调的Emu2可以对图像和视频输入进行自由问答,以统一模型在VQAv2、OKVQA、MSVD、MM-Vet、TouchStone等十余个图像和视频问答评测集上取得最优性能。


在零样本的DreamBench主体驱动图像生成测试上,较此前方法取得显著提升,例如比Salesforce的BLIP-Diffusion的CLIP-I分数高7.1%, 比微软的Kosmos-G的DINO分数高7.2%。



多模态上下文学习

生成式预训练完成后,Emu2具备全面且强大的多模态上下文学习能力。基于几个例子,模型可以照猫画虎的完成对应理解和生成任务。

例如在上下文中描述图像、在上下文中理解视觉提示(覆盖图像上的红圈)、在上下文中生成类似风格的图像、在上下文中生成对应主体的图像等。



强大的多模态理解

经过对话数据指令微调的Emu2-Chat,可以精准理解图文指令、更好的完成多模态理解任务。

例如推理图像中的要素、读指示牌提供引导、按要求提取和估计指定属性、回答简单的专业学科问题等。 



基于任意prompt序列的图像生成

经过高质量图像微调的Emu2-Gen,可以接受图像、文本、位置交错的序列作为输入,生成对应的高质量图像,这样的灵活性带来高可控性。

例如生成指定位置、指定主体的熊和向日葵: 


生成指定位置、指定主体、指定风格的宠物狗和小鸸鹋的合影图像:


更多的根据图文序列生成的例子:



基于任意prompt序列的视频生成

进一步的,Emu2支持基于任意prompt序列的视频生成。

基于文本、图文交错、图文位置交错的序列,可以生成对应的高质量视频。 


统一的生成式预训练

Emu2的训练方法是在多模态序列中进行生成式预训练。

使用统一的自回归建模方式,根据当前已生成的 token 预测下一个视觉或文本token。

相比Emu1,Emu2使用了更简单的建模框架、训练了更好的从特征重建原图的解码器、并把模型规模化到37B参数。

参考资料:

https://baaivision.github.io/emu2/



编辑:web3528btc 来源:加密钱包代币

免责声明:以上文章内容信息均搜集自互联网或用户发布,并不代表本站观点或立场,本站不对其真实合法性负责。如有信息侵犯了您的权益,请联系本站将立即删除。
分享到:

  • 上一篇
    下一篇

  • 今日要闻|实事关注

    每日快讯(日常热点指南)
    手机查看(二维码扫一扫)

    每日快讯网为您提供最新的行业简讯、新闻报道,以及今日热点内容,重大事件等实时资讯,24小时不间断播报,让您获得最新行业信息。
    « 2018年 » « 02月 »
    1234
    567891011
    12131415161718
    19202122232425
    262728

    最新资讯

    我是广州新锐时代的销售经理陈长清,[开户代运营]ai课程 养生粉推广社群粉,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 20:51:03

     

    我是云南讯海的销售股问颜梦,[开户代运营]Ai剪辑培训,大国小国测算,养生壶,养生书,驼绒被,三康治疗仪,血糖贴,睡眠仪,血压计,熊胆粉,小护士,我们是乙方综合性服务商,欢迎点击对接合作与我联系。
  • 2026-02-28 20:42:00

     

    我是成都鑫安宁的营销总监荀留东,[开户代运营]多条获客渠道,帮企业解决获客难问题,还有大量汽车、装修线索,现寻找实力电销团队合作,我们是,欢迎点击对接合作与我联系。
  • 2026-02-28 20:32:56

     

    我是六安有信的市场总监赵仁新,[开户代运营]盲盒、债务逾期、个贷企业贷、黄金回收等全行业均可投放,免保证金、免费设计出图,运营一站式服务,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 20:23:53

     

    我是成都枣米糖的运营总监程凯文,[开户代运营]手游平台-游戏全免费 广告盈利 诚招代理/创业伙伴 提供广告分成,我们是,欢迎点击对接合作与我联系。
  • 2026-02-28 20:14:49

     

    我是巨划算的销售专员练文杰,[代运营托管]百度(baidu)电商高点开户代运营 对公47 对私53➕!,我们是推广代运营服务商,欢迎点击对接合作与我联系。
  • 2026-02-28 20:05:45

     

    我是艾斯互动的CEO许萍,[代运营托管]百度(baidu)健康商城CID粉,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 19:56:42

     

    全平台MCN寻求各大有预算的品牌方视频植入合作
  • 2026-02-28 19:47:39

     

    我是大林科技的媒介总监李佳妮,[开户代运营]闲鱼平台的收量服务,可针对闲置/新品等各类商品高效完成收量需求,助力提升相关数据表现,我们是乙方综合性服务商,欢迎点击对接合作与我联系。
  • 2026-02-28 19:38:36

     

    我是安徽快磁互动的渠道专员孙甜甜,[开户代运营]快手一代财商报白、AI剪辑、妇产、体检、骨科、心理咨询,法律服务、数字人、加盟无人机、祛斑祛痘现成户,政策好,量大可谈,我们是,欢迎点击对接合作与我联系
  • 2026-02-28 19:29:32

     

    我是北京中传的广告销售龙涛,[开户代运营] 百度(baidu)医疗 医生号签框开户及代运营服务,量大成本低,欢迎咨询合作,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 19:20:28

     

    我是南北传媒的销售经理黄家森,[开户代运营]广点通气血,祛斑,JF,耳鸣,胃病,骨病等小病种代运营软文粉,量大政策好,欢迎咨询,我们是推广代运营服务商,欢迎点击对接合作与我联系。
  • 2026-02-28 19:11:25

     

    我是民众普康的ad信息流销售何骋远,[开户代运营] 千川政策高 一手婚恋相亲表单 三角洲护航有量 、抖快手涨粉 、手机回收 、抖音证券,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 19:02:22

     

    我是网多多的大客户经理陈曦,[开户代运营]腾讯全国多地端口及KA游戏教育金融开户,旅游、教育、商服、小病种软文加粉、珠宝软文加粉等现户资源,我们是乙方综合性服务商,欢迎点击对接合作与我联系。
  • 2026-02-28 18:53:18

     

    我是天津优智的商务经理陈磊,[开户代运营]腾讯K3、K4新开及存量业务合作,高政策且稳定,我们是广告媒体代理商,欢迎点击对接合作与我联系。
  • 2026-02-28 18:44:15