模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

1,250次阅读
没有评论

丰色 发自 凹非寺
量子位 | 公众号 QbitAI

把Huggingface上的现成模型拿来“攒一攒”——

直接就能组合出新的强大模型?!

日本大模型公司sakana.ai脑洞大开(正是“Transformer八子”之一所创办的公司),想出了这么一个进化合并模型的妙招。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

该方法不仅能自动生成新的基础模型,而且性能绝不赖

他们得到的一个70亿参数的日语数学大模型,直接在相关基准测试上取得了SOTA,打败了700亿参数的Llama-2等前辈。

最重要的是,得出这样的模型不需要任何梯度训练,因此需要的计算资源大大减少。

英伟达科学家Jim Fan看完大赞:

这是我最近读过的最有想象力的论文之一。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

合并进化,自动生成新基础模型

开源大模型排行榜上表现最好的模型,大多不再是LLaMA或Mistral这种“原始”模型,而是一些微调或合并模型之后,我们就能看出:

一种新的趋势出现了。

Sakana.ai介绍,开源基础模型很容易在数百个不同的方向上进行扩展和微调,然后产生在新的领域表现出色的新模型。

而在这之中,模型合并显现出了巨大前景。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

但,它可能是一种“黑魔法”,严重依赖直觉和专业知识。

因此,我们需要更为系统性的方法。

受自然界的自然选择启发,Sakana.ai盯上了进化算法,引入“进化模型合并”(Evolutionary Model Merge)的概念,提出一种可以发现最佳模型组合的通用方法。

该方法结合了两种不同的思路:

(1)合并数据流空间(层)中的模型,以及(2)合并参数空间(权重)中的模型。

具体而言,第一种数据流空间方法是通过进化来发现不同模型层的最佳组合,以此形成新模型。

在社区以往的做法中,都是靠直觉来确定如何以及模型哪些层可以与另一个模型的层结合。

但其实,Sakana.ai介绍,这个问题有一个组合数量巨大的搜索空间,最适合由优化算法如进化算法来搜索。

其操作示例如下:

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

至于第二个参数空间方法则混合多个模型权重来形成新模型。

这种方法其实很无数种实现,再加上混合的每一层原则上可以使用不同的混合比例,就更多了。

而这,利用进化方法就可以有效地找出更为新颖的混合策略。

以下是将两个不同模型的权重进行混合得到新模型的操作示例:

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

将以上这两种方法合并,就是这样的:

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

作者介绍,他们希望在相距较远的领域,例如数学和非英语语言、视觉和非英语语言,来组成之前大家不曾探索过的新兴组合。

结果,还真有点让人惊喜。

新模型轻松拿下SOTA

用以上进化合并方法,团队得到了3个基础模型:

  • 大语言模型EvoLLM-JP

由日语大模型Shisa-Gamma和数学大模型WizardMath/Abel合并而成,擅长解决日语数学问题,进化了100-150代。

  • 视觉语言模型EvoVLM-JP

日语大模型Shisa Gamma 7B v1+LLaVa-1.6-Mistral-7B,是具有日语能力的VLM。

  • 图像生成模型EvoSDXL-JP

支持日语的SDXL扩散模型。

前两个已在Hugging Face和GitHub上发布,最后一个也即将推出。

具体来看。

1、EvoLLM-JP

它在GSM8K数据集的多语言版本——MGSM的日语评估集上取得成绩如下:

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

可以看到,EvoLLM-JP用日语解决数学问题的表现超过了它们的原始模型,也超过了Llama-2、GPT-3.5等高性能模型。

其中模型4是仅在参数空间进行了优化,模型6是使用模型4在数据流空间中进一步优化的结果。

在既评估数据能力也评估一般日语能力的日语lm-evaluation-harness基准上,EvoLLM-JP则在9个任务上的平均得分最高达到了70.5——只用70亿参数,它就打败了700亿的Llama-2等模型。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

团队表示,EvoLLM-JP已经足够优秀,可以作为通用日语大模型,并解决一些有趣的例子:

比如需要特定日本文化知识的数学问题,或者用关西方言讲日本笑话。

2、EvoVLM-JP

在以下两个图像问答的基准数据集上,分数越高,代表模型用日语回答的描述越准确。

结果,它不仅比其所基于的英语VLM LLaVa-1.6-Mistral-7B更出色,也比现有的日语VLM更厉害。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

如下图所示,在回答图中的信号灯为什么颜色之时,只有EvoVLM-JP答对:蓝色。(日本的习俗就是把红绿灯称为红蓝灯)

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

3、EvoSDXL-JP

这个支持日语的SDXL模型只需4个扩散模型即可执行推理,生成速度相当快。

具体跑分还没出来,但团队透露也是“相当有希望的”。

可以欣赏一些示例:

提示词包括:味噌ラーメン、最高品質の浮世絵、葛飾北斎、江戸時代。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

对于以上3个新模型,团队指出:

原则上,我们可以采用基于梯度的反向传播来进一步提高以上这些模型的性能。

但我们不用,因为现在的目的就是表明,即使没有反向传播,我们仍然可以得到足够先进的基础模型,挑战当前的“昂贵范式”。

对此,网友们纷纷点赞。

Jim Fan也补充:

在基础模型领域,目前社区几乎完全专注于让模型去学习,而不太重视搜索,但后者在训练(也就是本文提出的进化算法)和推理阶段其实都有巨大的潜力。

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了
马斯克点赞

所以,如网友所说:

我们现在已经处于模型的寒武纪大爆发时代了吗?

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

论文地址:
https://arxiv.org/abs/2403.13187
参考链接:
[1]
https://sakana.ai/evolutionary-model-merge/
[2]https://twitter.com/DrJimFan/status/1771927650883522899?s=20
[3]https://twitter.com/SakanaAILabs/status/1770613032198279663

评选报名即将截止!

2024年值得关注的AIGC企业&产品

量子位正在评选2024年最值得关注的AIGC企业、 2024年最值得期待的AIGC产品两类奖项,欢迎报名评选

评选报名截至2024年3月31日 模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

中国AIGC产业峰会同步火热筹备中,了解更多请戳:Sora时代,我们该如何关注新应用?一切尽在中国AIGC产业峰会

商务合作请联络微信:18600164356 徐峰

活动合作请联络微信:18801103170 王琳玉

点这里👇关注我,记得标星噢

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

模型合并就进化,直接拿下SOTA!Transformer作者创业新成果火了

 

Read More 

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)

文心AIGC

2024 年 3 月
 123
45678910
11121314151617
18192021222324
25262728293031
文心AIGC
文心AIGC
人工智能ChatGPT,AIGC指利用人工智能技术来生成内容,其中包括文字、语音、代码、图像、视频、机器人动作等等。被认为是继PGC、UGC之后的新型内容创作方式。AIGC作为元宇宙的新方向,近几年迭代速度呈现指数级爆发,谷歌、Meta、百度等平台型巨头持续布局
文章搜索
热门文章
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026 Jay 2025-12-22 09...
共推空天领域智能化升级!趋境科技与金航数码强强联手

共推空天领域智能化升级!趋境科技与金航数码强强联手

共推空天领域智能化升级!趋境科技与金航数码强强联手 十三 2025-12-09 18:18:41 来源:量子位...
起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机” 西风 202...
面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25 鹭羽 2025-12-13 22:37...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
最新评论
ufabet ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง
tornado crypto mixer tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.
ดูบอลสด ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
Obrazy Sztuka Nowoczesna Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.
ufabet ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
ufabet ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!
ufabet ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
热评文章
小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东

小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东

小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东 Jay 2025-12-09 08:26:01 来源...
梁文锋,Nature全球年度十大科学人物!

梁文锋,Nature全球年度十大科学人物!

梁文锋,Nature全球年度十大科学人物! 一水 2025-12-09 09:46:23 来源:量子位 来自安...
起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机” 西风 202...
摩尔线程新一代GPU架构10天后发布

摩尔线程新一代GPU架构10天后发布

摩尔线程新一代GPU架构10天后发布 思邈 2025-12-09 15:46:09 来源:量子位 国内首个聚焦...
极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」

极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」

极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」 henry 2...