金磊西风发自凹非寺

量子位 | 公众号 QbitAI

家人们，大模型圈儿出了个惊天大瓜——

斯坦福AI团队，竟然曝出了抄袭事件，而且抄袭的还是中国国产的大模型成果——模型结构和代码，几乎一模一样！跟任何抄袭事故一样……AI圈内都惊呆了。

斯坦福的这项研究叫做Llama3-V，是于5月29日新鲜发布，宣称只需要500美元就能训出一个SOTA多模态大模型，比GPT-4V、Gemini Ultra、Claude Opus都强。

Llama3-V的3位作者或许是拥有名校头衔加持，又有特斯拉、SpaceX的大厂相关背景，这个项目短短几天就受到了不小的关注。

甚至一度冲上了HuggingFace趋势榜首页：

然而，戏剧性的一幕开始上演了。

有位细心的网友发现，咦？这“配方”怎么如此的熟悉？

然后他定睛一看，好家伙，这不就是MiniCPM-Llama3-V 2.5（出自清华系明星创业公司面壁智能）嘛。

于是这位网友便跑到面壁智能GitHub项目下开始爆料了：

你们家大模型被斯坦福团队抄袭了！

并且他还附上了一堆的证据，最直接的莫过于这张2个模型代码的对比图了：

Emmm……用这位网友的话来说就是：

模型结构、代码、配置文件，简直一模一样，只是变量名变了而已。

至于为什么这位网友要跑到面壁智能GitHub项目下面留言，是因为他之前已经给Llama3-V作者留过言了，但斯坦福团队的做法竟是删库跑路……

没错，现在不论是GitHub还是HuggingFace，统统都是404：

并且这事现在还在持续发酵的过程中，网上吃瓜的群众也是越来越多。

那么我先来一同回顾一下这件drama事情的始末。

“代码和架构一模一样”

正如刚才所述，一个网友爆料Llama3-V抄袭MiniCPM-Llama3-V 2.5，跑到面壁智能的GitHub主页提醒团队注意，并把关键证据都一一截图列举整理了下来，这才有了整个抄袭门的还原现场。

以下是来自这位网友的证据。

证据一，Llama3-V的模型架构和代码与MiniCPM-Llama3-V 2.5几乎完全相同：

看下面的例子，配置文件就改了图像切片、分词器、重采样器和数据加载等格式化和变量名：

Llama3-V作者表示参考了LLaVA-UHD架构，在ViT和LLM等选择上有一些差异。但实际上，网友发现他们的具体实现在空间模式等很多方面都与LLaVA-UHD不同，却出奇与MiniCPM-Llama3-V 2.5一致。

甚至，Llama3-V还用了MiniCPM-Llama3-V 2.5的分词器，连MiniCPM-Llama3-V 2.5定义的特殊符号都能“巧合”实属离谱。

证据二，网友质疑Llama3-V作者是如何在MinicPM-Llama3-V2.5项目发布之前就使用上MinicPM-Llama3-V2.5分词器的。

Llama3-V作者给的回复是这样婶儿的，说是用的面壁智能上一代MinicPM-V-2项目的：

但事实却是，HuggingFace中，MiniCPM-V2与MiniCPM-Llama3-V 2.5分词器分别是两个文件，文件大小也完全不同。

MiniCPM-Llama3-V 2.5的分词器是用Llama3分词器加上MiniCPM-V系列模型的特殊token组成，而MiniCPM-V2的发布都在Llama3开源之前，怎么会有Llama3分词器。

证据三，Llama3-V作者随后无故删除了网友在Llama3-V页面上提交的质疑他们抄袭的问题。

而且，他们似乎对MiniCPM-Llama3-V 2.5架构或他们自己的代码都不完全了解。

感知器重采样器（Perceiver resampler）是单层交叉注意力，而不是双层自注意力。但是下图所示Llama3-V的技术博客里作者的理解很明显是错的。

SigLIP的Sigmoid激活也不用于训练多模态大语言模型，而仅用于预训练SigLIP。

视觉特征提取不需要Sigmoid激活：

基于以上三点事实，这位网友认为足以证据证明Llama3-V项目窃取了MiniCPM-Llama3-V 2.5项目的学术成果。

但还没完，他随后又补充了两点证据。

几天前，当这位网友尝试运行Llama3-V时，发现他们提供的代码无法与HuggingFace的checkpoint一起使用，反馈问题没有得到作者回复。

于是网友把从HuggingFace下载的Llama3-V模型权重中的变量名改成了MiniCPM-Llama3-V 2.5的，惊奇发现模型居然可以用MiniCPM-V代码成功运行。

此外，如果将高斯噪声（由单个标量参数化）添加到MiniCPM-Llama3-V 2.5的checkpoint，结果就是会得到一个行为与Llama3-V极其相似的模型。

收到网友的提醒后，MiniCPM-Llama3-V 2.5团队这边也迅速展开了调查，他们按照网友的在GitHub上的说明，使用 Llama3-V的checkpoint和MiniCPM-Llama3-V 2.5的代码和配置文件正确获取了推理结果。

于是，一个更为关键性的证据出现了。

Llama3-V在一些未公开的实验性特征上表现出与MiniCPM-Llama3-V 2.5高度相似的行为，而这些特征是根据MiniCPM-Llama3-V 2.5团队内部数据训练的。

例如，识别清华简！

MiniCPM-Llama3-V 2.5特有的功能之一是识别清华简，这是一种非常罕见、于战国时期写在竹子上的中国古代文字。

训练图像是从最近出土的文物中扫描出来的，由MiniCPM-Llama3-V 2.5团队进行了标注，尚未公开发布。

而Llama3-V的识别情况和MiniCPM-Llama3-V 2.5极为相似。

识别错误的情况竟也出奇一致：

MiniCPM-Llama3-V 2.5团队还在1000 张竹简图像上测试了几种基于Llama3的视觉-语言模型，并比较了每对模型的预测精确匹配。

结果，每两个模型之间的重叠为零，而Llama3-V和MiniCPM-Llama3-V 2.5之间的&&重叠达到了惊人的87%**。

此外，MiniCPM-Llama3-V 2.5和Llama3-V甚至具有相似的错误分布。Llama3-V和MiniCPM-Llama3-V 2.5分别做出 236和194个错误预测，重叠部分为182个。

且按照网友在GitHub上的指令获得的MiniCPM-Llama3-V2.5-noisy显示出与Llama3-V几乎相同的定量结果，真令人匪夷所思……

在另一个MiniCPM-Llama3-V 2.5内部数据上训练的未公开功能——WebAgent上，也出现了同样的情况。

Llama3-V甚至和MiniCPM-Llama3-V 2.5团队新定义的WebAgent模式中犯的错误都一样。

鉴于这些结果，MiniCPM-Llama3-V 2.5团队表示很难将这种不寻常的相似性解释为巧合，希望Llama3-V作者能对这个问题给出一个正式的解释。

斯坦福团队已删库跑路

虽然斯坦福的2位本科生已经下架了几乎所有与之相关的项目，但其实在此之前，他们最初在面对质疑的时候还是做出了些许的解释。

例如他们强调，Llama3-V这项工作的时间是要早于面壁智能的MiniCPM，只是使用了他们的tokenizer。

不过作者对Medium上的声明还是做了保留：

非常感谢那些在评论中指出与之前研究相似之处的人。

我们意识到我们的架构非常类似于OpenBMB的“MiniCPM-Llama3-V 2.5，他们在实现上比我们抢先一步。

我们已经删除了关于作者的原始模型。

对此，一部分网友表示，既然选择删掉项目，那么就表示确实存在一定的问题。

不过另一方面，对于抄袭这事也有不一样的声音——

MiniCPM-Llama3-V 2.5不也是在Llama3的基础上做的改良吗？不过连tokenizer都直接拿来用就应该不算是借鉴了。

而就在刚刚，另一个戏剧性的事情发生了。

斯坦福的作者在中午时间做出了最新的回应：

但现在……这条回应又删掉了

而面壁智能这边，CEO李大海也做出了正式回应：

参考链接：
[1]https://github.com/OpenBMB/MiniCPM-V/issues/196
[2]https://github.com/mustafaaljadery/Llama3-V
[3]https://www.reddit.com/r/LocalLLaMA/comments/1d6f1f3/Llama3-V_project_is_stealing_a_lot_of_academic/
[4]https://www.reddit.com/r/LocalLLaMA/comments/1d6f1f3/Llama3-V_project_is_stealing_a_lot_of_academic/?rdt=41696&onetap_auto=true&one_tap=true
[5]https://aksh-garg.medium.com/llama-3v-building-an-open-source-gpt-4v-competitor-in-under-500-7dd8f1f6c9ee

2024 年 6 月
一	二	三	四	五	六	日
	1	2
3	4	5	6	7	8	9
10	11	12	13	14	15	16
17	18	19	20	21	22	23
24	25	26	27	28	29	30

ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง

tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.

ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.

ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.

ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.

Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.

ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.

ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!

ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.

斯坦福团队被曝抄袭清华系大模型，已删库跑路，创始人回应：也算国际认可

“代码和架构一模一样”

斯坦福团队已删库跑路

小说创作

清库存！DeepSeek突然补全R1技术报告，训练路径首次详细公开

训具身模型遇到的很多问题，在数据采集时就已经注定了丨鹿明联席CTO丁琰分享

「北京版幻方」冷不丁开源SOTA代码大模型！一张3090就能跑，40B参数掀翻Opus-4.5和GPT-5.2

AI金矿上打盹的小红书，刚刚醒了一「点点」

字节Seed：大概念模型来了，推理的何必是下一个token

海信CES发布全新一代RGB-Mini LED，全球首创玲珑4芯真彩背光

英特尔CES奇袭老黄大本营！英伟达显卡刚涨价，最强酷睿量产出货

陈天桥代季峰打响2026大模型第一枪：30B参数跑出1T性能

OpenAI推理第一人离职，7年打造了o3/o1/GPT-4/Codex

文心AIGC