GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

1,292次阅读
没有评论

丰色 发自 凹非寺
量子位 | 公众号 QbitAI

Claude 3的竞技场排名终于来了:

短短3天内,20000张投票,将榜单的流量推向空前。

最终,Claude 3最强的“大杯”模型Opus得分1233,成为第一个能和GPT-4-Turbo一较高下的选手。

“中杯”Sonnet也还不错,和GPT-4的两个旧版本不相上下。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

不过总的来说,还是GPT-4系列占据上风。

Claude 3的表现和宣传有些许出入。如网友总结:

GPT-4还是大模型之王!

但,免费的“中杯”Claude 3(Sonnet)更物超所值。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

大模型竞技场出炉,“新王”排第三

Claude 3发布时官方的宣传是全面超过了GPT-4,但没提是哪个版本的GPT-4。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

竞技场榜单(LMSYS Chatbot Arena Leaderboard)的最新更新,帮咱摸清了。

来看详细情况。

排在第一名的是OpenAI去年11月推出的GPT-4 Turbo,也就是:

GPT-4-1106-preview

它功能更强价格也更便宜,具有128k上下文,训练数据从此前的2021年9月更新到2023年4月。

与它并列第一的是GPT-4 Turbo最新的版本,今年一月发布的:

GPT-4-0125-preview

它的训练数据更广,扩展到了2023年12月。

两者均取得了1251的分数。

接着才是Claude 3(训练数据截止到2023年8月)

它的最强版本Opus得分1233,比GPT-4 Turbo低了18分

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

这个差距相比起来不算太大,毕竟再往下看:

它比GPT-4的两个版本(0314、0613)分别高了48分、72分

至于中等性能的Claude 3 Sonnet,则排名第6,位于GPT-4这两个版本之间:

不过只比0314版低5分,大有潜力一举超越。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

所以总的来说,官方宣传的也算没大毛病,全面超越老版GPT-4,但离GPT-4 Turbo还有点距离,尽管不算太大。

——从此榜单的评比机制等情况来看,它的结果还是相当有业内认可度的。

它由“小羊驼”(Vicuna)的作者团队发起。

但裁判官不是“小羊驼”,更不是GPT-4,而是基于人类偏好。

详细来说,也就我们随机向两个匿名模型提出任意问题,然后评价它们各自的回答,把票投给更好的那一个。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

如果一轮投不出,咱可以选择继续提问。如果聊天中模型不小心透露了自己的身份,投票则作废。

特别的,计分规则采用Elo机制来保证公平(玩王者荣耀的朋友都熟)

举个例子:如果某个模型输了,但它的分数不一定低,因为它本身实力就弱,这是预料之中。

截止目前,这个榜单可以说是非常火爆,已经有全球73个模型参与挑战,共收到了网友们37万张+投票。

通义千问挤进前10

除了Claude 3,我们再看看其他表现亮眼的选手。

首先要提的就是基于Gemini Pro的Bard,排名第四,仅次于GPT-4Turbo和Claude 3。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

可以说是有点让人惊喜。

网友戏谑:

谷歌这是生生在在排行榜上开了个“洞”啊。

并连忙艾特JeffDean和DeepMind负责人:喂,加把劲儿啊(旺柴)

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

然后要说的就是阿里通义千问(1.5版本,上个月发布)

它在本次排名中挤进了前十、并列第九,是国内选手中表现最好的。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

被它甩在身后的,除了其他国产选手,还有Claude 2、Gemini Pro和GPT-3.5等等。

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

完整榜单:
https://huggingface.co/spaces/lmsys/chatbot-arena-leaderboard
参考链接:
https://twitter.com/lmsysorg/status/1765774296000172289

报名中!

2024年值得关注的AIGC企业&产品

量子位正在评选2024年最值得关注的AIGC企业、 2024年最值得期待的AIGC产品两类奖项,欢迎报名评选

评选报名截至2024年3月31日 GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

中国AIGC产业峰会同步火热筹备中,了解更多请戳:Sora时代,我们该如何关注新应用?一切尽在中国AIGC产业峰会

商务合作请联络微信:18600164356 徐峰

活动合作请联络微信:18801103170 王琳玉

点这里👇关注我,记得标星噢

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见 ~ 

GPT-4王冠没掉!Claude 3竞技场人类投票成绩出炉:仅居第三

 

Read More 

正文完
可以使用微信扫码关注公众号(ID:xzluomor)
post-qrcode
 0
评论(没有评论)

文心AIGC

2024 年 3 月
 123
45678910
11121314151617
18192021222324
25262728293031
文心AIGC
文心AIGC
人工智能ChatGPT,AIGC指利用人工智能技术来生成内容,其中包括文字、语音、代码、图像、视频、机器人动作等等。被认为是继PGC、UGC之后的新型内容创作方式。AIGC作为元宇宙的新方向,近几年迭代速度呈现指数级爆发,谷歌、Meta、百度等平台型巨头持续布局
文章搜索
热门文章
潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026

潞晨尤洋:日常办公没必要上私有模型,这三类企业才需要 | MEET2026 Jay 2025-12-22 09...
共推空天领域智能化升级!趋境科技与金航数码强强联手

共推空天领域智能化升级!趋境科技与金航数码强强联手

共推空天领域智能化升级!趋境科技与金航数码强强联手 十三 2025-12-09 18:18:41 来源:量子位...
起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机” 西风 202...
面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25

面向「空天具身智能」,北航团队提出星座规划新基准丨NeurIPS’25 鹭羽 2025-12-13 22:37...
5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级

5天连更5次,可灵AI年末“狂飙式”升级 思邈 2025-12-10 14:28:37 来源:量子位 让更大规...
最新评论
ufabet ufabet มีเกมให้เลือกเล่นมากมาย: เกมเดิมพันหลากหลาย ครบทุกค่ายดัง
tornado crypto mixer tornado crypto mixer Discover the power of privacy with TornadoCash! Learn how this decentralized mixer ensures your transactions remain confidential.
ดูบอลสด ดูบอลสด Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Pretty! This has been a really wonderful post. Many thanks for providing these details.
ดูบอลสด ดูบอลสด Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
Obrazy Sztuka Nowoczesna Obrazy Sztuka Nowoczesna Thank you for this wonderful contribution to the topic. Your ability to explain complex ideas simply is admirable.
ufabet ufabet Hi there to all, for the reason that I am genuinely keen of reading this website’s post to be updated on a regular basis. It carries pleasant stuff.
ufabet ufabet You’re so awesome! I don’t believe I have read a single thing like that before. So great to find someone with some original thoughts on this topic. Really.. thank you for starting this up. This website is something that is needed on the internet, someone with a little originality!
ufabet ufabet Very well presented. Every quote was awesome and thanks for sharing the content. Keep sharing and keep motivating others.
热评文章
小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东

小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东

小冰之父李笛智能体创业,公司取名Nextie!陆奇是股东 Jay 2025-12-09 08:26:01 来源...
梁文锋,Nature全球年度十大科学人物!

梁文锋,Nature全球年度十大科学人物!

梁文锋,Nature全球年度十大科学人物! 一水 2025-12-09 09:46:23 来源:量子位 来自安...
起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机”

起底“豆包手机”:核心技术探索早已开源,GUI Agent布局近两年,“全球首款真正的AI手机” 西风 202...
摩尔线程新一代GPU架构10天后发布

摩尔线程新一代GPU架构10天后发布

摩尔线程新一代GPU架构10天后发布 思邈 2025-12-09 15:46:09 来源:量子位 国内首个聚焦...
极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」

极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」

极客公园创新大会 2026在京落幕,罗永浩、张楠、何小鹏、刘靖康等共议 AI 时代「进程由我」 henry 2...