阿里Qwen2.5-Max超DeepSeek V3!又一国产大模型海外出圈

Qwen2.5-Max在最新一期的Chatbot Arena LLM Leaderboard中冲进前十,位列全球第七名,超越了DeepSeek V3、o1-mini和Claude-3.5-Sonnet等模型。它在数学和编程方面排名第一,在Hard prompts方面排名第二。

摘要

Qwen2.5-Max是由阿里云通义团队开发的最新MoE模型,在多个主流基准测试中表现强劲,如Arena-Hard、LiveBench、LiveCodeBench等,几乎全面超越了GPT-4o、DeepSeek-V3及Llama-3.1-405B。

Chatbot Arena是由LMSYS Org推出的大模型性能测试平台,集成了190多种模型。该平台通过匿名方式将大模型两两组队,让用户进行盲测并投票,因此成为全球顶级大模型的重要竞技场。

企业可以在阿里云百炼调用Qwen2.5-Max模型的API,开发者也可以在Qwen Chat平台中免费体验。阿里云旗下的通义千问已实现全尺寸、全模态的开源,推出了多种类型的开源模型。Qwen的衍生模型数量已超9万个,成为全球最大的开源模型群。

Qwen2.5-Max发布后在海外开发者中引发广泛关注,许多网友对其出色表现表示赞扬,甚至有人认为其性能足以替代ChatGPT。阿里云通义团队表示将继续提升模型性能,探索预训练和强化学习的规模化发展,以实现超越人类的智能。

2月4日凌晨,Chatbot Arena LLM Leaderboard更新了最新一期的榜单,不久前发布的Qwen2.5-Max直接冲进前十,超越DeepSeek V3、o1-mini和Claude-3.5-Sonnet等模型,以1332分位列全球第七名!同时,Qwen2.5-Max在数学和编程上排名第一,在Hard prompts方面排名第二。

Qwen-Max是阿里云通义团队对MoE模型的最新探索成果,新模型展现出极强劲的综合性能。在Arena-Hard、LiveBench、LiveCodeBench、GPQA-Diamond及MMLU-Pro等主流基准测试中,Qwen2.5-Max比肩Claude-3.5-Sonnet,并几乎全面超越了GPT-4o、DeepSeek-V3及Llama-3.1-405B。

ChatBot Arena官方账号 lmarena.ai 对其评价称,阿里巴巴的Qwen2.5-Max在多个领域表现强劲,特别是在专业技术向的(编程、数学、有难度的提示词等)方面。

据了解,Chatbot Arena是由LMSYS Org推出的大模型性能测试平台,目前集成了190多种模型。该榜单采用匿名方式将大模型两两组队,交给用户进行盲测,用户根据真实对话体验对模型能力进行投票。因此Chatbot Arena LLM Leaderboard成为全球顶级大模型的最重要竞技场。

此前,Qwen2.5-72B-Instruct发布后也曾闯入Chatbot Arena榜单全球前十,是得分较高的中国大模型;Qwen2-VL-72B-Instruct闯入Vision榜单第九,是成绩优异的开源模型。

目前,企业可在阿里云百炼调用Qwen2.5-Max模型的API,开发者也可在Qwen Chat平台中免费体验Qwen2.5-Max。

Qwen2.5-Max发布后,在海外开发者中引发了大量关注。有网友在对比DeepSeek-V3 和 Qwen 2.5后,高度赞扬了Qwen2.5-Max的出色表现。

还有网友打趣地为OpenAI的首席执行官Sam Altman担忧:又一个中国模型来了。

不少海外网友表示,中国新模型的迭代速度和质量令人惊艳。

作为国内较早开源自研大模型的科技大厂,阿里云旗下的通义千问已实现全尺寸、全模态的开源,推出了包括语言大模型、多模态大模型等多种类型的开源模型。

在全球范围内,Qwen的衍生模型数量超9万个,已超越Llama成为全球更大的开源模型群。此次Qwen2.5-max的发布,亦备受全球各种语言的开发者的欢迎。

“有了Qwen2.5-max,我们能对ChatGPT说再见了?!”有使用阿拉伯语的网友如是说。

多名海外网友用英文表达了对Qwen2.5-max极致性能的惊叹。

通义团队方面表示,持续提升数据规模和模型参数规模能够有效提升模型的智能水平。通义团队对下一个版本的Qwen2.5-Max充满信心,也将持续探索,除了在预训练的scaling 上继续探索外,还将大力投入强化学习的scaling,希望能实现超越人类的智能,驱动AI探索未知之境。

本文源自「私域神器」,发布者:siyushenqi.com,转载请注明出处:https://www.firethy.com/32848.html

(0)
打赏 微信扫一扫 微信扫一扫 支付宝扫一扫 支付宝扫一扫
上一篇 5天前
下一篇 5天前

相关推荐

发表回复

登录后才能评论
联系我们

联系我们

+86 132-7601-9273

在线咨询: QQ交谈

邮件:siyushenqi@gmail.com

工作时间:周一至周日 9:00-18:30

添加微信
添加微信
WhatsApp Telegram email Email
分享本页
返回顶部

私域神器:一站式全网全渠道拓客营销软件
销售热线:173 5412 3667 (←点击添加微信)