闭源对话模型榜单突变!最新第一名竟是它

闭源对话模型榜单突变!最新第一名竟是它

类别:职场资讯 时间:2026-01-06 浏览:
FlagEval天秤大模型评测平台完成升级并发布202406榜单,覆盖多模态与多领域评测。榜单显示某闭源对话模型以89.72综合评分居首,其他模型紧随;IDC报告亦给出主流产品多维评估结果与市场表现。

近日,由北京智源研究院打造的FlagEval天秤大模型评测平台实现了全面升级,并公布202406期FlagEval模型评测排行榜单。最新一期榜单显示,百度文心大模型4.0以89.72的综合评分在闭源对话模型中排名第一。

闭源对话模型榜单突变!最新第一名竟是它(图1)

FlagEval大语言模型评测能力榜单官网截图

FlagEval天秤大模型评测平台是智源研究院推出的科学、权威、公正、开放的大模型评测体系,自2023年发布以来,已从主要面向语言模型扩展到视频、语音、多模态模型,实现多领域全覆盖,目前已评测国内外300余个开源和商业闭源的语言及多模态大模型。资料显示,FlagEval大语言模型评测体系当前包含6大评测任务,近30个评测数据集,超10万道评测题目。

闭源对话模型榜单突变!最新第一名竟是它(图2)

FlagEval大语言模型评测能力榜单官网截图

从榜单中可以看到,百度文心大模型4.0以89.72的综合评分在闭源对话模型中排名第一,云雀2-Pro、豆包、GPT-4o分别位居二三四位,百川、零一万物、kimi等追随其后。

日前,国际数据公司IDC发布的《中国大模型市场主流产品评估,2024》中,百度同样位于第一梯队。评测显示,百度旗下生成式AI产品文心一言和文心一格在问答理解类、推理类、创作表达类、数学类、代码类的基础能力,toC通用场景类、toB特定行业类的应用能力等7大维度均具备领先优势。其他评测厂商中,阿里获6项优势维度,OpenAI GPT-4和商汤分获5项。

闭源对话模型榜单突变!最新第一名竟是它(图3)

IDC《中国大模型市场主流产品评估,2024》

公开资料显示,2023年10月,百度文心大模型4.0正式发布,实现了基础模型的全面升级,在理解、生成、逻辑和记忆能力上明显提升。截至目前,文心一言累计用户规模已达2亿,日均调用量也达到了2亿。

(本文来源东方财富网,如有侵权请联系删除)

相关推荐

©2025 职聘优选 版权所有

网站备案号: 沪ICP备2025136253号