6月17日记者获悉,由北京智源研究院(以下简称智源)打造的FlagEval天秤大模型评测平台实现了全面升级,并公布202406期FlagEval模型评测排行榜单。最新一期榜单显示,百度文心大模型、字节跳动“云雀”和“豆包”大模型的综合评分在闭源对话模型中位列前三,GPT-4o、百川、零一万物、kimi等紧随其后。
智源FlagEval榜单截图。 来源:智源
据了解,FlagEval天秤大模型评测平台是北京智源研究院推出的开放的大模型评测体系,自2023年发布以来,该评测平台已从主要面向语言模型扩展到视频、语音、多模态模型,实现多领域全覆盖,目前已评测国内外 300 余个开源和商业闭源的语言及多模态大模型。资料显示,FlagEval大语言模型评测体系当前包含6大评测任务,近30个评测数据集,超10万道评测题目。6月的评测结果显示,在中文语境下,文心大模型等国内头部语言模型的综合表现出色。
就在上周,国际数据公司(IDC)发布的《中国大模型市场主流产品评估,2024》中,百度文心一言、阿里通义千问和OpenAI GPT-4等也位于第一梯队,其中,百度是唯一一家在问答理解类、推理类、创作表达类、数学类、代码类的基础能力,toC通用场景类、toB特定行业类的应用能力等7个维度上均为“优势厂商”的企业。阿里获6项优势维度,OpenAI GPT-4和商汤分获5项。
截图自IDC《中国大模型市场主流产品评估,2024》。
岁月不居,时节如流。转眼间,2023年已步入尾声。这一年给我们留下了太多值得铭记的精彩时刻:我国科学家成功制备并验证5 流感、肺炎支原体、新型冠状病毒、呼吸道合胞病毒等病原体在这个冬天叠加来袭,让国内医疗机构的发热门诊、儿科门诊异常 12月19日,山东先进制造业人力资源服务供需对接活动在济南举办,活动由山东省人力资源和社会保障厅、山东产业技术研究 12月16日,首届多尺度材料计算模拟国际研讨会在北京召开,来自国内外100多位专家学者共同探讨材料计算领域的研究成果和 ·“这项研究似乎说明,长期生活在食品不安全的状况中所带来的危害是没那么容易逆转的。研究也表明,对于那些因 ? 肖连团 ? 番兴明 ? 陈 勇 ? 马 洁(以上照片均为受访者提供) ? 数据来源:科技部、国 。本文链接:IDC、智源最新一期大模型评测结果出炉http://www.sushuapos.com/show-11-7354-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 中国科大人工智能与人形机器人前沿论坛举行