本期汇总各个大模型综合能力的评测数据,综合能力得分类目为:医疗、教育、金融、法律、行政公务、心理健康、推理与数学计算、语言与指令遵从共8个领域得分的平均值。同时,大模型的通用能力、垂直行业应用等领域不同类型、不同阶段、不同维度的评测,都在爆肝输出中,敬请期待。
#公众号:【大模型评测EasyLLM】,欢迎交流!!!
完整评测题集及结果详见:github.com/jeinlee1991…
我们的目标是: 通过评测为大家透视化呈现,各个大模型的能力边界,以支持大家高效使用!
以下是本期107个大模型的评测综合得分和排名,以及涉及推理、商用、开源、价格、参数量等不同细分类型和维度的大模型排行榜。 目录如下: 一、综合能力排行榜(图) 1.1 推理类模型排行榜(表) 1.2 商用大模型排行榜(含开源模型的付费API) (1)输出价格30元及以上(表) (2)输出价格5-30元(表) (3)输出价格1-5元(表) (4)输出价格1元以下(表) 1.3 开源大模型排行榜 (1)5B以下(表) (2)5B-20B(表) (3)20B以上(表)
完整评测题集及结果详见:github.com/jeinlee1991…
#公众号:【大模型评测EasyLLM】,欢迎交流!!!
一、综合能力排行榜(图)绿色(闭源),蓝色(开源)完整评测题集及结果详见:github.com/jeinlee1991…
推理类模型排行榜完整评测题集及结果详见:github.com/jeinlee1991…
1.2 商用大模型排行榜(含开源模型的付费API)(1)输出价格30元及以上(2)输出价格5-30元
(3)输出价格1-5元
(4)输出价格1元以下
完整评测题集及结果详见:github.com/jeinlee1991…
1.3 开源大模型排行榜(1)5B以下(2)5B-20B
(3)20B以上
完整评测题集及结果详见:github.com/jeinlee1991…
教育行业|小学至高中3个阶段、9个学科、110个大模型应用实测!
那些免费的大模型API效果到底好不好?——CLiB大模型排行榜
#公众号:【大模型评测EasyLLM】,欢迎交流!!!
关于【大模型评测EasyLLM】
- 最全——全球最全大模型产品评测平台,已囊括203个大模型
- 最新——月更各个大模型各项能力指标评测,输出排行榜
- 最方便——无需注册/梯子,国内外各个大模型可一键评测
- 结果可见——所有大模型评测的方法、题集、过程、得分结果,可见可追溯!
- 错题本——百万级大模型错题本
大模型评测EasyLLM目前已囊括203个大模型,覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型, 以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。不仅提供能力评分排行榜,也提供所有模型的原始输出结果!
完整评测题集及结果详见:github.com/jeinlee1991…
#公众号:【大模型评测EasyLLM】,欢迎交流!!!