大模型评测【综合能力篇】｜8大领域、107个大模型实测横评-综合能力排行榜04.01本期汇总各个大模型综合能力的评测数据

本期汇总各个大模型综合能力的评测数据，综合能力得分类目为：医疗、教育、金融、法律、行政公务、心理健康、推理与数学计算、语言与指令遵从共8个领域得分的平均值。同时，大模型的通用能力、垂直行业应用等领域不同类型、不同阶段、不同维度的评测，都在爆肝输出中，敬请期待。

#公众号：【大模型评测EasyLLM】，欢迎交流！！！

完整评测题集及结果详见：github.com/jeinlee1991…

我们的目标是： 通过评测为大家透视化呈现，各个大模型的能力边界，以支持大家高效使用！

以下是本期107个大模型的评测综合得分和排名，以及涉及推理、商用、开源、价格、参数量等不同细分类型和维度的大模型排行榜。目录如下：一、综合能力排行榜（图） 1.1 推理类模型排行榜（表） 1.2 商用大模型排行榜（含开源模型的付费API）（1）输出价格30元及以上（表）（2）输出价格5-30元（表）（3）输出价格1-5元（表）（4）输出价格1元以下（表） 1.3 开源大模型排行榜（1）5B以下（表）（2）5B-20B（表）（3）20B以上（表）

完整评测题集及结果详见：github.com/jeinlee1991…
#公众号：【大模型评测EasyLLM】，欢迎交流！！！

一、综合能力排行榜（图）绿色（闭源），蓝色（开源）完整评测题集及结果详见：github.com/jeinlee1991…

推理类模型排行榜完整评测题集及结果详见：github.com/jeinlee1991…

1.2 商用大模型排行榜（含开源模型的付费API）（1）输出价格30元及以上（2）输出价格5-30元（3）输出价格1-5元（4）输出价格1元以下完整评测题集及结果详见：github.com/jeinlee1991…

1.3 开源大模型排行榜（1）5B以下（2）5B-20B（3）20B以上完整评测题集及结果详见：github.com/jeinlee1991…

往期文章
法律行业｜律师资格考试，108个大模型应用实测！

教育行业｜小学至高中3个阶段、9个学科、110个大模型应用实测！

医疗行业｜110个大模型，12个分类、18科目应用实测！

那些免费的大模型API效果到底好不好？——CLiB大模型排行榜

DeepSeek｜到底强在哪？这个评测一目了然！

推理类大模型排行榜03.03

#公众号：【大模型评测EasyLLM】，欢迎交流！！！

关于【大模型评测EasyLLM】

最全——全球最全大模型产品评测平台，已囊括203个大模型
最新——月更各个大模型各项能力指标评测，输出排行榜
最方便——无需注册/梯子，国内外各个大模型可一键评测
结果可见——所有大模型评测的方法、题集、过程、得分结果，可见可追溯！
错题本——百万级大模型错题本

大模型评测EasyLLM目前已囊括203个大模型，覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型，以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。不仅提供能力评分排行榜，也提供所有模型的原始输出结果！
完整评测题集及结果详见：github.com/jeinlee1991…

#公众号：【大模型评测EasyLLM】，欢迎交流！！！