医疗行业|110个大模型,12个分类、18科目应用实测!

51 阅读3分钟

书接上回的考公评测,本期安排上了应用于医疗行业的大模型能力评测,涉及12大分类、18个科目。同时,医疗领域不同类型、不同级别、不同科目的评测,都在爆肝输出中,敬请期待。

WechatIMG942.jpg

一、评测结论:百度系最新大模型得分第一!,腾讯系混元大模型排名第二,DeepSeek排名第七,和腾讯系模型是排名前10中唯二的开源模型。

二、评测维度:针对医疗行业的各类考试的选择题进行评测,囊括12大分类,18个科目:外科、皮肤科、妇产科、耳鼻咽喉科、神经内科、儿科、麻醉科、小儿外科、眼科、临床病理科、超声科、康复医学科、骨科、内科、口腔科、医学影像科、全科医学科、精神科。

各科目完整评测题集及结果详见:github.com/jeinlee1991…

三、评测方法:结合以上医疗类目考试的选择题,分别让各个大模型进行回答,根据结果进行打分,并统计每个模型的答题准确率。

*评测综合得分排名(图)|绿色(闭源),蓝色(开源)图片完整评测题集及结果详见:https://github.com/jeinlee1991/chinese-llm-benchmark


大模型评测EasyLLM,目前已就DeepSeek和各个大模型的不同能力维度进行了综合评测(详情可回顾以下链接👇),接下来还会针对大模型当律师、医生、老师等各个岗位角色进行测评,看看谁是各个垂直领域的最强打工人!宝子们看好哪个大模型可以在哪些岗位胜任最强牛马?或者想评测大模型的哪方面能力?评论区留言,有求必测,一一公布结果!有评测样本、有图有真相!图片
往期文章  
Llama/Qwen/DeepSeek开源之争——CLiB开源大模型排行榜03.04那些免费的大模型API效果到底好不好?——CLiB大模型排行榜参数量5B以下端侧大模型03.13——CLiB大模型排行榜DeepSeek|到底强在哪?这个评测一目了然!


  关于大模型评测EasyLLM  

  1. 最全——全球最全大模型产品评测平台,已囊括203个大模型
  2. 最新——月更各个大模型各项能力指标评测,输出排行榜
  3. 最方便——无需注册/梯子,国内外各个大模型可一键评测
  4. 结果可见——所有大模型评测的方法、题集、过程、得分结果,可见可追溯!

大模型评测EasyLLM目前已囊括187个大模型,覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型, 以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。不仅提供能力评分排行榜,也提供所有模型的原始输出结果!
完整评测题集及结果详见:github.com/jeinlee1991…


关注我们,后台发送ds或者deepseek,免费领取《DeepSeek从入门到精通》精华版学习资料、以及DeepSeek核心技术论文资料压缩包!!!图片