DeepSeek 多模态深度实测,确实有东西的

0 阅读1分钟

昨天 DeepSeek 发布了 DeepSeek-V4-Flash-Vision-Exp,这标志着 DeepSeek 正式杀进了多模态领域。

所以嘛梁子,多模态还是很重要的。

在 DeepSeek Harness 的 webui 中,已经有 DeepSeek-V4-Flash-Vision-Exp 的模型了。

image-20260822063508954

在 DeepSeek-Harness Release 中,可以看到 v0.1.1-rc.1 更新了增加 DeepSeek-V4-Flash-Vision-Exp 模型的支持。

image-20260822064443305

那我们这篇文章就给大家实测一下,这个 DeepSeek-V4-Flash-Vision-Exp(目前只是试验品阶段)的模型能力到底如何,好不好用。

首先先让它分析一张照片把。

image-20260822064752905

首先来说,分析的速度非常快,基本上就是眨眼之间就分析完了,并且从五个角度给出了这张图片的解读。

image-20260822065231842

嗯,这个挑战对他来说可能不难,因为绝大多数多模态的模型都能够把一张图片认得又快又好。

在这个基础上我们增加了一些挑战。

image-20260822070326867

我让他分析一下这个是做什么的,这张图片分析起来就有一些难度了。

(这里需要吐槽一下,dsh webui 中的 command + c 、v 直接把图片复制过去的方式用起来很难受,它甚至无法正确工作)

image-20260822071913358

只有把图片拖过去,或者使用 @ 的方式能够正常工作。

DeepSeek-V4-Flash-Vision-Exp 没有识别出来这张图片真正的精髓。

这张图片的精髓在于漏出来的一点充电器头,看起来 DeepSeek-V4-Flash-Vision-Exp 看到了这个充电器头,但它没有认出是什么,更没有当回事。

image-20260822072311758

而这个图片测试,只有 gemini 识别的是最靠谱的,

image-20260822072943441

下面我要测试视觉模型的多模态推理能力:OCR(文字识别)、空间理解、数量统计、逻辑推理、时间推断、异常检测。

而不仅仅是图片理解的能力。

(看了一圈很多自媒体发的测评文章,简简单单识别个图,测一下是啥就完事儿了,测了个寂寞?本来模型具有 10 成的功力,测了不到 0.1 成。这不叫测试,这叫体验。。。)

以下测试基于三种难度,简单,中等和困难。

挑战一:侦探桌上的线索拼图

这张图表面看是一张桌面照片,但实际上隐藏了一条逻辑链。

根据图片内容,回答下面三个问题:

图片中有哪些人物?

主人今天有哪些安排?

根据所有线索,推断主人下午是否可能赶不上火车,并说明理由。

image-20260822074122472

测试完成,结果如下

image-20260822075258457

通过这次测试,可以看出 DeepSeek 已经具备多图片元素关联、时间线建立和主动发现矛盾,这已经超过了一般的视觉模型。

主要有两个问题,第一个是火车票

火车票当天确实是 14:15 从北京向南出发的,然后超市小票显示 17:56 他还在超市购物。

这里有问题,只靠小票无法证明人在超市,有可能这个小票是家人代买的,DeepSeek 把物品证据升级成为了人物位置证据,这是过度推理。

第二个是手机时间推理问题,手机时间 18:42,并且晚上 19:15 还有和阿磊吃饭安排,说明他当天仍在本地。只考手机时间不能证明人在本地。这说明它的不确定性判断和抗幻觉能力还有提升空间

挑战二:超市货架挑战

这次测试主要测密集目标识别 + OCR + 数学计算,这是视觉模型非常难的一类。

根据图片内容,回答下面三个问题:

哪个商品缺货?

货架上最贵商品是什么?

买这些商品需要多少钱?

image-20260822080531590

测试完成,结果如下:

image-20260822080837791

第二个测试结果整体比第一个更好,识别、统计、计算基本准确,没有明显幻觉问题

DeepSeek 在 OCR、商品统计和数学计算方面表现优秀,但对复杂场景推理的深度还不足;这张图属于结构化信息,难度较低,暂时没有暴露明显缺陷。

挑战三:车站信息

这次主要测试表格理解 + 空间导航 + 时间规划。

根据图片内容,回答下面三个问题

哪辆车最适合乘坐?

从售票处到 B1 检票口怎么走?

一个带老人和行李的人,现在在候车大厅,要赶 09:05 的车,应该如何规划路线?

这个 prompt 中的第三个问题属于高难问题了。

image-20260822081242165

测试完成,结果如下:

image-20260822094305898

第三题测试结果整体表现较好,但出现了比第二题更明显的空间推理过度发挥问题。

DeepSeek 能正确读取车次、时间、检票口,但对地图路径进行了过度脑补,把图片中没有明确的信息(如楼梯、电梯、方向距离)扩展成了真实导航建议。

例如上面提到的

优先走无障碍电梯/直梯,避免楼梯

然而图片里没有提供电梯位置、楼梯位置、无障碍设施,这是典型的补全现实场景。

还有从售票处出来后进入候车大厅,向大厅中央走,再沿大厅往南方向走到 B1-B10 区域,基本上符合地图布局,但“中央走”“往南方向”等属于推测,并非图片直接提供。

严谨一点的说法是:根据地图显示,B 检票区域位于候车大厅下方区域,需前往 B1-B10 区域。

挑战四:停车场

这个测试主要侧重于空间关系的理解能力,这也同属于视觉模型最难的一类。

根据图片内容,回答下面四个问题

A3 是否有车?

C1 EV 车位的白色车是否违规停车?

车辆 B5 应该如何驶出停车场?

找一个,靠近出口,非新能源区域,空闲的停车位置

image-20260822094919587

测试完成,结果如下

image-20260822102918700

值得一提的是,所有的测试都基于 DSH 极简模式,前三个测试基本上都可以做到几个 steps 直接分析完毕,而这个测试,DSH 跑了十几分钟。。。。。。做了 48 步。

image-20260822102954527

第四个测试结果表现很好,甚至比第三题更稳定,说明 DeepSeek 在规则明确的空间理解任务上能力较强。

不过,仍然存在脑补的现象。

目前四个题目测试下来,给大家总结一下测试结果。

image-20260822103308352

目前暴露出来的核心问题很一致

识别能力很强,结构化推理也很强,但涉及现实世界常识补全时容易想太多。

这不是 DeepSeek 的问题,这是大多数视觉大模型的通病。

需要注意的是,这次测试都是基于 DeepSeek-V4-Flash-Vision-Exp 的多模态推理能力。

DeepSeek 官方说的多样化的 Agent 使用场景,这块我还没测,如果大家比较喜欢看这类文章的话,后续我可以测一下。

跟大家说一下这次测试的花销,总共花了两块五,个人感觉还是非常香。

image-20260822151725034

我凌晨六点爬起来就开始写这篇文章了,一直写到现在。昨天文章有个读者问我累不累,能不累嘛 。。。