我也是闲起来了,什么模型都敢测了!~
Opus5.5 还在干活,刷到 OpenCode 上有两个免费模型。
image-20260928124028642
一个是美团的 LongCat2.5,一个是匿名模型。既然免费,我就抽空跑了几个例子。
今天主要给大家看下 LongCat2.5 的效果!
exec-4bee8e71-43d5-4447-99d9-22d73d77a9b3
其实很早之前就有人叫我测一测了,刚发的时候它们也是搞过一波流量的。但是我有一种预感,不管别人怎么说,这个模型大概率是个“玩具”,并不会太好!
当然,没测过,就给人家判了,这样不是太好。所以我之前也没提过这个模型!
今天我测完了,也算是有一定的发言权了!
大家如果对这个模型很好奇,那么一起来开盒看一看!
先看一些背景资料:
这是官推的内容,主要是说免费两周,在 OpenCode 上面!
这也是一个 1M 上下文的多模态模型!
除此之外还没有其他具体的信息。
我找了一份 2.0 版本的基准数据:
大概就是这个样子吧!
当时这个版本参考对象还停留在 Opus 4.7 左右! 当然大家还要考虑水分。
现在是 2.5,估计会对标 Opus 5 系列!
其他我就不多说了,我尽量收住我的嘲讽技能,保持假日的愉快心情来写这篇文章吧。
主要是让对这个模型感兴趣的人,大致了解一下这个模型的水平!
我主要是测了四个例子,然后就没有往后测,因为这四个例子“太惊艳”了,已经惊掉我的下巴,没必要往后测了!
它为我的假期带来了很多欢乐。
赛博清明上河图!
先来看第一个例子:
整个过程只用了 3 分钟,这速度是真的贼快。
输出内容也是非常简洁,没有任何纠错、检查、修改的信息。就是一轮搞定,直接交差。
然后我们来看一下结果:
这个结果嘛,也是“抽象”到了极致!
日至今日,几乎所有模型,都能做得像模像样了 。想HY4,STEP5这这种效果都做的不错了。 langcat2.5这个结果,我是在是不知道用什么词来描述了。
“豆姐”看了都兜不住!
天文机械表
继续测试:
结果如下:
哈哈哈,这是“惊艳”之作。
最核心的表盘和指针都没画好,那么没必要去看其他方面了。
如果这个题目是100分满分,它可以成功拿到10分。
这个例子是它花的时间最多的,用了 6 分钟。
然后它只生成了代码,没有写入文件。就像一个 chat 模型一样,完全感受不到 Agentic的能力!
绝了👍!
游戏复刻
按照惯例复刻一下经典游戏坦克大战和超级玛丽!
坦克大战的效果如下:
超级玛丽的效果如下:
两个游戏都是黑屏无法启动!
这个效果实在是太“惊艳”了,我再次陷入了...词穷的境地。
我提示词里面清清楚楚地说了,允许参考网络攻略和 GitHub 代码。
然后它只花了 3 分钟,直接交差!
😁😁😁
平时我一篇测评大概 3000 字起步,5000 字常态,今天这篇文章要凑够 1000 字也很难了!
这是我测试的所有模型中,最让我“惊讶”的一个,它已经成功地引起了我的注意!
我现在再去看“卧龙凤雏”都觉得眉清目秀了!
美团,我们还是好好做送外卖这份有前途的事业吧,把钱省出来,给小哥多点福利,不好么?
赶紧再写几句,凑够1000字!
我认真地说一下:
这个模型并没有太多智能体相关的东西,更像上一代的聊天模型。它也完全无法识别任务的复杂度,从而合理分配注意力和时间。当然它也完全没有能力处理这些复杂的问题!
这模型不存在一线二线的问题,还在十八线!
我之前的预感是对的,不测有不测的道理。
测了,就很难收场了。
当然,我只是根据当前模型水平的现状,做了一个自己的个人评价!
对所有付出努力的人还是表示尊重的!