DeepSeek的“官方外挂”,被一张梁文锋的表情包难倒了
2 小时前 / 阅读约9分钟
来源:36kr
DeepSeek Harness开源3周获大量关注,主打“一切皆插件”。测试显示其视觉模型能理解图片视觉叙事,但人物和网络梗理解失准。开发者可自由搭配,但需配置调试。

要拿到GitHub上的20万星有多难?曾经大火的OpenClaw小龙虾,用了3个月左右。

DeepSeek Harness,只用了不到3周。

GitHub上的星相当于收藏或点赞。而这里的“Harness”,指的是一套让大模型调用工具、执行任务的软件框架,负责把读文件、运行代码、保存工作进度等环节组织起来。

简单来说,如果说大模型是“脑子”,决定了一个Agent是否聪明,那Harness就是“四肢”,决定了Agent干起活来的效率和效果。

DeepSeek Harness正是他们推出的首款软件框架,主打“一切皆插件”,里面的模型、工具乃至操作界面,都可以按需要替换和组合。

自8月13日开源以来,短短3周时间里,DeepSeek Harness不仅收获了大量关注,还围绕它出现的各种新玩法。

据量子位8月15日报道,GitHub上带有相关插件标签的公开仓库已经超过700个。

进入9月,DeepSeek又在3日、4日接连发布Harness新版本,继续改善图片处理、文件上传等体验。从社区开发者到商业公司,再到官方更新,这场围绕Harness的折腾还在继续。

那么,被开发者玩出这么多花样的DeepSeek Harness,实际用起来怎么样?

只是让人没想到的是,大名鼎鼎的DeepSeek Harness,被一张表情包给难住了。

看得见,能看懂吗?

DeepSeek Harness的各种新玩法里,最让我们想试一试的,是接入视觉模型之后,它能做些什么。

Harness开源仅一周多,DeepSeek就紧接着推出了V4-Flash-Vision-Exp,让模型的看图能力与这套干活框架来了个强强联合。官方也着重展示了多模态Agent的应用:制作带配图的旅行PPT、重新设计网页,以及开发带有动态效果的前端页面。

要知道,视觉能力一直都是DeepSeek的短板,现在却成了他们着重宣传的点,这些演示确实让人对这套组合多了些期待。

既然已经能处理图文并茂的任务,那么面对一张图片,它究竟能理解到什么程度?

表情包就是一道合适的考题。认出画面里的人物、衣服和动作,只能解释图片画了什么;要读懂其中的调侃,还得把画面和人物身份、网络流行语联系起来。有些图,人看一眼就能会意,逐项描述得再准确,也未必说得清它的笑点。

于是,我们把这张“滑动变祖器”交给了DeepSeek视觉模型与Harness的组合:

为了看看它到底是真懂,还是在“看图说话”,第一轮测试时,我什么背景都没告诉它。

不告诉它这个人是谁,更不告诉它这是一张梗图。

DeepSeek Harness很快就把图片的视觉变化抓出来了。它准确识别出这是6个横向拼接的画面,每一格都有一个黑色短发、戴细框眼镜的男性;前3格是深色西装,4、5格变成深色高领服装,第6格则变成红金色华丽长袍,还有明显的冠饰。

更重要的是,它不仅“看见”了这些东西,还理解了这组图片的视觉叙事:从现代商务人士,到传统服饰,再到帝王式造型;从普通,到庄严,再到威严。最后,它总结成了一句话:这个人正在被逐步升格、神化成至尊人物。

|但它是否知道图里的人是谁、网友又在调侃什么,还得继续问下去。

这次我告诉它:这个梗叫“滑动变祖器”,而且给了它5个称号:小难梁→牢梁→梁子→梁圣→梁祖,对应这张组图里任务的不同状态。没错,我故意拿掉了中间的“梁神”。

模型很快发现了问题:6张图,为什么只有5个称号?随后,它开始自己补答案,给出了“梁圣·升格”,甚至还有“梁煞”。真正缺失的称号却是“梁神”。继续追问后,它也承认,这些答案是为了“凑6个”而补出来的。

这也是这次测试最有意思的地方。因为它并不是完全胡说。它是看到了“圣”和“祖”之间存在一个等级缺口,然后根据已有的称号、神格递进和语言模式,生成了一个听起来非常像真的答案。

如果提问者也不知道原梗,这种解释反而容易让人信以为真。

而且,它连人物都猜错了。看到“梁”这个字之后,它猜人物可能是梁启超。但实际上,大家都知道,这个人是梁文锋。

|不过,接下来的一轮追问,又让它找回了一点分数。

我给它塞了一组真假混杂的背景信息:这是中文互联网梗图,主角是一位中国古代历史人物,因为历史功绩被神化,“圣”和“祖”是图中的等级……

这一次,它没有因为这些话是用户告诉它的,就全部照单全收。

它指出,图片能够支持“人物逐渐升格”的判断;至于是不是中文互联网梗、人物是否来自古代、有没有历史功绩,以及“圣”和“祖”是否属于图中的等级,都无法仅凭图片得到证明。

对于这些说法,它选择暂时保留怀疑。

这几轮测试下来,模型看懂了服装和人物形象如何逐步变化,也理解了整张图在表现“把一个人神化”。但到了具体人物和网络梗,它的回答就开始失准。

实际上,AI理解梗图的能力拆成了五层:

第一层,是看见人物、服装、背景这些视觉事实;

第二层,是理解“现代人→传统→帝王”这种视觉叙事;

第三层,才是理解“滑动变祖器”背后的中文文化和网络语义;

第四层,是把图片中的“梁”对应到现实世界里的梁文锋;

第五层,则是理解DeepSeek爆火、梁文锋在互联网语境下的梗文化。

前后两轮表现尤其耐人寻味:面对我塞进去的假背景,它知道证据不足;轮到自己补全称号时,却又把猜测填进了答案。

同样是图片里找不到的信息,它对用户的说法保持了怀疑,对自己编出的答案,却没有同样谨慎。

AI自由度很高,然后呢?

看到这里,很容易产生一个疑问:既然DeepSeek Harness可以调用工具,遇到不认识的人物和称号,为什么不先查一查?

查阅官方文档后,我们发现,DeepSeek Harness本身已经提供了网页搜索和网页抓取工具。当前默认组合中的搜索服务使用DeepSeek API凭证,也可以通过配置更换搜索提供方。

如果只是“上网搜索”的话,甚至不需要额外安装第三方搜索工具。

但有工具可用,和回答之前确实用工具核实过,是两回事。

这次测试里,模型补出了“梁煞”,也猜错了人物身份。仅凭这些回答,还无法判断它当时有没有可用的搜索服务、是否调用过,以及调用后拿到了什么资料。

不过,它至少暴露了这套组合在实际使用中的一个缺点:图片里找不到的答案,最终被模型用猜测补上了。

如果只是辨认服装、描述画面,视觉模型可以直接完成不少工作。但涉及人物身份、网络流行语和具体事件,就可能需要额外查资料。即使找到了相关网页,还得判断说的是不是同一个人、同一个梗,来源是否可信。

这些步骤,需要模型、工具和任务要求共同配合。

DeepSeek Harness已经提供了搭建这类流程的条件。除了搜索和文件操作,它还支持Skills、子Agent和工作流。开发者可以为某类任务写明处理要求,也可以安排不同Agent分别检索、检查,最后再汇总结果。

比如,围绕看图识梗,可以先让模型描述画面中能够确认的内容,再根据文字和人物线索搜索出处,把有来源支持的解释与暂时无法确认的推测分开。

只是,只从这次的测试看来,如果只靠DeepSeek Harness原生自带的这些工具,效果显然还远程不是“优秀”。

这也解释了为什么开发者会围绕DeepSeek Harness做出那么多插件。有人需要记住长期项目的背景,有人需要接入特定资料库,有人希望增加复核步骤。

不同类型工作的要求,不太可能靠一套默认配置就全部满足。

对愿意动手的开发者来说,这是发挥空间;对期待装好就能用的普通用户来说,也意味着需要承担一部分配置和调试工作。

更换模型、接入资料、编写Skill,也是一个大工程。

所以, 20万Star证明了DeepSeek Harness这套框架吸引了大量关注,而我们的测试提醒了另一件事:能够自由搭配,并不意味着随手搭出的一套就足够可靠。

DeepSeek把很大的选择空间交给了用户,怎样把这些选择变成省心的使用体验,仍是它需要继续完成的工作。