扒完DeepSeek最新论文,我发现了V4.1 Flash便宜大碗的秘密
5 小时前 / 阅读约13分钟
来源:凤凰网
DeepSeek发布V4.1 Flash模型,融合多模型能力,采用CED架构和CSA2注意力机制,降低KV cache开销,提升运行速度,在Agent测试中表现优异,未来将继续优化架构和训练稳定性。

DeepSeek V4.1 Flash 发布后,DeepSeek 网页版和 App 也更新了,之前需要选择的「快速」、「专家」和「识图」都合并升级为一个入口。

全新的 DeepSeek V4.1 Flash 同时具备了日常对话、图片理解与复杂问题解决能力,看起来像是把过去这一个多月,DeepSeek 发布的 V4 Flash 正式版、Vision Exp、V4 Pro 正式版几个模型,全部融合在一起了。

在社交媒体上,大家对 V4.1 Flash 最多的评价就是「快」。

有网友展示自己在 DeepSeek Harness 内的对话,模型的运行速度是 217 tok/s 左右。而其他的测试结果显示,V4.1 Flash 的运行速度为 420-507 tok/s ,比 Gemini 3.8 Flash 还要更快。

本来是融合了好几个模型,主干参数也接近上一代 Flash 的两倍,从 284B 到了 552B,但怎么速度就变快了。

虽然 4.1 看着是一次小更新,但从 DeepSeek 公开的技术报告来看,V4.1 Flash 采用了重新设计的模型架构,并扩大了训练数据和强化学习规模。

参数的增加,但处理长输入和保存上下文所需的开销却降低了,因为每 Token 的全局 KV cache 只有 890 字节,是自家 V4-Flash 的四分之一;和 2023 年的初代 DeepSeek-V1 相比,缩小了约 437 倍。

总参数变多,但是用来每一次工具调用、每一轮对话,模型上下文的 KV cache 却减少了,而减少的 KV cache 也没有因此让 V4.1 Flash 变弱,在多个 Agent 基准测试上,它打平甚至反超了 Claude Opus-5 和 GPT-5.6 Sol。

我们分析了 V4 Flash 和 V4.1 Flash 的两篇论文技术报告,看到了 DeepSeek 在 Agent 时代到底要做什么样的高效率模型。

图|论文地址:https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf

模型变大,成本怎么降下来

所谓的 KV cache 可以理解为模型处理过内容后留下的中间状态;后续生成需要参考前文时,复用这些状态,可以省下重新计算的开销。

而当我们的上下文越长时,这个用来保存模型状态的工作台台面就会越大,占的显存越多。

DeepSeek 四代模型的演化,可以说就是在不断地对 KV cache 进行压缩,从 V1 的每 token 389 KB,到 V3.2 的 48 KB、V4-Flash 的 3.5 KB,再到今天的 890 字节,连 1 KB 都不到。

V4.1-Flash 采用的做法是一组组合拳。在架构上,40 层网络被修改成「编码器 + 解码器」两半(CED 架构),Causal Encoder-Decoder,简称 CED。

它把 40 层网络分成前后两部分:前 20 层是因果编码器,后 20 层是解码器。后半部分需要的全局 KV 缓存,可以直接由前半部分的最终输出生成,因此,大部分输入内容无需再完整经过后 20 层。

即解码器需要的全局记忆直接由编码器的输出投影生成,预处理长文本的计算量近乎减半。这对频繁调用工具、缓存经常不命中的 Agent 负载尤其省钱。

图|DeepSeek 各代模型在不同上下文长度下的单 Token 解码(Decode)FLOPs 对比。

具体来说,假设我们让 AI 帮忙选一批办公电脑,看产品资料、查价格、列出配置,最后给采购建议。

第一轮,它读了几款电脑的介绍。第二轮,我们补充预算,让它重新筛选。第三轮,我们又接着说,有两个岗位需要剪视频,配置得单独调整。

就这样每次我们只补充一句话,模型处理的内容却可能越来越长。要接着完成任务,它需要记得前面选过哪些型号、为什么淘汰某一款、预算是多少,以及哪些要求刚刚发生了变化。

V4 是标准的 decoder-only,整个模型「读」和「写」用同一套全部工序。给它一段 100 万 token 的输入,每个 token 都要完整穿过全部 43 层。

现在 V4.1 Flash 大部分只需经过前半段,后半程的解码器不用再把原文逐层过一遍,而是直接拿编码器读完之后「消化好的笔记」,技术上是把编码器最后一层的隐状态投影成解码器的全局 KV cache,然后基于这份笔记开始生成。

图|V4 Flash 和 V4.1 Flash 架构区别

这样一来,模型处理输入时,每个 token 激活约 80 亿参数;生成时,激活约 160 亿参数。对于足够长的输入,技术报告给出的预处理计算量接近减半。

可以说 V4.1 Flash 的 CED 这套结构就是冲着 Agent 负载设计,它优先节省的,正是 Agent 不断接收材料时的计算。资料越长,省去大部分输入在后半网络中的处理,就越有价值。

其次,注意力机制升级为 CSA2,让不同层之间可以「借用」彼此算好的索引和缓存,而不是各算各的;主 KV cache 更是用上了 FP4 量化,并且特意选了 OCP 开放标准格式,理由是「支持尽可能多的硬件平台」。

V4.1-Flash 的 Compressed Sparse Attention 2,简称 CSA2,是让多个网络层共享全局 KV 缓存。有的层负责建立缓存、挑出相关位置;后续层可以沿用这份缓存,重新选择自己需要的位置;还有一些层连选择结果也直接复用。

上一代部署方案会把全局和部分局部 KV 状态长期保存,以便用户重新生成答案,或继续多轮对话。但局部状态往往只在活跃会话的短时间内有用,长期保留会占用大量存储。

V4.1-Flash 把编码器的局部状态放进只保留几分钟的内存池。状态过期后,如果用户又继续任务,就重新计算最近 128 个 token,近似恢复需要的局部状态。DeepSeek 将这个办法称为 SWA Bounded Replay。

它用少量重算,换掉了长期保存这部分状态的开销。移走局部状态,再叠加全局缓存压缩,同等负载下,持久 KV 缓存占用降到上一代的约八分之一,且可以保证驻留 72 小时以上。

换句话说,用户三天内回来继续对话,服务商都不用重新付钱算一遍。

这种近似恢复的方案也会带来取舍,恢复结果与完整重新计算并不完全相同,DeepSeek 在报告中称已测场景中的质量影响很小,并把极端长上下文检索、会话恢复时的状态变化列为后续重点测试对象。

此外,V4.1 Flash 对比 V4 Flash 的不同,还在于 552B 主干之外,模型还外挂了 196B 的「条件记忆」模块 Engram:它不做计算,只做查表。

通过把常见词的 2 到 4 个组合预先存成一张巨大的哈希表,用到时直接查出来接进网络,DeepSeek V4.1 Flash 的成本又能进一步下降。

省下计算和存储之后,模型还得把题做对

V4.1-Flash 使用了包含图像和文本的 45 万亿 token 预训练语料。它从语言模型预训练开始就接触多模态数据,图像经过视觉编码器处理后,与文字一起进入语言主干。

这让 Agent 可以直接利用截图检查工作。例如,在生成网页或办公文件后,读取渲染出来的画面,判断排版、图表或页面是否需要修改。工具返回的文字结果之外,模型多了一种检查依据。

后训练部分,DeepSeek 也写得相当明确:这次沿用了监督微调、强化学习和蒸馏,没有引入新的后训练算法。团队主要投入在训练数据和环境的生产上。

这似乎也在说,RL 的军备竞赛,主战场可能不在论文里的新算法,而在数据工程的水电煤。

他们把一道 Agent 任务拆成三个部分:问题、执行环境、验证系统。模型要面对足够难的要求,环境得能运行,验收也要与题目对应。

通用 Agent 的材料,来自内部员工和外部合作伙伴反馈的工作记录、工具接口与失败案例。团队据此重建工具的输入输出格式和行为约束,让模型可以在模拟环境中反复练习实际工作里出过错的步骤。

图|DeepSeek 会不断读取图片来检查结果

以编程任务为例,有的 AI 负责出题、准备工作环境,有的负责试做,还有独立的 AI 检查题目和验收要求是否一致、答案有没有泄漏、能不能靠钻漏洞过关。检查不过,就修好题目再试。

任务用于新一轮强化学习后,解题轨迹又会成为重新审核题目质量的材料。某个测试如果一直诱导模型钻空子,或者失败源于环境配置而非能力,这些问题就需要回到任务生产环节处理。

图|在 DeepSeek Harness 的 Minimal 模式下,随着强化学习(RL)训练规模的扩大,模型在各项代码智能体基准测试中的性能均有所提升。

在 DeepSeek 的归纳中,这次后训练的收益主要来自任务规模、多样性和可验证性的改善。模型做过更多类型的工作,也更频繁地得到与结果相关的反馈。

工具软件本身也会影响表现,DeepSeek 用不同工具框架测试同一个模型,发现系统提示、工具配置和历史信息管理的差异,都可能改变任务结果。

DeepSeek 在报告中表示,后续会继续扩大模型、数据和强化学习规模,并把模型与工具框架放在一起优化。

V4.1-Flash 目前是这一新架构系列中最小尺寸的模型,未来的 V4.1-Pro 或许会延续这一架构,但从上次 V4 Pro 正式版的经历来看,DeepSeek 显然不会再轻易就发布一款新的 Pro 模型。

Agent 测试进步明显,难题仍有差距

能力提升最集中地出现在 Agent 测试中。

在 DeepSeek 公布的最高推理档位结果里,V4.1-Flash 的 DeepSWE v1.1 软件问题解决率达到 74.2%,上一代 Flash 为 54.4%,V4-Pro 为 62.7%。同一测试表格中的 Opus-5 为 74.0%,GPT-5.6 Sol 为 73.0%。

Terminal-Bench 2.1 的成绩从 82.7 升到 90.6;面向工作自动化的 AutomationBench,则从 37.7 升到 54.8,也高于同表中的 V4-Pro、Opus-5 和 GPT-5.6 Sol。

最难的任务仍然拉得开距离。Terminal-Bench 4.0 上,新 Flash 从上一代的 7.0 提高到 31.2,但 Opus-5 为 51.8。在高难科学问答 GPQA Diamond 上,V4.1-Flash 的 90.9 也低于 V4-Pro 的 92.4。

原生视觉带来了新的可用范围,领先模型的优势也还在。带工具的专业图表测试 Chartography 中,V4.1-Flash 得到 78.9,高于 Kimi K3 的 68.1,低于 Opus-5 的 84.0。

模型的表现,还会受 Agent 框架影响。同一个 V4.1-Flash,在最高推理档位下,用 mini-SWE 跑 DeepSWE 得到 74.2,换成 Claude Code 为 69.8,Codex 为 65.6。系统提示、工具定义和上下文管理,都会影响模型能否把能力用出来。

另一方面,更长的思考也会增加账单。

DeepSeek 在强化学习中加入了随推理档位变化的长度惩罚,让同一模型学会用不同长度的推理处理任务。API 提供 low、high、max 三档,分别对应内部 50、75、100 的 effort 值。

图|报告中的总体趋势是,增加推理投入能改善成绩,但图表也出现了更高档位得分下降的情况。

在 V4 Flash 报告的结尾,DeepSeek 列了 7 条未来方向,包括架构精简、训练稳定性、稀疏嵌入、低延迟、长程 Agent、多模态,和数据合成,5 个月后 V4.1 似乎正逐条解决这些问题。

模型可以更大,思考可以更长,工具也可以调用更多次。只要最终把任务做完所需要的显存、延迟和总成本继续下降,它就依然是一款更便宜的模型。

从 7 月底发布 V4 Flash,到 8 月推出 V4 Pro,很快又更新了视觉推理预览模型 Vision Exp,再到这两天更新 V4.1 Flash,DeepSeek 的整体发布节奏对比过去一年,似乎是前所未有的快。

而过去那些卷 Benchmark 的分数,也会在一次次接近 100 分之后,开始卷速度,卷每秒处理的 Token 谁更多。