就在刚刚,
早在 V4 Flash 正式版更新日志里,除了直接对标 Claude Opus 模型的 benchmark 成绩,还有一行说明写着「正式版
APPSO 在发布之前拿到了

但如果只是用「
当
以下功能和界面等内容均来自内测版,可能与正式版略有出入,以正式发布的版本为主。
第一眼看和市面上大多数的本地 Agent 产品没什么两样,左侧边栏从上到下依次是「新建会话」、「工作区」,以及不同工作区/文件夹内的多个会话。

对话的设置部分,我们可以切换不同的工作区,不同的模型和思考深度,一共有 Off、High、Max 三档推理等级,还有允许


和一般的 Codex 产品只区分日常/办公、办公/代码等工作场景不同,
在 V4 Flash 正式版中提到的极简模式(minimal),正是 Harness 内置的四种 Agent 预设之一,它适合用于简单修改、测试最小 Agent,没有压缩、搜索、Skill、计划和子 Agent 这些功能。

写作工作台是我们自己创建一个 Agent 预设
另外三种预设模式分别是适合用来日常写代码、修 Bug、分析项目,以及默认选择的标准模式(standard);处理大批量搜索、并行读取和多步骤自动处理的代码模式(code);以及能开发新的 Agent 预设或插件的创造模式(cordis)。
不同的 Agent 预设模式可使用的命令不同,我们也可以直接在输入框内使用「/」快速选择不同的指令或 Skills。

标准模式、代码模式和创造模式,都包含有对话压缩、目标、计划等命令,而极简模式下,只有目标命令。
对于什么是 Agent 预设,以及几款 Agent 预设的具体区别,我们还能在设置页面看到详细的情况。

预设即一个会话的 Agent 所运行的插件组装 —— 它的工具、提示词与能力。复制一份既有预设改成自己的,或用「创造模式」让 Agent 帮你创建。
如果说模型等于大脑,决定基础的推理和理解能力;Skill 等于一份操作手册,告诉模型遇到某类任务时,具体怎么做;Tool / 插件 相当于软件和权限,它决定了模型能否搜索、改文件、运行命令、收发邮件等。
那么 Agent 预设就是一个岗位+工作环境,身份、长期规则、可用工具、工作方式,都由 Agent 预设决定。
一个 Agent 预设通用由一份配置文档构成,文档内把 Agent 的系统提示词、工具、上下文压缩和多 Agent 能力完整组合起来。

我们也新建了一个专门用于写作的 Agent 预设,在这份预设内,不仅可以使用文件进行配置,还能引入文件夹,加入不同的 Skill,来让自己的 Agent 更加完善。

自定义写作工作台 Agent 预设文件夹内包含的信息
在设置页面,我们还能看到模型的配置,

最后一项设置是

这个插件有多离谱,在内测的项目仓库里,参与内测的用户短短几天的时间就已经开发了约 300 个插件。

有的插件能把
虽然最底层的记忆依然是本地文件,但这套插件并没有把「长期记忆」做成传统的向量数据库 + RAG,而是通过本地文件持久化 + 分层上下文注入 + LLM 自我整理,形成的一套完整系统。

插件的能力还在于能实现模型的自我进化,定期让 LLM 回头审视自己的完整工作上下文,把临时经验压缩成长久知识。

使用该记忆插件的
但无论是记忆插件,还是皮肤插件,这些都只是插件能力的冰山一角。
在
通常我们理解的插件是给当前的产品增加一些小功能,就像 VS Code 里有着丰富的插件系统,或者是 Chrome 浏览器,我们能安装不同的插件,增加浏览器对应的能力。

Codex 应用内也有大量的插件,像是计算机使用、Chrome、Notion 等等对应不同的工具和服务。
但
如果你嫌

内测用户自己开发的 DSH 插件,能够直接修改页面 UI
举个例子,一个 Agent 的「标题生成插件」,通常是在对话里增加一个按钮或命令,点击后调用 AI 根据已有命令处理。
一个 DSH 的「写作插件」,则可能同时做到:给 Agent 增加 /headline 等能力;注册一个模型可以自主调用的标题工具;换掉系统提示词和写作规则;接入我们的各类 Skills;增加网页检索或外部 MCP;保存文章素材和长期偏好;在
市面上插件功能同样强大的产品可能是 Pi Agent,它也可以通过 Extension 改写工具、模型请求、会话行为和终端界面。

Pi 的介绍写着「有很多 Agent,但这个才是你的」
Pi 让一个 Coding Agent 可以任意扩展;DSH 则试图让整个 Agent 产品都由插件重新组合。

很难想象吧,以快著称的

为了观察执行层能给同一个模型带来多大变化,我们让
先看使用 V4 Flash 在
而使用刚刚上新的 V4 Pro,用时更长,表现反而更没那么好。

虽然界面似乎有更加精美了一点,太阳光沙漠都更自然,但是金字塔等元素又很抽象。
使用
Reasonix,据说是最适合

同样是最高等级的推理,差别真的很大。
首先是整体画面的美感就完全不如
而如果是 Codex+
接着他又找到了我使用

一个是允许他继续参考做出来的网页,一个是我们新开了一个对话,让 Codex 完全依靠自己的工具处理的网页。
两个版本似乎都比用 Reasonix 要更好,和
「受污染」版把色彩调好的同时,但是金字塔完全不像是金字塔。而从 0 开始做的版本确实有 Codex 的感觉,整体画面更明亮,也更简单。
就像 V4 Flash 使用极简模式的
这个单次案例虽然无法证明 Harness 在所有任务上更强,但至少说明:当模型完全相同时,Harness 提供的工具、提示词、上下文组织和执行策略,已经足以显著改变最终产物。
查看
从底层的技术配置到如何处理用户交互、AI 交互,

图片由 AI 生成

就像我们看到,已经有内测用户能通过插件,修改
其次是 Profile 和 Preset 构成的两级组合系统,Profile 决定整个 DSH 进程怎么运行,例如 Web、Headless、安装哪些 Bundle,它本质上是有顺序的 cordis.patch.yml 配置层。
Agent Preset(Agent 预设)决定某个会话里的 Agent 能看到哪些工具、提示词、Skill、子 Agent 和工作流。Preset 的作用域按 agent → preset → global 解析。

根据 Preset 作用域机制,意味着同一个进程中,可以同时运行写作 Agent、编码 Agent、研究 Agent,而且各自看到不同的工具和指令,不必启动四套服务。
另一个有价值的技术点是「模型可见 ⇔ 已记录」。
普通聊天工具往往只保存最终消息,DSH 保存的是完整事件流: turn/start、step/start 用户消息、实际请求使用的模型、系统提示词、工具定义、原始流式等等内容。
同时甚至上下文压缩也不会删除原始历史,只是用 replacement 事件改变模型此后看到的「表面」。

DSH-better-sidebar 插件,将
还有采用「先记录意图,再执行副作用」的 Agent Loop,以及所有工具共用一条执行内核。即模型可以写一段 TypeScript,把多个工具调用编排成程序,但中间数据留在运行环境里,只有最终结果进入模型上下文。
最后一项特别设计就是前端,即我们使用

图片由 AI 生成
应用启动后,界面挂载机制会加载一组 UI 插件。页面先声明侧边栏、对话区、输入区和设置区等标准挂载位,各插件再把自己的组件注册进去。
MCP、Skill、网页搜索、终端、子 Agent、多模型、Plan Mode、Workflow,这些单独看都已经是 Agent 产品的常见能力。

而这带来的最大改变,大概是以前我们是使用一个通用 AI Agent,每个人都在用一样的 Codex 去处理办公、编程、写作等任务;但
总的来说,Codex 尝试交付一个拿来即用的 Agent;
既然 Codex 可以切换不同的模型,模型只是 Agent 的一个部件,那 Agent 本身也应该能持续配置、替换和重组。
以前我们挑 Agent,挑的是哪家公司做出了最好用的那个产品。
DeepSeek Harness 给出的另一种可能是,Agent 和模型同样是基础设施。开发者和用户,可以使用 DeepSeek Harness 创造出无数个 Codex,而真正属于我们的 Agent,也可以由自己组装出来。
