- 博客
- DeepSeek Harness 是什么?一篇看懂优势、场景与上手方法
DeepSeek Harness 是什么?一篇看懂优势、场景与上手方法
目录
DeepSeek Harness 是什么?把 AI 编程助手变成一间可以自己改造的工作室

如果你已经用过 Claude Code、Codex 或其他 AI 编程工具,大概熟悉这样的体验:打开工具,交代任务,AI 读代码、改文件、运行命令,最后把结果交给你。
DeepSeek Harness 也能做这些事,但它真正有意思的地方并不在“也能写代码”。它想做的是另一件事:把 AI 助手拆开,让你看见它由哪些部分组成,并允许你重新组合。
你可以把普通 AI 编程工具想成一辆出厂时已经调好的汽车。上车就能开,省心,方向盘、刹车和导航都已经替你安排好。DeepSeek Harness 更像一间带着一辆基础车的改装工作室:车能开,但发动机、工具箱、行车记录、车库门禁,甚至驾驶方式,都可以换。
这听起来很强,也很容易被说得过于玄乎。本文不讨论“它会不会颠覆一切”,而是回答更实际的问题:它到底是什么,普通开发者怎么上手,哪些能力真的有价值,以及你现在是否值得用。
截至 2026 年 8 月 20 日,DeepSeek 官方仍把 Harness 标记为 Developer Preview。它值得学习和试验,但这与“已经适合无人看管地跑生产任务”不是一回事。官方项目说明
先把它想成一间“AI 工作室”

一个能干活的 AI Agent,表面上只是一个聊天框,背后其实有不少东西在配合:
- 有一个负责思考和生成内容的模型;
- 有读文件、改代码、运行命令的工具;
- 有保存上下文和历史记录的会话系统;
- 有决定“哪些操作要先问你”的权限规则;
- 还有把这一切串起来、决定下一步做什么的运行循环。
大多数成品工具会把这些部分预先组装好。这样做没有问题,甚至对多数人更友好。你不需要知道引擎怎样点火,也能把车开去上班。
DeepSeek Harness 的思路不同。官方介绍把模型、工具、Skills、Sessions、Sandboxes、Storage、Loops、Scheduling 和 UI 都看成可以装卸的插件。负责协调这些插件的核心叫 Cordis。
“插件”这个词很容易让人联想到浏览器扩展,但这里的范围要大得多。它不只是给聊天框多加一个按钮,而是可以替换 AI 的模型来源、工具集合、记忆方式、审批规则,甚至整个交互界面。独立的源码分析因此把它称为可组合的 Agent runtime,而不只是一个 Coding Agent。
这个区别什么时候才有意义?
假设你想做一个公司内部的代码审查 Agent。它只能读某几个仓库,执行危险命令前必须让人确认,检查结果要存进公司的系统,而且你希望以后可以从云端模型换成本地模型。成品工具可能允许你配置其中一部分;Harness 的目标则是让这些部分本来就是可替换的积木。
这里也藏着它的第一笔成本:积木越多,自由越大,但你要负责的事情也越多。插件之间能否兼容、插件可以做什么、升级后会不会变化,都不会凭空消失。
官方目前提供四种主要使用姿势:
- Standard 像组装好的基础车型,适合先体验完整工作流;
- PTC 更强调让模型用程序组织多步工具调用;
- Minimal 尽量减少预装内容,方便从小系统开始研究;
- Creator 面向插件的创建和调试。
新手不需要在第一天弄懂四种模式。先用 Standard,等你真的遇到“默认方式不合适”的地方,再去看另外三种,这才是更轻松的路径。
第一次打开,别急着把所有插件都装上

最小启动命令很短:
npx @deepseek-ai/dsh web
启动后,在 Settings 里配置模型,选择一个工作区,就可以开始任务。真正重要的不是把界面里的每个开关都试一遍,而是选一个规模小、结果容易检查、即使失败也没有损失的真实任务。
例如,你可以让它:
阅读这个示例项目,找出启动命令和最主要的目录,然后在不修改文件的前提下,用普通语言告诉我这个项目是做什么的。
这类任务看起来不刺激,却很适合作为第一次接触。你能观察它是否找对工作区、会读取哪些文件、怎样组织工具调用,也能看看哪些动作会触发审批。
确认读取没有问题后,再给一个很小的修改任务,例如补一段缺失的错误提示,并要求它运行现有测试。完成以后不要只看最终回答,还要打开 trajectory,看它中间经历了什么。
如果第一次就给它一个“重构整个项目、顺便升级依赖、自动修复所有问题”的大任务,你很难判断失败发生在哪里:是模型理解错了,是工具权限不足,是上下文太长,还是某个插件改变了行为。先走短路,再走长路,反而更快。
本地模型也是类似。社区已经有人把 Qwen 等本地模型接入 DSH,并跑了很长的任务;但这些结果高度依赖显卡、推理后端、上下文窗口、最大输出长度和自动压缩设置。一项长任务体验很亮眼,却仍然只是特定机器和配置下的个案。正确的阅读方式是“这条路走得通”,而不是“所有人照抄都会一样快”。
如果只记住一个上手原则,就是:先固定模型、工作区和模式,只改变一个变量。 等你知道基础组合怎样工作,再换模型、加插件或改 Agent loop。这样即使出问题,也容易找到原因。
真正值钱的,是你能看见 AI 走过的路

很多 AI 工具都有聊天记录,但聊天记录往往只保留“你问了什么、它回答了什么”。Agent 真正工作时,还发生了不少中间步骤:它读了哪些文件、把什么内容放进上下文、调用了什么工具、工具返回了什么、在哪一步改变了计划。
DeepSeek Harness 把这条过程记录称为 trajectory。它的会话采用追加式事件记录,官方强调可以恢复、分叉、搜索和重放。
可以把它想成游戏存档加行车记录仪。
AI 做到一半走错了,你不一定只能从头再来;可以回到一个较早的节点,从那里开出另一条分支。任务最后虽然完成了,但你想知道它为什么花了这么多 Token,也能顺着轨迹检查究竟在哪些步骤反复读取了大量内容。
这对普通开发者有两个直接好处。
第一个是更容易排错。当 Agent 说“任务完成”,但测试其实没跑成功,你可以分辨它是真的误读了命令结果,还是根本没有执行测试。
第二个是更容易学习 Agent。如果你正在研究怎样写 Skill、怎样安排上下文、怎样让模型选择工具,trajectory 比最终答案更有教学价值。它让你看到模型实际接收了什么,而不是只猜“AI 大概是这样想的”。
这也是 DeepSeek Harness 目前最不容易被其他卖点替代的优势。插件很吸引眼球,但插件多了也可能变成管理负担;trajectory 的可见性则几乎从第一天就能帮助调试和理解。
不过,记录得更完整不等于结果自动正确。行车记录仪能告诉你车在哪里转错了,却不会替你把方向盘打回来。它提高的是可观察性和可恢复性,不是模型智力本身。
它和 Claude Code、Codex 不是简单的输赢关系

“DeepSeek Harness 和 Claude Code、Codex 谁更强?”这是最自然的问题,也是目前最容易得到误导性答案的问题。
原因很简单:最终效果同时受到模型、系统提示、工具、上下文整理、权限、任务类型和机器环境影响。只换 Harness,其他条件也可能跟着变。现在并没有足够可靠的独立基准,证明 DSH 在速度、代码质量或 Token 成本上普遍优于 Claude Code 或 Codex。
社区反馈也彼此冲突。一位早期使用者看到了很高的缓存命中和不错的结果,同时抱怨速度慢、Token 用量大、插件说明难懂;讨论中又有人认为自己的效率更好。另一个跨模型体验帖认为某些 GPT 模型在 DSH 里的工具调用不够顺,而 Codex 的默认组合更省心。
所以,更有用的比较不是“冠军是谁”,而是“你愿意自己调多少东西”。
| 你的真实需要 | 更自然的选择 |
|---|---|
| 打开就做日常开发,少研究运行时 | Claude Code、Codex 等成熟成品 |
| 想换模型,但不想重做整个工作流 | 先看现有成品是否已支持你的供应商 |
| 想研究 Agent 怎样装配、怎样记录上下文 | DeepSeek Harness |
| 想自己做插件、审批、存储或专用界面 | DeepSeek Harness |
| 团队最在意稳定版本和成熟支持 | 目前优先成熟产品,继续观察 DSH |
换个比喻:高铁适合沿成熟线路快速到站,汽车适合日常灵活出行,模块化工作车适合带着工具去没有现成道路的地方。你不会因为工作车可以换轮胎,就断言它在高速路上一定最快。
DeepSeek Harness 的优势是“可以改造”和“看得更清楚”。Claude Code、Codex 的优势通常是默认体验完整、日常路径顺畅。两者并不互相否定,甚至可以同时使用:成熟工具承担日常工作,DSH 用来实验新的 Agent 组合。
现在该不该用?先看你想解决什么问题

如果你是下面几类人,现在就值得花时间试一试:
- 你想真正理解 Agent runtime,而不只是在不同聊天框之间切换;
- 你在设计公司内部的专用 Agent,需要自定义模型、工具、审批或存储;
- 你想开发插件,或者研究 Skill 如何影响上下文和工具选择;
- 你需要检查长任务的完整过程,并从中间节点恢复或分叉;
- 你在测试本地模型或 OpenAI-compatible 接口,希望有一个更开放的实验台。
如果你的目标只是“今天把需求做完”,而且 Claude Code 或 Codex 已经顺手,完全没有必要因为新品热度立即迁移。一个更开放的运行时,不会自动替你省掉配置、维护和学习成本。
生产使用则需要更谨慎。DSH 确实提供审批、guard 和 sandbox 等可配置控制点,但“存在安全开关”与“默认就安全”不是一回事。一项A.I.G. 间接提示注入评估在固定版本、模型、persona 与基线下进行了 14,560 次受控运行,不同攻击通道仍出现了不同程度的成功。这个研究不能代表所有版本和组合,却足以提醒我们:Agent 能读文件、调用工具、执行命令时,安全必须靠实际测试,而不是靠架构名称。
插件系统也有同样的问题。在Hacker News 发布讨论里,很多人喜欢“一切皆插件”的开放感,也有人担心插件疲劳、供应链、权限和 Node/npm 带来的治理成本。双方说的其实都对:插件给了你更大的房子,也意味着你要检查更多扇门。
因此,一个朴素的采用顺序会更稳:先在个人或隔离环境里完成几个真实小任务;再固定版本和配置,记录表现;然后检查审批、工作区边界和插件来源;只有当这些环节都可重复时,才考虑接入更重要的项目。
DeepSeek Harness 当前最吸引人的身份,不是“已经赢下所有 AI 编程工具的新王”,而是一间终于把门打开的 Agent 工作室。你可以走进去,看见模型、工具、记忆和权限怎样配合,也可以动手换掉其中一部分。
对只想坐车的人,它现在可能还不够省心。对想学会造车、修车,甚至设计新交通工具的人,它非常值得认真看看。
延伸观看
下面三个 YouTube 视频与主题高度相关,可以作为不同创作者视角的延伸材料。本次自动获取受到 YouTube 反机器人校验阻断,未取得可审计字幕和画面,因此本文没有用它们支持事实结论:
- Better Stack:DeepSeek Harness Just Changed AI Forever
- Prompt Engineering:Qwen 3.8-27B in DeepSeek Harness
- Turing Post TV:DeepSeek Just Killed Proprietary Coding Agents
参考资料与来源
- DeepSeek Harness 官方介绍
- DeepSeek Harness 官方 GitHub 仓库
- Cordis 论文草稿仓库
- Zicode:DeepSeek Harness Agent Runtime Source Analysis
- Kondasamy:DeepSeek Harness and the Cordis Kernel Architecture
- A.I.G.:DeepSeek Harness 间接提示注入安全评估
- Hacker News 发布讨论
- Reddit:首批使用体验
- Reddit:跨模型使用反馈
- Reddit:本地 Qwen 长任务实验
本文依据截至 2026 年 8 月 20 日可获得的官方资料、独立分析、安全研究和社区讨论撰写。Developer Preview 变化较快,实际使用前请再次核对官方文档。
最新博客文章
追踪 Vibe Coding Tools 最新的对比、测评与实战技巧。
把 Hermes 从聊天助理升级为数字员工组织系统:用 Profile 定义岗位,用 Orchestrator 拆解调度,用 Kanban 追踪多 Agent 协作。
Bitget 钱包虚拟卡完整开卡教程:准备护照与 USDC、下载创建钱包、绑定邀请码、通过欧易购买并提币、开通激活虚拟卡,绑定微信、支付宝、Apple Pay,并用于海外 AI 工具订阅。
bb-browser 把你已登录的真实浏览器变成 AI 可调用的 JSON 数据接口,绕过繁琐登录与反爬限制,更适合做认证场景下的信息采集。
