DeepSeek Harness 安装,初体验,没有惊喜。
千呼万唤始出来,DeepSeek Harness 发布了,先说个冷知识,DeepSeek Harness 是用 Claude Code 开发出来的
如果你还在好奇 Harness 到底是什么,最简单理解:
除模型本身以外的所有工作,都属于Harness的范畴
基座大模型相当于智能体的“大脑”,负责推理、理解需求、生成代码;读文件、改代码、执行命令、组织上下文、调用工具、保存会话、申请权限、派发子 Agent,这些模型之外的工作都在 Harness 这一层
同一个模型放进不同 Harness,体验可能差得非常远,细节大家可以看我这篇文章,会有感受:被Harness圈捧成圣的 Pi Agent,接上 DeepSeek-V4-Flash,如虎添翼
如果你想更细致了解Harness可以看我这篇:2026 年,AI 编程 Agent 的真正分水岭——Harness 详解一文中已有详细介绍
下面一起看看 DeepSeek Harness 到底如何,是不是 Claude Code 平替?
安装极简单:npx @deepseek-ai/dsh web

比较意外,它甚至没有 TUI,也没有客户端,只能网页端打开
目前还在内测,初步感觉:半成品上桌了,maybe 功夫都用在了看不见的地方吧

看 Github 上 DeepSeek Harness的设计,已经把一套完整运行环境搭出来了:
- Web 界面负责会话、工作区和设置
- Agent Loop 负责组织模型请求与工具调用
- 工具系统负责执行命令、文件操作等动作
- 会话记录负责恢复、分叉和重放上下文
- 权限策略负责在高风险操作前拦一道
- 插件系统负责把上面这些能力替换、组合和扩展
配置模型
把官网开放平台获取的 API Key 填进去就行了

使用
界面可以用“陋室”形容,你甚至感觉来到了 DeepSeek 官网

第一步要做的是选择一个本地文件夹作为工作区
它有几种Agent预设模式,大致看了下,默认标准模式就可以,全县更大点的是 PTC 模式,可以通过 Code Mode SDK 让模型用 TypeScript 程序组合多步操作

Agent 预设可以自定义
预设即一个会话的 Agent 所运行的插件组装 —— 它的工具、提示词与能力。复制一份既有预设改成自己的,或用「创造模式」让 Agent 帮你创建。

我没来得及细致研究预设,玩深了在倒腾吧
选择一个工作区以后,输入框才会真正解锁

设置
剩下的东西都藏在设置了
比如权限设置,我都已经麻木了,直接 Full access

前面有一步模型添加,在设置中也可以,支持第三方大模型的接入

重头戏——插件

一切皆插件,才是这次开源的重点
DeepSeek Harness 的核心设计叫「一切皆插件」
我初步理解,很像被Harness圈捧成圣的 Pi Agent,接上 DeepSeek-V4-Flash,如虎添翼中 Pi 的扩展
模型适配器是插件,工具注册表是插件,会话日志是插件,连 Agent Loop 本身也是插件
很多 Agent 产品允许你装几个工具,dsh 往前又走了一步:Agent 怎么循环、工具怎么执行、上下文怎么进入模型,都可以在配置层被替换
它的底层由 Cordis 驱动,一个正在运行的 dsh,本质上是一棵启动时组合出来的插件树
官方目前提供两种主要形态:
web:带浏览器界面的完整应用headless:没有服务器,接收一次任务并返回结果
每种形态都由多层配置叠起来,基础能力放在底层,用户自己的修改放在上层
想看机器实际启动了哪些插件,可以运行:
dsh --profile web --dump-config
实测
照惯例,所有模型我都会让其先做一下《背影》阅读理解+SVG 代码生成 + 审美测试
Harness 是否真的可以给 DeepSeek-V4-Flash 注入神秘力量呢
请看
整整4分钟鏖战

输出结果:差点意思,第二次背景原文没的不对呢

Token消耗情况:1 轮 · 14 步
- LLM 3m55s
- 工具调用 18.2s
- 首 token 平均 1.2s
- 112 tok/s
- 缓存命中 93%
- 输入 680K tok
- 输出 24.5K tok
作为对比,看下我最近常用的 Pi+DeepSeek-V4-Flash
确实稍微好一点点,虽然第二个识别也不行

Token消耗情况

找GPT分析了一下:
| 指标 | DeepSeek Harness | Pi + DeepSeek-V4-Flash | 对比 |
|---|---|---|---|
| 输入 | 680,000 | 245,232 | Harness 约 2.77 倍 |
| 输出 | 24,500 | 6,794 | Harness 约 3.61 倍 |
| 总量 | 704,500 | 252,026 | Harness 约 2.80 倍 |
| 缓存命中率 | 93% | 98.2% | Pi 高 5.2 个百分点 |
| 估算未缓存输入 | 47,600 | 4,464 | Harness 约 10.7 倍 |
核心差异:
- DeepSeek Harness 多消耗约 452,474 tokens。
- DeepSeek Harness 平均每步携带约 48.6K 输入、产生约 1.75K 输出。
- DeepSeek Harness 的输出占总量约 3.48%,Pi 约 2.70%,说明 Harness 每次任务生成得更多。
- 未缓存输入:Harness 约 4.76 万,Pi 只有 4464,差距达到 10.7 倍。
简单结论:Pi+V4-Flash 的上下文复用效率更高,整体 token 压力约为 DeepSeek Harness 的 36%;DeepSeek Harness 主要成本来自 14 步 Agent 流程中反复携带的大上下文。
‼️说明:该测试干扰因素巨多,不代表两者真实水平 ⚠️⚠️
DeepSeek Harness 知否值得玩
如果你现在只想找一个成熟工具写代码,Claude Code、Codex 这类成品更省心
它们已经把交互、权限、工具和日常开发流程磨了很久,装好就能干活
DeepSeek Harness 更适合:
- 想研究 Agent Loop、上下文和工具执行机制的开发者
- 想做自有 Agent 产品,又不想从零搭运行骨架的团队
- 想自己替换模型、工具、沙箱、界面和权限策略的重度玩家
dsh 现在的优势是开放和可组合,短板也很明显:版本早、变化快、文档偏开发者、生态刚起步。这也是我暂时不会把它当主力工具的原因
趋势
第一,Harness 已经成为模型厂商必须争的位置
模型能力越来越接近以后,真正影响任务完成率、成本和体验的,会逐渐转到上下文组织、工具设计、权限策略和任务循环
DeepSeek 亲自开源 Harness,说明它也在往模型之上的产品层走
第二,Agent 的扩展单位正在从工具走向整套运行机制
过去大家给 Agent 加一个搜索、一个终端、一个 MCP,就叫扩展
dsh 把模型、会话、循环、工具、权限都做成可替换插件,扩展范围明显更大
第三,开源 Agent 会越来越像发行版
同一套底层,换一个 Profile、叠几层插件和配置,就能变成 Web Agent、无界面自动化工具,甚至企业内部的专用 Agent;以后选 Agent,可能会越来越像选 Linux 发行版:底层能力接近,真正决定体验的是默认组合和生态
本文由作者@Ai学习的老章,授权发布于平台,未经许可禁止转载。
- 目前还没评论,等你发挥!

起点课堂会员权益



