DeepSeek-V4.1-Flash 的最佳 Harness 搭档,我觉得可能是 Claude Code

0 评论 238 浏览 0 收藏 9 分钟

DeepSeek 技术文件提到,大模型很少只跑在固定 Harness 里,不同脚手架的提示词、工具定义与上下文管理都会影响结果。官方测试显示 DSH Minimal 模式反常识地优于 Standard 与 PTC,Claude Code 开箱即用接近峰值。

DeepSeek V4.1 Flash 开源,本地部署成本骤降!实测,顶夯! 一文中,我注意到DeepSeek 技术文件里提到:大模型很少只跑在一个固定 Harness 里,不同脚手架的系统提示词、工具定义、上下文管理、交互协议都不一样,跑出来的结果也有差异

DeepSeek 官方测试显示:

1、DeepSeek 自家框架的 DSH Minimal 模式,在两项测试中都高于 Standard 和 PTC 模式,有点反常识,功能更多、流程更复杂,并没有换来更高的成功率。

2、Claude Code 或 Codex 里接 DeepSeek-V4.1-Flash,开箱即用的水平接近峰值

DeepSeek Harness 官方桌面端,抢鲜版! 一文中我做了复刻机必替 Astra 网页风格的实测,后来我把 DeepSeek-V4.1-Flash 分别接入到了 Pi Agent、Claude Code、DeepSeek Harness 做了更多尝试,先来看看结果情况

✦Pi Agent

✦Pi Agent

正文部分还行,首屏效果就差点意思了,有粒子效果,但偏离了的目标风格和布局

✦DeepSeek Harness 桌面端

✦DeepSeek Harness 桌面端

DSH 标准模式,我认为效果比 Pi Agent 好,首屏和侧边栏都符合预期,正文部分稍微有点弱

✦Claude Code

✦Claude Code

我感觉在Claude Code 中的发挥是超预期的,那个太空水滴有点经验!就是正文的布局有点不太理想

上面的任务有点主观了,所以我又换了一个实测:

Write an HTML and JavaScript page implementing space invaders

这个题目来自知名博主 Simon Willison,对,就是那个全网刷屏的鹈鹕骑单车测试的原创博主

我分别跑了 Pi Agent、Claude Code、DSH 标准模式、DSH 极简模式,先来看它们的效果,然后耗时、Token 消耗、缓存率与输出速度后面再分析

✦Pi Agent

✦Pi Agent

用时 36分09秒,Token 用量 9.7M tok,缓存命中 98.9%,输出速度(TPS) 未提供

✦DeepSeek Harness 标准模式

✦DeepSeek Harness 标准模式

用时 8分54秒,Token 用量 4.2M tok,缓存命中 98%,输出速度(TPS) 275 tok/s

✦DeepSeek Harness 极简模式

✦DeepSeek Harness 极简模式

用时 40分04秒,Token 用量 1.5M tok,缓存命中 99%,输出速度(TPS) 295 tok/s,任务失败

✦Claude Code

✦Claude Code

用时 9分34秒,Token 用量 3.0M tok,缓存命中 98%,输出速度(TPS) 约 205.5 tok/s

大总结:

只有极简模式失败了,其他三个完成度其实都差不多,我找机必替6-Astra当裁判,看了代码和操作电脑试玩了,它给出的评分也比较符合我的感觉:

实测结果:

  1. 首次打开:四个版本都正常。
  2. 开始、移动、射击、计分:四个版本都能玩。
  3. 暂停与恢复:功能都可用,CC 和 Standard 的提示文字有问题。
  4. 页面刷新:CC、Pi、DSH Standard 正常;DSH Minimal 失败。
  5. 窄屏:Standard 最稳但偏小;CC 需要上下滚动;Pi 首页重叠;DSH Minimal 刷新后空白。

辅助使用方面,Claude Code 和 DSH Standard 的操作按钮标注最好;Pi Agent的手机操作键对键盘和读屏不够友好

最后综合排名是 ① Claude Code ② Pi Agent ③ DSH 标准模式 ④ DSH 极简模式

版本 综合分 评价
Claude Code 9.2 最懂原版。街机竖屏、飞碟、掩体破损等细节齐全,外壳和数据面板也很专业。暂停后按钮仍显示“Pause”,游戏中的 Enter 与“重新开始”说明不一致;手机真机缩放有风险
Pi Agent 8.9 视觉效果最强。画面最大,、星空、发光、爆炸和拖动操作都很抓人,适合演示。窄屏首页出现标题压住计分区、底部文字重叠,难度也偏高
DSH 标准模式 8.7 最稳、最规整。刷新和宽窄屏都正常,玩法完整,整体很克制。电脑端和手机端画面偏小;暂停页同时出现“恢复”和“开始”提示,容易让人困惑
DSH 极简模式 7.2 首次打开的宽屏效果很好,颜色、粒子和射击反馈也很完整。刷新页面后会卡死,只剩空战场

✦耗时、Token 消耗、缓存率与输出速度分析

✦耗时、Token 消耗、缓存率与输出速度分析

deepseek_chart1_overview.png

deepseek_chart2_duration.png

deepseek_chart3_token.png

Claude Code 在交付质量、代码准确率和工程完整性上均位列第一。其上下文管理极其精炼,仅用 Pi Agent 约 1/3 的 Token 和 1/4 的耗时,就拿到了全场最优效果,属于生产级工业落地 ROI 最高的标杆方案

Pi Agent 生成效果紧随 Claude Code,展现出强大的工具链调用和深度推理能力;但代价是极其沉重的上下文膨胀(172 条消息、85 次工具调用),Token 消耗为全场最高(9.7M tok,约为极简模式的 6.4 倍),端到端耗时长达 36 分钟。适合对质量有极致要求、但对成本与耗时完全不敏感的探索性任务

DSH 标准模式以 8分54秒 的极限速度全场领跑,TPS 输出速度高达 275 tok/s,执行非常流畅利落;但在复杂任务的逻辑闭环和细节处理上弱于 Claude Code 和 Pi Agent,综合效果排在第三位。适合作为对交付时效要求极高、任务复杂度适中的日常高吞吐开发工具

DSH 极简模式 Token 消耗做到了全场极致(仅 1.5M tok,比常规方案省下 84.5%),但单次上下文被极端压榨,导致模型缺乏全局视野,不得不通过多轮反复试探和多步反思来推进任务。不仅把总用时反向拉长至 40 分钟(全场最慢),最终效果也垫底

⚠️:以上测试仅限这个任务,环境隔离也不一定理想,仅供参考

给大家提供一个思路,如果你觉得某个模型不太好,或许可以换一个 Harness

作者:Ai学习的老章 公众号:Ai学习的老章

本文由 @Ai学习的老章 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!