DeepSeek Harness 深度评测
DeepSeek Harness 深度评测
一句话结论:DeepSeek Harness 是 2026 年开源社区最值得关注的技术事件之一,它用"一切皆插件"的激进理念重新定义了 Agent 框架的边界,但作为开发者预览版,它离"开箱即用"还有一段距离——适合愿意折腾的技术人,不适合追求稳定的普通用户。
产品概览
2026 年 8 月 13 日晚 20:30,DeepSeek 正式发布并开源了其首个 Harness 产品。与常见的"模型即产品"路线不同,Harness 定位为 Agent 运行框架:模型是大脑,Harness 是手脚,负责文件读写、工具调用、上下文管理与任务持续执行。官方给出的核心理念是"一切皆插件"——模型、工具、技能、界面、审批策略乃至 Agent 主循环,全部可以拆开替换。
产品形态上,Harness 提供本地 Web UI、命令行一次性任务(dsh --profile headless "任务")以及官方 Python SDK(pip install deepseek-harness-sdk)三种使用方式。本地安装只需一行命令 npx @deepseek-ai/dsh web,浏览器打开 127.0.0.1:3080 即进入界面,会话、日志、数据全部留在本地。从安装到跑通第一个任务,实测几分钟即可完成。
发布热度方面,GitHub 仓库 deepseek-ai/deepseek-harness 公开 12 小时 Star 突破 5 万,头两小时涨速是此前增长最快仓库 OpenClaw 的约 80 倍,被开发者社区称为"Agent 界的 Android"。
版本与模型
当前版本为开发者预览版(Developer Preview),官方明确提示未来会出现破坏性兼容变更。模型方面,Harness 不锁死 DeepSeek 自家模型,官方支持接入 Anthropic、OpenAI 以及自定义 OpenAI 兼容端点,模型路由随时可换。实测中,DeepSeek V4 Pro 接入 Harness 后缓存命中率约 99%,比接入 Claude Code 时的 98% 高 1 个百分点。
定价与套餐
Harness 本体免费开源,模型调用按量计费。2026 年 8 月 13 日晚,DeepSeek 同步宣布了模型调价。发布当晚有媒体实测两个任务(重构极客公园官网、调 GitHub API 画涨星曲线),全程 token 花费不到 3 元。会话底部有实时统计,展示步骤数、模型耗时、输入输出 token 与缓存命中率,费用透明可控。
核心功能解析
四种工作模式
Harness 提供四种工作模式,覆盖从"直接干活"到"自定义一切"的完整光谱。标准模式功能最完整,适合日常任务;PTC 程序化工具调用模式用代码组织多步工具调用,适合批量、结构化任务;极简模式只保留 Shell 与文本编辑器两个工具,最可控——官方 V4-Flash 刷榜 Terminal Bench 用的就是极简模式;创造模式则允许用户自定义整套 Agent 预设,等同 shell 权限。
实测中,用两种模式分别制作独立咖啡店单页官网(品牌介绍、6 款饮品菜单、营业时间、菜单分类切换与饮品详情),结构与功能都正常,两种模式几乎没有差距。这说明模式选择更多是"控制粒度"的取舍,而非能力高下之分。
轨迹回放
模型看到的一切都写入只增不改的日志:系统提示词、思维链、每一次工具调用与返回结果全部留痕,任务过程可完整回看。这一设计被 Hacker News 开发者称为 killer feature,并指出美国模型厂商 API 恰恰把这层数据藏了起来。对于需要审计、调试或教学场景的用户,这几乎是杀手级能力——你能精确看到模型每一步在做什么、为什么这么做。
安全机制
内置进程沙箱,提供只读、工作区可写、完全访问三档权限模式。涉及高权限操作时 Web UI 会弹窗审批;对不熟悉的项目可先用只读模式,风险可控。这解决了 Agent 类工具"放权与安全"的核心矛盾,尤其适合处理不信任的第三方代码或敏感数据。
插件生态
内测阶段开发者已做出约 300 个插件,包括 Windows XP 复古皮肤、干完活发表情包的插件、官方插件库的 DSH-OpenPencil(对话中实时预览交互设计文件)等。给现有 Agent 装插件只需把仓库链接丢给 Harness 自行安装,这大大降低了扩展门槛。实测中,做数据看板时第一次跑两个半小时未完成,调用视觉插件后约 3 分钟交付——插件对效率的提升是数量级的。
用户口碑
开发者社区对 Harness 的评价呈现明显分化。在 Hacker News 的讨论中,技术型用户对"一切皆插件"的架构设计和轨迹透明度评价很高,认为改造空间大,有人直言"这才是 Agent 框架该有的样子"。多位开发者提到,插件机制让 Harness 可以适配各种奇特的个人工作流,这是其他框架难以比拟的。
另一部分声音则集中在使用体验上。有用户认为安装与配置过程不如成熟工具顺畅,部分基础功能不够完善;第三方对比测试显示,同款 V4-Flash 接入另一个开源 harness Pi 的 token 消耗只有 DeepSeek Harness 的三成多,这引发了关于框架效率的讨论。此外,长任务和并行执行偶发问题、文档偏工程化且部分进阶能力仍在完善,也是社区反馈中反复出现的痛点。
优点与不足
优点:
- 架构理念激进且清晰,"一切皆插件"给了用户极大的定制空间,实测中调对插件后效率提升明显
- 轨迹回放设计透明彻底,模型每一步操作都可审计,这是目前市面上少见的诚意
- 模型不锁死,支持多家 API 接入,且 DeepSeek V4 Pro 的缓存命中率表现优异
- 本地部署、数据留存本地,隐私友好
- 本体免费开源,token 消耗成本可控
不足:
- 开发者预览阶段版本不稳定,官方已提示未来会有破坏性兼容变更
- 长任务和并行执行偶发问题,对工具配置比较敏感
- 部分基础功能不够完善,文档偏工程化,普通用户学习成本高
- 默认配置下 token 消耗偏高(对比同类框架),需要手动调优
编辑部评分
| 维度 | 得分 |
|---|---|
| 功能完整度 | 7 |
| 易用性 | 6 |
| 创新性 | 10 |
| 稳定性 | 6 |
| 生态潜力 | 9 |
| 综合分 | 7.6 |
适合谁与选购建议
推荐给:
- 愿意尝鲜的技术人、独立开发者,尤其是对 Agent 架构有自己想法、想深度定制工作流的人
- 需要审计、调试 Agent 行为的团队,轨迹回放功能价值极高
- 对数据隐私敏感、希望本地运行的用户
不推荐给:
- 追求稳定开箱即用的普通用户,建议等待正式版
- 对 token 成本敏感、且不愿花时间调优配置的团队——默认配置下消耗偏高,需要投入学习成本才能优化
结语
DeepSeek Harness 的发布,像是往 Agent 生态里扔了一颗深水炸弹。"一切皆插件"的架构理念和轨迹透明的设计,让它在一众黑盒 Agent 工具中显得格外醒目。它不完美——预览版的不稳定、文档的工程化、默认配置的效率问题都是实打实的短板——但它代表了一种值得期待的方向:Agent 框架不应该是一个封闭的"黑箱",而应该是一个可以被理解、被拆解、被重新组装的基础设施。对于愿意动手的人来说,这正是它最大的价值。
—— Xool 评测组


