一句话搞懂 DeepSeek Harness

如果把 DeepSeek【模型】 比作一个“聪明的大脑”, DeepSeek Harness 就是给它配备的“全套工作台与机械手臂” ——让原本只会动嘴聊天的 AI,能够真正拿起工具帮你操作电脑、查资料、改文件和写代码。

对比Codex、Claude、Workbuddy、有什么区别?

DeepSeek Harness(dsh) 是 DeepSeek 于 2026 年 8 月开源的 Agent 运行时框架(MIT 许可,开发者预览版)。核心公式是 Agent = Model + Harness,强调“一切皆插件”(Everything is a Plugin),基于 Cordis 内核,模型、工具、技能、会话、沙箱、循环、UI 等全部可替换、可组合。

DeepSeek Harness 是“可拆装的 Agent 底盘”,适合想深度定制和二次开发的人;Codex/Claude Code 是“成熟的编程专车”;WorkBuddy 是“职场全能打工人”。如果你要自由组合、低成本、可扩展,选 Harness;要稳定开箱即用写代码,选 Codex/Claude Code;要办公自动化,选 WorkBuddy。

DeepSeek Harness 热度高,代表它真的强大吗?

DeepSeek Harness(dsh)刚开源即火爆(GitHub 短时间数万星),评价高度分化:开发者狂赞架构,普通用户 / 日常编码者吐槽体验。核心共识是“底层骨架很强,面向人的皮肤还没长出来”。

简单理解它的核心优缺点(社区集中讨论吐槽)

优点(它厉害在哪)

  • 特别省钱:同样干活,花费往往只要别人的几十分之一,甚至几毛钱就能跑完一个任务。
  • 非常自由:几乎所有功能都能像搭积木一样自己换、自己加,想怎么改就怎么改。
  • 过程全透明:它每一步在干什么都能看清楚、能回放,出了问题容易查。
  • 能干复杂活:能自己读文件、改内容、跑命令,完成从想法到成品的多步骤任务。
  • 完全开源免费:代码公开,想自己部署、二次开发都行,不用被某家公司绑死。

缺点(哪里让人头疼)

  • 对小白不友好:界面和操作偏“工程师风格”,术语多,第一次用容易懵,不知道从哪下手。
  • 还在早期测试阶段:容易出小毛病(卡住、显示不准、偶尔翻车),复杂任务常常需要人盯着改。
  • 上手要花时间:安装和设置有点麻烦,不像点开就能直接用的成熟软件。
  • 默认体验一般:开箱即用时不一定比现成的工具更顺手,需要自己调才能发挥实力。
  • 缺“眼睛”:目前还不擅长直接看图片、看界面,主要靠文字和代码工作。

一句话总结:
它像一台能自己组装的“高级工具箱”,强大又便宜,但目前更适合愿意动手折腾的人;普通用户想省心直接干活,可能还是现成的成熟产品更合适。

比如Codex、Claude、workbuddy等成熟产品,但是这些成熟产品的局限性也非常明显:深度模型绑定、自由度太低、功能需求依赖官方更新,相较而言,DSH的自由定制优势会有更大的扩展空间,以应对随着你的使用,越来越复杂的使用场景。

依然建议非技术人员、小白、文科生上手学习。

强大在哪里?

  1. 极致插件化架构(“Everything is a Plugin”)
    模型、工具、技能、会话、沙箱、循环、UI 全部可替换,配置层自由组合,无需改源码。被称为“Agent 时代的 Android”或“自组装台式机”,扩展性远超 Claude Code / Codex。支持动态加载/卸载,甚至能让 Agent 自己写插件扩展自己。
  2. 完全可追溯的事件流 / 会话日志
    模型看到的一切(提示词、工具调用、子 Agent、结果)都写入 append-only 日志。支持恢复、分叉、回放、检索。排查问题是“宝藏”,黑盒问题被打开。
  3. 成本极低 + 缓存命中率高
    配合 DeepSeek V4 系列,单任务成本常低至 0.2 元甚至更低(有报告称完整编程任务约 1 美元量级,远低于海外竞品)。实测缓存命中率常达 90-99%(甚至 99%+),长任务 token 效率好。首 token 快(约 0.8s),工具调用平均约 2.4s。
  4. 工程化落地能力强
    真正能读仓库、改文件、跑命令、子 Agent 并行、计划/目标驱动、错误恢复。长任务稳定性被夸(有量化交易背景设计痕迹)。四种模式(标准 / PTC 代码编排 / 极简 / 创造)灵活。支持多模型,还能把 Claude Code / Codex 当子 Agent 调用。
  5. 开源 + 可玩性高
    MIT 许可,社区快速出插件/启动器/监控工具。实测能独立完成 3D 魔方、坦克大战、陀飞轮动画等复杂任务(纠错后上限不低)。对探索“自进化 Agent”的团队很有吸引力。
  6. 透明可控
    实时显示 token/s、缓存命中率、轨迹等,成本可见。

典型评价:“架构设计 9-9.5/10,未来 Agent Runtime 潜力 9.5/10”“对探索自进化 Agent 的工程团队,搭出了目前其他方案没有的底层骨架”。

不足在哪里?

  1. 用户体验差,上手门槛高(最集中批评)
    “底层架构很强,用户体验很差”“已经造出很强的 Agent 骨架,但还没长出面向人的皮肤”。UI 工程师味重、术语多、文档偏工程化。普通用户反馈“字都认识,但愣是看不懂”“不会用”。安装需 Node.js + 大量依赖,国内网络可能踩坑(GitHub/npm)。轨迹功能对开发者是宝,对普通用户是噪音。
  2. 仍是开发者预览版,毛刺多、不稳定
    官方明确会有破坏性变更。实测有 UI 状态滞后(显示 5/9 完成,实际已全完成)、流式输出变慢、ask_user_question 卡死、历史加载失败、长任务/并行执行问题、对工具配置敏感。复杂任务常需人工验收和纠错,不是“放飞自我就能完事”。
  3. Token 效率并非最优
    虽然成本低,但有对比称同模型在其他 harness(如 Pi)token 消耗更低(有报告称仅 dsh 的 1/3 左右)。默认配置可能偏“重”,对日常简单编码显得多余。
  4. 缺视觉/多模态,模型“没有眼睛”
    常被吐槽模型执着于“想看到自己的工作”,影响部分任务。需要用社区插件调用其他模型补视觉。
  5. 学习曲线与生态早期
    Cordis 内核小众,配置系统(patch 非 deep merge)易踩坑。API 稳定性低(官方主动放弃兼容),核心暂不收外部 PR。插件生态刚起步,成熟度远不及商业产品。对绝大多数日常写代码的开发者“重得毫无必要”。
  6. 默认表现未必最稳
    可塑性强,调对工具后提升明显,但开箱默认不一定优于成熟工具。长任务耗时可能较长(半小时+),需盯着。

典型评价:“对日常开发者重而无必要,对自进化探索者是新骨架”“能干活,但得盯着”“当前取代 Codex/Claude Code 当生产力工具大概 6.5/10”。