一、为什么这一篇要谈「壳」
本系列此前持续讨论 Agent 运行时的内部机制:工具调用、会话状态、上下文管理、失败重试。但一个绕不开的问题是——这些能力最终要装进一个什么样的外壳里,才能让非开发者也能用?
DeepSeek Harness v0.2 预览版提供了一个可观察的样本。需要先明确本文的证据口径:当前唯一可用的信息来源是一篇 CSDN 社区实测文章(community_signal),并非官方一手资料。因此下文所有关于版本号、安装方式、赠金规则、插件使用率、发布稿引语、路线图内容的描述,均属于「该社区文章作者转述或实测所见」,未经官方一手来源核验。凡涉及具体数字与官方表述,本文一律标注来源层级,不做官方事实升级。
本篇不重复运行时内部机制,而是把 Harness 当作一个「外壳工程」案例,看它把哪些能力做进了壳里、哪些还留在边界外。
二、安装与首次配置:命令行门槛被拆掉了
据该社区实测文章描述,上一版需要先在终端执行 npx @deepseek-ai/dsh web 起本地 WebUI;v0.2 的桌面端是一个双击安装的 App,全程不碰终端。该文称官方口径为 macOS 和 Windows 桌面端安装包开箱即用,官网 deepseek.com/harness 下载,装完跟随引导即可工作,版本号从 v0.1.7-rc.2 跳到 v0.2。上述版本号、下载地址与平台支持范围均来自社区文章转述,尚未经官方一手来源核验。
首次打开后的引导流程,据该文描述包含三步:
- 给实例命名;
- 指定一个本地工作区目录——所有读写都发生在这个目录内,建议单独建空文件夹,不要直接指向主目录;
- 登录 DeepSeek 账号。
关于赠金:该社区文章称「官方这轮活动提到,符合条件的用户使用 DeepSeek 账号登录桌面端可获限时 6 元体验赠金,到账后 7 天内有效、限量」,并给出「约 1.2 亿缓存命中输入 token」的换算口径。这些赠金条款、有效期、限量规则与 token 换算数字均来自社区文章转述,本文无法独立核实,读者应以官方渠道实际公示为准。
工程提示:无论赠金规则如何,工作区目录的选择是安全边界的第一道闸。Agent 的读写权限被约束在这个目录内,把它指向主目录等于放弃这层隔离。
三、实测一:脏表清洗与「证据层」设计
据该社区文章描述,官方对 v0.2 的定位是面向日常办公和开发:文档、表格、PDF 可整理分析、生成图表和演示文稿,也能改项目、跑代码。该定位描述同样来自社区转述。
以下为社区实测作者口径。实测素材是一份 65 行的销售明细表,包含日期 6 种写法、金额带「¥」「元」和千分位逗号、同一区域四种叫法、竖向合并单元格、3 行重复、2 行退款负数、2 处空数量。指令是一句自然语言:清洗、去重、退款计负、按月汇总各区域销售额、生成月度对比图、结论做成不超过 5 页 PPT,并保留被剔除问题行的清单。
该文强调的方法论值得借鉴:提前用脚本算好核对基线(该文给出的数字是净销售额 344,720 元、有效记录 62 行)。测 Agent 处理表格最忌「看着像对了」,有基线才能逐条对答案。这些数字是该文作者自建素材的核对结果,不是产品性能指标。
该文认为 v0.2 在这个场景里最值得注意的设计是:生成的文件和每轮代码变更集中展示在对话里,侧栏可直接预览文件内容、查看代码 diff,还能用本地应用打开继续编辑。
这为什么重要?很多 Agent 的交付是「聊天框里一段文字描述它干了什么」,用户要自己去文件系统里找改动。Harness 把「说了什么」和「做了什么」分成两层:对话流负责叙述,diff 面板负责证据。对改代码、改报表这类需要信任判断的场景,这个分层直接决定你敢不敢放手。
该文称整个过程耗时 5 分 23 秒,一轮完成。该耗时为单次社区实测记录,不构成性能承诺。
四、实测二:定时任务把 Agent 变成「值班员工」
据该社区文章描述,v0.2 内置自动化任务插件,在侧栏插件管理页开启后,可把重复性工作设为按计划执行的定时任务,支持查看运行记录、调整执行频率与任务指令。
原理层面:Agent 产品做到今天,「你说一句它干一票」已不是卖点,「你不在场它也能把例行动作干完」才是。定时任务把 Agent 从问答工具变成值班员工。
该文实测任务:每天下班前扫描工作区当天新增文件,汇总成 Markdown 清单并标注疑似重复项。
边界提醒:定时任务意味着 Agent 在你不在场时自主执行。任务指令的措辞、执行频率、工作区范围都需要在开启前想清楚,否则它会在你不知情时反复读写文件。
五、实测三:npm 直装插件与生态分发链路
据该社区文章描述,「一切皆插件」是 Harness 从开源起就强调的设计理念:小到一把工具,大到整个交互界面,都能以插件方式融入。
该文称 v0.2 新增插件管理页面:输入插件的 npm 包名即可安装,不用打开终端;同一页面能停用、卸载、查看插件介绍与来源。
为什么「npm 包名」这个选择值得展开?如果 Harness 本体确为 TypeScript 写的开源运行时,插件直接用 npm 分发,等于把全球最大的包生态变成潜在插件市场。开发者今天把工具发到 npm,明天用户就能在桌面端贴包名装上。这个分发链路比官方审核上架轻得多,也野得多。「本体为 TypeScript 开源运行时」这一前提来自社区文章描述,本文未独立核验。
关于插件使用率:该社区文章称「官方给的佐证数据:按官方模型 API 用户口径,约 60% 的 DeepSeek Harness 用户使用了第三方插件」。该 60% 数字来自社区文章转述的所谓官方口径,本文无法核实其统计方法、样本范围与时间窗口,不应作为官方事实引用。
以下为社区实测作者口径。实测安装的是 ModLens(npm 包名 @liustack/modlens,该文称 MIT 开源、GitHub 约 4k stars),该文称其为 DSH 生态里的第一个视觉插件。它解决的痛点:DeepSeek 旗舰模型是纯文本的,装之前贴截图只会被要文件路径;装之后贴图可直接读。包名、许可证、stars 数均为该文所述,未经本文独立核验。
踩坑记录(社区实测口径):安装搜索时必须输入完整 scoped 名 @liustack/modlens,@ 和 / 一个不能少。输入 modlens 会提示未找到。该文称安装成功后,模型选择器里会出现 DeepSeek (modlens vision) 和 DeepSeek-V4-Pro (modlens vision) 两个条目。
六、实测四:创造模式与「Agent 自造插件」
据该社区文章描述,创造模式标注为实验性:通过对话描述需求,让 Harness 编写和修改插件。创建的插件即时生效、持久保存,并出现在插件管理页面。
注意这里的递归结构:一个 Agent 正在修改承载它自己的壳。插件系统属于壳,壳里的 Agent 又有权扩展壳。
该文实测题目较克制:造一个「工作区字数统计」小插件,统计当前工作区所有 Markdown 文件总字数,作为可在对话里调用的工具。
这个功能的产品意义不在于「每个人都需要自己写插件」,而在于把定制成本打到「会说话就会」的量级。
七、横向定位:五个壳放在一张桌子上
以下为定位对比,不是跑分横评。各产品定位描述基于公开资料与该社区文章作者的上手印象,不作为能力结论,也不代表本文对各家产品做过独立评测。
| 维度 | DeepSeek Harness | Claude Code | WorkBuddy | Trae | Qoder |
|---|---|---|---|---|---|
| 本质 | Agent 运行时 + 桌面壳 | 编程 Agent(CLI 为核) | AI 工作台 | AI IDE | AI 编程平台 |
| 开源 | MIT,可自改自建 | 闭源 | 闭源 | 主体闭源 | 闭源 |
| 主场 | 桌面 GUI,办公+开发 | 终端/IDE,纯开发 | 办公协作 | 写代码 | 写代码 |
| 扩展 | 一切皆插件(npm 直装)+ Agent 自造插件 | MCP 生态 | 技能+连接器 | 内置能力迭代 | 内置能力迭代 |
| 模型 | DeepSeek 系 | Anthropic 系 | 混元等多模型 | 豆包系等 | 千问系等 |
三个判断:
第一,Harness 桌面版抢的不是 Cursor/Trae/Qoder 的编程份额,那些产品背后是开发者「IDE 长在身上」的肌肉记忆。它抢的是「听说了 Claude Code 很神但装不上手」的泛知识工作者。装 App、指文件夹、说人话派活,三个「谁不会」是它的普惠刀法。
第二,开源壳是它难以复制的身份。WorkBuddy、Claude Code 再强,用的都是别人调教好的黑盒。若 Harness 这层壳确为 MIT,企业可以把调度逻辑、权限策略、数据存储拆开重做。对「数据不能出域」的场景,这一条就够进选型名单。但壳开源不等于体验开源,私有调教的部分未必在仓库里。该开源属性来自社区文章描述,选型前应自行核验仓库许可证。
第三,「Agent 自造插件」目前只有它端上桌。各家都有 MCP/技能/连接器生态,但生态都是「人给 Agent 装手」;创造模式是「Agent 给自己装手」。哪怕现在还实验、还粗糙,方向上是个独苗。
八、三盆冷水
-
该社区文章称官方自己仍在说「尚未成熟」,并引用发布稿原话「尚在起步阶段,功能与体验仍有待细致打磨」,创造模式明确标注实验性。该引语来自社区文章转述,本文未取得官方发布稿原文核验。 若 v0.2 确为 preview,把重要资料交给它批量操作前先备份是稳妥做法。
-
定时任务和插件权限是安全面。一个会按计划自主执行、还能装任意 npm 包的 Agent,等于给实习生开了永久门禁加自带工具箱。工作区目录要选对,插件包名要认得来路。
-
生态数据要换角度看。即便「60% 用户用第三方插件」这一社区转述数字成立,它也同时说明官方内置能力还盖不住用户主要需求。插件市场、插件 API 稳定性都还在路上。
九、对系列的意义
把这次社区实测浓缩成一句话:DeepSeek 正在把「Agent 产品」的定义权,从「谁的模型强」挪到「谁的壳好用、谁的壳开源」。
该社区文章还转述了发布稿中「日均活跃用户、日均会话数口径下,Harness 已成为最受 DeepSeek API 用户欢迎的 Coding Agent」,以及「与模型共同进化——在模型训练中优化 Harness 中的表现」。这些引语均来自社区转述,未经官方一手来源核验,仅作为观察信号而非结论。 若属实,则模型和壳的耦合在加深。
该文还提到路线图上列出沙箱与安全、长期记忆、浏览器和 GUI 自动化、远程与移动端、官方插件市场。该路线图内容同样来自社区文章转述。 若属实,每一个都对应今天版本的一块短板。
对我们这个系列而言,Harness 的价值在于提供了一个可拆解的外壳参照:哪些能力应该做进壳里(工作区隔离、diff 证据层、插件管理页),哪些应该留给运行时(工具调度、上下文压缩、失败重试),哪些还在边界外(沙箱、长期记忆、移动端)。这些取舍,正是手搓生产级 Agent 时迟早要面对的。
最后重申证据边界:本文所有关于 DeepSeek Harness v0.2 的具体功能、版本号、赠金规则、插件使用率、发布稿引语与路线图内容,均来自单一社区实测文章的转述,未经官方一手来源核验。读者在做出选型或生产决策前,应自行查阅官方文档与仓库进行验证。