一、为什么这一篇要谈「壳」

本系列此前持续讨论 Agent 运行时的内部机制:工具调用、会话状态、上下文管理、失败重试。但一个绕不开的问题是——这些能力最终要装进一个什么样的外壳里,才能让非开发者也能用?

DeepSeek Harness v0.2 预览版提供了一个可观察的样本。需要先明确本文的证据口径:当前唯一可用的信息来源是一篇 CSDN 社区实测文章(community_signal),并非官方一手资料。因此下文所有关于版本号、安装方式、赠金规则、插件使用率、发布稿引语、路线图内容的描述,均属于「该社区文章作者转述或实测所见」,未经官方一手来源核验。凡涉及具体数字与官方表述,本文一律标注来源层级,不做官方事实升级。

本篇不重复运行时内部机制,而是把 Harness 当作一个「外壳工程」案例,看它把哪些能力做进了壳里、哪些还留在边界外。

二、安装与首次配置:命令行门槛被拆掉了

据该社区实测文章描述,上一版需要先在终端执行 npx @deepseek-ai/dsh web 起本地 WebUI;v0.2 的桌面端是一个双击安装的 App,全程不碰终端。该文称官方口径为 macOS 和 Windows 桌面端安装包开箱即用,官网 deepseek.com/harness 下载,装完跟随引导即可工作,版本号从 v0.1.7-rc.2 跳到 v0.2。上述版本号、下载地址与平台支持范围均来自社区文章转述,尚未经官方一手来源核验。

首次打开后的引导流程,据该文描述包含三步:

  1. 给实例命名;
  2. 指定一个本地工作区目录——所有读写都发生在这个目录内,建议单独建空文件夹,不要直接指向主目录;
  3. 登录 DeepSeek 账号。

关于赠金:该社区文章称「官方这轮活动提到,符合条件的用户使用 DeepSeek 账号登录桌面端可获限时 6 元体验赠金,到账后 7 天内有效、限量」,并给出「约 1.2 亿缓存命中输入 token」的换算口径。这些赠金条款、有效期、限量规则与 token 换算数字均来自社区文章转述,本文无法独立核实,读者应以官方渠道实际公示为准。

工程提示:无论赠金规则如何,工作区目录的选择是安全边界的第一道闸。Agent 的读写权限被约束在这个目录内,把它指向主目录等于放弃这层隔离。

三、实测一:脏表清洗与「证据层」设计

据该社区文章描述,官方对 v0.2 的定位是面向日常办公和开发:文档、表格、PDF 可整理分析、生成图表和演示文稿,也能改项目、跑代码。该定位描述同样来自社区转述。

以下为社区实测作者口径。实测素材是一份 65 行的销售明细表,包含日期 6 种写法、金额带「¥」「元」和千分位逗号、同一区域四种叫法、竖向合并单元格、3 行重复、2 行退款负数、2 处空数量。指令是一句自然语言:清洗、去重、退款计负、按月汇总各区域销售额、生成月度对比图、结论做成不超过 5 页 PPT,并保留被剔除问题行的清单。

该文强调的方法论值得借鉴:提前用脚本算好核对基线(该文给出的数字是净销售额 344,720 元、有效记录 62 行)。测 Agent 处理表格最忌「看着像对了」,有基线才能逐条对答案。这些数字是该文作者自建素材的核对结果,不是产品性能指标。

该文认为 v0.2 在这个场景里最值得注意的设计是:生成的文件和每轮代码变更集中展示在对话里,侧栏可直接预览文件内容、查看代码 diff,还能用本地应用打开继续编辑。

这为什么重要?很多 Agent 的交付是「聊天框里一段文字描述它干了什么」,用户要自己去文件系统里找改动。Harness 把「说了什么」和「做了什么」分成两层:对话流负责叙述,diff 面板负责证据。对改代码、改报表这类需要信任判断的场景,这个分层直接决定你敢不敢放手。

该文称整个过程耗时 5 分 23 秒,一轮完成。该耗时为单次社区实测记录,不构成性能承诺。

四、实测二:定时任务把 Agent 变成「值班员工」

据该社区文章描述,v0.2 内置自动化任务插件,在侧栏插件管理页开启后,可把重复性工作设为按计划执行的定时任务,支持查看运行记录、调整执行频率与任务指令。

原理层面:Agent 产品做到今天,「你说一句它干一票」已不是卖点,「你不在场它也能把例行动作干完」才是。定时任务把 Agent 从问答工具变成值班员工。

该文实测任务:每天下班前扫描工作区当天新增文件,汇总成 Markdown 清单并标注疑似重复项。

边界提醒:定时任务意味着 Agent 在你不在场时自主执行。任务指令的措辞、执行频率、工作区范围都需要在开启前想清楚,否则它会在你不知情时反复读写文件。

五、实测三:npm 直装插件与生态分发链路

据该社区文章描述,「一切皆插件」是 Harness 从开源起就强调的设计理念:小到一把工具,大到整个交互界面,都能以插件方式融入。

该文称 v0.2 新增插件管理页面:输入插件的 npm 包名即可安装,不用打开终端;同一页面能停用、卸载、查看插件介绍与来源。

为什么「npm 包名」这个选择值得展开?如果 Harness 本体确为 TypeScript 写的开源运行时,插件直接用 npm 分发,等于把全球最大的包生态变成潜在插件市场。开发者今天把工具发到 npm,明天用户就能在桌面端贴包名装上。这个分发链路比官方审核上架轻得多,也野得多。「本体为 TypeScript 开源运行时」这一前提来自社区文章描述,本文未独立核验。

关于插件使用率:该社区文章称「官方给的佐证数据:按官方模型 API 用户口径,约 60% 的 DeepSeek Harness 用户使用了第三方插件」。该 60% 数字来自社区文章转述的所谓官方口径,本文无法核实其统计方法、样本范围与时间窗口,不应作为官方事实引用。

以下为社区实测作者口径。实测安装的是 ModLens(npm 包名 @liustack/modlens,该文称 MIT 开源、GitHub 约 4k stars),该文称其为 DSH 生态里的第一个视觉插件。它解决的痛点:DeepSeek 旗舰模型是纯文本的,装之前贴截图只会被要文件路径;装之后贴图可直接读。包名、许可证、stars 数均为该文所述,未经本文独立核验。

踩坑记录(社区实测口径):安装搜索时必须输入完整 scoped 名 @liustack/modlens,@ 和 / 一个不能少。输入 modlens 会提示未找到。该文称安装成功后,模型选择器里会出现 DeepSeek (modlens vision) 和 DeepSeek-V4-Pro (modlens vision) 两个条目。

六、实测四:创造模式与「Agent 自造插件」

据该社区文章描述,创造模式标注为实验性:通过对话描述需求,让 Harness 编写和修改插件。创建的插件即时生效、持久保存,并出现在插件管理页面。

注意这里的递归结构:一个 Agent 正在修改承载它自己的壳。插件系统属于壳,壳里的 Agent 又有权扩展壳。

该文实测题目较克制:造一个「工作区字数统计」小插件,统计当前工作区所有 Markdown 文件总字数,作为可在对话里调用的工具。

这个功能的产品意义不在于「每个人都需要自己写插件」,而在于把定制成本打到「会说话就会」的量级。

七、横向定位:五个壳放在一张桌子上

以下为定位对比,不是跑分横评。各产品定位描述基于公开资料与该社区文章作者的上手印象,不作为能力结论,也不代表本文对各家产品做过独立评测。

维度 DeepSeek Harness Claude Code WorkBuddy Trae Qoder
本质 Agent 运行时 + 桌面壳 编程 Agent(CLI 为核) AI 工作台 AI IDE AI 编程平台
开源 MIT,可自改自建 闭源 闭源 主体闭源 闭源
主场 桌面 GUI,办公+开发 终端/IDE,纯开发 办公协作 写代码 写代码
扩展 一切皆插件(npm 直装)+ Agent 自造插件 MCP 生态 技能+连接器 内置能力迭代 内置能力迭代
模型 DeepSeek 系 Anthropic 系 混元等多模型 豆包系等 千问系等

三个判断:

第一,Harness 桌面版抢的不是 Cursor/Trae/Qoder 的编程份额,那些产品背后是开发者「IDE 长在身上」的肌肉记忆。它抢的是「听说了 Claude Code 很神但装不上手」的泛知识工作者。装 App、指文件夹、说人话派活,三个「谁不会」是它的普惠刀法。

第二,开源壳是它难以复制的身份。WorkBuddy、Claude Code 再强,用的都是别人调教好的黑盒。若 Harness 这层壳确为 MIT,企业可以把调度逻辑、权限策略、数据存储拆开重做。对「数据不能出域」的场景,这一条就够进选型名单。但壳开源不等于体验开源,私有调教的部分未必在仓库里。该开源属性来自社区文章描述,选型前应自行核验仓库许可证。

第三,「Agent 自造插件」目前只有它端上桌。各家都有 MCP/技能/连接器生态,但生态都是「人给 Agent 装手」;创造模式是「Agent 给自己装手」。哪怕现在还实验、还粗糙,方向上是个独苗。

八、三盆冷水

  1. 该社区文章称官方自己仍在说「尚未成熟」,并引用发布稿原话「尚在起步阶段,功能与体验仍有待细致打磨」,创造模式明确标注实验性。该引语来自社区文章转述,本文未取得官方发布稿原文核验。 若 v0.2 确为 preview,把重要资料交给它批量操作前先备份是稳妥做法。

  2. 定时任务和插件权限是安全面。一个会按计划自主执行、还能装任意 npm 包的 Agent,等于给实习生开了永久门禁加自带工具箱。工作区目录要选对,插件包名要认得来路。

  3. 生态数据要换角度看。即便「60% 用户用第三方插件」这一社区转述数字成立,它也同时说明官方内置能力还盖不住用户主要需求。插件市场、插件 API 稳定性都还在路上。

九、对系列的意义

把这次社区实测浓缩成一句话:DeepSeek 正在把「Agent 产品」的定义权,从「谁的模型强」挪到「谁的壳好用、谁的壳开源」。

该社区文章还转述了发布稿中「日均活跃用户、日均会话数口径下,Harness 已成为最受 DeepSeek API 用户欢迎的 Coding Agent」,以及「与模型共同进化——在模型训练中优化 Harness 中的表现」。这些引语均来自社区转述,未经官方一手来源核验,仅作为观察信号而非结论。 若属实,则模型和壳的耦合在加深。

该文还提到路线图上列出沙箱与安全、长期记忆、浏览器和 GUI 自动化、远程与移动端、官方插件市场。该路线图内容同样来自社区文章转述。 若属实,每一个都对应今天版本的一块短板。

对我们这个系列而言,Harness 的价值在于提供了一个可拆解的外壳参照:哪些能力应该做进壳里(工作区隔离、diff 证据层、插件管理页),哪些应该留给运行时(工具调度、上下文压缩、失败重试),哪些还在边界外(沙箱、长期记忆、移动端)。这些取舍,正是手搓生产级 Agent 时迟早要面对的。

最后重申证据边界:本文所有关于 DeepSeek Harness v0.2 的具体功能、版本号、赠金规则、插件使用率、发布稿引语与路线图内容,均来自单一社区实测文章的转述,未经官方一手来源核验。读者在做出选型或生产决策前,应自行查阅官方文档与仓库进行验证。