DeepSeek Harness实测:Agent界Android为何一夜爆火5万星
北京时间 8 月 13 日晚 8 点 30 分,DeepSeek 正式发布了自成立以来首个 Agent 产品——此前已预热许久、备受关注的 DeepSeek Harness。截至发稿时,它的 GitHub 仓库 star 数已经突破 5 万,而从仓库公开到现在仅过去了 12 个小时。DeepSeek
北京时间 8 月 13 日晚 8 点 30 分,DeepSeek 正式发布了自成立以来首个 Agent 产品——此前已预热许久、备受关注的 DeepSeek Harness。
截至发稿时,它的 GitHub 仓库 star 数已经突破 5 万,而从仓库公开到现在仅过去了 12 个小时。

DeepSeek Harness GitHub 主页截至发稿时已突破 5 万 star|图片来源:GitHub
DeepSeek 对它的最新定义,其实和不少同类产品相似:模型加上 Harness,才真正构成 Agent。模型像大脑,Harness 像手脚;聊天机器人交付的是一段回答,而 Agent 交付的是一个实际完成的任务。
发布当晚,我们第一时间把它部署到自己的电脑里,让它完成了两项任务:一是按照 The Verge 的风格重构极客公园官网,二是调用 GitHub 接口,绘制出它自己的涨星曲线。这两项任务都顺利交付,全程消耗的 token 成本不到 3 元。
不过,它目前也的确还属于“毛坯房”阶段:界面对不会写代码的用户并不算友好,开发者预览版的粗糙感随处可见。连续使用 12 个小时后,我们的直观感受是——DeepSeek 现在并不是要给你一个完整成品,而是先交付一套等待开发者自行组装的零件系统。
01 「一切皆插件」
GitHub 仓库在正式公布前半小时就已悄然公开,随后我们见证了它的增长速度:21:05 查询时为 7,283 个 star,21:51 再查时升至 15,530 个。公布不到两小时,star 破万;到了今天早上再看,已经超过了 5 万。
在这之前,被称为史上增长最快仓库的 OpenClaw,用 84 天涨到 20 万 star,平均每小时约 99 个。而 DSH 在最初两个小时里的涨速,达到了它的 80 倍。
目前,DeepSeek Harness 还不是一个云端 Agent 服务:只要在装有 Node.js 的电脑上输入一行「npx @deepseek-ai/dsh web」,再用浏览器打开本地 3080 端口,就能进入它的全部界面。会话、日志和数据都保留在本地,浏览器更像是它的外壳。
新建会话页面上写着它的 slogan:「探索未至之境」,英文原文是 Into the Unknown,旁边还带有「预览版」角标。首次启动时,还会弹出一条“内部测试提示”,大意是 0.1 版本仍主要面向 Harness 开发者测试,核心插件和基础接口会在未来几个月内快速演进。换句话说:这是一款给开发者尝鲜的 Agent 开发框架,而不是面向普通用户的成熟产品。
它最激进、也是发布后 12 小时内争议最大的设计理念,就是「一切皆插件」。

插件化概念是 DeepSeek Harness 的核心|图片来源:极客公园
模型、工具、界面、审批策略,甚至驱动整个 Agent 运转的主循环本身,几乎都可以拆开替换:如果你愿意,连整个前端界面都可以改成自己喜欢的样子。比如我在上手的第一时间,就通过 Prompt 把它改成了自己更偏爱的洋红色主题。

DeepSeek 允许用户自由替换各种组件,甚至包括 Web UI 前端|图片来源:极客公园
允许用户直接修改 Harness 的 Web 前端,这个细节本身就说明了 DeepSeek Harness 的底层开发思路:它并不是一个封闭产品,而是一个由大量插件拼装而成的开放生态系统。只要你愿意动手适配这套机制,就能搭建出一套独特且专属于自己的 Agent 工作流。

按照最新文档的说法,DeepSeek Harness 目前内置了标准、极简、代码、创造四种 Agent 预设。V4-Flash 上个月在 Terminal Bench 刷榜时使用的,正是其中的极简模式——当时 API 更新日志里提到的「即将发布的 DeepSeek Harness」,如今终于正式上线。

目前 DeepSeek Harness 内置了 4 种 Agent 模式预设,也支持手动添加自定义预设|图片来源:极客公园
开放生态带来的结果,比想象中来得更快。内测阶段的开发者在几天内就做出了大约 300 个插件:有人给它换上 Windows XP 风格的复古皮肤,也有人做了表情包插件,让它完成工作后顺手给你发一张“大肥鱼”表情包。这些丰富玩法恰恰说明:这个 Agent 框架里,几乎没有什么是被彻底焊死的。
但 star 涨得越快,质疑来得也越快。发布第二天,开发者社区对它的评价开始出现明显分化:无论是 DeepSeek Harness 当前的使用体验,对非程序员并不友好,还是围绕插件建立起来的整体生态逻辑,都引发了不少讨论与争议。
这些批评并不是冲着模型本身去的,几乎都集中在 Harness 这一层“壳”上。这个壳到底表现如何,我们在发布当晚做的两项实测,正好可以作为对照。
上手 Harness 之后,我做的第一个测试,就是让它重构极客公园官网:我把极客公园的网址交给它,再要求它参考 The Verge 的风格,输出一版新的网页设计方案。

这个任务主要测试另一个关键问题:它究竟会不会真的去查看这两个网站页面。

这是 DeepSeek Harness 最终实际生成的效果:客观来说,这个页面在格式和交互上仍存在一些细节问题,但当你借助 DeepSeek Harness 的插件式架构,继续安装更多与模型能力、设计能力相关的 Agent 插件后,整个页面就能在快速迭代中逐步变得更现代、更完整。

例如,虽然 DeepSeek Harness 默认并不内置画板功能,但你完全可以通过安装插件来补齐;在最新插件库中,就已经有一个现成的 DSH-OpenPencil 插件。安装之后,你可以直接在对话过程中实时预览交互设计文件,让原本相对单调的 Web UI,直接升级为一个可用于设计交付的工具界面。

此外,为了进一步验证这次的图片生成能力与数据提取能力,我还直接用 DeepSeek Harness 生成了一张从昨晚到今天早上的 GitHub star 增长趋势图:
提示词:用 GitHub 的公开 API 查一下 deepseek-ai/deepseek-harness 这个仓库的 star 数据,结合这几个我们人工记录的时间点:8 月 13 日 21:05 是 7,283,21:51 是 15,530,8 月 14 日 8:53 是 44,514。画一张 star 增长曲线图,横轴时间、纵轴 star 数,标注关键节点,存成图片。

DeepSeek Harness 设有一个「轨迹」页,模型在执行过程里看到的全部信息都会被完整记录,包括系统提示词、思维链、每一次工具调用以及对应的返回结果。因此,它到底是真实抓取了页面内容,还是基于训练记忆中的印象去“脑补”出一个 Verge 风格页面,只要查看这些记录,就能直接核对清楚。这种「全程留痕」,正是它与传统聊天机器人在架构层面的根本差异之一——聊天工具通常只保留最终回答,而 DeepSeek Harness 保存的是任务执行过程中的每一步。
这一设计,也是它在 Hacker News 上收获最多好评的亮点之一。有开发者把“模型看到的一切都写入只增不改的日志”称作 killer feature,还特别指出,美国一些模型厂商的 API 恰恰把这一层关键数据隐藏了起来。
算一笔账
Harness 本身是免费开源的,但模型调用仍然按照正常规则收费:目前我们测试时采用的,还是 13 日晚 DeepSeek 官宣涨价之前的模型价格,因此整体仍然可以算是“量大管饱”。事实上,这篇文章中所有 Demo 测试全部做下来,消耗的 Token 成本也没有超过 3 元。

此外,DeepSeek Harness 还会主动帮用户把成本算清楚:每个会话底部都提供实时统计,这一轮执行了几步、模型耗时几秒、输入输出各消耗多少 token,甚至缓存命中率是多少,都会完整展示出来。
而争议恰恰也集中在这一点上。
发布次日,一项在开发者圈中流传的第三方对比数据显示,同样是接入 V4-Flash,使用另一套开源 harness——Pi 时,token 消耗仅为 DeepSeek Harness 的三成多。
从我们的实际体验来看,除了 V4 Pro Max 依然保持着量大管饱的特征之外,当前直接使用 DeepSeek V4 Flash 时,不仅响应速度更快,而且在内容生成准确率方面也没有出现明显下降。这或许也进一步说明,现阶段 DeepSeek 的 Harness 确实还处在开发者预览版阶段,距离最终完成版仍有优化空间。

02 Agent 界的 Android
模型公司亲自下场做“壳”,DeepSeek 并不是第一家。Anthropic 有 Claude Code,OpenAI 有 Codex,如今这个名单上又补齐了最后一个重要玩家。
从行业趋势来看,Harness 很可能是大模型打通真实生产场景最关键的路径之一。开发者工具公司 Composio 曾做过一项对照测试:同一个 V4-Flash,接入八种不同的 harness,执行 30 项任务。表现最好的完成了 20 项,最差的只完成 14 项。模型完全相同,结果却能相差三成。
模型决定能力上限,而 Harness 决定这份能力最终能被兑现多少。
对 DeepSeek 来说,这层“壳”背后还有三笔更现实的账。首先是成本:上下文如何组织、缓存如何命中,决定了一个任务会消耗多少 token、需要重试几次,而这些关键环节都发生在 Harness 层,别人的壳它无法控制。其次是数据:任务失败的完整执行记录,是持续改进模型效果的重要养料,而这些记录同样掌握在“壳”手中。最后是生态:网易科技的报道提到,团队表示会向部分开发者提供 API 额度——把插件开发者留在自己生态里的意图,其实并不隐晦。
如果把视角拉远,过去两年模型公司卖的主要还是 token,按字数收费,更像是“卖水”。但从 Claude Code 开始,它们逐渐意识到,真正更有价值的,是“把事情做完”这个动作本身。DeepSeek 是最新入局的大玩家,也是第一个选择将整个 Agent 壳层完整开源的公司。
它押注的是另一条路线:当别人把 Agent 打包成成品卖给用户时,它选择把 Agent 的零件全部摊开,赌开发者会基于这些模块,拼装出连它自己都未曾预设的新东西。
回头再看,今天围绕 DeepSeek Harness 最大的争议之一是“它更像框架,而不像成品”。但换一个坐标系,这句话也未尝不是一种赞美——安卓系统刚问世时,同样带着明显的毛坯感:粗糙、开放、吸引的主要是愿意动手折腾的人。后来的故事,大家都很清楚。
DeepSeek 所押注的,是 Agent 这个行业同样需要一个“Android”。

文章出处:极客公园
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
台式机加装固态硬盘怎么选?三星9100 PRO深度解析
台式机升级存储常受限于系统启动慢、游戏加载卡顿与大文件传输延迟。本文基于三星9100 PRO的PCIe 5 0架构、14800MB s读取、13400MB s写入、2200K 2600K IOPS、1TB~8TB容量、第八代V-NAND与5nm主控、镍涂层散热与DTG技术、散热片版适配及魔术师软件,提供选购判断与安装兼容性要点,帮助读者评估是否值得一步到位升级。
宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高
宁德时代发布2026年中期分红方案,总额达61 8亿元,同比增长35%。本文梳理分红具体安排、历史对比、业绩支撑及分红机制,帮助投资者评估公司现金流实力与股东回报策略。
企业硬盘报废销毁合规指南:如何选择专业机构与处理流程
企业硬盘报废面临数据复原与合规风险,需选择具备资质且流程透明的专业机构。本文解析行业乱象,介绍以团体标准为核心的合规销毁流程,涵盖上门收运、消磁粉碎、视频溯源及尾料处置,帮助企业规避泄密责任,确保数据安全闭环。
机密文件销毁找什么机构?认准团标参编与资质合规
机密文件销毁找什么机构?核心在于甄别服务商是否具备正规保密资质及是否参与行业标准制定。本文解析《商业秘密及敏感信息载体销毁通用规范》团标要求,提供筛选销毁机构的实操指南,帮助企业规避数据泄露风险,确保销毁流程合规可溯。
影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析
影石Insta360 X6全球同步发售即登顶国内外主流平台销量榜首。本文解析其搭载的索尼定制方形大底传感器、4nm AI三芯架构及8K50fps画质,详解3D时光舱、AI导演等独家功能,探讨全景相机从专业工具向大众智能创作设备的演进趋势。
- 热门数据榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2026-09-01 11:26
2026-09-01 06:41
2026-08-31 11:19
2026-08-31 11:19
2026-08-31 11:18
2026-08-31 11:18
2026-08-31 11:17
2026-08-31 11:17
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

