免费POC, 零成本试错
FDE知识库

FDE知识库

学习大模型的前沿技术与行业落地应用


收藏

新发布的DeepSeek Harness的五大创新及其启示

发布日期:2026-08-15 12:13:22 浏览次数: 1806
作者:软件工程3.0时代

微信搜一搜,关注“软件工程3.0时代”

推荐语

DeepSeek Harness开源,以系统化工程基础设施推动Agent从“能跑”到“敢交付”,直击行业治理与可靠性痛点。
核心内容:
1. 行业痛点:40% agentic AI项目面临取消风险,主因治理缺口与规模化瓶颈
2. 技术转向:从模型能力竞争转向执行可靠性(可控、可观测、可治理)
3. 核心创新:五大创新之“Self-modifying Runtime”,实现Agent运行时动态演进

杨芳贤
53AI创始人/腾讯云(TVP)最具价值专家

"能跑"不等于"敢交付"。当 Agent 系统从演示走向生产,从单个模型走向多智能体团队,从黑盒执行走向可审计可控,我们需要的不是更强的模型,而是一个真正的 Agent 操作系统。

前天(8月13日),DeepSeek 正式发布、开源了DeepSeek Harness(dsh),一个 MIT 许可的 Agent 驾驭框架。这不是又一个"大模型 + 工具列表",而是一套系统化的工程基础设施,旨在让 Agent 从"能跑"进化为"可控、可验收、可持续"——这正是我们所说的从"能跑"到"敢交付"的转变。

1. 行业的痛点已经暴露

2026 年上半年,行业数据已经刺痛了很多企业:
  • 40% 的 agentic AI 项目:在 2027 年底前面临被取消或下线的风险,主因不是模型能力不足,而是治理缺口
  • 多数项目不是死在 PoC,而是停在规模化之前
  • 上下文漂移:已被确认为所有前沿模型上的工程风险
这些都指向一个核心问题:模型解决"能不能做到",但系统必须解决"敢不敢交付"。

2. 技术对标从"模型能力"转向"执行可靠性"

DeepSeek 的策略转变很聪明:与其和 OpenAI/Anthropic 比模型参数和推理能力(这场比赛很难赢),不如把竞争维度移到"执行系统的可控性、可观测性、可治理性"这些企业更在乎的指标上。
  • Claude Code 和 Codex 的会话是黑盒私有的,无法外部审计
  • DeepSeek Harness 把会话变成类型化事件日志,支持 keyless 重放、快照回归、全文检索
这一步转变,从"谁的模型更聪明"变成"谁的系统更可信"

3. 开源 = 快速验证 + 生态共建 + 技术标准化

DeepSeek 选择 MIT 许可并快速开源(v0.1 时就发布),目的很明确:
  • 闭环加速:在社区中暴露缺口,迭代速度远快于单独商业化
  • 降低采用门槛:企业更愿意集成开源基础设施而非被技术锁定
  • 争夺标准:如同 Linux 之于操作系统,DeepSeek Harness 想成为 Agent 系统的"事实标准"

创新 1:会"改写自己"的运行时(Self-modifying Runtime)

痛点:传统 agent 框架的能力是静态的。模型只能"调用"工具,框架本身无法演进。
DeepSeek 的答案:通过Typert 类型反射 + Cordis 动态加载,让 Agent 能:
  • 检视自己的运行时结构(有哪些工具、插件、能力)
  • 动态生成新插件并在node:vm 沙箱中执行
  • 挂载/卸载新能力,而不需要重启系统
关键组件:
  • dsh-tool-cordis:模型可见的运行时检视工具
  • cordis-host-runner:node:vm 隔离 + 请求-运行往返
  • 风险受控:生命周期守卫 + 权限隔离,"可改写"不等于"失控改写"
为什么这是创新?
其他 Agent 框架只允许模型"调用"工具。DeepSeek 让 Agent改变自己的工具集—— 这是从"静态框架"向"动态自进化系统"的质的飞跃。
实际效果:Agent 可以在运行时识别自己的缺陷("我缺少某个能力"),然后自己生成、验证、加载新能力,而不必等待人工干预。

创新 2:事件溯源 + 可重放会话

痛点:Agent 最恐怖的生产灾难不是单次失败,而是失败后无法复盘
Claude Code 的会话是私有的,你看不到 Agent 到底做了什么
无法重放意味着无法审计、无法定位根因、无法验证修复
DeepSeek 的答案:Session 设计为一等公民
  • 会话 =类型化、版本化的事件日志(SessionEventMap)
  • 系统状态来自日志的折叠和投影(类似数据库的事务日志)
  • 支持JSONL/zstd + SQLite 双持久后端,效率与可靠性兼顾
关键能力
  • Keyless重放:无需原始API Key,从日志重放任何历史会话
  • 快照回归测试:可以对不同版本的Agent逻辑做对比测试
  • 全文检索 + 血缘追踪:SQLite FTS5+关系查询,快速定位某个错误决策是在第几步做的
为什么这是创新?
传统日志是"发生了什么"的记录。DeepSeek 让日志变成"系统完整的决定论重建"——给定同一份日志,任何人、任何时间都能得到相同的行为轨迹。
工程价值:
  • 可审计:所有 Agent 行为都有完整的审计链
  • 可复现:Bug 复现不再靠"描述",而是靠"重放"
  • 可学习:失败案例成为训练数据,可驱动自进化

创新 3:异构子Agent协议

痛点:企业环境中通常有多个 Agent 产品和工具链。如何让它们互相调用、协作?
DeepSeek的答案:定义两层协议:
ACP(Agent Client Protocol):自动化专用,面向任务编排
dsh-sdk:JSON-RPC进程外驱动,更通用
关键意义:
可以把 Claude Code、Codex 当作"sub-agent"委派任务
不同 Agent 实现可以互相调用,形成异构智能体网络
协议化接口意味着我们不被单一厂商锁定
实现形式:
  • 五种sub-agent后端:in-process spawn、in-process fork、ACP、Claude Code、Codex
  • 三类工具支持:委派、控制、报告
  • 父子协作形成闭环
为什么这是创新:
大多数 Agent 系统是单体架构("我就是唯一的 Agent")。DeepSeek 承认现实:企业有多个 Agent 和工具链,系统应该支持它们协议化、可替换的互操作。这就像 OS 的"进程通信"——不同厂商的应用也能通过标准协议通信。

创新 4:可移植沙箱+"fail-closed"设计

痛点:Agent 执行高风险操作(改文件、运行命令、访问网络)时,如何保证不越权?
DeepSeek的答案:一整个跨平台沙箱族
  • Linux:Landlock(内核能力隔离)+ bwrap(namespace)
  • macOS:Seatbelt(App Sandbox)
  • Windows:受限令牌 + ACL
关键设计:
  • 原生 C11 实现:native/landlock-run,自限制后 exec(不依赖外部工具)
  • Fail-closed exit 125:当内核无法强制隔离时,直接失败而非偷偷放开
  • 双重机制:沙箱隔离 + 权限策略(sandbox-policy)分级控制
为什么这是创新?
沙箱很多系统都有,但 DeepSeek 的创新是:
  • 跨平台一致:同一份策略,Windows/macOS/Linux 行为一致
  • "安全失败"是第一原则:宁可功能受限,也不偷偷放开权限
  • 原生底层:C11 Landlock 实现意味着零依赖、最小化攻击面
这体现了一个工程哲学:治理不是在应用层的 prompt 里祈祷,而是在基础设施层被机制强制执行。

创新 5:把"可靠性"当作工程纪律

痛点:很多 Agent 系统把可靠性寄托在 prompt 调优、温度参数、或"模型自我反思"上。这都是概率性的,无法保证。
DeepSeek 的答案:建立一套机器强制的工程门禁
机器强制门禁:
  • 100% 代码覆盖率(coverage)
  • 自动化快照回归测试(snapshot tests)
  • 死代码检测(knip)、复制代码检测(jscpd)
  • 导出一致性检查(publint)
  • 运行时不变量校验(invariants
决策与知识沉淀:
  • Agent Notes: ~680 条决策记录(为什么这样设计、为什么放弃另一个方案)
  • Postmortem:事故复盘(发生了什么、为什么发生、怎么防止再发生)
  • 这些知识可以被持续迭代利用
自动生成文档:
  • config-catalog:自动生成所有配置选项的文档
  • tool-catalog:所有模型工具的 schema 自动列举
  • persistence-catalog:所有持久化事件类型的目录
  • 双语文档体系:.md + .zh.md + .i18n.yaml 三元组,词条一致性强制
为什么这是创新?
可靠性 = 工程化,而不是靠 prompt 调优。这是 DeepSeek Harness 与一线 Agent 产品(Claude Code/Codex)的本质区别
前者把可靠性看作可优化的指标(覆盖率、测试通过率、不变量成立率);后者依赖不可量化的因素(模型"有没有想对"、prompt 有没有足够清晰)。


三、与 Claude Code/Codex的对比

关键差异:DeepSeek Harness 不是"更强的 Agent",而是把 Agent 变成可控、可审计、可扩展的基础设施

四、Harness Engineering最新趋势

从DeepSeek Harness的设计,我们能看到Harness Engineering(驾驭工程)的三个最新发展趋势:

1. 从"框架能力"走向"可治理运行时"

自改写运行时、沙箱与 fail-closed,让框架具备工程演进能力
治理不是静态的策略配置,而是动态的、可观测的、可降级的决策引擎

2. 从"日志"走向"事件-可重放-可审计"

事件溯源让 Agent 行为变成可回放的证据链
这是可规模化交付的前提:必须能解释"为什么 Agent 做了这个决策"

3. 从"调参/自评"走向"工程纪律与自动化守门"

可靠性不靠运气,而靠门禁、覆盖、不变量、postmortem、资产新鲜度管理
这标志着 Agent 工程从"科研探索"向"工程规范"的转变

五、给企业的启示

如果企业正在评估 Agent 系统,DeepSeek Harness 给出的信号是:
问"能跑"之前,先问"能控"
一个 Agent 会不会跑,和一个 Agent 能不能被企业安全地部署,是两回事。前者看模型能力,后者看系统底座。
可重放性是生产级系统的必须项
如果你的 Agent 系统无法完整重放某个历史行为,那它就无法被审计、无法被修复、无法被学习。
权限与治理必须在基础设施层强制
不要依赖 prompt 来约束 Agent 的行为。使用沙箱、权限策略、审批流等机制在系统层强制执行。
开源基础设施 = 技术自主
闭源产品再好,你也被锁定在厂商的技术选择上。开源 Agent OS 意味着你可以定制、可以审计、可以主导自己的 AI 战略。

结语

从"能跑"到"敢交付",不是模型更强就能做到的。需要的是一个真正的操作系统——把编排、验证、记忆、治理统一成闭环,让 Agent 进入生产流程且可控、可追溯、可持续。

DeepSeek Harness v0.1 的发布,标志着 Agent 工程不再是"工程师 + 好的 prompt",而是一个系统化的驾驭工程学科
五大创新(自改写运行时、事件溯源、异构协议、可移植沙箱、工程纪律)合在一起,形成了一个闭环:
  • 框架足够灵活(能改写自己)
  • 行为足够透明(事件可重放)
  • 协作足够开放(子代理协议)
  • 安全足够可信(沙箱 + 治理)
  • 质量足够有保障(工程纪律)
这就是下一代 AI 基础设施的样子。

53AI,企业落地大模型首选服务商

产品:场景落地咨询+大模型应用平台+行业解决方案

承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业

联系我们

售前咨询
186 6662 7370
预约演示
185 8882 0121

微信扫码

添加专属顾问

回到顶部

加载中...

扫码咨询

扫码登录
登录即表示您同意《53AI网站服务协议》
服务协议

欢迎您使用【53AI 官方网站】(以下简称“本网站”或“我们”)。本《会员服务协议》(以下简称“本协议”)是您(以下简称“会员”或“用户”)与【深圳市博思协创网络科技有限公司】之间关于注册、登录及使用本网站会员服务所订立的法律协议。

在您注册或登录前,请务必审慎阅读、充分理解各条款内容,特别是免除或限制责任的条款、知识产权条款、争议解决条款等。此类条款将以加粗形式提示您注意。 当您通过微信公众号授权、手机验证码验证或其他方式成功登录本网站时,即视为您已完全理解并同意接受本协议的全部内容。

一、 定义

本网站:指由【深圳市博思协创网络科技有限公司】运营的,域名为【53ai.com】的网站及相关移动端页面。

会员服务:指本网站向注册会员提供的知识库文章查阅、内容检索及其他相关增值服务。

知识库内容:指本网站发布的包括但不限于文字、图表、数据、研究报告、行业分析等数字化内容资源。

二、 账号注册与登录

登录方式:本网站支持以下登录方式,您可根据实际情况选择:

微信公众号授权登录:您同意将您的微信OpenID信息授权给本网站,用于创建或关联会员账号。

手机验证码登录:您需提供真实有效的手机号码,并通过短信验证码完成身份验证与登录/注册。

账号安全:您的账号仅限您本人使用,禁止赠与、借用、租用、转让或售卖。因您保管不善导致的账号被盗、密码泄露等损失,由您自行承担。

实名认证:根据相关法律法规要求,我们可能要求您在特定功能下完成实名认证。如您拒绝提供,可能无法使用部分或全部服务。

未成年人保护:若您未满18周岁,请在法定监护人的陪同下阅读本协议,并在征得监护人同意后使用本服务。

三、 服务内容与规范

知识库查阅权限:会员登录后,有权按照其会员等级对应的权限范围,在线浏览、检索本网站知识库中的相关文章及内容。

服务变更:我们有权根据业务发展需要,调整、变更或终止部分服务内容,并将以网站公告、公众号消息等方式提前通知。

禁止行为:您在使用服务时不得实施以下行为:

利用技术手段批量爬取、下载、转存知识库内容;

将知识库内容用于商业目的或未经授权地向第三方传播;

干扰本网站正常运行或侵犯其他用户合法权益;

发布违法违规信息或从事违反公序良俗的活动。

四、 知识产权声明

权利归属:本网站知识库中的排版设计、软件代码等内容的知识产权均归【公司全称】或原权利人所有,受《中华人民共和国著作权法》等法律保护。

有限许可:本网站授予会员一项非独占、不可转让、不可转授权的普通许可,仅限于个人学习、研究之目的在线查阅知识库内容。

侵权追责:未经书面许可,任何单位或个人不得以任何形式复制、转载、摘编、镜像、汇编或以其他方式使用上述内容。一经发现,我们保留追究其法律责任的权利。

五、 个人信息保护

我们重视对您个人信息的保护。关于我们如何收集、使用、存储和保护您的个人信息,请单独阅读 《隐私政策》。

您通过微信公众号授权或手机号验证所提供的信息,我们将严格按照《个人信息保护法》的规定处理,仅用于身份识别、服务提供及安全验证等必要用途。

您可以随时通过网站设置或联系客服行使查阅、更正、删除个人信息及撤回授权同意的权利。

六、 免责声明

内容准确性:知识库内容仅供参考,不构成专业建议。我们不对其完整性、准确性、时效性作任何明示或暗示的保证,您应自行判断并承担使用风险。

不可抗力:因自然灾害、政策法规变化、网络故障、第三方平台接口异常(如微信接口维护、运营商短信通道故障)等不可抗力导致的服务中断或延迟,我们不承担违约责任。

第三方链接:本网站可能包含指向第三方网站的链接,该等网站的内容和服务不受我们控制,请您自行甄别风险。

七、 违约责任

如您违反本协议约定,我们有权视情节采取警告、限制功能、暂停服务、注销账号等措施,并保留要求赔偿损失的权利。

如因您的违约行为导致我们遭受行政处罚、第三方索赔或商誉损失,您应承担全部赔偿责任(包括但不限于罚款、赔偿金、律师费、公证费等)。

八、 法律适用与争议解决

本协议的订立、执行和解释均适用中华人民共和国大陆地区法律。

因本协议产生的或与本协议有关的任何争议,双方应友好协商解决;协商不成的,任何一方均可向【公司所在地】有管辖权的人民法院提起诉讼。

九、 其他

本协议构成双方就本服务达成的完整协议,取代此前任何口头或书面约定。

本协议任一条款被认定为无效或不可执行的,不影响其他条款的效力。

我们对本协议享有最终解释权,并在法律允许的范围内保留随时修改的权利。修改后的协议一经公布即生效,继续使用服务即视为同意修订内容。


已查阅