网易首页 > 网易号 > 正文 申请入驻

Agent Harness进化史,系统了解DeepSeek Harness

0
分享至


  • 88% 企业 AI 卡在 PoC:2 个数据看懂 Harness 为什么重要

  • 88% 企业 AI 卡在 PoC?3 个 Harness 认知帮你破局

  • Agent Harness进化史:从"LLM+外壳"到DeepSeek的"一切皆插件"

打开任何一个 AI Agent 产品的技术文档,你会发现一个反复出现却很少被讲透的词:Harness。

DeepSeek Harness(业内简称 DSH)于 2026 年 8 月 13 日正式以开发者预览版亮相,仅仅两天,GitHub star 数便突破 11 万,fork 数超 1.18 万,这个速度甚至让见多识广的技术社区也愣了一下。

“一切皆插件”(Everything-is-a-Plugin)的架构理念让不少从业者兴奋,也让更多企业管理者一头雾水。很多人的第一反应是:这不就是个 Agent 框架吗,跟 LangChain、AutoGPT 有什么本质区别?

这个问题背后藏着一个更根本的认知盲区:绝大多数人理解的"AI Agent",其实只理解了一半。

Agent 能不能干活,能干多少活,能干多稳定的活,从来不只是大模型的事。

业内早有一个被反复引用的公式:Agent = LLM + Harness。

这个公式最早由 Anthropic 工程团队在讨论 Claude Code 架构时进行了概念铺垫,后来由LangChain 团队正式提出,最近 Lilian Weng 也在一篇技术长文中系统梳理。

模型只是发动机,Harness 才是那套让发动机跑在正确赛道上、不至于翻车的底盘、传动系统和安全带。


但在企业层面,这个公式长期被忽视,代价极为惨重。

IDC 与联想联合调研的数据显示:88% 的企业 AI 概念验证(PoC)项目从未能抵达生产环境。

Gartner 则预测,超过 40% 的 Agentic AI 项目会在 2027 年底前被砍掉,原因指向"成本失控、ROI 不明、风险管控缺位"。

这些失败里,有多少是因为花了大价钱选好了模型,却从没认真考虑过 Harness?


DeepSeek 这次高调推出 Harness,不是心血来潮的产品发布,而是踩在一条已经走了三年的技术演进曲线上。

今天我们就跟大家把这条曲线彻底捋一遍:Harness 从哪来,为什么必须存在,经历了怎样的进化,DSH 到底新在哪,企业又该怎么看待这场"底盘革命"。

Harness是什么:先搞懂这个被翻译坏了的词

Harness 的字面意思是"马具"“安全带”,工程领域常用来形容"给某个核心部件套上一层约束与支撑结构"。

这个词在 AI Agent 圈的中文翻译一直不统一,有人叫"执行框架",有人叫"工程脚手架",也有人干脆不翻译直接用英文,反而是最清醒的选择。

放到 AI Agent 语境里,Harness 指的是包裹在大模型外面、负责让模型真正"能干活"的整套工程系统:工具调用协议、上下文管理策略、记忆机制、执行环境、错误恢复逻辑、多轮任务规划器,缺一不可。

Wikipedia 对 Agent Harness 的定义是:“围绕基础模型构建的软件基础设施,用于赋予其感知环境、调用工具、维持状态并执行多步骤任务的能力”。

Databricks 的技术博客给出了一个更好理解的类比。

如果把大模型看作一位极其聪明但完全没有工作经验的应届生,Harness 就是那套帮他熟悉工位、拿到工具权限、知道该向谁汇报、犯错后能纠正的入职培训与工作手册体系。

这位"天才应届生"不管智商多高,没有工作手册、没有工具权限、没有汇报机制,进了公司照样寸步难行。

Salesforce 在自己的 Agentforce 文档里说得更直白:模型决定 Agent"能想到什么",Harness 决定 Agent"能不能真正做到"。

也就是说,大模型的智商决定了 Agent 的天花板,但 Harness 决定了 Agent 能不能摸到这个天花板,摸到之后能不能稳定发挥。

具体来说,套完整的 Harness 通常包含以下六个核心模块:

模块

功能

典型问题(缺失时会怎样)

工具调用层

定义模型可以调用哪些外部工具、以何种协议调用

Agent想干活却"没手没脚"

上下文管理

决定哪些信息进入模型上下文窗口、如何压缩历史

长任务中途"失忆"、跑偏

记忆系统

跨会话、跨任务保留关键信息

每次对话都要从零讲背景

执行环境

提供代码执行、文件系统、终端等运行沙箱

只能"说",不能"做"

规划与反思

拆解复杂任务、评估中间结果、自我纠错

一步错步步错,无法回头

安全护栏

权限控制、行为边界、风险拦截

模型"越权"操作生产环境

这六个模块拼起来,才是一个能在企业场景里真正干活的 Agent。


而这套东西,绝大多数企业在采购"大模型 API"的时候,是完全没有考虑到的。

他们买了一台发动机,却没有买变速箱、没有买底盘,然后纳闷为什么车开不起来。

有一组数据可以印证这个问题的普遍程度:Capgemini 2025 年的研究发现,全球只有 2% 的企业将 Agentic AI 真正部署到了全规模生产环境。

研究明确指出,这 98% 与 2% 之间的差距,不是模型能力的差距,也不是人才的差距,而是上下文基础设施(context infrastructure)的差距,这本质上就是 Harness 工程的差距。

Harness为什么会出现:一场被现实狠狠教育的技术必然

Harness 不是先有理论后有实践的产物,恰恰相反,它是在无数次生产环境翻车之后,工程师们被迫总结出来的"补丁体系"。

这条演进路径,经历了三次清晰的行业觉醒。


第一次觉醒:AutoGPT 热潮与幻灭(2023 年)

2023 年春天,AutoGPT 横空出世,号称给 GPT-4 装上"自主执行"的能力,GitHub star 数一度冲到全球增速第一。

彼时整个行业的情绪是:AGI 不远了,Agent 要改变世界了。

但真正把它跑起来的开发者很快发现:模型会陷入死循环,会自己给自己下达错误指令,会因为上下文丢失而反复重复同一个动作,还会在完成了根本没人要求的任务之后,宣布自己"已完成目标"。

有人形容这种体验像"雇了一个聪明到离谱但完全不受控的实习生,给他一台电脑后你就不知道他在做什么了"。

裸模型直接自主运行,本质上就是没有安全带的赛车,跑两圈就出事。

这次幻灭教育了整个行业一个基本事实:LLM 的推理能力和执行可靠性完全不是一回事。

模型可以在单次问答里表现得像天才,却在多步骤任务里因为缺乏状态管理而彻底失控。

AutoGPT 的热度消退,但它留下了一份珍贵的"踩坑清单"。

正是这份清单,让后来的工程师们开始认真对待 Harness 的每一个模块。

第二次觉醒:Coding Agent 倒逼工程化(2024-2025 年)

如果说 AutoGPT 暴露了问题,真正把 Harness 从"隐性基础设施"推到"显性工程学科"位置的,是 2024 到 2025 年爆发的 AI 编程助手大战:Claude Code、OpenAI Codex CLI、Cursor Agent、Aider 相继登场。

写代码是对 Harness 要求最苛刻的场景。原因很直白:代码任务有明确的验收标准(能不能跑通)、需要频繁调用工具(读文件、写文件、跑测试、查报错)。

错误有时候是连锁反应(改了 A 破坏了 B,B 又影响了 C),而且用户给出的反馈往往是一条报错信息,而不是自然语言描述的清晰指令。

这种场景下,Harness 的每一个模块都会被极限压测。

LangChain 团队在其技术博客《The Anatomy of an Agent Harness》中系统拆解了 Claude Code、Codex 等产品的架构差异。

他们指出,决定这些编程 Agent 实际能力上限的,往往不是背后用了 GPT-4 还是 Claude,而是各自 Harness 里对上下文压缩、工具编排和错误恢复的工程设计。

这个判断后来被大量社区评测反复验证。

多篇横向对比文章都指向同一个结论:把同一个模型底座换到不同的 Harness 里跑同一批任务,实际完成率、Token 消耗效率、任务成功率会出现明显差异。

而且差异幅度经常超过更换模型本身带来的提升。

这一点极其关键,也是本文希望传递给企业管理者的核心认知之一:你以为你在为"AI 能力"付费,实际上你更多是在为"Harness 的工程质量"付费。

同样一个开源模型底座,套上不同厂商的 Harness,交付出来的产品体验可能天差地别。

第三次觉醒:评测体系倒逼 Harness 工程学独立成科(2025-2026 年)

到了 2025 年,随着 Agent 项目大规模从 PoC 走向(或走不向)生产环境,行业积累了足够多的失败案例,开始出现系统性的反思。

一个最广为引用的数据来自多家研究机构的交叉印证:88% 的 AI Agent PoC 无法进入生产环境,在真实工作流程中,AI Agent 的任务失败率在 70%-95% 之间,具体取决于任务复杂度。

在 WebArena 基准测试上,最好的 GPT-4 Agent 端到端任务成功率只有 14.41%,而人类完成同类任务的成功率是 78.24%。

这个数字放在企业场景里意味着什么?每处理 100 个工单,86 个会出错。

LangChain 在《A Recipe for Harness Hill-Climbing with Evals》里提出了一个很实用的方法论:企业与团队应该像调参一样,用系统化的 Eval 评测持续迭代自己的 Harness 设计,而不是把精力全部押注在"换更好的模型"上。

这篇文章开启了一种新的工程思维方式:Harness 不是买来就能用的现成品,而是需要跟业务场景持续磨合、不断迭代优化的工程系统。

LangChain 在另一篇分析《Open Models have crossed a threshold》中进一步提出:随着开源模型能力持续逼近闭源模型,竞争的胜负关键正在从"模型能力"转移到"Harness 工程能力"。

当底层模型的差异被压缩到个位数百分点,谁的 Harness 设计得更聪明,谁就能把同样的模型压榨出更高的实用价值。

这正是为什么 DeepSeek 在把模型能力做到全球第一梯队之后,转身开始重兵投入 Harness。

因为战场早就转移了。

Harness的分类与流派:不是一种东西,而是一整套设计哲学

行业里对 Harness 没有统一的分类标准,但结合公开资料,可以从三个维度理解现有的技术流派,帮助企业在选型时建立清晰的认知框架。

按架构范式分类

Parallel AI 在其技术文章中把主流 Harness 架构总结为三种范式:

范式

代表产品

核心特点

适用场景

ReAct循环型

早期AutoGPT、多数Agent框架

思考-行动-观察循环迭代

通用任务,容错要求不高

计划-执行分离型

LangChain Deep Agents

先规划任务树,再逐步执行

复杂多步骤任务

插件/工具中心型

Claude Code、DeepSeek Harness

一切能力抽象为可插拔工具

高扩展性、企业定制场景

ReAct 循环型是最早期、最直觉的设计:模型思考一步,做一步,看结果,再思考下一步。

优点是实现简单,缺点是一旦某一步出了问题,模型要靠自己识别和纠偏,长链条任务里小错误会像滚雪球一样越滚越大。

计划-执行分离型则更像一个项目经理:先把整个任务拆解成结构化的执行树,明确每个节点的依赖关系,再按顺序执行。

这种方式适合复杂任务,但规划本身消耗的 Token 成本很高,而且规划阶段如果理解偏了,后面全程跑偏。

插件/工具中心型是目前企业场景里最受青睐的方向:把所有能力(包括工具调用、记忆管理、执行沙箱)都抽象成统一规范的"插件",模型通过调用插件来完成任务。

这种设计的好处是扩展性极强,企业新增一个业务系统,只需要写一个插件接入,不影响其他任何部分。


LangChain 的 Deep Agents 方向值得单独一提。他们在《Tuning Deep Agents to Work Well with Different Models》中提出了一个反常识但很重要的观点:同一套 Harness 架构,针对不同的底层模型需要进行专门的"调参"。

因为不同模型对 Prompt 结构、工具描述格式、上下文长度的敏感度完全不同。

这意味着 Harness 和模型不是简单的"插拔关系",而是需要协同优化的耦合系统,也解释了为什么 DeepSeek 不满足于"通用 Harness",而要自己下场造一套跟自家模型深度绑定的方案。

按开放程度分类

从开放程度看,Harness 方案大体分为封闭型与开放型两大流派。

封闭型的代表是部分商业 Coding Agent 的内置 Harness,工具层、执行层、记忆层全部封装在厂商私有实现里,开发者可以调整参数但无法替换核心组件。这类方案的优点是开箱即用,缺点是企业一旦想做深度业务定制,往往会撞墙。

开放型的代表则是以 LangChain、Aider 为代表的开源方案,核心架构对外开放,企业可以自由修改任意模块。

Milvus 的技术博客指出,开放型 Harness 正在成为企业级 Agent 落地的主流选择,核心原因是企业的业务系统差异极大,没有任何一套封闭 Harness 能够做到开箱即用地适配所有企业。

这也是 DeepSeek 选择"插件化"路线、以 MIT 协议开源的重要战略考量。

典型开源项目与参考案例

企业调研时,以下几个项目值得重点关注。

CodeWhale是社区驱动的开源 Agent Harness 项目,主打模块化插件生态,可自由替换工具层与执行层。

它的思路跟 DSH 有相似之处,但面向的主要是开发者群体,企业级的权限管理和审计能力相对薄弱。

Claude Code是 Anthropic 官方的 Coding Agent,被广泛认为是"Harness 设计的教科书级案例"。

它的上下文压缩策略和工具描述规范被多篇对比文章反复解剖,Claude Code 成功的很大一部分原因,正是其 Harness 在长任务稳定性和错误恢复机制上的精心打磨。

Aider是轻量级开源 Coding Agent,Harness 设计极简,强调"让开发者掌控每一步",是研究 Harness 最小可行架构的好样本。

如果说 Claude Code 是豪华轿车,Aider 就是一辆设计极其清晰、每个零件都清楚可见的改装摩托车,适合想搞清楚"Harness 到底是怎么跑起来的"的工程师。

社区作者在 Medium 上有句话很扎心,值得放在企业决策者面前反复读:“你的 AI Agent 表现里,70% 的效果其实活在模型之外的 Harness 里”。

这句话的潜台词是:企业如果只比较模型跑分而忽视 Harness 质量,很可能会为一个"参数亮眼但落地乏力"的产品买单。

DeepSeek Harness深解:一切皆插件,到底新在哪

理解了前面三年的技术演进,再看 DSH,就不会只停留在"又一个 Agent 框架"的浅层认知了。

DSH 的核心主张:Everything-is-a-Plugin

DSH 的官方 README 开头只有一句话,却说尽了它的设计野心:“Everything is a plugin.”

DeepSeek 官方将 DSH 定位为:把模型能力之外的一切执行组件,包括工具、记忆、执行环境、沙箱、调度逻辑、UI 界面,乃至 Agent 循环本身,全部统一抽象为可插拔的 Cordis 插件单元。

“没有什么是硬编码的核心,每一个能力都是一个可以被替换的插件”,这是 DSH 架构文档里的原话。

类比一下会更清晰:传统的 Harness 设计就像一栋预制好的公寓楼,格局是固定的,你可以换家具换地板,但不能改变承重墙的位置;而 DSH 的设计更像乐高积木,从地基到屋顶每一块都是独立的标准化组件,你可以按照自己的需求重新拼装,甚至在房子已经建起来的时候,替换某一块积木而不影响整体结构。

这个设计哲学解决了此前主流 Harness 的一个核心痛点:工具层、记忆层、执行层往往深度耦合在特定框架的内部实现里,企业想替换其中一个模块,经常牵一发动全身。

改一个记忆存储方案,可能需要动整个 Agent 循环的代码;接入一个新的业务工具,可能需要重新部署整套服务。

DSH 的插件化架构试图把这种耦合彻底拆开。

Cordis:DSH 插件体系的技术底座

DSH 选择了一个不太出名但有意思的底层框架:Cordis。

Cordis 是一个 TypeScript 元框架,其核心特点是"时空可组合性"(spatiotemporal composability),简单说就是:插件的挂载和卸载是完全可逆的清洁操作,不会在系统里留下任何残留状态。

这听起来是个技术细节,但对 Agent 运行时来说极其重要。

长时间运行的 Agent 进程里,如果插件的卸载不"干净",就会积累大量僵尸监听器和泄漏状态,最终导致 Agent 行为越来越不可预测。

这是很多早期 Harness 框架在生产环境里运行一段时间后就开始表现异常的根本原因之一。

Cordis 的架构从设计层面保证了这个问题不会发生。

更值得一提的是,Cordis 并非临时拼凑的新框架,它背后有一个已经运行了四年、拥有超过 4000 个社区插件的成熟聊天机器人框架作为实战检验。

DeepSeek 选择在成熟底座上构建 Harness,而不是自己重造一套插件系统,是一个务实的工程决策。

从架构分层来看,DSH 的调用链路是这样的:








1

2

3

4

5

6

7

8






用户界面
↓ 会话管理
↓ Agent循环
↓ Prompt与工具组装
↓ LLM适配器
↓ 工具调用解析
↓ 权限与沙箱层
↓ 文件系统、Shell、终端、子Agent




这条链路的每一层,在 DSH 里都是独立的 Cordis 插件。

这意味着企业可以在不改动其他层的前提下,单独替换任意一层的实现。

比如,把默认的本地文件系统替换成企业内部的对象存储,或者把默认的权限策略替换成符合公司安全规范的自定义策略。


DSH 不只是 DeepSeek 模型的配套工具

这一点经常被误解,需要单独说清楚。

DSH 的官方文档明确列出了它支持的模型提供商:DeepSeek(官方直连)、Anthropic、OpenAI,以及 AWS Bedrock、Google Vertex AI、Azure OpenAI Service 等企业云端点,还支持任何 OpenAI 兼容格式的自定义端点。

换句话说,DSH 的名字里有 DeepSeek,但它不是一把只能配 DeepSeek 这把锁的钥匙。

你可以用 DSH 的整套插件体系,配上 Claude、GPT、自部署的开源模型,或者公司内部训练的私有模型。

模型适配器本身也是一个插件,可以自由替换。

这个设计逻辑有深意。

DeepSeek 显然希望 DSH 成为一套独立的行业基础设施,而不只是让用户绑定在自家模型上。

当一套 Harness 变成足够多企业的"标准装备",它反过来会形成对整个生态(包括模型选择)的引力。

与其他主流 Harness 方案的横向对比

结合前文提到的多个技术流派,把 DSH 放在同一张桌子上跟主流方案比较:

维度

DeepSeek Harness (DSH)

Claude Code

LangChain Deep Agents

Aider

架构范式

插件中心型(Cordis)

插件/工具中心型

计划-执行分离型

ReAct循环型(极简)

开放程度

完全开源(MIT)

半封闭

开源

完全开源

模型绑定

多模型,DeepSeek优先

Claude系优先

多模型,需分别调参

模型无关

企业定制难度

低(配置即定制)

中高(需理解规划树)

低但功能基础

热插拔能力

支持(Cordis保证)

不支持

部分支持

不支持

典型场景

企业系统集成、通用Agent

编程/开发

复杂多步骤自动化

轻量代码协作

需要说明的是,DSH 目前仍处于开发者预览阶段,Composio 等第三方评测机构在测试其与 DeepSeek V4 系列模型搭配效果时,认为协同效率有明显优势,但插件生态的成熟度和第三方工具覆盖广度仍在追赶 Claude Code 等先发产品。


这符合技术产品的一般规律:架构理念可以领先,生态积累永远需要时间。

本地化部署的现实考量

对于国内企业而言,DSH 的本地部署能力是绕不开的话题。

DSH 支持多种本地化部署方式:一行命令启动(npx @deepseek-ai/dsh web,无需本地 Node.js 环境),以及从源码克隆的完整本地部署,同时提供 Python SDK。

它支持 Linux x64、Linux arm64、macOS 14+(Apple Silicon)等主流服务器和开发环境。

沙箱与权限系统是 DSH 在合规场景下的重要保障。架构文档显示,DSH 将沙箱管控和操作审批作为两个独立控制层分别设计:沙箱决定 Agent 能访问哪些系统资源,审批层决定哪些操作需要人工确认再执行。

这个设计对金融、政务、医疗等合规要求严格的行业很重要。

在这些场景里,Agent 在执行高风险操作(比如修改生产数据库记录)之前必须有人工确认环节,而这个确认节点本身也应该是可配置的插件,而不是硬编码进系统里的固定逻辑。

企业为什么必须重新理解Harness:不是技术选型问题,是战略问题

讲到这里,很多企业管理者可能会问:这些架构名词跟我有什么关系?我又不写代码。

答案是:这直接决定了你的 AI 投资回报率,也直接决定了你的 AI 项目会不会成为那 88% 里的一个。

一个真实的认知误区,代价很大

大量企业在选型 AI Agent 产品时,习惯性地把"用了什么模型"作为核心决策依据,是 GPT-4 还是 Claude 还是 DeepSeek,参数量多大、跑分多高。

这个思路在 2023 年或许还成立,但今天已经严重滞后。

前文提到 LangChain 的判断很值得反复强调:当模型能力的差距被压缩到个位数百分点,Harness 的工程质量才是决定产品实际可用性的关键变量。

换句话说,企业采购 Agent 产品,本质上是在采购一整套"模型 + Harness"的组合能力,只看模型参数就下单,跟只看发动机排量不看变速箱和底盘调校就买车,是同样的认知偏差。

有个例子很说明问题:Snowflake 工程团队在 2026 年的一项研究中发现,给 Agent 系统补充了组织本体(organizational ontology)之后,Agent 的任务准确率提升了 20%,工具调用次数下降了约 39%。

模型一行代码没改,只改了 Harness 里的上下文结构设计,效果就发生了显著变化。

这不是个例,而是一种普遍规律。

Harness 质量差异带来的实际业务后果

理解了这个前提,来看看 Harness 设计缺陷在企业场景里会造成哪些具体后果。

TechTarget 的行业分析梳理了几种典型模式。

上下文管理粗糙会导致长任务中途"失忆"。

想象一个企业客服 Agent,正在处理一个涉及多部门协调的复杂退款工单:客户先向售后说了 A,售后转给财务时 Agent 把 A 丢了,财务又要客户重述一遍。

客户说的是"这已经是第三次解释了"。这不是模型不够聪明,是 Harness 没有做好跨轮次的信息保留。

工具调用协议设计不合理会导致 Agent 频繁静默失败。

调用内部 OA 系统的接口返回了一个格式略有不同的错误码,Agent 不认识这个错误码,既没有上报,也没有重试,直接当作成功处理了,继续往下走。

结果是任务表面上完成了,实际上数据写入失败,下游系统因为拿不到这条数据而报错,排查问题花了三个小时,最后发现根源是 Harness 的错误处理逻辑没有覆盖这种边界情况。

Digital Applied 的分析显示,一个失败的企业 AI Agent 项目,平均浪费成本约为 34 万美元。

安全护栏缺失是最危险的情况。

有公开案例(Fiddler.ai 报告中引用):一个 Agent 在生产环境的重试循环里,创建了 847 条重复的客户记录,才有人注意到异常。

这不是模型幻觉,是 Harness 里没有设置"写操作需要去重检查"的防护逻辑。

这些问题在 Demo 阶段几乎不会暴露,往往是批量上线后才集中爆发。

“Agent PoC 阶段很惊艳,规模化落地却处处翻车”,根子不在模型,在 Harness 从一开始就没有按照生产环境标准设计。

企业该如何评估一套 Harness 方案

结合前文提到的 Eval 驱动方法论,我给企业决策者整理了五个实用的自查问题。

第一问,插件和工具扩展成本是多少。

接入一个新的内部系统,需要多大的开发工作量?是否支持热插拔,还是每次新增工具都要重新部署整套服务?

一套好的企业级 Harness,接入一个新工具不应该超过一天的开发量。

第二问,上下文与记忆机制是否透明可控。

厂商是否说清楚了上下文压缩策略?当任务超过上下文窗口时,哪些信息会被丢弃?企业能否自定义这个策略?

如果厂商说"这是黑盒,交给模型自己决定",这个答案不及格。

第三问,模型解耦程度如何。

这套 Harness 是否绑死了单一模型?六个月后如果出现性价比更高的新模型,迁移成本是多少?

一套设计合理的开放型 Harness,替换底层模型不应该触动业务逻辑层的任何代码。

第四问,安全与合规能力是否可配置。

审批流、权限策略、操作日志是否可以按照企业自身的合规要求定制?还是只有几个固定档位的预设选项?

对于金融、医疗等行业,这个问题的权重比功能丰富度更高。

第五问,有没有系统化的可观测性。

Agent 的每一步操作是否有完整的追踪日志?出了问题,能不能快速定位到是哪一个插件、哪一次工具调用出了问题?

DSH 的官方文档对此有一句明确的设计原则:“Every run is traceable(每一次运行都可追溯)”,这种可观测性优先的设计理念,是生产环境可靠性的基础。

这五个问题比"跑分多高""参数多大"更能反映一套 Agent 方案的真实生产可用性。


DSH 对企业的战略启发

DSH 的"一切皆插件"理念之所以值得企业关注,核心不在于它是不是当前"最强"的 Harness,而在于它代表了一种更适合企业场景的架构方向。

这个方向是:降低企业接入自有业务系统的门槛,让 Agent 能力和企业 IT 资产真正打通,而不是变成一个孤立的聊天机器人。

这与 Gartner 近几年反复强调的核心判断是一致的:企业级 Agentic AI 的价值不在于单个模型的智能程度,而在于 Agent 能否深度嵌入现有业务流程与系统生态。

Gartner 预测,2026 年底前,40% 的企业应用将嵌入任务专属的 AI Agent,而 2025 年这个数字不足 5%。

这种大规模嵌入的前提,正是一套能够灵活对接各类企业系统的开放 Harness 架构。

值得关注的是全球 AI Agent 市场数字:Axis Intelligence和MarketsandMarkets数据显示,2025 年市场规模约为 79 亿至 80 亿美元,预计 2026 年达到 109 亿至 118 亿美元,CAGR 约 44%-47%,到 2030 年有望超过 520 亿美元。

这个市场里,真正的竞争已经不是谁的模型更聪明,而是谁能把 Agent 能力更稳定地嵌入企业的真实工作流。

这场竞争,本质上是 Harness 工程能力的竞争。

写在最后:Harness才是AI Agent时代真正的护城河

回到本文开头的问题:DeepSeek Harness 跟其他 Agent 框架有什么本质区别?

现在答案应该清晰了。

区别不在于谁家的模型更聪明,而在于谁的 Harness 设计能让企业以更低的成本、更高的可靠性,把 AI 能力嫁接到真实业务流程里。

模型层的竞争终将走向同质化,就像今天已经很难说清 GPT 系列和 Claude 系列在通用智能上到底谁强多少;但 Harness 层的竞争才刚刚开始,这是一场关于工程细节、生态开放度、企业适配能力的持久战。

DeepSeek 这次高调推出 Harness,本质上是在下注一个判断:模型的红利期正在收窄,工程层的红利期才刚刚打开。

MIT 开源、Cordis 插件体系、多模型支持、热插拔架构,每一个设计选择背后都有清晰的战略逻辑。

这个判断值得每一个正在做 AI 战略决策的企业管理者认真消化。

对企业管理者来说,DSH 出现带来的最大价值或许不是"我们应不应该用 DSH"这个具体的选型问题,而是一次认知校准的机会。

这个机会是:以后评估任何一款 AI Agent 产品,除了问"它用的是什么模型",请务必追加一个问题"它的 Harness 是怎么设计的"。

这个问题,比模型参数量更能戳破营销话术,也更能判断一个 AI 产品到底是花架子还是真本事。

Agent = LLM + Harness,这个公式从被提出的那天起,就在提醒我们一件事:智能只是原材料,工程才是产品。

看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,也可以给个星标,你的支持就是我的动力。

全文完

王吉伟频道图书《一本书讲透Agentic AI》已出版,完整构建Agentic AI在企业应用中的全景式知识体系,内容跨越 “基础认知-技术原理-业务应用-组织战略-实操指南” 五大板块,为读者提供从认知共识、技术解构、业务对接到组织变革的端到端路线图,欢迎大家关注。

【赠书福利进行中】

感谢大家的长期关注与支持。欢迎小伙伴们在文末留言与转发,王吉伟频道会随机选取读者,《一本书讲透Agentic AI》包邮到家。

【 文末福利1 】:后台发消息研报2026,获取15篇 2026年 AI Agent研报 。


【文末福利2】: 后台发消息Workflow,获取 Agentic Workflow 相关25篇论文。


【文末福利3】:后 台发消息agentic,获取Agentic AI相关资源 。


【文末福利4】:后台发消息RPA Agent,获取 相关论文和研报。


1、

2、

3、

4、

5、

6、

7、

8、

8、

10、

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
605303,重大资产重组

605303,重大资产重组

中国基金报
2026-09-28 22:05:08
伊朗总统终于醒悟,自己犯下了四个致命失误,但现在后悔已经晚了

伊朗总统终于醒悟,自己犯下了四个致命失误,但现在后悔已经晚了

闻识
2026-09-28 07:18:38
齐达内在皇马钦点前切尔西球星阿扎尔,浪费皇马1亿欧;齐达内惋惜道:可惜阿扎尔饱受伤病困扰!

齐达内在皇马钦点前切尔西球星阿扎尔,浪费皇马1亿欧;齐达内惋惜道:可惜阿扎尔饱受伤病困扰!

福酱的小时光
2026-09-28 16:58:41
勇士总经理:波尔津吉斯由于健康问题将无限期缺阵

勇士总经理:波尔津吉斯由于健康问题将无限期缺阵

懂球帝
2026-09-28 23:22:07
亚运会|举重综合:世界纪录六次被改写 中国队摘两铜

亚运会|举重综合:世界纪录六次被改写 中国队摘两铜

新华社
2026-09-28 22:54:26
曾对着裁判爆粗中国篮球被你们吹掉了!浙江官宣:免除方俊总经理

曾对着裁判爆粗中国篮球被你们吹掉了!浙江官宣:免除方俊总经理

狼叔评论
2026-09-28 17:44:02
翟德怀任沈阳市副市长

翟德怀任沈阳市副市长

上观新闻
2026-09-28 17:53:58
为了“掏空”老百姓的钱袋子,编造出来的四个谎言,谁信谁倒霉!

为了“掏空”老百姓的钱袋子,编造出来的四个谎言,谁信谁倒霉!

风信子的花
2026-05-26 19:06:10
C罗暴怒原因揭晓!约好出战半小时却变卦 72岁新帅:他不该拒绝谢场

C罗暴怒原因揭晓!约好出战半小时却变卦 72岁新帅:他不该拒绝谢场

我爱英超
2026-09-28 07:14:39
抢救58天后身亡!情侣吃“分手饭”醉酒摔倒,男友操作太离谱,法院判了↗

抢救58天后身亡!情侣吃“分手饭”醉酒摔倒,男友操作太离谱,法院判了↗

极目新闻
2026-09-28 19:00:17
旗舰卖不动了?三大国产新机首销遇冷,最惨的跌了4成

旗舰卖不动了?三大国产新机首销遇冷,最惨的跌了4成

小蜜情感说
2026-09-28 01:17:45
高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

高铁女孩熟睡男生盯死手机不敢转头,两百万外网围观无声的人机对峙,藏着成年人不敢破冰的社交尴尬防线

明话直说
2026-08-25 18:07:55
美国中期选举:特朗普支持者要求特朗普宣布进入紧急状态,或辞职

美国中期选举:特朗普支持者要求特朗普宣布进入紧急状态,或辞职

阿尔卑斯瞭望
2026-09-28 23:35:07
鄂媒长文质疑篮协主席郭振明:篮协强令女篮退还慰问红包且无后续

鄂媒长文质疑篮协主席郭振明:篮协强令女篮退还慰问红包且无后续

狼叔评论
2026-09-28 12:08:11
亚运奖牌榜:中国132金53银45铜双榜第一 超日本91金断层领先

亚运奖牌榜:中国132金53银45铜双榜第一 超日本91金断层领先

醉卧浮生
2026-09-28 22:16:08
“卖货给欧洲”的时代结束了:45%关税逼出大招!中国不卖货改建厂

“卖货给欧洲”的时代结束了:45%关税逼出大招!中国不卖货改建厂

大卫聊科技
2026-09-26 12:58:39
被骗者平均年龄81岁,专挑老人下手的“新”骗局要注意

被骗者平均年龄81岁,专挑老人下手的“新”骗局要注意

环球网资讯
2026-09-28 17:00:05
全世界感叹:新的世界秩序已经形成,两个超级大国时代开启

全世界感叹:新的世界秩序已经形成,两个超级大国时代开启

农夫史记
2026-09-27 19:57:36
“第一次感觉离死亡这么近!”男子称喝了几口隔夜鱼汤差点窒息,孩子哭着喊“爸爸不要死”……医疗专家解析

“第一次感觉离死亡这么近!”男子称喝了几口隔夜鱼汤差点窒息,孩子哭着喊“爸爸不要死”……医疗专家解析

都市快报橙柿互动
2026-09-28 00:14:52
拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

拉夫罗夫:莫斯科将把所有历史上的俄罗斯土地归还其合法家园

旧窗老街
2026-02-23 01:50:19
2026-09-29 01:03:00
王吉伟
王吉伟
关注互联网+与行业转型
874文章数 8584关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

这台车开完还想开 智界RX最让我意外的,不是智驾,是操控

态度原创

旅游
数码
家居
手机
教育

旅游要闻

魔都生活指北丨@全体上海人:长风公园焕新归来,又一个童年记忆回来了!

数码要闻

罗巍:荣耀Magic9系列影像成了 价格全靠友商衬托

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

荣耀Magic9发布后,罗巍宣布荣耀影像站起来了

教育要闻

全国首个!C9大学,获批一交叉学科博士点

无障碍浏览 进入关怀版