【DSH】如何将 DeepSeek Harness 嵌入生产环境?万字解构 DeepSeek Agent Harness 的运行机制与安全边界

发布时间:2026/8/15 2:33:18

【DSH】如何将 DeepSeek Harness 嵌入生产环境?万字解构 DeepSeek Agent Harness 的运行机制与安全边界
DeepSeek Harness 全景解剖从第一次启动到“一切皆插件”的运行时组装dsh web看上去像一个启动网页的命令真正值得追问的是源码中为什么找不到一个不可替换的“Web Agent Core”答案不在 Web UI而在启动时构成的 Cordis plugin tree。UI 只是其中一个 Bundle 加入的表层Agent、会话、模型适配、工具、Sandbox 与 Approval 也都以同样的方式进入树。先把研究对象放对位置模型会生成文本和 tool-call block它不保存项目会话、不能自行打开文件也不拥有操作系统权限。Agent Harness 是两者之间的承载运行时保存任务事实、组装每次请求可见的 Context 与工具 schema、把调用送往真实执行环境并在边界处施加策略。因而浏览器不是 Harness 的定义换成 Headless runner、SDK server 或 ACP transport核心问题仍然相同。在本基线中dsh是“profile launcher”。dsh web是--profile web的别名dsh --profile headless …则装配一条一次性运行的 Headless surface。这一结论来自apps/cli/src/args.ts并以pnpm dsh --help的实际输出验证。CLI 只消费自己的 profile、patch 与 dump 参数它遇到未知 token 后把余下参数原样交给已经装配出的 app plugin。这个分界让新 surface 自己拥有命令行而不必修改 launcher。四个层次四个所有者Cordis 是此仓库的组装框架Plugin 在共享ctx上提供 service、订阅 typed event、注册 effectplugin 卸载时注册随 effect 反向撤销。“一切皆插件”不是“所有文件都可选”而是没有一个通过修改 Loop 才能替换的特权核心。实体谁拥有它回答的问题Plugin代码包我注册/提供什么能力Bundle可发布包的dsh.bundle我贡献哪一层 Cordis patchProfile$DSH_HOME/profiles/name这次运行选择哪些 Bundle、安装哪些 out-of-tree 依赖PatchProfile、home 或命令行对既有 row 做何种最终替换/插入最容易出错的是把 Bundle 当成 Profile。Bundle 是可分发的“贡献层”Profile 是用户启动的命名组合。二者都使用package.json中的dsh字段但前者声明 patch 文件后者声明有序bundles列表。Patch 也不是深度 merge同一id的替换应重述该 row 所需的完整 config。这是安全而清晰的配置契约不是 YAML 技巧。Boot从空树到可运行产品apps/cli/src/profile-boot.ts中的composeProfile()把 Bundle patch、profile patch、home patch 与--patchoverlays 依次组成 row随后boot()在一个空 root config 上装载它。实际优先级为Profile bundles (listed order)Profile cordis.patch.yml$DSH_HOME/cordis.patch.yml--patch overlays (argv order)Effective Cordis plugin tree后层可以替换早层的同 id row命令行 patch 因此适合作为可复现实验的显式覆盖而不是偷偷改安装文件。Profile boot 还将 launcher 的环境快照和 app arguments 作为服务提供给树并监听两个用户 patch 文件以允许 config-only reload。它不理解某个 Agent 的行为。我在 Linux x86_64 / Node 24.14.0 上执行DSH_HOME$(mktemp-d)pnpmdsh--profileheadless --dump-default-config命令以 0 退出输出 333 行。其前部可直接看到llm、session、agent、session-persistence-jsonl、subprocess、sandbox、sandbox-policy、approval、permission与工具 rows。这不是“Headless 少了运行时”而是 Headless Bundle 换掉了 surface。第二次以--patch ../article-1-overlay.yml --dump-config运行亦以 0 退出且输出将tool-web标记为由该 overlay patch这验证了层的可观察合成。dsh web实际启动什么最准确的回答不是一个固定对象名称而是“web Profile 的有效 plugin tree”。dsh-base给出共同的基础层dsh-web-app加入 browser applicationdsh-headless则加入一次性 runner、没有 server。请把 “Web UI” 视作一个可替换 consumer而不是 Agent Harness 的 owner。这种设计有一个工程后果要改变工具、模型、执行 provider 或 UI先问它属于哪一个 row 和哪一个 service再决定是在 profile、bundle 还是 patch 改动。修改dsh web的启动代码通常是最后选项。可复现起点源码路径要求 Node 满足根package.json的 engines使用 pnpm。发布包与本次基线没有同一可核验 git headregistry 的当前包为0.1.0-rc.6而冻结源码为rc.5因此本文没有将前者的行为冒充为基线证据。本文环境中node-pty的原生构建因归档权限失败故仅验证了不加载 PTY 的 CLI/dump 路径。真实 Web boot 还需要完成官方要求的 build artifacts。下一篇不再讨论树怎样形成而问一个更关键的问题树已经装好后为什么一句“运行测试”可以在一次 Turn 中发出多次模型请求、持久化多组事实并最终触及真实环境DeepSeek Harness Runtime 深潜一次 Agent 任务如何从模型推理走向真实世界用户只说“修复测试”为什么不是一次 completion 就结束因为 Harness 把“完成一个用户任务”和“发出一次模型请求”分成了 Turn 与 Step。这个区分不是命名偏好而是日志、重试、工具执行与外部控制能否正确推理的边界。从 Inbox 到 Turn再到 StepAgent 有一个 Inbox。followup()写入next-turn并唤醒 driversteer()写入next-step并唤醒inject()也写入 next-step但不自行唤醒。ReactLoopAgent在agent-loop/src/agent.ts先持久化turn/start原子地 claim 输入再经过agent/pre-stepwaterfall。该 hook 可以拒绝或重写进入模型的 message因此一个已开始 Turn 可以不花任何 Step 便结束日志仍能记录尝试。一个 Step 是一次请求、一次 streaming completion 与其工具批次同一 Turn 在工具结果或新的 next-step 输入出现时继续下一 Step。核心顺序如下ToolsLLMSession logAgent LoopToolsLLMSession logAgent Loopturn/start, step/start, user/messageassembled requestassistant chunks / messageassistant/message, tool/callguarded execution pipelinefinalized resulttool/result, step/endnext Step when work is owedturn/end仓库的 JSON-RPC Bash snapshot 给出可核验的具体轨迹turn/start(1)与step/start(1,1)后模型产生bashcalltool/call的 seq 63 在执行前记录tool/result的 seq 64 用sourceEventSeqs:[63]链接它随后step/end同一 Turn 的step/start(1,2)再请求模型最终turn/end。这证明“一条任务 一个模型调用”是错误的运行时模型。该轨迹是当前测试 fixture 证据而非本文环境向外部模型的实测。SessionEvent 为什么是事实来源Session是 append-only logderiveMessages()只从带surfaceOp的 message-producing event 折叠出模型历史。chunk、turn boundary 这类 raw 事件留在日志中以服务重放/UI却不会被误塞回 prompt。Loop 在请求前调用this.session.deriveMessages()可选 invariant 又从 log 重建请求边界。由此得到仓库明确的不变量Model-visible means logged。这带来一个很实际的设计约束若你的 plugin 想向模型增加持久上下文不应偷改内存 messages array应定义并记录相应的SessionEvent再从日志投影。这样 resume、fork、transcript、telemetry 与 UI 都可以从同一事实流工作。反过来实时状态应在agent/*事件表达不能误称为会话事实。Tool pipeline日志先于副作用工具并非模型直接调用 shell。Loop 先把模型生成的调用持久化再让ctx.tools驱动 pipelineassistant tool-call blockpersist tool/calltools/pre-execute waterfallmonotonic guardstools/execute waterfall bodytools/post-execute waterfallfinalizeContent tools/resultpersist tool/resulttools/pre-execute、tools/execute、tools/post-execute都是 waterfalllistener 必须以next()委托后续链否则它是在有意短路。pre可 allow/deny/ask随后 registered guard 只能收紧、不能放宽既有 owner policyexecute可包裹调度timeout、metrics 等post可接受、阻断、替换输出或添加 context。最终finalizeContent强制 content-only 合约tools/result只观察冻结的权威结果。335 项 CLI/Agent Loop 测试在本环境通过其中 tool invariant 明确检查这三个阶段的次序。Capability Seam 与 Execution World所谓 Capability Seam 不是“有一个 interface”就成立。完整的 seam 有三角Definition 声明ctxservice 合约Provider 实现它Consumer常见为模型可见 Tool只依赖合约。文件系统、subprocess、sandbox、shell/PTY 的关键含义在于多个 consumer 可共享一个 execution world。替换 fs/subprocess provider 为远端 sandbox并不自动迁移 session 或模型它只移动由该 provider 承担的文件/进程操作。这也是为何“新增能力”要先问谁定义、谁提供、谁消费、什么会持久化只写一个 Tool body 而没有稳定 provider 边界往往是在制造不可替换的耦合。安全边界不能合并成一个词层控制什么不控制什么Tool exposed to model模型能请求哪些能力请求是否批准、OS 是否允许Permission policy预设把 mode 映射到策略它不是内核隔离Approval某次 ask 的人类决定不是长期 OS capabilitySandboxprovider 对文件/进程的约束当前SandboxMode不表示网络/进程政策OS / credentials进程实际拥有的权限与密钥Harness 不能凭空收回宿主已授予的一切默认 headless config 在本次 dump 中将workspace-write配为 sandboxworkspace-write approvalaskdanger-full-access配为 approvalnever。这描述 composition而不是“有 Sandbox 就安全”。Python minimal example 明确使用danger-full-access只应在一次性 checkout/container 中运行。本地没有 API credential故真实模型 tool 的端到端路径未 runtime-verified不要把 snapshot 或源码推断写成“实测模型”。但执行顺序、日志事实与 hook 合约由架构文档、实现、fixture 与通过的测试共同覆盖。下一篇把这些稳定边界变成行动准则新增一个能力时何时写 Plugin、何时写 Adapter以及怎样把同一个 runtime 放进脚本、服务或编辑器生态。从理解到掌控扩展 DeepSeek Harness并将 Agent Runtime 嵌入真实工程系统如果要增加一个模型工具为什么不直接在 Agent Loop 的if分支里接入因为 Loop 的职责是驱动 Turn/Step把某个业务能力塞进去会让每一个 product composition 都承受它的依赖、权限与失败语义。仓库的边界更严格新行为通过 Plugin、service、event 或 Tool registry 进入Loop 不为它改形状。先选择扩展点需求首选机制不应误用为新模型可见能力Tool Plugin 注册到ctx.tools修改 Agent Loop新文件/进程实现Capability Provider复制每个 Tool拦截一次 tool calltools/*waterfall / guard在 Tool body 中硬编码全局政策新 provider 协议LLM Adapter仅填一个 provider 名称新可安装产品层BundleProfile 本身非交互运行Headless / SDK serverWeb UI 自动化一个最小 plugin 只是导出apply(ctx)Cordis 在加载时调用它。注册返回的是 effectplugin unload 后相应注册撤销。这是 out-of-tree code 可以与 in-tree package 同等参与树的原因。生产插件不应只console.log它至少要明确 inject 依赖、注册何种能力、失败时是否阻断调用、以及是否需要 durable event。Tool把业务副作用放进已存在的通道官方adding-a-tool指南要求通过defineTool/ctx.tools注册 definition。definition 提供可供模型 schema 化的参数、execute的 canonical value以及 model-facingoutput.renderUI card 则是独立的纯 presentation projection。不要在 presenter 中读文件、取时间或做 I/O它还会在 Session log replay 中运行。importtype{Context}fromdeepseek-ai/cordisimport{defineTool}fromdeepseek-ai/dsh-toolsexportconstnameproject-metadata-toolexportconstinject[tools]exportfunctionapply(ctx:Context){ctx.tools.register(defineTool({name:project_metadata,description:Return controlled project metadata.,// Parameter/output schemas must follow the baseline tool cookbook.asyncexecute(_args,_signal){return{value:{revision:replace-with-real-provider}}},}))}这是结构示意不能原样当成可运行文件当前版本的 schema 与 return contract 需从docs/cookbook/adding-a-tool.md复制完整定义并为输入、拒绝、执行错误与输出固定测试。真正的 non-toy case 是“受控项目元数据”Tool 只消费一个注入的 metadata provider权限/approval 仍在通用 pipeline持久化仍由 Loop 的tool/call/tool/result完成。这样没有新增一个绕开审计的直接 shell 通道。Bundle 是分发Profile 是选择当 plugin 要交给别人安装写 Bundle包内dsh.bundle指向cordis.patch.yml该 patch insert plugin rows。用户再以dsh plugin --profile demo add package将 Bundle 放入该 Profile 的有序列表。Profile 仍可用自己的cordis.patch.yml覆盖 Bundlehome 与--patch层仍在其上。Git 安装与 npm 包不同Git 安装的是 source若其preparescript 获允会在用户机器执行代码应只信任源码并 pin commit或分发已构建 tarball/npm artifact。Provider config 不等于 LLM Adapter“换模型”有两种完全不同的改动。若已注册 Adapter 认识新 provider route/model id只需要 composition 中的 provider/model/credential config。若需把 Harness 的GenerateOptions翻译为一种新上游协议则实现LlmAdapter.stream()将 provider response 还原为严格StreamChunk序列再调用ctx.llm.registerAdapter()。Adapter 必须遵守 usage 在 finish 前、finish 后无 chunk、tool arguments 保持 raw JSON、错误转为稳定 code、传播 abort signal 等契约。只改DEEPSEEK_BASE_URL并不会实现另一种 streaming dialect。选择嵌入边界谁驱动 runtime?CLI one-shotOwn processExternal agent clientWeb client business calldsh --profile headlessTypeScript/Python SDK over stdio JSON-RPCACP serverTypert API GatewayHeadlessdsh --profile headless job创建 fresh persisted session、打印最终文本并退出适合 shell automation。SDK JSON-RPCTypeScriptDeepSeekHarness或 PythonDeepSeekHarness管理一个子进程。客户端只驱动 runtimecordis.yml仍拥有组成。Python SDK 文档要求 Python 3.10、受支持平台与可修改的隔离 workspace其 bundled runtime 不要求系统 Node。ACP面向 Agent Client Protocol 的 automation server。它创建 fresh agents走 stdin/stdout JSON-RPC只发 committed assistant text并可处理 bridge-owned one-shot permission request不等于 UI、transcript 或 editor protocol。API GatewayWeb host/client 的 unary Remote service 层。Remote/RemoteScope描述可跨 connection/api调用的方法session event stream 不应伪装为 Remote unary call。这四条路可并存它们是入口/transport不是对同一 capability 的重复实现。SDK 进程关闭、ACP client disconnect 与 Cordis unload 都必须归结到明确的 agent/session dispose 生命周期。上线前的最小检查指出 capability 的 Definition、Provider、Consumer 与 owner不要只贴 Tool 名字。为模型可见或可重放事实设计SessionEvent而非临时数组。明确 Tool exposure、policy、approval、sandbox、OS/credential 的五层责任。固定cordis.yml、plugin 版本、cwd、credential 来源与日志目录危险 composition 只在 disposable 环境运行。用真实或 mock provider 跑 tool case读取 JSONL 的 call/result/Step没有 credential 时只报告 source/test verification。在本研究容器中本地 out-of-tree plugin 的真实长驻 boot 和 Python SDK 未完成 runtime verification前者受 source build/PTY 原生依赖限制后者还需要 credential 与 bundled wheel。本文不以教程文本替代实验。已经验证的部分是 CLI composition dump 以及 335 项核心测试其余结论按照文档/源码等级陈述。读到这里面对陌生 package 的正确起手式不是“它是不是核心”而是它定义什么 capability谁提供谁消费何时运行什么持久化哪些 hook 能替换它失败落在哪里这正是把 Harness 从“能运行”变成“能嵌入、能修改”的方法。

相关新闻

电商搜索意图生成:用T5模型提升商品可发现性的实战指南

电商搜索意图生成:用T5模型提升商品可发现性的实战指南

2026/8/15 2:33:18

在电商搜索场景中,用户输入的查询词往往简短、模糊,甚至包含拼写错误,这给搜索引擎准确理解用户意图、召回相关商品带来了巨大挑战。例如,用户搜索“跑步鞋”,其背后可能隐藏着“男士缓震跑鞋”、“女士竞速跑鞋”或“…

零依赖智能体记忆系统Inspeximus:轻量级AI记忆管理实践指南

零依赖智能体记忆系统Inspeximus:轻量级AI记忆管理实践指南

2026/8/15 2:33:18

1. 先搞清楚“零依赖智能体记忆”到底解决什么问题 看到 DanceNitra/inspeximus 这个项目,标题里最核心的两个词是“零依赖”和“智能体记忆”。这直接点明了它的定位:一个不依赖外部库的、用于构建智能体(Agent)记忆系统的工具…

量化交易入门:7大核心策略原理与Python实战实现

量化交易入门:7大核心策略原理与Python实战实现

2026/8/15 2:33:18

最近在后台收到不少读者私信,想了解量化交易如何入门,尤其是面对五花八门的策略不知从何下手。很多朋友尝试自己写策略时,常常卡在策略逻辑不清晰、回测结果不理想、或者不知如何将策略转化为实际代码这几个环节。网上的资料要么过于学术化&a…

STM32串口ISP烧录全解析:从Bootloader原理到Flymcu实战排错

STM32串口ISP烧录全解析:从Bootloader原理到Flymcu实战排错

2026/8/15 3:43:21

1. 项目概述:为什么Flymcu是STM32开发者的“老朋友”在STM32的开发世界里,烧录程序是每个项目从代码到硬件落地的必经之路。提到烧录,很多人第一反应是昂贵的专用仿真器,比如J-Link或者ST-Link。但对于大量使用串口进行调试、或者…

Python数据分析实战:从工具使用到数据思维的系统构建

Python数据分析实战:从工具使用到数据思维的系统构建

2026/8/15 3:43:21

1. 从“会用工具”到“理解数据”:为什么你需要一本好的Python数据分析教材 最近几年,Python数据分析的热度居高不下,几乎成了职场和学术圈的“硬通货”。无论是想转行数据岗位,还是想用数据驱动业务决策,Python都是绕…

威联通Qsirch AI模式深度解析:本地NAS如何实现智能语义搜索

威联通Qsirch AI模式深度解析:本地NAS如何实现智能语义搜索

2026/8/15 3:43:21

你有没有过这样的经历:在 NAS 里存了成千上万的文件——照片、文档、视频截图、会议录音——明明记得某个文件就在那里,但用文件名、日期甚至模糊关键词搜了半天,就是找不到。传统的 NAS 搜索,就像在一个没有目录的图书馆里&#…

基于Python的人体健康检测与可视化分析系统的设计与实现毕业设计项目源码文档

基于Python的人体健康检测与可视化分析系统的设计与实现毕业设计项目源码文档

2026/8/15 3:43:21

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

基于深度学习的TPU焊接缺陷检测:从原理到YOLOv8工程实践

基于深度学习的TPU焊接缺陷检测:从原理到YOLOv8工程实践

2026/8/15 3:43:21

这次我们来看一个关于TPU焊接质量检测的技术话题。虽然标题本身更像是一个行业内的吐槽,但它精准地指向了TPU(热塑性聚氨酯)材料在焊接工艺中面临的普遍挑战:虚焊、褶皱、良品率低以及材料本身的次品率问题。对于从事柔性电路板&a…

OneDrive云存储高效利用策略:从免费5GB到1TB的合法扩容与智能管理

OneDrive云存储高效利用策略:从免费5GB到1TB的合法扩容与智能管理

2026/8/15 3:33:21

1. 项目概述:从“白嫖”到高效利用的云存储策略最近在几个技术社群里,总能看到有人讨论“白嫖”大容量云存储空间的话题,其中微软的OneDrive被提及的频率相当高。作为一个长期依赖云服务进行文件同步、备份和协作的深度用户,我完全…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/13 11:01:28

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/14 10:48:24

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/13 17:17:06

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

一文读懂快消WMS怎么选?2026年国内外10大主流WMS品牌盘点

2026/8/15 0:03:07

快消品(FMCG)是流通速度较快、竞争较为激烈的行业之一。一瓶饮料从出厂到消费者手中,往往只有几十天甚至几天的周转窗口。这决定了快消行业的仓储管理系统(WMS)与制造业、电商行业存在明显区别:它不仅需要管…

内景 空间站内部 中国空间站 太空 内仓

内景 空间站内部 中国空间站 太空 内仓

2026/8/15 0:03:07

本项目为前几天收费帮学妹做的一个项目,在工作环境中基本使用不到,但是很多学校把这个当作编程入门的项目来做,故分享出本项目供初学者参考。 一、项目描述 空间站内部 中国空间站 太空 内仓 地址:本地PC端运行(或Web…

重新定义数据接口:3个突破性场景让通达信数据读取更智能

重新定义数据接口:3个突破性场景让通达信数据读取更智能

2026/8/15 0:03:07

重新定义数据接口:3个突破性场景让通达信数据读取更智能 【免费下载链接】mootdx 通达信数据读取的一个简便使用封装 项目地址: https://gitcode.com/GitHub_Trending/mo/mootdx 当我们面对海量金融数据时,传统的数据获取方式往往让我们陷入困境—…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/15 1:04:46

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/14 19:35:14

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…