Matt Pocock 的 AI 工程工作流:与其追模型,不如造 harness

发布时间:2026/8/9 23:56:31

Matt Pocock 的 AI 工程工作流:与其追模型,不如造 harness
Matt Pocock 的 AI 工程工作流与其追模型不如造 harness模型只是引擎。prompt提示词、skills工作流规则、codebase 架构代码好不好改、工作环境agent 在哪跑、怎么跑。这些才是你能控制的底盘。Matt Pocock 用 62 分钟拆解他的整套 Agentic Engineering 方法论。从战术 vs 战略编程到 AFK 并行工作流再到「删光一切重新开始」。一、开场定调别只盯模型看看你的 Harness访谈第一分钟Matt 就扔出一个反直觉的判断Everyones obsessed with the model and I think they should be more interested in the harness. 所有人都在追模型但我觉得他们应该更关心 harness。他把 AI 工程比作一辆 F1 赛车。模型是引擎。当然重要但你控制不了它。harness 是底盘、空气动力套件、悬挂系统。prompt 怎么写、skills 怎么组织、codebase 架构好不好、agent 在什么环境里跑。这些你能控制而且它们跟引擎一样重要。什么是 HarnessHarness 本义是「马具/挽具」。套在马身上用来驾驭和传力的皮带系统。马的力量再大没有缰绳你控制不了方向。没有挽具你拉不动车。Matt 把这个词搬到 AI 工程里。指围绕模型的整套可控基础设施包括提示词prompt你怎么给 agent 下达指令Skills可复用的工作流程和规则集Codebase 架构代码的模块化程度、接口清晰度、改动成本自动化流水线CI/CD、GitHub Actions、沙箱环境Context Window 管理CLAUDE.md / AGENTS.md 里放什么、不放什么工作流设计human-in-the-loop 还是 AFK、队列还是循环一句话模型是「你拉什么车」harness 是「你怎么赶车」。马模型会越来越壮。但驾车技术harness是你自己的。换匹马照样跑。Matt 甚至说这是他的「hot take」个人锐评、大胆主张。快速抛出、刻意引发讨论的观点。模型和 harness 五五开。人们花 90% 精力追最新模型。忘了剩下 50% 的可控区域。有人问我怎么优化 token 消耗把 codebase 做得更容易改就行。codebase 架构好便宜模型也能干同样的活。二、战术编程已死战略编程永生Matt 引用了 John Ousterhout 的《软件设计的哲学》(A Philosophy of Software Design)里的经典二分法战术编程Tactical Programming写代码、修 bug、处理语法细节、创建 commit。日复一日的「地面作战」。战略编程Strategic Programming赢得战争而非战役。codebase 应该长什么样怎样提高团队开发速度模块间接口怎么定义这确实出自原书第 3 章「Working Code Isnt Enough」。不是 Matt 自己发明的。Ousterhout 在此章定义了两种对立的编程姿态。战术编程以最快速度搞定当前任务为唯一目标不关心未来的修改成本。他为此造了词「战术龙卷风」tactical tornado形容产出极快但留一堆技术债的人。战略编程则采用投资心态。宁可当前慢一点也要花时间改善系统设计。回报期估算 6–18 个月。关键信条首要目标是好的设计代码能跑只是副产品Matt 的判断很直白AI is basically eaten tactical programming. Its gone. All gone. AI 基本吃掉了战术编程。全吃掉了。没了。AI 写代码比你快、比你便宜、还不用睡觉。你现在拥有一支「无限的战术程序员舰队」。但指挥这支舰队的能力。把任务界定清楚、把难点预先设计好、把模块接口定义准确、把测试策略想清楚。这些才是你作为人的主战场。这些东西没有因为 AI 出现而改变。Matt 说得直接。战略编程 30 年前怎么做现在就怎么做。只是你把活从初级程序员手里转交给了 AI。三、你的技能 AI 的天花板Your skills are the ceiling on what AI can do. 你的技能就是 AI 能发挥的上限。Matt 到处看到同一个现象。AI 让资深开发者强 10 倍。但给初级开发者的提升非常有限。为什么因为 AI 是倍增器。基数小乘出来还是小。基数大乘出来吓人。这不是说初级开发者没前途。Matt 自己也经历过那个阶段。他最初是声乐老师转行写代码现在教几万开发者。但他的观点很清楚Getting good with AI is really about getting good at your domain. 用好 AI 的关键是精通你自己的领域。David 追问了一个尖锐的问题。那怎么看待「真正的 AI 信徒」那些技术基础一般但把 AI 工具玩得飞起的年轻人。他们会不会比不碰 AI 的资深开发者更有竞争力Matt 承认热情 实验精神 资历。但他引入一对概念DXDeveloper Experience和 AXAgent Experience。好的 codebase让人类开发者和 AI agent 都舒服。模块边界清晰、改动影响范围小、测试覆盖充分。这些东西资深开发者做了 10 年自然知道怎么做。初级开发者要补的不是「怎么用 AI」。而是这些软件工程基础。四、/teach把教学法编码进 Agent访谈中最精彩的实操演示是 Matt 的 /teach。原理简单但执行深度惊人。把教育学的关键概念最近发展区、知识/技能/智慧三层模型编码进一个 skill。让 agent 变成你的私人教师。针对任何主题生成个性化课程。现场 Demo 环节Matt 模拟了一个「vibe coder 想补基础」的场景。他的 prompt 没提任何具体技术。只描述了自己的处境I am a vibe coder and I want to fill in my knowledge gaps so that I can ship better software. I know some very, very basic CLI commands and I know just about enough to read some code and use the terminal, but thats about it. 我是一个 vibe coder我想补上知识缺口让我能交付更好的软件。我只会一些非常基础的 CLI 命令刚好够读代码和使用终端差不多就这样。Agent 读完这个 prompt做了几件事先对齐目标。问三个澄清问题理解学员的目标。创建mission.md。记录「这个人想做什么、为什么重要、成功长什么样」。搜索可信资源判断「对 vibe coder 来说最高杠杆的缺口不是更多语法。而是 Git、读错误信息、debug、测试」。生成 HTML 课程文件。带交互式测验、终端实操练习、参考链接。这门课不是静态的。Matt 特别强调这是stateful skill。agent 在工作区里存学习记录。知道你已经学了什么、下一步该学什么。「好老师记得你学过什么」AI 也可以。Matt 甚至用这个 skill 自学了魔方。「我现在可以凭记忆复原魔方了。靠这个 skill 教的。」安装命令一行npx skillslatest add mattpocock/skills --skillteach五、Procedure vs Ability手握方向盘聊到 skill 架构时Matt 做了一个关键区分Procedure过程Ability能力谁触发用户手动/命令模型自动判断描述词不泄露进 context window常驻 context每轮都占位控制权人模型适用场景规划、审查、教学、面试代码规范、风格检查Matt 偏好⭐ 首选谨慎使用I prefer to be the one in control. I dont want to delegate my thinking to the model. 我偏好人来掌控。我不想把思考也委托给模型。他举了 /grill-me 做例子。这个 skill 只有 4-5 句话。把 agent 变成一个对抗式面试官。你说一个想法它追着你问直到达成共识。Matt 用它替代计划模式。在写任何代码之前先跑一轮。Ive been using this for coding, just as a replacement for plan mode. Its unreasonably effective. 我一直用这个来写代码当计划模式的替代品。效果好得不讲道理。David 提了个有意思的反驳。那 Obra 的 Superpowers目前最流行的 skills 仓库之一走的是 ability-first 路线让模型主动调用。你怎么看Matt 的回应很务实。能力型 skill 的描述词会泄露进 context window。装 100 个 ability skill等于上下文里挂 100 条描述。每轮对话都在为不用的东西付 token。所以他的选择很明确尽量用 procedure。把知识留在人脑里而不是塞进 agent 的 context 里。六、AFK把自己并行化Matt 说他真正感受到 AI 编码威力是在发现 AFKAway From Keyboard之后The moment I discovered AFK was the moment I really got into AI coding. I was able to massively increase my output. 发现 AFK 的那一刻我才真正进入 AI 编码。我突然能并行产出两个我、三个我、四个我同时做事。他管这叫「把自己并行化」parallelize yourself。关键工具是他自己造的Sandcastle。一个在 Docker/Podman 沙箱里运行 agent 的系统。配合 GitHub Actionsissue 打上explore标签 → AFK agent 自动分析可行性issue 打上agent implement标签 → AFK agent 在沙箱里实现PR 提交 → AFK agent 自动 code review人只需要做最终 approve这套流水线的关键每个 AFK agent 做一件范围明确的事。Matt 说这不是什么新概念。开发者团队一直都是这样工作的。一个待办列表、多个人现在是多个 agent取任务、做完提交、人审核。七、Queues, not Loops开发不是死循环访谈后半段David 把话题引向当时 Twitter 上最火的讨论。agentic loop。很多人认为AI 编码的未来是让 agent 在一个 while 循环里不停地跑直到任务完成。Matt 对此态度鲜明This idea that loops are the only way to do it is crazy. 认为循环是唯一方式这想法太疯狂了。他的替代方案Queues队列不是 Loops循环。开发本质是一个队列。产品经理往待办列表加任务。开发者人 or agent取任务、完成、提交。一个死循环 agent 不停地跑。既对不上团队工作方式又在无意义地烧 token。有个 bug report → 打标签 → AFK agent 取走 → explore → implement → review → 人 approve → merge。这不是循环。这是队列。David 用了个精妙的比喻。像中世纪国王管理王国。你不会把大臣派到边疆然后不管了。他会在那边自主决策可能对可能错。你要的是「大臣回来汇报你来做优先级决策」。AI agent 也一样。human-in-the-loop checkpoints 应该被「推得更远」但不该被消灭。因为你看的不只是代码。更是产出代码的系统是否健康。八、Bitter Lesson 与务实主义David 抛出一个尖锐的挑战。你说的 harness 优化会不会掉进机器学习的「Bitter Lesson苦涩的教训」历史上每次有人尝试手动优化系统最终都被 raw compute 的增长碾压。原始算力。纯粹堆更多 GPU、更大模型、更多数据让机器自己学而非人工注入领域知识。Matt 的回应坦率而务实我不是预言家。我只是用现在手头的东西做到最好。如果我用的是经过 30、40 年验证的软件工程基础而不是针对某个模型做过度优化。那么不管未来哪个模型胜出我的工作流都能继续用。 Im not a pundit. Im trying to do the best with what I have right now. If I try to apply good software fundamentals to what Im doing, it will probably continue to work in the future.他的立场不是「模型不重要」。而是不要从模型出发思考问题。从 codebase 出发、从架构出发、从工作流出发。这些才是你能控制的变量。模型会变好、会变便宜、会有新的王者。但你打下的工程基础不需要推倒重来。人们问我怎么优化 token 消耗。把 codebase 做得更容易改。这样你能用更便宜的模型做同样的事。你的安全边界更好、探索成本更低、agent 不需要反复撞墙。 Have a code base thats easier to make changes in, because then you can employ a stupider model.九、删光一切从零开始访谈尾声David 问 Matt给普通 AI 用户一两个立刻能做的事你的建议是什么Matt 的答案出乎意料Delete every single skill, every single plugin, every single MCP server. Delete your CLAUDE.md, delete your AGENTS.md. Go back to absolutely nothing. Observe what the agent does. 删掉每一个 skill、每一个插件、每一个 MCP server。删掉你的 CLAUDE.md、AGENTS.md。回到什么都没有的状态。观察 agent 做了什么。理由是大多数人把 context window 塞爆了。100 条指令躺在上下文里。每轮对话都占 tokens。但 80% 从来用不到。归零之后再加回来的每一样东西都必须是你自己决定需要的 procedure skill。而不是「别人推荐」的 ability skill。如果你发现少了什么。比如没了 Superpowers 的 brainstorming 让你不舒服。再加回来。但要确保你装的每一样东西都是你能修改、能实验、能掌控的。 If you really miss brainstorming from Superpowers, then bring that back. Make sure you install them in a way you can customize them.小结Matt 的方法论可以浓缩为一句话模型给你上限harness 决定你离上限有多近。他反复回到这对概念。engine 和 chassis、tactical 和 strategic、ability 和 procedure、loops 和 queues。每对概念都是同一个主张的不同切面把控制权拿回自己手里。Fable 出来那天所有人都在惊叹模型又变强了。Matt 的反应是模型强很好。但你的 codebase 是不是该更好一点你的 skills 是不是该更精简一点你的 AFK 流水线是不是该更自动化一点这不是保守主义。这是工程师的本能。在你能控制的变量上做功别在控制不了的变量上焦虑。People are focused on the wrong thing. Theyre looking at the big shiny new thing, when in fact just focus on the stuff thats been working for 30, 40 years. And it really does work. 人们关注错了方向。他们盯着闪亮的新玩具但真正有效的是那些已经工作了 30、40 年的东西。而且它们真的有效。素材来源视频YouTube Matt Pococks Agentic Engineering Workflow (just copy him)Matt Pocock 的 skills 仓库github.com/mattpocock/skillsMatt Pocock 的网站aihero.devJohn Ousterhout《软件设计的哲学》(A Philosophy of Software Design)

相关新闻

跨平台Plist编辑器终极指南:ProperTree如何简化你的Hackintosh配置工作

跨平台Plist编辑器终极指南:ProperTree如何简化你的Hackintosh配置工作

2026/8/9 23:56:31

跨平台Plist编辑器终极指南:ProperTree如何简化你的Hackintosh配置工作 【免费下载链接】ProperTree Cross platform GUI plist editor written in python. 项目地址: https://gitcode.com/gh_mirrors/pr/ProperTree ProperTree是一款基于Python和Tkinter开发…

计算机软件著作权权属不明,如何认定侵权?——盘锦龙某侵犯著作权无罪案带来的启示

计算机软件著作权权属不明,如何认定侵权?——盘锦龙某侵犯著作权无罪案带来的启示

2026/8/9 23:56:31

邱戈龙 黄丽璇软件著作权权属不清、代码来源复杂、合作开发关系混乱等问题,常常成为侵权案件的争议焦点。如何准确认定著作权人、如何判断实质性相似、如何处理权利来源不明的指控,成为司法实践中的难点。探讨侵犯著作权罪案件中“权利人身份”这一基础性…

Leshan与Redis集成:分布式LWM2M服务器的高可用部署指南

Leshan与Redis集成:分布式LWM2M服务器的高可用部署指南

2026/8/9 23:56:31

Leshan与Redis集成:分布式LWM2M服务器的高可用部署指南 【免费下载链接】leshan Java Library for LWM2M 项目地址: https://gitcode.com/gh_mirrors/le/leshan Leshan是一个基于Java的OMA LWM2M服务器和客户端库,通过与Redis集成,能够…

身边毕业生都在用 AI 写论文,主流工具都有哪些?

身边毕业生都在用 AI 写论文,主流工具都有哪些?

2026/8/10 0:46:35

每一年毕业季,无数应届毕业生深陷毕业论文难题:选题毫无头绪、搭建大纲逻辑混乱、文献综述整理耗时长、写完初稿发愁查重率、AI 生成痕迹过高被学校检测拦截、参考文献与文档格式反复返工。现如今 AI 学术工具已经成为当代毕业生的得力帮手,从…

免费和付费 AI 工具差距多大?针对毕业论文实测对比

免费和付费 AI 工具差距多大?针对毕业论文实测对比

2026/8/10 0:46:35

数万毕业生都会纠结一件事:到底免费通用 AI 能不能搞定毕业论文,还是必须花钱购买专业付费论文 AI? 很多同学一开始习惯使用豆包、Deep‑Seek 这类免费通用大模型搭建初稿,等到查重翻车、AI 检测超标、参考文献虚构、格式反复出错…

UE5.1与Cesium集成:子关卡流式加载优化数字城市大场景性能

UE5.1与Cesium集成:子关卡流式加载优化数字城市大场景性能

2026/8/10 0:46:35

1. 项目概述:当UE5.1遇见Cesium,如何驾驭一座数字城市?如果你正在用Unreal Engine 5.1做数字孪生、智慧城市或者大场景仿真,大概率会遇到一个头疼的问题:城市模型太大了。动辄几十上百平方公里的高精度建筑、道路、地形…

JS逆向实战:定位QQ音乐VMP加密核心函数_getSecuritySign与__cgiDecrypt

JS逆向实战:定位QQ音乐VMP加密核心函数_getSecuritySign与__cgiDecrypt

2026/8/10 0:46:35

1. 项目概述:从新手视角看QQ音乐VMP逆向的挑战 如果你刚接触JS逆向,看到“VMP加密”、“ _getSecuritySign ”、“ __cgiDecrypt ”这些词,可能会觉得头大。这很正常,因为QQ音乐作为一款国民级应用,其前端安全防护…

Unity 3D虚拟地震应急游戏开发:从设计到实现的全流程指南

Unity 3D虚拟地震应急游戏开发:从设计到实现的全流程指南

2026/8/10 0:46:35

1. 项目概述与核心价值最近几年,关于自然灾害应急教育的需求越来越受到重视,尤其是在学校、社区和家庭安全培训中。传统的宣传册、讲座或者视频,虽然能传递知识,但参与感和记忆留存度往往有限。大家听完、看完,真到紧急…

如何快速优化macOS鼠标体验:Mac Mouse Fix完整配置指南

如何快速优化macOS鼠标体验:Mac Mouse Fix完整配置指南

2026/8/10 0:36:34

如何快速优化macOS鼠标体验:Mac Mouse Fix完整配置指南 【免费下载链接】mac-mouse-fix Mac Mouse Fix - Make Your $10 Mouse Better Than an Apple Trackpad! 项目地址: https://gitcode.com/GitHub_Trending/ma/mac-mouse-fix 你是否厌倦了在macOS上使用普…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/9 0:05:25

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/9 0:05:25

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/9 0:05:25

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

Prometheus 监控体系深度部署:选型别只看功能清单

Prometheus 监控体系深度部署:选型别只看功能清单

2026/8/10 0:06:33

Prometheus 监控体系深度部署:选型别只看功能清单 选型场景:小规模集群直接部署 Thanos 的代价 如果为解决 15 天本地存储限制,直接部署 Thanos Sidecar、Store Gateway、Querier、Compactor、Ruler、Bucket Web 并接入 S3,就需…

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节

2026/8/10 0:06:33

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节 场景示例:一条 2MB 日志影响 Elasticsearch 写入 一个上传接口若执行 log.Info("Request dumped: ", r.Body),会将 2MB 的二进制 Body 写入日志。高并发下,这类超…

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节

2026/8/10 0:06:33

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节 项目进入稳定版本后,外部 Pull Request(PR)会带来新的协作成本。大范围改动混入风格重构,或修复局部问题时修改公共函数签名,都可能扩大评审和兼容…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…