从 RAG 到 Agent学习笔记

发布时间:2026/8/28 2:38:32

从 RAG 到 Agent学习笔记
大模型LLM的能力正在逐渐趋同真正的技术壁垒正在向 Harness Engineering驾驭工程转移。本文将结合近期技术探讨系统梳理大模型应用开发中的核心工程化技术涵盖 RAG 结构化输出、约束解码原理、工具调用范式、Agent 编排框架以及沙箱环境构建。一、 RAG 结构化输出的“三道防线”在 RAG检索增强生成流程中将大模型从不可控的“文本生成器”改造为稳定的“结构化数据提取器”需要建立严密的质检与交付体系提示工程软引导在 Prompt 组装阶段通过角色设定、格式定义和 Few-Shot 示例在语义层面与模型达成“契约”诱导其输出目标格式。格式约束硬控制在模型推理Inference过程中实施硬性拦截。通过 RAG 框架调用底层推理引擎将 JSON Schema 注入在模型生成每一个 Token 时进行 Logits Masking概率屏蔽将不符合语法的 Token 概率强制设为负无穷从数学上剥夺模型犯错的可能性。后处理兜底修复在拿到模型返回值后执行闭环校验。包括自动解析捕获、自我修正循环将错误信息重新封装 Prompt 让模型修正以及业务逻辑校验确保最终数据逻辑有效。二、 约束解码的底层原理有限状态机与 Logits Masking在不修改大模型的前提下控制其输出的每一个 Token核心在于约束解码。其底层原理是将 JSON Schema 编译成有限状态机FSM在模型每生成一个 Token 时用状态机判断哪些 Token 语法合法把不合法的 Token 概率强制归零。1. 有限状态机FSMFSM 是一种描述系统行为的数学模型由有限个状态、状态之间的转移规则和输入事件组成。在结构化输出中FSM 用于实时校验每一步输出的合法性例如初始状态允许输出{若已输出key则下一状态只允许:。2. Logits Masking 机制大模型生成文本是自回归的。约束解码在模型计算出所有 Token 的 logit 分数后、Softmax 归一化之前插入一个“语法警察”合法 Token 的 mask 值为 0保留原始 logit非法 Token 的 mask 值为 -∞经过 Softmax 后概率变为 0。模型全程以为自己在自由生成但推理引擎只从中挑选合法的 Token实现了“不碰大脑只控制嘴巴”的物理隔离。三、 工具调用范式MCP 与 CLI 的抉择在 AI Agent 调用外部工具时MCP 与 CLI 代表了两条不同的技术路线两者并不互斥而是互补MCP标准化协议路线被称为“AI 的 USB-C 接口”本质是标准化的 Client-Server 协议。适用于跨系统、跨模型、企业级集成提供安全可控的鉴权与沙箱隔离但需要额外开发和维护 MCP Server。CLI环境控制路线模型直接生成并执行系统命令行指令。具有零开发成本、极其轻量、组合性强的优势适用于单机任务、脚本执行和快速原型但安全风险较高且缺乏标准化。当前业界的最佳实践是两者融合MCP 负责提供标准化的工具发现与调用框架而 CLI 负责在 MCP Server 内部执行具体的系统级操作。四、 Agent 编排LangChain 与 LangGraph 的定位在智能体编排中LangChain 与 LangGraph 承担着不同的工程角色LangChain作为 Agent Framework框架能实现基础的流程编排。通过 Chains 和 Agents 将多个步骤组合成工作流支持线性流水线、条件分支等标准化业务流程。LangGraph作为 Agent Runtime运行时专为复杂、有状态、多智能体协作的场景设计。提供基于有向图的编排能力支持 Supervisor 模式、Fan-out 扇出模式、Human-in-the-Loop人工审批以及 Checkpointing断点恢复与状态回溯。简而言之LangChain 是“零件”LangGraph 是“组装工厂”。构建复杂、可中断、可恢复的生产级智能体系统LangGraph 是更合适的选择。五、 智能体沙箱操控页面与软件部署在智能体沙箱中操控页面完成软件部署是通过“隔离沙箱容器 无头浏览器CDP协议 大模型 ReAct 决策循环”三者协同完成的沙箱层通过 Docker 容器或云沙箱提供完全隔离的执行环境确保智能体的操作不影响外部系统。浏览器层沙箱内启动无头浏览器通过 CDPChrome DevTools Protocol建立 WebSocket 连接赋予智能体“看”获取 DOM/截图和“做”点击/输入/执行 JS的能力。决策层大模型通过 ReAct 框架不断执行“感知→思考→行动→反馈”循环。为节省 Token通常对页面 DOM 进行精简表示仅提取可交互元素。若操作失败智能体还能进行自动重试、重新规划甚至现场编写新函数进行自我修复。大模型应用开发正在从“拼模型能力”走向“拼工程架构”。无论是通过约束解码实现 100% 格式正确的结构化输出还是通过 MCP/CLI 融合打通工具链亦或是利用 LangGraph 和沙箱构建复杂任务的执行环境其核心思想都是把不可控的大模型装进可控的工程框架里。掌握这套 Harness Engineering 体系是构建生产级 AI 应用的必经之路。

相关新闻

61-NIN(补充端侧部署和云端部署的概念)

61-NIN(补充端侧部署和云端部署的概念)

2026/8/24 18:11:59

基于架构图的 VGG Net 与 NiN Net 深度分析这张图清晰对比了VGG 网络和NiN 网络的核心架构、基础模块设计,直观展现了两种经典 CNN 的设计思路差异,核心围绕「卷积模块设计」「分类头架构」「核心创新点」三个维度展开,以下是完整分析&#x…

备份脚本,拉去ftp下所有文件

备份脚本,拉去ftp下所有文件

2026/8/28 1:05:52

备份脚本,拉去ftp下所有文件 #!/bin/bash # FTP参数 FTP_IP"192.168.2.22" FTP_PORT"6000" FTP_USER"admin" FTP_PASS"123456" LOCAL_DIR"/home/data-bak"# 创建本地备份目录 mkdir -p "${LOCAL_DIR}"…

AI 开源工具链评估:Star 数不能替代维护质量

AI 开源工具链评估:Star 数不能替代维护质量

2026/8/25 22:40:37

AI 开源工具链评估:Star 数不能替代维护质量 一、工具选型不能只看热度 AI 开源工具链更新很快。很多项目 Star 数很高,文档很热闹,但真正接入实验或生产后,才发现版本不稳定、接口频繁变化、issue 长期没人处理。热度不是维护质量…

MATLAB假设检验实战:从T检验到非参数方法,数模竞赛数据分析核心技能

MATLAB假设检验实战:从T检验到非参数方法,数模竞赛数据分析核心技能

2026/8/28 2:28:38

1. 从“假设”到“结论”:为什么假设检验是数模的灵魂在数学建模竞赛或者任何数据分析项目中,我们常常会面对一个核心困境:你基于数据或模型得出了一个结论,比如“新工艺比旧工艺的成品率更高”,或者“城市A的PM2.5年均…

蓝桥杯Scratch国赛真题剖析:从算法思维到调试优化的实战指南

蓝桥杯Scratch国赛真题剖析:从算法思维到调试优化的实战指南

2026/8/28 2:28:38

1. 项目概述:从一场国赛真题说起如果你是一位Scratch编程的爱好者、指导老师,或者正在备战蓝桥杯这类编程赛事的学生,那么“真题剖析”这四个字对你来说,价值可能远超一本普通的教程。今天要聊的,就是2022年5月29日那场…

BLE MCU多协议射频与NFC选型实战:从天线设计到低功耗应用

BLE MCU多协议射频与NFC选型实战:从天线设计到低功耗应用

2026/8/28 2:28:38

做嵌入式这几年,我经常遇到一种看似很简单的需求:设备要连手机,用BLE;但用户又希望手机没电或者不想打开App的时候,靠"碰一碰"也能读到设备的身份信息或者触发某个功能。以前的标准做法是加一颗独立NFC芯片&…

AI资源配额治理实践:BitTime如何约束Agent行为与成本

AI资源配额治理实践:BitTime如何约束Agent行为与成本

2026/8/28 2:28:38

之前在团队里做 AI Agent 与模型网关相关项目时,一直被一个问题困扰:模型能力的边界在快速扩展,但调用侧的“约束机制”却还停留在余额、账单、接口限流这些传统手段上。大模型 API 越来越便宜,反而让业务方更敢放开用量&#xff…

大模型开发实战:DeepSeek与Kimi的API接入、IDE集成与本地部署指南

大模型开发实战:DeepSeek与Kimi的API接入、IDE集成与本地部署指南

2026/8/28 2:28:38

最近 DeepSeek 和 Kimi 的热度,已经不只是“新闻里的大模型”了。据公开报道,DeepSeek 的估值被市场看到 5000 亿元区间,Kimi 背后的月之暗面也频繁出现在融资讨论中;而在开发者生态里,这种“抢”更加直接——抢 API 额…

Qwen3-Embedding上TPU:16K长上下文怎么稳住

Qwen3-Embedding上TPU:16K长上下文怎么稳住

2026/8/28 2:18:38

Embedding 服务最容易被低估的性能问题,不是单条文本有多快。 而是: 输入突然从1K tokens 变成15K tokens以后, 系统还能不能稳定批处理?Google 8月26日公开了 vLLM 在 Cloud TPU 上服务 Qwen3 Embedding 系列的一组工程实现。目标…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/26 17:50:58

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

基于Claude Code的开源AI求职框架:从职位搜索到Offer的全自动化闭环

2026/8/28 0:08:32

当AI助手能够独立完成从职位匹配、简历定制到面试准备的全链路求职流程时,求职不再是一场信息战,而是一场工程化战役。框架概述:本地运行的AI求职引擎这是一个构建在Claude Code之上的开源AI求职框架,核心理念是"在工作者的机…

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

Godot 4 仿 agar.io:相机缩放被 max_zoom 卡死,窗口越大球越小的根因与修复

2026/8/28 0:08:32

1. 问题现象 在 Godot 4 仿 agar.io 的 2D 项目中,相机缩放设计为「由球组整体尺寸决定」,世界可见高度恒定,窗口只作为视口裁剪。默认小窗口 1280x720 时相机高度正常;但窗口最大化到 2940x1912 后,视角被明显拉远、…

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

从软件测试大赛到实战:Java+Selenium自动化测试进阶指南

2026/8/28 0:08:32

1. 缘起:从校园到赛场,我的软件测试之路几年前,我还是一个在校园里对着Java课本和“Hello World”程序挠头的普通学生。软件测试对我来说,只是一个在开发流程末尾、用鼠标点点按钮的模糊概念。直到我偶然在学校的公告栏上看到了“…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/26 18:07:30

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/26 17:57:52

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…