大模型微调完整分类

发布时间:2026/7/22 10:58:54

大模型微调完整分类
一、按训练目标 / 训练阶段日常说的 SFT、偏好、强化微调1. 普通微调SFT 监督指令微调就是你说的「普通微调」最基础一环全称Supervised Fine-Tuning 监督微调数据标准问答、对话、领域标准答案单条正样本作用教会模型听懂指令、固定输出格式、学习行业知识法律 / 医疗 / 代码例子给模型几千条客服问答让它学会标准回复2. 继续预训练微调 CPT领域知识扩充微调很多人容易忽略属于前置知识微调数据无标注领域长文本行业文档、书籍、论文作用给底座模型灌入全新专业知识先扩充知识库再做 SFT场景垂直行业专用大模型如医疗、金融专属底座3. 偏好微调离线偏好对齐DPO/ORPO/KTO你说的「偏好微调」不带强化学习现在工业主流替代 RLHFDPO 直接偏好优化最常用 用「同一个问题好回答 vs 差回答」成对偏好数据纯监督损失不用奖励模型、不用 PPO 强化。ORPO 对比偏好优化 一步融合 SFT 偏好对齐省去单独 SFT 阶段轻量化训练。KTO 知识偏好优化 侧重区分有用 / 无用回答适合客服、知识库场景。4. 强化微调RLHF 人类反馈强化学习PPO你说的「强化微调」唯一带奖惩函数 强化训练的对齐方案 完整三步SFT 基础微调 → 2. 训练奖励模型打分 / 奖惩函数 → 3. PPO 强化学习迭代优化特点依靠奖惩函数引导模型生成人类更喜欢的回答对齐价值观、安全、人性化缺点算力大、训练不稳定。 衍生强化对齐GRPO推理专用强化微调数学 / 代码提升巨大5. 对比微调 CPT Contrastive Prompt Tuning小众辅助微调区分正负样例提升意图识别、上下文区分能力。二、按参数更新方式PEFT 参数高效微调所有上面的微调都能搭配不是训练目标但日常开发都会区分「全量微调 / LoRA 微调」全参数微调 Full FT 更新模型全部权重效果最好显存成本极高仅 7B 以下小模型偶尔使用。LoRA 低秩适配器微调主流 冻结主模型只训练少量低秩矩阵显存消耗极低单卡可训 70B。QLoRA 量化 LoRA 4bit 量化底座极致省显存低配显卡微调超大模型。Adapter / P-Tuning v2 前缀微调 插入额外小网络 / 可学习 prompt适合分类、小样本任务。最简流水线顺序通用大模型训练流程底座预训练 → CPT 领域预训练可选→SFT 普通微调→DPO 偏好微调/RLHF 强化微调一句话区分你提到的三类普通 SFT教模型「标准答案怎么说」偏好 DPO教模型「哪个回答更好」纯监督无强化强化 RLHF用奖惩函数 PPO 反复试错强制模型往高分回答靠拢带强化训练RLHF为例1. 环境准备首先确保安装了必要的库bashpip install trl peft transformers datasets2. 完整的修正版代码pythonimport re from datasets import Dataset from transformers import AutoTokenizer, AutoModelForCausalLM from peft import LoraConfig from trl import GRPOConfig, GRPOTrainer # 1. 准备数据集 # 模拟一个包含 prompt 和 ground_truth 的数据集 data [ {prompt: 11等于几, ground_truth: 2}, {prompt: 中国的首都是哪里, ground_truth: 北京}, ] dataset Dataset.from_list(data) # 2. 编写正确的奖惩逻辑 # 注意trl 的 reward_funcs 接收的参数是 (completions, **kwargs) # kwargs 中会自动包含数据集里的其他字段如 ground_truth # 返回值必须是一个包含浮点数的列表长度等于 completions 的数量 # 奖惩逻辑1格式奖励强制模型使用 answer 标签 def format_reward(completions, **kwargs): pattern ranswer(.*?)/answer rewards [] for completion in completions: # 检查模型输出是否包含正确的标签 match re.search(pattern, completion[0][content]) if match: rewards.append(0.5) # 格式正确给 0.5 分好的 else: rewards.append(0.0) # 格式错误给 0 分坏的 return rewards # 奖惩逻辑2准确率奖励检查答案是否与标准答案一致 def accuracy_reward(completions, ground_truth, **kwargs): rewards [] for completion, gt in zip(completions, ground_truth): content completion[0][content] match re.search(ranswer(.*?)/answer, content) if match and match.group(1).strip() str(gt).strip(): rewards.append(1.0) # 答案正确给 1 分极好 else: rewards.append(0.0) # 答案错误给 0 分坏 return rewards # 3. 配置并启动微调 # 这里使用一个小模型作为示例实际可替换为 Qwen 等模型 model_id Qwen/Qwen2.5-0.5B-Instruct # 配置 GRPO 训练参数 training_args GRPOConfig( output_dir./qwen-grpo-output, num_train_epochs3, per_device_train_batch_size2, logging_steps5, learning_rate5e-5, ) # 配置 LoRA 进行高效微调 peft_config LoraConfig( task_typeCAUSAL_LM, r8, lora_alpha16, lora_dropout0.05, ) # 初始化 GRPO 训练器 trainer GRPOTrainer( modelmodel_id, argstraining_args, train_datasetdataset, reward_funcs[format_reward, accuracy_reward], # 【核心】注入奖惩逻辑 peft_configpeft_config, ) # 开始训练模型会根据奖惩函数的反馈不断调整权重 if __name__ __main__: trainer.train() 核心修正点说明奖励函数签名trl的奖励函数必须接收completions作为第一个参数数据集里的其他字段如ground_truth会通过**kwargs自动传入。返回值格式奖励函数必须返回一个列表列表的长度必须与传入的completions长度严格一致。数据结构completions是一个嵌套列表每个元素是[{content: 模型生成的文本}]所以提取文本时需要用completion[0][content]。

相关新闻

AI日报:自动化采集与专业筛选的技术实践

AI日报:自动化采集与专业筛选的技术实践

2026/7/22 10:58:54

1. 项目概述2026年6月30日AI日报是一个聚焦人工智能领域最新动态的资讯项目。作为长期跟踪AI技术发展的从业者,我每天都会整理行业内的突破性进展、重要论文发布、企业动态和开源项目更新。这个日报不同于普通的新闻聚合,而是经过专业筛选和深度解读的技…

n8n运维实战:日志管理、监控与安全配置

n8n运维实战:日志管理、监控与安全配置

2026/7/22 10:58:54

1. 为什么n8n实例需要完整的运维体系 当你在生产环境运行n8n工作流引擎时,会发现这个看似简单的工具背后隐藏着复杂的运维需求。我部署的第一个n8n实例就曾因为日志堆积导致磁盘爆满,整个服务突然崩溃。那次事故让我意识到:n8n作为自动化枢纽…

SkillCorpus:大语言模型智能体的技能生态系统与标准化实践

SkillCorpus:大语言模型智能体的技能生态系统与标准化实践

2026/7/22 10:58:54

今天来看一个专门为大语言模型智能体设计的技能生态系统项目——SkillCorpus。这个项目由研究团队开源,旨在解决当前LLM智能体在真实世界任务中技能管理和检索的痛点。SkillCorpus的核心价值在于它提供了一个统一的技能语料库,能够帮助智能体更好地理解和…

涉密会议录音转文字,如何防止内容泄露?5款主流工具安全横评

涉密会议录音转文字,如何防止内容泄露?5款主流工具安全横评

2026/7/22 12:08:56

上周,我的一位做技术总监的朋友找我吐槽:他们团队刚完成一次重要的故障复盘会议,涉及核心业务系统的架构缺陷和客户数据风险。为了确保复盘质量,他用了某款常见的录音转文字工具进行转写,结果第二天,会议纪…

MotrixNext:基于Tauri 2与Rust的高效下载工具重构实践

MotrixNext:基于Tauri 2与Rust的高效下载工具重构实践

2026/7/22 12:08:56

1. MotrixNext 项目背景与技术重构动机 MotrixNext 作为经典开源下载工具 Motrix 的精神续作,其诞生源于两个核心痛点:Electron 架构的技术债务积累与开源社区维护停滞。原版 Motrix 虽然凭借清爽界面和全协议支持获得 GitHub 3.6万星标,但20…

ComfyUI-SeedVR2:如何在消费级GPU上实现专业级4K视频超分辨率

ComfyUI-SeedVR2:如何在消费级GPU上实现专业级4K视频超分辨率

2026/7/22 12:08:56

ComfyUI-SeedVR2:如何在消费级GPU上实现专业级4K视频超分辨率 【免费下载链接】ComfyUI-SeedVR2_VideoUpscaler Official SeedVR2 Video Upscaler for ComfyUI 项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-SeedVR2_VideoUpscaler ComfyUI-SeedVR2_…

AI 驱动的金融界面异常检测:自动识别数据展示错误与风险提示缺失

AI 驱动的金融界面异常检测:自动识别数据展示错误与风险提示缺失

2026/7/22 12:08:56

AI 驱动的金融界面异常检测:自动识别数据展示错误与风险提示缺失 一、引言:一个金额单位错误,比任何 Bug 都更致命 金融前端有一个让人睡不着的风险:数据显示错误。 一个真实的案例:某金融 App 在一次发布后&#xff0…

网盘不限速终极突破!开源直链解析完全指南

网盘不限速终极突破!开源直链解析完全指南

2026/7/22 12:08:56

在日常开发或资料整理过程中,我们经常会遇到这样的尴尬场景:明明只是需要下载一个几兆的文档或者一个安装包,却被迫要先安装庞大的客户端软件,注册账号,甚至还要忍受漫长的排队等待。对于偶尔需要获取文件的用户来说&a…

2024最危险的AI搜索误判场景曝光:92.3%企业仍在忽略的3类时效性漏洞(附合规审计清单)

2024最危险的AI搜索误判场景曝光:92.3%企业仍在忽略的3类时效性漏洞(附合规审计清单)

2026/7/22 11:58:56

更多请点击: https://intelliparadigm.com 第一章:2024最危险的AI搜索误判场景曝光:92.3%企业仍在忽略的3类时效性漏洞(附合规审计清单) 当AI搜索系统将2022年失效的GDPR数据处理条款当作现行依据返回给法务团队&…

微服务进阶:服务网格与Istio

微服务进阶:服务网格与Istio

2026/7/21 5:45:57

541|微服务进阶:服务网格与Istio 上篇文章我们聊了微服务的基本概念和拆分方法。 但微服务多了,问题也多了: 服务之间怎么通信? 怎么监控每个服务的调用链路? 熔断、限流、重试怎么做? 安全认证怎么统一? 以前这些都靠SDK库(比如Hystrix、Feign),每个服务都要集成…

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

零售超级终端全域协同:ShareKit 碰一碰商品流转业务落地案例

2026/7/21 9:56:14

一、零售门店全域协同业务背景与行业痛点 1.1 门店超级终端设备矩阵(连锁便利店/商超标准配置) 自助收银Kiosk一体机:顾客结算、自助核销优惠券、商品素材预览;运营折叠平板:店长后台商品上新、图片录入、活动配置、…

噗叽短视频界面分析

噗叽短视频界面分析

2026/7/21 3:09:32

1 和小红书类似,可以采用类似判断方法------------其实他比小红书好判断,因为他没有图片,控件位置几乎是固定的,都不用判断------------2 因为他没有点赞按钮------------而且几乎所有控件位置都是完全一样的,所以我就…

设计EDA 首席专家 12 维度 JD(HR 仅高管 / HRD 使用)

设计EDA 首席专家 12 维度 JD(HR 仅高管 / HRD 使用)

2026/7/22 0:08:09

定位:公司 EDA 技术最高负责人、技术天花板、战略级专家、流片总兜底人 属于P9/Fellow/ 首席科学家级,不做日常执行,管方向、管架构、管风险、管突破。1. 对标层级内部职级:P9 / 首席专家 / Fellow 外部对标:华为 20–…

费用率无法实时监控怎么办?费用率联动预算管理怎么实现?

费用率无法实时监控怎么办?费用率联动预算管理怎么实现?

2026/7/22 0:08:09

很多企业费用管控存在严重滞后性:日常差旅、招待、营销、人力费用持续发生,但费用率只能等到月末结账、营收数据出来后才能计算核对,月度中途费用超标、营收不达标导致的费用率失衡完全无法感知。等到月末发现整体费用率远超预算目标时&#…

设计EDA 研发总监 12 维度 JD(HR 内部仅高管层使用)

设计EDA 研发总监 12 维度 JD(HR 内部仅高管层使用)

2026/7/22 0:08:09

定位:公司 EDA / 设计平台最高管理岗,技术 管理 经营三重决策,对整体流片、效率、质量、成本、团队负最终责任1. 对标层级内部职级:M3 / P8 / 总监级 外部对标:华为 20 级、互联网 M2 / 总监、头部芯片 / EDA 公司研…