OneRec-V1和V2的架构演进

发布时间:2026/8/9 7:25:46

OneRec-V1和V2的架构演进
一、OneRec-V1为了解决大量资源消耗在通信和存储而非模型计算GPU 利用率远低于大语言模型各阶段目标分散模型结构差异导致建模不一致级联架构阻碍了 Scaling Law、强化学习对齐等先进技术的应用的问题快手团队提出了OneRec框架将推荐系统重新定义为端到端的生成式任务模型根据用户上下文直接“生成”推荐序列而非从候选集中“挑选”物品。1.语义IDSemantic ID的设计阶段一协同感知的多模态表示学习通过视觉语言模型处理每个视频的多模态信息生成1280个Token向量再用QFormer模块将这些向量压缩为4个可学习的查询向量。再引入物品对对比学习拉进这些物品对的表示使Semantic ID能够同时编码内容语义和行为模式。为了防止退化还加入标题生成的辅助任务确保表示保留内容理解能力。物品对对比学习从用户行为中提取高协同相似度的物品对如同一用户正向点击的物品阶段二RQ-Kmeans层次化量化将协同感知的多模态表示采用残差量化K-meansRQ-Kmeans将连续表示离散化为Semantic ID不用与端到端训练的RQ-VAERQ-Kmeans直接在残差上应用K-means聚类构建码本。经过三层量化每个视频m获得由粗到细的语义标识符序列{sm1sm2sm3}这将成为生成式推荐模型的输出目标。2.模型架构设计2.1.Encoder四个通路的设计2.1.1.用户静态特征通路User Static Pathway用户ID、年龄、性别等基础画像信息经过两层密集变换后得到。2.1.2.短期行为通路Short-term Pathway处理用户最近20次交互。2.1.3.正反馈行为通路Positive-feedback Pathway处理用户256次高参与度交互特征构成与短期通路类似。2.1.4.超长期历史通路Lifelong PathwayOneRec采用分层压缩策略首先通过分层K-means聚类对历史序列进行压缩选择最接近中心的代表物品然后使用QFormer模块通过128个可学习查询向量对压缩后的 2000 长度序列进行交叉注意力处理最终得到紧凑表示。将上述4个通路拼接完整的上下文序列通过Encoder处理最终Encoder输出提供全面的用户上下文表示。2.2.Decoder解码器负责基于上下文表示生成目标物品。对于每个目标物品 m解码器输入由起始 Token[BOS]和该物品的语义 ID 序列组成。每层解码器包含三个关键组件因果自注意力Causal SelfAttn捕获已生成 Token 间的依赖交叉注意力CrossAttn让解码器关注编码器的上下文混合专家前馈网络MoE FFN采用 top-k 路由策略在增强模型容量的同时保持计算效率。3.奖励系统设计利用预训练模型过程中它含有传统模型的局限性导致性能被束缚为了突破这个束缚OneRec采用奖励系统设计主要有三个层次构成3.1.用户偏好对齐传统方法将多个目标点击率CTR、点赞率LTR、观看时长VTR等预测值融合成一个分数缺乏精准性和个性化且容易导致目标间优化冲突。OneRec提出使用神经网络学习个性化的P-ScorePreference Score。基于SIMSearch-based Interest Model架构为每个目标构建独立值每个独立值使用对应的标签计算二元交叉熵损失作为辅助。各个值的隐状态联通用户和物品表示被输入最终MLP层输出P-Score。通过调整权重可以让P-Score偏向各个目标最终在所有目标上都实现 AUC 提升。这种方法能够接收具体用户信息为该用户动态调整偏好分数而不会影响其他用户体验。3.2.生成格式规范化引入格式奖励应对推理时生成的无法映射到实际物品ID的非法序列挤压效应。具体而言从生成样本中随机选择部分进行合法性强化学习对合法样本设置优势为 1对非法样本直接丢弃以避免挤压效应。3.3.工业场景对齐OneRec 的端到端特性使得只需将优化目标融入奖励系统通过强化学习进行针对性优化。当病毒内容占比超过最优比例 时对其 P-Score 奖励进行降权。4.ECPO算法ECPOEarly Clipped GRPO算法进行偏好对齐对于用户u 使用旧策略模型生成 G 个物品每个物品通过 P-Score 模型获得奖励r_i 。ECPO 相比原始 GRPO 的关键改进在于对负优势样本的策略比率进行预先裁剪。在 GRPO 中负优势样本的策略比率可以任意大容易导致梯度爆炸ECPO 通过引入δ参数限制负优势样本的最大比率在保持训练稳定性的同时允许负优势发挥作用。5.缺点5.1.Encoder-Decoder架构存在严重的计算资源分配失衡绝大部分计算被消耗在上下文编码上而真正产生梯度的目标 Token 解码占比极低5.2.基于奖励模型的强化学习面临采样效率低和reward hacking的风险随着 OneRec 大规模部署后真实用户反馈变得可观测这些瓶颈催生了 OneRec-V2 的诞生。二、OneRec-V2主要从架构和算法两个维度进行了系统性优化架构上提出Lazy Decoder-Only架构解决计算效率问题算法上引入基于真实用户反馈的强化学习突破奖励模型的局限性。1.Lazy Decoder-Only架构将计算资源集中到真正对损失贡献梯度的目标物品Token上。这一架构包含两个核心组件Onerec Lazy Decoder-Only模型结构图1.1.Context Processor设计Context Processor将异构的用户特征统一转换为适合Decoder用的键值对把OneRec-V1中Encoder中的那部分摘出来了成功提升架构效率。这些键值对对于同一上下文在整个前向传播过程中保持不变因此可以被多个解码器层共享而无需在每一层重新计算。实验表明即使采用极致的共享策略L_{kv} 1, S_{kv} 1模型性能也不会受到明显影响。1.2.Lazy Decoder Block设计与传统Decoder-Only架构将所有输入拼接成一个长序列进行自注意力处理不同Lazy Decoder-Only架构不将上下文信息作为序列的一部分而是将其视为静态的条件信息仅通过交叉注意力访问。这里“Lazy惰性”的含义是只在目标 Token 位置计算损失而不对整个序列的每个位置都计算下一 Token 预测损失。在训练时目标物品的前两个Semantic ID加上一个[BOS]Token组成输入序列仅3个Token这个紧凑的序列通过Lazy Decoder Block处理Lazy Cross-Attention让解码器隐藏状态关注Context Processor提供的键值对。Lazy1无键值投影直接使用预先计算好的键值对2分组查询注意力GQA多个查询头共享同一组键值头极大降低内存占用。Causal Self-Attention在目标物品的Semantic ID Token之间进行自回归建模。Feed-Forward Network对注意力输出进行非线性变换在更深层可用MoE替代。通过上述两种设计Lazy Decoder-Only 架构实现了接近 100% 的计算资源集中在目标 Token 上。换言之Lazy Decoder-Only 架构在保持相近的模型性能的前提下将计算开销降低了94%训练资源节约了90%。1.3. Scaling Law验证Lazy Decoder-Only 架构展现出优秀的可扩展性。OneRec-V2 成功将模型规模从 0.1B 扩展到 8B 参数并观察到清晰的 Scaling Law模型损失L随参数量N的增长呈现幂律衰减。通过引入 MoE一个总参数 4B 但每次仅激活 0.5B 的稀疏模型收敛损失为 3.22优于 2B 密集模型损失 3.23而计算开销与 0.5B 密集模型相当。这为在计算预算受限的情况下提升模型性能提供了有效途径。2.用户反馈强化学习在短视频推荐场景中每个视频的播放时长是最密集的反馈信号且与最重要的在线指标如 App Stay Time 和 7 日留存 LT7高度相关。然而原始播放时长存在固有偏差长视频天然倾向于累积更长的播放时长无论用户兴趣如何。为解决这一偏差OneRec-V2 提出了时长感知奖励塑形Duration-Aware Reward Shaping具体步骤如下。2.1.对数分桶采用对数策略将历史视频划分到不同桶中。2.2.分桶内百分位计算对于目标视频i计算其播放时长Pi在对应时长桶内用户历史分布中的百分位排名。也就是说比较之前看过的视频中当前视频看的时长百分比。2.3.优势值分配选择排名前25%的视频作为正样本明确负反馈如“不喜欢”的视频作为负样本其他样本过滤。这种策略有效过滤出高质量正样本同时纳入直接负反馈信号生成更准确的用户偏好信号。3.GBPO算法OneRec-V2 发现传统的裁剪方法如 PPO、GRPO、ECPO无法完全解决梯度不稳定问题。问题的根源在于对于策略比率为 1 的样本如来自传统推荐管线的曝光样本传统方法认为这些样本是稳定的而不进行裁剪但实际上负样本仍可能导致梯度爆炸。OneRec-V2 提出GBPOGradient-Bounded Policy Optimization用 BCE 损失的稳定梯度来界定 RL 梯度GBPO 相比传统裁剪方法有两个优势(1)完整样本利用保留所有样本的梯度鼓励模型进行更多样化的探索(2)有界梯度稳定化用 BCE 损失的梯度界定 RL 梯度增强训练稳定性。

相关新闻

C语言开发工具选型指南:VS、CLion、VSCode与Dev C++深度横评

C语言开发工具选型指南:VS、CLion、VSCode与Dev C++深度横评

2026/8/9 7:25:46

1. 项目概述:为什么C语言开发者需要一个清晰的工具选型指南?干了这么多年C语言开发,从学生时代的Turbo C到后来在工业级项目里摸爬滚打,我最大的感触之一就是:工具选对了,事半功倍;工具选错了&a…

Oracle 19.31 RU补丁回退实战:Exadata ORA-00600内存错误深度解析与修复

Oracle 19.31 RU补丁回退实战:Exadata ORA-00600内存错误深度解析与修复

2026/8/9 7:25:46

1. 一次突如其来的生产告警:从平静到风暴那天下午,我正处理着几个常规的性能优化工单,监控大屏上突然弹出一条刺眼的红色告警,来源是我们核心业务的一套Exadata数据库一体机。告警信息很简短,但足以让任何一个DBA心头一…

木桩定制厂家实力榜单,选对源头少走弯路

木桩定制厂家实力榜单,选对源头少走弯路

2026/8/9 7:25:46

在水利护岸、园林景观、地基工程等领域,木桩定制是一项关乎工程品质与长期效益的关键选择。面对市场上众多厂家,如何精准筛选出具备实力的源头供应商,避免中间环节与质量陷阱,成为许多从业者绕不开的课题。本文从行业实际情况出发…

GitHub汉化终极指南:3分钟让英文界面变中文的免费解决方案

GitHub汉化终极指南:3分钟让英文界面变中文的免费解决方案

2026/8/9 8:35:49

GitHub汉化终极指南:3分钟让英文界面变中文的免费解决方案 【免费下载链接】github-chinese GitHub 汉化插件,GitHub 中文化界面。 (GitHub Translation To Chinese) 项目地址: https://gitcode.com/gh_mirrors/gi/github-chinese 还在为GitHub全…

DC-1 完整渗透测试笔记

DC-1 完整渗透测试笔记

2026/8/9 8:35:49

文章目录DC-1 完整渗透测试笔记:从 Drupalgeddon2 到 root flag一、靶场简介二、环境搭建2.1 主机与靶机网络配置2.2 验证连通性三、信息收集3.1 主机发现(arp-scan)3.2 端口扫描(nmap)3.3 Web 服务指纹识别&#xff0…

大语言模型应用开发:如何避免AI奉承与用户依赖的技术方案

大语言模型应用开发:如何避免AI奉承与用户依赖的技术方案

2026/8/9 8:35:49

在开发基于大语言模型(LLM)的应用程序时,我们常常会惊叹于其强大的内容生成和对话能力。然而,一个容易被开发者忽视的深层问题是:我们训练和调优的AI,是否正在潜移默化地塑造一种“阿谀奉承”的交互模式&am…

Unity插件精选:50款提升游戏开发效率的实战工具清单

Unity插件精选:50款提升游戏开发效率的实战工具清单

2026/8/9 8:35:49

1. 项目概述:为什么你需要一份高质量的Unity插件清单? 在Unity游戏开发的日常里,我经常听到同行们抱怨:“Asset Store里插件太多了,看得眼花缭乱,不知道哪个靠谱。” 或者“项目卡在某个环节,感…

小龙虾养殖自动化设备一键安装技术解析

小龙虾养殖自动化设备一键安装技术解析

2026/8/9 8:35:49

1. 小龙虾养殖自动化设备现状分析 小龙虾养殖行业近年来正经历着从传统人工操作向智能化管理的转型。在江苏盱眙、湖北潜江等主要产区,越来越多的养殖户开始采用自动化投喂设备替代人工操作。这类设备通常由以下几个核心组件构成: 智能控制主机&#xf…

3倍效率提升!ComfyUI-KJNodes:让AI工作流变得如此简单

3倍效率提升!ComfyUI-KJNodes:让AI工作流变得如此简单

2026/8/9 8:25:49

3倍效率提升!ComfyUI-KJNodes:让AI工作流变得如此简单 【免费下载链接】ComfyUI-KJNodes Various custom nodes for ComfyUI 项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-KJNodes 你是否曾在ComfyUI中面对杂乱无章的节点连线感到头痛&a…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/9 0:05:25

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/9 0:05:25

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/9 0:05:25

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/9 0:05:25

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/9 0:05:25

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/9 0:05:25

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/7 8:02:42

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…