序列到序列-seq2seq

发布时间:2026/8/11 3:58:08

序列到序列-seq2seq
编码器-解码器架构序列到序列问题的基础框架机器翻译是序列转换模型的一个核心问题 其输入和输出都是长度可变的序列编码器encoder 它接受一个长度可变的序列作为输入 并将其转换为具有固定形状的编码状态。解码器decoder 它将固定形状的编码状态映射到长度可变的序列。架构代码体现Encoder接收输入序列 X返回编码输出Decoder先用 init_state 接收编码器的状态再用 forward 逐步生成输出把前两者串联起来定义完整的数据流Seq2seq序列到序列学习核心思想是用两个循环神经网络RNN分别充当编码器和解码器以翻译模型为例特定的“eos”表示序列结束词元一旦输出序列生成此词元模型就会停止预测特定的“bos”表示序列开始词元它是解码器的输入序列的第一个词元。 其次使用循环神经网络编码器最终的隐状态来初始化解码器的隐状态。*训练翻译模型时因为知道具体的输入对应的输出可以在解码器部分连续的更新但是如果是句子推理模型就有点区别了衡量生成序列的好坏BLUEBLEU 通过比较预测序列与标签参考序列之间的n-gram 重叠程度来衡量生成质量。如何计算n-gram预测中某个 n-gram 的匹配次数不能超过它在标签中出现的次数【例】标签A,B,C,D,E,F 序列A,B,B,C,D计算n 1p1第二个B的匹配次数大于标签出现次数不能匹配当n2时p2如何计算BLUE左侧长度惩罚预测长度短于标签长度min会取负数exp一个负数就会降低分数其余min取0不会降低分数右侧加权几何平均具体的实现编码器RNN的实现嵌入层vocab_size 个词每个变成 embed_size 维向量把词元索引变成稠密向量*用低维稠密向量反应词义的远近随机的索引反应不出GRU 循环网络逐个读取词元更新隐状态最终把整句话压缩成一个状态向量X为输入一批句子每个句子有 num_steps 个词元索引embedding 嵌入后形状: (batch_size, num_steps, embed_size)output所有时间步的输出这里用不到state最后一个时间步的隐藏状态包含了对这个句子的最终理解解码器RNN的实现每个时间步t解码器输出yt的概率取决于1.已经生成的词y1,y2,...,yt′−1​2.上下文变量c 编码器给的整句语义因为要得到序列的输出所以相比于incoder多了一个dense层GRU 输入维度 embed_size num_hiddens初始的隐藏状态为incoder最后的输出statecontext state[-1].repeat(X.shape[0], 1, 1)# state[-1] 形状: (batch_size, num_hiddens) 最后一层的最终隐状态# repeat 后形状: (num_steps, batch_size, num_hiddens)为什么要repeat编码器的上下文c只有一个对应最后一个时间步但解码器要生成 num_steps 个词。每个时间步生成都需要看到源句子的语义所以把 c 复制 num_steps 次让每个时间步都能读到它。之前数据处理对于长度不足的数据进行了padding我们应该将填充词元的预测排除在损失函数的计算之外损失函数1.创建全1的权重矩阵和 label 形状相同2.用 sequence_mask 把填充位置置0有效位置1填充位置03设置 reductionnone让父类返回每个位置的损失4.计算交叉熵训练训练时解码器需要逐个词生成翻译。如果让模型自己生成第1步猜错了 - 第2步基于错误输入继续错 - 错误像滚雪球一样累积Teacher Forcing 的解决方案训练时解码器的输入不用模型自己生成的而是用真实标签ground truth。初始化参数优化器和损失函数按epoch训练构造一个bos列向量作为输入每个时间步解码器看到正确答案的上一词预测当前词。反向传播梯度裁剪参数更新预测和训练时最大的区别是没有 Teacher Forcing 了模型必须自己生成一个词再用这个词作为下一步的输入。核心部分BLUE的实现

相关新闻

XOR过滤器:超越布隆过滤器的高性能静态集合查询方案

XOR过滤器:超越布隆过滤器的高性能静态集合查询方案

2026/8/11 3:48:07

大家好,我是专注于分享后端技术与系统架构的博主。在构建高性能、高并发的系统时,我们常常需要一种能够快速判断“某个元素是否存在”的数据结构,布隆过滤器(Bloom Filter)因其卓越的空间效率而广为人知。然而&#xf…

G03|外贸落地辅导是什么?真的能落地吗?

G03|外贸落地辅导是什么?真的能落地吗?

2026/8/11 3:48:07

引言:外贸企业的共同困境 在外贸圈,有一个现象屡见不鲜:老板们参加了一场又一场培训,笔记记了厚厚一本,现场听得热血沸腾,感觉“这次终于找到方法了”。然而,回到公司不到一个月,一…

Linux文件操作核心指令详解:从创建到权限管理的八大场景实战

Linux文件操作核心指令详解:从创建到权限管理的八大场景实战

2026/8/11 3:48:07

1. 项目概述:为什么文件操作是Linux的基石如果你刚开始接触Linux,无论是为了工作、学习,还是单纯觉得那个黑色的命令行窗口很酷,第一个让你感到既强大又困惑的领域,多半就是文件操作。在Windows或macOS里,我…

Vue视频列表无缝循环播放实现:基于vue-video-player的完整解决方案

Vue视频列表无缝循环播放实现:基于vue-video-player的完整解决方案

2026/8/11 5:18:12

1. 项目缘起:一个看似简单却暗藏玄机的播放需求最近在做一个后台管理系统,里面有个功能模块需要展示一系列的宣传视频。产品经理提了个需求:在一个固定的视频播放区域里,自动、无缝地循环播放一个视频列表。听起来很简单对吧&…

分布式系统设计与服务拆分策略:上线配置该怎么收口

分布式系统设计与服务拆分策略:上线配置该怎么收口

2026/8/11 5:18:12

分布式系统设计与服务拆分策略:上线配置该怎么收口 服务拆分后,配置会分散到多个仓库、环境和运行平台。风险不在于配置数量本身,而在于来源不清、差异不可追溯,或敏感值混入代码。本文给出一套上线前收口的检查思路。1. 分布式服…

2026年长春阳光房品牌怎么选?认准这3点避坑指南

2026年长春阳光房品牌怎么选?认准这3点避坑指南

2026/8/11 5:18:12

阳光房选择的业务背景随着长春地区居住品质需求的持续升级,阳光房已从单纯的采光空间演变为集休闲、会客、养绿植于一体的多功能生活区域。面对2026年日趋多元化的门窗市场,消费者在众多品牌中做出精准选择并非易事。若选购不当,不仅影响使用…

一键式生成AI漫剧怎么选?知漫剧模型聚合方案与传统管线成本对比

一键式生成AI漫剧怎么选?知漫剧模型聚合方案与传统管线成本对比

2026/8/11 5:18:12

在当下的内容自动化生产实践中,AI漫剧已经从原先繁琐的本地多节点串联,转向更高集成度的端到端工作流,不少创作者开始借助工具整合站点知漫剧( qq.jiaxunai.cn )这类AI模型聚合平台,将生图、动态扩展与TTS语音合成统一调度&#x…

C/C++数据库编程:ADO核心接口、实战技巧与性能优化指南

C/C++数据库编程:ADO核心接口、实战技巧与性能优化指南

2026/8/11 5:18:12

1. 项目概述:为什么C/C开发者绕不开ADO?如果你用C或C写过需要连接数据库的桌面应用、服务端程序,或者维护过一些遗留的企业级系统,那你大概率听说过甚至用过ADO。ActiveX Data Objects,这个微软在二十多年前推出的数据…

【案例分享-57】|IBM TS4300 磁带库落地生物医药企业,构建 PB 级混合架构长期归档体系

【案例分享-57】|IBM TS4300 磁带库落地生物医药企业,构建 PB 级混合架构长期归档体系

2026/8/11 5:08:12

副标题:破解生物医药冷数据存储难题!IBM TS4300 磁带库赋能企业云本地混合归档升级前言生物医药行业研发、实验、临床原始数据体量庞大,数据保存周期长、合规要求严苛,大量冷数据长期存放云端,持续产生高额存储成本&am…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/10 5:58:32

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/10 7:54:12

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/10 7:19:21

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

Unity新手入门:从零搭建开发环境与核心概念解析

Unity新手入门:从零搭建开发环境与核心概念解析

2026/8/11 0:07:41

1. 项目概述:为什么Unity是游戏开发者的首选起点如果你对游戏开发感兴趣,或者想进入这个充满创造力的行业,那么“Unity”这个名字你肯定不陌生。它几乎是所有新手开发者、独立游戏团队,甚至是一些3A大厂在特定项目上的首选引擎。为…

Agency-Agents 智能体系统从零搭建实战指南

Agency-Agents 智能体系统从零搭建实战指南

2026/8/11 0:07:41

在开发复杂应用时,我们常常遇到单一模型难以兼顾全局规划与细节执行的困境。有时候,模型擅长创意生成却在逻辑推理上稍显吃力,或者精于代码编写却缺乏对业务上下文的深刻理解。为了解决这个问题,多智能体协作架构应运而生&#xf…

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

2026/8/11 0:07:41

🚀 MiniMax Token Plan MiniMax 推出全新 Token 计划,新增语音、音乐、视频和图片生成权益。 用户邀请好友可享双重福利 订阅一份套餐,解锁最新模型 —— 前沿 Coding 能力、1M 超长上下文、原生多模态,图文音视频共用套餐额度。 …

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…