Torch核心数据结构Tensor(张量)

发布时间:2026/9/28 3:12:59

Torch核心数据结构Tensor(张量)
Torch核心数据结构Tensor张量在深度学习和科学计算领域PyTorch 凭借其动态计算图和易用性成为了最受欢迎的框架之一。而这一切的基石便是其核心数据结构——Tensor张量。Tensor 可以理解为多维数组的泛化它不仅是存储数据的容器更是连接 CPU、GPU 计算以及自动微分Autograd的桥梁。本文将从原理层面深入剖析 Tensor并提供可运行的代码示例帮助读者理解其精髓。## Tensor 的基本概念与内存布局Tensor 本质上是一个多维数组但与传统数组不同它拥有更丰富的语义。从数学角度看标量0维张量、向量1维张量、矩阵2维张量都是张量的特例。在 PyTorch 中Tensor 包含两个核心部分-数据区存储在连续内存块中的数值支持整数、浮点数等类型。-元数据包括形状shape、步长stride、数据类型dtype和设备device如 CPU/GPU。步长stride是理解 Tensor 内存布局的关键。它表示在每个维度上从当前元素移动到下一个元素需要跳过的内存单元数量。例如一个形状为(3, 4)的矩阵默认的步长为(4, 1)即行间移动需跳过 4 个元素列间移动只需 1 个元素。PyTorch 通过步长实现了视图view操作在不复制数据的情况下重塑张量极大节省了内存。## Tensor 的创建与基本操作我们从一个简单的代码示例开始演示如何创建 Tensor 并观察其属性。pythonimport torch# 创建一个形状为 (2, 3) 的浮点型张量元素值随机tensor_a torch.randn(2, 3) # 标准正态分布随机数print(Tensor a:\n, tensor_a)print(形状:, tensor_a.shape)print(数据类型:, tensor_a.dtype)print(设备:, tensor_a.device)print(步长:, tensor_a.stride()) # 输出 (3, 1)表示行步长3列步长1# 创建全零张量并指定数据类型和设备if torch.cuda.is_available(): tensor_b torch.zeros(2, 3, dtypetorch.float64, devicecuda) print(\nTensor b (on GPU):\n, tensor_b)else: print(CUDA 不可用使用 CPU 代替) tensor_b torch.zeros(2, 3, dtypetorch.float64)# 从 Python 列表创建张量list_data [[1, 2, 3], [4, 5, 6]]tensor_c torch.tensor(list_data)print(\n从列表创建的张量:\n, tensor_c)print(数据类型:, tensor_c.dtype) # 默认为 int64运行上述代码你会看到 Tensor 的创建方式灵活多样且通过.dtype、.device等属性可以轻松管理计算资源。注意torch.randn会返回一个torch.float32类型的张量而torch.zeros允许显式指定dtype这在混合精度训练中非常重要。## Tensor 的运算与自动广播机制Tensor 支持逐元素运算如加法、乘法和矩阵运算如mm、matmul。其中广播Broadcasting机制允许不同形状的张量进行运算其原理类似于 NumPy。广播规则如下1. 从最后一个维度开始对齐。2. 如果一个维度的大小为 1 或不存在则将该维度扩展为匹配的尺寸。3. 如果维度大小不一致且都不为 1则报错。下面是一个演示广播和矩阵运算的代码示例pythonimport torch# 演示广播加法a torch.tensor([[1, 2, 3], [4, 5, 6]]) # 形状 (2, 3)b torch.tensor([10, 20, 30]) # 形状 (3,)print(广播加法结果:\n, a b) # b 被广播为 (2, 3)# 矩阵乘法形状需兼容 (m, n) (n, p) - (m, p)c torch.randn(3, 2) # 形状 (3, 2)d torch.randn(2, 4) # 形状 (2, 4)result torch.mm(c, d) # 等价于 c dprint(\n矩阵乘法结果形状:, result.shape) # 输出 (3, 4)# 逐元素运算与原地操作e torch.ones(2, 3)e.mul_(2) # 原地乘以2注意下划线表示原地操作print(\n原地操作后的张量:\n, e)# 使用 view 改变形状不复制数据f torch.arange(12) # 一维张量 [0,1,...,11]g f.view(3, 4) # 重塑为 3x4注意元素总数必须匹配print(\n原始张量 f:, f)print(视图 g:\n, g)# 修改视图会影响原始数据g[0, 0] 99print(修改后 f:, f) # f 的第一个元素也变为 99这段代码展示了 Tensor 运算的灵活性和高效性。view操作通过调整步长实现了零拷贝的形状变换但要求原始张量在内存中是连续的。如果遇到非连续张量如转置后的张量可以使用.contiguous()方法强制转换为连续内存。## Tensor 的自动微分原理Tensor 与 Autograd 紧密结合实现了自动梯度计算。当设置requires_gradTrue时Tensor 会记录所有操作构建一个计算图。每个 Tensor 都有一个.grad_fn属性指向生成它的函数如AddBackward用于反向传播时计算梯度。关键原理计算图是动态构建的每次前向传播都会创建新的图结构。叶子节点用户创建的张量的grad_fn为None而中间节点的梯度通过链式法则计算。下面是一个完整的自动微分示例pythonimport torch# 创建需要梯度的张量x torch.tensor([2.0, 3.0], requires_gradTrue)w torch.tensor([1.0, -1.0], requires_gradTrue)b torch.tensor(0.5, requires_gradTrue)# 定义计算y sum(x * w) by torch.sum(x * w) b # 等价于 2*1 3*(-1) 0.5 -0.5print(y 的值:, y.item())# 反向传播计算梯度y.backward()print(dy/dx:, x.grad) # 梯度为 [w1, w2] [1.0, -1.0]print(dy/dw:, w.grad) # 梯度为 [x1, x2] [2.0, 3.0]print(dy/db:, b.grad) # 梯度为 1.0# 梯度累积如果再次调用 backward梯度会累积y2 torch.sum(x * w) b # 重新计算 yy2.backward() # 梯度会累加到之前的梯度上print(\n累积后的梯度:, x.grad) # 变为 [2.0, -2.0]注意默认情况下 PyTorch 会累积梯度因此在训练循环中需要手动清零使用optimizer.zero_grad()。此外with torch.no_grad()上下文管理器可以临时禁用梯度计算常用于评估模式。## Tensor 的 GPU 加速与性能优化Tensor 可以通过.to(device)在 CPU 和 GPU 之间迁移。GPU 上的 Tensor 运算利用 CUDA 核心并行执行显著提升性能尤其是在矩阵运算和卷积中。但频繁的数据迁移会带来开销因此应尽量将数据保持在同一个设备上。性能优化技巧- 使用torch.cuda.Stream实现异步操作。- 使用torch.jit.script或torch.compilePyTorch 2.0进行图优化。- 合理选择数据类型如float16代替float32以减少显存占用。## 总结Tensor 是 PyTorch 生态的基石它通过统一的数据抽象实现了跨设备计算、自动微分和高效的内存管理。本文从内存布局、创建操作、广播机制、自动微分到 GPU 加速层层深入揭示了其设计原理。理解 Tensor 的内部机制不仅有助于编写高效的代码还能为自定义算子或模型优化打下坚实基础。无论是初学者还是资深研究者掌握 Tensor 的精髓都是掌握 PyTorch 的第一步。

相关新闻

nftables精讲与例子(NAT、限速、限流量、禁ping等例子)

nftables精讲与例子(NAT、限速、限流量、禁ping等例子)

2026/9/4 9:43:09

nftables精讲与例子(NAT、限速、限流量、禁ping等例子) 为什么选择nftables?在Linux网络管理领域,iptables曾长期占据统治地位。但随着网络规模扩大和功能需求增加,iptables的局限性日益显现:规则集难以维护…

如何免费解锁九大网盘高速下载?这个开源工具让你告别限速烦恼

如何免费解锁九大网盘高速下载?这个开源工具让你告别限速烦恼

2026/9/8 7:15:51

如何免费解锁九大网盘高速下载?这个开源工具让你告别限速烦恼 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘…

Go语言并发编程:从volatile原理到内存模型与职业发展思考

Go语言并发编程:从volatile原理到内存模型与职业发展思考

2026/9/26 17:24:27

1. 项目概述:从“volatile”到职业焦虑的跨界思考 最近在整理Go语言并发编程的笔记时,我又一次遇到了那个经典且容易引发困惑的问题: “在Go里,什么时候需要用到volatile?” 这个问题看似是纯技术细节,但…

CANN/GE ACL数据集缓冲区添加函数

CANN/GE ACL数据集缓冲区添加函数

2026/9/26 19:14:12

aclmdlAddDatasetBuffer 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Te…

用ffmpeg高效批量调整图片尺寸的实战指南

用ffmpeg高效批量调整图片尺寸的实战指南

2026/9/27 1:30:29

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

2026/9/28 2:15:29

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱 【免费下载链接】transformers 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and mu…

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

2026/9/27 1:30:35

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system sup…

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

2026/9/27 1:30:34

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

2026/9/26 16:36:51

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system supporting mi…

远程协作的工作台整理

远程协作的工作台整理

2026/9/26 14:29:04

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/26 13:57:22

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/26 23:35:16

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…