MARS-M训练损失曲线深度分析:为什么它能超越Moonlight?

发布时间:2026/9/23 0:30:13

MARS-M训练损失曲线深度分析:为什么它能超越Moonlight?
MARS-M训练损失曲线深度分析为什么它能超越Moonlight【免费下载链接】MARSThe official implementation of MARS: Unleashing the Power of Variance Reduction for Training Large Models项目地址: https://gitcode.com/gh_mirrors/mars11/MARSMARS-M是GitHub加速计划mars11/MARS项目中提出的优化器通过方差减少技术实现了大型模型训练效率的显著提升。本文将深入分析MARS-M的训练损失曲线表现揭示其超越MoonlightMuon优化器的核心原因并通过多组实验数据验证其优势。一、损失曲线对比MARS-M vs Moonlight1.1 小模型在OpenWebText数据集上的表现在Small ModelOpenWebText数据集的训练中MARS-Mγ0.025红色曲线展现出比Moonlight蓝色曲线更陡峭的损失下降趋势。当训练 tokens 达到50B时MARS-M的验证损失比Moonlight低约0.02且曲线波动更小表明其优化过程更稳定。1.2 大模型在多数据集上的一致性优势Large Model在OpenWebText数据集上的实验进一步验证了MARS-M的优势训练初期10B tokensMARS-M与Moonlight损失基本持平中期20-30B tokensMARS-M开始拉开差距最终50B tokensMARS-M损失值比Moonlight低0.03且收敛速度更快1.3 超大型模型的扩展性验证在XL ModelFineWeb-Edu 100B数据集上MARS-M的优势更加明显。当训练达到50B tokens时MARS-Mγ0.01的验证损失比Moonlight低0.05且曲线更加平滑显示出其在超大规模模型训练中的强大稳定性。二、MARS-M超越Moonlight的核心技术2.1 方差减少机制MARS-M通过创新的方差减少技术Variance Reduction有效降低了梯度估计的噪声。与Moonlight相比MARS-M在优化过程中引入了两种计算模式精确模式需要额外的梯度计算但能获得更准确的梯度估计近似模式无需额外梯度计算保持计算效率的同时仍能实现方差减少这种设计使得MARS-M在不同计算资源条件下都能保持优化性能优势。2.2 自适应学习率调整MARS-M的γ参数如γ0.025和γ0.01提供了灵活的学习率调整机制。从损失曲线可以看出适当增大γ值如0.025能加速前期收敛而较小的γ值如0.01则有助于后期精细优化这种动态调整能力是Moonlight所不具备的。2.3 计算效率优化MARS-M的实现代码MARS_M/optimizers/mars_m.py中特别优化了计算流程近似版本无需额外梯度计算精确版本通过高效实现将额外计算成本降至最低相比之下MoonlightMARS_M/optimizers/moonlight.py采用的牛顿-舒尔茨正交化方法计算复杂度更高导致其在大规模训练时效率偏低。三、实验配置与复现指南3.1 模型与数据集实验覆盖了四种模型规模Small ModelMedium ModelLarge ModelXL Model使用的数据集包括OpenWebTextdata/openwebtext/prepare.pyFineWeb-Edu 100B3.2 训练脚本MARS-M的训练脚本位于项目的scripts目录下例如MARS_M/scripts/run_mars_m_small.shMARS_M/scripts/run_mars_m_xl_fw.sh要复现实验结果可通过以下命令克隆仓库git clone https://gitcode.com/gh_mirrors/mars11/MARS四、结论与应用建议MARS-M通过方差减少技术和自适应学习率机制在各种模型规模和数据集上均展现出超越Moonlight的训练性能。其优势主要体现在更低的最终验证损失平均降低0.02-0.05更快的收敛速度提前5-10B tokens达到稳定状态更好的优化稳定性损失曲线波动更小对于实际应用建议中小规模模型优先使用MARS-M γ0.025超大规模模型推荐MARS-M γ0.01计算资源有限时选择近似模式资源充足时启用精确模式MARS-M的这些特性使其成为训练大型语言模型的理想选择特别是在需要平衡训练效率和模型性能的场景中。【免费下载链接】MARSThe official implementation of MARS: Unleashing the Power of Variance Reduction for Training Large Models项目地址: https://gitcode.com/gh_mirrors/mars11/MARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

Splunk Attack Data环境搭建教程:GitHub LFS配置与数据拉取最佳实践

Splunk Attack Data环境搭建教程:GitHub LFS配置与数据拉取最佳实践

2026/9/23 0:27:28

Splunk Attack Data环境搭建教程:GitHub LFS配置与数据拉取最佳实践 【免费下载链接】attack_data A repository of curated datasets from various attacks 项目地址: https://gitcode.com/gh_mirrors/at/attack_data GitHub Attack Data是一个精心策划的攻…

Hy3-oQ2e项目结构深度解析:初学者必知的文件组织与功能模块

Hy3-oQ2e项目结构深度解析:初学者必知的文件组织与功能模块

2026/9/7 6:25:59

Hy3-oQ2e项目结构深度解析:初学者必知的文件组织与功能模块 【免费下载链接】Hy3-oQ2e 项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Hy3-oQ2e Hy3-oQ2e是HuggingFace镜像项目mlx-community中的重要组成部分,本文将带您深入了解其…

Inline-Execute-PE命令详解:从peload到peunload的完整操作手册

Inline-Execute-PE命令详解:从peload到peunload的完整操作手册

2026/9/7 12:15:05

Inline-Execute-PE命令详解:从peload到peunload的完整操作手册 【免费下载链接】Inline-Execute-PE Execute unmanaged Windows executables in CobaltStrike Beacons 项目地址: https://gitcode.com/gh_mirrors/in/Inline-Execute-PE Inline-Execute-PE是G…

CANN/GE ACL数据集缓冲区添加函数

CANN/GE ACL数据集缓冲区添加函数

2026/9/21 18:38:46

aclmdlAddDatasetBuffer 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Te…

用ffmpeg高效批量调整图片尺寸的实战指南

用ffmpeg高效批量调整图片尺寸的实战指南

2026/9/21 18:41:09

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

2026/9/21 18:36:40

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱 【免费下载链接】transformers 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and mu…

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

2026/9/21 18:37:26

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system sup…

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

2026/9/21 18:40:29

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

2026/9/21 18:36:17

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system supporting mi…

远程协作的工作台整理

远程协作的工作台整理

2026/9/22 0:19:28

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/21 23:38:13

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/22 0:48:53

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…