Audiocraft 音频生成终极指南:从零安装到用 MusicGen 创作你的第一首歌

发布时间:2026/8/18 15:07:09

Audiocraft 音频生成终极指南:从零安装到用 MusicGen 创作你的第一首歌
Audiocraft 音频生成终极指南从零安装到用 MusicGen 创作你的第一首歌【免费下载链接】audiocraftAudiocraft is a library for audio processing and generation with deep learning. It features the state-of-the-art EnCodec audio compressor / tokenizer, along with MusicGen, a simple and controllable music generation LM with textual and melodic conditioning.项目地址: https://gitcode.com/gh_mirrors/au/audiocraft你有没有过这样的时刻剪辑视频时想要一段独一无二的背景音乐搜遍素材库却找不到合适的写文章时想配一段轻音效又怕版权问题。如果只敲下一句话比如温暖的木吉他配上舒缓的钢琴就能在几分钟内得到一段完整音频那该多好Audiocraft 音频生成库正是为此而生——它是基于 PyTorch 的深度学习音频生成库集成了文本生成音乐MusicGen、文本生成音效AudioGen等当前最前沿的模型。下面这份指南会带你从零搭建环境、完成安装并用最短的代码创作出第一段属于自己的 AI 音乐。一个想法一句话Audiocraft 能为你做什么简单说Audiocraft 把文字 → 音频这件事做到了开箱即用。它由 MetaFacebook研究院开源核心思路是先用神经音频编解码器 EnCodec 把声音翻译成离散的 Token再用语言模型根据你的文字描述去预测这些 Token最后解码成波形。整个过程你几乎感知不到因为公开 API 只有寥寥几行。你可以用它做的事包括文本生成音乐输入一句风格描述得到完整乐曲旋律约束生成哼一段旋律或给一段参考音频让 AI 顺着旋律续写文本生成音效描述雨滴打在窗户上这类场景生成对应声音音频水印给自己的作品打上不可感知的版权标识。项目的核心模型源码都清晰可查比如音乐生成主入口在 audiocraft/models/musicgen.py音效生成在 audiocraft/models/audiogen.py想深入研究时非常方便。为什么值得选它一库装下主流音频生成全家桶市面上的音频生成方案并不少但很多要么只做单一任务要么依赖多套不同的库和接口。Audiocraft 的差异化价值在于全家桶式的整合模型能力一句话定位MusicGen文本 → 音乐可控的文本生成音乐模型AudioGen文本 → 音效文本生成环境声/人声等EnCodec音频编解码高质量神经音频压缩与分词器Multi Band Diffusion音频解码扩散模型解码器可与 EnCodec 搭配MAGNeT文本 → 音乐/音效非自回归生成速度更快JASCO多条件 → 音乐支持和弦、旋律、鼓点组合控制AudioSeal水印为音频添加版权标识更关键的是它们的调用风格高度统一。学会一个 MusicGen其他模型几乎零成本上手。这一点对新手尤其友好——你不需要为每个模型重新学习一套 API。动手前的地基环境三件套在安装 Audiocraft 之前请先确认三件事它们就像盖楼前的地基Python 3.9 或更高版本——用python --version检查PyTorch 2.1.0CUDA 版本——音频模型本质上是深度学习模型强烈建议使用支持 GPU 的版本。可以用python -c import torch; print(torch.cuda.is_available())快速验证FFmpeg——音频解码与转码的基础工具很多音频文件的读取都依赖它。如果你的 Python 版本偏旧推荐先用虚拟环境隔离python -m venv audiocraft_env source audiocraft_env/bin/activate然后安装 PyTorch 基础环境若已装过可跳过python -m pip install torch2.1.0 torchaudio torchvision接着安装构建工具与 FFmpegpython -m pip install setuptools wheel sudo apt-get install ffmpeg # Ubuntu/Debian 系统 # 如果使用 Anaconda也可以用conda install ffmpeg5 -c conda-forge 提示FFmpeg 装好后再安装 Audiocraft可以避免后续音频读写时出现莫名其妙的格式错误。三种安装方式选最省心的那一种环境就绪后根据你的目标选择安装方式方式一直接安装稳定版最快python -m pip install -U audiocraft适合只想快速体验生成效果的场景。方式二从源码安装训练模型的必经之路git clone https://gitcode.com/gh_mirrors/au/audiocraft cd audiocraft python -m pip install -e .-e表示以可编辑模式安装代码改动即时生效官方明确要求训练时必须采用这种方式。方式三附带水印功能可选python -m pip install -e .[wm]需要训练或使用音频水印模型AudioSeal时再选这个。安装完成后用一段代码验证安装是否成功import torch import audiocraft print(PyTorch:, torch.__version__, | CUDA 可用:, torch.cuda.is_available()) print(Audiocraft 版本:, audiocraft.__version__)三分钟快速上手生成你的第一段 AI 音乐安装就绪现在进入最激动人心的环节——用 MusicGen 创作第一段音乐。打开你的 Python 环境输入from audiocraft.models import MusicGen # 加载预训练模型首次运行会自动下载权重稍等片刻 model MusicGen.get_pretrained(facebook/musicgen-small) # 设置生成参数输出 10 秒音频 model.set_generation_params(duration10) # 输入文字描述一次生成多条 descriptions [欢快的电子舞曲节奏感强烈, 宁静的钢琴独奏伴着雨声] wav model.generate(descriptions)运行完成后wav里就是两段对应的音频张量。接下来把它保存成文件from audiocraft.data.audio import audio_write for idx, one_wav in enumerate(wav): # 自动做响度归一化-14 LUFS并保存为 wav 文件 audio_write(fmy_music_{idx}, one_wav.cpu(), model.sample_rate, strategyloudness, loudness_compressorTrue)去当前目录找找my_music_0.wav和my_music_1.wav播放听听——这就是你创作的第一段 AI 音乐玩得更花让音乐跟随你的旋律纯文本生成已经够神奇但 MusicGen 的旋律约束功能更能体现它的可控性。假设你有一小段哼唱或一段参考旋律想让 AI 基于它续写完整配乐只需要import torchaudio # 读取一段参考音频项目 assets 目录自带示例如 bach.mp3 melody, sr torchaudio.load(assets/bach.mp3) # 让 AI 在保持原旋律走向的同时按描述生成音乐 wav model.generate_with_chroma(descriptions, melody[None].expand(len(descriptions), -1, -1), sr)generate_with_chroma会提取参考音频的旋律特征Chroma作为生成的约束条件。你可以试试用同一段旋律配上爵士版摇滚版等不同描述感受 AI 如何在约束与创意之间找到平衡。 想体验更强条件控制JASCO 模型支持同时指定和弦、鼓点和旋律配置参考 config/conditioner/ 目录下的 jasco 相关配置文件。从音乐到音效AudioGen 与更多玩法除了音乐Audiocraft 还能生成音效这就是 AudioGen 的用武之地。它的用法几乎和 MusicGen 一模一样from audiocraft.models import AudioGen model AudioGen.get_pretrained(facebook/audiogen-medium) model.set_generation_params(duration5) wav model.generate([小狗在公园里叫远处传来鸟鸣还有风声])给游戏做素材、给视频配环境音、给播客加转场音效……AudioGen 都能派上用场。更妙的是因为两套 API 统一你可以很自然地在同一个项目里音乐 音效混搭使用。进阶之路本地 Demo 与自定义训练光看代码不过瘾项目自带基于 Gradio 的图形界面 Demo一条命令即可启动像玩网页应用一样体验全部模型能力python -m demos.musicgen_app --share另外 demos/ 目录下还有magnet_app.py、jasco_app.py等更多示例应用以及对新手友好的 Jupyter Notebook如 demos/musicgen_demo.ipynb。如果你已经准备好训练自己的模型项目也提供了完整的训练管线训练框架与求解器逻辑位于 audiocraft/solvers/所有配置采用 Hydra 管理集中在 config/ 目录包括模型结构config/model/、数据集config/dset/和训练求解器config/solver/三大部分训练相关细节请查阅官方训练文档 docs/TRAINING.md。需要提醒的是训练对硬件要求较高建议先熟悉生成流程再逐步进入训练环节。新手避坑指南五个高频问题一次讲清① CUDA 不可用怎么办先确认安装的是 CUDA 版 PyTorchtorch.cuda.is_available()必须返回True。安装时建议用pip install torch2.1.0这类带版本号的命令避免装到与 CUDA 不匹配的版本。② 显存不够用生成音乐本质上是跑大模型。官方建议使用至少 16GB 显存的 GPU 跑中等模型约 15 亿参数如果你的显卡较小优先选facebook/musicgen-small3 亿参数并缩短duration仍然可以获得不错的效果。③ 依赖版本冲突项目对依赖有明确锁定torch2.1.0、xformers0.0.23、numpy2.0.0、torchaudio2.1.2。若遇到冲突检查并调整这些包的版本即可。强烈建议全程使用虚拟环境避免污染系统 Python。④ 模型下载太慢或想换缓存目录模型权重默认从 Hugging Face 下载可通过环境变量AUDIOCRAFT_CACHE_DIR指定缓存位置方便统一管理已下载的权重。⑤ 商用版权问题代码采用 MIT 许可但预训练模型权重采用 CC-BY-NC 4.0 许可即免费但仅限非商业用途。有商用需求时务必阅读项目根目录的LICENSE_weights文件确认条款。现在轮到你动手了从一句文字描述到一段完整音频Audiocraft 把过去需要大量专业知识的音频制作流程压缩成了十几行 Python 代码。你不需要懂声学原理也不必掌握复杂的深度学习知识只需要一个想法、一台带 GPU 的电脑和一点点好奇心。现在就动手吧安装环境、跑通上面的示例然后试着用一句话描述你脑海中的声音。也许下一首让你单曲循环的音乐就诞生在你的键盘之下。想深入探索可以从项目内的 docs/ 目录开始那里有 MusicGen、AudioGen、MAGNeT 等每个模型的专题文档祝创作愉快【免费下载链接】audiocraftAudiocraft is a library for audio processing and generation with deep learning. It features the state-of-the-art EnCodec audio compressor / tokenizer, along with MusicGen, a simple and controllable music generation LM with textual and melodic conditioning.项目地址: https://gitcode.com/gh_mirrors/au/audiocraft创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

复制一个钱包地址,钱就进了别人口袋?——剪切板劫持全揭秘

复制一个钱包地址,钱就进了别人口袋?——剪切板劫持全揭秘

2026/8/18 14:57:08

复制一个钱包地址,钱就进了别人口袋?——剪切板劫持全揭秘 【免费下载链接】Stealerium Stealer Clipper Keylogger 项目地址: https://gitcode.com/gh_mirrors/st/Stealerium 深夜,你从交易所复制了一串比特币地址,粘贴…

每天省下2小时:用三月七小助手把崩坏星穹铁道自动化进行到底

每天省下2小时:用三月七小助手把崩坏星穹铁道自动化进行到底

2026/8/18 14:57:08

每天省下2小时:用三月七小助手把崩坏星穹铁道自动化进行到底 【免费下载链接】March7thAssistant 崩坏:星穹铁道全自动 三月七小助手 项目地址: https://gitcode.com/gh_mirrors/ma/March7thAssistant 晚上十点半,你终于忙完一天的事&…

W5500 9大应用场景

W5500 9大应用场景

2026/8/18 14:57:08

W5500 是 WIZnet 公司推出的一款经典的硬件 TCP/IP 协议栈以太网控制器,内置 10/100M 以太网 PHY 和 MAC,通过高速 SPI 接口与主控 MCU(如 STM32、ESP32、51 单片机等)通信。 它的核心优势在于:将繁琐的 TCP/IP 协议处…

聚合音源实战手册:一个配置打通五大平台无损曲库,告别来回切换

聚合音源实战手册:一个配置打通五大平台无损曲库,告别来回切换

2026/8/18 16:07:11

聚合音源实战手册:一个配置打通五大平台无损曲库,告别来回切换 【免费下载链接】lxmusic- lxmusic(洛雪音乐)全网最新最全音源 项目地址: https://gitcode.com/gh_mirrors/lx/lxmusic- 晚上十点,你想听一首十年前的老歌。网易云有版权…

Andy.scss 进阶指南:如何基于现有代码扩展属于自己的 SASS Mixins

Andy.scss 进阶指南:如何基于现有代码扩展属于自己的 SASS Mixins

2026/8/18 16:07:11

Andy.scss 进阶指南:如何基于现有代码扩展属于自己的 SASS Mixins 【免费下载链接】andy Open-Source Collection of Useful SASS Mixins Library 项目地址: https://gitcode.com/gh_mirrors/an/andy Andy.scss 是一个开源、轻量、零依赖的 SASS Mixins 库&a…

GANFit的开源生态指南:3D人脸重建与TBGAN纹理形状模型许可证申请与探索

GANFit的开源生态指南:3D人脸重建与TBGAN纹理形状模型许可证申请与探索

2026/8/18 16:07:11

GANFit的开源生态指南:3D人脸重建与TBGAN纹理形状模型许可证申请与探索 【免费下载链接】GANFit Project Page of GANFIT: Generative Adversarial Network Fitting for High Fidelity 3D Face Reconstruction [CVPR2019] 项目地址: https://gitcode.com/gh_mirro…

reinstall一键重装脚本终极指南:把重装命令交给别名,手残星人也能三秒上车

reinstall一键重装脚本终极指南:把重装命令交给别名,手残星人也能三秒上车

2026/8/18 16:07:11

reinstall一键重装脚本终极指南:把重装命令交给别名,手残星人也能三秒上车 【免费下载链接】reinstall 一键DD/重装脚本 (One-click reinstall OS on VPS) 项目地址: https://gitcode.com/GitHub_Trending/re/reinstall 凌晨两点,监控…

3分钟免费获取苹方字体:Windows安装与网页字体美化完整指南

3分钟免费获取苹方字体:Windows安装与网页字体美化完整指南

2026/8/18 16:07:11

3分钟免费获取苹方字体:Windows安装与网页字体美化完整指南 【免费下载链接】PingFangSC PingFangSC字体包文件、苹果平方字体文件,包含ttf和woff2格式 项目地址: https://gitcode.com/gh_mirrors/pi/PingFangSC 如果你正为 Windows 系统里的字体…

用 MemorySharp 打造自动化测试工具:模拟键盘鼠标实现 UI 回归测试

用 MemorySharp 打造自动化测试工具:模拟键盘鼠标实现 UI 回归测试

2026/8/18 15:57:11

用 MemorySharp 打造自动化测试工具:模拟键盘鼠标实现 UI 回归测试 【免费下载链接】MemorySharp A C# based memory editing library targeting Windows applications, offering various functions to extract and inject data and codes into remote processes to…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/17 1:28:42

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/18 1:03:22

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/17 8:40:51

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

多智能体大模型辩论中的立场收敛:从伪共识到理性说服的评估方法

多智能体大模型辩论中的立场收敛:从伪共识到理性说服的评估方法

2026/8/18 0:06:29

1. 从一场“假辩论”说起:为什么大模型辩论会走向“伪共识”?最近在折腾多智能体大语言模型(Multi-Agent LLM)的辩论实验,发现一个挺有意思的现象。我让几个基于GPT-4的智能体就一个争议性话题(比如“远程办…

Frida动态代码插桩框架:从原理到实战的移动安全与逆向工程指南

Frida动态代码插桩框架:从原理到实战的移动安全与逆向工程指南

2026/8/18 0:06:29

1. 从“黑盒”到“白盒”:为什么我们需要Frida在移动安全、逆向工程甚至是一些自动化测试的场景里,我们经常会遇到一个让人头疼的问题:面对一个编译好的、没有源代码的应用程序,我们如何知道它在运行时内部发生了什么?…

ECharts饼图中心文字配置指南:从label与title区别到动态交互实现

ECharts饼图中心文字配置指南:从label与title区别到动态交互实现

2026/8/18 0:06:29

1. 从“空心”到“有魂”:为什么要在饼图中间加文字?如果你用过ECharts画饼图,大概率会注意到一个现象:默认生成的饼图中间是空心的。这个设计本身没问题,它清晰地展示了各个扇区的占比关系。但在很多实际的业务场景里…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…