FMA|完整音乐分析数据集,106,574 首曲目与 917 GiB CC 音频

发布时间:2026/8/25 23:15:43

FMA|完整音乐分析数据集,106,574 首曲目与 917 GiB CC 音频
FMA完整音乐分析数据集106,574 首曲目与 917 GiB CC 音频【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fmaFMA 是一个开源音乐分析数据集收录 106,574 首 Creative Commons 授权的曲目、161 个流派标签和预计算音频特征。你在训练音频模型时缺数据它一次给齐。FMA 音乐分析数据集解决什么麻烦想训练音频模型先得弄到一批来路干净的音频自己收集的话版权没法保证。只有 1,000 首、8 个标签的老数据集模型一上就过拟合那 8 个流派。特征提取也是座大山自己用 librosa 跑 10 万首曲目的特征光处理就要好几天。能力速览能力一句话说明≤15字典型场景CC 授权音频106,574 首343 天时长流派识别、音频模型训练预计算特征librosa 提取即用跳过特征工程直接建模分层流派标签161 个流派带父子关系粗粒度分类、多标签任务元数据与标签艺术家、专辑、播放量、简介推荐系统、多模态特征官方切分与基线train/val/test 附基线与社区论文对比数字最短上手路径git clone https://gitcode.com/gh_mirrors/fm/fma cd fma pip install -r requirements.txt然后在data/目录下载并解压fma_metadata.zip342 MiB和fma_small.zip7.2 GiB下载命令和 sha1 校验脚本都写在 README.md 里照抄即可。再在仓库根目录的.env里把AUDIO_DIR指向解压后的音频目录就可以跑第一个 cellimport utils tracks utils.load(data/fma_metadata/tracks.csv) features utils.load(data/fma_metadata/features.csv) print(tracks[track, genre_top].value_counts().head())立刻能看到曲目数最多的流派和对应特征。音频共四种规格从小到大fma_small7.2 GiB—— 8,000 首 30 秒片段8 个平衡流派适合快速验证fma_medium22 GiB—— 25,000 首 30 秒片段16 个流派适合中等规模实验fma_large93 GiB—— 106,574 首 30 秒片段161 个流派适合全流派研究fma_full879 GiB—— 完整长度音频适合全长序列建模三个真实用法跑通流派识别基线想知道现有数据和方法能到什么水平先跑官方基线模型。make baselines.ipynb它会分别用音频和特征训练两组基线并给出准确率。验证音频加载链路写训练管线之前先确认第一首曲子的路径和波形加载没问题。import os import utils path utils.get_audio_path(os.environ[AUDIO_DIR], 2) y utils.LibrosaLoader().load(path)查看流派层级顶层分类只需要少数顶层流派时先看清父子结构再决定怎么归并标签。import utils from utils import Genres genres utils.load(data/fma_metadata/genres.csv) print(Genres(genres).find_roots())踩坑清单unzip 解压到尾部报 unsupported compression 错。换 7zip 解压不放心就用 README 里的 sha1 先校验压缩包是否完整。pip install -r requirements.txt 报错提示指向 numpy 或 resampy。先执行pip install numpy1.12.1再装 requirements官方 README 明确这是绕过 resampy 的安装问题。在 Python 3.10 以上环境tensorflow 1.0.1、librosa 0.5.0 这类老版本装不上。用 Python 3.6 开独立环境conda create -n fma python3.6如果只用元数据和特征也可以直接拿新版 pandas 读 csv绕开整套老依赖。下一步usage.ipynb加载数据、训练与评测模型的完整流程analysis.ipynb探索元数据、特征与流派层级分布baselines.ipynb流派识别基线数字进阶方向用 fma_large 的 30 秒片段预训练音频表示模型再微调下游任务clone 下来解压 fma_small你手里就是 8,000 首带流派标签的音频。【免费下载链接】fmaFMA: A Dataset For Music Analysis项目地址: https://gitcode.com/gh_mirrors/fm/fma创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

AI Skill 全面介绍:从概念到实战应用

AI Skill 全面介绍:从概念到实战应用

2026/8/25 23:15:43

1. 什么是 AI SkillAI Skill 是指面向人工智能应用场景封装的一组可复用能力单元,它将特定领域的知识、提示词模板、工具调用逻辑和数据处理流程整合在一起,让开发者或普通用户能够以较低成本快速构建和部署智能应用。简单来说,AI Skill 可以…

拯救者工具箱 Lenovo Legion Toolkit 使用教程:性能模式、独显直连与自动化一站配好

拯救者工具箱 Lenovo Legion Toolkit 使用教程:性能模式、独显直连与自动化一站配好

2026/8/25 23:05:42

拯救者工具箱 Lenovo Legion Toolkit 使用教程:性能模式、独显直连与自动化一站配好 【免费下载链接】LenovoLegionToolkit Lightweight Lenovo Vantage and Hotkeys replacement for Lenovo Legion laptops. 项目地址: https://gitcode.com/gh_mirrors/le/Lenovo…

SQL Server数据插入性能优化:从单条到海量的七种方法对比

SQL Server数据插入性能优化:从单条到海量的七种方法对比

2026/8/25 23:05:42

1. 项目概述:为什么我们要关心SQL Server的插入效率?在数据库日常开发和运维中,数据插入(INSERT)是最基础、最高频的操作之一。无论是业务系统记录用户行为、日志系统收集跟踪信息,还是数据仓库进行ETL过程…

具身智能精密装配赛上位机开发:TCP通讯、协议解析与实时调度实战指南

具身智能精密装配赛上位机开发:TCP通讯、协议解析与实时调度实战指南

2026/8/26 0:05:45

1. 先搞清楚“具身智能精密装配赛”到底要解决什么问题看到“具身智能精密装配赛”这个标题,很多人的第一反应可能是“这比赛要用机器人做装配”,然后就开始琢磨机械臂、视觉算法或者强化学习。但结合“线下赛区需要智能体上位机教学及tcp通讯”这个关键…

缓存穿透、击穿与雪崩:原理、区别与Spring Boot+Redis实战解决方案

缓存穿透、击穿与雪崩:原理、区别与Spring Boot+Redis实战解决方案

2026/8/26 0:05:45

大家好,我是专注于后端技术分享的博主。在构建高并发系统时,缓存是提升性能、保护数据库的利器。然而,如果使用不当,缓存也可能成为系统稳定性的“阿喀琉斯之踵”。缓存穿透、击穿和雪崩是三个高频出现且极易混淆的故障场景&#…

免费AI大模型调教指南:打造专属网文写作助手

免费AI大模型调教指南:打造专属网文写作助手

2026/8/26 0:05:45

1. 先搞清楚“AI小说扩展模式”到底能帮你做什么如果你是一个刚开始写网文、或者卡在L3级别以下的作者,最头疼的可能是情节推进不下去、人物对话干瘪,或者世界观设定不够丰满。自己对着空白文档硬憋,效率很低。这时候,一个能理解你…

Hermes接入团队协作后,我推翻了三个效率假设

Hermes接入团队协作后,我推翻了三个效率假设

2026/8/26 0:05:45

聊《Hermes真能提效吗?先看流程里最慢的那一步》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要团队把 Hermes 接进项目三个月后,交付速度没有提升反而慢了。复盘后发现,最先…

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

2026/8/26 0:05:45

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

Python图片爬虫实战:从Requests到反爬策略的工业级解决方案

Python图片爬虫实战:从Requests到反爬策略的工业级解决方案

2026/8/25 23:55:44

1. 项目概述:从“能爬”到“爬得好”的蜕变干了这么多年开发,Python爬虫算是我的老本行了。从最初用urllib硬着头皮解析HTML,到后来requestsBeautifulSoup的黄金组合,再到应对各种反爬策略的斗智斗勇,踩过的坑比写过的…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/24 19:53:32

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/24 19:56:07

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/24 21:16:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

Python random 模块常用函数详解:从入门到实战

Python random 模块常用函数详解:从入门到实战

2026/8/26 0:05:45

目录 1. 引言2. 准备工作3. 基础随机函数4. 序列相关函数5. 随机种子与复现6. 实战案例7. 注意事项8. 常见问题与排查9. 总结 1. 引言 摘要: 本文系统介绍 Python 标准库 random 模块中最常用的随机数生成函数。内容涵盖基础随机函数(random()、unifor…

Hermes接入团队协作后,我推翻了三个效率假设

Hermes接入团队协作后,我推翻了三个效率假设

2026/8/26 0:05:45

聊《Hermes真能提效吗?先看流程里最慢的那一步》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要团队把 Hermes 接进项目三个月后,交付速度没有提升反而慢了。复盘后发现,最先…

免费AI大模型调教指南:打造专属网文写作助手

免费AI大模型调教指南:打造专属网文写作助手

2026/8/26 0:05:45

1. 先搞清楚“AI小说扩展模式”到底能帮你做什么如果你是一个刚开始写网文、或者卡在L3级别以下的作者,最头疼的可能是情节推进不下去、人物对话干瘪,或者世界观设定不够丰满。自己对着空白文档硬憋,效率很低。这时候,一个能理解你…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…