头歌实践教学平台:数据科学与大数据技术导论(十一上)

发布时间:2026/8/27 21:08:24

头歌实践教学平台:数据科学与大数据技术导论(十一上)
十一、数据处理与分析第1关数据处理与分析的概念任务描述本关任务根据相关知识内容完成右边选择题。相关知识为了完成本关任务你需要掌握1.数据分析与处理的概念。数据处理与分析的概念数据分析可以分为广义的数据分析和狭义的数据分析广义的数据分析就包括狭义的数据分析和数据挖掘。广义的数据分析是指用适当的分析方法来自统计学、机器学习和数据挖掘等领域对收集来的数据进行分析提取有用信息和形成结论的过程。可以看出在广义的数据分析中可以使用复杂的机器学习和数据挖掘算法也可以根本不使用这些算法而只使用一些简单的统计分析方法比如汇总求和、求平均值、求均方差等。狭义的数据分析是指根据分析目的用适当的统计分析方法及工具对收集来的数据进行处理与分析提取有价值的信息发挥数据的作用。数据分析与数据挖掘狭义的数据分析和数据挖掘是有着明显的区分的具体如下1在定义层面狭义的数据分析在上面已经定义过。而数据挖掘是指从大量的数据中通过统计学、人工智能、机器学习等方法挖掘出未知的、且有价值的信息和知识的过程。2在作用层面数据分析主要实现三大作用现状分析、原因分析、预测分析定量。数据分析的目标明确先做假设然后通过数据分析来验证假设是否正确从而得到相应的结论。数据挖掘主要侧重解决四类问题分类、聚类、关联和预测定量、定性数据挖掘的重点在寻找未知的模式与规律如著名的数据挖掘案例——啤酒与尿布就是事先未知的但又是非常有价值的信息。3在方法层面数据分析主要采用对比分析、分组分析、交叉分析、回归分析等常用分析方法数据挖掘主要采用决策树、神经网络、关联规则、聚类分析等统计学、人工智能、机器学习等方法进行挖掘4在结果层面数据分析一般都是得到一个指标统计量结果如总和、平均值等这些指标数据都需要与业务结合进行解读才能发挥出数据的价值与作用。数据挖掘则是输出模型或规则并且可相应得到模型得分或标签模型得分如流失概率值、总和得分、相似度、预测值等标签如高中低价值用户、流失与非流失、信用优良中差等。综上所述数据分析狭义与数据挖掘的本质都是一样的都是从数据里面发现关于业务的知识有价值的信息从而帮助业务运营、改进产品以及帮助企业做更好的决策。所以数据分析狭义与数据挖掘构成广义的数据分析。数据分析与数据处理数据分析过程通常会伴随着发生数据处理或者说伴随着大量数据计算因此数据分析和数据处理是一对关系紧密的概念很多时候二者是融合在一起的很难割裂开来。也就是说当用户在进行数据分析的时候底层的计算机系统会根据数据分析任务的要求使用程序进行大量的数据处理或者说发生大量的数据计算。例如当用户进行决策树分析时需要事先根据决策树算法编写分析程序当分析开始以后决策树分析程序就会从磁盘读取数据进行大量计算最终给出计算结果也就是决策树分析结果。大数据处理与分析数据分析包含两个要素即理论和技术。在理论层面需要统计学、机器学习和数据挖掘等知识。在技术层面包括单机分析工具比如 SPSS、SAS 等或单机编程语言比如 Python、R以及大数据处理与分析技术比如 MapReduce、Spark、Hive 等。数据分析可以是针对小规模数据的分析也可以是针对大规模数据的分析这时被称为“大数据分析”。在大数据时代到来之前数据分析主要以小规模的抽样数据为主一般使用统计学、机器学习和数据挖掘的相关方法以单机分析工具比如 SPSS 和 SAS或者单机编程比如 Python、R的方式来实现分析程序。但是到了大数据时代数据量爆炸式地增长很多时候需要对规模巨大的全量数据而不是小规模的抽样数据进行分析这时单机工具和单机程序已经显得“无能为力”就需要采用分布式实现技术比如使用 MapReduce、Spark 或 Flink 编写分布式分析程序借助于集群的多台机器进行并行数据处理分析这个过程就被称为“大数据处理与分析”。编程要求根据相关知识完成右侧选择题测试说明若选择题答案与正确答案一致则可通关。开始你的任务吧祝你成功第2关机器学习和数据挖掘算法任务描述本关任务根据相关知识内容完成右边选择题。相关知识为了完成本关任务你需要掌握1.概述2.分类3.聚类4.回归分析5.关联规则6.协同过滤。概述机器学习是一门多领域交叉学科涉及概率论、统计学、逼近论、凸分析、算法复杂度理论等多门学科专门研究计算机怎样模拟或实现人类的学习行为以获取新的知识或技能重新组织已有的知识结构使之不断改善自身的性能它是人工智能的核心是使计算机具有智能的根本途径其应用遍及人工智能的各个领域。数据挖掘是指从大量的数据中通过算法搜索隐藏于其中信息的过程。数据挖掘可以视为机器学习与数据库的交叉它主要利用机器学习界提供的算法来分析海量数据利用数据库界提供的存储技术来管理海量数据。从知识的来源角度而言数据挖掘领域的很多知识也“间接”来自于统计学界之所以说“间接”是因为统计学界一般偏重于理论研究而不注重实用性统计学界中的很多技术需要在机器学习界进行验证和实践并变成有效的机器学习算法以后才可能进入数据挖掘领域对数据挖掘产生影响。虽然数据挖掘的很多技术都来自机器学习领域但是我们并不能因此就认为数据挖掘只是机器学习的简单应用。毕竟机器学习通常只研究小规模的数据对象往往无法应用到海量数据的情形数据挖掘领域必须借助于海量数据管理技术对数据进行存储和处理同时对一些传统的机器学习算法进行改进使其能够支持海量数据的情形。典型的机器学习和数据挖掘算法包括分类、聚类、回归分析和关联规则等。分类分类是一种重要的机器学习和数据挖掘技术。分类的目的是根据数据集的特点构造一个分类函数或分类模型(也常常称作分类器)该模型能把未知类别的样本映射到给定类别中。构造分类模型的过程一般分为训练和测试两个阶段。在构造模型之前将数据集随机地分为训练数据集和测试数据集。先使用训练数据集来构造分类模型然后使用测试数据集来评估模型的分类准确率。如果认为模型的准确率可以接受就可以用该模型对其它数据元组进行分类。一般来说测试阶段的代价远低于训练阶段。典型的分类方法包括决策树、朴素贝叶斯、支持向量机和人工神经网络等。这里给出一个分类的应用实例。假设有一名植物学爱好者对她发现的鸢尾花的品种很感兴趣。她收集了每朵鸢尾花的一些测量数据花瓣的长度和宽度以及花萼的长度和宽度。她还有一些鸢尾花分类的数据也就是说这些花之前已经被植物学专家鉴定为属于 setosa、versicolor 或 virginica 三个品种之一。基于这些分类数据她可以确定每朵鸢尾花所属的品种。于是她可以构建一个分类算法让算法从这些已知品种的鸢尾花测量数据中进行学习得到一个分类模型再使用分类模型预测新鸢尾花的品种。聚类聚类又称群分析是一种重要的机器学习和数据挖掘技术。聚类分析的目的是将数据集中的数据对象划分到若干个簇中并且保证每个簇之间样本尽量接近不同簇的样本间距离尽量远。通过聚类生成的簇是一组数据对象的集合簇满足以下两个条件1每个簇至少包含一个数据对象2每个数据对象仅属于一个簇。聚类分析的常见应用场景包括1目标用户的群体分类通过对特定运营目的和商业目的所挑选出的指标变量进行聚类分析把目标群体划分成几个具有明显特征区别的细分群体从而可以在运营活动中为这些细分群体采取精细化个性化的运营和服务最终提升运营的效率和商业效果。2不同产品的价值组合企业可以按照不同的商业目的并依照特定的指标标量来为众多的产品种类进行聚类分析把企业的产品体系进一步细分成具有不同价值、不同目的的多维度的产品组合并且在此基础分别制定和相应的开发计划、运营计划和服务规划。3探测发现离群点和异常值这里的离群点是指相对于整体数据对象而言的少数数据对象这些对象的行为特征与整体的数据行为特征很不一致比如某 B2C 电商平台上比较昂贵、频繁的交易就有可能隐含欺诈的风险需要风控部门提前关注。聚类分析一般属于无监督分类的范畴按照一定的要求和规律在没有关于分类的先验知识情况下对数据进行区分和分类。聚类既能作为一个单独过程用于找寻数据内部的分布结构也可以作为分类等其他学习任务的前驱过程。聚类算法可分为划分法Partitioning Method、层次法Hierarchical Method、基于密度的方法Density-based Method、基于网格的方法Grid-based Method、基于模型的方法Model-BasedMethod。这些方法没有统一的评价指标因为不同聚类算法的目标函数相差很大。有些聚类是基于距离的如 K-Means有些是假设先验分布的如 GMMLDA有些是带有图聚类和谱分析性质的如谱聚类还有些是基于密度的如 DBSCAN。聚类算法应该嵌入到问题中进行评价。回归分析回归分析Regression Analysis指的是确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法。回归分析按照涉及的变量的多少分为一元回归和多元回归分析按照因变量的多少可分为简单回归分析和多重回归分析按照自变量和因变量之间的关系类型可分为线性回归分析和非线性回归分析。在大数据分析中回归分析是一种预测性的建模技术它研究的是因变量目标和自变量预测器之间的关系。这种技术通常用于预测分析时间序列模型以及发现变量之间的因果关系。例如司机的鲁莽驾驶与道路交通事故数量之间的关系最好的研究方法就是回归。关联规则关联规则最初是针对购物篮分析Market Basket Analysis问题提出的。假设零售商想更多地了解顾客的购物习惯。特别是想知道顾客可能会在一次购物时同时购买哪些商品为了回答该问题可以对商店的顾客事物零售数量进行购物篮分析。该过程通过发现顾客放入“购物篮”中的不同商品之间的关联分析顾客的购物习惯。这种关联的发现可以帮助零售商了解哪些商品频繁地被顾客同时购买从而帮助他们开发更好的营销策略。关联规则定义为假设是I{I1,I2,I3,…,Im}项的集合。给定一个交易数据库 D其中每个事务 t 是 I 的非空子集即每一个交易都与一个唯一的标识符 TID 对应。关联规则在 D 中的支持度是 D 中事务同时包含 X、Y 的百分比即概率置信度是 D 中事务已经包含 X 的情况下包含 Y 的百分比即条件概率。如果满足最小支持度阈值和最小置信度阈值则认为关联规则是有趣的。这些阈值是根据挖掘需要人为设定的。这里举一个简单的例子进行说明。顾客购买记录TID 乒乓球拍 乒乓球 运动鞋 羽毛球1 1 1 1 02 1 1 0 03 1 0 0 04 1 0 1 05 0 1 1 16 1 1 0 0上表是顾客购买记录的数据库 D包含 6 个事务。项集 I {乒乓球拍乒乓球运动鞋羽毛球}。考虑关联规则频繁二项集乒乓球拍与乒乓球事务1,2,3,4,6包含乒乓球拍事务1,2,6同时包含乒乓球拍和乒乓球这里用 X 表示购买了乒乓球用 Y 表示购买了乒乓球拍则X˄Y3, D6支持度(X˄Y)/D0.5X5, 置信度(X˄Y)/X0.6。若给定最小支持度α 0.5最小置信度β 0.6认为购买乒乓球拍和购买乒乓球之间存在关联。常见的关联规则挖掘算法包括 Apriori 算法和 FP-Growth 算法等。协同过滤推荐技术从被提出到现在已有十余年在多年的发展历程中诞生了很多新的推荐算法。协同过滤作为最早、最知名的推荐算法不仅在学术界得到了深入研究而且至今在业界仍有广泛的应用已经被大量应用到电子商务的推荐系统中。协同过滤主要包括基于用户的协同过滤、基于物品的协同过滤和基于模型的协同过滤。基于用户的协同过滤算法简称 UserCF 算法是推荐系统中最古老的算法可以说UserCF 的诞生标志着推荐系统的诞生。该算法在 1992 年 被提出直到现在该算法都是推荐系统领域最著名的算法之一。UserCF 算法符合人们对于“趣味相投”的认知即兴趣相似的用户往往有相同的物品喜好当目标用户需要个性化推荐时可以先找到和目标用户有相似兴趣的用户群体然后将这个用户群体喜欢的、而目标用户没有听说过的物品推荐给目标用户这种方法就称为“基于用户的协同过滤算法”。基于物品的协同过滤算法简称 ItemCF 算法是目前业界应用最多的算法。无论是亚马逊还是 Netflix其推荐系统的基础都是 ItemCF 算法。ItemCF 算法是给目标用户推荐那些和他们之前喜欢的物品相似的物品。ItemCF 算法并不利用物品的内容属性计算物品之间的相似度而主要通过分析用户的行为记录来计算物品之间的相似度该算法基于的假设是物品 A 和物品 B 具有很大的相似度是因为喜欢物品 A 的用户大多也喜欢物品 B。例如该算法会因为你购买过《数据挖掘导论》而给你推荐《机器学习实战》因为买过《数据挖掘导论》的用户多数也购买了《机器学习实战》。基于模型的协同过滤算法ModelCF是通过已经观察到的所有用户给产品的打分来推断每个用户的喜好并向用户推荐适合的产品。实际上ModelCF 同时考虑了用户和物品两个方面因此它也可以看作是 UserCF 和 ItemCF 的混合形式。编程要求根据相关知识完成右侧选择题测试说明若选择题答案与正确答案一致则可通关。开始你的任务吧祝你成功有任何问题都可以随时关注私信

相关新闻

重磅推荐欧米到家西安中央空调维修-优质服务及正规操作检修|快速上门深度排查故障原因|权威靠谱受市民好评

重磅推荐欧米到家西安中央空调维修-优质服务及正规操作检修|快速上门深度排查故障原因|权威靠谱受市民好评

2026/8/27 21:08:24

核心导读西安中央空调出现不制冷、制冷效果差、漏水、异响、频繁停机、故障代码或部分房间没有效果时,维修的关键并不是立即加氟或更换配件,而是先判断故障究竟来自冷媒系统、电控系统、风路水路,还是安装与维护问题。欧米到家面向西安家庭、…

重磅推荐欧米到家泉州中央空调维修-优质服务及正规操作检修|快速上门深度排查故障原因|权威靠谱受市民好评

重磅推荐欧米到家泉州中央空调维修-优质服务及正规操作检修|快速上门深度排查故障原因|权威靠谱受市民好评

2026/8/27 21:08:24

核心导读泉州中央空调出现不制冷、制冷效果差、漏水、异响、频繁停机、故障代码或部分房间没有效果时,维修的关键并不是立即加氟或更换配件,而是先判断故障究竟来自冷媒系统、电控系统、风路水路,还是安装与维护问题。欧米到家面向泉州家庭、…

Vite构建安全:识别与清除打包链路中的恶意依赖

Vite构建安全:识别与清除打包链路中的恶意依赖

2026/8/27 21:08:24

第一次在业务项目里执行npm install时,看着终端里滚动几十秒的下载记录,我还没有意识到——这台开发机正通过 npm 把成千上万行第三方代码送进项目。等到 Vite 构建产物里出现某个不应该存在的接口请求,我才真正理解了“打包即投毒”这句话的…

从开源数据集到数据飞轮:智元机器人IPO背后的技术博弈与开发者机会

从开源数据集到数据飞轮:智元机器人IPO背后的技术博弈与开发者机会

2026/8/27 22:18:27

最近技术圈和财经圈难得在同一件事上“吵”了起来:智元机器人传出 IPO 进展的同时,“首席科学家”的动向成了关注焦点。“消失”这个说法确实抓眼球,但如果你去问一位真正在做机器人本体的工程师,他大概率会先纠正你:这…

YOLO红外飞机小目标检测数据集:结构、标签转换与训练实战

YOLO红外飞机小目标检测数据集:结构、标签转换与训练实战

2026/8/27 22:18:27

简介:目标检测是计算机视觉的核心任务之一,而小目标检测因目标像素少、特征弱,一直是工程落地中的难点。红外图像由于对比度低、纹理信息少,进一步加大了检测难度。高质量的红外飞机小目标数据集稀缺,标签格式不统一也…

AI多Agent协作系统实战(五十二):我删了定时器,进程还在偷偷干活

AI多Agent协作系统实战(五十二):我删了定时器,进程还在偷偷干活

2026/8/27 22:18:27

系列第52篇 | 计划任务删了,8小时常驻进程却还在每10分钟"交作业"——双定时源的隐藏重复背景 “定时报告又在重复了,你去查一下。” 用户一句话,我又回到了熟悉的排查现场。我们的AI数字员工系统里,62号Windows机器&am…

数学建模中的替换式密码:从频率分析到可验证推理框架

数学建模中的替换式密码:从频率分析到可验证推理框架

2026/8/27 22:18:27

1. 这不是一道“密码题”,而是一次对数学建模底层思维的实战压力测试2015年认证杯SPSSPRO杯数学建模B题(第一阶段)——“替换式密码全过程文档及程序”,这个标题乍看是讲古典密码破译,但如果你真把它当成一个CTF入门题…

C++ std::list工业级实现与避坑指南

C++ std::list工业级实现与避坑指南

2026/8/27 22:18:27

1. 这不是教科书,是我在工业级C项目里亲手拆过、重写过、压测过list的实战笔记“STL list类的讲解及模拟实现”——看到这个标题,别急着划走。它不是又一篇照着《STL源码剖析》抄来的概念复读机,而是我过去三年在三个真实场景中反复打磨list底…

开题季别乱撞,我把论文AI工具分了四类,毕业之家挺对口

开题季别乱撞,我把论文AI工具分了四类,毕业之家挺对口

2026/8/27 22:08:27

又到了每年最让人头秃的季节——选题定不下来、文献读不进去、开题报告改到第八版导师还在说"逻辑不通",参考文献格式调到怀疑人生。 2026年了,用AI写论文早就不是秘密,但工具选错,努力全白费:有人用ChatGPT…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/27 7:25:23

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/26 17:50:58

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

Go语言构建企业级AI服务网关:统一管理英伟达等AI接口调用

2026/8/27 0:07:12

1. 项目概述:从零构建一个企业级的AI服务网关 最近在帮一个做内容审核的团队做技术架构升级,他们原来的业务里,每天有几十万张图片和短视频需要过审,最初是接了几个开源的AI模型自己部署,但效果和性能一直不太稳定。后…

LeetCode Hot100(51-60)算法精解与面试技巧

LeetCode Hot100(51-60)算法精解与面试技巧

2026/8/27 0:07:12

1. 题目背景与核心价值"hot100(51-60)"这个标题看起来像是某个编程题库或算法练习集中的一组题目编号。在技术社区中,类似命名通常指向LeetCode、牛客网等平台的热门题目集合。作为刷过300题的算法老手,我理解这类题目的核心价值在于&#xff…

CRC校验实战:从模2除法到HJ212协议排错

CRC校验实战:从模2除法到HJ212协议排错

2026/8/27 0:07:12

1. 为什么一个“校验码”能扛住工业现场90%的数据 corruption? 你有没有遇到过这样的场景:嵌入式设备通过RS-485上传温湿度数据,上位机偶尔收到一帧乱码——温度显示成-273℃,湿度跳到999%,但串口波形看起来完全正常&a…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/26 18:07:30

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/26 17:57:52

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…