PSY24002-数据挖掘基础

发布时间:2026.09.04

附件1.北京师范大学本科生课程教学大纲

课程名称:数据挖掘基础

英文名称:Introduction to Data Mining

课程代码】(可选项)

PSY24002

课程性质】(必备项)专业特色课

学分数】(必备项)2

适用专业】(必备项)心理学

授课语言】(必备项) 中文授课

学时数(必备项)

24理论+16实践

开设学期(春季、秋季、小学期)】(必备项)

秋季

【已开设次数】(可选项)

0

【建议最大选课人数】(必备项)

60 (需配备助教)

授课教师姓名】(必备项)

陶富祥

授课教师职称】(必备项)

特聘副研究员

授课教师联系方式Email(必备项):fuxiang.tao@bnu.edu.cn 办公座机(可选项):

【先修课要求】(必备项)算法与程序设计(Python

一、课程简介(必备项)

《数据挖掘基础》是一门面向心理学本科生开设的数据分析与方法入门课程。课程旨在帮助学生了解数据挖掘的基本概念、常见任务和应用场景,理解如何从心理学研究和实际应用中的数据中发现规律、识别模式并进行简单预测。课程内容兼顾基础知识讲授与实践操作,不强调复杂数学推导和算法实现细节,而是注重培养学生的数据思维、问题意识和初步的数据分析能力。

本课程围绕心理学相关数据的获取、整理、分析和解释展开,涵盖从数据预处理、数据探索到模式发现和结果评估的基本流程。课程内容包括以下主题:

  1. 数据挖掘的基本概念、一般流程及其在心理学中的应用场景;
  2. 心理学常见数据类型、数据关系度量、数据清洗与预处理方法;
  3. 经典数据挖掘任务,包括分类、聚类等;
  4. 常用数据挖掘方法的基本思想与简单实践,如决策树、K近邻、逻辑回归和聚类算法等;
  5. 数据挖掘结果的评估、解释及其在心理学研究与应用中的注意事项。

通过本课程学习,学生将能够理解数据挖掘的基本概念和常见方法,掌握心理学数据整理、探索和简单建模的基本流程,并能够在问卷数据、实验数据、行为数据或文本数据等实际材料中开展初步的数据挖掘实践,为后续学习心理统计、心理测量、人工智能心理学应用和数字心理健康等课程奠定基础。

二、课程目标(必备项)(课程目标应包括教学目标和育人目标。坚持知识传授与价值引领相结合,结合专业特点,挖掘课程内在的育人要素,体现课程的育人目标。)

(一)教学目标

  1. 理解数据挖掘的基本概念与流程

使学生了解数据挖掘的基本含义、主要任务和一般流程,理解数据预处理、数据探索、模式发现、模型评估等环节在数据分析中的作用。

  1. 掌握心理学数据的基本处理方法

使学生能够识别心理学研究中常见的数据类型,如问卷数据、实验数据、行为数据和文本数据等,并掌握数据清洗、缺失值处理、变量转换、描述性分析和可视化等基本方法。

  1. 了解常见数据挖掘方法的基本思想

使学生理解分类、聚类、关联规则和异常检测等经典数据挖掘任务的基本思想,初步了解决策树、K近邻、逻辑回归、K-means聚类等简单算法的适用场景。

  1. 培养初步的数据分析与实践能力

通过课堂练习和案例实践,使学生能够使用常见数据分析工具完成简单的数据导入、预处理、建模、结果评估和结果解释,初步具备利用数据挖掘方法分析实际问题的能力。

  1. 培养方法选择与结果解释能力

训练学生根据研究问题、数据类型和分析目的选择合适的数据挖掘方法,并能够对模型结果进行合理解释,理解不同方法的优势、局限及其在心理学应用中的适用边界。

(二)育人目标

  1. 培养数据素养与科学思维

引导学生形成基于数据理解问题、分析问题和解释现象的意识,提升其数据素养、证据意识和科学思维能力。

  1. 强化伦理意识与规范意识

帮助学生认识数据挖掘过程中涉及的隐私保护、数据安全、知情同意、算法偏见和公平性等伦理问题,树立规范、审慎、负责任的数据使用意识。

  1. 提升跨学科理解与应用能力

通过心理学与数据科学方法的结合,培养学生从多学科视角理解心理行为问题的能力,增强其将数据挖掘方法应用于心理学研究和实践场景的意识。

  1. 培养批判性思维

引导学生认识数据挖掘结果并不等同于因果解释,能够审慎看待模型预测、算法结论和数据偏差,形成对技术应用的批判性理解。

  1. 激发创新意识与终身学习能力

鼓励学生关注数据挖掘、人工智能与心理学交叉领域的发展,培养其持续学习新方法、新工具和新应用的兴趣,为后续专业学习和研究实践奠定基础。

  1. 增强社会责任感

引导学生认识数据技术在教育、健康、心理服务和社会治理等领域中的应用价值与潜在影响,培养其以人为本、服务社会的责任意识。

三、教学内容和学时分配(必备项)

(一)第一章:数据挖掘导论 2学时(2课堂讲授学时+0实践学时)

主要内容:(必备项)数据挖掘的基本概念、发展背景与应用领域;数据挖掘与统计分析、机器学习、人工智能之间的关系;数据挖掘的一般流程,包括问题提出、数据收集、数据预处理、模型构建、结果评估和应用解释;数据挖掘在心理学研究与实践中的典型应用等。

教学要求:(必备项)使学生理解数据挖掘的基本含义和主要任务,了解数据挖掘在心理学中的应用价值;能够初步区分描述、预测、分类、聚类和模式发现等不同分析目标;能够认识到数据挖掘是从实际问题出发,围绕数据、方法和解释形成完整分析过程。

课前学习要求:(可选项)回顾心理统计、心理测量或实验心理学课程中接触过的数据类型;思考心理学研究中哪些问题可以通过数据分析和模式发现来解决。

重点、难点:(可选项)理解数据挖掘的基本流程及其在心理学中的应用场景。区分数据挖掘、传统统计分析和机器学习之间的联系与差异。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(二)第二章:心理学数据的类型与结构 2学时(2课堂讲授学时+0实践学时

主要内容:(必备项)心理学研究中常见的数据类型,包括问卷数据、实验数据、行为数据、文本数据和数字化记录数据;变量、样本、特征、标签、观测值等基本概念;分类变量、连续变量、顺序变量、二分类变量等变量类型;数据表的基本结构;特征变量与结果变量的区分;心理学数据中常见的数据组织方式。

教学要求:(必备项)使学生能够识别不同类型的心理学数据,理解数据表中行、列、变量和观测对象的含义;能够区分不同变量类型及其适用的基本分析方法;能够初步判断一个心理学问题中哪些变量可以作为特征变量,哪些变量可以作为结果变量。

课前学习要求:(可选项)复习心理学研究方法中关于变量、自变量、因变量、样本和测量的基本概念;提前了解常见表格数据格式,如Excel文件和CSV文件。

重点、难点:(可选项)掌握心理学数据的基本结构和变量类型。理解同一个心理学变量在不同分析任务中可能具有不同角色。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(三)第三章:数据质量与数据预处理 4 学时(2课堂讲授学时+2实践学时)

主要内容:(必备项)数据质量的基本含义;缺失值、异常值、重复数据、录入错误和变量编码错误等常见问题;数据标准化和归一化的基本思想;数据预处理在后续建模和结果解释中的作用。

教学要求:(必备项)使学生理解数据预处理是数据挖掘的重要基础;能够识别心理学数据中常见的数据质量问题。

课前学习要求:(可选项)复习问卷数据和量表计分的基本知识;回顾均值、标准差等描述统计概念。

重点、难点:(可选项)掌握缺失值处理和标准化等常见操作。理解数据预处理应根据研究目的、变量含义和数据特点进行合理选择。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)上机实践:读取一个简单的心理学数据集,识别变量类型,区分特征变量和结果变量,建立简单的数据说明表;对问卷数据进行缺失值检查、异常值查看和变量标准化处理。

(四)第四章:探索性数据分析与可视化 2学时(2课堂讲授学时+0实践学时)

主要内容:(必备项)探索性数据分析的基本思想;描述统计指标,包括均值、中位数、标准差、频数和比例等;数据分布、变量关系和组间差异的初步观察;常见可视化方法,包括柱状图、直方图、箱线图、散点图、折线图和相关矩阵图;心理学数据可视化中的规范表达与误读风险。

教学要求:(必备项)使学生掌握常见描述统计方法及其适用情境;能够根据变量类型和分析目的选择合适的可视化方式;能够通过图表初步观察数据分布、异常值、变量关系和群体差异;能够对可视化结果进行基本解释。

课前学习要求:(可选项)复习均值、标准差、相关、频数和比例等基础统计概念;提前观察心理学论文或报告中常见的数据图表形式。

重点、难点:(可选项)掌握不同变量类型对应的描述统计和可视化方法。避免对图表结果进行过度解释。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(五)第五章:相似性、距离与特征表示 2 学时(2学时讲授课程+0实践学时)

主要内容:相似性和相异性的基本概念;欧氏距离、曼哈顿距离、余弦相似度和相关系数的基本思想;变量量纲和标准化对距离计算的影响;特征表示的基本含义;心理学数据中个体相似性、行为模式相似性和文本相似性的简单应用。

教学要求:使学生理解相似不同可以通过数据进行度量;了解常见距离和相似性指标的基本含义及适用场景;理解变量选择、变量编码和标准化处理会影响相似性计算结果。

课前学习要求:复习上一章中的标准化和变量类型内容;思考在心理学中如何判断两个个体、两份问卷回答或两段文本是否相似。

重点和难点:理解相似性度量在数据挖掘中的基础作用。理解不同距离或相似性指标并没有绝对优劣,需要根据数据类型和分析目标选择。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(六)第六章:分类与预测入门 4学时(2课堂讲授学时+2实践学时)

主要内容:(必备项)监督学习的基本思想;分类与回归的区别;训练集、测试集、特征变量和标签变量的概念;常见分类方法的基本思想,包括逻辑回归、决策树、K近邻等

教学要求:使学生理解分类与预测任务的基本逻辑;能够区分训练数据和测试数据;了解常见简单分类算法的基本思想和适用场景;能够使用工具完成一个简单分类模型的训练和预测;能够初步解释模型输出结果。

课前学习要求:复习变量类型、数据预处理和相似性度量的相关内容;了解心理学研究中常见的分组变量。

重点和难点:理解分类任务的基本流程,包括确定标签、选择特征、划分数据、训练模型和进行预测。理解模型预测结果并不等于临床诊断或因果解释,尤其在心理健康相关场景中需要谨慎解释。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)上机操作:使用简单心理学数据集进行分类预测,完成数据划分、模型训练和预测输出。

(七)第七章:模型评估与结果解释 2学时(2课堂讲授学时+0实践学时)

主要内容:模型评估的基本意义;准确率、混淆矩阵、精确率、召回率、F1值等常见分类评估指标;过拟合和欠拟合的基本概念;训练集和测试集划分对评估结果的影响;心理学应用中模型结果解释的注意事项;预测准确性、解释性和应用风险之间的关系。

教学要求:使学生理解模型评估是判断模型是否有效的重要环节;能够读懂混淆矩阵和常见分类评价指标;能够比较不同模型的基本表现;能够认识到高准确率并不必然意味着模型具有良好的实际应用价值;能够从心理学意义和伦理风险角度解释模型结果。

课前学习要求:复习第六章分类与预测的基本流程;回顾比例、错误率和分类正确率等基础概念;思考心理学预测任务中误判可能带来的影响。

重点和难点:重点是理解准确率、混淆矩阵、精确率和召回率的含义。难点是结合具体心理学任务解释不同错误类型的影响,例如将高风险个体误判为低风险,与将低风险个体误判为高风险,其实际后果并不相同。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(八)第八章:关联规则与异常检测 2学时(2课堂讲授学时+0实践学时)

主要内容:关联规则分析的基本思想;频繁项集、支持度、置信度和提升度的含义;关联规则在行为共现、症状组合和学习行为模式分析中的应用;异常检测的基本概念;异常值、特殊个案和数据错误之间的区别;基于统计和距离的简单异常检测思路。

教学要求:使学生理解关联规则用于发现变量或行为之间的共现关系;能够解释支持度、置信度和提升度等基本指标;了解异常检测在数据质量控制和特殊样本识别中的作用;能够区分数据错误、极端值和具有研究意义的特殊个案。

课前学习要求:复习分类变量、二分类变量和数据预处理的相关内容;思考心理学数据中哪些行为、症状或选择可能具有共现关系;回顾异常值识别的基本方法。

重点和难点:理解关联规则和异常检测的基本应用场景。正确解释关联规则和异常样本,避免将经常同时出现误解为因果关系,也避免将所有异常值都简单删除。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(九)第九章:聚类分析与心理类型发现 4学时(2课堂讲授学时+2实践学时)

主要内容:无监督学习的基本思想;聚类分析的定义和应用场景;K-means聚类和层次聚类的基本思想;聚类数量选择的初步方法;聚类结果的解释;聚类在心理画像、人格类型、学习行为模式和生活方式分类中的应用。

教学要求:使学生理解聚类分析与分类预测的区别;了解聚类分析如何从数据中发现潜在群体结构;能够解释K-means和层次聚类的基本思想;能够根据聚类结果描述不同群体的特征;能够认识到聚类结果具有探索性,不能简单等同于稳定的人格类型或临床类别。

课前学习要求:复习相似性、距离和标准化的相关内容;思考心理学研究中类型”“群体”“画像等概念与数据聚类之间的关系。

重点和难点:理解聚类分析的基本逻辑和结果解释方法。避免将聚类结果过度实体化,即不能因为算法分出了若干类,就认为现实中一定存在清晰、固定的人群类型。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)上机操作:使用数据进行简单聚类,比较不同类别个体的变量特征,并撰写聚类结果解释。

(十)第十章:文本数据挖掘入门 4学时(2课堂讲授学时+2实践学时)

主要内容:文本数据的特点及其在心理学中的应用;开放式问卷、访谈文本、社交媒体文本和咨询文本的基本分析思路;文本预处理的基本步骤,包括分词、去停用词和词频统计;关键词提取、词云、情绪词典和简单文本分类的基本思想;文本分析结果的解释边界。

教学要求:使学生了解文本数据如何转化为可以分析的数据;掌握词频统计、关键词提取和情绪词典分析的基本思路;能够对开放式文本材料进行简单的数据化处理;能够结合心理学问题解释文本分析结果。

课前学习要求:提前阅读若干开放式问卷回答或短文本材料;思考语言表达如何反映情绪、态度、认知和心理状态;了解分词、关键词和词频的基本含义。

重点和难点:理解文本数据从非结构化材料转化为结构化特征的过程。文本结果的解释不能脱离语境,不能仅凭词频或情绪词典结果对个体心理状态作出确定性判断。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)上机操作:对开放式问卷回答或短文本材料进行词频统计、关键词提取或情绪词典分析,并根据结果撰写简短解释。

(十一)第十一章:数据伦理、隐私保护与算法公平 2学时(2课堂讲授学时+0实践学时)

主要内容:心理学数据的敏感性;数据收集、存储、分析和共享中的伦理问题;知情同意、隐私保护、数据匿名化和数据安全;算法偏见、算法公平和群体差异问题;心理健康预测、教育评估和行为画像中的伦理风险;负责任的数据挖掘原则。

教学要求:使学生认识到数据挖掘不仅是技术问题,也涉及伦理和社会责任;理解心理学数据在隐私和安全方面的特殊要求;能够识别数据挖掘应用中可能出现的偏见、误判、标签化和不公平问题;形成审慎、规范、负责任地使用数据和算法的意识。

课前学习要求:阅读或了解一个与个人数据、算法推荐、心理健康预测或教育数据分析相关的伦理案例;思考数据分析可能给个体和群体带来的积极作用与潜在风险。

重点和难点:理解心理学数据挖掘中的隐私保护、知情同意和算法公平问题。平衡技术应用价值与个体权益保护之间的关系,避免把模型结果当作绝对客观和中立的判断。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)无

(十二)第十二章:心理学数据挖掘综合应用:数字行为与心理健康风险识别 10学时(2课堂讲授学时+8实践学时)

主要内容:心理学数据挖掘在心理健康、教育评估、用户行为分析和数字心理服务中的综合应用;数字行为数据的基本概念,包括问卷数据、行为记录、学习平台数据、社交媒体文本、可穿戴设备数据等;心理健康风险识别的基本流程,包括问题定义、数据采集、特征提取、模型构建、模型评估和结果解释;分类、聚类、异常检测和文本挖掘方法在心理学综合案例中的应用;模型结果在心理学解释、个体差异理解和服务决策中的作用与局限。

教学要求:使学生能够理解数据挖掘方法如何应用于真实心理学问题;能够从综合案例中识别数据来源、分析目标、变量特征和适用方法;能够理解心理健康风险识别、学习行为分析和心理画像等应用场景中的基本技术流程;能够结合心理学理论对数据挖掘结果进行谨慎解释;能够认识到数据模型只能提供辅助信息,不能替代专业判断、临床诊断或个体化心理服务。

课前学习要求:回顾前面章节中关于数据预处理、探索性分析、分类预测、聚类分析、异常检测、文本挖掘和模型评估的基本内容;思考心理学研究或心理服务中哪些数据可以用于理解个体心理状态、行为模式或风险变化。

重点和难点:理解如何围绕一个真实心理学问题组织完整的数据挖掘流程,并能够将不同方法放入同一个应用场景中进行理解。

其它教学环节:(如实验、习题课、讨论课、其它实践活动)课下实践作业:结合前面所学内容,分析一个心理健康风险识别、学习行为预测或数字心理服务案例,说明其中使用了哪些数据、采用了哪些方法、结果可以如何解释,以及可能存在的伦理风险。

四、选用教材与学习资源(必备项)

周志华著. 机器学习. 清华大学出版社

《数据挖掘原理与应用》作者: 丁兆云 周鋆 杜振国,ISBN: 9787111696308,出版社: 机械工业出版社,出版时间: 2021-12

《数据挖掘:原理与实践(基础篇)》作者: Charu C. Aggarwal,译者:王晓阳、王建勇、禹晓辉、陈世敏,ISBN: 9787111670292,出版社:机械工业出版社,出版时间:2020-12

五、教学策略与方法建议(可选项)

结合实战案例讲解原理

六、考核方式(必备项)(备注:考核分为考试和考查两种,根据学校《课程考核管理办法(试行)》(师校发〔2021〕46号)的要求,列入培养方案的理论课程,其中必修课程的期末考核应采用闭卷考试形式)

考查

七、其他

编写日期202672

1