Skip to content

下面这份笔记严格以你上传的 Chapter 1《Introduction》为主,不把后续章节的算法细节偷偷提前塞进来。这个 Chapter 本身几乎没有正式数学推导,因此我会区分:

  • 【课件原文】:课件明确给出的定义、流程、概念与例子;
  • 【形式化补充】:为了帮助期末理解而补充的数学表达,但它们不是课件这一章明确要求的公式。
    这样可以避免复习时把“我的扩展解释”和“老师 PPT 原文”混在一起。

重要程度我统一标为:

  • ★★★:核心概念,强烈建议做到能定义、比较、解释;
  • ★★☆:重要应用/分类,适合选择题、简答题;
  • ★☆☆:背景、例子、扩展,知道即可。

Chapter 1 — Introduction

0. 本章到底在讲什么?——先建立整章“进化树”

这一章并不是在教某一个具体算法,而是在回答一个更基础的问题:

面对巨大、复杂、异构的数据,我们怎样从“原始数据”一步步得到“有意义、可信、可使用的知识”?

整章可以压缩成下面这一条主线:

text
现实世界不断产生海量数据

Raw Data 本身 ≠ Knowledge

需要 Data Mining
发现 patterns / models / knowledge

但现实数据很脏、异构、结构复杂

Data Mining 不能孤立进行
必须嵌入 KDD

Cleaning → Integration → Transformation → Selection

Data Mining

Pattern / Model Evaluation

Knowledge Presentation

真正可使用的 Knowledge

随后问题进一步扩展:

text
数据不只有表格

├─ Structured
├─ Semi-structured
├─ Unstructured
├─ Sequence / Time-series
├─ Spatial / Temporal / Spatiotemporal
├─ Graph / Network
└─ Stored / Streaming

不同数据结构 + 不同问题

需要不同 mining functionalities

├─ Summarization
├─ Frequent patterns / association / correlation
├─ Classification / regression
├─ Clustering
├─ Deep learning
├─ Outlier analysis
├─ Sequential / trend / evolution analysis
└─ Graph / network / Web mining

发现了 pattern 还不够

Is it interesting / valid / representative?

Knowledge Evaluation

同时考虑 scalability / complexity / privacy

形成 Data Mining 这一多学科交叉领域

所以本章最重要的思想不是背若干名词,而是:

Data Mining = 在复杂数据中发现知识,但完整目标不是“发现尽可能多的 pattern”,而是通过 KDD 流程得到 valid、novel、useful、interesting 的知识。


1. What Is Data Mining? ★★★

1.1 核心定义

课件第 2 页:

Data mining is the process of discovering interesting patterns, models and other kinds of knowledge in large data sets.

中文可以准确理解为:

数据挖掘是在大规模数据集中发现有趣的模式(patterns)、模型(models)和其他知识(knowledge)的过程。

核心关键词不要漏:

  1. large data sets
  2. discover
  3. patterns / models
  4. knowledge
  5. interesting

其中第五个词特别重要。

因为:

finding a pattern ≠ finding useful knowledge.

后面第 22 页专门回来解决这个问题。


1.2 为什么“Data Mining”这个名字其实不够准确? ★★☆

课件说:

“Data mining”: a misnomer?
It should be “knowledge mining from data”.

类比:

  • 从矿石里 mining 的目标不是得到“矿石”;
  • 而是得到黄金;
  • 从 data 里 mining 的目标也不是得到更多 data;
  • 而是得到 knowledge。

因此:

这里是我对课件逻辑的形式化,并非 PPT 原始公式。


1.3 同义或近义术语 ★★☆

课件列出了:

  • Knowledge mining from data
  • KDD — Knowledge Discovery from Data
  • Pattern discovery
  • Knowledge extraction
  • Data analytics
  • Information harvesting

注意:

严格来说,Data Mining 与 KDD 不完全等价。

后面会看到:

Data Mining 是 KDD 中的核心步骤之一,而不是完整 KDD。

这个区别很容易考概念题。


2. 从 Data 到 Pattern:什么叫“模式”? ★★☆

第 3 页主要通过图片说明 pattern。

图片包括:

  • 视觉图案;
  • 色盲图中的隐藏数字;
  • scatter plot 中的线性趋势;
  • 多变量数据中的变量关系。

统一思想是:

大量 individual observations 看起来可能杂乱,但整体上存在某些规律性的 structure。

例如散点数据:

可能存在近似关系:

这就是一种 pattern。

但是这里必须注意:

Chapter 1 并没有正式教授 linear regression。

因此不要把回归公式当成本章算法考点;这里仅用于理解 pattern 的概念。


3. Data Mining 与 AI 的区别 ★★★

这是本章非常容易出简答/比较题的一部分,对应第 4–5 页。

最核心的一句话是:

第 27 页 Summary 也再次强调这一点。


3.1 Goal:目标不同

Artificial Intelligence

目标:

Build systems that perceive, reason, learn, plan, and act to achieve objectives.

即 AI 更关心:

最终是:

让一个系统在环境中完成目标。

Data Mining

目标:

Discover valid, novel, and useful patterns from data within the KDD process.

即:


4. AI vs. Data Mining:完整对比 ★★★

维度AIData Mining
核心对象System / AgentData
Problem framingOptimize behavior to meet objectivesAsk descriptive / predictive questions about data
Goalperceive, reason, learn, plan, actdiscover valid, novel, useful patterns
Data dependency可包含 perception / interaction data常处理记录型数据;也可为 stream、graph、sequence 等
Evaluationtask success / utility in context取决于任务:预测任务重视 held-out generalization,描述性任务还看 coverage、novelty、稳定性和领域效用
Workflowdeployment + monitoring + feedbackcleaning + exploration + discovery + reporting
Typical riskssafety, alignment, distribution shiftspurious correlation, data leakage
Outputdecisions, actions, predictions, interactive behaviorpatterns, rules, segments, predictive models

4.1 为什么 AI 范围更广? ★★☆

AI 包括:

  • machine learning
  • knowledge representation
  • reasoning
  • planning
  • vision
  • NLP
  • reinforcement learning
  • LLMs
  • probabilistic reasoning

而 Data Mining 更集中在:

  • clustering
  • association rules
  • anomaly detection
  • feature selection
  • predictive classical ML
  • pattern discovery

因此不要简单写:

Data Mining = AI

也不要写:

AI = Data Mining。

两者有大量重叠,但研究目标和 framing 不一样。


4.2 Healthcare 例子 ★★☆

课件的例子非常适合帮助区分两者。

Data Mining

Mining EHRs:

找 comorbidity clusters 和 myocardial infarction risk factors。

本质:

AI

AI agent:

  1. summarize a chart;
  2. decide next test;
  3. order the test;
  4. explain why。

即:

这就是“data-centered”与“system-centered”的本质区别。


5. Data Mining 是 KDD 中的一个步骤 ★★★

这是整章最核心的架构之一,对应第 6 页。

5.1 完整 KDD Pipeline

课件的流程是:

text
Data Sources

Data Cleaning

Data Integration

Data Warehouse(可选的数据管理层)

Data Transformation / Selection

Data Mining

Pattern / Model Evaluation

Knowledge Presentation

Knowledge

这张图列的是常见的数据准备组件,不是所有项目都必须经过、也不是唯一固定顺序的 pipeline;例如 data warehouse 是常见实现设施,而非 KDD 的必经步骤。cleaning、integration、selection、transformation 也会依数据和任务反复迭代。

简化写成:

其中:

  • :raw data;
  • :cleaned data;
  • :integrated data;
  • :transformed data;
  • :selected target data;
  • :mined patterns/models;
  • :经过 evaluation 的 patterns;
  • :presented/interpretable knowledge。

这是形式化补充,不是 PPT 原公式。


6. KDD 各步骤详解 ★★★

6.1 Data Cleaning

解决:

  • missing values
  • errors
  • inconsistencies
  • noise

核心:

Garbage in, garbage out.

如果输入数据存在系统性错误:

其中 很大,那么后面的 mining 很可能发现:

error pattern,而不是 real-world pattern。


6.2 Data Integration

问题:

现实数据往往来自多个 source。

例如:

text
Database A
Database B
Sensor C
External file D

 Integration

 unified representation

困难可能包括:

  • schema 不一致;
  • unit 不一致;
  • ID 不一致;
  • duplicate records;
  • semantic conflicts。

6.3 Data Transformation

目的:

将数据转换成更适合 mining 的形式。

例如概念上可能有:

  • normalization
  • aggregation
  • encoding
  • feature construction

但这一页没有进一步展开具体方法。


6.4 Data Selection

不是所有数据都应该进入算法。

设完整数据库为:

根据分析任务选择:

上执行 mining。

核心问题:

Which subset of the available data is relevant to the problem?


6.5 Data Mining

现在才真正执行:

  • pattern discovery;
  • model learning;
  • clustering;
  • classification;
  • associations 等。

所以:


6.6 Pattern / Model Evaluation

问题:

算法找出来的 pattern 一定有意义吗?

答案:

可能:

  • 偶然;
  • 不具有代表性;
  • 只在某时间成立;
  • 只在某区域成立;
  • statistical artifact;
  • irrelevant。

因此需要进一步筛选。


6.7 Knowledge Presentation

即使 pattern statistically valid,如果人无法理解,也未必成为真正可使用的 knowledge。

所以还需要:

  • visualization;
  • reporting;
  • summarization;
  • interpretation。

最终:


7. KDD 为什么是一种“方法论升级”? ★★★

这里可以按照你要求的 Why it fails → How it fixes 理解。

Stage A:直接在 raw data 上跑算法

问题:

Why it fails?

因为:

  • dirty;
  • inconsistent;
  • heterogeneous;
  • irrelevant variables;
  • noisy;
  • duplicate。

Stage B:加入 Data Preparation

解决:


Stage C:只输出所有 patterns

问题:

即使 mining 成功:

用户仍然不知道哪些值得关注。

Stage D:Pattern Evaluation

加入:

  • coverage;
  • accuracy;
  • novelty;
  • typicality;
  • representativeness。

Stage E:只得到数学 pattern

问题:

结果可能无法被人理解和行动。

Stage F:Knowledge Presentation

最终成为:

这实际上就是整个 KDD 出现的根本逻辑。


8. Diversity of Data Types I:结构层面的分类 ★★★

对应第 7–10 页。

最基本分类:

text
Data
├── Structured
├── Semi-structured
└── Unstructured

但现实世界:

往往是混合存在的。


9. Structured Data ★★★

定义:

uniform, record- or table-like structures

特点:

  1. fixed set of attributes;
  2. value range 基本预定义;
  3. semantic meaning 明确;
  4. data dictionary 可明确描述。

形式上可以表示成:

其中:

  • :records 数;
  • :attributes/features 数;
  • :第 个 object 的第 个属性,且一般

若所有属性都已经数值化,才可进一步写成 ;医疗表中 M/F、Yes/No 一类字段说明,这不是 structured data 的一般前提。

课件例子:

  • relational database;
  • data cube;
  • data matrix;
  • data warehouse。

第 8 页医疗表格:

text
patient_id | age | sex | BMI | smoker

就是典型 structured tabular data。


10. Semi-Structured Data ★★★

这是特别容易混淆的一类。

课件定义:

Semi-structured data 可以:

  • contain set-valued attributes;
  • contain heterogeneous typed values;
  • contain nested structures;
  • allow objects/subobjects 的结构 dynamically defined。

所以它不是:

completely structureless。

而是:

有结构,但是结构不像关系表一样固定。


10.1 Transactional Data

第 8 页例子:

json
{
  "transaction_id": "...",
  "patient_id": "...",
  "items": [
      {...},
      {...}
  ],
  "payment": {...}
}

存在明确:

  • key;
  • hierarchy;
  • nested object;
  • array。

但是不同 transaction 的内部结构可以更灵活。

所以是:


10.2 Sequence Data

例如:

text
Arrival-ED

ECG

Lab-Troponin

顺序本身携带信息。

数学上可以抽象为:

其中:

  • :sequence;
  • :第 个 event;
  • :sequence length。

关键:

因为 order 有意义。


11. Graph / Network Data ★★★

课件称其:

A more sophisticated type of semi-structured data set.

数学上:

其中:

  • :vertices / nodes;
  • :edges / relationships。

例如医疗图:

text
Patient → seen_by → Doctor
Doctor → ordered → Department

这里真正重要的信息不只是 node attributes,还包括:

这也解释了后面为什么需要 graph mining / link mining。


12. Unstructured Data ★★★

课件典型例子:

  • text
  • audio
  • image
  • video

例如:

Chief complaint: chest tightness for 2 hours...

虽然人可以读懂文本,但它没有像 relational table 一样直接定义:

text
attribute_1
attribute_2
attribute_3

因此属于 unstructured data。


13. 第 10 页的陷阱:医学 X-ray 到底 structured 还是 unstructured? ★★☆

课件提出:

Semi-Structured or Unstructured Data?

这个问题的重点实际上是:

数据类型不是只看“长什么样”,还取决于数据表示。

原始 X-ray image

主要是 pixel matrix + visual content:

在 data mining taxonomy 中通常视为:

如果 X-ray 带有 structured annotation

例如:

  • clavicle contour;
  • heart boundary;
  • diaphragm boundary;
  • organ labels。

那么整个 sample 可能变成:

text
image
+
regions
+
labels
+
coordinates
+
relations

整体系统具有明显 semi-structured characteristics。

因此你考试时最好的回答不是:

image 永远是 unstructured。

而是:

Raw image content is unstructured, but annotated image data may combine unstructured image content with structured or semi-structured metadata.


14. Diversity of Data Types II:应用语义也决定 mining 方法 ★★★

第 11 页非常关键:

Different applications → different datasets → different analysis methods.

即使形式一样,也不代表方法一样。


14.1 Sequence ≠ Time Series ★★★

Sequence

一般形式:

其中 可以是:

  • item;
  • symbol;
  • biological residue;
  • transaction;
  • event。

时间间隔不一定固定。


Time Series

课件定义:

ordered set of numerical values with equal time interval

数学上:

且:

为固定时间间隔。

因此:

这是高概率概念题。


15. Spatial / Temporal / Spatiotemporal Data ★★☆

分别强调:

  • spatial:location;
  • temporal:time;
  • spatiotemporal:space + time。

可以形式化为:

其中:

  • :spatial coordinate;
  • :time。

这种数据与普通 i.i.d. tabular data 不同,因为:

与附近:

可能具有明显 dependency。


16. 同样是 Graph,语义可能完全不同 ★★☆

课件列举:

  • social networks
  • computer communication networks
  • biological networks
  • information networks

共同结构都是:

但:

完全不同。

例如 edge 可以表示:

  • friendship;
  • communication;
  • protein interaction;
  • hyperlink;
  • citation。

所以:

Data structure alone does not determine the mining task. Domain semantics matters.


17. 同一数据,不同问题也需要不同 mining 方法 ★★★

第 11 页:

software program 数据可以用于:

Problem A

find plagiarized modules

Problem B

find copy-and-paste bugs

输入数据可能一样:

但 query 不一样:

因此:

其中 表示选择的 mining method。

这是一个非常重要的方法论:

算法不是由 data alone 决定,而是由 data + question 决定。


18. Stored Data vs Streaming Data ★★★

Stored Data

课件:

Finite, stored in large repositories.

形式上:

可以:

  • 重复扫描;
  • offline processing;
  • 多轮迭代。

Streaming Data

例子:

  • video surveillance;
  • remote sensing。

特点:

  1. dynamic;
  2. continuously arriving;
  3. potentially infinite;
  4. require real-time response。

形式:

且理论上:

问题变成:

因此 traditional stored-data mining 不一定适用。


19. Mining Various Kinds of Knowledge:总图 ★★★

第 12 页列出:

  1. Multidimensional Data Summarization
  2. Frequent Patterns / Associations / Correlations
  3. Classification / Regression
  4. Cluster Analysis
  5. Deep Learning
  6. Outlier Analysis
  7. Evaluation of mining results

随后还包括:

  1. Sequential / trend / evolution analysis
  2. Graph / network analysis
  3. Web mining

这不是简单的“算法清单”,而是在回答:

What kind of knowledge do we want?


20. 方法论的“进化树”:为什么会有这些不同任务? ★★★

这一章没有说:

Algorithm A 被 Algorithm B 淘汰。

更准确的演化逻辑是:

text
首先:我只想知道“数据总体长什么样”

Summarization

但总体平均不能告诉我“哪些东西经常一起发生”

Frequent Pattern / Association

但关联仍然只是描述过去

Classification / Regression
预测未知结果

但很多数据根本没有标签

Clustering

但 classical representations 难处理复杂图像/文本/序列

Deep Learning

但 majority pattern 会忽视少数异常

Outlier Analysis

但现实事件具有 time/order

Sequential / Trend / Stream Mining

但现实对象之间还有 explicit relations

Graph / Network / Web Mining

但方法能找出海量“pattern”

Knowledge Evaluation

这就是本章真正意义上的“方法演进”。


21. Multidimensional Data Summarization ★★★

第 13 页。

核心任务:

Generalize, summarize, and contrast data characteristics.

例如:

dry regions vs. wet regions。


21.1 Information Integration + Data Warehouse

先:

  • clean;
  • transform;
  • integrate;

再建立:

multidimensional data model。


22. Data Cube ★★☆

概念上:

若数据包含 dimensions:

例如:

  • location;
  • time;
  • product;
  • customer。

则 measure 可以写成:

例如:

Data Cube 就是允许从不同 dimension / aggregation level 分析这些 measure。


23. Materialization ★★☆

课件:

scalable methods for computing (materializing) multidimensional aggregates.

所谓 materialization:

将某些 aggregation 结果预先计算并保存。

例如:

Why?

因为大规模数据中每次重新 aggregate:

预计算:

代价则通常是:

本章没有进一步分析 trade-off。


24. OLAP ★★★

OLAP:

Online Analytical Processing.

核心思想:

在 multidimensional data 上进行交互式聚合分析。

记住:

共同服务于:

multidimensional summarization。


25. Characterization vs Discrimination ★★★

Multidimensional concept description 包含两类。

Characterization

回答:

What are the characteristics of target class ?

例如:

wet regions 的一般特征是什么?

Discrimination

回答:

What distinguishes from ?

例如:

一句话:

  • characterization = summarize one class;
  • discrimination = contrast classes。

26. Frequent Pattern Mining ★★★

第 14 页。

问题:

What items are frequently purchased together?

例如 transaction:

其中:

  • :all possible items;
  • :第 个 basket。

某个 itemset:

如果 在很多 transaction 中共同出现,就叫:

frequent itemset。


26.1 Association Rule

课件例子:

意思不是:

diaper causes beer.

而是:

diaper 与 beer 在交易数据中存在某种统计 association。

因果关系和关联关系必须区分。


26.2 Support / Confidence:重要说明

本 PPT 第 14 页并没有给出 support / confidence 的公式。

如果你的老师在后续 Chapter 教 association mining,它们通常会正式定义;因此这里不要把下面内容当 Chapter 1 原公式。

形式化补充:

对于:

support:

confidence:

但是:


27. Correlation Analysis ★★★

第 14 页三个 scatter plots:

  • :几乎无线性相关;
  • :中等负相关;
  • :强正相关。

核心理解:

一般解释:

课件没有给 Pearson correlation 的完整公式,因此下面作为补充:

其中:

  • :第 个 sample 的两个变量;
  • :sample means;
  • numerator:共同偏离均值的程度;
  • denominator:进行 scale normalization。

因此 衡量的是:

standardized linear co-variation。


28. Association ≠ Correlation ≠ Causation ★★★

极其重要。

Diaper → Beer 只是 pattern,不代表:

买 diaper 导致购买 beer。

这与第 4 页提到的 data mining risk:

spurious correlations

直接呼应。


29. Classification and Regression for Predictive Analysis ★★★

第 15 页。

这一部分从:

describe existing data

进入:

predict unknown target。


30. Classification ★★★

有 training examples:

其中:

  • :features;
  • :known class label。

学习:

对新 sample:

预测:

其中:

  • :predicted class label。

这是形式化补充,但准确对应课件:

Construct models based on training examples and predict unknown class labels.


31. Classification 为什么是 supervised learning? ★★★

因为 training data 中:

已知。

即:

而不是只知道

它要学习:


32. 分类方法 ★★☆

课件列出:

  • Decision Trees
  • Naïve Bayesian Classification
  • SVM
  • Neural Networks
  • Rule-based Classification
  • Pattern-based Classification
  • Logistic Regression

注意:

这一章只要求认识它们属于:

没有在 Chapter 1 展开算法公式。


33. Classification Applications ★★☆

课件:

  • credit card fraud detection;
  • direct marketing;
  • classifying stars;
  • disease classification;
  • web-page classification。

共同形式:

其中 是 discrete class。


34. Regression ★★★

虽然 slide 标题包含 Regression,但正文重点主要讲 classification。

概念上:

classification:

regression:

即:

TaskTarget
Classificationcategorical
Regressioncontinuous numerical

例如:

  • “是否 fraud?” → classification;
  • “未来 sales = 多少?” → regression。

35. Cluster Analysis ★★★

第 16 页。

核心:

Unsupervised learning — class labels are unknown.

数据只有:

没有:

目标:

从数据自身结构中形成新的 categories / clusters。


36. Clustering Principle ★★★

课件原文:

Maximizing intra-class similarity & minimizing interclass similarity.

更自然地写:

以及:

换成 distance 语言:


36.1 一个形式化目标

课件没有给 K-means 公式,但最经典的数学形式可以辅助理解:

其中:

  • :cluster 数;
  • :第 个 cluster;
  • :sample;
  • :cluster centroid;
  • :within-cluster squared distance。

直觉:

每一个 sample 离自己 cluster center 尽可能近。

再次强调:这是形式化补充,不是本页 PPT 明确公式。


37. Classification vs Clustering ★★★

这是必会比较。

ClassificationClustering
LearningSupervisedUnsupervised
LabelsKnown in trainingUnknown
GoalPredict existing classDiscover new groups
Outputclass label/modelclusters
Core question“Which known class?”“What natural groups exist?”

一句话:


38. Deep Learning ★★☆

第 17 页。

定义定位:

A fast expanding dynamic frontier in machine learning.

课件列出的 architecture:

  1. Feed-forward neural networks
  2. CNN
  3. RNN
  4. GNN
  5. Transformer

重要的是:

Deep Learning 在这一章不是一个“与 classification 平级且互斥的任务”。

而是一类:

可以用于多个 mining tasks。


39. 为什么说 Deep Learning “reshapes” Data Mining? ★★☆

课件说 deep learning 已经影响:

  • classification;
  • clustering;
  • outlier detection;
  • reinforcement learning。

所以结构关系更像:

text
Mining Task

   ├─ Classification
   │      └─ may use DL
   ├─ Clustering
   │      └─ may use DL
   └─ Outlier Detection
          └─ may use DL

而不是:

text
Classification vs Clustering vs Deep Learning

完全互斥。

这个概念层次值得记住。


40. 不同 Neural Architecture 对应不同 data structure ★★☆

虽然后续课件才会深入,这一页隐含着:

ArchitectureTypical data inductive structure
Feed-forward NNfixed-dimensional vectors
CNNspatial/local structure
RNNsequential data
GNNgraph/network data
Transformersequence/global interaction

因此它与前面“Diversity of Data Types”形成逻辑闭环:


41. Outlier Analysis ★★★

第 18 页。

定义:

An outlier is a data object that does not comply with the general behavior of the data.

可以理解为:

即该点与整体正常分布显著不同。


42. Outlier ≠ Noise ★★★

课件一句非常重要:

Noise or Exception?
One person's garbage could be another person's treasure.

举例:

Sensor error

异常值可能是:

应该 remove。

Fraud transaction

异常值可能正是:

因此:

这是非常值得考的概念。


43. Outlier 从哪里来? ★★☆

课件说可以成为:

by-product of clustering or regression analysis.

Clustering

离所有 cluster 都远的 point:

可能是 outlier。

Regression

如果:

其中 residual:

异常大,则可能:

为 outlier candidate。


44. Outlier Applications ★★★

课件:

  • fraud detection;
  • rare events analysis。

这里最核心的思想:

对于很多业务,真正最有价值的不是 majority,而是 rare deviation。


45. Time and Ordering:为什么普通 item mining 不够? ★★★

第 19 页。

普通 frequent itemset 关心:

但不关心:

还是:

现实很多问题:

order matters。

因此发展出:

  • sequential pattern mining;
  • trend analysis;
  • time-series analysis;
  • periodicity;
  • motif analysis;
  • data-stream mining。

46. Trend / Time-Series / Deviation Analysis ★★★

主要目标:

研究数据怎样随时间变化。

例如:

其中:

  • :underlying trend;
  • :deviation/noise。

课件举:

  • regression;
  • value prediction。

47. Sequential Pattern Mining ★★★

例子:

buy digital camera → then buy large memory cards.

可以表示:

不是:

因为:


48. Periodicity Analysis ★★☆

寻找规律性重复:

其中 是 period。

例如:

  • daily;
  • weekly;
  • yearly cycles。

49. Motif Analysis ★★☆

Motif:

recurring subsequence / structure.

课件特别提到:

  • biological sequences;
  • approximate motifs;
  • consecutive motifs。

重点:

现实 sequence 不一定 exact match,因此还需要 approximate matching。


50. Similarity-Based Analysis ★★☆

不要求 pattern 完全相同,而是寻找:

足够高的 objects / subsequences。

关键问题变成:

How do we define similarity?

后续具体章节通常才会定义 distance/similarity measures。


51. Mining Data Streams ★★★

课件定义:

Ordered, time-varying, potentially infinite data streams.

三个关键:

因此:

不能简单假设“把整个 dataset 先放到内存里”。

这是 streaming mining 的根本挑战。


52. Structure and Network Analysis ★★★

第 20–21 页。

为什么 tabular mining 不够?

因为很多问题中:

例如:

只看 node attributes:

会丢掉:

中的结构信息。

于是有:

  • Graph mining
  • Information network analysis
  • Link mining
  • Web mining

53. Graph Mining ★★★

核心任务:

Find frequent subgraphs / trees / substructures.

例如:

  • chemical compounds;
  • XML trees;
  • Web fragments。

设数据库:

目标可能是找到:

使得:

对于很多 都成立。

即:

frequent subgraph。


54. Frequent Subgraph Mining ★★☆

第 21 页用 chemical structure → graph 来说明:

原始 molecule:

text
atoms + bonds

转成:

text
nodes + edges

即:

从大量 molecular graphs 中发现频繁结构:

可能代表某种重要 structural motif。


55. Information Network Analysis ★★★

Social network:

  • actors = nodes;
  • relationships = edges。

即:

其中:

可能是:

  • people;
  • authors;
  • organizations。

而:

可能表示:

  • friendship;
  • collaboration;
  • communication。

56. Heterogeneous Networks ★★★

课件说:

A person could be in multiple information networks: friends, family, classmates...

因此现实 network 可能包含:

  • multiple node types;
  • multiple edge types。

形式化可以写:

其中:

  • :node type;
  • :edge type。

这是形式化补充。

核心:


57. Link Mining ★★★

课件:

Links carry a lot of semantic information.

也就是说:

不仅:

是 data。

传统 tabular modeling 往往只表达 object 的 feature,而 network mining 特别关注:

以及:


58. Web Mining ★★★

课件:

Web is a big information network: from PageRank to Google.

Web:

  • pages = nodes;
  • hyperlinks = edges。

因此:

常见任务:

  • Web community discovery;
  • opinion mining;
  • usage mining。

59. Knowledge Evaluation:为什么“发现很多 pattern”不是成功? ★★★

第 22 页是整章哲学上最重要的一页之一。

问题:

Are all mined knowledge interesting?

答案显然:

因为算法可以发现:

其中 可能巨大。

但真正 useful:

甚至:


60. Pattern 为什么可能“不 interesting”? ★★★

课件列出:

1. Only valid in certain dimensions

例如只在:

  • particular time;
  • particular location。

即:

可能很高,

但:

整体上不高。


2. Not representative

可能只是很小 sample subset 的偶然 pattern。


3. Transient

可能今天成立,之后失效:


61. Interestingness Criteria ★★★

课件列出:

  • descriptive vs. predictive;
  • coverage;
  • typicality vs. novelty;
  • accuracy。

61.1 Descriptive vs Predictive

Descriptive

回答:

What is happening / what structure exists?

例如:

  • clusters;
  • associations;
  • summaries。

Predictive

回答:

What will the unknown value/class be?

例如:

  • classification;
  • regression。

61.2 Coverage

pattern 覆盖多少数据?

形式化补充:

如果只覆盖:

的数据,需要思考它究竟:

  • 是珍贵 rare pattern;
  • 还是偶然 noise。

61.3 Typicality vs Novelty ★★★

这是很重要的 tension。

Typical

pattern:

能很好代表大多数数据。

Novel

pattern:

令人意外、之前未知。

它们不一定一致。

例如:

coverage 很高,但 novelty 很低。

而某个非常 unusual pattern:

却可能:

所以 interestingness 常是多目标:

这是形式化补充。


61.4 Accuracy

对于 predictive model:

需要好。

但本章同时强调:

还需要:

  • relevance;
  • representativeness;
  • coverage;
  • novelty。

62. “直接 mine interesting knowledge” 是一个更高级目标 ★★★

简单方案:

text
Mine everything

Evaluate everything

Keep interesting patterns

问题:

evaluation 本身会非常昂贵。

于是更理想的是:

text
Interestingness constraints

Mining algorithm

Interesting patterns directly

即:

第 22 页用问号提出了这个思想。


63. Data Mining 是多学科交汇 ★★★

第 23 页。

中心:

周围包括:

  • Machine Learning
  • Statistics
  • Pattern Recognition
  • Visualization & HCI
  • Algorithms
  • High-Performance Computing
  • Applications
  • Social Sciences
  • Database Technology
  • NLP

64. 各领域分别贡献什么? ★★★

Discipline对 Data Mining 的贡献
Database Technologystorage, query, indexing, data management
Statisticsinference, uncertainty, validity
Machine Learningpredictive/model learning
Pattern Recognitionpattern/object recognition
Algorithmsefficient computational procedures
HPCscalable computation
Visualization/HCIknowledge presentation and interaction
NLPtext mining
Social Scienceshuman/social interpretation
Applicationsdomain semantics and requirements

最重要:

Data Mining 不是“Machine Learning 的另一个名字”。

因为真实 mining 还涉及:


65. 为什么必须多学科融合? ★★★

第 24 页给了三个根本原因。

Reason 1:Tremendous Amount of Data

导致:

所以算法必须:

如果一个算法复杂度是:

当:

往往不可接受。

虽然 PPT 没给 Big-O 公式,但 “scalable” 的本质就是:

data size increase 时,计算资源需求不能爆炸式失控。


66. High Dimensionality ★★★

课件例:

Micro-array may have tens of thousands of dimensions.

设:

当:

甚至:

会产生:

  • computational challenge;
  • statistical challenge;
  • visualization challenge;
  • curse of dimensionality。

其中 curse of dimensionality 不是本页正式展开内容,但这是其核心背景。


67. High Complexity of Data ★★★

复杂性不仅是:

大或者:

大。

还包括 data structure complex:

  • streams;
  • sensor data;
  • time-series;
  • temporal;
  • sequence;
  • graphs;
  • social networks;
  • information networks;
  • spatial;
  • spatiotemporal;
  • multimedia;
  • text;
  • Web;
  • software programs;
  • scientific simulations。

所以:

也包括:


68. New and Sophisticated Applications ★★☆

算法不是存在于真空中。

新的领域不断提出:

于是需要不同学科联合解决。


69. Data Mining Applications ★★☆

第 25 页。

主要包括:

Web page analysis

  • classification;
  • clustering;
  • ranking。

Recommender systems

  • collaborative analysis。

Basket analysis

Biological / medical data

  • biological patterns;
  • diagnosis/risk patterns。

Software Engineering

mine software repositories / program structures。

Text Analysis

text mining / NLP。

Social / Information Network Analysis

graph mining / link mining。


70. Invisible Data Mining ★★☆

课件提出:

Built-in / invisible data mining functions.

例如互联网系统中很多功能背后:

用户不一定意识到自己正在使用 data-mining-powered systems。

举例平台:

  • Google
  • Microsoft
  • LinkedIn
  • Meta

71. Dedicated Data Mining Tools ★☆☆

课件列举:

  • SAS
  • MS SQL-Server Analysis Manager
  • Oracle Data Mining Tools

期末除非老师特别强调,一般知道是 data mining systems/tools 即可。


72. Data Mining and Society ★★★

第 26 页是社会影响。

必须同时掌握:


73. Benefits ★★☆

课件列出:

  • scientific discovery;
  • business management;
  • economic recovery;
  • security protection;
  • cyberattack / intruder discovery。

本质:


74. Risks ★★★

问题:

Need to guard against misuse.

即使算法没有直接公布 private data,也可能通过 patterns:

因此风险包括:

  • confidential business information disclosure;
  • government information disclosure;
  • personal information disclosure。

75. Pizza Index ★★☆

课件专门标红:

Pizza Index。

它表达的不是披萨本身重要,而是一种更普遍的 security problem:

即使某种公开行为表面上无害,也可能通过 aggregation / indirect correlation 泄漏敏感活动信息。

抽象为:

其中:

  • :公开或非敏感 observable information;
  • :本不希望公开的信息。

这称为:

inference leakage / indirect information disclosure

的直觉。


76. Privacy-Preserving Data Mining ★★★

课件明确说这是 ongoing research theme:

  • data security;
  • privacy-preserving data publishing;
  • privacy-preserving data mining。

总体原则:

而不是:


77. 这一章的完整“Why it fails → How it fixes”演进表 ★★★

阶段原始方法/假设Why it fails新思想 / How it fixes
1保存大量 raw dataData ≠ knowledgeData Mining
2直接 mining raw datanoise, inconsistency, heterogeneityKDD data preparation
3假设所有数据都是 tableimage/text/graph/sequence 不满足 fixed schemaSpecialized representations/mining methods
4只做 summarization无法发现 co-occurrenceFrequent pattern mining
5只描述历史无法预测未知结果Classification/regression
6依赖 known labels很多数据没有 labelClustering
7Classical models/featurescomplex high-dimensional representationsDeep learning
8关注 majorityrare but critical cases 被忽视Outlier analysis
9忽略 orderingtemporal order 携带知识Sequential/time-series mining
10假设 finite stored datasetstream potentially infiniteStream mining
11把 objects 当 independent rowsrelations carry semanticsGraph/network/link mining
12输出所有 patterns很多 patterns irrelevant/spurious/transientKnowledge evaluation
13单一算法视角scale/dimension/structure/application 太复杂Multi-disciplinary confluence
14只追求 mining utilityprivacy/security riskPrivacy-preserving mining

78. 本章最容易混淆的概念 ★★★

78.1 Data Mining vs KDD

KDD 更大。


78.2 AI vs Data Mining


78.3 Structured vs Semi-Structured vs Unstructured

TypeSchema
Structuredfixed
Semi-structuredflexible but explicit structure
Unstructuredno explicit fixed semantic schema

78.4 Sequence vs Time Series


78.5 Classification vs Clustering


78.6 Outlier vs Noise


78.7 Association vs Causation


78.8 Pattern vs Knowledge


79. Chapter 1 的逻辑闭环 ★★★

现在把第一页到最后一页连起来。

Step 1 — Why Data Mining?

因为:

但:

有限。

所以:


Step 2 — Why KDD?

因为:

所以:


Step 3 — Why many mining algorithms?

因为:


Step 4 — Why knowledge evaluation?

因为:


Step 5 — Why interdisciplinary?

因为现实问题同时存在:

没有单一学科可以全部解决。


Step 6 — Why society/privacy?

因为:

本身是双刃剑:

和:

来自同一种 technical capability。


80. Chapter 1 最重要的“总公式”

虽然课件不是数学章节,但如果用一个形式化框架压缩整章,可以写成:

其中:

  • :raw data;
  • :prepared dataset;
  • :data mining method;
  • :all discovered patterns/models;
  • :evaluation;
  • :interesting / valid patterns;
  • :visualization / presentation;
  • :usable knowledge。

而 mining algorithm 又依赖:

这两条式子不是 PPT 原始公式,但它们几乎把整章的逻辑压缩完了。


81. 期末考试优先级:第一梯队 ★★★

如果时间有限,以下内容必须做到“合上 PPT 可以自己讲出来”:

  1. Data Mining 定义。
  2. Data Mining vs AI。
  3. Data Mining vs KDD。
  4. KDD 完整流程与每一步作用。
  5. Structured / semi-structured / unstructured。
  6. Sequence vs time-series。
  7. Stored vs streaming data。
  8. Summarization / association / classification / clustering / outlier 各在解决什么问题。
  9. Classification vs clustering。
  10. Outlier vs noise。
  11. Association/correlation ≠ causation。
  12. Knowledge evaluation 为什么必要。
  13. coverage / typicality / novelty / accuracy。
  14. 为什么 Data Mining 是 multi-disciplinary。
  15. scalability / dimensionality / complexity。
  16. data mining 的 privacy/security problem。

82. 第二梯队 ★★☆

建议熟悉例子与关键词:

  • Google Flu Trends;
  • dry vs wet region;
  • Diaper → Beer;
  • credit card fraud;
  • deep learning architectures;
  • camera → memory card sequential pattern;
  • frequent subgraph;
  • PageRank/Web mining;
  • Pizza Index;
  • SAS / SQL Server / Oracle tools。

83. 一张表记住所有 Mining Functionalities ★★★

Function输入假设核心问题输出
Summarizationmultidimensional data数据整体有什么特征?summaries
Frequent Patterntransactions什么经常一起出现?itemsets
Associationco-occurrence dataX 与 Y 如何关联?rules
Correlationvariables两变量是否共同变化?correlation
Classificationlabeled data新 sample 属于哪类?class
Regressionlabeled numeric target数值是多少?numerical prediction
Clusteringunlabeled data自然有哪些群体?clusters
Deep Learning(方法族)可服务于多类任务学习复杂 representation/modelneural model
Outlier Analysismajority + rare cases谁不符合一般行为?anomalies
Sequential Miningordered events哪些事件按某顺序出现?sequential patterns
Trend Analysistemporal data如何随时间变化?trends
Periodicitytemporal data是否周期重复?periods
Stream Miningongoing data如何在线处理无限数据?online knowledge
Graph Mininggraph data有哪些结构模式?subgraphs
Link Miningnetworkrelation 本身说明什么?relational patterns
Web MiningWeb network/contentWeb 中有哪些结构/行为?communities/ranking/etc.

84. 最终 1 分钟背诵版

如果考试前只剩一分钟,记这一段:

Data mining aims to discover interesting patterns, models and knowledge from large datasets. It focuses on data, whereas AI focuses more broadly on intelligent systems that perceive, reason, learn, plan and act. Data mining is only one stage of the KDD process, which includes data cleaning, integration, transformation, selection, mining, pattern evaluation and knowledge presentation. Real-world data may be structured, semi-structured or unstructured, and may further involve sequences, time series, spatial-temporal information, graphs and data streams, so different data and different questions require different mining methods. Major mining functionalities include multidimensional summarization, frequent-pattern and association mining, classification and regression, clustering, deep learning, outlier analysis, sequential and trend analysis, stream mining and graph/network mining. Because mining can generate enormous numbers of patterns, results must be evaluated for properties such as coverage, accuracy, typicality and novelty. Data mining therefore draws on databases, statistics, machine learning, pattern recognition, algorithms, HPC, visualization, NLP and domain applications. Finally, while data mining can benefit science, business and security, it can also reveal sensitive information, so data security and privacy-preserving mining are essential.

这基本对应第 27 页 Summary,但把第 1–26 页之间的逻辑关系完整串了起来。


高密度复习:Introduction / KDD

一条主线

Data mining 是 KDD 中的 mining 步骤,不是整个 KDD;AI 的对象是能感知、推理、学习、规划和行动的系统,DM 的对象是数据中的模式、模型与知识。

KDD 与评价

环节目的高频陷阱
Cleaning缺失、噪声、冲突不等于 transformation
Integration多源合并、实体匹配warehouse 是可选管理层,不是必经步骤
Selection / Transformation选目标数据、构造/缩放特征顺序可依任务迭代,非固定流水线
Mining找规则、模型、簇、异常算法输出不自动有价值
Evaluation / Presentationvalidity、novelty、utility、可解释呈现held-out generalization 主要是预测任务指标

预测型任务重点看 accuracy/generalization;描述型任务还看 coverage、typicality、novelty、稳定性与领域效用。

数据对象速记

类型核心结构典型任务/陷阱
Record / table属性集合,不必全为实数;类别列同样是 structured data
Transactionitem 集合item 顺序通常无关
Time series / sequence有序 集合符号会丢失顺序和重复
Spatial / spatiotemporal位置与邻接关系proximity、尺度、边界很重要
Graph / networknodes + linkslink 和 subgraph 本身可含信息
Stream持续、可能无限不能默认 fixed dataset/schema;需在线处理

Mining functionalities:按“任务”而非“工具”记

  • Summarization / characterization / discrimination:数据总体是什么、两类有何不同。
  • Frequent pattern / association / correlation / sequential:什么共同出现、是否有方向/统计关系、是否有顺序。
  • Classification / regression:有标签的离散/连续预测。
  • Clustering / outlier:无标签的群体结构与偏离者。
  • Stream / graph / spatial mining:由数据结构带来的专门约束。
  • Deep learning 是方法族,可用于上述多种任务,不是与它们互斥的功能。

考场检查清单

  1. 先判断任务是 predictive 还是 descriptive,再选 evaluation。
  2. 问“data mining vs AI”时,答 data-centered pattern discovery vs system-centered intelligent behavior,不要写成互斥关系。
  3. 问 KDD 时,说明 preparation 的组件与迭代性;不要把 data warehouse 写成硬性一步。
  4. 问隐私时,指出模式发布本身可能泄露敏感信息,因此要有 security/privacy-preserving mining。

Static academic notes built with VitePress and KaTeX.