Theme
下面这份笔记严格以你上传的 Chapter 1《Introduction》为主,不把后续章节的算法细节偷偷提前塞进来。这个 Chapter 本身几乎没有正式数学推导,因此我会区分:
- 【课件原文】:课件明确给出的定义、流程、概念与例子;
- 【形式化补充】:为了帮助期末理解而补充的数学表达,但它们不是课件这一章明确要求的公式。
这样可以避免复习时把“我的扩展解释”和“老师 PPT 原文”混在一起。
重要程度我统一标为:
- ★★★:核心概念,强烈建议做到能定义、比较、解释;
- ★★☆:重要应用/分类,适合选择题、简答题;
- ★☆☆:背景、例子、扩展,知道即可。
Chapter 1 — Introduction
0. 本章到底在讲什么?——先建立整章“进化树”
这一章并不是在教某一个具体算法,而是在回答一个更基础的问题:
面对巨大、复杂、异构的数据,我们怎样从“原始数据”一步步得到“有意义、可信、可使用的知识”?
整章可以压缩成下面这一条主线:
text
现实世界不断产生海量数据
↓
Raw Data 本身 ≠ Knowledge
↓
需要 Data Mining
发现 patterns / models / knowledge
↓
但现实数据很脏、异构、结构复杂
↓
Data Mining 不能孤立进行
必须嵌入 KDD
↓
Cleaning → Integration → Transformation → Selection
↓
Data Mining
↓
Pattern / Model Evaluation
↓
Knowledge Presentation
↓
真正可使用的 Knowledge随后问题进一步扩展:
text
数据不只有表格
│
├─ Structured
├─ Semi-structured
├─ Unstructured
├─ Sequence / Time-series
├─ Spatial / Temporal / Spatiotemporal
├─ Graph / Network
└─ Stored / Streaming
↓
不同数据结构 + 不同问题
↓
需要不同 mining functionalities
│
├─ Summarization
├─ Frequent patterns / association / correlation
├─ Classification / regression
├─ Clustering
├─ Deep learning
├─ Outlier analysis
├─ Sequential / trend / evolution analysis
└─ Graph / network / Web mining
↓
发现了 pattern 还不够
↓
Is it interesting / valid / representative?
↓
Knowledge Evaluation
↓
同时考虑 scalability / complexity / privacy
↓
形成 Data Mining 这一多学科交叉领域所以本章最重要的思想不是背若干名词,而是:
Data Mining = 在复杂数据中发现知识,但完整目标不是“发现尽可能多的 pattern”,而是通过 KDD 流程得到 valid、novel、useful、interesting 的知识。
1. What Is Data Mining? ★★★
1.1 核心定义
课件第 2 页:
Data mining is the process of discovering interesting patterns, models and other kinds of knowledge in large data sets.
中文可以准确理解为:
数据挖掘是在大规模数据集中发现有趣的模式(patterns)、模型(models)和其他知识(knowledge)的过程。
核心关键词不要漏:
- large data sets
- discover
- patterns / models
- knowledge
- interesting
其中第五个词特别重要。
因为:
finding a pattern ≠ finding useful knowledge.
后面第 22 页专门回来解决这个问题。
1.2 为什么“Data Mining”这个名字其实不够准确? ★★☆
课件说:
“Data mining”: a misnomer?
It should be “knowledge mining from data”.
类比:
- 从矿石里 mining 的目标不是得到“矿石”;
- 而是得到黄金;
- 从 data 里 mining 的目标也不是得到更多 data;
- 而是得到 knowledge。
因此:
这里是我对课件逻辑的形式化,并非 PPT 原始公式。
1.3 同义或近义术语 ★★☆
课件列出了:
- Knowledge mining from data
- KDD — Knowledge Discovery from Data
- Pattern discovery
- Knowledge extraction
- Data analytics
- Information harvesting
注意:
严格来说,Data Mining 与 KDD 不完全等价。
后面会看到:
Data Mining 是 KDD 中的核心步骤之一,而不是完整 KDD。
这个区别很容易考概念题。
2. 从 Data 到 Pattern:什么叫“模式”? ★★☆
第 3 页主要通过图片说明 pattern。
图片包括:
- 视觉图案;
- 色盲图中的隐藏数字;
- scatter plot 中的线性趋势;
- 多变量数据中的变量关系。
统一思想是:
大量 individual observations 看起来可能杂乱,但整体上存在某些规律性的 structure。
例如散点数据:
可能存在近似关系:
这就是一种 pattern。
但是这里必须注意:
Chapter 1 并没有正式教授 linear regression。
因此不要把回归公式当成本章算法考点;这里仅用于理解 pattern 的概念。
3. Data Mining 与 AI 的区别 ★★★
这是本章非常容易出简答/比较题的一部分,对应第 4–5 页。
最核心的一句话是:
第 27 页 Summary 也再次强调这一点。
3.1 Goal:目标不同
Artificial Intelligence
目标:
Build systems that perceive, reason, learn, plan, and act to achieve objectives.
即 AI 更关心:
最终是:
让一个系统在环境中完成目标。
Data Mining
目标:
Discover valid, novel, and useful patterns from data within the KDD process.
即:
4. AI vs. Data Mining:完整对比 ★★★
| 维度 | AI | Data Mining |
|---|---|---|
| 核心对象 | System / Agent | Data |
| Problem framing | Optimize behavior to meet objectives | Ask descriptive / predictive questions about data |
| Goal | perceive, reason, learn, plan, act | discover valid, novel, useful patterns |
| Data dependency | 可包含 perception / interaction data | 常处理记录型数据;也可为 stream、graph、sequence 等 |
| Evaluation | task success / utility in context | 取决于任务:预测任务重视 held-out generalization,描述性任务还看 coverage、novelty、稳定性和领域效用 |
| Workflow | deployment + monitoring + feedback | cleaning + exploration + discovery + reporting |
| Typical risks | safety, alignment, distribution shift | spurious correlation, data leakage |
| Output | decisions, actions, predictions, interactive behavior | patterns, rules, segments, predictive models |
4.1 为什么 AI 范围更广? ★★☆
AI 包括:
- machine learning
- knowledge representation
- reasoning
- planning
- vision
- NLP
- reinforcement learning
- LLMs
- probabilistic reasoning
而 Data Mining 更集中在:
- clustering
- association rules
- anomaly detection
- feature selection
- predictive classical ML
- pattern discovery
因此不要简单写:
Data Mining = AI
也不要写:
AI = Data Mining。
两者有大量重叠,但研究目标和 framing 不一样。
4.2 Healthcare 例子 ★★☆
课件的例子非常适合帮助区分两者。
Data Mining
Mining EHRs:
找 comorbidity clusters 和 myocardial infarction risk factors。
本质:
AI
AI agent:
- summarize a chart;
- decide next test;
- order the test;
- explain why。
即:
这就是“data-centered”与“system-centered”的本质区别。
5. Data Mining 是 KDD 中的一个步骤 ★★★
这是整章最核心的架构之一,对应第 6 页。
5.1 完整 KDD Pipeline
课件的流程是:
text
Data Sources
↓
Data Cleaning
↓
Data Integration
↓
Data Warehouse(可选的数据管理层)
↓
Data Transformation / Selection
↓
Data Mining
↓
Pattern / Model Evaluation
↓
Knowledge Presentation
↓
Knowledge这张图列的是常见的数据准备组件,不是所有项目都必须经过、也不是唯一固定顺序的 pipeline;例如 data warehouse 是常见实现设施,而非 KDD 的必经步骤。cleaning、integration、selection、transformation 也会依数据和任务反复迭代。
简化写成:
其中:
- :raw data;
- :cleaned data;
- :integrated data;
- :transformed data;
- :selected target data;
- :mined patterns/models;
- :经过 evaluation 的 patterns;
- :presented/interpretable knowledge。
这是形式化补充,不是 PPT 原公式。
6. KDD 各步骤详解 ★★★
6.1 Data Cleaning
解决:
- missing values
- errors
- inconsistencies
- noise
核心:
Garbage in, garbage out.
如果输入数据存在系统性错误:
其中 很大,那么后面的 mining 很可能发现:
error pattern,而不是 real-world pattern。
6.2 Data Integration
问题:
现实数据往往来自多个 source。
例如:
text
Database A
Database B
Sensor C
External file D
↓
Integration
↓
unified representation困难可能包括:
- schema 不一致;
- unit 不一致;
- ID 不一致;
- duplicate records;
- semantic conflicts。
6.3 Data Transformation
目的:
将数据转换成更适合 mining 的形式。
例如概念上可能有:
- normalization
- aggregation
- encoding
- feature construction
但这一页没有进一步展开具体方法。
6.4 Data Selection
不是所有数据都应该进入算法。
设完整数据库为:
根据分析任务选择:
在 上执行 mining。
核心问题:
Which subset of the available data is relevant to the problem?
6.5 Data Mining
现在才真正执行:
- pattern discovery;
- model learning;
- clustering;
- classification;
- associations 等。
所以:
6.6 Pattern / Model Evaluation
问题:
算法找出来的 pattern 一定有意义吗?
答案:
可能:
- 偶然;
- 不具有代表性;
- 只在某时间成立;
- 只在某区域成立;
- statistical artifact;
- irrelevant。
因此需要进一步筛选。
6.7 Knowledge Presentation
即使 pattern statistically valid,如果人无法理解,也未必成为真正可使用的 knowledge。
所以还需要:
- visualization;
- reporting;
- summarization;
- interpretation。
最终:
7. KDD 为什么是一种“方法论升级”? ★★★
这里可以按照你要求的 Why it fails → How it fixes 理解。
Stage A:直接在 raw data 上跑算法
问题:
Why it fails?
因为:
- dirty;
- inconsistent;
- heterogeneous;
- irrelevant variables;
- noisy;
- duplicate。
Stage B:加入 Data Preparation
解决:
Stage C:只输出所有 patterns
问题:
即使 mining 成功:
用户仍然不知道哪些值得关注。
Stage D:Pattern Evaluation
加入:
- coverage;
- accuracy;
- novelty;
- typicality;
- representativeness。
Stage E:只得到数学 pattern
问题:
结果可能无法被人理解和行动。
Stage F:Knowledge Presentation
最终成为:
这实际上就是整个 KDD 出现的根本逻辑。
8. Diversity of Data Types I:结构层面的分类 ★★★
对应第 7–10 页。
最基本分类:
text
Data
├── Structured
├── Semi-structured
└── Unstructured但现实世界:
往往是混合存在的。
9. Structured Data ★★★
定义:
uniform, record- or table-like structures
特点:
- fixed set of attributes;
- value range 基本预定义;
- semantic meaning 明确;
- data dictionary 可明确描述。
形式上可以表示成:
其中:
- :records 数;
- :attributes/features 数;
- :第 个 object 的第 个属性,且一般 。
若所有属性都已经数值化,才可进一步写成 ;医疗表中 M/F、Yes/No 一类字段说明,这不是 structured data 的一般前提。
课件例子:
- relational database;
- data cube;
- data matrix;
- data warehouse。
第 8 页医疗表格:
text
patient_id | age | sex | BMI | smoker就是典型 structured tabular data。
10. Semi-Structured Data ★★★
这是特别容易混淆的一类。
课件定义:
Semi-structured data 可以:
- contain set-valued attributes;
- contain heterogeneous typed values;
- contain nested structures;
- allow objects/subobjects 的结构 dynamically defined。
所以它不是:
completely structureless。
而是:
有结构,但是结构不像关系表一样固定。
10.1 Transactional Data
第 8 页例子:
json
{
"transaction_id": "...",
"patient_id": "...",
"items": [
{...},
{...}
],
"payment": {...}
}存在明确:
- key;
- hierarchy;
- nested object;
- array。
但是不同 transaction 的内部结构可以更灵活。
所以是:
10.2 Sequence Data
例如:
text
Arrival-ED
↓
ECG
↓
Lab-Troponin顺序本身携带信息。
数学上可以抽象为:
其中:
- :sequence;
- :第 个 event;
- :sequence length。
关键:
因为 order 有意义。
11. Graph / Network Data ★★★
课件称其:
A more sophisticated type of semi-structured data set.
数学上:
其中:
- :vertices / nodes;
- :edges / relationships。
例如医疗图:
text
Patient → seen_by → Doctor
Doctor → ordered → Department这里真正重要的信息不只是 node attributes,还包括:
这也解释了后面为什么需要 graph mining / link mining。
12. Unstructured Data ★★★
课件典型例子:
- text
- audio
- image
- video
例如:
Chief complaint: chest tightness for 2 hours...
虽然人可以读懂文本,但它没有像 relational table 一样直接定义:
text
attribute_1
attribute_2
attribute_3因此属于 unstructured data。
13. 第 10 页的陷阱:医学 X-ray 到底 structured 还是 unstructured? ★★☆
课件提出:
Semi-Structured or Unstructured Data?
这个问题的重点实际上是:
数据类型不是只看“长什么样”,还取决于数据表示。
原始 X-ray image
主要是 pixel matrix + visual content:
在 data mining taxonomy 中通常视为:
如果 X-ray 带有 structured annotation
例如:
- clavicle contour;
- heart boundary;
- diaphragm boundary;
- organ labels。
那么整个 sample 可能变成:
text
image
+
regions
+
labels
+
coordinates
+
relations整体系统具有明显 semi-structured characteristics。
因此你考试时最好的回答不是:
image 永远是 unstructured。
而是:
Raw image content is unstructured, but annotated image data may combine unstructured image content with structured or semi-structured metadata.
14. Diversity of Data Types II:应用语义也决定 mining 方法 ★★★
第 11 页非常关键:
Different applications → different datasets → different analysis methods.
即使形式一样,也不代表方法一样。
14.1 Sequence ≠ Time Series ★★★
Sequence
一般形式:
其中 可以是:
- item;
- symbol;
- biological residue;
- transaction;
- event。
时间间隔不一定固定。
Time Series
课件定义:
ordered set of numerical values with equal time interval
数学上:
且:
为固定时间间隔。
因此:
这是高概率概念题。
15. Spatial / Temporal / Spatiotemporal Data ★★☆
分别强调:
- spatial:location;
- temporal:time;
- spatiotemporal:space + time。
可以形式化为:
其中:
- :spatial coordinate;
- :time。
这种数据与普通 i.i.d. tabular data 不同,因为:
与附近:
可能具有明显 dependency。
16. 同样是 Graph,语义可能完全不同 ★★☆
课件列举:
- social networks
- computer communication networks
- biological networks
- information networks
共同结构都是:
但:
完全不同。
例如 edge 可以表示:
- friendship;
- communication;
- protein interaction;
- hyperlink;
- citation。
所以:
Data structure alone does not determine the mining task. Domain semantics matters.
17. 同一数据,不同问题也需要不同 mining 方法 ★★★
第 11 页:
software program 数据可以用于:
Problem A
find plagiarized modules
Problem B
find copy-and-paste bugs
输入数据可能一样:
但 query 不一样:
因此:
其中 表示选择的 mining method。
这是一个非常重要的方法论:
算法不是由 data alone 决定,而是由 data + question 决定。
18. Stored Data vs Streaming Data ★★★
Stored Data
课件:
Finite, stored in large repositories.
形式上:
可以:
- 重复扫描;
- offline processing;
- 多轮迭代。
Streaming Data
例子:
- video surveillance;
- remote sensing。
特点:
- dynamic;
- continuously arriving;
- potentially infinite;
- require real-time response。
形式:
且理论上:
问题变成:
因此 traditional stored-data mining 不一定适用。
19. Mining Various Kinds of Knowledge:总图 ★★★
第 12 页列出:
- Multidimensional Data Summarization
- Frequent Patterns / Associations / Correlations
- Classification / Regression
- Cluster Analysis
- Deep Learning
- Outlier Analysis
- Evaluation of mining results
随后还包括:
- Sequential / trend / evolution analysis
- Graph / network analysis
- Web mining
这不是简单的“算法清单”,而是在回答:
What kind of knowledge do we want?
20. 方法论的“进化树”:为什么会有这些不同任务? ★★★
这一章没有说:
Algorithm A 被 Algorithm B 淘汰。
更准确的演化逻辑是:
text
首先:我只想知道“数据总体长什么样”
↓
Summarization
但总体平均不能告诉我“哪些东西经常一起发生”
↓
Frequent Pattern / Association
但关联仍然只是描述过去
↓
Classification / Regression
预测未知结果
但很多数据根本没有标签
↓
Clustering
但 classical representations 难处理复杂图像/文本/序列
↓
Deep Learning
但 majority pattern 会忽视少数异常
↓
Outlier Analysis
但现实事件具有 time/order
↓
Sequential / Trend / Stream Mining
但现实对象之间还有 explicit relations
↓
Graph / Network / Web Mining
但方法能找出海量“pattern”
↓
Knowledge Evaluation这就是本章真正意义上的“方法演进”。
21. Multidimensional Data Summarization ★★★
第 13 页。
核心任务:
Generalize, summarize, and contrast data characteristics.
例如:
dry regions vs. wet regions。
21.1 Information Integration + Data Warehouse
先:
- clean;
- transform;
- integrate;
再建立:
multidimensional data model。
22. Data Cube ★★☆
概念上:
若数据包含 dimensions:
例如:
- location;
- time;
- product;
- customer。
则 measure 可以写成:
例如:
Data Cube 就是允许从不同 dimension / aggregation level 分析这些 measure。
23. Materialization ★★☆
课件:
scalable methods for computing (materializing) multidimensional aggregates.
所谓 materialization:
将某些 aggregation 结果预先计算并保存。
例如:
Why?
因为大规模数据中每次重新 aggregate:
预计算:
代价则通常是:
本章没有进一步分析 trade-off。
24. OLAP ★★★
OLAP:
Online Analytical Processing.
核心思想:
在 multidimensional data 上进行交互式聚合分析。
记住:
共同服务于:
multidimensional summarization。
25. Characterization vs Discrimination ★★★
Multidimensional concept description 包含两类。
Characterization
回答:
What are the characteristics of target class ?
例如:
wet regions 的一般特征是什么?
Discrimination
回答:
What distinguishes from ?
例如:
一句话:
- characterization = summarize one class;
- discrimination = contrast classes。
26. Frequent Pattern Mining ★★★
第 14 页。
问题:
What items are frequently purchased together?
例如 transaction:
其中:
- :all possible items;
- :第 个 basket。
某个 itemset:
如果 在很多 transaction 中共同出现,就叫:
frequent itemset。
26.1 Association Rule
课件例子:
意思不是:
diaper causes beer.
而是:
diaper 与 beer 在交易数据中存在某种统计 association。
因果关系和关联关系必须区分。
26.2 Support / Confidence:重要说明
本 PPT 第 14 页并没有给出 support / confidence 的公式。
如果你的老师在后续 Chapter 教 association mining,它们通常会正式定义;因此这里不要把下面内容当 Chapter 1 原公式。
形式化补充:
对于:
support:
confidence:
但是:
27. Correlation Analysis ★★★
第 14 页三个 scatter plots:
- :几乎无线性相关;
- :中等负相关;
- :强正相关。
核心理解:
一般解释:
课件没有给 Pearson correlation 的完整公式,因此下面作为补充:
其中:
- :第 个 sample 的两个变量;
- :sample means;
- numerator:共同偏离均值的程度;
- denominator:进行 scale normalization。
因此 衡量的是:
standardized linear co-variation。
28. Association ≠ Correlation ≠ Causation ★★★
极其重要。
Diaper → Beer 只是 pattern,不代表:
买 diaper 导致购买 beer。
这与第 4 页提到的 data mining risk:
spurious correlations
直接呼应。
29. Classification and Regression for Predictive Analysis ★★★
第 15 页。
这一部分从:
describe existing data
进入:
predict unknown target。
30. Classification ★★★
有 training examples:
其中:
- :features;
- :known class label。
学习:
对新 sample:
预测:
其中:
- :predicted class label。
这是形式化补充,但准确对应课件:
Construct models based on training examples and predict unknown class labels.
31. Classification 为什么是 supervised learning? ★★★
因为 training data 中:
已知。
即:
而不是只知道 。
它要学习:
32. 分类方法 ★★☆
课件列出:
- Decision Trees
- Naïve Bayesian Classification
- SVM
- Neural Networks
- Rule-based Classification
- Pattern-based Classification
- Logistic Regression
注意:
这一章只要求认识它们属于:
没有在 Chapter 1 展开算法公式。
33. Classification Applications ★★☆
课件:
- credit card fraud detection;
- direct marketing;
- classifying stars;
- disease classification;
- web-page classification。
共同形式:
其中 是 discrete class。
34. Regression ★★★
虽然 slide 标题包含 Regression,但正文重点主要讲 classification。
概念上:
classification:
regression:
即:
| Task | Target |
|---|---|
| Classification | categorical |
| Regression | continuous numerical |
例如:
- “是否 fraud?” → classification;
- “未来 sales = 多少?” → regression。
35. Cluster Analysis ★★★
第 16 页。
核心:
Unsupervised learning — class labels are unknown.
数据只有:
没有:
目标:
从数据自身结构中形成新的 categories / clusters。
36. Clustering Principle ★★★
课件原文:
Maximizing intra-class similarity & minimizing interclass similarity.
更自然地写:
以及:
换成 distance 语言:
36.1 一个形式化目标
课件没有给 K-means 公式,但最经典的数学形式可以辅助理解:
其中:
- :cluster 数;
- :第 个 cluster;
- :sample;
- :cluster centroid;
- :within-cluster squared distance。
直觉:
每一个 sample 离自己 cluster center 尽可能近。
再次强调:这是形式化补充,不是本页 PPT 明确公式。
37. Classification vs Clustering ★★★
这是必会比较。
| Classification | Clustering | |
|---|---|---|
| Learning | Supervised | Unsupervised |
| Labels | Known in training | Unknown |
| Goal | Predict existing class | Discover new groups |
| Output | class label/model | clusters |
| Core question | “Which known class?” | “What natural groups exist?” |
一句话:
38. Deep Learning ★★☆
第 17 页。
定义定位:
A fast expanding dynamic frontier in machine learning.
课件列出的 architecture:
- Feed-forward neural networks
- CNN
- RNN
- GNN
- Transformer
重要的是:
Deep Learning 在这一章不是一个“与 classification 平级且互斥的任务”。
而是一类:
可以用于多个 mining tasks。
39. 为什么说 Deep Learning “reshapes” Data Mining? ★★☆
课件说 deep learning 已经影响:
- classification;
- clustering;
- outlier detection;
- reinforcement learning。
所以结构关系更像:
text
Mining Task
│
├─ Classification
│ └─ may use DL
├─ Clustering
│ └─ may use DL
└─ Outlier Detection
└─ may use DL而不是:
text
Classification vs Clustering vs Deep Learning完全互斥。
这个概念层次值得记住。
40. 不同 Neural Architecture 对应不同 data structure ★★☆
虽然后续课件才会深入,这一页隐含着:
| Architecture | Typical data inductive structure |
|---|---|
| Feed-forward NN | fixed-dimensional vectors |
| CNN | spatial/local structure |
| RNN | sequential data |
| GNN | graph/network data |
| Transformer | sequence/global interaction |
因此它与前面“Diversity of Data Types”形成逻辑闭环:
41. Outlier Analysis ★★★
第 18 页。
定义:
An outlier is a data object that does not comply with the general behavior of the data.
可以理解为:
即该点与整体正常分布显著不同。
42. Outlier ≠ Noise ★★★
课件一句非常重要:
Noise or Exception?
One person's garbage could be another person's treasure.
举例:
Sensor error
异常值可能是:
应该 remove。
Fraud transaction
异常值可能正是:
因此:
这是非常值得考的概念。
43. Outlier 从哪里来? ★★☆
课件说可以成为:
by-product of clustering or regression analysis.
Clustering
离所有 cluster 都远的 point:
可能是 outlier。
Regression
如果:
其中 residual:
异常大,则可能:
为 outlier candidate。
44. Outlier Applications ★★★
课件:
- fraud detection;
- rare events analysis。
这里最核心的思想:
对于很多业务,真正最有价值的不是 majority,而是 rare deviation。
45. Time and Ordering:为什么普通 item mining 不够? ★★★
第 19 页。
普通 frequent itemset 关心:
但不关心:
还是:
现实很多问题:
order matters。
因此发展出:
- sequential pattern mining;
- trend analysis;
- time-series analysis;
- periodicity;
- motif analysis;
- data-stream mining。
46. Trend / Time-Series / Deviation Analysis ★★★
主要目标:
研究数据怎样随时间变化。
例如:
其中:
- :underlying trend;
- :deviation/noise。
课件举:
- regression;
- value prediction。
47. Sequential Pattern Mining ★★★
例子:
buy digital camera → then buy large memory cards.
可以表示:
不是:
因为:
48. Periodicity Analysis ★★☆
寻找规律性重复:
其中 是 period。
例如:
- daily;
- weekly;
- yearly cycles。
49. Motif Analysis ★★☆
Motif:
recurring subsequence / structure.
课件特别提到:
- biological sequences;
- approximate motifs;
- consecutive motifs。
重点:
现实 sequence 不一定 exact match,因此还需要 approximate matching。
50. Similarity-Based Analysis ★★☆
不要求 pattern 完全相同,而是寻找:
足够高的 objects / subsequences。
关键问题变成:
How do we define similarity?
后续具体章节通常才会定义 distance/similarity measures。
51. Mining Data Streams ★★★
课件定义:
Ordered, time-varying, potentially infinite data streams.
三个关键:
因此:
不能简单假设“把整个 dataset 先放到内存里”。
这是 streaming mining 的根本挑战。
52. Structure and Network Analysis ★★★
第 20–21 页。
为什么 tabular mining 不够?
因为很多问题中:
例如:
只看 node attributes:
会丢掉:
中的结构信息。
于是有:
- Graph mining
- Information network analysis
- Link mining
- Web mining
53. Graph Mining ★★★
核心任务:
Find frequent subgraphs / trees / substructures.
例如:
- chemical compounds;
- XML trees;
- Web fragments。
设数据库:
目标可能是找到:
使得:
对于很多 都成立。
即:
frequent subgraph。
54. Frequent Subgraph Mining ★★☆
第 21 页用 chemical structure → graph 来说明:
原始 molecule:
text
atoms + bonds转成:
text
nodes + edges即:
从大量 molecular graphs 中发现频繁结构:
可能代表某种重要 structural motif。
55. Information Network Analysis ★★★
Social network:
- actors = nodes;
- relationships = edges。
即:
其中:
可能是:
- people;
- authors;
- organizations。
而:
可能表示:
- friendship;
- collaboration;
- communication。
56. Heterogeneous Networks ★★★
课件说:
A person could be in multiple information networks: friends, family, classmates...
因此现实 network 可能包含:
- multiple node types;
- multiple edge types。
形式化可以写:
其中:
- :node type;
- :edge type。
这是形式化补充。
核心:
57. Link Mining ★★★
课件:
Links carry a lot of semantic information.
也就是说:
不仅:
是 data。
传统 tabular modeling 往往只表达 object 的 feature,而 network mining 特别关注:
以及:
58. Web Mining ★★★
课件:
Web is a big information network: from PageRank to Google.
Web:
- pages = nodes;
- hyperlinks = edges。
因此:
常见任务:
- Web community discovery;
- opinion mining;
- usage mining。
59. Knowledge Evaluation:为什么“发现很多 pattern”不是成功? ★★★
第 22 页是整章哲学上最重要的一页之一。
问题:
Are all mined knowledge interesting?
答案显然:
因为算法可以发现:
其中 可能巨大。
但真正 useful:
甚至:
60. Pattern 为什么可能“不 interesting”? ★★★
课件列出:
1. Only valid in certain dimensions
例如只在:
- particular time;
- particular location。
即:
可能很高,
但:
整体上不高。
2. Not representative
可能只是很小 sample subset 的偶然 pattern。
3. Transient
可能今天成立,之后失效:
61. Interestingness Criteria ★★★
课件列出:
- descriptive vs. predictive;
- coverage;
- typicality vs. novelty;
- accuracy。
61.1 Descriptive vs Predictive
Descriptive
回答:
What is happening / what structure exists?
例如:
- clusters;
- associations;
- summaries。
Predictive
回答:
What will the unknown value/class be?
例如:
- classification;
- regression。
61.2 Coverage
pattern 覆盖多少数据?
形式化补充:
如果只覆盖:
的数据,需要思考它究竟:
- 是珍贵 rare pattern;
- 还是偶然 noise。
61.3 Typicality vs Novelty ★★★
这是很重要的 tension。
Typical
pattern:
能很好代表大多数数据。
Novel
pattern:
令人意外、之前未知。
它们不一定一致。
例如:
coverage 很高,但 novelty 很低。
而某个非常 unusual pattern:
却可能:
所以 interestingness 常是多目标:
这是形式化补充。
61.4 Accuracy
对于 predictive model:
需要好。
但本章同时强调:
还需要:
- relevance;
- representativeness;
- coverage;
- novelty。
62. “直接 mine interesting knowledge” 是一个更高级目标 ★★★
简单方案:
text
Mine everything
↓
Evaluate everything
↓
Keep interesting patterns问题:
evaluation 本身会非常昂贵。
于是更理想的是:
text
Interestingness constraints
↓
Mining algorithm
↓
Interesting patterns directly即:
第 22 页用问号提出了这个思想。
63. Data Mining 是多学科交汇 ★★★
第 23 页。
中心:
周围包括:
- Machine Learning
- Statistics
- Pattern Recognition
- Visualization & HCI
- Algorithms
- High-Performance Computing
- Applications
- Social Sciences
- Database Technology
- NLP
64. 各领域分别贡献什么? ★★★
| Discipline | 对 Data Mining 的贡献 |
|---|---|
| Database Technology | storage, query, indexing, data management |
| Statistics | inference, uncertainty, validity |
| Machine Learning | predictive/model learning |
| Pattern Recognition | pattern/object recognition |
| Algorithms | efficient computational procedures |
| HPC | scalable computation |
| Visualization/HCI | knowledge presentation and interaction |
| NLP | text mining |
| Social Sciences | human/social interpretation |
| Applications | domain semantics and requirements |
最重要:
Data Mining 不是“Machine Learning 的另一个名字”。
因为真实 mining 还涉及:
65. 为什么必须多学科融合? ★★★
第 24 页给了三个根本原因。
Reason 1:Tremendous Amount of Data
导致:
所以算法必须:
如果一个算法复杂度是:
当:
往往不可接受。
虽然 PPT 没给 Big-O 公式,但 “scalable” 的本质就是:
data size increase 时,计算资源需求不能爆炸式失控。
66. High Dimensionality ★★★
课件例:
Micro-array may have tens of thousands of dimensions.
设:
当:
甚至:
会产生:
- computational challenge;
- statistical challenge;
- visualization challenge;
- curse of dimensionality。
其中 curse of dimensionality 不是本页正式展开内容,但这是其核心背景。
67. High Complexity of Data ★★★
复杂性不仅是:
大或者:
大。
还包括 data structure complex:
- streams;
- sensor data;
- time-series;
- temporal;
- sequence;
- graphs;
- social networks;
- information networks;
- spatial;
- spatiotemporal;
- multimedia;
- text;
- Web;
- software programs;
- scientific simulations。
所以:
也包括:
68. New and Sophisticated Applications ★★☆
算法不是存在于真空中。
新的领域不断提出:
于是需要不同学科联合解决。
69. Data Mining Applications ★★☆
第 25 页。
主要包括:
Web page analysis
- classification;
- clustering;
- ranking。
Recommender systems
- collaborative analysis。
Basket analysis
Biological / medical data
- biological patterns;
- diagnosis/risk patterns。
Software Engineering
mine software repositories / program structures。
Text Analysis
text mining / NLP。
Social / Information Network Analysis
graph mining / link mining。
70. Invisible Data Mining ★★☆
课件提出:
Built-in / invisible data mining functions.
例如互联网系统中很多功能背后:
用户不一定意识到自己正在使用 data-mining-powered systems。
举例平台:
- Microsoft
- Meta
71. Dedicated Data Mining Tools ★☆☆
课件列举:
- SAS
- MS SQL-Server Analysis Manager
- Oracle Data Mining Tools
期末除非老师特别强调,一般知道是 data mining systems/tools 即可。
72. Data Mining and Society ★★★
第 26 页是社会影响。
必须同时掌握:
73. Benefits ★★☆
课件列出:
- scientific discovery;
- business management;
- economic recovery;
- security protection;
- cyberattack / intruder discovery。
本质:
74. Risks ★★★
问题:
Need to guard against misuse.
即使算法没有直接公布 private data,也可能通过 patterns:
因此风险包括:
- confidential business information disclosure;
- government information disclosure;
- personal information disclosure。
75. Pizza Index ★★☆
课件专门标红:
Pizza Index。
它表达的不是披萨本身重要,而是一种更普遍的 security problem:
即使某种公开行为表面上无害,也可能通过 aggregation / indirect correlation 泄漏敏感活动信息。
抽象为:
其中:
- :公开或非敏感 observable information;
- :本不希望公开的信息。
这称为:
inference leakage / indirect information disclosure
的直觉。
76. Privacy-Preserving Data Mining ★★★
课件明确说这是 ongoing research theme:
- data security;
- privacy-preserving data publishing;
- privacy-preserving data mining。
总体原则:
而不是:
77. 这一章的完整“Why it fails → How it fixes”演进表 ★★★
| 阶段 | 原始方法/假设 | Why it fails | 新思想 / How it fixes |
|---|---|---|---|
| 1 | 保存大量 raw data | Data ≠ knowledge | Data Mining |
| 2 | 直接 mining raw data | noise, inconsistency, heterogeneity | KDD data preparation |
| 3 | 假设所有数据都是 table | image/text/graph/sequence 不满足 fixed schema | Specialized representations/mining methods |
| 4 | 只做 summarization | 无法发现 co-occurrence | Frequent pattern mining |
| 5 | 只描述历史 | 无法预测未知结果 | Classification/regression |
| 6 | 依赖 known labels | 很多数据没有 label | Clustering |
| 7 | Classical models/features | complex high-dimensional representations | Deep learning |
| 8 | 关注 majority | rare but critical cases 被忽视 | Outlier analysis |
| 9 | 忽略 ordering | temporal order 携带知识 | Sequential/time-series mining |
| 10 | 假设 finite stored dataset | stream potentially infinite | Stream mining |
| 11 | 把 objects 当 independent rows | relations carry semantics | Graph/network/link mining |
| 12 | 输出所有 patterns | 很多 patterns irrelevant/spurious/transient | Knowledge evaluation |
| 13 | 单一算法视角 | scale/dimension/structure/application 太复杂 | Multi-disciplinary confluence |
| 14 | 只追求 mining utility | privacy/security risk | Privacy-preserving mining |
78. 本章最容易混淆的概念 ★★★
78.1 Data Mining vs KDD
KDD 更大。
78.2 AI vs Data Mining
78.3 Structured vs Semi-Structured vs Unstructured
| Type | Schema |
|---|---|
| Structured | fixed |
| Semi-structured | flexible but explicit structure |
| Unstructured | no explicit fixed semantic schema |
78.4 Sequence vs Time Series
78.5 Classification vs Clustering
78.6 Outlier vs Noise
78.7 Association vs Causation
78.8 Pattern vs Knowledge
79. Chapter 1 的逻辑闭环 ★★★
现在把第一页到最后一页连起来。
Step 1 — Why Data Mining?
因为:
但:
有限。
所以:
Step 2 — Why KDD?
因为:
所以:
Step 3 — Why many mining algorithms?
因为:
Step 4 — Why knowledge evaluation?
因为:
Step 5 — Why interdisciplinary?
因为现实问题同时存在:
没有单一学科可以全部解决。
Step 6 — Why society/privacy?
因为:
本身是双刃剑:
和:
来自同一种 technical capability。
80. Chapter 1 最重要的“总公式”
虽然课件不是数学章节,但如果用一个形式化框架压缩整章,可以写成:
其中:
- :raw data;
- :prepared dataset;
- :data mining method;
- :all discovered patterns/models;
- :evaluation;
- :interesting / valid patterns;
- :visualization / presentation;
- :usable knowledge。
而 mining algorithm 又依赖:
这两条式子不是 PPT 原始公式,但它们几乎把整章的逻辑压缩完了。
81. 期末考试优先级:第一梯队 ★★★
如果时间有限,以下内容必须做到“合上 PPT 可以自己讲出来”:
- Data Mining 定义。
- Data Mining vs AI。
- Data Mining vs KDD。
- KDD 完整流程与每一步作用。
- Structured / semi-structured / unstructured。
- Sequence vs time-series。
- Stored vs streaming data。
- Summarization / association / classification / clustering / outlier 各在解决什么问题。
- Classification vs clustering。
- Outlier vs noise。
- Association/correlation ≠ causation。
- Knowledge evaluation 为什么必要。
- coverage / typicality / novelty / accuracy。
- 为什么 Data Mining 是 multi-disciplinary。
- scalability / dimensionality / complexity。
- data mining 的 privacy/security problem。
82. 第二梯队 ★★☆
建议熟悉例子与关键词:
- Google Flu Trends;
- dry vs wet region;
- Diaper → Beer;
- credit card fraud;
- deep learning architectures;
- camera → memory card sequential pattern;
- frequent subgraph;
- PageRank/Web mining;
- Pizza Index;
- SAS / SQL Server / Oracle tools。
83. 一张表记住所有 Mining Functionalities ★★★
| Function | 输入假设 | 核心问题 | 输出 |
|---|---|---|---|
| Summarization | multidimensional data | 数据整体有什么特征? | summaries |
| Frequent Pattern | transactions | 什么经常一起出现? | itemsets |
| Association | co-occurrence data | X 与 Y 如何关联? | rules |
| Correlation | variables | 两变量是否共同变化? | correlation |
| Classification | labeled data | 新 sample 属于哪类? | class |
| Regression | labeled numeric target | 数值是多少? | numerical prediction |
| Clustering | unlabeled data | 自然有哪些群体? | clusters |
| Deep Learning(方法族) | 可服务于多类任务 | 学习复杂 representation/model | neural model |
| Outlier Analysis | majority + rare cases | 谁不符合一般行为? | anomalies |
| Sequential Mining | ordered events | 哪些事件按某顺序出现? | sequential patterns |
| Trend Analysis | temporal data | 如何随时间变化? | trends |
| Periodicity | temporal data | 是否周期重复? | periods |
| Stream Mining | ongoing data | 如何在线处理无限数据? | online knowledge |
| Graph Mining | graph data | 有哪些结构模式? | subgraphs |
| Link Mining | network | relation 本身说明什么? | relational patterns |
| Web Mining | Web network/content | Web 中有哪些结构/行为? | communities/ranking/etc. |
84. 最终 1 分钟背诵版
如果考试前只剩一分钟,记这一段:
Data mining aims to discover interesting patterns, models and knowledge from large datasets. It focuses on data, whereas AI focuses more broadly on intelligent systems that perceive, reason, learn, plan and act. Data mining is only one stage of the KDD process, which includes data cleaning, integration, transformation, selection, mining, pattern evaluation and knowledge presentation. Real-world data may be structured, semi-structured or unstructured, and may further involve sequences, time series, spatial-temporal information, graphs and data streams, so different data and different questions require different mining methods. Major mining functionalities include multidimensional summarization, frequent-pattern and association mining, classification and regression, clustering, deep learning, outlier analysis, sequential and trend analysis, stream mining and graph/network mining. Because mining can generate enormous numbers of patterns, results must be evaluated for properties such as coverage, accuracy, typicality and novelty. Data mining therefore draws on databases, statistics, machine learning, pattern recognition, algorithms, HPC, visualization, NLP and domain applications. Finally, while data mining can benefit science, business and security, it can also reveal sensitive information, so data security and privacy-preserving mining are essential.
这基本对应第 27 页 Summary,但把第 1–26 页之间的逻辑关系完整串了起来。
高密度复习:Introduction / KDD
一条主线
Data mining 是 KDD 中的 mining 步骤,不是整个 KDD;AI 的对象是能感知、推理、学习、规划和行动的系统,DM 的对象是数据中的模式、模型与知识。
KDD 与评价
| 环节 | 目的 | 高频陷阱 |
|---|---|---|
| Cleaning | 缺失、噪声、冲突 | 不等于 transformation |
| Integration | 多源合并、实体匹配 | warehouse 是可选管理层,不是必经步骤 |
| Selection / Transformation | 选目标数据、构造/缩放特征 | 顺序可依任务迭代,非固定流水线 |
| Mining | 找规则、模型、簇、异常 | 算法输出不自动有价值 |
| Evaluation / Presentation | validity、novelty、utility、可解释呈现 | held-out generalization 主要是预测任务指标 |
预测型任务重点看 accuracy/generalization;描述型任务还看 coverage、typicality、novelty、稳定性与领域效用。
数据对象速记
| 类型 | 核心结构 | 典型任务/陷阱 |
|---|---|---|
| Record / table | 属性集合, | 不必全为实数;类别列同样是 structured data |
| Transaction | item 集合 | item 顺序通常无关 |
| Time series / sequence | 有序 | 集合符号会丢失顺序和重复 |
| Spatial / spatiotemporal | 位置与邻接关系 | proximity、尺度、边界很重要 |
| Graph / network | nodes + links | link 和 subgraph 本身可含信息 |
| Stream | 持续、可能无限 | 不能默认 fixed dataset/schema;需在线处理 |
Mining functionalities:按“任务”而非“工具”记
- Summarization / characterization / discrimination:数据总体是什么、两类有何不同。
- Frequent pattern / association / correlation / sequential:什么共同出现、是否有方向/统计关系、是否有顺序。
- Classification / regression:有标签的离散/连续预测。
- Clustering / outlier:无标签的群体结构与偏离者。
- Stream / graph / spatial mining:由数据结构带来的专门约束。
- Deep learning 是方法族,可用于上述多种任务,不是与它们互斥的功能。
考场检查清单
- 先判断任务是 predictive 还是 descriptive,再选 evaluation。
- 问“data mining vs AI”时,答 data-centered pattern discovery vs system-centered intelligent behavior,不要写成互斥关系。
- 问 KDD 时,说明 preparation 的组件与迭代性;不要把 data warehouse 写成硬性一步。
- 问隐私时,指出模式发布本身可能泄露敏感信息,因此要有 security/privacy-preserving mining。