模型评估

机器学习教程 · 第 7 章 · 10 次浏览

特征工程是把原始数据变成模型能高效学习的特征。好特征比好模型更重要——"垃圾进,垃圾出"。

常用方法

  • 标准化:StandardScaler 均值 0 方差 1(很多算法要求)
  • 归一化:MinMaxScaler 缩到 0-1
  • 类别编码:OneHotEncoder 独热
  • 缺失值:SimpleImputer 补均值/中位数/常数
  • 特征选择:SelectKBest 挑重要特征

Pipeline

用 Pipeline 把"预处理 + 模型"串成一条流水线,避免数据泄漏,代码整洁。

代码示例

from sklearn.pipeline import Pipeline
from sklearn.preprocessing import StandardScaler
from sklearn.impute import SimpleImputer
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import cross_val_score
import numpy as np

# 模拟带缺失的数据
X = np.array([[25, 1], [30, 0], [np.nan, 1], [40, 0], [28, 1]])
y = [0, 1, 1, 0, 1]

# 流水线:补缺失 → 标准化 → 模型
pipe = Pipeline([
    ("imputer", SimpleImputer(strategy="mean")),
    ("scaler", StandardScaler()),
    ("clf", LogisticRegression()),
])

scores = cross_val_score(pipe, X, y, cv=3)
print("Pipeline 交叉验证:", scores.mean())
📚 Python 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
print("hello")输出到控制台
name = "张三"变量赋值(无需声明类型)
if x > 0: ...条件判断(注意冒号和缩进)
for i in range(10): ...循环(缩进是语法的一部分)
while x < 10: ...条件循环
def fn(a, b): return a + b定义函数
class Person: ...定义类
list = [1, 2, 3]列表(可改)
tuple = (1, 2)元组(不可改)
dict = {"key": "value"}字典(键值对)
set = {1, 2, 3}集合(去重)
len(obj)取长度
str(x) / int(x) / float(x)类型转换
s.split(",")字符串按分隔符拆分
" ".join(list)列表拼接成字符串
import os导入模块
from math import sqrt从模块导入指定函数
try: ... except Exception as e: ...异常捕获
with open("a.txt", "r") as f: ...文件读取(自动关闭)
f"你好 {name}"f-string 格式化
lambda x: x * 2匿名函数
list(map(fn, arr))函数式处理列表
range(start, stop, step)生成数字序列
if __name__ == "__main__":主入口判断
pip install 包名安装第三方包(命令行)