聚类模型

Scikit-learn 教程 · 第 7 章 · 4 次浏览

训练好的模型要保存复用(joblib/pickle),参数要系统调优(GridSearchCV/RandomizedSearchCV)。这是从"跑通"到"能用"的两步。

保存加载

joblib.dump(model, "model.pkl") 保存;joblib.load 加载。整个 Pipeline 一起保存更方便。

网格搜索

GridSearchCV:参数组合穷举 + 交叉验证,自动找最优。RandomizedSearchCV 随机采样(参数多时更快)。

代码示例

import joblib
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import GridSearchCV
from sklearn.datasets import load_iris

X, y = load_iris(return_X_y=True)

# 网格搜索调参
param_grid = {
    "n_estimators": [50, 100, 200],
    "max_depth": [3, 5, None],
    "min_samples_split": [2, 5],
}
grid = GridSearchCV(
    RandomForestClassifier(random_state=42),
    param_grid, cv=5, n_jobs=-1, verbose=1)
grid.fit(X, y)

print("最佳参数:", grid.best_params_)
print("最佳得分:", grid.best_score_.round(4))

# 保存最佳模型
joblib.dump(grid.best_estimator_, "iris_model.pkl")

# 加载使用
loaded = joblib.load("iris_model.pkl")
print("加载后预测:", loaded.predict(X[:3]))
📚 Python 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
print("hello")输出到控制台
name = "张三"变量赋值(无需声明类型)
if x > 0: ...条件判断(注意冒号和缩进)
for i in range(10): ...循环(缩进是语法的一部分)
while x < 10: ...条件循环
def fn(a, b): return a + b定义函数
class Person: ...定义类
list = [1, 2, 3]列表(可改)
tuple = (1, 2)元组(不可改)
dict = {"key": "value"}字典(键值对)
set = {1, 2, 3}集合(去重)
len(obj)取长度
str(x) / int(x) / float(x)类型转换
s.split(",")字符串按分隔符拆分
" ".join(list)列表拼接成字符串
import os导入模块
from math import sqrt从模块导入指定函数
try: ... except Exception as e: ...异常捕获
with open("a.txt", "r") as f: ...文件读取(自动关闭)
f"你好 {name}"f-string 格式化
lambda x: x * 2匿名函数
list(map(fn, arr))函数式处理列表
range(start, stop, step)生成数字序列
if __name__ == "__main__":主入口判断
pip install 包名安装第三方包(命令行)