项目实战

机器学习教程 · 第 8 章 · 9 次浏览

完整实战:预测泰坦尼克号乘客是否幸存。经典入门数据集,覆盖数据清洗、特征工程、模型训练、评估全流程。

步骤

加载数据 → 处理缺失 → 编码类别 → 训练随机森林 → 评估 + 提交预测。跟着跑一遍,机器学习流程就通了。

代码示例

import pandas as pd
from sklearn.ensemble import RandomForestClassifier
from sklearn.model_selection import train_test_split
from sklearn.metrics import accuracy_score

# 加载(假设本地有 titanic.csv)
df = pd.read_csv("titanic.csv")
print(df.head())

# 特征选择
features = ["Pclass", "Sex", "Age", "SibSp", "Parch", "Fare"]
X = df[features].copy()
y = df["Survived"]

# 缺失值处理
X["Age"] = X["Age"].fillna(X["Age"].median())
X["Fare"] = X["Fare"].fillna(X["Fare"].median())

# 性别编码
X["Sex"] = X["Sex"].map({"male": 0, "female": 1})

X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42)

model = RandomForestClassifier(n_estimators=100, random_state=42)
model.fit(X_train, y_train)

print("准确率:", accuracy_score(y_test, model.predict(X_test)))
print("特征重要性:", dict(zip(features, model.feature_importances_)))
📚 Python 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
print("hello")输出到控制台
name = "张三"变量赋值(无需声明类型)
if x > 0: ...条件判断(注意冒号和缩进)
for i in range(10): ...循环(缩进是语法的一部分)
while x < 10: ...条件循环
def fn(a, b): return a + b定义函数
class Person: ...定义类
list = [1, 2, 3]列表(可改)
tuple = (1, 2)元组(不可改)
dict = {"key": "value"}字典(键值对)
set = {1, 2, 3}集合(去重)
len(obj)取长度
str(x) / int(x) / float(x)类型转换
s.split(",")字符串按分隔符拆分
" ".join(list)列表拼接成字符串
import os导入模块
from math import sqrt从模块导入指定函数
try: ... except Exception as e: ...异常捕获
with open("a.txt", "r") as f: ...文件读取(自动关闭)
f"你好 {name}"f-string 格式化
lambda x: x * 2匿名函数
list(map(fn, arr))函数式处理列表
range(start, stop, step)生成数字序列
if __name__ == "__main__":主入口判断
pip install 包名安装第三方包(命令行)