监督学习

机器学习教程 · 第 2 章 · 10 次浏览

机器学习的第一步是数据。特征(Feature)是模型看的输入维度,标签(Label)是我们要预测的目标。

数据形态

表格数据最常见:行是样本,列是特征,最后一列常是标签。sklearn 用二维数组(numpy)装数据。

数据质量

缺值要补(fillna)、异常值要处理、类别特征要编码(One-Hot)、数值要标准化。数据质量决定模型上限。

代码示例

import pandas as pd

# 构造示例数据
data = pd.DataFrame({
    "age": [25, 30, 35, None, 40],        # 有缺失
    "city": ["北京", "上海", "北京", "广州", "上海"],
    "salary": [8000, 12000, 15000, 9000, 20000],
    "buy": [0, 1, 1, 0, 1]                 # 标签:是否购买
})
print(data)

# 处理缺失
data["age"] = data["age"].fillna(data["age"].mean())

# 类别编码
data = pd.get_dummies(data, columns=["city"])
print(data)

# X = data.drop("buy", axis=1)
# y = data["buy"]
📚 Python 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
print("hello")输出到控制台
name = "张三"变量赋值(无需声明类型)
if x > 0: ...条件判断(注意冒号和缩进)
for i in range(10): ...循环(缩进是语法的一部分)
while x < 10: ...条件循环
def fn(a, b): return a + b定义函数
class Person: ...定义类
list = [1, 2, 3]列表(可改)
tuple = (1, 2)元组(不可改)
dict = {"key": "value"}字典(键值对)
set = {1, 2, 3}集合(去重)
len(obj)取长度
str(x) / int(x) / float(x)类型转换
s.split(",")字符串按分隔符拆分
" ".join(list)列表拼接成字符串
import os导入模块
from math import sqrt从模块导入指定函数
try: ... except Exception as e: ...异常捕获
with open("a.txt", "r") as f: ...文件读取(自动关闭)
f"你好 {name}"f-string 格式化
lambda x: x * 2匿名函数
list(map(fn, arr))函数式处理列表
range(start, stop, step)生成数字序列
if __name__ == "__main__":主入口判断
pip install 包名安装第三方包(命令行)