数据合并

Pandas 教程 · 第 7 章 · 10 次浏览

时间序列和文本列是两类高频处理场景。Pandas 把两种操作都做得很顺手。

时间处理

pd.to_datetime() 转时间类型;dt.year/month/day 提取;set_index + resample 按时间重采样(日→月聚合)。

文本处理

str 访问器:str.contains() 含关键词、str.strip() 去空白、str.replace() 替换、str.split() 拆分、str.extract() 提取正则。

代码示例

import pandas as pd

# 时间处理
df = pd.DataFrame({
    "date": ["2026-01-05", "2026-01-15", "2026-02-03"],
    "amount": [100, 200, 150],
})
df["date"] = pd.to_datetime(df["date"])
df["month"] = df["date"].dt.month       # 提取月份
print(df)

# 按月聚合
monthly = df.set_index("date").resample("M")["amount"].sum()
print(monthly)

# 文本处理
texts = pd.Series([" 苹果 5元 ", "香蕉 3元", "橘子 6元"])
clean = texts.str.strip()                        # 去空白
has_apple = texts.str.contains("苹果")            # 含苹果
name = texts.str.extract(r"(\S+)")               # 正则提取
print(name)
📚 Python 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
print("hello")输出到控制台
name = "张三"变量赋值(无需声明类型)
if x > 0: ...条件判断(注意冒号和缩进)
for i in range(10): ...循环(缩进是语法的一部分)
while x < 10: ...条件循环
def fn(a, b): return a + b定义函数
class Person: ...定义类
list = [1, 2, 3]列表(可改)
tuple = (1, 2)元组(不可改)
dict = {"key": "value"}字典(键值对)
set = {1, 2, 3}集合(去重)
len(obj)取长度
str(x) / int(x) / float(x)类型转换
s.split(",")字符串按分隔符拆分
" ".join(list)列表拼接成字符串
import os导入模块
from math import sqrt从模块导入指定函数
try: ... except Exception as e: ...异常捕获
with open("a.txt", "r") as f: ...文件读取(自动关闭)
f"你好 {name}"f-string 格式化
lambda x: x * 2匿名函数
list(map(fn, arr))函数式处理列表
range(start, stop, step)生成数字序列
if __name__ == "__main__":主入口判断
pip install 包名安装第三方包(命令行)