实战案例
实战:用 XPath 从 HTML 页面提取数据。浏览器开发者工具(F12)可以直接复制元素的 XPath,爬虫和自动化测试(Selenium)都靠它定位元素。
实战流程
PHP 里 loadHTML 加载页面 → DOMXPath 查询 → 提取标题/链接/列表。注意:HTML 不是严格 XML,要先 loadHTML 再 query。
代码示例
<?php
// 抓取网页并提取数据(示例结构)
$html = file_get_contents("https://example.com/products");
$dom = new DOMDocument();
libxml_use_internal_errors(true); // 忽略 HTML 非严格标签的警告
$dom->loadHTML($html);
libxml_clear_errors();
$xpath = new DOMXPath($dom);
// 提取所有商品标题(假设结构 .product h2.title)
$titles = $xpath->query("//div[contains(@class,'product')]//h2");
foreach ($titles as $t) {
echo trim($t->nodeValue), "<br>";
}
// 提取第一个商品链接
$link = $xpath->query("(//div[contains(@class,'product')]//a)[1]/@href");
if ($link->length > 0) {
echo "第一个链接: ", $link->item(0)->nodeValue;
}
?>
📚 PHP 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
| 写法 / 语法 | 作用 |
|---|---|
<?php ... ?> | PHP 代码块标记 |
echo "hello"; | 输出字符串 |
$name = "张三"; | 变量(以 $ 开头,无需声明类型) |
if ($x > 0) { } else { } | 条件判断 |
foreach ($arr as $k => $v) { } | 遍历数组(最常用) |
for ($i = 0; $i < 10; $i++) { } | 计数循环 |
function fn($a) { return $a; } | 定义函数 |
array("a" => 1) | 关联数组(PHP 的"字典") |
count($arr) | 数组长度 |
isset($x) / empty($x) | 变量是否存在 / 是否为空 |
$_GET["key"] / $_POST["key"] | 获取表单 / 查询参数 |
$_SESSION["user"] | 会话数据读写(需 session_start()) |
$_COOKIE["key"] | 读取 Cookie |
header("Location: /index.php"); | 页面跳转 |
mysqli_connect($host, $user, $pass, $db) | 连接 MySQL(旧接口,新项目用 PDO) |
new PDO($dsn, $user, $pass) | 连接 MySQL(推荐,防 SQL 注入) |
$stmt->prepare($sql) | 预处理语句(防 SQL 注入) |
htmlspecialchars($str) | HTML 转义(防 XSS) |
strlen($s) / mb_strlen($s) | 字符串长度 |
explode(",", $s) / implode(",", $arr) | 字符串拆分 / 拼接 |
json_encode($arr) / json_decode($s) | 数组与 JSON 互转 |
include / require | 引入文件(require 报错即停) |
date("Y-m-d H:i:s") | 当前时间格式化 |
$_FILES["file"] | 文件上传数据 |
file_put_contents($path, $data) | 写入文件 |