实战案例

XPath 教程 · 第 8 章 · 6 次浏览

实战:用 XPath 从 HTML 页面提取数据。浏览器开发者工具(F12)可以直接复制元素的 XPath,爬虫和自动化测试(Selenium)都靠它定位元素。

实战流程

PHP 里 loadHTML 加载页面 → DOMXPath 查询 → 提取标题/链接/列表。注意:HTML 不是严格 XML,要先 loadHTML 再 query。

代码示例

<?php
// 抓取网页并提取数据(示例结构)
$html = file_get_contents("https://example.com/products");

$dom = new DOMDocument();
libxml_use_internal_errors(true);      // 忽略 HTML 非严格标签的警告
$dom->loadHTML($html);
libxml_clear_errors();

$xpath = new DOMXPath($dom);

// 提取所有商品标题(假设结构 .product h2.title)
$titles = $xpath->query("//div[contains(@class,'product')]//h2");
foreach ($titles as $t) {
    echo trim($t->nodeValue), "<br>";
}

// 提取第一个商品链接
$link = $xpath->query("(//div[contains(@class,'product')]//a)[1]/@href");
if ($link->length > 0) {
    echo "第一个链接: ", $link->item(0)->nodeValue;
}
?>
📚 PHP 语法速查
常用条目速查,完整版见对应教程章节。可复制代码到在线运行中测试。
写法 / 语法作用
&lt;?php ... ?&gt;PHP 代码块标记
echo "hello";输出字符串
$name = "张三";变量(以 $ 开头,无需声明类型)
if ($x > 0) { } else { }条件判断
foreach ($arr as $k => $v) { }遍历数组(最常用)
for ($i = 0; $i < 10; $i++) { }计数循环
function fn($a) { return $a; }定义函数
array("a" => 1)关联数组(PHP 的"字典")
count($arr)数组长度
isset($x) / empty($x)变量是否存在 / 是否为空
$_GET["key"] / $_POST["key"]获取表单 / 查询参数
$_SESSION["user"]会话数据读写(需 session_start())
$_COOKIE["key"]读取 Cookie
header("Location: /index.php");页面跳转
mysqli_connect($host, $user, $pass, $db)连接 MySQL(旧接口,新项目用 PDO)
new PDO($dsn, $user, $pass)连接 MySQL(推荐,防 SQL 注入)
$stmt->prepare($sql)预处理语句(防 SQL 注入)
htmlspecialchars($str)HTML 转义(防 XSS)
strlen($s) / mb_strlen($s)字符串长度
explode(",", $s) / implode(",", $arr)字符串拆分 / 拼接
json_encode($arr) / json_decode($s)数组与 JSON 互转
include / require引入文件(require 报错即停)
date("Y-m-d H:i:s")当前时间格式化
$_FILES["file"]文件上传数据
file_put_contents($path, $data)写入文件